{"id":"W3029811621","doi":"10.1186/s12874-020-01031-w","title":"The semi-automation of title and abstract screening: a retrospective exploration of ways to leverage Abstrackr’s relevance predictions in systematic and rapid reviews","year":2020,"lang":"en","type":"article","venue":"BMC Medical Research Methodology","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":85,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"Canadian Institutes of Health Research; Alberta Innovates","keywords":"Workload; Leverage (statistics); Systematic review; Computer science; Relevance (law); Medicine; Automation; MEDLINE; Machine learning; Data mining; Medical physics; Engineering","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.4551888,0.002493879,0.003562325,0.01116705,0.001556447,0.005850829,0.004250973,0.001809393,0.003678757],"category_scores_gemma":[0.7226175,0.003848003,0.006309737,0.009257533,0.001848437,0.00703612,0.005059633,0.002225031,0.001594011],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003854833,"about_ca_system_score_gemma":0.01769142,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004651373,"about_ca_topic_score_gemma":0.01134357,"domain_scores_codex":[0.4694015,0.4336252,0.06569802,0.0108865,0.0192598,0.001128964],"domain_scores_gemma":[0.07610664,0.7904215,0.052249,0.04914393,0.03121662,0.0008623448],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.008983875,0.0005507283,0.0544428,0.08237221,0.008711024,0.0005624517,0.01446727,0.03253684,0.008057072,0.005100168,0.01626705,0.7679484],"study_design_scores_gemma":[0.01320398,0.01423225,0.1029918,0.06892812,0.02920474,0.004770475,0.007128073,0.5250101,0.04069957,0.05599989,0.1338218,0.004009214],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.211089,0.0255733,0.6852036,0.009395272,0.001001688,0.03015007,0.01138287,0.01970713,0.006497017],"genre_scores_gemma":[0.324913,0.002359194,0.6559332,0.001062427,0.0001883475,0.01264758,0.00187167,0.0005956923,0.0004289966],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.5448111,"threshold_uncertainty_score":0.6718491,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.951314378397344,"score_gpt":0.6454746183789096,"score_spread":0.3058397600184344,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}