{"id":"W3164863290","doi":"10.2196/24418","title":"The Impact of Systematic Review Automation Tools on Methodological Quality and Time Taken to Complete Systematic Review Tasks: Case Study","year":2021,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":61,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Task (project management); Automation; Systematic review; Computer science; Quality (philosophy); MEDLINE; Engineering","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":["metaresearch","insufficient_payload"],"category_scores_codex":[0.26581,0.0003617215,0.008272779,0.0001461021,0.0002217402,0.0004852396,0.001225943,0.000103025,0.003540929],"category_scores_gemma":[0.5829098,0.0001335568,0.001424936,0.001928362,0.00007321965,0.00016698,0.0001632363,0.0002379546,0.001101637],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001294085,"about_ca_system_score_gemma":0.0007278963,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0000443337,"about_ca_topic_score_gemma":0.00001403681,"domain_scores_codex":[0.8809493,0.09520191,0.01561901,0.0009525587,0.007014659,0.000262573],"domain_scores_gemma":[0.929394,0.04870477,0.01068084,0.00694818,0.003504133,0.0007680482],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","study_design_scores_codex":[0.000004010099,0.000608072,0.0000990728,0.9534667,0.0004551647,0.00003550119,0.0008496561,0.000001258582,0.000008614831,0.0005140236,0.04143474,0.002523199],"study_design_scores_gemma":[0.0002552335,0.0004639862,0.004277985,0.9799887,0.004213614,0.001871256,0.005927624,0.001674526,0.000001524003,0.0007201103,0.0002003086,0.0004051161],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","genre_codex":"review","genre_gemma":"empirical","genre_scores_codex":[0.2840427,0.5640851,0.005800975,0.04230421,0.001025605,0.09960388,0.0001107764,0.00007878337,0.002947946],"genre_scores_gemma":[0.9084333,0.01773494,0.00634784,0.03512307,0.000422497,0.02251644,0.0001968276,0.00009929211,0.009125832],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.6243905,"threshold_uncertainty_score":0.9996761,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.8491025457728606,"score_gpt":0.6725898424502403,"score_spread":0.1765127033226203,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}