{"id":"W7117365168","doi":"10.1016/j.imed.2025.12.006","title":"Evaluation of artificial intelligence-based tool Covidence in literature screening for guideline updates: A prospective study","year":2025,"lang":"en","type":"article","venue":"Intelligent Medicine","topic":"Clinical practice guidelines implementation","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Hamilton Health Sciences; Population Health Research Institute; McMaster University; University of British Columbia; Impact","funders":"Hamilton Health Sciences Foundation","keywords":"Guideline; Randomized controlled trial; Workload; Breast cancer; MEDLINE; Lung cancer screening; Stage (stratigraphy); Clinical Practice; Evidence-based medicine","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.1956873,0.001314489,0.002752241,0.004678082,0.001186621,0.00434399,0.002484328,0.002678541,0.002972109],"category_scores_gemma":[0.4912117,0.001872555,0.00536765,0.004523982,0.001880547,0.006287077,0.003300335,0.002500792,0.001159406],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002578295,"about_ca_system_score_gemma":0.006875294,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003362094,"about_ca_topic_score_gemma":0.003149784,"domain_scores_codex":[0.8107114,0.1291924,0.0313139,0.008344717,0.01882708,0.001610491],"domain_scores_gemma":[0.2439486,0.604658,0.05845639,0.03791511,0.05122732,0.003794565],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0781291,0.02363693,0.568902,0.01612259,0.01104717,0.0003501836,0.009991759,0.007168538,0.001284868,0.001949674,0.004710985,0.2767062],"study_design_scores_gemma":[0.04508097,0.1660003,0.5874168,0.01206877,0.03150672,0.001725129,0.006007577,0.1062914,0.01143251,0.003990903,0.02723009,0.001248796],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9399798,0.005427996,0.02721747,0.001046653,0.0002537833,0.02015818,0.002331426,0.0005569797,0.00302778],"genre_scores_gemma":[0.9187329,0.001269464,0.05771295,0.0007834434,0.0001690714,0.01883812,0.001862772,0.0001377369,0.0004933624],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8043127,"threshold_uncertainty_score":0.9918607,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3663738052635487,"score_gpt":0.5644291767119313,"score_spread":0.1980553714483825,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}