{"id":"W4408043079","doi":"10.1177/08465371251323124","title":"Evaluating Adherence to Canadian Radiology Guidelines for Incidental Hepatobiliary Findings Using RAG-Enabled LLMs","year":2025,"lang":"en","type":"article","venue":"Canadian Association of Radiologists Journal","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":18,"is_retracted":false,"has_abstract":true,"ca_institutions":"Western University; University of Toronto","funders":"","keywords":"Medicine; Readability; Guideline; Comprehension; Pathology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.007198216,0.0007759857,0.0004335176,0.001424076,0.0005116957,0.001208043,0.0009917628,0.000594945,0.003165139],"category_scores_gemma":[0.0556864,0.0002900391,0.0009353078,0.0009563768,0.0003644327,0.0007072365,0.00129624,0.0004708448,0.000760588],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003359248,"about_ca_system_score_gemma":0.006555676,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.1411304,"about_ca_topic_score_gemma":0.2542435,"domain_scores_codex":[0.9957914,0.001937434,0.000481738,0.0004433429,0.001129277,0.0002167349],"domain_scores_gemma":[0.9748675,0.01434997,0.003169196,0.001602934,0.004960731,0.00104962],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.003852016,0.001406577,0.5577213,0.001851692,0.0004359329,0.000613138,0.006874375,0.02266428,0.01064271,0.0005627314,0.01165272,0.3817224],"study_design_scores_gemma":[0.0008723551,0.004349723,0.7494524,0.0007425046,0.00104721,0.0009420721,0.005008444,0.1826528,0.02816942,0.00119222,0.02504965,0.0005213615],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9828584,0.0002406884,0.006980631,0.0004771701,0.00002272967,0.001098466,0.002257231,0.001809367,0.004255387],"genre_scores_gemma":[0.9502283,0.0002580376,0.04405624,0.0001768825,0.00001319697,0.00056089,0.003025779,0.00008098292,0.00159958],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9928018,"threshold_uncertainty_score":0.280618,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1122429857990092,"score_gpt":0.4238276171464156,"score_spread":0.3115846313474065,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}