{"id":"W4403220723","doi":"10.1148/radiol.241489","title":"Retrieval-Augmented Generation for Large Language Models in Radiology: Another Leap Forward in Board Examination Performance","year":2024,"lang":"en","type":"article","venue":"Radiology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":22,"is_retracted":false,"has_abstract":true,"ca_institutions":"Toronto General Hospital","funders":"","keywords":"Medicine; Medical physics; Radiology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005804172,0.001794376,0.001058182,0.0009005153,0.0003997043,0.002196705,0.001329425,0.001765565,0.008274473],"category_scores_gemma":[0.02590116,0.0005018452,0.0009638692,0.0008835921,0.0006730022,0.002862854,0.001791185,0.00268004,0.002911146],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007805452,"about_ca_system_score_gemma":0.001554357,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007807078,"about_ca_topic_score_gemma":0.00717358,"domain_scores_codex":[0.9965328,0.002256568,0.000180681,0.0005232232,0.0003283282,0.0001783667],"domain_scores_gemma":[0.9833943,0.01336419,0.0002386142,0.001806042,0.0008801299,0.0003167645],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002454333,0.0005977714,0.006854905,0.0006027989,0.0004583959,0.0005063379,0.0005970268,0.1838203,0.02221914,0.003626018,0.03617959,0.7420833],"study_design_scores_gemma":[0.0003806239,0.0006771748,0.002802839,0.00007364804,0.0002005057,0.000351773,0.0002208191,0.9563408,0.01961078,0.008669403,0.01056727,0.0001043233],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.4570157,0.005194276,0.4219769,0.004731697,0.001183264,0.0006439323,0.003866371,0.08459022,0.02079766],"genre_scores_gemma":[0.773942,0.0004823384,0.2064268,0.00151291,0.0002069049,0.0002730722,0.005889917,0.003119088,0.008146948],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.008274473,"threshold_uncertainty_score":0.03069574,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1076246466781111,"score_gpt":0.3942330226564129,"score_spread":0.2866083759783018,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}