{"id":"W4390919625","doi":"10.1148/radiol.232411","title":"Comparing GPT-3.5 and GPT-4 Accuracy and Drift in <i>Radiology</i> Diagnosis Please Cases","year":2024,"lang":"en","type":"article","venue":"Radiology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":52,"is_retracted":false,"has_abstract":false,"ca_institutions":"London Health Sciences Centre; Western University","funders":"","keywords":"Medicine; Medical physics; Radiology; Nuclear medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002725665,0.0001196908,0.0003279987,0.0001840801,0.00006656851,0.00002019469,0.0000393323,0.0001560557,0.00005869038],"category_scores_gemma":[0.0007702655,0.0001053661,0.0000276093,0.000159133,0.000201108,0.00008363183,0.00002947534,0.0002868711,0.00002787161],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00006083502,"about_ca_system_score_gemma":0.0001128624,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001837117,"about_ca_topic_score_gemma":0.0006181754,"domain_scores_codex":[0.9989198,0.0001046649,0.0003149085,0.0003373123,0.0000436057,0.0002796802],"domain_scores_gemma":[0.9979612,0.001692609,0.00003085101,0.0001411877,0.00002574772,0.0001484413],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00009702384,0.00005098951,0.9157305,0.0002558904,0.00002930827,0.0004664764,0.003223499,0.00001012262,0.0003997923,0.001636605,0.004428674,0.07367112],"study_design_scores_gemma":[0.0005339271,0.002080855,0.8456234,0.001166115,0.0002883124,0.02110306,0.005476652,0.01496839,0.004640729,0.007872698,0.09548752,0.0007583426],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9700218,0.02235357,0.00003553097,0.006441002,0.0005857288,0.0002609203,0.000003919738,0.00005676147,0.0002407756],"genre_scores_gemma":[0.9913107,0.006958786,0.0001312555,0.001009768,0.0004184161,0.00007934457,0.00002345396,0.00001318843,0.00005509347],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.09105885,"threshold_uncertainty_score":0.4296707,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1689424278669887,"score_gpt":0.4260712340969973,"score_spread":0.2571288062300087,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}