{"id":"W4386865122","doi":"10.1148/radiol.232082","title":"Evaluating Diagnostic Performance of ChatGPT in Radiology: Delving into Methods","year":2023,"lang":"en","type":"letter","venue":"Radiology","topic":"Radiomics and Machine Learning in Medical Imaging","field":"Medicine","cited_by":18,"is_retracted":false,"has_abstract":false,"ca_institutions":"Western University; London Health Sciences Centre","funders":"","keywords":"Medicine; Radiology; Medical imaging; Medical physics; Nuclear medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05941443,0.0005414227,0.001811109,0.001832799,0.000940291,0.005654071,0.002479415,0.006230291,0.00273927],"category_scores_gemma":[0.2767799,0.0004915189,0.0008183881,0.001141124,0.003173022,0.004952653,0.001456487,0.006484238,0.003664365],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003032228,"about_ca_system_score_gemma":0.002623677,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003415376,"about_ca_topic_score_gemma":0.006258027,"domain_scores_codex":[0.9536976,0.03000917,0.005585519,0.001802512,0.007708333,0.001196785],"domain_scores_gemma":[0.610216,0.3164465,0.00789846,0.01059367,0.04930039,0.005544974],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.00219001,0.0005228107,0.1932673,0.001137351,0.0004762382,0.002845477,0.001296207,0.003255069,0.003219645,0.009144625,0.2591178,0.5235276],"study_design_scores_gemma":[0.001370733,0.004746787,0.2054104,0.00518153,0.001375825,0.05557403,0.008617616,0.1321661,0.02861083,0.1529439,0.4030564,0.0009459549],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"commentary","genre_gemma":"empirical","genre_scores_codex":[0.06705881,0.01478367,0.03141369,0.8483632,0.01188346,0.0004107358,0.000717017,0.0004822067,0.02488735],"genre_scores_gemma":[0.6035649,0.007637145,0.09515629,0.2224676,0.0619624,0.0006923776,0.0006243631,0.0005339086,0.007361053],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.05941443,"threshold_uncertainty_score":0.3142173,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03925053290297194,"score_gpt":0.4176554604831245,"score_spread":0.3784049275801525,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}