{"id":"W4376640725","doi":"10.1148/radiol.230582","title":"Performance of ChatGPT on a Radiology Board-style Examination: Insights into Current Strengths and Limitations","year":2023,"lang":"en","type":"article","venue":"Radiology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":456,"is_retracted":false,"has_abstract":true,"ca_institutions":"Women's College Hospital","funders":"","keywords":"Medicine; Style (visual arts); Recall; Order (exchange); Radiology; Medical physics; Cognitive psychology; Psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08539562,0.001033485,0.001280613,0.00237513,0.0007237545,0.002797071,0.001640064,0.0009492728,0.001939672],"category_scores_gemma":[0.2030175,0.0005314595,0.001476267,0.001902434,0.001470084,0.002534646,0.003579066,0.0009369191,0.0009293593],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00189971,"about_ca_system_score_gemma":0.001829199,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00508347,"about_ca_topic_score_gemma":0.006479017,"domain_scores_codex":[0.9409313,0.04193705,0.004730737,0.003824287,0.007282017,0.001294457],"domain_scores_gemma":[0.6733283,0.2601357,0.0220018,0.01476451,0.02521566,0.00455394],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001744204,0.000412835,0.8883104,0.0007115151,0.0003313972,0.0002153952,0.006472451,0.001725795,0.0009949441,0.0002675416,0.001780194,0.09703337],"study_design_scores_gemma":[0.000196846,0.003413365,0.9466256,0.0007604996,0.0003064622,0.0009795872,0.00534464,0.03172667,0.003287394,0.001162465,0.00604418,0.0001522057],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9817837,0.0008836465,0.009606883,0.001211733,0.0001423663,0.001008481,0.0007528719,0.0003624774,0.004247923],"genre_scores_gemma":[0.9895346,0.0003055868,0.00760203,0.0003946133,0.0001030015,0.0008564462,0.0006386309,0.00007723063,0.000487933],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.08539562,"threshold_uncertainty_score":0.4516206,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1150913827002931,"score_gpt":0.3991779660783883,"score_spread":0.2840865833780953,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}