{"id":"W4408613424","doi":"10.2196/58897","title":"Performance of ChatGPT-4 on Taiwanese Traditional Chinese Medicine Licensing Examinations: Cross-Sectional Study","year":2025,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Cross-sectional study; Medicine; Traditional medicine; Family medicine; Pathology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0008929076,0.0001570433,0.0002745477,0.0004930421,0.0002129447,0.00001372964,0.0001296109,0.0001891202,0.001198576],"category_scores_gemma":[0.003160412,0.0001249649,0.00005829178,0.0008306646,0.0002821218,0.0001473152,0.00001613694,0.0003858657,0.00004231606],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002615207,"about_ca_system_score_gemma":0.002421578,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003009546,"about_ca_topic_score_gemma":0.00003041742,"domain_scores_codex":[0.997583,0.00008922225,0.0008329918,0.0003312965,0.0009749256,0.000188576],"domain_scores_gemma":[0.9981048,0.0004912906,0.0001715484,0.000304238,0.0007065823,0.000221521],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0002599923,0.003863657,0.9317362,0.0002651198,0.00003131921,0.000001339676,0.00314466,0.000006174618,0.0001231217,0.001383909,0.00176242,0.05742214],"study_design_scores_gemma":[0.0002716204,0.0009940686,0.9932038,0.000578725,0.00002405564,0.00002398931,0.001853167,0.001357208,0.0001952472,0.0008523238,0.0005620946,0.00008365313],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9838999,0.0001119134,0.00003273717,0.006700105,0.002794175,0.0009376975,0.000002001312,0.00004635438,0.005475108],"genre_scores_gemma":[0.994511,0.00004467058,0.00005512193,0.002001244,0.001563493,0.0002823033,0.0001552867,0.00001180982,0.00137505],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0614677,"threshold_uncertainty_score":0.9997144,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1018300476529706,"score_gpt":0.4836972677800188,"score_spread":0.3818672201270482,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}