{"id":"W4408613424","doi":"10.2196/58897","title":"Performance of ChatGPT-4 on Taiwanese Traditional Chinese Medicine Licensing Examinations: Cross-Sectional Study","year":2025,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Cross-sectional study; Medicine; Traditional medicine; Family medicine; Pathology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008325201,0.0005072982,0.000567545,0.001402796,0.0004804653,0.0009453097,0.0007089428,0.000934385,0.001388171],"category_scores_gemma":[0.0334694,0.0004367218,0.0008640326,0.0009021087,0.0006297841,0.001342589,0.001317339,0.0009499427,0.0007284665],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009714682,"about_ca_system_score_gemma":0.0008068763,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007620636,"about_ca_topic_score_gemma":0.006752459,"domain_scores_codex":[0.9965284,0.001716859,0.0004999453,0.0004337548,0.0005813222,0.0002397698],"domain_scores_gemma":[0.9746431,0.01185563,0.005129702,0.001980349,0.004787948,0.001603275],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001709932,0.000577571,0.9892259,0.00005284758,0.00005238209,0.0001667435,0.003614609,0.000266124,0.0003403988,0.00002194604,0.0001628982,0.005347528],"study_design_scores_gemma":[0.00002035237,0.001721641,0.9887455,0.00003972807,0.00007294425,0.000286383,0.003709228,0.004286634,0.000612376,0.0000346676,0.0004447595,0.0000258676],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9996154,0.00002063635,0.0000944316,0.00001972578,0.000002400913,0.00003679905,0.00005413212,0.000005438565,0.0001510213],"genre_scores_gemma":[0.999255,0.00004187337,0.0001977553,0.00002479384,0.0000052435,0.00005551807,0.0001844084,0.000004536418,0.000230833],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.008325201,"threshold_uncertainty_score":0.0440284,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1018300476529706,"score_gpt":0.4836972677800188,"score_spread":0.3818672201270482,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}