{"id":"W7106794673","doi":"10.2196/80167","title":"Digitally Assisted Clinical Decision-Making in Traditional Chinese Medicine: Comparative Study of 5 Large Language Models","year":2025,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Traditional Chinese Medicine Studies","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Government of Jiangsu Province; National Natural Science Foundation of China","keywords":"Standardization; Reliability (semiconductor); Quality (philosophy); Benchmark (surveying); Benchmarking; Medical prescription; Clinical trial; MEDLINE","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002896323,0.0002462222,0.001106546,0.001372206,0.0001865106,0.00001421372,0.0002853229,0.00009594761,0.0001144002],"category_scores_gemma":[0.001948061,0.0001600711,0.0001309747,0.002291274,0.0006213904,0.0003890255,0.0002143964,0.001192642,0.00001401957],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002163619,"about_ca_system_score_gemma":0.0003164993,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00003658798,"about_ca_topic_score_gemma":0.0002827252,"domain_scores_codex":[0.9955117,0.0005621018,0.001277767,0.0003890335,0.001816303,0.000443076],"domain_scores_gemma":[0.9913395,0.007170563,0.0001547731,0.0003756079,0.0008287959,0.0001307536],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.008901794,0.04200506,0.4979392,0.001409069,0.002148152,0.0008533124,0.3347777,0.0003405666,0.0002022671,0.03025967,0.06388467,0.01727861],"study_design_scores_gemma":[0.00862397,0.002539265,0.9247045,0.001805022,0.00002434824,0.00001727654,0.04465319,0.004047523,0.00000286644,0.01342474,0.00005907104,0.00009826132],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9476982,0.0003640006,0.0007462284,0.0008444447,0.0001807024,0.001570503,0.00008188474,0.00003810921,0.0484759],"genre_scores_gemma":[0.9990082,0.00002166011,0.0001610968,0.0001384721,0.0001997128,0.000256361,0.00008073662,0.00001363065,0.0001200962],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4267653,"threshold_uncertainty_score":0.652751,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1798021339684095,"score_gpt":0.5470641326485618,"score_spread":0.3672619986801523,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}