{"id":"W4416516670","doi":"10.2196/81545","title":"Large Language Model Evaluation in Traditional Chinese Medicine for Stroke: Quantitative Benchmarking Study","year":2025,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Traditional Chinese Medicine Studies","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Benchmarking; Benchmark (surveying); Traditional Chinese medicine; Empirical research; Foundation (evidence); Language model","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005838743,0.0002306182,0.0005632694,0.001531925,0.0003457549,0.0000155776,0.0001645109,0.00006947992,0.0001387978],"category_scores_gemma":[0.002446448,0.0001613747,0.0000920598,0.0013952,0.0002712526,0.0002995704,0.0000857565,0.0007076152,0.000008907117],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005612908,"about_ca_system_score_gemma":0.0004715965,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00004415646,"about_ca_topic_score_gemma":0.0003071988,"domain_scores_codex":[0.9962231,0.0004089421,0.000576657,0.0003837845,0.001886315,0.0005212126],"domain_scores_gemma":[0.9962081,0.002207082,0.00007990522,0.0002540216,0.001149079,0.0001018083],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"observational","study_design_scores_codex":[0.007516782,0.01462136,0.1606649,0.002935434,0.00179772,0.0001135408,0.5749506,0.001595684,0.004497618,0.1390905,0.08040399,0.01181181],"study_design_scores_gemma":[0.01407709,0.002990267,0.6493788,0.0006319367,0.00006743175,0.000005157063,0.05129761,0.2641673,0.00002427081,0.01713529,0.00008681353,0.0001380705],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9701909,0.000635984,0.003770909,0.004357178,0.0002145448,0.004867133,0.0002342332,0.00004004925,0.01568901],"genre_scores_gemma":[0.9951948,0.00001855966,0.0005239391,0.0001801796,0.0002936618,0.002838458,0.0005124058,0.00001831184,0.000419681],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.523653,"threshold_uncertainty_score":0.6580669,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1634898744243955,"score_gpt":0.5202254729175368,"score_spread":0.3567355984931413,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}