{"id":"W4416516670","doi":"10.2196/81545","title":"Large Language Model Evaluation in Traditional Chinese Medicine for Stroke: Quantitative Benchmarking Study","year":2025,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Traditional Chinese Medicine Studies","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Benchmarking; Benchmark (surveying); Traditional Chinese medicine; Empirical research; Foundation (evidence); Language model","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01475179,0.00154093,0.001007622,0.002215324,0.0005508935,0.001524361,0.001683421,0.001286716,0.001940943],"category_scores_gemma":[0.03576786,0.0002375641,0.001187126,0.002096089,0.0007492197,0.002021058,0.001514047,0.001427454,0.0009064944],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002375209,"about_ca_system_score_gemma":0.001949143,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01153125,"about_ca_topic_score_gemma":0.01168873,"domain_scores_codex":[0.9912063,0.005621006,0.0006796464,0.001041755,0.001219489,0.0002316891],"domain_scores_gemma":[0.9734375,0.01929777,0.000771637,0.002409511,0.003581899,0.0005016145],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002765745,0.003036176,0.09624984,0.003946973,0.001868429,0.0006121875,0.00154388,0.3033701,0.005732397,0.004220787,0.04170991,0.5349435],"study_design_scores_gemma":[0.0003297279,0.001556602,0.03879566,0.000392753,0.0004881416,0.0002947496,0.000943685,0.9332818,0.007810605,0.00369317,0.01230675,0.000106355],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9195742,0.01105745,0.04312187,0.001232648,0.0003675394,0.0008714722,0.01090231,0.002729967,0.01014258],"genre_scores_gemma":[0.9372914,0.001164346,0.03251958,0.0002385797,0.00009882977,0.0005371214,0.02634311,0.0001741274,0.001632806],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01475179,"threshold_uncertainty_score":0.07801586,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1634898744243955,"score_gpt":0.5202254729175368,"score_spread":0.3567355984931413,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}