{"id":"W4410711823","doi":"10.2196/75103","title":"Evaluating and Improving Syndrome Differentiation Thinking Ability in Large Language Models: Method Development Study","year":2025,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Traditional Chinese Medicine Studies","field":"Medicine","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Preprint; Computer science; Natural language processing; World Wide Web","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01792959,0.001983906,0.0009450188,0.002354339,0.0007793405,0.002111919,0.002603179,0.001289055,0.003604105],"category_scores_gemma":[0.05241412,0.0006642438,0.001711906,0.001700118,0.0005762735,0.003056648,0.002411848,0.002240387,0.001186448],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00158935,"about_ca_system_score_gemma":0.003471925,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005762388,"about_ca_topic_score_gemma":0.008053336,"domain_scores_codex":[0.9862806,0.008656461,0.001199003,0.00228504,0.001323364,0.0002555208],"domain_scores_gemma":[0.9400387,0.04750236,0.001252752,0.004614145,0.005953035,0.0006390639],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.001170632,0.002579986,0.0412191,0.002289005,0.000996248,0.0004440811,0.001740134,0.0414344,0.01018482,0.003894473,0.0140773,0.8799698],"study_design_scores_gemma":[0.001045577,0.001200308,0.01131647,0.0004710574,0.0007770762,0.0005092131,0.001611699,0.9424592,0.02158453,0.006353687,0.01248967,0.0001814712],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2521381,0.002156936,0.7217056,0.0008804153,0.0003241512,0.005365295,0.00359328,0.009749897,0.004086268],"genre_scores_gemma":[0.2925884,0.0003691589,0.6958315,0.000262435,0.00005105153,0.003908184,0.005544446,0.0003901505,0.001054679],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01792959,"threshold_uncertainty_score":0.09482181,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03897205438098617,"score_gpt":0.3985427546078242,"score_spread":0.359570700226838,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}