{"id":"W4413550031","doi":"10.2196/66503","title":"Performance Assessment of ChatGPT-4.0 and ChatGLM Series in Traditional Chinese Medicine for Metabolic Associated Fatty Liver Disease: Comparative Study","year":2025,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Disease; Knowledge base; Ranking (information retrieval); Fatty liver; Traditional Chinese medicine; The Internet; Medicine; Confusion; Metabolic syndrome; Alternative medicine; Computer science; Psychology; Artificial intelligence; Pathology; World Wide Web","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01217905,0.001416152,0.001176987,0.002111761,0.0004633231,0.001377138,0.001161689,0.001024328,0.002477643],"category_scores_gemma":[0.05768237,0.0002861504,0.001080989,0.001064797,0.000387828,0.001922871,0.001716667,0.0008383552,0.0011323],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001228623,"about_ca_system_score_gemma":0.001508972,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006438456,"about_ca_topic_score_gemma":0.004572499,"domain_scores_codex":[0.9925858,0.005166908,0.000637711,0.0006953398,0.000721397,0.0001928406],"domain_scores_gemma":[0.9443879,0.04651721,0.001481578,0.001425362,0.004267989,0.001919994],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.01728452,0.004431723,0.2235261,0.003835611,0.001314864,0.0006028628,0.007163975,0.02848901,0.006983215,0.0008348505,0.01170279,0.6938304],"study_design_scores_gemma":[0.001616009,0.0183665,0.3476899,0.0006362505,0.002533172,0.001102289,0.007133698,0.5929032,0.01335441,0.002247811,0.01197568,0.0004411272],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9808087,0.001127876,0.009286574,0.0004164977,0.0001070589,0.0008316623,0.001504617,0.002004383,0.003912576],"genre_scores_gemma":[0.9716412,0.0005441544,0.02212918,0.000164782,0.00007350661,0.0007546807,0.003214403,0.0001067326,0.001371296],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01217905,"threshold_uncertainty_score":0.06440973,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3102130887503805,"score_gpt":0.5647545839173643,"score_spread":0.2545414951669839,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}