{"id":"W7117303567","doi":"10.1016/j.jtumed.2025.11.004","title":"From diagnostics to education: Multi-domain evaluation of LLM chatbots in neurology","year":2025,"lang":"en","type":"article","venue":"Journal of Taibah University Medical Sciences","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Workflow; Adaptation (eye); Neurology; Clinical neurology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002204145,0.00004450984,0.0001727526,0.0004233214,0.00006415719,0.000004664173,0.0002047456,0.00008951448,0.0001924589],"category_scores_gemma":[0.003825333,0.00003815952,0.00003962507,0.0007616958,0.0002097948,0.00009981208,0.00003458606,0.0001950497,0.000003907096],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001460864,"about_ca_system_score_gemma":0.004263628,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00153395,"about_ca_topic_score_gemma":0.0007303085,"domain_scores_codex":[0.9985146,0.000196313,0.0003265012,0.0001126408,0.0007368994,0.000113055],"domain_scores_gemma":[0.9986147,0.0004989142,0.0001602003,0.00006551461,0.0004702774,0.0001903713],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0003873934,0.002034334,0.5391445,0.00005346691,0.00003534232,0.00005252531,0.005990982,0.0003647591,0.0003219308,0.002123061,0.01110322,0.4383885],"study_design_scores_gemma":[0.001396772,0.00332729,0.8654736,0.002392578,0.0003437566,0.00007632235,0.06251473,0.01101822,0.003181161,0.01802125,0.0320187,0.000235577],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9458091,0.000298536,0.001469809,0.05035492,0.001178235,0.0001440662,8.863132e-7,0.000001935325,0.0007424608],"genre_scores_gemma":[0.9968745,0.0002047468,0.001538719,0.001141655,0.0001835854,3.162644e-7,9.725081e-7,9.916336e-7,0.00005448458],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4381529,"threshold_uncertainty_score":0.7563493,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2057126788288148,"score_gpt":0.4825346791552645,"score_spread":0.2768220003264498,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}