{"id":"W4403177786","doi":"10.2196/56762","title":"Evaluating AI Competence in Specialized Medicine: Comparative Analysis of ChatGPT and Neurologists in a Neurology Specialist Examination in Spain","year":2024,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Preprint; Competence (human resources); Neurology; Medical education; Psychology; Medicine; Psychiatry; Computer science; World Wide Web","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.008757375,0.0004262794,0.0007906522,0.003511121,0.0004844836,0.001343635,0.0007459305,0.00104176,0.001224019],"category_scores_gemma":[0.03055996,0.0002621913,0.0006626889,0.001617856,0.000895995,0.000805915,0.002583333,0.0005271331,0.0005339419],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001794762,"about_ca_system_score_gemma":0.001526708,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009048506,"about_ca_topic_score_gemma":0.01096885,"domain_scores_codex":[0.9949824,0.002011621,0.0007824399,0.0006928368,0.0009948096,0.0005359139],"domain_scores_gemma":[0.9725342,0.01241755,0.004177881,0.001087555,0.006150231,0.003632625],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.000477354,0.0002651766,0.9707155,0.0001786691,0.0000757594,0.0005456864,0.01191805,0.000263129,0.0004741178,0.00003099611,0.0004712481,0.01458438],"study_design_scores_gemma":[0.00002055978,0.0003661504,0.98875,0.00006894967,0.00002768196,0.0003969896,0.008768925,0.0005504633,0.0002444683,0.00003784322,0.0007532345,0.00001488984],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9988744,0.0001622566,0.0001178226,0.0000512661,0.0000102792,0.00003305089,0.0001363436,0.0000108126,0.0006037598],"genre_scores_gemma":[0.9988627,0.0001395224,0.0002332978,0.00004683066,0.00001185269,0.00003865204,0.0003031218,0.000008145961,0.0003557445],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9912426,"threshold_uncertainty_score":0.04631394,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1737585601633037,"score_gpt":0.5358228037959748,"score_spread":0.3620642436326711,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}