{"id":"W4411230079","doi":"10.2196/70047","title":"Evaluating Large Language Models for Preoperative Patient Education in Superior Capsular Reconstruction: Comparative Study of Claude, GPT, and Gemini","year":2025,"lang":"en","type":"article","venue":"JMIR Perioperative Medicine","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Psychology; Medicine; Medical physics","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005307704,0.0002114289,0.0006422742,0.0003308978,0.0001910137,0.00001399015,0.00005854451,0.00009401255,0.0001081263],"category_scores_gemma":[0.0003478464,0.0001659727,0.00003427088,0.000432168,0.0001929978,0.0001949987,0.000031134,0.0002412547,0.000001206922],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001999586,"about_ca_system_score_gemma":0.0008871824,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001096966,"about_ca_topic_score_gemma":0.001561122,"domain_scores_codex":[0.9980436,0.0002277349,0.0008348456,0.0004373682,0.0002295148,0.0002269667],"domain_scores_gemma":[0.9984602,0.0002189389,0.0001270485,0.0002457394,0.0008552136,0.00009283615],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.001101452,0.002442606,0.06274493,0.0005595984,0.0001283473,0.000003533215,0.7718102,0.0004349784,0.01264443,0.001453991,0.0003309619,0.146345],"study_design_scores_gemma":[0.001510032,0.00729195,0.01760828,0.001612311,0.000136401,0.00002085427,0.9180863,0.03978339,0.01335907,0.0002412936,0.0001416521,0.0002084284],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9893461,0.001965577,0.0003700105,0.001035202,0.0004092552,0.005450584,0.00001164706,0.00001762068,0.001393967],"genre_scores_gemma":[0.9959094,0.00004971494,0.001127671,0.0004007575,0.0001728936,0.001543727,0.0000533635,0.00001210082,0.0007303585],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1462762,"threshold_uncertainty_score":0.676817,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1629329300717069,"score_gpt":0.5154731456468635,"score_spread":0.3525402155751566,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}