{"id":"W4417515976","doi":"10.1016/j.ajoint.2025.100216","title":"Assessing demographic variation in large language model outputs for patient education materials in cataract surgery","year":2025,"lang":"en","type":"article","venue":"AJO International","topic":"Health Literacy and Information Accessibility","field":"Health Professions","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McMaster University; Western University; Queen's University","funders":"","keywords":"Readability; Patient education; Indigenous; Cataract surgery; Reading (process); Grade level; Socioeconomic status; Variation (astronomy); MEDLINE","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002422667,0.00009782882,0.0001907954,0.0007011283,0.0001631869,0.00006646931,0.0001300523,0.0001439326,0.0001862663],"category_scores_gemma":[0.001078394,0.00009585307,0.00005157158,0.00028962,0.000008647185,0.001875567,0.00005415233,0.0002228765,0.00001783371],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004008296,"about_ca_system_score_gemma":0.001142892,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0006113679,"about_ca_topic_score_gemma":0.0004130399,"domain_scores_codex":[0.9976937,0.0002640587,0.001400263,0.000200601,0.0001622939,0.0002790894],"domain_scores_gemma":[0.9984858,0.0006214599,0.0004196417,0.0001623552,0.0002731257,0.00003764348],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0003162419,0.001073496,0.8667126,0.001266301,0.00002974826,0.000001055182,0.02295958,0.0002384036,0.001041432,0.04149109,0.006455107,0.05841492],"study_design_scores_gemma":[0.0008437011,0.000007797888,0.9041911,0.00107067,0.000006563934,3.144893e-7,0.003217053,0.07720701,0.0002099128,0.005573636,0.007492522,0.0001797087],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9602299,0.00004839268,0.03141918,0.001612963,0.002510655,0.000827408,0.0001241155,0.00003220259,0.003195133],"genre_scores_gemma":[0.9900004,0.00001057992,0.002498698,0.005621872,0.0001013136,0.0005833606,0.0008843049,0.000007173835,0.000292299],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.07696862,"threshold_uncertainty_score":0.3908775,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04278803316391143,"score_gpt":0.4684787450061979,"score_spread":0.4256907118422865,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}