Assessing demographic variation in large language model outputs for patient education materials in cataract surgery
Notice bibliographique
Résumé
• Demographic factors influence LLM readability and word count in cataract education • Indigenous and Black prompts elicited the most complex LLM-generated responses • Insured patients consistently received longer, more complex content across models • Geographic disparities across Canadian provinces were observed, with Nunavut receiving the least readable outputs. • No LLM met AMA readability standards; all exceeded sixth grade reading level To evaluate whether large language model (LLM)-generated patient education materials for cataract surgery vary in readability, length, and accuracy based on demographic modifiers including race, gender, geography, and insurance status. Cross-sectional study This study analyzed 7,000 responses from five LLMs (ChatGPT, Claude, Copilot, DeepSeek, and Gemini) between March-May 2025 using 280 standardized prompts that varied by race, gender, province/territory, and insurance coverage. Each prompt was submitted five times. Readability was assessed using the Flesch-Kincaid Grade Level (FKGL), Flesch Reading Ease (FRE), and SMOG index. Accuracy was assessed by dual blinded reviewers against AAO clinical guidelines. ANOVA was performed (α = 0.05). LLM outputs differed significantly across all metrics (p < 0.001). Gemini generated the longest (876 ± 143 words) and most complex text (FKGL 15.2 ± 0.8). Race, insurance status, and geography significantly impacted readability. Prompts referencing Indigenous patients were the most complex (FKGL 11.1 ± 1.8, FRE 36.5 ± 7.9). Insured prompts were longer and more complex (11.0 ± 1.7 vs. 10.8 ± 1.7; 429 vs. 399 words; p < 0.001). Prompts from Nunavut and Manitoba were the least readable (FKGL ≥ 11.1), while Quebec and PEI were most readable. Gender had minimal impact. No outputs contained clinically unsafe information, but most lacked sufficient depth. None of the responses met the AMA’s sixth-grade readability recommendation. LLM-generated patient education for cataract surgery varies by patient demographics. These disparities may hinder equitable access to health information and highlight the need for bias-aware development of AI tools in healthcare.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,002 | 0,001 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,000 | 0,000 |
| Bibliométrie | 0,001 | 0,000 |
| Études des sciences et des technologies | 0,000 | 0,000 |
| Communication savante | 0,000 | 0,002 |
| Science ouverte | 0,000 | 0,000 |
| Intégrité de la recherche | 0,000 | 0,000 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,000 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».