Use of Large Language Models for Family medicine education and examination
Notice bibliographique
Résumé
Dans cette thèse, nous avons réalisé deux études pour évaluer l'utilité de dix chatbots basés sur des LLMs en utilisant un échantillon de questionnaire pour l'examen de médecine familiale canadien, afin d'évaluer la précision des réponses et d'explorer quels aspects de ces LLMs pourraient être plus utiles dans ce contexte.Nous avons utilisé un échantillon du questionnaire de problèmes de gestion à réponses courtes (SAMPs) du site officiel du Collège des médecins de famille du Canada (CMFC). Cet ensemble d'échantillons comprenait 19 scénarios cliniques couvrant divers domaines de la médecine familiale, chacun comprenant de 2 à 7 questions, résultant en un total de 77 questions nécessitant 165 lignes de réponses.Dans la première étude, nous avons utilisé GPT-3.5 et GPT-4 cinq fois entre le 8 et le 25 août 2023 pour répondre au questionnaire. Pour le premier tour, nous avons fourni une invite limitant la réponse à 10 mots par ligne. Cette procédure a été répétée une semaine plus tard au deuxième tour. Le troisième tour impliquait la régénération immédiate des réponses du deuxième tour. Le quatrième tour utilisait une invite différente qui ne faisait pas référence aux questions d'examen du CMFC. Enfin, le cinquième tour s'est déroulé sans invite.Deux évaluateurs certifiés par le CMFC avec une expérience moyenne de 15 ans ont évalué les réponses en fonction du clé de réponse du CMFC. Les évaluateurs étaient aveugles aux évaluations de chacun mais ont résolu toutes les divergences par plusieurs réunions. Nous avons appliqué un modèle d'équations d'estimation généralisées (GEE) logistique ordinal pour analyser les mesures répétées sur les cinq tours.Dans notre deuxième étude, menée en février et mars 2024, nous avons examiné dix chatbots basés sur des LLM comme suit : (1) LLM de domaine général sans recherche en ligne, y compris GPT-3.5 et GPT-4 d'Open AI, Gemini Pro 1.0 et Gemini Ultra 1.0 de Google et Personal Intelligence d'Inflection AI (utilisant Inflection 2.5) ; (2) Chatbots basés sur des LLM incluant des capacités de recherche en ligne, comme le mode Smart de YouChat (utilisant GPT-3), le mode GPT-4 de YouChat et Copilot de Microsoft (utilisant GPT-4) ; (3) LLM formés sur des connaissances médicales : c'est-à-dire AI Doctor de Docus AI (utilisant GPT-4) et Chat Doctor créé par meta-AI (utilisant LLaMA).Comme dans la première étude, trois évaluateurs certifiés par le CMFC ont noté les réponses générées par les LLM. Nous avons utilisé le Kappa de Fleiss pour mesurer l'accord entre les évaluateurs après les réunions.Selon la clé de réponse du CMFC, GPT-3.5 a fourni des réponses exactes dans 607 des 825 lignes de réponses (73,6 %),, tandis que GPT-4 a atteint une précision de 691 cas (81%). L'analyse GEE a révélé que GPT-4 avait 2,31 fois plus de chances d'obtenir un score CFPC plus élevé que GPT-3.5 (Odds Ratio : 2,31 ; Intervalle de Confiance à 95% : 1,53 à 3,47 ; P<0,001). D'autres résultats des cinq tours de la première étude comprenaient une cohérence sur une semaine, aucun impact significatif de l'utilisation de la limite de 10 mots, et aucun changement substantiel après la suppression de l'examen CMFC de l'invite initiale.Dans la deuxième étude, le score Kappa variait de 0,89 à 1, indiquant un consensus parfait. ChatGPT-4 a démontré le taux de précision le plus élevé parmi les dix systèmes avec 85,5%, suivi par AI Doctor avec 82,4%, Gemini Advanced et Chat Doctor avec 81,2%, et Copilot avec 80%. Les LLM avec accès à Internet ont surpassé ChatGPT-4.Nos résultats mettent en évidence le potentiel des LLMs pour l'éducation en médecine familiale et la préparation à l'examen du CMFC. Nous avons démontré une plus grande cohérence et précision dans les réponses de GPT-4 par rapport à GPT-3.5, ainsi que la performance supérieure de GPT-4 parmi les dix modèles. Il est nécessaire de mener d'autres études pour explorer plusieurs utilisations des LLMs et améliorer leur performance dans ce domaine
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,008 | 0,030 |
| Méta-épidémiologie (sens strict) | 0,002 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,003 |
| Bibliométrie | 0,002 | 0,001 |
| Études des sciences et des technologies | 0,001 | 0,001 |
| Communication savante | 0,004 | 0,005 |
| Science ouverte | 0,002 | 0,002 |
| Intégrité de la recherche | 0,002 | 0,003 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,011 | 0,005 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».