Use of Large Language Models for Family medicine education and examination
Bibliographic record
Abstract
Dans cette thèse, nous avons réalisé deux études pour évaluer l'utilité de dix chatbots basés sur des LLMs en utilisant un échantillon de questionnaire pour l'examen de médecine familiale canadien, afin d'évaluer la précision des réponses et d'explorer quels aspects de ces LLMs pourraient être plus utiles dans ce contexte.Nous avons utilisé un échantillon du questionnaire de problèmes de gestion à réponses courtes (SAMPs) du site officiel du Collège des médecins de famille du Canada (CMFC). Cet ensemble d'échantillons comprenait 19 scénarios cliniques couvrant divers domaines de la médecine familiale, chacun comprenant de 2 à 7 questions, résultant en un total de 77 questions nécessitant 165 lignes de réponses.Dans la première étude, nous avons utilisé GPT-3.5 et GPT-4 cinq fois entre le 8 et le 25 août 2023 pour répondre au questionnaire. Pour le premier tour, nous avons fourni une invite limitant la réponse à 10 mots par ligne. Cette procédure a été répétée une semaine plus tard au deuxième tour. Le troisième tour impliquait la régénération immédiate des réponses du deuxième tour. Le quatrième tour utilisait une invite différente qui ne faisait pas référence aux questions d'examen du CMFC. Enfin, le cinquième tour s'est déroulé sans invite.Deux évaluateurs certifiés par le CMFC avec une expérience moyenne de 15 ans ont évalué les réponses en fonction du clé de réponse du CMFC. Les évaluateurs étaient aveugles aux évaluations de chacun mais ont résolu toutes les divergences par plusieurs réunions. Nous avons appliqué un modèle d'équations d'estimation généralisées (GEE) logistique ordinal pour analyser les mesures répétées sur les cinq tours.Dans notre deuxième étude, menée en février et mars 2024, nous avons examiné dix chatbots basés sur des LLM comme suit : (1) LLM de domaine général sans recherche en ligne, y compris GPT-3.5 et GPT-4 d'Open AI, Gemini Pro 1.0 et Gemini Ultra 1.0 de Google et Personal Intelligence d'Inflection AI (utilisant Inflection 2.5) ; (2) Chatbots basés sur des LLM incluant des capacités de recherche en ligne, comme le mode Smart de YouChat (utilisant GPT-3), le mode GPT-4 de YouChat et Copilot de Microsoft (utilisant GPT-4) ; (3) LLM formés sur des connaissances médicales : c'est-à-dire AI Doctor de Docus AI (utilisant GPT-4) et Chat Doctor créé par meta-AI (utilisant LLaMA).Comme dans la première étude, trois évaluateurs certifiés par le CMFC ont noté les réponses générées par les LLM. Nous avons utilisé le Kappa de Fleiss pour mesurer l'accord entre les évaluateurs après les réunions.Selon la clé de réponse du CMFC, GPT-3.5 a fourni des réponses exactes dans 607 des 825 lignes de réponses (73,6 %),, tandis que GPT-4 a atteint une précision de 691 cas (81%). L'analyse GEE a révélé que GPT-4 avait 2,31 fois plus de chances d'obtenir un score CFPC plus élevé que GPT-3.5 (Odds Ratio : 2,31 ; Intervalle de Confiance à 95% : 1,53 à 3,47 ; P<0,001). D'autres résultats des cinq tours de la première étude comprenaient une cohérence sur une semaine, aucun impact significatif de l'utilisation de la limite de 10 mots, et aucun changement substantiel après la suppression de l'examen CMFC de l'invite initiale.Dans la deuxième étude, le score Kappa variait de 0,89 à 1, indiquant un consensus parfait. ChatGPT-4 a démontré le taux de précision le plus élevé parmi les dix systèmes avec 85,5%, suivi par AI Doctor avec 82,4%, Gemini Advanced et Chat Doctor avec 81,2%, et Copilot avec 80%. Les LLM avec accès à Internet ont surpassé ChatGPT-4.Nos résultats mettent en évidence le potentiel des LLMs pour l'éducation en médecine familiale et la préparation à l'examen du CMFC. Nous avons démontré une plus grande cohérence et précision dans les réponses de GPT-4 par rapport à GPT-3.5, ainsi que la performance supérieure de GPT-4 parmi les dix modèles. Il est nécessaire de mener d'autres études pour explorer plusieurs utilisations des LLMs et améliorer leur performance dans ce domaine
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.008 | 0.030 |
| Meta-epidemiology (narrow) | 0.002 | 0.001 |
| Meta-epidemiology (broad) | 0.001 | 0.003 |
| Bibliometrics | 0.002 | 0.001 |
| Science and technology studies | 0.001 | 0.001 |
| Scholarly communication | 0.004 | 0.005 |
| Open science | 0.002 | 0.002 |
| Research integrity | 0.002 | 0.003 |
| Insufficient payload (model declined to judge) | 0.011 | 0.005 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".