MétaCan
Menu
← Retour à la cohorte
Enregistrement W7161978291 · doi:10.82308/12415

Use of Large Language Models for Family medicine education and examination

2025· dissertation· en· W7161978291 sur OpenAlexaboutno aff
Mehdi Mousavi

Notice bibliographique

Revuenon disponible
Typedissertation
Langueen
DomaineMedicine
ThématiqueArtificial Intelligence in Healthcare and Education
Établissements canadiensnon disponible
Organismes subventionnairesnon disponible
Mots-clésEnglish language

Résumé

récupéré en direct d'OpenAlex

Dans cette thèse, nous avons réalisé deux études pour évaluer l'utilité de dix chatbots basés sur des LLMs en utilisant un échantillon de questionnaire pour l'examen de médecine familiale canadien, afin d'évaluer la précision des réponses et d'explorer quels aspects de ces LLMs pourraient être plus utiles dans ce contexte.Nous avons utilisé un échantillon du questionnaire de problèmes de gestion à réponses courtes (SAMPs) du site officiel du Collège des médecins de famille du Canada (CMFC). Cet ensemble d'échantillons comprenait 19 scénarios cliniques couvrant divers domaines de la médecine familiale, chacun comprenant de 2 à 7 questions, résultant en un total de 77 questions nécessitant 165 lignes de réponses.Dans la première étude, nous avons utilisé GPT-3.5 et GPT-4 cinq fois entre le 8 et le 25 août 2023 pour répondre au questionnaire. Pour le premier tour, nous avons fourni une invite limitant la réponse à 10 mots par ligne. Cette procédure a été répétée une semaine plus tard au deuxième tour. Le troisième tour impliquait la régénération immédiate des réponses du deuxième tour. Le quatrième tour utilisait une invite différente qui ne faisait pas référence aux questions d'examen du CMFC. Enfin, le cinquième tour s'est déroulé sans invite.Deux évaluateurs certifiés par le CMFC avec une expérience moyenne de 15 ans ont évalué les réponses en fonction du clé de réponse du CMFC. Les évaluateurs étaient aveugles aux évaluations de chacun mais ont résolu toutes les divergences par plusieurs réunions. Nous avons appliqué un modèle d'équations d'estimation généralisées (GEE) logistique ordinal pour analyser les mesures répétées sur les cinq tours.Dans notre deuxième étude, menée en février et mars 2024, nous avons examiné dix chatbots basés sur des LLM comme suit : (1) LLM de domaine général sans recherche en ligne, y compris GPT-3.5 et GPT-4 d'Open AI, Gemini Pro 1.0 et Gemini Ultra 1.0 de Google et Personal Intelligence d'Inflection AI (utilisant Inflection 2.5) ; (2) Chatbots basés sur des LLM incluant des capacités de recherche en ligne, comme le mode Smart de YouChat (utilisant GPT-3), le mode GPT-4 de YouChat et Copilot de Microsoft (utilisant GPT-4) ; (3) LLM formés sur des connaissances médicales : c'est-à-dire AI Doctor de Docus AI (utilisant GPT-4) et Chat Doctor créé par meta-AI (utilisant LLaMA).Comme dans la première étude, trois évaluateurs certifiés par le CMFC ont noté les réponses générées par les LLM. Nous avons utilisé le Kappa de Fleiss pour mesurer l'accord entre les évaluateurs après les réunions.Selon la clé de réponse du CMFC, GPT-3.5 a fourni des réponses exactes dans 607 des 825 lignes de réponses (73,6 %),, tandis que GPT-4 a atteint une précision de 691 cas (81%). L'analyse GEE a révélé que GPT-4 avait 2,31 fois plus de chances d'obtenir un score CFPC plus élevé que GPT-3.5 (Odds Ratio : 2,31 ; Intervalle de Confiance à 95% : 1,53 à 3,47 ; P<0,001). D'autres résultats des cinq tours de la première étude comprenaient une cohérence sur une semaine, aucun impact significatif de l'utilisation de la limite de 10 mots, et aucun changement substantiel après la suppression de l'examen CMFC de l'invite initiale.Dans la deuxième étude, le score Kappa variait de 0,89 à 1, indiquant un consensus parfait. ChatGPT-4 a démontré le taux de précision le plus élevé parmi les dix systèmes avec 85,5%, suivi par AI Doctor avec 82,4%, Gemini Advanced et Chat Doctor avec 81,2%, et Copilot avec 80%. Les LLM avec accès à Internet ont surpassé ChatGPT-4.Nos résultats mettent en évidence le potentiel des LLMs pour l'éducation en médecine familiale et la préparation à l'examen du CMFC. Nous avons démontré une plus grande cohérence et précision dans les réponses de GPT-4 par rapport à GPT-3.5, ainsi que la performance supérieure de GPT-4 parmi les dix modèles. Il est nécessaire de mener d'autres études pour explorer plusieurs utilisations des LLMs et améliorer leur performance dans ce domaine

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction machine sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.

score de la tête « metaresearch » (Codex)0,008
score de la tête « metaresearch » (Gemma)0,030
Version: metacan-v3-hybrid-931329e0061cStatut de validation: machine_predicted_unvalidated
Catégories candidatesaucune
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Sans objet · Signal consensuel: aucune
GenreSignal candidat: Méthodes · Signal consensuel: Méthodes
Score de désaccord entre enseignants0,032
Score d'incertitude au seuil0,063

Scores du classifieur distillé par catégorie (deux têtes)

CatégorieCodexGemma
Métarecherche0,0080,030
Méta-épidémiologie (sens strict)0,0020,001
Méta-épidémiologie (sens large)0,0010,003
Bibliométrie0,0020,001
Études des sciences et des technologies0,0010,001
Communication savante0,0040,005
Science ouverte0,0020,002
Intégrité de la recherche0,0020,003
Charge utile insuffisante (le modèle a refusé de juger)0,0110,005

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,216
Tête enseignante GPT0,488
Écart entre enseignants0,272 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.

Les modèles n’ont appliqué aucune catégorie : rien dans la taxonomie ne correspondait à ce travail.
Devis d'étudeSans objet
Domainenon disponible
GenreMéthodes

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2025
Routes d'admission1
Résumé présentoui

Explorer davantage

Même sujetArtificial Intelligence in Healthcare and Education→Travaux en français237 207→