ISQUA16-1878ARE STATISTICAL NATURAL LANGUAGE PROCESSING MODELS FOR PNEUMONIA SURVEILLANCE GENERALIZABLE ACROSS ACUTE CARE HOSPITALS?
Notice bibliographique
Résumé
Natural language processing (NLP) models are increasingly used for adverse event (AE) surveillance in acute care hospitals, but limited information is available on their generalizability, which is important for valid benchmarking of AE data across institutions. We examined the generalizability of a statistical NLP model for identifying pneumonia from electronic health record (EHR) data; a common AE that is associated with significant morbidity, mortality and cost. We randomly sampled 4,000 narrative reports of chest radiological examinations performed at a university health network (UHN) in Quebec (Canada) between 2010 and 2014. We manually identified pneumonia within each report, which served as our reference standard. We used a nested cross-validation approach to train and validate a support vector machine (SVM) model predicting pneumonia. This model was then applied to a random sample of 2,281 narrative radiology reports from another UHN in Ontario (Canada), and accuracy was measured. The accuracy of the Quebec model, as applied to Ontario data, was compared to that of two alternative models: 1) a model recalibrated on Ontario data and; 2) a model trained and validated using all available data (pooled Quebec-Ontario model).
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,002 | 0,001 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,000 | 0,000 |
| Bibliométrie | 0,000 | 0,000 |
| Études des sciences et des technologies | 0,001 | 0,000 |
| Communication savante | 0,000 | 0,001 |
| Science ouverte | 0,002 | 0,000 |
| Intégrité de la recherche | 0,000 | 0,000 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,000 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».