Exploring the Feasibility of Applying Deep Learning for the Early Prediction of Arthritis
Notice bibliographique
Résumé
Introduction: Arthritis is one of the most common chronic diseases. Early detection of arthritis and its progression can facilitate early intervention measures, lowering disease severity in patients. As electronic health records (EHR) become more accessible, this study assesses whether general health information and arthritis-related questionnaires can be used in arthritis diagnosis, without the involvement of costly imaging methods. Therefore, we created deep learning (DL) and machine learning (ML) models to explore the feasibility of combining EHR and modern computational tools to diagnose arthritis. Methods: A total of 782 arthritis patients and 4014 control patients were identified from the Osteoarthritis Initiative (OAI) – a ten-year-long observational study that included patient EHR in five time points. Six hundred variables were filtered by random forest classifier followed by manual filtering. Data were split properly to training, testing and validation set, and the training set was balanced. Sequential, nonsequential DL models, and five independent DL models for each time points were used. The accuracy, positive prevalence value (PPV), negative prevalence value (NPV), and area under curve (AUC), were assessed and compared with four classical ML models. SHAP (SHapley Additive exPlanations) summary analysis was also conducted. Results: Sequential and non-sequential deep learning models showed accuracies of ~ 0.97, and the four classical machine learning approaches showed accuracies of above 0.9. High positive and negative predicted values (> 0.90) for all of the models suggested the potential clinical applicability of the model, while the SHAP analysis demonstrated its interpretability. Discussion: We tested various models and showed the ability to use machine learning methods for early diagnosis of arthritis with EHR. The models can be used as a screening tool to select susceptible patients for confirmatory tests such as X-ray and MRI. Identification of early disease states could facilitate protective measures that slow disease progression.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,003 | 0,006 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,000 |
| Méta-épidémiologie (sens large) | 0,000 | 0,001 |
| Bibliométrie | 0,001 | 0,000 |
| Études des sciences et des technologies | 0,000 | 0,000 |
| Communication savante | 0,001 | 0,001 |
| Science ouverte | 0,001 | 0,001 |
| Intégrité de la recherche | 0,001 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,001 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».