Variability of sleep stage scoring in late midlife and early old age
Notice bibliographique
Résumé
Sleep stage scoring can lead to important inter-expert variability. Although likely, whether this issue is amplified in older populations, which show alterations of sleep electrophysiology, has not been thoroughly assessed. Algorithms for automatic sleep stage scoring may appear ideal to eliminate inter-expert variability. Yet, variability between human experts and algorithm sleep stage scoring in healthy older individuals has not been investigated. Here, we aimed to compare stage scoring of older individuals and hypothesized that variability, whether between experts or considering the algorithm, would be higher than usually reported in the literature. Twenty cognitively normal and healthy late midlife individuals' (61 ± 5 years; 10 women) night-time sleep recordings were scored by two experts from different research centres and one algorithm. We computed agreements for the entire night (percentage and Cohen's κ) and each sleep stage. Whole-night pairwise agreements were relatively low and ranged from 67% to 78% (κ, 0.54-0.67). Sensitivity across pairs of scorers proved lowest for stages N1 (8.2%-63.4%) and N3 (44.8%-99.3%). Significant differences between experts and/or algorithm were found for total sleep time, sleep efficiency, time spent in N1/N2/N3 and wake after sleep onset (p ≤ 0.005), but not for sleep onset latency, rapid eye movement (REM) and slow-wave sleep (SWS) duration (N2 + N3). Our results confirm high inter-expert variability in healthy aging. Consensus appears good for REM and SWS, considered as a whole. It seems more difficult for N3, potentially because human raters adapt their interpretation according to overall changes in sleep characteristics. Although the algorithm does not substantially reduce variability, it would favour time-efficient standardization.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,008 | 0,010 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,000 | 0,000 |
| Bibliométrie | 0,001 | 0,002 |
| Études des sciences et des technologies | 0,000 | 0,000 |
| Communication savante | 0,000 | 0,001 |
| Science ouverte | 0,001 | 0,001 |
| Intégrité de la recherche | 0,000 | 0,002 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,000 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».