Inter-observer variation in LV analysis in a dedicated CMR unit: the impact of audit and consensus guideline on reproducibility
Notice bibliographique
Résumé
Cardiac MRI (CMRI) is reported to be accurate and reproducible in the assessment of left ventricular function. This, however, is generally by experienced observers using automated or semi-automated software. Many departments still rely on manual contour tracing with trainees increasingly performing analysis but is reproducibility still good? This study assess the impact of the observer experience on LV function assessment and the role of consensus guidelines in raising standards among trainees. 20 LV data sets of varying volumes and ejection fractions (EF) were anonymized. Each data set comprised 2 and 4 chamber long axis cine SSFPs and contiguous short axis cine SSFPs from base to apex. LV volumes (LVEDV, LVESV), end diastolic muscle mass (EDMM), and EF were manually evaluated using Argus software (Siemens Medical Solutions, Erlangen) by all those regularly analyzing data in our department (7 experienced operators (> 2 years CMR experience) and 4 inexperienced operators (< 1 year CMR experience)). Inter-observer variability for all parameters was assessed, using the mean of all expert observers as the reference. Analysis of saved contours for all observers showed a small number of common causes of variability. Based on these, consensus guidelines were agreed and instituted. 4 of the experienced and all the inexperienced observers repeated the analysis of the 10 most problematic data sets after 3 months. Inter-operator variances for analyses before and after introduction of guidelines were compared. The department as a whole showed wide inter-observer variation for all parameters (mean standard deviation for EF, LVEDV, LVESV and EDMM were 3.8%, 10.8 mls, 10.5 mls and 23.6 gms respectively). As expected, there was greater variation between inexperienced observers than experienced observers (mean SD of variation in EF for inexperienced was 4.9% compared with 2.7% for experienced, LVEDV 12.3 mls and 7.6 mls, LVESV 11.9 mls and 7.4 mls, EDMM 29.2 gms and 16.0 gms). Following introduction of consensus guidelines, mean SD for EF fell to 2.7%, LVEDV to 7.2 mls, LVESV to 6.7 mls. There was little change in mean SD for EDMM (18.8 gms). The use of guidelines eliminated differences between experienced and inexperienced observers for all parameters. Reported reproducibility of LV function measurements by CMRI is high for experienced observers but this may not be true in large departments or when observers are inexperienced. Internal audit should be routine for validating practice and consensus guidelines can help in raising standards to meet published values.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,251 | 0,433 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,002 | 0,002 |
| Études des sciences et des technologies | 0,001 | 0,002 |
| Communication savante | 0,003 | 0,003 |
| Science ouverte | 0,002 | 0,003 |
| Intégrité de la recherche | 0,001 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,001 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; l’étiquette directe de Gemma et le classifieur distillé Codex s’accordent sur ce qui est montré ici.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».