MétaCan
Menu
Retour à la cohorte
Enregistrement W4405281526 · doi:10.1002/path.6373

Stress testing deep learning models for prostate cancer detection on biopsies and surgical specimens

2024· article· en· W4405281526 sur OpenAlexaff
Brennan Flannery, Howard M. Sandler, Priti Lal, Michael D. Feldman, Juan C. Santa-Rosario, Tilak Pathak, Tuomas Mirtti, Xavier Farré, Rohann Correa, Susan Chafe, Amit B. Shah, Jason A. Efstathiou, Karen E. Hoffman, M.A. Hallman, Michael Straza, Richard C. Jordan, Stephanie L. Pugh, Felix Y. Feng, Anant Madabhushi

Notice bibliographique

RevueThe Journal of Pathology · 2024
Typearticle
Langueen
DomaineMedicine
ThématiqueProstate Cancer Diagnosis and Treatment
Établissements canadiensLondon Health Sciences Centre
Organismes subventionnairesDOD Prostate Cancer Research ProgramNational Institute of Biomedical Imaging and BioengineeringDOD Peer Reviewed Cancer Research ProgramNational Cancer InstituteUniversity of Texas MD Anderson Cancer CenterAstraZenecaHelsingin YliopistoVarian Medical SystemsEmory UniversityNRG OncologyU.S. Department of Veterans Affairs
Mots-clésConvolutional neural networkProstate cancerDeep learningArtificial intelligenceProstateBiopsyMedicineCancerPathologyComputer scienceMachine learningRadiologyInternal medicine

Résumé

récupéré en direct d'OpenAlex

Abstract The presence, location, and extent of prostate cancer is assessed by pathologists using H&E‐stained tissue slides. Machine learning approaches can accomplish these tasks for both biopsies and radical prostatectomies. Deep learning approaches using convolutional neural networks (CNNs) have been shown to identify cancer in pathologic slides, some securing regulatory approval for clinical use. However, differences in sample processing can subtly alter the morphology between sample types, making it unclear whether deep learning algorithms will consistently work on both types of slide images. Our goal was to investigate whether morphological differences between sample types affected the performance of biopsy‐trained cancer detection CNN models when applied to radical prostatectomies and vice versa using multiple cohorts ( N = 1,000). Radical prostatectomies ( N = 100) and biopsies ( N = 50) were acquired from The University of Pennsylvania to train (80%) and validate (20%) a DenseNet CNN for biopsies (M B ), radical prostatectomies (M R ), and a combined dataset (M B+R ). On a tile level, M B and M R achieved F1 scores greater than 0.88 when applied to their own sample type but less than 0.65 when applied across sample types. On a whole‐slide level, models achieved significantly better performance on their own sample type compared to the alternative model ( p < 0.05) for all metrics. This was confirmed by external validation using digitized biopsy slide images from a clinical trial [NRG Radiation Therapy Oncology Group (RTOG)] (NRG/RTOG 0521, N = 750) via both qualitative and quantitative analyses ( p < 0.05). A comprehensive review of model outputs revealed morphologically driven decision making that adversely affected model performance. M B appeared to be challenged with the analysis of open gland structures, whereas M R appeared to be challenged with closed gland structures, indicating potential morphological variation between the training sets. These findings suggest that differences in morphology and heterogeneity necessitate the need for more tailored, sample‐specific (i.e. biopsy and surgical) machine learning models. © 2024 The Author(s). The Journal of Pathology published by John Wiley & Sons Ltd on behalf of The Pathological Society of Great Britain and Ireland.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction distillée sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.

score de la tête « metaresearch » (Codex)0,000
score de la tête « metaresearch » (Gemma)0,000
Version: codex-gemma-dda1882f352aStatut de validation: machine_predicted_unvalidated
Catégories candidatesaucune
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Autre devis · Signal consensuel: aucune
GenreSignal candidat: Empirique · Signal consensuel: Empirique
Score de désaccord entre enseignants0,923
Score d'incertitude au seuil0,173

Scores Codex et Gemma par catégorie

CatégorieCodexGemma
Métarecherche0,0000,000
Méta-épidémiologie (sens strict)0,0000,000
Méta-épidémiologie (sens large)0,0000,000
Bibliométrie0,0000,000
Études des sciences et des technologies0,0000,000
Communication savante0,0000,000
Science ouverte0,0000,000
Intégrité de la recherche0,0000,000
Charge utile insuffisante (le modèle a refusé de juger)0,0000,000

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,047
Tête enseignante GPT0,315
Écart entre enseignants0,269 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.

Les modèles n’ont appliqué aucune catégorie : rien dans la taxonomie ne correspondait à ce travail.
Devis d'étudeAutre devis
Domainenon disponible
GenreEmpirique

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations2
Publié2024
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revueThe Journal of PathologyMême sujetProstate Cancer Diagnosis and TreatmentTravaux en français237 207