MétaCan
Menu
Retour à la cohorte
Enregistrement W7132957422

Advanced Machine Learning Techniques for Survival Analysis in Medical Data

2025· dissertation· W7132957422 sur OpenAlexfundno aff
Hamed Shourabizadeh

Notice bibliographique

RevueTSpace · 2025
Typedissertation
Langue
DomaineComputer Science
ThématiqueImbalanced Data Classification Techniques
Établissements canadiensnon disponible
Organismes subventionnairesUniversity of Toronto
Mots-clésSurvival analysisProportional hazards modelRandom forestSurvival rateOverall survivalBinary classificationBone marrow transplantEnsemble learning
DOInon disponible

Résumé

récupéré en direct d'OpenAlex

Survival analysis is critical in many fields, particularly in healthcare, to guide medical decisions. Traditional methods like Kaplan-Meier (KM) and Cox proportional hazards (Cox) models, which generate survival curves, have limitations for long-term predictions due to their population-level assumptions. Advances in machine learning (ML) offer improved survival predictions. We apply ML models in survival prediction with three primary goals: 1) identify risk groups, 2) determine significant variables in patient survival, and 3) accurately predict long-term survival. Using binary classification to predict t-period survival, we identify risk groups and propose a novel integrated variable importance analysis using ensemble techniques and statistical analysis to highlight essential variables. Our framework is tested on bone marrow transplant (predicting 100-day to 5-year survival) and liver transplant (predicting 20-year to 30-year survival) datasets, showing improved AUCs compared to conventional models. While bone marrow transplant risk groups are statistically stratified (p-value < 0.001), liver transplant groups, though visually stratified, are not statistically significant (p-value > 0.05), indicating limited long-term survival applicability of ML classification models, even those designed for survival predictions like random survival forest (RSF). To enhance long-term survival prediction, we introduce classification-augmented survival estimation (CASE), a framework treating survival as a classification task that produces survival curves. Using dataset augmentation, CASE addresses class imbalance and offers accurate survival time predictions. Applied to a liver transplant case study, CASE improved AUCs from 0.69 to 0.88 and F1 scores from 0.32 to 0.73. Compared to KM, Cox, and RSF models, CASE showed better performance across survival metrics, including our novel metric, the mean of individual areas under the survival curve (mAUSC). We also developed temporal feature importance methods to reveal how feature significance varies over time, providing actionable insights for real-world survival problems. Sağkalım analizi, özellikle sağlık alanında tıbbi kararları yönlendirmek için birçok alanda kritik öneme sahiptir. Kaplan-Meier (KM) ve Cox orantılı risk (Cox) modelleri gibi geleneksel yöntemler, sağkalım eğrileri oluştururken popülasyon düzeyindeki varsayımlarına dayandığıdan uzun vadeli tahminlerde iyi performans gösterememektedir. Makine öğrenmesi (ML) alanındaki ilerlemeler, sağkalım tahminlerini iyileştirme imkanı sunmaktadır. Bu çalışmada, ML modellerini sağkalım tahmininde üç ana amaçla uyguluyoruz: 1) Risk gruplarını belirlemek, 2) Hasta sağkalımında önemli değişkenleri belirlemek ve 3) Uzun vadeli sağkalımı doğru bir şekilde tahmin etmek. T-periyot sağkalımını tahmin etmek için ikili sınıflandırma kullanarak risk gruplarını belirliyoruz. Temel değişkenleri vurgulamak için topluluk teknikleri ve istatistiksel analiz kullanılarak entegre bir değişken önem analizi öneriyoruz. Bu yaklaşım, kemik iliği nakli (100 günlükten 5 yıla kadar sağkalımı tahmin eden) ve karaciğer nakli (20 yıllık ve 30 yıllık sağkalımı tahmin eden) veri setlerinde test edilmiş ve geleneksel modellere kıyasla AUC’lerde önemli iyileşmeler göstermektedir. Kemik iliği nakli risk grupları istatistiksel olarak anlamlı bir şekilde ayrılmıştır (p-değeri < 0,001), ancak karaciğer nakli grupları görsel olarak ayrılmış olmasına rağmen istatistiksel olarak anlamlı ayrılmamaktadır (p-değeri > 0,05). Bu durum, random survival forest (RSF) gibi sağkalım tahminleri için tasarlanmış modeller de dahil olmak üzere, ML sınıflandırma modellerinin uzun vadeli sağkalım tahminlerindeki sınırlılığını göstermektedir. Uzun vadeli sağkalım tahminini geliştirmek için sağkalımın bir sınıflandırma görevi olarak ele alındığı ve sağkalım eğrileri üreten sınıflandırma destekli sağkalım tahmini (CASE) adlı bir çerçeve sunuyoruz. Veri seti artırımı kullanılarak CASE, sınıf dengesizliğini ele alır ve doğru sağkalım süresi tahminleri sunar. Karaciğer nakli örnek çalışmasında uygulanan CASE, AUC’leri 0,69’dan 0,88’e ve F1 skorlarını 0,32’den 0,73’e yükseltmiştir. KM, Cox ve RSF modelleri ile karşılaştırıldığında, CASE, bireysel sağkalım eğrisi altındaki alanların ortalaması (mAUSC) adlı yeni bir metriğimiz de dahil olmak üzere sağkalım metrikleri açısından daha iyi performans göstermiştir. Son olarak, gerçek dünyadaki sağkalım problemleri için uygulanabilir öngörüler sağlayan, zaman içinde değişken öneminin nasıl değiştiğini ortaya koyan geçici özellik önem yöntemleri de sunmaktayız.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction distillée sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.

score de la tête « metaresearch » (Codex)0,004
score de la tête « metaresearch » (Gemma)0,005
Version: codex-gemma-dda1882f352aStatut de validation: machine_predicted_unvalidated
Catégories candidatesMéta-épidémiologie (sens strict), Science ouverte
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Autre devis · Signal consensuel: aucune
GenreSignal candidat: Méthodes · Signal consensuel: Méthodes
Score de désaccord entre enseignants0,957
Score d'incertitude au seuil0,999

Scores Codex et Gemma par catégorie

CatégorieCodexGemma
Métarecherche0,0040,005
Méta-épidémiologie (sens strict)0,0010,001
Méta-épidémiologie (sens large)0,0020,000
Bibliométrie0,0020,006
Études des sciences et des technologies0,0000,000
Communication savante0,0000,001
Science ouverte0,0080,002
Intégrité de la recherche0,0010,002
Charge utile insuffisante (le modèle a refusé de juger)0,0000,000

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,050
Tête enseignante GPT0,415
Écart entre enseignants0,366 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.

Devis d'étudeAutre devis
Domainenon disponible
GenreMéthodes

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2025
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revueTSpaceMême sujetImbalanced Data Classification TechniquesTravaux en français237 207