A Fully Automated, Data-Driven Approach for Dimensionality Reduction and Clustering in Single-Cell RNA-seq Analysis
Notice bibliographique
Résumé
Abstract Single-cell RNA sequencing (scRNA-seq) provides deep insights into cellular heterogeneity but demands robust dimensionality reduction (DR) and clustering to handle high-dimensional, noisy data. Many DR and clustering approaches rely on user-defined parameters, undermining reliability. Even automated clustering methods like ChooseR and MultiK still employ fixed principal component defaults, limiting their full automation. To overcome this limitation, we propose a fully automated clustering approach by integrating scLENS—a method for optimal PC selection—with these tools. Our fully automated approach improves clustering performance by ∼14% for ChooseR and ∼10% for MultiK and identifies additional cell subtypes, highlighting the advantages of adaptive, data-driven DR. Highlights Fully automated, data-driven clustering pipeline for scRNA-seq analysis. Addresses the limitation of fixed principal component defaults in DR. Data-driven pipeline improves clustering performance by 10-14%. Performance gains are most pronounced on high-sparsity, high-skewness data. Author Summary A fundamental goal in modern biology is to create detailed cellular maps of complex tissues to understand their function in health and disease. Achieving this level of detail is now possible through single-cell sequencing, a technology that generates massive, high-dimensional, and noisy datasets of individual cells’ genetic profiles. However, accurately identifying cell-types from these datasets remains a major analytical hurdle, as current computational methods rely on subjective parameters that compromise reliability and reproducibility. To address this challenge, we developed a fully automated pipeline that integrates scLENS, an adaptive noise filtering method, with automated cell grouping tools. By providing optimal parameters for noise filtering and cell grouping, our pipeline eliminates their reliance on subjective, fixed parameters, thereby significantly improving accuracy in cell-type classification. This tool, characterized by its high clustering efficiency, can accelerate discoveries in fields like cancer biology and immunology by providing a robust and reproducible analytical platform.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,003 | 0,006 |
| Méta-épidémiologie (sens strict) | 0,002 | 0,001 |
| Méta-épidémiologie (sens large) | 0,002 | 0,003 |
| Bibliométrie | 0,002 | 0,002 |
| Études des sciences et des technologies | 0,002 | 0,001 |
| Communication savante | 0,003 | 0,001 |
| Science ouverte | 0,003 | 0,003 |
| Intégrité de la recherche | 0,001 | 0,003 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,005 | 0,006 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».