Principal component analysis based feature extraction methods applied to biomedical and communication network data
Notice bibliographique
Résumé
This thesis focuses on the development of multi-variate feature extraction methods and their applications to biomedical signals, communication networks and other types of multi-scale data. Three new feature extraction methods are examined. The first is a multi-scale principal component analysis (PCA) method, which combines discrete wavelet transform and PCA for feature extraction of multi-variate signals in both spatial and temporal domains. The second one is a multi-scale wavelet kernels to kernel PCA (KPCA) as a feature extraction method for multi-scale data classification problems. Finally, a modified dynamic PCA method is proposed for feature extraction of long-period univariate time series data in classification and event detection problems. The multi-scale PCA feature extraction method for signal classification is illustrated by applying it to EEG data. This method is also applicable to communication networks data. The feature extraction method via multi-scale wavelet kernels for KPCA is explored using simulated clustered data sets and concentric circle data sets. The feature extraction method via modified dynamic PCA is tested on EEG data to help diagnose epilepsy and to detect onset of epileptic seizures. Additionally, the statistical analysis of communication network data in order to improve quality of service by better understanding the dynamics of number of packets in transit (NPT) is carried out. Our study shows that feature extraction by multi-scale PCA leads to a high classification accuracy for data that appears to be functional in the Fourier feature space. This methodology enables extraction of feature information in both spatial and temporal domains of multi-variate signals. The multi-scale wavelet kernel makes kernel PCA a more robust method for transforming data and enables it to perform well in extracting data features. This methodology is potentially useful for spatial event cluster detection problems. The study of diagnosing epilepsy, of detecting epileptic seizures, and of detecting network load increase suggests that the modified dynamic PCA methodology and its associated detection schemes are very promising in analyzing these type of data because of the low type I error and high value of power of the test statistic.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,002 | 0,006 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,000 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,003 | 0,005 |
| Études des sciences et des technologies | 0,000 | 0,001 |
| Communication savante | 0,002 | 0,001 |
| Science ouverte | 0,001 | 0,001 |
| Intégrité de la recherche | 0,001 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,002 | 0,002 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».