MétaCan
Menu
Retour à la cohorte
Enregistrement W4377019721 · doi:10.3390/pr11051551

Impact of Data Grouping on the Multivariate Analysis of Several Concrete Plants

2023· article· en· W4377019721 sur OpenAlexafffundabout
Malika Perluzzi, William Wilson, Ryan Gosselin

Notice bibliographique

RevueProcesses · 2023
Typearticle
Langueen
DomaineChemistry
ThématiqueSpectroscopy and Chemometric Analyses
Établissements canadiensUniversité de Sherbrooke
Organismes subventionnairesMitacs
Mots-clésPrincipal component analysisCollinearityRaw dataMultivariate statisticsComputer scienceBlocking (statistics)Data miningBlock (permutation group theory)NoveltyMultivariate analysisProcess (computing)Data analysisFactory (object-oriented programming)Dimension (graph theory)Curse of dimensionalityStatisticsMathematicsArtificial intelligenceMachine learning

Résumé

récupéré en direct d'OpenAlex

Multivariate analysis can be used to study industrial process data exhibiting collinearity between variables. Such data can often be collected into conceptually meaningful groups or blocks. While data blocks may appear intuitive (e.g., raw material properties vs. process parameters), such blocking is sometimes much more subjective. The novelty of this work lies in the investigation of the impact of data blocking on the subsequent analysis. To our knowledge, no such investigation can be found in the literature. To fill this gap, we analyze the impact of grouping data from 10 Canadian concrete plants in which multiple blocking alternatives are considered. The analysis is performed via principal component analysis (PCA) to reduce the dimensionality of the matrix and also via consensus principal component analysis (CPCA). The data grouping options are as follows: (1) all data combined into a single block, (2) grouped according to the factory, (3) grouped according to parameter type, and (4) grouped according to parameter type within each factory. The results show that the grouping strategy alters the conclusion by emphasizing specific aspects of the data. While some grouping options emphasized seasonal variations, others emphasized other characteristics in the data, such as step changes in processing regimes or the significant impact of the raw materials’ moisture on the process. As such, it appears relevant to consider multiple blocking options when analyzing complex datasets. Doing so will give the analyst a better understanding of overarching trends and more subtle characteristics of the dataset.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction distillée sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.

score de la tête « metaresearch » (Codex)0,000
score de la tête « metaresearch » (Gemma)0,001
Version: codex-gemma-dda1882f352aStatut de validation: machine_predicted_unvalidated
Catégories candidatesaucune
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Expérimental (laboratoire) · Signal consensuel: aucune
GenreSignal candidat: Empirique · Signal consensuel: Empirique
Score de désaccord entre enseignants0,435
Score d'incertitude au seuil0,974

Scores Codex et Gemma par catégorie

CatégorieCodexGemma
Métarecherche0,0000,001
Méta-épidémiologie (sens strict)0,0000,000
Méta-épidémiologie (sens large)0,0000,000
Bibliométrie0,0000,003
Études des sciences et des technologies0,0000,000
Communication savante0,0000,000
Science ouverte0,0010,000
Intégrité de la recherche0,0000,000
Charge utile insuffisante (le modèle a refusé de juger)0,0010,000

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,090
Tête enseignante GPT0,381
Écart entre enseignants0,291 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.

Les modèles n’ont appliqué aucune catégorie : rien dans la taxonomie ne correspondait à ce travail.
Devis d'étudeExpérimental (laboratoire)
Domainenon disponible
GenreEmpirique

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations1
Publié2023
Routes d'admission3
Résumé présentoui

Explorer davantage

Même revueProcessesMême sujetSpectroscopy and Chemometric AnalysesTravaux en français237 207