MétaCan
Menu
← Retour à la cohorte
Enregistrement W7038634991

Intégration des données manquantes en vue de la prédiction des événements de givre et de verglas

2008· other· fr· W7038634991 sur OpenAlexvenueaboutno aff

Notice bibliographique

RevueLibrary and Archives Canada (Government of Canada) · 2008
Typeother
Languefr
DomaineEnvironmental Science
ThématiqueAmphibian and Reptile Biology
Établissements canadiensnon disponible
Organismes subventionnairesnon disponible
Mots-clésContext (archaeology)LimitingFilter (signal processing)
DOInon disponible

Résumé

récupéré en direct d'OpenAlex

Les matériaux soumis à des conditions climatiques hivernales sont susceptibles de recevoir une accumulation de glace qui peut nuire à leur intégrité ou à leur fonctionnement. L'étude des phénomènes de glace atmosphérique cherche à développer une connaissance qui permettrait de prévoir et d'estimer les dangers d'un événement afin de prendre les mesures appropriées. Des recherches sont effectuées à cet effet. Cependant, aucune étude pour traiter les données manquantes n'a encore été amorcée. Or, l'intégration de ces types de données est nécessaire pour tenir compte des données disponibles et élargir le champ de vision en ce qui concerne le développement de modèle de prédiction des événements de givre et de verglas. \n \nLe présent travail s'inscrit dans le cadre de l'analyse et de l'exploitation des données recueillies par le système d'acquisition de données SYGIVRE. En résumé, on a pu collecter des données provenant de 35 stations de mesure lors de la saison 2001-2002 et pour la saison 2003- 2004, on a compté 32 stations. Ces données provenant des sites naturels ont été traitées afin de créer une base de données des tempêtes de givre et de verglas pour ces saisons d'observation. Les informations disponibles grâce à ce système sont l'ensemble des relevés horaires des valeurs des températures de l'air et des signaux des givromètres. \n \nAfin de construire une base d'apprentissage pour le modèle de prédiction des poids d'accumulation de givre et de verglas et de retracer les tempêtes de givre et de verglas répertoriées dans la base de données SYGIVRE, un processus de modélisation des données a été amorcé. Ceci consiste en premier lieu à la recherche de méthodologie pour identifier les événements élémentaires de givre et de verglas. Ensuite, les types d'accumulation sont déterminés selon leurs caractéristiques. En tenant compte de ces types d'accumulation, une procédure basée sur l'algorithme 9-23 a été proposée pour estimer les taux d'accrétions horaires de givre et de verglas. Ceci a permis l'évaluation de leurs poids d'accumulation au fil des heures. Par la suite, on a défini la notion de tempête avant de proposer une méthode pour répertorier les tempêtes ou événements de givre et de verglas lors des saisons 2001-2002 et 2003-2004. Ce processus de modélisation de la base de données SYGIVRE se termine par le regroupement des stations de mesure. Selon les localités de ces dernières, on a distingué la région de Montréal- Québec, celle du Saguenay - Lac-Saint-Jean et celle de la Côte-Nord. D'après les résultats d'analyse des données, on a recensé 507 tempêtes de givre et de verglas. Ces tempêtes s'étendent dans l'ensemble sur une période de 3948 heures et le cumulatif du nombre de signaux de givromètre enregistrés est égal à 9167 coups. Il a été remarqué que la durée moyenne d'une tempête est égale à 8 heures et on enregistre 18 signaux de givromètre durant son occurrence. \n \nAprès avoir modélisé la base de données SYGIVRE, nous avons amorcé le développement du modèle de prédiction des poids d'accumulation de givre et de verglas lors des tempêtes identifiées par la première phase de ce travail. Nous avons choisi une architecture de réseau de neurones multicouche à rétropropagation de l'erreur. Étant donné que nous n'avons pas suffisamment de données pour effectuer l'apprentissage de ce modèle, une simulation de données de givrage atmosphérique a été effectuée pour le valider avant de le tester avec les données de la base de données SYGIVRE. La principale raison d'utilisation de ces données simulées est le fait que des tests directs sur les données réelles ne nous assurent pas la validité du modèle de prédiction quand une partie des données est manquante. Ainsi, ces tests préliminaires nous permettront d'estimer la performance du modèle de réseau de neurones. De plus, cette simulation de données virtuelles permet non seulement de générer des données statistiquement proches des données réelles mais aussi d'avoir une représentation du phénomène de givrage atmosphérique. \n \nEn vue de poursuivre l'objectif à atteindre, une méthodologie a été élaborée afin d'intégrer les données manquantes au modèle de prédiction. En principe, toutes les observations doivent être complètes pour les deux phases de développement de réseau de neurones: apprentissage et prévision. Ces conditions ne sont pas respectées quand des valeurs sont manquantes à une ou plusieurs stations de mesure. Pour pallier ces problèmes, l'applicabilité des méthodes statistiques d'imputations a été étudiée. Trois types de données manquantes ont été considérés dans cette étude: des données manquantes au hasard, des données manquantes complètement au hasard et les autres types de données manquantes. Ainsi, des méthodes de remplacement de données ont été réalisées pour chaque groupe de stations et ont permis d'estimer des valeurs manquantes pour des courtes périodes d'observation. En ce qui concerne la résolution du problème causé par la présence de saisons manquantes, nous avons introduit la technique d'inhibition des cellules du réseau de neurones pour adapter l'algorithme d'apprentissage à ces lacunes de données. \n \nLors des expériences, plusieurs configurations du modèle de prédiction ont été utilisées en variant les paramètres du réseau de neurones. Ces paramètres sont le nombre de cellules dans la couche cachée, le taux d'apprentissage et le moment d'apprentissage. D'après les résultats obtenus, on démontre que la technique d'inhibition de réseaux de neurones permet d'intégrer les valeurs manquantes pour la prédiction des événements de givre et de verglas. Les tests sur les données simulées, avec et sans données manquantes, ont fait ressortir deux modèles de prédiction qui ont sensiblement les mêmes performances et qui sont fonctionnels par rapport à la prévision des tempêtes de givre et de verglas. Toutefois, quand on a varié les paramètres du modèle, on a remarqué que ce dernier ne fournit pas toujours les résultats escomptés vis-à-vis de toutes les stations composant le groupe étudié. En ce qui concerne les tests sur les données du groupe du Saguenay - Lac-Saint-Jean, les mêmes constatations ont été observées. En effet, la présence de saison manquante au niveau d'une des stations composant ce groupe n'empêche pas le modèle étudié de prédire correctement les événements de givre et de verglas aux autres stations. En résumé, les résultats des validations des modèles de prédiction des événements de givre et de verglas nous amènent à affirmer que la combinaison des méthodes d'imputation statistiques et la technique d'inhibition du réseau de neurones lors de la phase d'apprentissage permettent d'intégrer les données manquantes dans l'étude de ce phénomène. Ces modèles de prédiction sont fonctionnels et affichent de bons résultats de prédiction lorsque leurs paramètres sont bien calibrés. En effet, les perturbations engendrées par les données manquantes sont insignifiantes d'après la validation des modèles avec les données simulées et avec les données du groupe de stations de la région du Saguenay - Lac-Saint-Jean. Par ailleurs, on a constaté que ces modèles sont instables avec la variation des paramètres d'apprentissage du réseau de neurones. Cette étude a apporté des éléments de réponses aux problèmes impliqués par la présence des lacunes au niveau de la base de données SYGIVRE. De plus, elle contribue à la compréhension des problèmes reliés au suivi des événements de givre et de verglas par les interrogations qu'elle soulève et le besoin de les étudier.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction machine sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.

score de la tête « metaresearch » (Codex)0,004
score de la tête « metaresearch » (Gemma)0,013
Version: metacan-v3-hybrid-931329e0061cStatut de validation: machine_predicted_unvalidated
Catégories candidatesaucune
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Simulation ou modélisation · Signal consensuel: aucune
GenreSignal candidat: Méthodes · Signal consensuel: aucune
Score de désaccord entre enseignants0,038
Score d'incertitude au seuil0,076

Scores du classifieur distillé par catégorie (deux têtes)

CatégorieCodexGemma
Métarecherche0,0040,013
Méta-épidémiologie (sens strict)0,0010,001
Méta-épidémiologie (sens large)0,0010,002
Bibliométrie0,0030,004
Études des sciences et des technologies0,0010,001
Communication savante0,0070,005
Science ouverte0,0020,002
Intégrité de la recherche0,0020,002
Charge utile insuffisante (le modèle a refusé de juger)0,0230,005

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,003
Tête enseignante GPT0,159
Écart entre enseignants0,156 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.

Les modèles n’ont appliqué aucune catégorie : rien dans la taxonomie ne correspondait à ce travail.
Devis d'étudeSimulation ou modélisation
Domainenon disponible
GenreMéthodes

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2008
Routes d'admission2
Résumé présentoui

Explorer davantage

Même revueLibrary and Archives Canada (Government of Canada)→Même sujetAmphibian and Reptile Biology→Travaux en français237 207→