Développement de méthodes d'apprentissage automatique pour l'estimation à long terme de la vitesse du vent dans des sites non echantillonés
Bibliographic record
Abstract
L’énergie éolienne représente une ressource durable, essentielle à la transition énergétique en cours. Son exploitation efficace repose sur une estimation précise de sa disponibilité à long terme, ce qui nécessite des données fiables sur les vitesses du vent. Lorsque ces données sont manquantes, il est nécessaire de recourir à des méthodes d’estimation basées sur des approches physiques, statistiques, ou hybrides. Plusieurs méthodes statistiques d’estimation de la vitesse ont été développées au fil des années. Il était donc utile de procéder à une revue exhaustive de ces approches afin d’identifier leurs forces, leurs limites et les axes d’amélioration possibles. Dans notre premier article, une revue de littérature offrant un aperçu complet de ces méthodes a été réalisée. Cette synthèse permet d’établir un cadre de référence pour le développement de nouvelles méthodologies pour l’estimation de la vitesse du vent. Le deuxième article compare six méthodes de sélection de variables explicatives pour l’interpolation spatiale de plusieurs quantiles de vitesse de vent au Canada. En considérant des quantiles associés à différentes probabilités de dépassement, cette étude permet non seulement d’identifier les variables explicatives les plus pertinentes, mais aussi d’analyser leur influence relative sur les différentes plages de vitesse du vent (faibles, moyennes ou élèves). Dans le troisième article de cette thèse, nous proposons une nouvelle approche non paramétrique pour estimer la distribution de probabilité des vitesses du vent aux sites non échantillonnés. Cette approche est recommandée dans les régions où la variabilité spatiale des régimes du vent est importante et où une seule famille de distribution peut ne pas être suffisamment flexible pour représenter cette variabilité. Les vitesses de vents issues des données de réanalyses sont couramment utilisées pour estimer le potentiel éolien aux sites non échantillonnés. Cependant, la résolution spatiale grossière de ces données, les rendent incapables de représenter avec précision les variations locales du relief et leur influence sur les vitesses de vent près du sol. Le quatrième article de cette thèse propose une étude comparative des méthodes de correction statistiques des vitesses du vent issues des données de réanalyse, incluant une nouvelle approche que nous avons développée. Des recommandations ont été formulées quant aux méthodes les plus adaptées selon les contextes d'application et les objectifs spécifiques des études réalisées. Un défi majeur des méthodes de correction existantes demeure l’amélioration de la variabilité temporelle des vitesses de vents estimées à partir des données de réanalyses. Le cinquième article introduit une nouvelle approche de correction basée sur l’apprentissage profond (Deep Learning). Cette méthode permet non seulement de corriger les biais systématiques, mais aussi d’améliorer significativement la variabilité temporelle des séries.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.004 | 0.014 |
| Meta-epidemiology (narrow) | 0.001 | 0.001 |
| Meta-epidemiology (broad) | 0.002 | 0.002 |
| Bibliometrics | 0.002 | 0.002 |
| Science and technology studies | 0.001 | 0.001 |
| Scholarly communication | 0.003 | 0.002 |
| Open science | 0.002 | 0.001 |
| Research integrity | 0.002 | 0.003 |
| Insufficient payload (model declined to judge) | 0.006 | 0.003 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".