Essays on Nowcasting : Machine learning, high-frequency data and nowcasting
Bibliographic record
Abstract
Le COVID-19 a brutalement accéléré le besoin pour les acteurs des politiques publiques de disposer de données en temps réel sur l'activité économique. Cet événement a précipité l'aboutissement de recherches plus anciennes sur l'usage de méthodes nouvelles en économie, autour de l'apprentissage statistique et des big data. Car si les données massives créées et détenues par les entreprises contiennent de l'information en temps réel sur l'économie, leur traitement requiert une approche particulière qui s'appuie des algorithmes d'apprentissage non-linéaires.Les présentes recherches introduisent le OECD Weekly Tracker, un outil de suivi de l'activité économique qui fournit des estimations du PIB hebdomadaire de 48 pays en temps réel. Il s'appuie sur les données Google Trends, lesquelles renseignent l'évolution des sujets d'intérêts des utilisateurs de Google Search, un moteur de recherche. La principale innovation méthodologique tient à la mise en place d'un modèle de panel non-linéaire. Un réseau de neurones modélise conjointement la relation entre le PIB et les données Google Trends pour 48 pays, tout en autorisant l'existence de disparités entre les pays dans cette relation.Le Weekly Tracker est mis à jour chaque semaine depuis l'été 2020. Par suite, l'analyse de sa performance historique montre que ses prévisions étaient plus fiables que celles de l'Economic Outlook, publication phare de l'OCDE, durant les années de pandémie. En étudiant les nombreuses publications presse citant les chiffres du Weekly Tracker, on montre également que cet outil a fourni des indications qui étaient qualitativement justes et pertinentes pour aiguiller la prise de décision publique.La pertinence politique du Weekly Tracker tient au fait qu'il est publié en temps réel tout autant qu'à la production d'estimations du PIB hebdomadaires. Les séries disponibles depuis 2004 permettent d'enrichir l'analyse retrospective des politiques en exploitant des méthodes d'identification statistique haute fréquence. Le Tracker est utilisé dans un article paru dans la revue Nature Communications, qui étudie les conséquences de l'introduction du pass sanitaire en France, en Italie et en Allemagne. Entre autres, celui-ci révèle que l'effort de vaccination était positivement corrélé à la croissance économique, et que le pass sanitaire a permis de gagner 6 milliards d'euros de PIB en France, et respectivement 1.4 et 2.1 milliards d'euros en Allemagne et en Italie.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.004 | 0.026 |
| Meta-epidemiology (narrow) | 0.001 | 0.001 |
| Meta-epidemiology (broad) | 0.001 | 0.001 |
| Bibliometrics | 0.002 | 0.005 |
| Science and technology studies | 0.001 | 0.004 |
| Scholarly communication | 0.006 | 0.008 |
| Open science | 0.001 | 0.002 |
| Research integrity | 0.004 | 0.006 |
| Insufficient payload (model declined to judge) | 0.009 | 0.004 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".