Essays on Nowcasting : Machine learning, high-frequency data and nowcasting
Notice bibliographique
Résumé
Le COVID-19 a brutalement accéléré le besoin pour les acteurs des politiques publiques de disposer de données en temps réel sur l'activité économique. Cet événement a précipité l'aboutissement de recherches plus anciennes sur l'usage de méthodes nouvelles en économie, autour de l'apprentissage statistique et des big data. Car si les données massives créées et détenues par les entreprises contiennent de l'information en temps réel sur l'économie, leur traitement requiert une approche particulière qui s'appuie des algorithmes d'apprentissage non-linéaires.Les présentes recherches introduisent le OECD Weekly Tracker, un outil de suivi de l'activité économique qui fournit des estimations du PIB hebdomadaire de 48 pays en temps réel. Il s'appuie sur les données Google Trends, lesquelles renseignent l'évolution des sujets d'intérêts des utilisateurs de Google Search, un moteur de recherche. La principale innovation méthodologique tient à la mise en place d'un modèle de panel non-linéaire. Un réseau de neurones modélise conjointement la relation entre le PIB et les données Google Trends pour 48 pays, tout en autorisant l'existence de disparités entre les pays dans cette relation.Le Weekly Tracker est mis à jour chaque semaine depuis l'été 2020. Par suite, l'analyse de sa performance historique montre que ses prévisions étaient plus fiables que celles de l'Economic Outlook, publication phare de l'OCDE, durant les années de pandémie. En étudiant les nombreuses publications presse citant les chiffres du Weekly Tracker, on montre également que cet outil a fourni des indications qui étaient qualitativement justes et pertinentes pour aiguiller la prise de décision publique.La pertinence politique du Weekly Tracker tient au fait qu'il est publié en temps réel tout autant qu'à la production d'estimations du PIB hebdomadaires. Les séries disponibles depuis 2004 permettent d'enrichir l'analyse retrospective des politiques en exploitant des méthodes d'identification statistique haute fréquence. Le Tracker est utilisé dans un article paru dans la revue Nature Communications, qui étudie les conséquences de l'introduction du pass sanitaire en France, en Italie et en Allemagne. Entre autres, celui-ci révèle que l'effort de vaccination était positivement corrélé à la croissance économique, et que le pass sanitaire a permis de gagner 6 milliards d'euros de PIB en France, et respectivement 1.4 et 2.1 milliards d'euros en Allemagne et en Italie.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,004 | 0,026 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,002 | 0,005 |
| Études des sciences et des technologies | 0,001 | 0,004 |
| Communication savante | 0,006 | 0,008 |
| Science ouverte | 0,001 | 0,002 |
| Intégrité de la recherche | 0,004 | 0,006 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,009 | 0,004 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».