SMALL AREA ESTIMATION: A BUSINESS SURVEY APPLICATION
Notice bibliographique
Résumé
Statistics Canada’s Survey of Employment, Payrolls and Hours (SEPH) combines data from a monthly payroll survey with administrative data from the Canada Revenue Agency (CRA). Using this administrative data allows SEPH to produce estimates for domains with small sample sizes. SEPH is currently investigating regression composite estimation as a means to further improve the efficiency of its estimates. Despite these efforts, there are still domains of interest for which reliable estimates can not be produced. In this presentation we propose an estimator that combines small area estimation methods with the regression composite estimator and illustrate it using data from SEPH. RESUME L’Enquete sur l’emploi, la remuneration et les heures de travail (EERH) de Statistiques Canada combine des donnees issues d’une enquete mensuelle sur la remuneration et des donnees administratives de l’Agence du revenu du Canada (ARC). En utilisant ces donnees, l’EERH peut produire des estimations – relativement aux domaines – en prenant des echantillons de petite taille. L’EERH evalue presentement l’estimateur composite de regression afin de determiner s’il permettrait d’augmenter la precision de ses estimations. En depit de ces efforts, il reste des domaines d’interet pour lesquels on ne dispose d’aucun estimateur fiable. Cette presentation se penche sur un estimateur qui allie les methodes d’estimation de petits domaines a celles de l’estimateur composite de regression. Les donnees de l’EERH serviront d’etalon pour l’evaluation de cet estimateur. MOTS CLES : Modele transversal et de series chronologiques; MPLSBE Statistics Canada’s Survey of Employment, Payrolls and Hours (SEPH) is a monthly survey designed to produce estimates of levels and monthtomonth trends of payrolls, employment, paid hours and earnings. The target population is composed of all employees in Canada except for those in a few select industries (ex. agriculture, fishing and trapping, etc.). The survey makes extensive use of administrative data with the aid of a monthly survey. The administrative source is the Canada Revenue Agency’s (CRA) Payroll Deduction Accounts (PD7) file, which includes the number of employees and the gross monthly payroll for the approximately 1 million employers in Canada. The administrative data is combined with data from the monthly Business Payroll Survey (BPS) through the use of the Generalized Regression (GREG) estimator. Taking advantage of the administrative data has allowed SEPH to produce quality estimates at a moderately detailed industry by province level. However, data users are asking for levels of detail for which the SEPH sample is unable to support estimates of reliable quality. To address these demands, SEPH is investigating the use of small area estimation techniques which would produce quality estimates at domains where there are very few sampled units.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,007 | 0,041 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,003 | 0,007 |
| Études des sciences et des technologies | 0,001 | 0,000 |
| Communication savante | 0,002 | 0,001 |
| Science ouverte | 0,001 | 0,001 |
| Intégrité de la recherche | 0,001 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,016 | 0,003 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».