MétaCan
Menu
← Retour à la cohorte
Enregistrement W7037356780

Données de panel d'enquête dans le contexte d'un processus de renouvellement alterné tronqué et censuré par intervalle

2023· other· fr· W7037356780 sur OpenAlexaboutno aff

Notice bibliographique

RevueArchipelago (University of Quebec in Montreal) · 2023
Typeother
Languefr
DomaineEarth and Planetary Sciences
ThématiquePaleontology and Stratigraphy of Fossils
Établissements canadiensnon disponible
Organismes subventionnairesnon disponible
Mots-clésContext (archaeology)Sampling errorStatistical analysis
DOInon disponible

Résumé

récupéré en direct d'OpenAlex

Modèles statistiques décrivant différents états d’un processus ainsi que les différentes transitions possibles entre ces états, les modèles multi-états sont utiles, par exemple, pour les mesures répétées dans le temps et les données longitudinales. Un cas particulier est le processus de renouvellement alterné dans lequel l’individu pivote entre deux états (0 et 1, Sain et Malade, ou Chômage et Emploi comme dans notre cas de figure). Le sujet de la présente recherche est motivée par des données d’enquête par panel telles que l’Enquête sur la dynamique du travail et du revenu (EDTR), une enquête de Statistique Canada, qui suit les individus du début du panel à la fin de celui-ci. Enquête longitudinale à participation volontaire, l’EDTR est composée de deux panels dont les individus transitent entre chômage et emploi et sont suivis sur une durée de six ans consécutifs avec pour objectif de comprendre le bien-être économique des Canadiens et les changements ayant des incidences dans le temps sur leurs conditions de vie. Les données, parfois collectées rétroactivement avant le début du panel, emmènent des défis quant aux dates de début et de fin des périodes de temps. Dans un processus de renouvellement alterné censuré par intervalle PRACI (window censored alternating renewal process WCARP), les bornes supérieure et inférieure interceptent la première durée de séjour observée ainsi que la dernière durée de séjour observée respectivement. Motivé par différentes approches vues dans la littérature, dans ce mémoire nous développons trois fonctions de vraisemblance dans les situations suivantes : 1. lorsqu’aucune donnée de temps de début de la période n’est collectée avant l’entrée dans le panel : la première durée de séjour est incomplète. Dans cette approche, elle est supprimée. La dernière durée de séjour observée est traitée en utilisant la censure à droite ; 2. lorsque les dates de début des périodes de temps sont collectées avant introduction dans le panel : de ce fait, nous connaissons la valeur complète de la première durée de séjour observée dans le panel. Une approche conditionnelle est utilisée pour ces premiers temps de séjour ; et à nouveau une censure à droite est utilisée pour les dernières périodes incomplètes de l’intervalle ; 3. lorsqu’aucune donnée n’est collectée avant le début du panel, au lieu de « jeter » les premières périodes (comme dans la première approche), en supposant la stationnarité, nous incluons ces périodes incomplètes dans notre approche ; puis traitons à nouveau la dernière période incomplète en utilisant encore une censure à droite. L’EDTR produit un ensemble de données très complexe qui comprend une pondération pour différents échantillons. Une description en détail et une présentation de quelques données tabulaires non pondérées de l’EDTR (tout en mettant l’accent sur les temps de transition manquants) ainsi que la description de bon nombre de difficultés provenant de l’ensemble de données lors de l’analyse des périodes de chômage et d’emploi est faite. Dans une étude de simulation, nous générons un jeu de données semblables à celles de l’EDTR puis nous estimons, dans chacune des trois méthodes décrites plus haut, les paramètres des lois ayant permis de générer cet échantillon. Dans cette étude, nous faisons varier différents paramètres tels que la largeur de la fenêtre d’observation et la taille de l’échantillon. D’autres paramètres comme le taux de chômage et les paramètres des fonctions permettant la génération des durées ont été fixés. Une réplication de 100 fois chaque situation a permis d’obtenir les résultats qui sont présentés dans le Chapitre 4. Dans ce mémoire est apporté un traitement à l’une parmi les nombreuses complexités présentées par les données de panel d’enquête en général et par l’EDTR en particulier qui a motivé ce travail. _____________________________________________________________________________ MOTS-CLÉS DE L’AUTEUR : modèles multi-états, processus de renouvellement alterné, enquêtes longitudinales, panel, EDTR, vraisemblances, EMV, chaîne continue de Markov homogène, stationnarité, optimisation, simulation Monte Carlo

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction machine sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.

score de la tête « metaresearch » (Codex)0,020
score de la tête « metaresearch » (Gemma)0,074
Version: metacan-v3-hybrid-931329e0061cStatut de validation: machine_predicted_unvalidated
Catégories candidatesaucune
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Simulation ou modélisation · Signal consensuel: aucune
GenreSignal candidat: Méthodes · Signal consensuel: Méthodes
Score de désaccord entre enseignants0,074
Score d'incertitude au seuil0,148

Scores du classifieur distillé par catégorie (deux têtes)

CatégorieCodexGemma
Métarecherche0,0200,074
Méta-épidémiologie (sens strict)0,0010,001
Méta-épidémiologie (sens large)0,0020,003
Bibliométrie0,0020,007
Études des sciences et des technologies0,0020,001
Communication savante0,0040,003
Science ouverte0,0030,002
Intégrité de la recherche0,0020,003
Charge utile insuffisante (le modèle a refusé de juger)0,0290,005

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,020
Tête enseignante GPT0,201
Écart entre enseignants0,181 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.

Les modèles n’ont appliqué aucune catégorie : rien dans la taxonomie ne correspondait à ce travail.
Devis d'étudeSimulation ou modélisation
Domainenon disponible
GenreMéthodes

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2023
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revueArchipelago (University of Quebec in Montreal)→Même sujetPaleontology and Stratigraphy of Fossils→Travaux en français237 207→