Estimation en présence de données incohérentes : étude de l'impact des biais de déclaration d'âge à l'initiation de la consommation de substances psychoactives à partir de données longitudinales
Notice bibliographique
Résumé
Les données d’enquêtes jouent un rôle primordial dans la production scientifique en sciences sociales. Cependant, la présence de biais dans les données au moment de la collecte, y compris les erreurs de réponse et de non-réponse, pourrait affecter la fiabilité des résultats obtenus. Bien que le problème des erreurs de réponse et de non-réponse soit largement discuté, la littérature existante s’intéresse peu aux mécanismes par lesquels ces erreurs influencent les mesures estimées. Par conséquent, l’objectif principal de cette thèse est d’apporter une contribution méthodologique à la compréhension des estimations d’enquêtes en présence de données erronées et manquantes, en déterminant leur part explicative dans les modèles estimés. À l’aide de deux mesures répétées de l’âge de la première consommation de substances psychoactives recueillies par l’ELNEJ (1994-2009) auprès de jeunes Canadiens à l’âge de 12-13 ans, puis à l’âge de 14-15 ans, cette thèse par articles visait à étudier : (1) les types d’incohérences ou de biais imputés dans la deuxième mesure comparativement à la première (mesure de référence) et ainsi déduire les caractéristiques des répondants dont les déclarations sont incohérentes (Article 1); (2) l’impact de ces biais dans la détermination des prédicteurs de la consommation précoce, c’est-à-dire à l’âge de 13 ans ou moins (Article 2); et (3) leur impact sur la prédiction de la consommation à l’âge de 16-17 ans en fonction de l’âge d’initiation (Article 3). L’impact du biais est déterminé en corrigeant (1) le biais de sélection dû à la censure des répondants ayant des déclarations incohérentes de l’échantillon de l’étude, lorsque l’âge de l’initiation est la variable dépendante dans le modèle estimé (Article 2) ou (2) le biais d’endogénéité dû à la présence de valeurs erronées et manquantes dans l’âge d’initiation, lorsque l’âge d’initiation est une variable explicative dans le modèle estimé (Article 3). Le premier article révèle qu’au deuxième passage de l’enquête, les jeunes de 14-15 ans ne fournissent pas nécessairement des âges d’initiation cohérents avec ceux fournis lorsqu’ils avaient 12-13 ans. La proportion d’incohérence enregistrée n’est pas négligeable; elle est de 43 % pour l’alcool, 33 % pour le tabac et 32 % pour la drogue. Ces jeunes sont susceptibles de déclarer des âges d’initiation plus tardifs ou d’omettre l’expérimentation antérieure (biais télescopique vers l’avant: BTA), des âges d’initiation plus hâtifs (biais télescopique vers l’arrière: BTR), et peuvent également ne pas déclarer leur initiation à au moins un des deux cycles d’enquête (Biais non-déclaré : BND). Les résultats de la régression multinomiale montrent que le risque de détecter ces biais n’est pas le fruit du hasard; il varie en fonction des caractéristiques socio-démographiques et personnelles des répondants, notamment le genre, la structure de la famille et la région de résidence. En raison du biais dans la deuxième déclaration de l'âge d'initiation, le deuxième article démontre que l'identification des groupes à risque de consommation précoce est affectée par le potentiel de biais au sein de ces groupes. En utilisant l'approche de Heckman, il a été conclu que les âges d'initiation déclarés plus hâtifs (plus tardifs) génèrent une surestimation (sous-estimation) des risques de consommation précoce (à 13 ans et moins) dans les groupes les plus susceptibles de fournir des âges biaisés vers l'arrière BTR (biaisés vers l'avant BTA). Cependant, ces risques sont sous-estimés dans les groupes qui n’ont pas déclaré leur âge d’initiation lors du premier passage de l’enquête (BND). Ceci indique que pour ces groupes, l’âge d’initiation qui n’a pas été déclaré lors du premier passage est probablement un âge précoce (autour de 12-13 ans). Le troisième article conclut que les biais attribués à l'âge de l'initiation affectent l’estimation de la relation entre l’âge d’initiation et la fréquence de consommation à l'âge de 16-17 ans. Le fait que cette relation soit surestimée ou sous-estimée dépend spécifiquement du type de biais et de sa corrélation avec la consommation ultérieure. Enfin, cette thèse tente de fournir des preuves empiriques mettant en évidence le biais de réponse et de non-réponse comme une source d'information supplémentaire qui caractérise l'échantillon de l'étude et qui sa propre part explicative dans les modèles estimés. La validité des données d'enquête est donc d'une grande utilité pour la validité des résultats des études.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,149 | 0,434 |
| Méta-épidémiologie (sens strict) | 0,002 | 0,002 |
| Méta-épidémiologie (sens large) | 0,002 | 0,006 |
| Bibliométrie | 0,003 | 0,006 |
| Études des sciences et des technologies | 0,002 | 0,003 |
| Communication savante | 0,006 | 0,005 |
| Science ouverte | 0,004 | 0,004 |
| Intégrité de la recherche | 0,002 | 0,004 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,004 | 0,001 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».