Approches de médiation basées sur la régression avec réponse binaire : contourner l'hypothèse de la réponse rare ou commune
Bibliographic record
Abstract
L’analyse de médiation causale désigne un ensemble de concepts théoriques et d’outils d’estimation conçus pour étudier dans quelle mesure l’effet d’une exposition sur une variable réponse se produit à travers des variables intermédiaires (médiateurs). Dans cette thèse, nous nous concentrons sur l’analyse de médiation causale qui porte sur un seul médiateur et nous cherchons à décomposer l’effet total d’une exposition selon les soi-disant effets naturels direct et indirect. Un nombre d’approches d’estimation paramétriques basées sur la régression logistique pour une réponse binaire ont été proposées dans la littérature pour l’estimation d’effets naturels. Ces approches ont invoqué lesdites hypothèses de la réponse rare ou commune (non rare) afin d’obtenir des expressions approximatives simples et fermées pour ces effets. Toutefois, dans les études appliquées, l’évaluation de l’hypothèse de la réponse rare représente un défi à cause de l’absence de lignes directrices explicites permettant de qualifier une réponse binaire comme rare dans le contexte de la médiation causale. Dans cette thèse, nous présentons des estimateurs exacts des effets naturels pour une réponse binaire basés sur la régression. L’utilisation du terme « exact » est justifiée par le fait que nos estimateurs sont dérivés sans invoquer aucune hypothèse théorique simplificatrice, ce qui permet de surmonter la difficulté inhérente à l’évaluation de l’hypothèse de la réponse rare dans le cadre de la médiation causale d’une réponse binaire. Nos estimateurs sont développés pour des expositions et des médiateurs binaires et/ou continus, et ils accommodent trois échelles binaires standards, c’est-à-dire le rapport de cotes, le rapport de risques et la différence de risques. Notre approche exacte repose sur la spécification de modèles de régression logistique pour les réponses et médiateurs binaires et sur la régression linéaire pour les médiateurs continus. Des formules pour les erreurs standards basées sur la méthode delta sont proposées. Nous avons évalué le comportement de nos estimateurs dans des études de simulation où la réponse était rare ou commune, y compris des scénarios où la réponse était rare marginalement, mais pas conditionnellement. Dans nos études de simulation, basées sur une taille échantillonnale relativement grande, la performance adéquate des estimateurs exacts proposés a été observée, indépendamment de l’échelle des effets et de la prévalence (marginale ou conditionnelle) de la réponse. Plus précisément, nous avons obtenu des valeurs faibles de biais relatif, ce qui suggère que nos estimateurs exacts sont sans biais pour des tailles échantillonnales suffisamment grandes. Les intervalles de confiance par la méthode delta ou par le bootstrap basé sur les percentiles ont démontré des probabilités de couverture proches du niveau nominal. Notre contribution pratique consiste au développement de macros SAS conçues pour implémenter l’approche exacte proposée. Ces macros fournissent les estimations des effets naturels sur les trois échelles binaires standards facilitant ainsi une comparaison directe avec les résultats obtenus par d’autres approches de médiation causale pour une réponse binaire. _____________________________________________________________________________ MOTS-CLÉS DE L’AUTEUR : analyse de médiation causale simple basée sur la régression, effets naturels direct et indirect, estimateurs exacts, hypothèse de la réponse rare, régression logistique, variable réponse binaire
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.040 | 0.139 |
| Meta-epidemiology (narrow) | 0.003 | 0.002 |
| Meta-epidemiology (broad) | 0.003 | 0.005 |
| Bibliometrics | 0.003 | 0.004 |
| Science and technology studies | 0.001 | 0.003 |
| Scholarly communication | 0.006 | 0.007 |
| Open science | 0.005 | 0.004 |
| Research integrity | 0.003 | 0.007 |
| Insufficient payload (model declined to judge) | 0.022 | 0.004 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".