Checking assumptions: Advancing the analysis of sex and gender in human health and psychological sciences
Notice bibliographique
Résumé
Sex and gender are dissociable, multi-component variables. Focusing on the analytic problems associated with dichotomising continuous variables, we synthesize a new approach to collecting and analysing sex and gender data in health research, in contrast to the conventional use of dichotomous tickboxes to code sex/gender.Methods. Using a literature review and data simulations in R, we examined the magnitude of the statistical and methodological problems associated with the use of a single dichotomised sex/gender variable, including construct validity, predictive validity, measurement error, residual confounding, misclassification and bias due to cut points, power, and representative sampling.Results. Using the dichotomous sex/gender predictor rather than a continuous sex/gender predictor increased residual confounding up to 80% and misclassification of individual participants up to 50%. Further, there was substantial bias in model parameters when continuous sex/gender variables were dichotomised. Finally, we found that using the dichotomous sex/gender predictor decreased power, in some cases by more than 50%.Conclusions. Using a dichotomous sex/gender predictor in place of a continuous sex/gender predictor has profound impacts on the statistical model and the validity of inferences drawn from such a model. We describe measurement and analytic approaches to reduce the statistical problems related to a dichotomised sex/gender analysis.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,561 | 0,858 |
| Méta-épidémiologie (sens strict) | 0,003 | 0,003 |
| Méta-épidémiologie (sens large) | 0,006 | 0,007 |
| Bibliométrie | 0,008 | 0,009 |
| Études des sciences et des technologies | 0,006 | 0,032 |
| Communication savante | 0,017 | 0,023 |
| Science ouverte | 0,009 | 0,016 |
| Intégrité de la recherche | 0,007 | 0,015 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,014 | 0,002 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; l’étiquette directe de Gemma et le classifieur distillé Codex s’accordent sur ce qui est montré ici.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».