Assessment of systemic lupus erythematosus diagnoses within Quebec's health administrative databases
Bibliographic record
Abstract
Contexte : Le lupus érythémateux disséminé (LED) est une maladie auto-immune chronique relativement peu commune. L'évolution de cette maladie est décrite en phases de poussées et de rémissions et ses manifestations cliniques touchent plusieurs organes. L'utilisation de médicaments immunosuppresseurs est souvent nécessaire pour contrôler le LED. Les banques de données administratives du domaine de la santé s'avèrent utiles pour étudier le LED, car elles pourraient être utilisées pour étudier l'incidence, la prévalence et les manifestations cliniques. Toutefois, comme les diagnostics présents dans ces bases de données administratives n'ont pas nécessairement de confirmation clinique, la détermination des cas de LED représente un défi d'ordre méthodologique et certains de ces problèmes méthodologiques font l'objet de la présente thèse.Méthodologie : L'algorithme initial de définition de cas de LED a déjà été utilisé pour identifier des sujets atteints de LED s'ils répondaient aux critères suivants : un code de congé d'hôpital de LED, une réclamation d'un rhumatologue pour le LED et/ou deux réclamations par un médecin autre qu'un rhumatologue pour le LED séparées d'au moins huit semaines, mais dans un intervalle de deux ans. D'autres algorithmes ont été créés en modifiant un paramètre ou plus de l'algorithme initial. Des estimations d'incidence et de prévalence ont été obtenues grâce à chaque algorithme créé et ces valeurs ont été comparées aux estimations initiales. L'effet de l'utilisation de périodes de données de différentes longueurs sur la détection des patients a également été examiné. Des analyses Kaplan-Meier (K-M) ont été faites pour évaluer la documentation des manifestations cliniques du LED et l'utilisation de médicaments immunosuppresseurs spécifiques au sein d'une cohorte incidente de patients atteints de LED identifiés par l'algorithme initial (décrit plus haut). L'intervalle d'observation a débuté quatre ans avant le diagnostic de LED et s'est poursuivi jusqu'à huit ans après le diagnostic. Des analyses utilisant le modèle de régression à risques proportionnels de Cox ont servi à examiner l'association entre l'utilisation précoce d'antipaludiques et les manifestations rénales. Résultats : Avec l'algorithme initial, l'incidence annuelle de LED en 1998 était de 6,0 cas pour 100 000 habitants (95 % d'intervalle de confiance (CI), 5,5-6,6). En changeant les paramètres de l'algorithme initial, l'incidence en 1998 a varié entre 4,4 et 7,4 pour 100 000. La prévalence a passé de 65,5 pour 100 000 (95 % CI : 63,7–67,4) avec l'algorithme initial à entre 47,8–79,1 pour 100 000 avec les autres algorithmes. En modifiant la longueur des périodes de données de quinze à cinq ans, l'incidence annuelle en 2001 était surestimée par 38,3 %.Dans l'ensemble, 66,2 % (95 % CI : 63,4–68,9 %) des patients incidents au sein de la cohorte de patients atteints de LED assemblée grâce à l'algorithme initial montraient au moins une manifestation de LED au cours de la période évaluée. Au sein d'une sous-cohorte de patients incidents atteints de LED couverts par la RAMQ, 87,2 % (95 % CI : 84,2–90,3 %) ont reçu au moins un médicament à l'étude avant la fin de l'intervalle étudié. Aucune association n'a été trouvée entre l'utilisation précoce d'antipaludiques et les manifestations rénales subséquentes. Conclusion : La variation de la définition de cas et de la période de données peut modifier considérablement les estimations d'incidence et de prévalence. Ainsi, tous les paramètres, y compris la période de temps pour laquelle les données sont recueillies, devraient être choisis avec précaution. La majorité des patients incidents atteints de LED montrent des manifestations de LED qui pourraient offrir une confirmation potentielle des cas de LED. Ces informations supplémentaires pourront être utilisées pour des études futures sur les bases de données des services de soins de santé afin de mieux comprendre le LED.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.007 | 0.041 |
| Meta-epidemiology (narrow) | 0.000 | 0.000 |
| Meta-epidemiology (broad) | 0.001 | 0.001 |
| Bibliometrics | 0.008 | 0.011 |
| Science and technology studies | 0.002 | 0.000 |
| Scholarly communication | 0.004 | 0.001 |
| Open science | 0.002 | 0.002 |
| Research integrity | 0.001 | 0.001 |
| Insufficient payload (model declined to judge) | 0.004 | 0.001 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".