MétaCan
Menu
Back to cohort
Record W4396766131 · doi:10.1016/j.jeph.2024.202420

CO7.1 - Pondération par avis d'expert versus modèles statistiques pour la création d'un score composite des dimensions du questionnaire Flare-OA-16 pour les poussées d'arthrose des membres inférieurs.

2024· article· fr· W4396766131 on OpenAlexaff
Marc Soudant, J. Epstein, Dorcas Beaton, S.M. Cembalo, Shawna Grosskleg, ML. Erpelding, George A. Wells, F. Guillemin

Bibliographic record

VenueJournal of Epidemiology and Population Health · 2024
Typearticle
Languagefr
FieldMedicine
TopicMusculoskeletal pain and rehabilitation
Canadian institutionsUniversity of OttawaInstitute for Work & HealthUniversity of Toronto
Fundersnot available
KeywordsHumanitiesPhysicsPsychologyArt

Abstract

fetched live from OpenAlex

La création d'un score composite pour un instrument de mesure multidimensionnel est utile pour la prise de décision clinique. L'objectif était de comparer les qualités d'un score composite du questionnaire Flare-OA-16 caractérisant les poussées d'arthrose des membres inférieurs selon les pondérations de ses dimensions obtenues par avis d'expert versus divers modèles statistiques. Cinq méthodes de pondération des cinq dimensions (16 items) du questionnaire Flare-OA-16 pour construire un score additif ont été comparées. Les avis d'experts ont été obtenus auprès de rhumatologues, scientifiques et patients participants au congrès international OMERACT 2023, USA. Ils ont d'abord établi un jugement individuel, puis construit des consensus par groupes. Les modèles statistiques ont été développés sur un jeu de données internationales de sujets atteints d'arthrose des membres inférieurs recrutés en France, Australie, et USA, incluant une question "avez-vous eu une poussée d'arthrose au cours des 4 dernières semaines" (1). Les méthodes de calcul du score avec différentes pondérations des dimensions, en utilisant les items recodés après analyse de Rasch (2), étaient : 1) pondération d'expert individuelle, avec le poids moyen des jugements individuels, 2) pondération consensuelle, avec le poids moyen des jugements consensuels de groupes, 3) équipondération, avec un poids égal à 1 pour chaque dimension (somme simple), 4) pondération de Rasch, avec la correspondance des items sur le trait latent, 5) pondération factorielle obtenue à partir d'une analyse factorielle confirmatoire de second ordre (items et dimensions). L'analyse a décrit la distribution de chaque score composite et leurs performances prédictives de la survenue d'une poussée par calcul de l'aire sous la courbe et son intervalle de confiance (AUC (IC95%). Un panel de 70 experts (18 patients et 52 rhumatologues et chercheurs) seuls, puis réparti en 11 groupes, a déterminé des pondérations pour chacune des cinq dimensions. Parmi les 381 sujets atteints d'arthrose des membres inférieurs, 247 déclaraient une poussée au cours des quatre dernières semaines. Les scores moyens (m (ET)) par dimension variaient de 2,4 (3,2) à 5,0 (2,9). Les pondérations des dimensions par les experts individuels et consensuelles variaient de 13,3 % à 31,2 %, et de 14,1 % à 31,8 %, respectivement. Les cinq scores composites moyens variaient de 4,3 (2,5) à 4,3 (2,6). Il y avait très peu d'effet plancher (5,8 %) et aucun effet plafond selon les cinq méthodes comparées. Les performances de chacune des méthodes pour identifier la survenue d'une poussée avec les scores composites étaient très proches, avec une AUC (IC95%) entre 0,861 (0,821-0,900) et 0,865 (0,826-0,904). A la recherche d'une cause possible de cette similarité, les corrélations (Pearson) calculées entre les dimensions variaient entre r=0,39 et 0,96. les avis d'experts et diverses pondérations issues de modèles statistiques n'ont pas montré de différence de score moyen ni de performance pour identifier la survenue d'une poussée d'arthrose. La corrélation forte à élevée entre les dimensions du questionnaire est une explication possible de ces similarités. Un score composite du questionnaire Flare-OA-16 peut être calculé comme la somme des scores de Rasch de chaque dimension.

Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.

How this classification was reachedexpand

Full frame distilled prediction

Teacher imitation

Not calibrated prevalence, not ground truth. Human validation pending. Learned from the 10,348 direct Codex labels and 10,348 direct Gemma labels. Candidate is the union of thresholded teacher heads; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels or direct frontier model labels.

metaresearch head score (Codex)0.007
metaresearch head score (Gemma)0.007
Version: codex-gemma-dda1882f352aValidation status: machine_predicted_unvalidated
Candidate categoriesMeta-epidemiology (narrow)
Consensus categoriesnone
DomainCandidate signal: none · Consensus signal: none
Study designCandidate signal: Observational · Consensus signal: Observational
GenreCandidate signal: Empirical · Consensus signal: Empirical
Teacher disagreement score0.320
Threshold uncertainty score1.000

Codex and Gemma teacher scores by category

CategoryCodexGemma
Metaresearch0.0070.007
Meta-epidemiology (narrow)0.0000.000
Meta-epidemiology (broad)0.0010.000
Bibliometrics0.0000.000
Science and technology studies0.0010.001
Scholarly communication0.0000.001
Open science0.0000.000
Research integrity0.0000.001
Insufficient payload (model declined to judge)0.0000.000

Machine scores (provisional)

The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.

Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.

Opus teacher head0.061
GPT teacher head0.391
Teacher spread0.330 · how far apart the two teachers sit on this one work
Validation statusscore_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from it

Classification

machine, unvalidated

Machine predicted; a candidate call from one teacher head, not a consensus.

Study designObservational
Domainnot available
GenreEmpirical

How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".

Quick stats

Citations0
Published2024
Admission routes1
Has abstractyes

Explore more

Same venueJournal of Epidemiology and Population HealthSame topicMusculoskeletal pain and rehabilitationFrench-language works237,207