The Validity of Level of Evidence Ratings of Articles Submitted to JBJS
Notice bibliographique
Résumé
BACKGROUND: In 2003, The Journal of Bone & Joint Surgery (American Volume) implemented a requirement for submitted clinical research articles to include a level of evidence rating. The aim of this study was to analyze the agreement between authors and JBJS regarding the level of evidence rating of accepted clinical articles. METHODS: A random sample of 353 clinical research articles accepted by JBJS from 2010 to 2012 was analyzed; 188 had a level of evidence rating provided by the author. Articles were grouped by study type and subspecialty. An unweighted kappa value was calculated to measure agreement between the authors and the JBJS editor, whose decision was used as the gold standard. In a secondary analysis, the articles in each subspecialty were categorized according to the year of submission to evaluate temporal trends. RESULTS: Of the 353 articles, 69.4% (245) were classified by JBJS as representing a therapeutic study, 17.6% (sixty-two) were classified as representing Level-I evidence, and 25.2% (eighty-nine) dealt with arthroplasty. Agreement between the author and the JBJS editor was 0.79 (95% confidence interval [CI], 0.71 to 0.89; p < 0.001) for the study type, 0.62 (95% CI, 0.53 to 0.70; p < 0.001) for the level of evidence, and 0.65 (95% CI, 0.58 to 0.73; p < 0.001) for the full level of evidence rating (study type and level of evidence). CONCLUSIONS: Level of evidence ratings suggested by authors from 2010 to 2012 had moderate to substantial agreement with the ratings assigned by the JBJS editor. This suggests that the level of evidence rating system is being properly understood by authors of articles published in JBJS. However, the low frequency of reporting suggests that JBJS needs to strictly enforce requirements for submission of a level of evidence rating at the time of manuscript submission.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Étiquettes directes de modèles (non validées)
Étiquettes de catégorie et de devis d'étude par modèle, issues des rondes d'étiquetage. C'est une sortie machine, non validée, et le désaccord entre modèles est livré comme donnée. Aucun devis ici n'est encore validé contre MEDLINE.
| Bras | Catégories | Devis d'étude | Confiance |
|---|---|---|---|
| gemma | Métarecherche Domaine: Évaluation · Genre: Empirique Porte sur le système de recherche canadien: non · Porte sur un sujet canadien: non | Observationnel | low |
| gpt | Métarecherche Domaine: Évaluation · Genre: Empirique Porte sur le système de recherche canadien: non · Porte sur un sujet canadien: non | Observationnel | medium |
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,311 | 0,747 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,004 | 0,006 |
| Bibliométrie | 0,036 | 0,016 |
| Études des sciences et des technologies | 0,002 | 0,005 |
| Communication savante | 0,008 | 0,005 |
| Science ouverte | 0,004 | 0,006 |
| Intégrité de la recherche | 0,003 | 0,002 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,002 | 0,001 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéeÉtiqueté directement par 2 modèles lisant le dossier complet.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».