Have We Progressed in the Surgical Literature? Thirty-Year Trends in Clinical Studies in 3 Surgical Journals
Notice bibliographique
Résumé
BACKGROUND: We practice in an era of evidence-based medicine. In 1993, Solomon and McLeod published an article examining study designs in 3 surgical journals from 1980 and 1990. OBJECTIVE: The purpose of this study was to evaluate subsequent 30-year trends in the quality of selected literature. DESIGN: All of the articles from Diseases of the Colon & Rectum, Surgery, and the British Journal of Surgery during 2000 and 2010 were classified by study design. Nonclinical studies were substratified by animal/laboratory, surgical technique, editorial/review, or miscellaneous articles. Clinical articles were categorized as case or comparative studies, further categorized by study design, and rated on a 10-point scale to determine strength. We compared interobserver reliability using a random sample. SETTING: This study was conducted at 3 North American medical centers. PATIENTS: Patients described in the scope of the literature were included in this study. MAIN OUTCOME MEASURES: Frequency, type, and strength of study design were measured. RESULTS: We evaluated 1911 articles (967 clinical; 17% comparative). There was a significant increase in multicenter clinical studies (from 12% to 27%; p < 0.0001) and mean study population (from 326 to 6775; p < 0.05). Studies using administrative data increased from 14% to 43% (p < 0.0001). Case reports decreased from 16% to 7% of all clinical studies (p < 0.001), whereas the percentage of comparative studies increased from 14% to 21% (p = 0.001). The percentage of randomized controlled trials did not increase significantly (8.5% in 2000; 10.0% in 2010; p = 0.44). The mean 10-point score for comparative studies was 6.7 for both years (p = 0.50). There was good interobserver agreement in the classification of studies (κ = 0.70) and moderate agreement in scoring comparative studies (κ = 0.47). LIMITATIONS: This descriptive study cannot fully account for the reasons behind the identified differences. CONCLUSIONS: Comparative and multicenter studies, mean study population, and the use of administrative data increased from 2000 to 2010. This suggests that increased use of administrative databases has allowed larger populations of patients from more institutions to be studied and may be more generalizable. Researchers should strive toward improving the level of evidence (see Video, Supplemental Digital Content 1, http://links.lww.com/DCR/A167).
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,088 | 0,265 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,002 |
| Bibliométrie | 0,033 | 0,029 |
| Études des sciences et des technologies | 0,002 | 0,003 |
| Communication savante | 0,006 | 0,006 |
| Science ouverte | 0,001 | 0,004 |
| Intégrité de la recherche | 0,002 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,001 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».