{"id":"W2112548834","doi":"10.1016/j.jclinepi.2011.01.010","title":"Testing a tool for the classification of study designs in systematic reviews of interventions and exposures showed moderate reliability and low accuracy","year":2011,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":73,"is_retracted":false,"has_abstract":false,"ca_institutions":"McMaster University; University of Alberta","funders":"Agency for Healthcare Research and Quality","keywords":"Inter-rater reliability; Reliability (semiconductor); Context (archaeology); Test (biology); Systematic review; Research design; CLARITY; Statistics; Computer science; Medicine; Reliability engineering; Medical physics; MEDLINE; Mathematics; Engineering; Rating scale","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["metaresearch"],"domain":"methods","study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":["metaresearch"],"domain":"methods","study_design":"design_other","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"medium","status":"direct model label, unvalidated"}],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.6919273,0.0001463669,0.01016478,0.000173056,0.00004799927,0.00002630818,0.0007371911,0.0001060085,0.0000801695],"category_scores_gemma":[0.9256294,0.00005367912,0.001965854,0.0003411531,0.0002142753,0.000166012,0.00008059506,0.0002658857,0.000002311934],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000008017778,"about_ca_system_score_gemma":0.00006381201,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001424378,"about_ca_topic_score_gemma":0.000033121,"domain_scores_codex":[0.6876513,0.2080839,0.1020411,0.0008169491,0.001133829,0.0002729905],"domain_scores_gemma":[0.1106369,0.8030835,0.08072201,0.002346605,0.003058519,0.0001524782],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001353904,0.0005131472,0.9742187,0.004843171,0.0002556918,6.624816e-7,0.0007221852,0.0001052206,0.00003746905,0.0007708624,0.0003754166,0.01802205],"study_design_scores_gemma":[0.0005033108,0.0009242815,0.9333621,0.002023265,0.0006891316,0.00001288529,0.0009714411,0.03895715,0.000001512467,0.02247278,0.00002816464,0.00005400709],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8601037,0.003733988,0.1330703,0.0004048762,0.0001530317,0.002505392,0.000002488642,5.225355e-7,0.00002569181],"genre_scores_gemma":[0.972443,0.000388637,0.02697198,0.00006897359,0.00003094855,0.0000689708,1.189393e-7,0.000003427936,0.00002399065],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5949997,"threshold_uncertainty_score":0.6948442,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.9765515537496716,"score_gpt":0.6909558342193558,"score_spread":0.2855957195303158,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}