{"id":"W1994466426","doi":"10.1016/j.jclinepi.2012.07.005","title":"Testing the Risk of Bias tool showed low reliability between individual reviewers and across consensus assessments of reviewer pairs","year":2012,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":171,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Ottawa; Ottawa Hospital; McMaster University; University of Alberta","funders":"Agency for Healthcare Research and Quality","keywords":"Inter-rater reliability; Reliability (semiconductor); Publication bias; Meta-analysis; Systematic review; Randomized controlled trial; Medicine; Psychology; MEDLINE; Clinical psychology; Surgery; Internal medicine; Biology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.6079112,0.004389931,0.009310607,0.01735856,0.005456932,0.009184459,0.006344336,0.006610422,0.005477136],"category_scores_gemma":[0.8798392,0.004099943,0.01488527,0.01047901,0.006246209,0.008644015,0.01081601,0.006683597,0.002069822],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00417608,"about_ca_system_score_gemma":0.008558121,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003159959,"about_ca_topic_score_gemma":0.00834895,"domain_scores_codex":[0.1976167,0.4779687,0.2104576,0.040829,0.0690511,0.004076878],"domain_scores_gemma":[0.03610956,0.7967385,0.04270742,0.04330355,0.07978106,0.001359921],"domain_codex":"methods","domain_gemma":"methods","domain_candidate":"methods","domain_consensus":"methods","study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.01302817,0.001683041,0.4068913,0.0654089,0.1306597,0.001862726,0.0605812,0.01015698,0.01004797,0.01571487,0.02884269,0.2551224],"study_design_scores_gemma":[0.01059899,0.007332634,0.4324681,0.03432067,0.1042244,0.006948704,0.01834179,0.1186967,0.04536061,0.1008373,0.1148649,0.006005221],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3095517,0.02609293,0.5654237,0.007157389,0.01138487,0.04523714,0.007198057,0.004811159,0.02314313],"genre_scores_gemma":[0.7244335,0.001097317,0.2460546,0.001835346,0.0007748106,0.01984174,0.002285946,0.001482622,0.002194132],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.3920888,"threshold_uncertainty_score":0.4835153,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.9364054554289195,"score_gpt":0.6789392139059987,"score_spread":0.2574662415229209,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}