{"id":"W1994466426","doi":"10.1016/j.jclinepi.2012.07.005","title":"Testing the Risk of Bias tool showed low reliability between individual reviewers and across consensus assessments of reviewer pairs","year":2012,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":171,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Ottawa; Ottawa Hospital; McMaster University; University of Alberta","funders":"Agency for Healthcare Research and Quality","keywords":"Inter-rater reliability; Reliability (semiconductor); Publication bias; Meta-analysis; Systematic review; Randomized controlled trial; Medicine; Psychology; MEDLINE; Clinical psychology; Surgery; Internal medicine; Biology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","metaepi_broad"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.8714682,0.0002945942,0.01635289,0.0001074172,0.0001124237,0.00003940101,0.001638131,0.0003161095,0.0004299412],"category_scores_gemma":[0.9688113,0.0001075667,0.004432388,0.0007757334,0.0009972559,0.000175102,0.0003416096,0.001101984,0.00003988696],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0000155793,"about_ca_system_score_gemma":0.0001823785,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001894112,"about_ca_topic_score_gemma":0.000002766815,"domain_scores_codex":[0.5463022,0.3433888,0.1037024,0.0009887216,0.004773557,0.0008442772],"domain_scores_gemma":[0.03975043,0.8289953,0.1202692,0.003633195,0.006798995,0.0005528507],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00002017457,0.00007891562,0.8887021,0.0001712714,0.0004905308,5.930596e-7,0.00008022108,0.00002833704,0.000001493382,0.00005465983,0.0194743,0.0908974],"study_design_scores_gemma":[0.0003313044,0.0003008273,0.971778,0.0003805612,0.00103728,0.00002075439,0.0002281675,0.0002334035,0.000001492128,0.005116096,0.0204802,0.00009195715],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9841248,0.01002172,0.002419165,0.001703739,0.0009608764,0.0005065898,0.00005969441,0.000001186624,0.0002021803],"genre_scores_gemma":[0.9597334,0.002254967,0.03660427,0.000729894,0.0005769815,0.000003836373,0.000001197402,0.000008571144,0.00008687121],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5065518,"threshold_uncertainty_score":0.9982504,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.9364054554289195,"score_gpt":0.6789392139059987,"score_spread":0.2574662415229209,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}