{"id":"W4389410166","doi":"10.1186/s13643-023-02389-w","title":"Inter-rater reliability of risk of bias tools for non-randomized studies","year":2023,"lang":"en","type":"article","venue":"Systematic Reviews","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"Centre Hospitalier de l’Université de Montréal; Université de Montréal","funders":"","keywords":"Intraclass correlation; Checklist; Medicine; Reliability (semiconductor); Inter-rater reliability; Scale (ratio); Statistics; Rating scale; Mathematics; Clinical psychology; Psychometrics; Psychology; Cartography","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.6735605,0.003227879,0.01207555,0.02597594,0.002761253,0.008378555,0.005657021,0.003729889,0.005607627],"category_scores_gemma":[0.8581126,0.002848127,0.02607314,0.01980333,0.006489536,0.007605031,0.009361778,0.003900145,0.001449731],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.007201965,"about_ca_system_score_gemma":0.01013134,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001566094,"about_ca_topic_score_gemma":0.002207469,"domain_scores_codex":[0.1223985,0.5712667,0.2298262,0.01904124,0.05615308,0.001314253],"domain_scores_gemma":[0.04710284,0.7260928,0.1221476,0.04241951,0.06127882,0.0009584281],"domain_codex":"methods","domain_gemma":"methods","domain_candidate":"methods","domain_consensus":"methods","study_design_codex":"systematic_review","study_design_gemma":"observational","study_design_scores_codex":[0.0106889,0.0005281552,0.2086869,0.3131959,0.1018606,0.000416712,0.01925209,0.007876366,0.002275933,0.01987769,0.01546066,0.2998801],"study_design_scores_gemma":[0.01296042,0.01005196,0.3509947,0.2415468,0.1118577,0.002922319,0.009173881,0.06104986,0.01466176,0.08287259,0.0990818,0.002826231],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08332273,0.1075307,0.6117533,0.004262531,0.004824325,0.1524059,0.01523968,0.003093833,0.01756691],"genre_scores_gemma":[0.3677873,0.006511388,0.3915111,0.001038641,0.0008639879,0.2271519,0.00386365,0.0005439086,0.0007280161],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.3264395,"threshold_uncertainty_score":0.4025581,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4923679694819516,"score_gpt":0.4693242146934178,"score_spread":0.02304375478853377,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}