{"id":"W4389410166","doi":"10.1186/s13643-023-02389-w","title":"Inter-rater reliability of risk of bias tools for non-randomized studies","year":2023,"lang":"en","type":"article","venue":"Systematic Reviews","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"Centre Hospitalier de l’Université de Montréal; Université de Montréal","funders":"","keywords":"Intraclass correlation; Checklist; Medicine; Reliability (semiconductor); Inter-rater reliability; Scale (ratio); Statistics; Rating scale; Mathematics; Clinical psychology; Psychometrics; Psychology; Cartography","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.1807735,0.0002442122,0.004876456,0.0002122598,0.00007443594,0.00006956999,0.0008213623,0.00006297815,0.00006879724],"category_scores_gemma":[0.4107653,0.0001053624,0.001439762,0.0009159545,0.0003204946,0.0002357486,0.0001623509,0.00007785238,0.000371062],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004317505,"about_ca_system_score_gemma":0.00003610018,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001416525,"about_ca_topic_score_gemma":0.00001279563,"domain_scores_codex":[0.9827873,0.007586896,0.007282352,0.0005126029,0.001593859,0.0002369489],"domain_scores_gemma":[0.9294542,0.06144786,0.004836722,0.002251507,0.00194316,0.00006653159],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"systematic_review","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.004886159,0.0006622394,0.01432366,0.8152596,0.001702991,0.000001807758,0.04209247,0.0005373374,0.0009506937,0.002165181,0.09376968,0.02364819],"study_design_scores_gemma":[0.1067702,0.001610953,0.004395115,0.2058584,0.005358189,0.000005847925,0.07536788,0.0201388,0.00799551,0.5068941,0.06336062,0.002244443],"study_design_candidate":"systematic_review","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8448691,0.01583614,0.04316949,0.001387698,0.004402863,0.08816609,0.0002123537,0.00009637928,0.001859862],"genre_scores_gemma":[0.9816961,0.005934168,0.005202759,0.00006358467,0.00009149606,0.005466388,0.000006399168,0.000018931,0.00152012],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.6094012,"threshold_uncertainty_score":0.8435661,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4923679694819516,"score_gpt":0.4693242146934178,"score_spread":0.02304375478853377,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}