{"id":"W4322767903","doi":"10.21203/rs.3.rs-2206790/v1","title":"WITHDRAWN: Inter-rater Reliability of Risk of Bias Tools for Non-Randomized Studies","year":2023,"lang":"en","type":"preprint","venue":"Research Square","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Inter-rater reliability; Reliability (semiconductor); Reliability engineering; Psychology; Computer science; Engineering; Physics; Developmental psychology; Rating scale","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","metaepi_narrow"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.1642882,0.0004130947,0.002862281,0.00102441,0.0002628192,0.0003527721,0.002473814,0.0003847067,0.0001883904],"category_scores_gemma":[0.3798007,0.0002458507,0.001545462,0.001220536,0.002669406,0.0002580267,0.003511873,0.001280421,0.0001100395],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002544858,"about_ca_system_score_gemma":0.0006315475,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0006060267,"about_ca_topic_score_gemma":0.0002772423,"domain_scores_codex":[0.9788653,0.007700926,0.003556343,0.001647309,0.00747364,0.0007565258],"domain_scores_gemma":[0.8670857,0.1104344,0.001725163,0.003950533,0.01660318,0.00020108],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.2105445,0.005447818,0.3055396,0.04261878,0.006796485,0.00003114618,0.08939952,0.03506808,0.001749414,0.003525432,0.2007864,0.09849276],"study_design_scores_gemma":[0.03774108,0.001339276,0.0242289,0.00646044,0.0002888288,3.612582e-7,0.0354964,0.006569793,0.01032983,0.8721099,0.004681245,0.0007539305],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9751287,0.0009949583,0.007316177,0.002793313,0.001558483,0.01004729,0.001482843,0.00005486099,0.0006233823],"genre_scores_gemma":[0.991769,0.001882006,0.002895992,0.00001040579,0.0002121833,0.001571827,0.00004327362,0.00003627105,0.001579034],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8685845,"threshold_uncertainty_score":0.9999994,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.6070368058631517,"score_gpt":0.5470055814174135,"score_spread":0.06003122444573816,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}