{"id":"W2328506869","doi":"10.1097/01.mib.0000480117.43672.38","title":"P-026 Effect of Standardized Scoring Conventions on Inter-Rater Reliability in the Endoscopic Evaluation of Crohnʼs Disease","year":2016,"lang":"en","type":"article","venue":"Inflammatory Bowel Diseases","topic":"Inflammatory Bowel Disease","field":"Biochemistry, Genetics and Molecular Biology","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto; St. Michael's Hospital; Robarts Clinical Trials","funders":"","keywords":"Medicine; Crohn's disease; Reliability (semiconductor); Disease; Scoring system; Inter-rater reliability; Internal medicine; Confidence interval; Severity of illness; Physical therapy; Surgery; Gastroenterology; Rating scale; Psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2334091,0.000880754,0.001158779,0.001178491,0.001172397,0.001973183,0.001310871,0.001310693,0.002643757],"category_scores_gemma":[0.4322383,0.00120764,0.001962956,0.00164976,0.00285997,0.001756271,0.002655429,0.001900215,0.001267589],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001521449,"about_ca_system_score_gemma":0.001343603,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001352587,"about_ca_topic_score_gemma":0.002272643,"domain_scores_codex":[0.621241,0.2983325,0.0245626,0.0140404,0.03989407,0.001929541],"domain_scores_gemma":[0.2517661,0.6061395,0.04903435,0.04022512,0.05002261,0.002812305],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.05082724,0.002077996,0.7167574,0.001829479,0.00505053,0.0004426436,0.01630612,0.007601889,0.01147445,0.002332209,0.007775335,0.1775247],"study_design_scores_gemma":[0.001799056,0.02727491,0.9122846,0.0007330953,0.001471599,0.0006674813,0.001806129,0.03189468,0.0112103,0.001299563,0.00925177,0.0003067956],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9493374,0.002537522,0.03284006,0.0006475692,0.001214611,0.002603725,0.0006255505,0.0002900506,0.009903455],"genre_scores_gemma":[0.9787658,0.0001704569,0.01784202,0.0001999525,0.0001322508,0.001589975,0.0002783897,0.000146054,0.0008751616],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2334091,"threshold_uncertainty_score":0.9453431,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01091688605311338,"score_gpt":0.2801349291391048,"score_spread":0.2692180430859915,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}