{"id":"W3016792159","doi":"10.4300/jgme-d-20-00163.1","title":"The Reliability of Rater Variability","year":2020,"lang":"en","type":"letter","venue":"Journal of Graduate Medical Education","topic":"Orthopedic Surgery and Rehabilitation","field":"Medicine","cited_by":4,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Northern British Columbia","funders":"","keywords":"Reliability (semiconductor); Inter-rater reliability; MEDLINE; Computer science; Psychology; Medicine; Data science; Statistics; Biology; Mathematics; Rating scale","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0731141,0.0002494952,0.0007803463,0.001314447,0.001370927,0.002433922,0.001327764,0.005591155,0.002242969],"category_scores_gemma":[0.4401729,0.0004848801,0.0006911008,0.0007717409,0.002221136,0.002105484,0.001291105,0.004159512,0.002768151],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001629841,"about_ca_system_score_gemma":0.001465286,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004002074,"about_ca_topic_score_gemma":0.00439499,"domain_scores_codex":[0.914842,0.0536768,0.009775437,0.004316658,0.01589503,0.001494111],"domain_scores_gemma":[0.4442402,0.4466197,0.01470278,0.02116018,0.0715762,0.001700979],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.002068369,0.0001098843,0.3622493,0.0007731844,0.0005090479,0.005140505,0.02282779,0.0009337303,0.006093189,0.01639933,0.2614712,0.3214244],"study_design_scores_gemma":[0.0002978257,0.00118832,0.6157022,0.003849532,0.0006761026,0.0275096,0.01380752,0.02251137,0.01127781,0.03474624,0.2678269,0.0006065384],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"commentary","genre_gemma":"empirical","genre_scores_codex":[0.3314535,0.01230157,0.04288869,0.4730465,0.02609247,0.0002979087,0.001534074,0.0004214657,0.1119638],"genre_scores_gemma":[0.9165052,0.002233187,0.01017908,0.05167151,0.01063064,0.0003576738,0.0003236553,0.0002084519,0.007890617],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9268859,"threshold_uncertainty_score":0.386669,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02798861408743941,"score_gpt":0.318804975134802,"score_spread":0.2908163610473626,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}