{"id":"W971963990","doi":"10.1503/cjs.010614","title":"Evaluating the reliability of surgical assessment methods in an orthopedic residency program","year":2015,"lang":"en","type":"article","venue":"Canadian Journal of Surgery","topic":"Surgical Simulation and Training","field":"Medicine","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Inter-rater reliability; Medicine; Cronbach's alpha; Orthopedic surgery; Reliability (semiconductor); Medical education; Intra-rater reliability; Physical therapy; Family medicine; Medical physics; Confidence interval; Surgery; Psychometrics; Psychology; Clinical psychology; Rating scale; Internal medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.07216617,0.0005058884,0.0005198875,0.00239023,0.0009419672,0.001099518,0.0008828961,0.0004591982,0.0006254954],"category_scores_gemma":[0.134792,0.0004263253,0.0007279636,0.001505126,0.001400609,0.0008721399,0.001699338,0.0005988682,0.0003577655],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001862911,"about_ca_system_score_gemma":0.003116181,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006762243,"about_ca_topic_score_gemma":0.01341729,"domain_scores_codex":[0.9328667,0.03524117,0.006690973,0.003316164,0.02057619,0.001308874],"domain_scores_gemma":[0.8294821,0.08667485,0.01767441,0.007086824,0.05664133,0.002440489],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0008265371,0.0003446418,0.9202167,0.0002935476,0.0003507194,0.00007980232,0.00558332,0.00104186,0.002433973,0.0001520927,0.000665531,0.06801122],"study_design_scores_gemma":[0.00006943288,0.001901863,0.9814083,0.0002538454,0.0001281654,0.0002660962,0.002685885,0.007377308,0.003707508,0.0001939759,0.001953535,0.00005406851],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.986621,0.0004569338,0.008987918,0.0001224471,0.00009389564,0.0005576352,0.0001501032,0.00006635328,0.002943803],"genre_scores_gemma":[0.9906422,0.0001710147,0.008465281,0.00002787764,0.00002901451,0.0002503739,0.000147964,0.00001299432,0.0002532073],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9278338,"threshold_uncertainty_score":0.3816558,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3569495608508862,"score_gpt":0.5348872314008267,"score_spread":0.1779376705499405,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}