{"id":"W2998758675","doi":"10.1016/j.amjsurg.2020.01.019","title":"The impact of rater training on the psychometric properties of standardized surgical skill assessment tools","year":2020,"lang":"en","type":"article","venue":"The American Journal of Surgery","topic":"Surgical Simulation and Training","field":"Medicine","cited_by":14,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Checklist; Construct validity; Knot tying; Reliability (semiconductor); Inter-rater reliability; Internal consistency; Psychology; Rating scale; Medicine; Psychometrics; Medical physics; Clinical psychology; Surgery; Developmental psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08321913,0.0009048751,0.0009653897,0.0009486665,0.0007130179,0.001834226,0.001184657,0.001318855,0.00200851],"category_scores_gemma":[0.3975655,0.0006018833,0.001386006,0.0009452461,0.001316539,0.002367393,0.00169002,0.001501703,0.0009171579],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001177836,"about_ca_system_score_gemma":0.001460294,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002391332,"about_ca_topic_score_gemma":0.002592201,"domain_scores_codex":[0.9149772,0.05891731,0.006338888,0.004873919,0.01361743,0.0012752],"domain_scores_gemma":[0.4280454,0.5046309,0.01811015,0.02705432,0.0201511,0.002008142],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.02043986,0.004439605,0.6560068,0.0005978739,0.002022351,0.0002429683,0.007309906,0.006296727,0.01544495,0.0005661971,0.002474685,0.2841581],"study_design_scores_gemma":[0.0005128957,0.01162224,0.9680699,0.0002558563,0.0007724752,0.0005852857,0.0008423791,0.008781627,0.006451967,0.0004655259,0.001509789,0.0001301782],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9918051,0.000688004,0.003438072,0.0003843958,0.0002114682,0.0001699088,0.000147306,0.00007947517,0.003076116],"genre_scores_gemma":[0.9961522,0.0001924704,0.002331138,0.0002005097,0.00008359674,0.0001199585,0.0002104111,0.00007840765,0.0006312697],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.08321913,"threshold_uncertainty_score":0.4401101,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1798463362986748,"score_gpt":0.3749284874325116,"score_spread":0.1950821511338368,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}