{"id":"W3121978394","doi":"10.1097/acm.0000000000003921","title":"Generalizability of the Ottawa Surgical Competency Operating Room Evaluation (O-SCORE) Scale to Assess Medical Student Performance on Core EPAs in the Workplace: Findings From One Institution","year":2021,"lang":"en","type":"article","venue":"Academic Medicine","topic":"Innovations in Medical Education","field":"Medicine","cited_by":19,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Generalizability theory; Formative assessment; Medical education; Scale (ratio); Summative assessment; Educational measurement; Medicine; Reliability (semiconductor); Psychology; Curriculum; Pedagogy","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03949546,0.0005056066,0.0006089569,0.002189497,0.0007455748,0.001579579,0.001210862,0.0008943072,0.001109964],"category_scores_gemma":[0.1212273,0.0004006682,0.001804081,0.001405059,0.002124186,0.001278694,0.002957719,0.001195799,0.0004394944],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001747897,"about_ca_system_score_gemma":0.002401724,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005872405,"about_ca_topic_score_gemma":0.008393636,"domain_scores_codex":[0.9635051,0.01264399,0.005460593,0.003657708,0.01354852,0.001184037],"domain_scores_gemma":[0.8972637,0.0480704,0.01780503,0.01141464,0.02305563,0.002390653],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0002804317,0.0002242561,0.9759632,0.0000948181,0.0002910999,0.00003684249,0.002209325,0.0004557945,0.0006059075,0.0001130149,0.0003747173,0.01935058],"study_design_scores_gemma":[0.00004381288,0.001234908,0.9905398,0.0001819502,0.0001282037,0.0001374919,0.003108041,0.001905631,0.001082285,0.0002020433,0.001401121,0.00003479287],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9924648,0.0003949165,0.002844217,0.0003202487,0.00009311328,0.0003523112,0.0002132653,0.00002943506,0.003287784],"genre_scores_gemma":[0.9982612,0.0001091853,0.001008822,0.0001091257,0.00001828953,0.0001283254,0.0001667766,0.00001840389,0.0001798035],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03949546,"threshold_uncertainty_score":0.2088744,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0962312262534963,"score_gpt":0.4234945292962467,"score_spread":0.3272633030427504,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}