{"id":"W3176230537","doi":"10.1097/acm.0000000000004222","title":"Workplace-Based Entrustment Scales for the Core EPAs: A Multisite Comparison of Validity Evidence for Two Proposed Instruments Using Structured Vignettes and Trained Raters","year":2021,"lang":"en","type":"article","venue":"Academic Medicine","topic":"Innovations in Medical Education","field":"Medicine","cited_by":16,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"University of Illinois at Urbana-Champaign; National Center for Advancing Translational Sciences; Association of American Medical Colleges","keywords":"Generalizability theory; Scale (ratio); Summative assessment; Operationalization; Medical education; Psychology; Inter-rater reliability; Applied psychology; Variance (accounting); Clinical psychology; Concurrent validity; Concordance; Intraclass correlation; Psychometrics; Medicine; Rating scale; Formative assessment; Internal consistency; Pedagogy; Developmental psychology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06061446,0.0004190287,0.0006151751,0.001807169,0.0009066547,0.001408931,0.001374554,0.001152415,0.001490293],"category_scores_gemma":[0.1759615,0.0006583745,0.001397141,0.001120882,0.002763054,0.002312696,0.002885113,0.001468232,0.0002339972],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001970924,"about_ca_system_score_gemma":0.002141389,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0009217277,"about_ca_topic_score_gemma":0.002263889,"domain_scores_codex":[0.9325206,0.04855993,0.006449052,0.002236941,0.009584687,0.0006487513],"domain_scores_gemma":[0.7716648,0.169456,0.02275113,0.01247803,0.02147488,0.002175173],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.01466914,0.007979785,0.7390901,0.001963454,0.001483208,0.0001474677,0.02556048,0.002096326,0.00564055,0.003496799,0.001165779,0.196707],"study_design_scores_gemma":[0.002306291,0.02931946,0.9366773,0.000699346,0.0004541763,0.000292817,0.0117023,0.007510405,0.006298865,0.00178595,0.002742271,0.0002108939],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9891172,0.0002361136,0.005680392,0.00008529332,0.00008794286,0.003141684,0.0001266854,0.00002054573,0.001504201],"genre_scores_gemma":[0.9701731,0.0001689042,0.02059422,0.00009416933,0.00004134504,0.008303969,0.0002752891,0.00001191367,0.0003372825],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.06061446,"threshold_uncertainty_score":0.3205637,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2298711976766265,"score_gpt":0.4770813155469423,"score_spread":0.2472101178703158,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}