{"id":"W3158940376","doi":"10.1097/ceh.0000000000000362","title":"Evaluation of a High Stakes Physician Competency Assessment: Lessons for Assessor Training, Program Accountability, and Continuous Improvement","year":2021,"lang":"en","type":"article","venue":"Journal of Continuing Education in the Health Professions","topic":"Innovations in Medical Education","field":"Medicine","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"Laurentian University","funders":"","keywords":"Intraclass correlation; Quartile; Competence (human resources); Accountability; Psychology; Medicine; Linear regression; Inter-rater reliability; Clinical psychology; Statistics; Psychometrics; Social psychology; Rating scale; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1037626,0.000557807,0.001010239,0.002171968,0.001071389,0.002924259,0.001797033,0.0009803585,0.001422121],"category_scores_gemma":[0.2348615,0.0002751164,0.0005284852,0.001259733,0.002261554,0.003392291,0.002481676,0.002034962,0.0002208541],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00485791,"about_ca_system_score_gemma":0.01227033,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005775163,"about_ca_topic_score_gemma":0.008278861,"domain_scores_codex":[0.9213374,0.05757517,0.0027136,0.001792202,0.01552752,0.001054117],"domain_scores_gemma":[0.7125354,0.2073931,0.03337711,0.00802367,0.02950205,0.009168683],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.0003136536,0.0009531619,0.1988914,0.001200073,0.0001870901,0.00007280779,0.002731865,0.002804991,0.0004864026,0.002728742,0.006718946,0.782911],"study_design_scores_gemma":[0.000415258,0.007169906,0.8892595,0.008333305,0.0003898743,0.0006361808,0.006460797,0.04341718,0.003912404,0.0233971,0.01631372,0.0002947985],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7330735,0.02475309,0.1330213,0.08132339,0.0008227279,0.002066134,0.0003001086,0.001068927,0.02357075],"genre_scores_gemma":[0.953508,0.001984339,0.04242815,0.001048977,0.0001926868,0.0004260264,0.00006094842,0.00002581068,0.0003250421],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1037626,"threshold_uncertainty_score":0.5487557,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09104589761689608,"score_gpt":0.5133866432229481,"score_spread":0.4223407456060521,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}