{"id":"W4407721618","doi":"10.1177/23821205251321791","title":"Program Evaluation in Competence by Design: A Mixed-Methods Study","year":2025,"lang":"en","type":"article","venue":"Journal of Medical Education and Curricular Development","topic":"Innovations in Medical Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Ottawa","funders":"","keywords":"Competence (human resources); Descriptive statistics; Medical education; Program evaluation; Specialty; Subspecialty; Program Design Language; Curriculum; Psychology; Computer science; Medicine; Family medicine; Political science; Pedagogy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1633517,0.00159496,0.002976974,0.005546407,0.004476161,0.005159983,0.00318141,0.002677647,0.005150069],"category_scores_gemma":[0.1265295,0.001826298,0.002956948,0.005449184,0.003041715,0.003988772,0.003991366,0.002078416,0.0007211668],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.009171083,"about_ca_system_score_gemma":0.01557049,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002727738,"about_ca_topic_score_gemma":0.005269241,"domain_scores_codex":[0.8159708,0.1496804,0.01050709,0.007893853,0.01225234,0.003695477],"domain_scores_gemma":[0.7997844,0.1577406,0.01586031,0.00857395,0.01542953,0.00261125],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.006763998,0.02942077,0.1064783,0.0293372,0.001851936,0.001553579,0.259068,0.002484011,0.004395721,0.01333447,0.005912961,0.5393991],"study_design_scores_gemma":[0.0174131,0.1072346,0.1856773,0.03913118,0.004111374,0.001877363,0.4352365,0.02042886,0.01484893,0.02598274,0.1470639,0.0009942137],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7087975,0.005039193,0.08887026,0.001466373,0.0003208435,0.1861855,0.001210989,0.0002059924,0.007903335],"genre_scores_gemma":[0.4757104,0.002184574,0.2222782,0.003106751,0.0002310114,0.2937148,0.0004566764,0.0001228112,0.002194823],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1633517,"threshold_uncertainty_score":0.8638968,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02647637743565949,"score_gpt":0.4709311998325691,"score_spread":0.4444548223969096,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}