{"id":"W4320894712","doi":"10.4300/jgme-d-22-00397.1","title":"Program Evaluation Use in Graduate Medical Education","year":2023,"lang":"en","type":"article","venue":"Journal of Graduate Medical Education","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Ottawa","funders":"University of Ottawa","keywords":"Timeline; Process (computing); Publication; Curriculum; Medical education; Program evaluation; Graduate medical education; Computer science; Psychology; Accreditation; Medicine; Political science; Pedagogy","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.3571777,0.0009227009,0.001794193,0.01015948,0.005622025,0.01344809,0.003577252,0.004390885,0.007957288],"category_scores_gemma":[0.5157045,0.001181914,0.001500535,0.01130701,0.00890169,0.01189074,0.01888752,0.005454078,0.001868525],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01725233,"about_ca_system_score_gemma":0.02737233,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004012225,"about_ca_topic_score_gemma":0.005665732,"domain_scores_codex":[0.4164625,0.5075652,0.03238115,0.005868905,0.03491038,0.002811935],"domain_scores_gemma":[0.3849336,0.4613087,0.03900493,0.0396915,0.06492374,0.01013745],"domain_codex":"methods","domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.0003078221,0.0003614631,0.009191794,0.006328327,0.0001230095,0.0003799392,0.04809537,0.0005233936,0.0005570988,0.05390541,0.05649285,0.8237335],"study_design_scores_gemma":[0.0001937151,0.001019572,0.02082194,0.04955776,0.0002139295,0.001561933,0.03521676,0.003224447,0.003618364,0.05909328,0.8250977,0.0003804115],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.05891688,0.1162986,0.3212693,0.1769515,0.01154416,0.00926178,0.000990833,0.008663815,0.2961032],"genre_scores_gemma":[0.5478194,0.02651846,0.3593555,0.0308546,0.00268739,0.01463738,0.0005973458,0.003372197,0.01415774],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.3571777,"threshold_uncertainty_score":0.7927144,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5342027688137225,"score_gpt":0.6158367903650068,"score_spread":0.0816340215512843,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}