{"id":"W4320894712","doi":"10.4300/jgme-d-22-00397.1","title":"Program Evaluation Use in Graduate Medical Education","year":2023,"lang":"en","type":"article","venue":"Journal of Graduate Medical Education","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Ottawa","funders":"University of Ottawa","keywords":"Timeline; Process (computing); Publication; Curriculum; Medical education; Program evaluation; Graduate medical education; Computer science; Psychology; Accreditation; Medicine; Political science; Pedagogy","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.03851812,0.0001889127,0.0004136499,0.001631827,0.0001285706,0.0003112605,0.0008575282,0.0002134356,0.003280424],"category_scores_gemma":[0.07346608,0.000134723,0.0001794809,0.003213524,0.00014508,0.001355601,0.00008053934,0.0008217715,0.0005038967],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003739013,"about_ca_system_score_gemma":0.02735132,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001093954,"about_ca_topic_score_gemma":0.0003298459,"domain_scores_codex":[0.9809217,0.001299461,0.002225998,0.0003606392,0.01483751,0.0003546732],"domain_scores_gemma":[0.9929926,0.001065586,0.0011115,0.0004224233,0.003625692,0.00078222],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.00003658381,0.001147376,0.02241398,0.00001072983,0.00001294275,0.000005633181,0.0009934905,0.00009367017,0.00000672061,0.0006004098,0.1209567,0.8537217],"study_design_scores_gemma":[0.0019157,0.000453546,0.7155604,0.0007134157,0.00007204721,0.0002090257,0.005316727,0.164278,0.0000474905,0.04476999,0.06635068,0.0003129831],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9189734,0.0001359855,0.000209646,0.07240203,0.00630579,0.0007459326,9.92443e-7,0.00003979223,0.001186373],"genre_scores_gemma":[0.9932703,0.0006671445,0.001025092,0.002702394,0.001007942,0.0002102714,0.00006291529,0.00001884731,0.001035122],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8534088,"threshold_uncertainty_score":0.9976307,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5342027688137225,"score_gpt":0.6158367903650068,"score_spread":0.0816340215512843,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}