{"id":"W4378223319","doi":"10.1002/ev.20539","title":"Meeting the challenges of educating internal evaluators","year":2023,"lang":"en","type":"article","venue":"New Directions for Evaluation","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"Institute for Clinical Evaluative Sciences; Queen's University","funders":"","keywords":"Front line; Public relations; Geopolitics; Coronavirus disease 2019 (COVID-19); Pandemic; Program evaluation; Political science; Business; Medicine; Public administration","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1775569,0.0008783411,0.001064681,0.002188819,0.008922302,0.02367754,0.002829886,0.005399364,0.007904977],"category_scores_gemma":[0.1826908,0.0007156722,0.0007141907,0.0009225427,0.009942832,0.01261199,0.01500298,0.01348913,0.002817972],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.008452885,"about_ca_system_score_gemma":0.02942002,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00271299,"about_ca_topic_score_gemma":0.005311442,"domain_scores_codex":[0.8542297,0.1151098,0.003889264,0.003615327,0.01607137,0.007084548],"domain_scores_gemma":[0.598514,0.244903,0.01793634,0.01517175,0.08644867,0.03702622],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.000210006,0.001474737,0.01817996,0.001724253,0.0001480799,0.0004887077,0.07187869,0.00216578,0.00172426,0.07008024,0.2616135,0.5703118],"study_design_scores_gemma":[0.0002894585,0.0008883237,0.01341982,0.008354655,0.0001039612,0.0009286759,0.1598318,0.006124446,0.004542664,0.1417493,0.6634736,0.0002933007],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"commentary","genre_gemma":"empirical","genre_scores_codex":[0.08380216,0.01468474,0.07172196,0.7635204,0.004373027,0.000584449,0.00006500858,0.0007913565,0.06045701],"genre_scores_gemma":[0.7817616,0.01076962,0.08398671,0.09212858,0.003077033,0.001050103,0.0001225845,0.0004581846,0.02664566],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.1775569,"threshold_uncertainty_score":0.9390219,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3888663697506948,"score_gpt":0.5659171151344419,"score_spread":0.1770507453837471,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}