{"id":"W4399652816","doi":"10.1111/capa.12571","title":"Navigating the challenges of policy evaluation","year":2024,"lang":"en","type":"article","venue":"Canadian Public Administration","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université Laval","funders":"","keywords":"Accountability; Work (physics); Rationality; Political science; Management science; Engineering ethics; Public relations; Public administration; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.007501695,0.00007790691,0.00008988748,0.0002169431,0.0001977081,0.0005115708,0.0003426953,0.00005994009,0.001501891],"category_scores_gemma":[0.003053474,0.00005091129,0.00005574664,0.000983043,0.00007391582,0.0006133865,0.00001338348,0.0001738639,0.0002194361],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000275724,"about_ca_system_score_gemma":0.0114886,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007458447,"about_ca_topic_score_gemma":0.1479686,"domain_scores_codex":[0.9974661,0.0002671021,0.0004554158,0.0002381038,0.001382956,0.0001903115],"domain_scores_gemma":[0.9981876,0.0005030563,0.0001174317,0.0003688054,0.0006406452,0.0001824554],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","study_design_scores_codex":[6.639287e-7,0.000003745206,0.0001956127,0.000004239656,0.000006162869,6.392454e-7,0.0005292247,0.000007982188,0.00001702356,0.5249663,0.001186374,0.473082],"study_design_scores_gemma":[0.000259086,0.0002564811,0.02262317,0.0001211371,0.00003459529,0.0000450282,0.01106071,0.2364909,0.0005000148,0.1327323,0.5955983,0.0002783304],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"commentary","genre_gemma":"empirical","genre_scores_codex":[0.1828386,0.002037309,0.0004940438,0.7499803,0.0007971847,0.000529464,0.00004133045,0.00003960128,0.06324217],"genre_scores_gemma":[0.9989862,0.00003614336,0.00005490686,0.0003579533,0.0002702592,0.00004387105,0.00002371652,0.000006160892,0.0002207828],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8161476,"threshold_uncertainty_score":0.9994109,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3086440193675319,"score_gpt":0.5311292359529306,"score_spread":0.2224852165853987,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}