{"id":"W1559496221","doi":"10.3138/cjpe.28.005","title":"Neutral Assessment of the National Research Council Canada Evaluation Function","year":2013,"lang":"en","type":"article","venue":"Canadian Journal of Program Evaluation","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"École Nationale d'Administration Publique; National Research Council Canada","funders":"","keywords":"Treasury; Function (biology); Government (linguistics); Research council; Public administration; Political science; Public relations; Accounting; Business; Law","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2125775,0.001155102,0.001121275,0.006865222,0.007067619,0.01198971,0.003990761,0.001633654,0.00413858],"category_scores_gemma":[0.2244187,0.0006354731,0.001376204,0.004113114,0.004764839,0.003529104,0.005795569,0.002752344,0.001444765],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.09943515,"about_ca_system_score_gemma":0.2204216,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.7164484,"about_ca_topic_score_gemma":0.6857876,"domain_scores_codex":[0.8060448,0.07019611,0.01048791,0.004759947,0.09992687,0.008584402],"domain_scores_gemma":[0.5214064,0.03068439,0.007147778,0.009581304,0.4227909,0.008389266],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.002325173,0.001108838,0.1059838,0.001499397,0.0003574285,0.0002310459,0.009951727,0.0169565,0.005345717,0.1758569,0.1663644,0.5140191],"study_design_scores_gemma":[0.0009515497,0.00331041,0.3525788,0.003453738,0.0006151008,0.0003980318,0.01424821,0.08449768,0.02380743,0.04242583,0.472331,0.001382146],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"other","genre_gemma":"empirical","genre_scores_codex":[0.2593128,0.003755733,0.184157,0.01967737,0.00149355,0.0108318,0.003766039,0.002531329,0.5144744],"genre_scores_gemma":[0.8452289,0.0006551847,0.1192299,0.002203269,0.00007427444,0.00314884,0.001906365,0.000336521,0.0272168],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9005648,"threshold_uncertainty_score":0.9710321,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.7595030484590533,"score_gpt":0.59285100163704,"score_spread":0.1666520468220133,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}