{"id":"W1559496221","doi":"10.3138/cjpe.28.005","title":"Neutral Assessment of the National Research Council Canada Evaluation Function","year":2013,"lang":"en","type":"article","venue":"Canadian Journal of Program Evaluation","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"École Nationale d'Administration Publique; National Research Council Canada","funders":"","keywords":"Treasury; Function (biology); Government (linguistics); Research council; Public administration; Political science; Public relations; Accounting; Business; Law","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.1275013,0.0001214777,0.0002151316,0.0004622252,0.0004722679,0.0003812719,0.0007250073,0.00008507197,0.005855021],"category_scores_gemma":[0.02127089,0.00007953943,0.0001258014,0.001592084,0.0001744855,0.0008336924,0.00002530787,0.0004427971,0.00002738401],"about_ca_system_candidate":true,"about_ca_system_consensus":true,"about_ca_system_score_codex":0.01362382,"about_ca_system_score_gemma":0.2217632,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.2753851,"about_ca_topic_score_gemma":0.9455593,"domain_scores_codex":[0.9661093,0.002408926,0.00128267,0.0002379479,0.02960201,0.0003591781],"domain_scores_gemma":[0.8789093,0.0005457408,0.0008904769,0.0002950164,0.1190457,0.0003137271],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.00001730122,0.0001088918,0.05064125,0.00001182723,0.00009090568,5.830192e-7,0.0007014079,0.05111915,0.0004274606,0.003353371,0.3371784,0.5563495],"study_design_scores_gemma":[0.0008444886,0.000298619,0.6398241,0.00004153229,0.00006952354,0.00001213905,0.001165873,0.2611075,0.0000868081,0.02909739,0.06735183,0.0001002381],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9370078,0.0002967715,0.0002436765,0.01068968,0.003086902,0.003871307,0.00001807567,0.000004896038,0.0447809],"genre_scores_gemma":[0.9983985,0.000002939043,0.0005531764,0.0003020627,0.0002454915,0.0002408982,0.000005556917,0.000008468025,0.0002429478],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.6701742,"threshold_uncertainty_score":0.9950538,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.7595030484590533,"score_gpt":0.59285100163704,"score_spread":0.1666520468220133,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}