{"id":"W2616845762","doi":"10.3138/cjpe.328","title":"A Case Study of the Guiding Principles for Collaborative Approaches to Evaluation in a Developmental Evaluation Context","year":2017,"lang":"en","type":"article","venue":"Canadian Journal of Program Evaluation","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"Queen's University","funders":"","keywords":"Context (archaeology); Set (abstract data type); Reflection (computer programming); Engineering ethics; Sociology; Psychology; Knowledge management; Management science; Computer science; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gpt","categories":[],"domain":null,"study_design":"qualitative","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"},{"model":"grok","categories":[],"domain":null,"study_design":"qualitative","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"},{"model":"opus","categories":["metaresearch"],"domain":"methods","study_design":"qualitative","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"}],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.06480952,0.000163367,0.00034562,0.0007382032,0.0008690559,0.0006243639,0.0008291595,0.00007674073,0.0002319022],"category_scores_gemma":[0.02186915,0.0001144823,0.0001023671,0.0007839989,0.00009784094,0.0008614002,0.0000534292,0.0001188336,0.000004689034],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00162049,"about_ca_system_score_gemma":0.01570485,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001969104,"about_ca_topic_score_gemma":0.3927177,"domain_scores_codex":[0.9920684,0.001803158,0.001600682,0.0003288568,0.003932361,0.0002665349],"domain_scores_gemma":[0.9887931,0.0003774073,0.002079755,0.0005437232,0.007962837,0.000243155],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006512539,0.0002047071,0.1202412,0.000005962214,0.00005724065,0.000006940858,0.03357006,0.02023438,0.00003351323,0.0002192972,0.000224717,0.8251368],"study_design_scores_gemma":[0.007303105,0.001468128,0.2941539,0.000161774,0.000390063,0.0001913224,0.2069715,0.4834275,0.000364468,0.003024971,0.002290422,0.0002528885],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9844207,0.0001205143,0.0002335862,0.001412576,0.0006805535,0.01207716,0.00001259863,0.000002218585,0.001040132],"genre_scores_gemma":[0.995288,7.140827e-7,0.003044135,0.00004658863,0.00008135614,0.001489942,0.000005189169,0.0000108349,0.00003326395],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8248839,"threshold_uncertainty_score":0.9898752,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.9106579329392426,"score_gpt":0.5628987801781327,"score_spread":0.3477591527611099,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}