{"id":"W237532803","doi":"10.3138/cjpe.26.006","title":"The Essential Skills Series in Evaluation: Assessing the Validity of the ESS Participant Workshop Evaluation Questionnaire","year":2011,"lang":"en","type":"article","venue":"Canadian Journal of Program Evaluation","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"ca_institutions":"Centre de Liaison Sur l'Intervention et la Prévention Psychosociales; Université du Québec à Montréal; Université de Montréal","funders":"","keywords":"Psychology; Medical education; Applied psychology; Medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gpt","categories":[],"domain":null,"study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"},{"model":"grok","categories":[],"domain":null,"study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":true,"confidence":"high","status":"direct model label, unvalidated"},{"model":"opus","categories":[],"domain":null,"study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":true,"confidence":"medium","status":"direct model label, unvalidated"}],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.1013005,0.0001908422,0.0002976926,0.0003219803,0.0009840672,0.0007025307,0.001189448,0.000121263,0.001021024],"category_scores_gemma":[0.01912317,0.00009430009,0.0002239777,0.001641884,0.000541906,0.001379401,0.00004882348,0.0004302124,0.00001264478],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000639029,"about_ca_system_score_gemma":0.01187325,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0006206697,"about_ca_topic_score_gemma":0.07303869,"domain_scores_codex":[0.9838411,0.007246238,0.001937332,0.0002855865,0.006257947,0.0004317623],"domain_scores_gemma":[0.9881095,0.0008753238,0.001996249,0.0008092596,0.007996893,0.0002127336],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.0000307122,0.0001471939,0.1548779,0.000007096411,0.00006272527,0.00000150637,0.01161226,0.01419738,0.00004056496,0.001328093,0.000990496,0.8167041],"study_design_scores_gemma":[0.0009522966,0.0001591938,0.8014541,0.000229801,0.0004635141,0.00003065904,0.007948485,0.1469479,0.0004805289,0.0396121,0.001576455,0.0001449776],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9836564,0.001101163,0.0005890633,0.006704959,0.003220428,0.003116385,0.000003749146,0.000006790578,0.001601075],"genre_scores_gemma":[0.9988406,0.00002644611,0.0003909255,0.00008924334,0.0002286176,0.0003301539,0.00000494976,0.00001197377,0.0000770995],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8165591,"threshold_uncertainty_score":0.9998922,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.518137140465873,"score_gpt":0.548237636298514,"score_spread":0.03010049583264096,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}