{"id":"W4366449571","doi":"10.3138/cjpe.0022.005","title":"Design and Development Issues in Provincial Large-Scale Assessments: Designing Assessments to Inform Policy and Practice","year":2008,"lang":"en","type":"article","venue":"Canadian Journal of Program Evaluation","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Accountability; Scale (ratio); Quality (philosophy); Key (lock); Management science; Engineering ethics; Political science; Psychology; Public relations; Computer science; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02446746,0.0001591875,0.0002775468,0.001329653,0.0004544049,0.0004657198,0.0002554074,0.00008495163,0.0001561376],"category_scores_gemma":[0.005523701,0.0001344628,0.00002451928,0.001023336,0.00006451082,0.001901001,0.00003862026,0.0002112392,0.00002148901],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000845706,"about_ca_system_score_gemma":0.013948,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0006427153,"about_ca_topic_score_gemma":0.009425364,"domain_scores_codex":[0.9952442,0.000879843,0.00104136,0.0002587216,0.002177667,0.0003982183],"domain_scores_gemma":[0.9960716,0.0005987624,0.0005780642,0.0001629941,0.001980313,0.0006082808],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.0001104711,0.0001088975,0.05288415,0.000007444217,0.00003120242,0.00002623957,0.01452983,0.002323783,0.00007129442,0.0001281865,0.000939897,0.9288386],"study_design_scores_gemma":[0.005258287,0.002997251,0.5591237,0.000249765,0.00008926293,0.0006682501,0.01821412,0.0741832,0.0005553088,0.001905378,0.3360789,0.0006766362],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8143609,0.0006595979,0.1690318,0.007636425,0.0004953044,0.004570106,0.000005208527,0.00001918444,0.003221522],"genre_scores_gemma":[0.621602,0.00004665454,0.3771822,0.0007204772,0.0001193294,0.000129226,0.000005558464,0.00001185527,0.0001827325],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.928162,"threshold_uncertainty_score":0.991642,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4087057107089686,"score_gpt":0.5695313585263149,"score_spread":0.1608256478173463,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}