{"id":"W4366449571","doi":"10.3138/cjpe.0022.005","title":"Design and Development Issues in Provincial Large-Scale Assessments: Designing Assessments to Inform Policy and Practice","year":2008,"lang":"en","type":"article","venue":"Canadian Journal of Program Evaluation","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Accountability; Scale (ratio); Quality (philosophy); Key (lock); Management science; Engineering ethics; Political science; Psychology; Public relations; Computer science; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.4132288,0.001125854,0.001901044,0.00482254,0.008168668,0.01438415,0.005010139,0.00319421,0.002532111],"category_scores_gemma":[0.6437905,0.001927073,0.001265194,0.01031901,0.009698749,0.01164227,0.009484575,0.005461895,0.0009149549],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.04949429,"about_ca_system_score_gemma":0.1725433,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.1617533,"about_ca_topic_score_gemma":0.2760282,"domain_scores_codex":[0.5765212,0.3575617,0.02078279,0.006106496,0.03383081,0.005196918],"domain_scores_gemma":[0.2854214,0.4727946,0.03756553,0.04490364,0.1509558,0.008359139],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.001555851,0.002018018,0.1235501,0.009077248,0.0006561511,0.0004115592,0.05922135,0.05147318,0.002738642,0.1282359,0.02441328,0.5966488],"study_design_scores_gemma":[0.003304177,0.00369227,0.1671321,0.0194243,0.001112825,0.00035807,0.08148585,0.1645287,0.01143432,0.3897425,0.1568957,0.0008893116],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1655314,0.004003033,0.6015096,0.05401365,0.00101312,0.08648338,0.002334779,0.001467923,0.08364294],"genre_scores_gemma":[0.4996287,0.0008193658,0.470756,0.001454997,0.00008395852,0.02558535,0.0003637471,0.0001228875,0.001184939],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.4132288,"threshold_uncertainty_score":0.7235934,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4087057107089686,"score_gpt":0.5695313585263149,"score_spread":0.1608256478173463,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}