{"id":"W2133584145","doi":"","title":"Improving the Utility of Large-Scale Assessments in Canada","year":2014,"lang":"en","type":"article","venue":"Canadian Journal of Education / Revue canadienne de l éducation","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Strengths and weaknesses; Scale (ratio); Schedule; Mathematics education; Reliability (semiconductor); Psychology; Computer science; Social psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.008568233,0.0001031933,0.0002380063,0.0005151918,0.0001589285,0.00008449422,0.0006901544,0.00004803096,0.001028087],"category_scores_gemma":[0.00365268,0.00008295046,0.00006183882,0.0008174643,0.00004410539,0.0003529256,0.00001026224,0.0002453528,0.000005218736],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003636384,"about_ca_system_score_gemma":0.06808227,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.9283084,"about_ca_topic_score_gemma":0.9997468,"domain_scores_codex":[0.9975908,0.0004573651,0.00100848,0.0001841891,0.0003435462,0.0004156173],"domain_scores_gemma":[0.9960342,0.0004788919,0.0009729681,0.0004925131,0.001381656,0.0006397367],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0000123872,0.00007765101,0.8137444,0.00004388819,0.00001624432,0.000002082804,0.02421531,0.0008800939,0.0001436585,0.002683541,0.03041013,0.1277706],"study_design_scores_gemma":[0.0002303331,0.00004899444,0.8650723,0.00007219709,0.00001839995,0.00004453454,0.05585564,0.02226794,0.0001193364,0.00316059,0.05299303,0.0001167266],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9869111,0.00008783513,0.001250136,0.004887987,0.003599828,0.0001454017,0.00001636642,8.497778e-7,0.003100509],"genre_scores_gemma":[0.9978553,0.000004178068,0.0004907617,0.0009115385,0.0002005009,0.000009931269,0.000008875982,0.000007605646,0.0005112992],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1276539,"threshold_uncertainty_score":0.9998851,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1160623273922698,"score_gpt":0.4076064290081847,"score_spread":0.2915441016159148,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}