{"id":"W1531240630","doi":"10.58680/rte201424579","title":"A Framework for Using Consequential Validity Evidence in Evaluating Large-Scale Writing Assessments: A Canadian Study","year":2014,"lang":"en","type":"article","venue":"Research in the Teaching of English","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":49,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Ottawa; University of Lethbridge","funders":"","keywords":"Scale (ratio); Psychology; Test validity; Mathematics education; Pedagogy; Psychometrics; Developmental psychology; Geography","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.5714146,0.002600866,0.003979927,0.05165152,0.02616157,0.027731,0.01284131,0.005568066,0.003179229],"category_scores_gemma":[0.6624575,0.002663023,0.00407273,0.03503532,0.06085307,0.01866795,0.02445042,0.008102145,0.0003759248],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.1831381,"about_ca_system_score_gemma":0.3256985,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.7943796,"about_ca_topic_score_gemma":0.7955487,"domain_scores_codex":[0.3802666,0.4924845,0.0373527,0.01796358,0.06249193,0.009440643],"domain_scores_gemma":[0.2463685,0.5645608,0.03277368,0.0356144,0.1146283,0.00605428],"domain_codex":"methods","domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"observational","study_design_scores_codex":[0.0003226097,0.0003043728,0.04887108,0.006039891,0.0006939753,0.001233539,0.1574127,0.002682148,0.0007214453,0.6953988,0.003978986,0.08234052],"study_design_scores_gemma":[0.001482938,0.00127524,0.08026213,0.05126291,0.002768694,0.001309672,0.1757739,0.0254006,0.003137076,0.4943303,0.1620997,0.0008967958],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1537328,0.03619197,0.4112281,0.09531116,0.001421721,0.04249616,0.002015113,0.0003403416,0.2572626],"genre_scores_gemma":[0.6793953,0.004568573,0.2960778,0.004822715,0.0001035016,0.01277111,0.000356882,0.0001150571,0.001789084],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.5714146,"threshold_uncertainty_score":0.9474441,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.50791354546036,"score_gpt":0.5991396042643354,"score_spread":0.09122605880397539,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}