{"id":"W3125926441","doi":"10.1177/0829573520987753","title":"Accuracy of Automated Written Expression Curriculum-Based Measurement Scoring","year":2021,"lang":"en","type":"article","venue":"Canadian Journal of School Psychology","topic":"Writing and Handwriting Education","field":"Social Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University; University of British Columbia","funders":"Social Sciences and Humanities Research Council of Canada; Institute of Education Sciences","keywords":"Curriculum; Curriculum-based measurement; Expression (computer science); Writing assessment; Narrative; Word (group theory); Natural language processing; Artificial intelligence; Computer science; Psychology; Mathematics education; Linguistics; Curriculum development; Pedagogy","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02078168,0.0005019545,0.0006085056,0.002495813,0.0003320568,0.0014185,0.0009850506,0.0004435978,0.001008301],"category_scores_gemma":[0.1027096,0.0002937095,0.000320196,0.001575159,0.0004350228,0.0009016907,0.001403191,0.0003738106,0.0009136386],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005537579,"about_ca_system_score_gemma":0.0006578154,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003482006,"about_ca_topic_score_gemma":0.005235942,"domain_scores_codex":[0.9741173,0.01300817,0.002328463,0.00309433,0.0068957,0.0005560601],"domain_scores_gemma":[0.9187158,0.03716373,0.01174705,0.008692002,0.0227488,0.000932481],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0006809353,0.0003154881,0.6680914,0.0001659471,0.0001764911,0.0000498716,0.001800999,0.002560837,0.006642271,0.000365939,0.00189635,0.3172534],"study_design_scores_gemma":[0.00007432829,0.001027963,0.949828,0.00009028226,0.00005663303,0.0001736933,0.0007102476,0.03220297,0.01132944,0.0005270772,0.003910675,0.00006872768],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9715754,0.0002476591,0.02148042,0.0001128198,0.00006103618,0.0003620985,0.0007619195,0.0006194604,0.004779194],"genre_scores_gemma":[0.9823956,0.00008079223,0.01520635,0.00005827126,0.00001904811,0.0002796596,0.0005971249,0.00004638397,0.001316637],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02078168,"threshold_uncertainty_score":0.1099054,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07501246287484065,"score_gpt":0.3842205940610423,"score_spread":0.3092081311862017,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}