{"id":"W3125926441","doi":"10.1177/0829573520987753","title":"Accuracy of Automated Written Expression Curriculum-Based Measurement Scoring","year":2021,"lang":"en","type":"article","venue":"Canadian Journal of School Psychology","topic":"Writing and Handwriting Education","field":"Social Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University; University of British Columbia","funders":"Social Sciences and Humanities Research Council of Canada; Institute of Education Sciences","keywords":"Curriculum; Curriculum-based measurement; Expression (computer science); Writing assessment; Narrative; Word (group theory); Natural language processing; Artificial intelligence; Computer science; Psychology; Mathematics education; Linguistics; Curriculum development; Pedagogy","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001591472,0.00007274659,0.0001866111,0.0002532545,0.0002780278,0.00005965153,0.0002442735,0.0001106979,0.0004838014],"category_scores_gemma":[0.003871665,0.00007533014,0.00008449333,0.000346078,0.0001271648,0.0001481518,0.000004252748,0.0002577706,0.00001279129],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002455086,"about_ca_system_score_gemma":0.005497412,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004900096,"about_ca_topic_score_gemma":0.02140171,"domain_scores_codex":[0.9984636,0.0003562,0.0004234048,0.0001313075,0.0003261626,0.0002992914],"domain_scores_gemma":[0.9975572,0.00007776469,0.0003769229,0.0001584394,0.001222478,0.0006072299],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00005570673,0.0004910069,0.5827441,0.0001535263,0.0001448367,0.0005628178,0.008276506,0.000287214,0.09237994,0.002495689,0.2803477,0.03206097],"study_design_scores_gemma":[0.006263911,0.000580693,0.6318157,0.006977426,0.0002325453,0.000298091,0.05884855,0.0001645786,0.03250445,0.003748467,0.2574227,0.001142811],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9706158,0.0024133,0.0002667638,0.01263111,0.002051825,0.00009121273,0.000005015618,0.0000354043,0.01188957],"genre_scores_gemma":[0.9973354,0.00004663709,0.001555459,0.0005086777,0.0005004629,0.000001904014,0.000001757539,0.000008418095,0.00004133256],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.05987549,"threshold_uncertainty_score":0.9964551,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07501246287484065,"score_gpt":0.3842205940610423,"score_spread":0.3092081311862017,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}