{"id":"W4389294437","doi":"10.1080/15434303.2023.2288253","title":"Validity Arguments for Automated Essay Scoring of Young Students’ Writing Traits","year":2023,"lang":"en","type":"article","venue":"Language Assessment Quarterly","topic":"Text Readability and Simplification","field":"Computer Science","cited_by":24,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Writing assessment; Consistency (knowledge bases); Context (archaeology); Vocabulary; Psychology; Inference; Argument (complex analysis); Formative assessment; Trait; Artificial intelligence; Natural language processing; Computer science; Mathematics education; Linguistics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2394291,0.001394173,0.00154497,0.005948508,0.003165643,0.008760588,0.004888351,0.003590815,0.00286906],"category_scores_gemma":[0.679516,0.001080217,0.002295502,0.00358941,0.01344043,0.009080148,0.007059562,0.004919419,0.0009716409],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00489859,"about_ca_system_score_gemma":0.004150737,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004871405,"about_ca_topic_score_gemma":0.002731176,"domain_scores_codex":[0.7255397,0.200425,0.01324781,0.02016597,0.03779344,0.002828021],"domain_scores_gemma":[0.1397443,0.7501418,0.02765603,0.04884825,0.03226558,0.001343967],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.004930359,0.001313598,0.5719006,0.0009624443,0.00182869,0.0005078285,0.01339225,0.02890253,0.003111244,0.1539545,0.00586557,0.2133304],"study_design_scores_gemma":[0.0008671816,0.002453372,0.2207034,0.001611138,0.0006872055,0.0007309751,0.005711642,0.4239153,0.01574371,0.3160672,0.01114306,0.0003658762],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5678994,0.002271663,0.361417,0.01914079,0.0007077638,0.001817696,0.001172129,0.0008032663,0.04477027],"genre_scores_gemma":[0.9499434,0.000104779,0.04696103,0.0007895456,0.0002151254,0.0006306105,0.000387895,0.0000935221,0.0008741515],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2394291,"threshold_uncertainty_score":0.9379193,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0296680655231284,"score_gpt":0.359881211422216,"score_spread":0.3302131458990876,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}