{"id":"W2900390458","doi":"10.1177/0731948718803296","title":"The Potential for Automated Text Evaluation to Improve the Technical Adequacy of Written Expression Curriculum-Based Measurement","year":2018,"lang":"en","type":"article","venue":"Learning Disability Quarterly","topic":"Writing and Handwriting Education","field":"Social Sciences","cited_by":18,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Curriculum-based measurement; Construct validity; Psychology; Curriculum; Writing assessment; Expression (computer science); Construct (python library); Rating scale; Scale (ratio); Quality (philosophy); Natural language processing; Artificial intelligence; Machine learning; Computer science; Mathematics education; Clinical psychology; Psychometrics; Developmental psychology; Pedagogy; Curriculum development","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04108473,0.001119931,0.0008154204,0.004363204,0.00063114,0.002234659,0.001355149,0.0006343757,0.002472536],"category_scores_gemma":[0.1732931,0.0003939671,0.0005960733,0.002880469,0.0008012761,0.002303647,0.002065513,0.0008580756,0.001007491],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009604832,"about_ca_system_score_gemma":0.001766031,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003460892,"about_ca_topic_score_gemma":0.006308123,"domain_scores_codex":[0.9612262,0.02719263,0.002635133,0.002541507,0.005897358,0.0005071901],"domain_scores_gemma":[0.7295977,0.1910837,0.02109403,0.01935151,0.03757193,0.001301204],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006981188,0.0007368181,0.3214982,0.0005651322,0.0002421078,0.0000607149,0.0024179,0.006063019,0.007553303,0.001547373,0.004555492,0.6540619],"study_design_scores_gemma":[0.0002299893,0.003147303,0.8302247,0.0005926846,0.0002352737,0.0003672012,0.002715779,0.1142812,0.02690825,0.00646833,0.01459873,0.0002305172],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.747442,0.0008247875,0.2267897,0.0009788851,0.0002934622,0.002800599,0.001569337,0.003277857,0.01602343],"genre_scores_gemma":[0.8267901,0.0002803532,0.1675793,0.0002669417,0.00009972448,0.001812192,0.0009772381,0.0001736955,0.00202045],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.04108473,"threshold_uncertainty_score":0.2172794,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0245414221554363,"score_gpt":0.3552407992022679,"score_spread":0.3306993770468316,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}