{"id":"W4366728273","doi":"10.21432/cjlt28241","title":"Automated Scoring of Speaking and Writing: Starting to Hit its Stride","year":2023,"lang":"en","type":"article","venue":"Canadian Journal of Learning and Technology","topic":"Second Language Acquisition and Learning","field":"Psychology","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Calgary; Queen's University","funders":"","keywords":"Context (archaeology); Computer science; Section (typography); Notation; Process (computing); Data science; Linguistics; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006108252,0.00008928798,0.0002307645,0.001547628,0.0001743858,0.00003103711,0.0001034293,0.0001310011,0.0007929573],"category_scores_gemma":[0.0007210276,0.00009414701,0.00002466822,0.0007559264,0.00007276783,0.00005219211,0.0000272964,0.0005090262,0.0000226999],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00002687831,"about_ca_system_score_gemma":0.00009824018,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003159474,"about_ca_topic_score_gemma":0.0002661395,"domain_scores_codex":[0.9990252,0.00007655579,0.000344281,0.0001447581,0.00006616031,0.00034308],"domain_scores_gemma":[0.9991851,0.0001204304,0.0002482911,0.0000745037,0.0001286972,0.000242979],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"qualitative","study_design_scores_codex":[0.0000660593,0.00001807114,0.5562011,0.0001478174,0.0003550686,0.005109883,0.02918023,0.0009625165,0.02960542,0.009383975,0.003011379,0.3659585],"study_design_scores_gemma":[0.00669123,0.003915806,0.2264256,0.003340778,0.0002687782,0.008104798,0.5890454,0.005941502,0.0100289,0.00119183,0.1433287,0.001716616],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9942684,0.002968618,0.0000360541,0.001539526,0.0001629951,0.00004440039,0.000002177367,0.0001437878,0.0008340902],"genre_scores_gemma":[0.9992884,0.000009488344,0.0002277189,0.000128215,0.00006660922,0.000001213113,0.00000145375,0.00001794145,0.0002589038],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5598652,"threshold_uncertainty_score":0.8682326,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01922601542231894,"score_gpt":0.3105721623918642,"score_spread":0.2913461469695453,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}