{"id":"W4396625747","doi":"10.3138/cmlr-2023-0022","title":"Examining Performance on an Integrated Writing Task from a Canadian English Language Proficiency Test","year":2024,"lang":"en","type":"article","venue":"Canadian Modern Language Review/ La Revue canadienne des langues vivantes","topic":"Second Language Acquisition and Learning","field":"Psychology","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University","funders":"","keywords":"Test (biology); Task (project management); Computer science; Natural language processing; Language assessment; Linguistics; Psychology; Mathematics education; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0009901611,0.0005955182,0.0006549313,0.0009248512,0.00038164,0.0003333309,0.0006593533,0.0003002362,0.01289331],"category_scores_gemma":[0.001241496,0.0005791298,0.0001641569,0.0009127161,0.0001783535,0.0003776089,0.00002975491,0.0009922674,0.0005077807],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001145464,"about_ca_system_score_gemma":0.0006350716,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.7917644,"about_ca_topic_score_gemma":0.879683,"domain_scores_codex":[0.9959881,0.0004303083,0.0006239772,0.001147433,0.000151884,0.001658319],"domain_scores_gemma":[0.9961072,0.0006060078,0.0001244811,0.001026222,0.0001693143,0.001966801],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"qualitative","study_design_scores_codex":[0.00001790447,0.00007694321,0.003509017,0.002088096,0.0002445584,0.02571115,0.4091929,0.0000292937,0.00574923,0.0008922418,0.004314472,0.5481741],"study_design_scores_gemma":[0.001767392,0.001519135,0.1169788,0.05527549,0.0009228775,0.003222078,0.445019,0.0188556,0.0003793362,0.00009792171,0.3499794,0.005982945],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.826566,0.1484281,0.00003556856,0.0001867851,0.000643254,0.0005434186,0.001635163,0.0003884381,0.02157319],"genre_scores_gemma":[0.9865528,0.0006174613,0.0002694208,0.006458506,0.001060352,0.0001510364,0.002121588,0.000189852,0.002579023],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5421912,"threshold_uncertainty_score":0.999666,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01757527934679107,"score_gpt":0.2638428090947306,"score_spread":0.2462675297479396,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}