{"id":"W2782384206","doi":"10.1177/0265532217750692","title":"Examining sources of variability in repeaters’ L2 writing scores: The case of the PTE Academic writing section","year":2018,"lang":"en","type":"article","venue":"Language Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University","funders":"","keywords":"Test (biology); Psychology; Context (archaeology); Boston Naming Test; Language assessment; Language proficiency; Mathematics education; Cognition","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01680917,0.0005903814,0.0009403958,0.002077518,0.0007889246,0.001449179,0.001232195,0.0009154358,0.0008750019],"category_scores_gemma":[0.08644085,0.0004298863,0.001207516,0.001830958,0.0008822128,0.001172158,0.002051326,0.001258612,0.0003054514],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007867691,"about_ca_system_score_gemma":0.0007109115,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009939506,"about_ca_topic_score_gemma":0.01300357,"domain_scores_codex":[0.9786649,0.009484821,0.001519954,0.004085725,0.005554582,0.0006899992],"domain_scores_gemma":[0.882834,0.06778924,0.02032795,0.01847431,0.009355581,0.001218942],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001650633,0.00008151137,0.9730865,0.00004991613,0.0004904555,0.0002261814,0.006504957,0.0004934868,0.001100683,0.0002335684,0.0002576248,0.01730991],"study_design_scores_gemma":[0.000004315327,0.0001648292,0.9944717,0.00002485887,0.00006522344,0.00046772,0.001316674,0.001920923,0.000724516,0.0002548628,0.0005541747,0.00003021488],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.991251,0.0003736107,0.006684916,0.0001639738,0.00002614572,0.000063297,0.0003714664,0.00005441561,0.001011177],"genre_scores_gemma":[0.9973416,0.00005012375,0.001704032,0.00003121624,0.00001686343,0.00004417276,0.000371491,0.00002976491,0.0004107461],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01680917,"threshold_uncertainty_score":0.08889645,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3740090240133829,"score_gpt":0.4424069973241175,"score_spread":0.0683979733107346,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}