{"id":"W4416807726","doi":"10.1016/j.asw.2025.100992","title":"How reliable and valid is peer evaluation in adolescents’ L2 argumentative writing?","year":2025,"lang":"en","type":"article","venue":"Assessing Writing","topic":"Writing and Handwriting Education","field":"Social Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"University of British Columbia","keywords":"Argumentative; Grammar; Peer assessment; Reliability (semiconductor); Literacy; Peer feedback; Second language writing","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07511803,0.0004766867,0.001245997,0.002298377,0.001446626,0.003621763,0.001577868,0.001113979,0.0007836855],"category_scores_gemma":[0.2114941,0.0005740536,0.001026461,0.001970434,0.002796901,0.003488556,0.002461629,0.001328481,0.0003914008],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001276719,"about_ca_system_score_gemma":0.002769407,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007944365,"about_ca_topic_score_gemma":0.009476788,"domain_scores_codex":[0.9259797,0.0491351,0.00698401,0.003935921,0.01242976,0.001535684],"domain_scores_gemma":[0.7991526,0.08732935,0.03885107,0.01383893,0.05751101,0.003317088],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001303003,0.0001704809,0.8925261,0.0004765791,0.0002528055,0.0001170222,0.02291124,0.0001604391,0.0003969514,0.0004425503,0.0006007086,0.08181486],"study_design_scores_gemma":[0.00003643521,0.0006981152,0.9575739,0.001366143,0.0003091262,0.0003736171,0.03013401,0.001871481,0.001926145,0.0008570952,0.004753916,0.00009988101],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9878033,0.002305238,0.003356206,0.001128239,0.0001733096,0.0002625914,0.0001307661,0.00003143922,0.004808882],"genre_scores_gemma":[0.9964881,0.000519535,0.002277837,0.00009982266,0.00005184058,0.0002132196,0.00007915042,0.00001508892,0.0002554171],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.07511803,"threshold_uncertainty_score":0.3972669,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05378053516253805,"score_gpt":0.4197787474552024,"score_spread":0.3659982122926643,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}