{"id":"W2006318610","doi":"10.5054/tq.2010.214047","title":"Do ESL Essay Raters' Evaluation Criteria Change With Experience? A Mixed‐Methods, Cross‐Sectional Study","year":2010,"lang":"en","type":"article","venue":"TESOL Quarterly","topic":"Discourse Analysis in Language Studies","field":"Arts and Humanities","cited_by":70,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University","funders":"","keywords":"Psychology; Argumentation theory; Rating scale; Scale (ratio); Sample (material); Quality (philosophy); Social psychology; Applied psychology; Linguistics; Developmental psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05364491,0.0003317262,0.000637132,0.00232414,0.0007661876,0.002241199,0.0006859429,0.0007302653,0.0008190447],"category_scores_gemma":[0.1365297,0.0006055641,0.0005727444,0.001205702,0.0008602697,0.001915063,0.001322488,0.0008238371,0.0005566804],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000603798,"about_ca_system_score_gemma":0.0006463912,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0009399618,"about_ca_topic_score_gemma":0.001366951,"domain_scores_codex":[0.9717049,0.01719323,0.003218931,0.002081787,0.004883588,0.0009176078],"domain_scores_gemma":[0.8653373,0.05972607,0.03332599,0.007801523,0.03077471,0.003034501],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0003207043,0.0003963529,0.9455571,0.00009908765,0.0001439011,0.0001096704,0.02877266,0.00007243872,0.001099592,0.00007857908,0.0003036199,0.02304624],"study_design_scores_gemma":[0.00002672018,0.00154025,0.9717091,0.00008824741,0.00006110586,0.0004558382,0.02220129,0.0007015148,0.001499295,0.0001141238,0.001548231,0.00005427394],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9978366,0.0001976376,0.001172483,0.00007309307,0.00002008879,0.00007376061,0.00008481606,0.00001122955,0.0005303056],"genre_scores_gemma":[0.9975528,0.0001230835,0.001463895,0.00007551078,0.00002095539,0.0002314403,0.0001404852,0.00001114085,0.0003805975],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.05364491,"threshold_uncertainty_score":0.2837048,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06913721327542385,"score_gpt":0.4049282043392576,"score_spread":0.3357909910638337,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}