{"id":"W2053410856","doi":"10.5054/tj.2011.269751","title":"Generalizability Theory as Evidence of Concerns About Fairness in Large‐Scale ESL Writing Assessments","year":2011,"lang":"en","type":"article","venue":"TESOL Journal","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":16,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Generalizability theory; Rating scale; Reliability (semiconductor); Psychology; Variation (astronomy); Scale (ratio); Inter-rater reliability; Mathematics education; Developmental psychology; Geography","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2657934,0.000770367,0.001210625,0.003713858,0.002390285,0.003357508,0.002136484,0.002621186,0.003651628],"category_scores_gemma":[0.5384294,0.0006637615,0.002435057,0.002353877,0.01127686,0.006421719,0.004845568,0.004199011,0.0003245611],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003793095,"about_ca_system_score_gemma":0.002707834,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003673046,"about_ca_topic_score_gemma":0.002012534,"domain_scores_codex":[0.716629,0.192368,0.01381084,0.02291744,0.05168879,0.002585936],"domain_scores_gemma":[0.2270143,0.6487939,0.03394413,0.06338106,0.02561662,0.001250038],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00215312,0.001170711,0.5836595,0.002598284,0.002945408,0.001157705,0.06349207,0.01029631,0.006049889,0.1701732,0.003885626,0.1524182],"study_design_scores_gemma":[0.0007245232,0.006900851,0.4830637,0.00201366,0.001383155,0.003130452,0.02345445,0.05625848,0.01497673,0.3880354,0.01966422,0.0003942927],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.4780795,0.002231324,0.4381453,0.009308768,0.0008296572,0.003237358,0.0003823948,0.0005141868,0.0672715],"genre_scores_gemma":[0.9799396,0.0001089882,0.01740044,0.0009715423,0.0001470079,0.0007589685,0.00007912635,0.00006184834,0.0005326284],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2657934,"threshold_uncertainty_score":0.9054074,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.112657399584718,"score_gpt":0.4387508983425095,"score_spread":0.3260934987577915,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}