{"id":"W2789355765","doi":"10.1080/09500782.2018.1430825","title":"Initial assessment for K-12 English language support in six countries: revisiting the validity–reliability paradox","year":2018,"lang":"en","type":"article","venue":"Language and Education","topic":"Multilingual Education and Policy","field":"Social Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"Institute for Christian Studies; University of Toronto","funders":"","keywords":"Construct validity; Construct (python library); Reliability (semiconductor); Psychology; Writing assessment; Validity; Language assessment; Argument (complex analysis); Variance (accounting); Equity (law); Predictive validity; Computer science; Mathematics education; Psychometrics; Political science; Developmental psychology; Economics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1511082,0.0005685965,0.0008330457,0.005840639,0.004094956,0.005880812,0.002447502,0.001493657,0.00118287],"category_scores_gemma":[0.2481518,0.0007151084,0.0008192714,0.005350608,0.005911145,0.007189658,0.009255801,0.003746935,0.0002580138],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.008543628,"about_ca_system_score_gemma":0.01894746,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02499588,"about_ca_topic_score_gemma":0.02489993,"domain_scores_codex":[0.9111493,0.05429688,0.01116243,0.00393983,0.01514852,0.004303024],"domain_scores_gemma":[0.7410582,0.1340743,0.0226112,0.01858627,0.07732719,0.006342814],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0005111204,0.0004493621,0.6368481,0.0009848359,0.0001771379,0.0005649233,0.06245562,0.00303067,0.002273861,0.08603589,0.004628177,0.2020403],"study_design_scores_gemma":[0.0001465673,0.001721282,0.8125858,0.004420137,0.0002050304,0.0006234599,0.09246089,0.008039149,0.01217229,0.03060232,0.03669835,0.0003247156],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9240007,0.001861146,0.02763663,0.01516141,0.0002426768,0.000815945,0.0004365406,0.00008341982,0.02976158],"genre_scores_gemma":[0.9664713,0.0004641645,0.03041783,0.000733929,0.00002137916,0.0007079035,0.0002047438,0.00002798187,0.000950841],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1511082,"threshold_uncertainty_score":0.7991461,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04921096980836722,"score_gpt":0.4818473775180079,"score_spread":0.4326364077096407,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}