{"id":"W4282931634","doi":"10.5539/elt.v15n7p75","title":"Validation of the Results of Linking Speaking Test of IELTS to China’s Standards of English Language Ability","year":2022,"lang":"en","type":"article","venue":"English Language Teaching","topic":"Educational Technology and Assessment","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Generalizability theory; Psychology; Consistency (knowledge bases); Test (biology); Mathematics education; Developmental psychology; Computer science","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003457096,0.0001064307,0.0002436432,0.0001585249,0.0001342978,0.00001265242,0.001089752,0.00004764598,0.00002076011],"category_scores_gemma":[0.00748427,0.00009194823,0.00009611593,0.0004759947,0.00006296066,0.0001843685,0.0007294088,0.0004786952,5.917508e-8],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000119992,"about_ca_system_score_gemma":0.0001924379,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004625548,"about_ca_topic_score_gemma":0.00003114111,"domain_scores_codex":[0.9980192,0.0003365514,0.0005490043,0.0002682698,0.0006732031,0.0001538335],"domain_scores_gemma":[0.9978826,0.0004836962,0.0005441558,0.000818731,0.0002446507,0.00002615757],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.00002889701,0.0005286599,0.01373239,0.0001639346,0.00003723407,0.000002454734,0.8992892,0.00382668,0.05727447,0.01044576,0.0001164275,0.01455389],"study_design_scores_gemma":[0.001173452,0.0004908481,0.02558342,0.0004907801,0.00004191795,0.000003028042,0.1577233,0.0009243951,0.811384,0.0008512017,0.0009997984,0.0003339333],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9900413,0.00009477089,0.004391878,0.000143423,0.0006250474,0.0002207088,0.0001923102,0.00006998817,0.004220618],"genre_scores_gemma":[0.9901942,5.883974e-7,0.009617549,0.00001775607,0.000105248,0.00001028257,0.00001449129,0.000007949811,0.0000319465],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7541095,"threshold_uncertainty_score":0.8959911,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.007618265817560001,"score_gpt":0.2864872787797649,"score_spread":0.2788690129622049,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}