{"id":"W3048273900","doi":"10.5539/ijel.v10n6p30","title":"An Evaluation of China’s Automated Scoring System Bingo English","year":2020,"lang":"en","type":"article","venue":"International Journal of English Linguistics","topic":"Text Readability and Simplification","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Fluency; China; Quality (philosophy); Test (biology); Scoring system; Psychology; Natural language processing; Artificial intelligence; Linguistics; Computer science; Mathematics education; Medicine; Political science","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01262719,0.0006702333,0.000682455,0.004618354,0.0006885281,0.001340805,0.001176349,0.0005212871,0.002499571],"category_scores_gemma":[0.02991038,0.0002237131,0.0002519822,0.002098916,0.0006141356,0.001725155,0.001935483,0.0004005305,0.0008561947],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001175926,"about_ca_system_score_gemma":0.001774468,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01183606,"about_ca_topic_score_gemma":0.0141039,"domain_scores_codex":[0.9909461,0.003664008,0.0008813727,0.0008527978,0.003342528,0.0003132947],"domain_scores_gemma":[0.9596271,0.01044839,0.002304937,0.00398194,0.02177699,0.001860623],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.002755116,0.001204891,0.1537088,0.0008738925,0.0001929698,0.0005206699,0.007076602,0.004515766,0.04379447,0.00204875,0.01104612,0.7722619],"study_design_scores_gemma":[0.0009233178,0.006241258,0.6648045,0.0002863035,0.0004025113,0.0009858002,0.006988415,0.2078938,0.06128959,0.001709948,0.04800782,0.0004668946],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9798645,0.0003739962,0.01170214,0.000224241,0.00008953661,0.000544958,0.0006625518,0.001853359,0.004684703],"genre_scores_gemma":[0.9536757,0.0002607598,0.03749089,0.000107145,0.00007596356,0.0004060632,0.001898796,0.0001578273,0.005926837],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01262719,"threshold_uncertainty_score":0.06677973,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03625590267231639,"score_gpt":0.3134911558562807,"score_spread":0.2772352531839643,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}