{"id":"W4411780569","doi":"10.5539/elt.v18n7p48","title":"Evaluating GPT-4 Turbo`s Ability to Design English Reading Test Items for Language Learners","year":2025,"lang":"en","type":"article","venue":"English Language Teaching","topic":"Educational Technology and Assessment","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Psychology; Reading (process); Test (biology); Linguistics; Language assessment; Mathematics education","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.003967763,0.0002245529,0.0002469106,0.0002843809,0.0004287663,0.0002554691,0.001093018,0.0001396363,0.00001342592],"category_scores_gemma":[0.01894618,0.0002251148,0.00009409153,0.0004648138,0.00003695285,0.0004383058,0.0003130906,0.0006343568,0.000007495647],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002553464,"about_ca_system_score_gemma":0.0002052908,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00007028673,"about_ca_topic_score_gemma":0.00001035966,"domain_scores_codex":[0.997905,0.0003020813,0.00035376,0.0006993372,0.0002680355,0.0004718483],"domain_scores_gemma":[0.9960221,0.002802477,0.0001093092,0.0008221873,0.0001456654,0.00009824776],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.00002513508,0.0004958931,0.004823115,0.0001892281,0.00008743632,0.00001910698,0.5866172,0.003504656,0.0463637,0.07962529,0.005485121,0.2727641],"study_design_scores_gemma":[0.005199691,0.001826083,0.004198926,0.001856966,0.0002677361,0.00001766603,0.6370962,0.1444604,0.1691988,0.01487053,0.01713355,0.003873417],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5333949,0.0002876595,0.4540996,0.00108693,0.00147275,0.0009170473,0.000008821397,0.001236874,0.007495378],"genre_scores_gemma":[0.7477822,6.766716e-7,0.2500892,0.0004804402,0.0003564334,0.0001906436,0.0000119653,0.00001441664,0.001073996],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2688907,"threshold_uncertainty_score":0.9893177,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02722475778468759,"score_gpt":0.3750710716186919,"score_spread":0.3478463138340043,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}