{"id":"W4321376664","doi":"10.1080/10904018.2022.2164718","title":"DOES VIDEO BELONG IN L2 ACADEMIC LISTENING TESTS? STAKEHOLDERS’ PERCEPTIONS ABOUT TEST DIFFICULTY, AUTHENTICITY, AND MOTIVATION","year":2023,"lang":"en","type":"article","venue":"International Journal of Listening","topic":"Communication in Education and Healthcare","field":"Psychology","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Paragon Testing Enterprises; British Council; National Federation of Modern Language Teachers Associations; Educational Testing Service","keywords":"Active listening; Psychology; Perception; Test (biology); Social psychology; Applied psychology; Cognitive psychology; Communication","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007944668,0.0001373915,0.0002082966,0.0008317814,0.0001593309,0.0001161255,0.0005447627,0.0001366421,0.0004096562],"category_scores_gemma":[0.0012188,0.0001095027,0.00008749577,0.0003991101,0.0001015772,0.0003627663,0.000148507,0.000796369,0.00004115929],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001732743,"about_ca_system_score_gemma":0.00008853897,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000174882,"about_ca_topic_score_gemma":0.0001778078,"domain_scores_codex":[0.9980258,0.0001572925,0.0009296448,0.0002017715,0.0004525403,0.0002329836],"domain_scores_gemma":[0.9972754,0.001230973,0.000604872,0.0001914246,0.0005729023,0.0001244321],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00003553991,0.0001214867,0.9393336,0.00001691842,0.00005776841,0.0000294988,0.04192305,0.00009206006,0.002117404,0.001813856,0.001419287,0.01303953],"study_design_scores_gemma":[0.0007602029,0.00004587835,0.9709998,0.0004402836,0.00001506134,0.0001347096,0.02332146,0.0003532092,0.00001385752,0.0007721243,0.003022199,0.0001212017],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9793028,0.0002238685,0.000194435,0.01657018,0.002158702,0.0001227496,0.00002135838,0.00005361483,0.001352299],"genre_scores_gemma":[0.9953176,0.000363512,0.0005169632,0.000386769,0.0005729723,0.0000180199,0.00003589745,0.00002285492,0.002765364],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03166621,"threshold_uncertainty_score":0.4485449,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1099192116525557,"score_gpt":0.4251381891406588,"score_spread":0.3152189774881031,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}