{"id":"W3207181862","doi":"","title":"Investigating Test Purpose Pluralism and Test Retrofitting in High-Stakes Language Proficiency Testing","year":2021,"lang":"en","type":"article","venue":"DOAJ (DOAJ: Directory of Open Access Journals)","topic":"Higher Education Learning Practices","field":"Social Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Queen's University","funders":"","keywords":"Test (biology); Language assessment; Psychology; Mathematics education; Geology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2179137,0.0009539811,0.001188276,0.007294261,0.00305512,0.01168059,0.004293888,0.002900765,0.002759022],"category_scores_gemma":[0.4760554,0.001415598,0.002401962,0.008442963,0.0152181,0.0185608,0.01262416,0.005470776,0.0003870942],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01060175,"about_ca_system_score_gemma":0.01355986,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007780047,"about_ca_topic_score_gemma":0.01236105,"domain_scores_codex":[0.7233422,0.1947673,0.01519687,0.00973455,0.05207517,0.004883952],"domain_scores_gemma":[0.3075173,0.5702094,0.073407,0.02488473,0.02108259,0.002898929],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"qualitative","study_design_scores_codex":[0.0004427054,0.0007049753,0.4454545,0.003696294,0.0006567909,0.001317249,0.1101915,0.002278048,0.0006275576,0.09819417,0.002040697,0.3343956],"study_design_scores_gemma":[0.0002320508,0.002172046,0.4350458,0.03077566,0.002254444,0.006403984,0.191485,0.0232527,0.007660451,0.2422681,0.0579344,0.0005153119],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8327222,0.02169497,0.07643117,0.02099735,0.0003048214,0.0008420435,0.0002479845,0.0001678322,0.04659158],"genre_scores_gemma":[0.9789189,0.003320203,0.01507869,0.001359469,0.00006270195,0.0003232766,0.0001272436,0.0000599221,0.0007496151],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2179137,"threshold_uncertainty_score":0.9644516,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2879308988340085,"score_gpt":0.5813397783383066,"score_spread":0.2934088795042982,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}