{"id":"W3207181862","doi":"","title":"Investigating Test Purpose Pluralism and Test Retrofitting in High-Stakes Language Proficiency Testing","year":2021,"lang":"en","type":"article","venue":"DOAJ (DOAJ: Directory of Open Access Journals)","topic":"Higher Education Learning Practices","field":"Social Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Queen's University","funders":"","keywords":"Test (biology); Language assessment; Psychology; Mathematics education; Geology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","metaepi_narrow","scholarly_communication","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.004619525,0.000248657,0.0005239954,0.0004305302,0.0009626795,0.00290482,0.001401112,0.0001377318,0.001923396],"category_scores_gemma":[0.07731518,0.0002577974,0.00005407176,0.003096519,0.0004119561,0.004017856,0.000559716,0.0007877066,0.00001252653],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001791898,"about_ca_system_score_gemma":0.0009550144,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01447787,"about_ca_topic_score_gemma":0.001266896,"domain_scores_codex":[0.9961253,0.0009809143,0.0008934023,0.0005649521,0.0008728151,0.0005625829],"domain_scores_gemma":[0.9891891,0.008229068,0.001322363,0.0003300634,0.0005932809,0.0003361574],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.000002490224,0.0001593792,0.9028301,0.00005402997,0.0000119259,0.00005253351,0.01732914,0.00003346484,0.07056365,0.0002411251,0.0007461669,0.007976005],"study_design_scores_gemma":[0.000269331,0.000009241776,0.9739543,0.0007775942,0.00003179644,0.00001236014,0.01430753,0.00004530352,0.005842234,0.0008748232,0.003520684,0.0003548714],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.980848,0.007078059,0.000006122179,0.002604633,0.0003933377,0.0003677306,0.00001189789,0.00007424994,0.008615972],"genre_scores_gemma":[0.9934672,0.0007751445,0.003591951,0.0003723879,0.0003531574,0.00003432953,0.000006936483,0.00004067279,0.001358285],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.07269566,"threshold_uncertainty_score":0.9999874,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2879308988340085,"score_gpt":0.5813397783383066,"score_spread":0.2934088795042982,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}