{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":3,"total_is_capped":false,"direct_labels_cover":0,"predictions_cover":3,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"9bc749b77fef","filters":{"venue":"Studies in Language Assessment"}},"results":[{"id":"W4376626995","doi":"10.58379/rshg8366","title":"DIF investigations across groups of gender and academic background in a large-scale high-stakes language test ","year":2015,"lang":"en","type":"article","venue":"Studies in Language Assessment","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"","funders":"Queen's University","keywords":"Test (biology); Differential item functioning; Psychology; Quality (philosophy); Reliability (semiconductor); Scale (ratio); Gender bias; Social psychology; Applied psychology; Mathematics education; Medical education; Item response theory; Developmental psychology; Psychometrics; Medicine","authors":[{"name":"Xiamei Song","is_ca":false},{"name":"Liying Cheng","is_ca":false},{"name":"Don A. Klinger","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.119758425185111,"gpt":0.46502313377722,"spread":0.3452647085921091,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001939991,0.0001865303,0.0004069052,0.0001291336,0.0001860482,0.00004365888,0.0002733563,0.0001244726,0.00003273934],"category_scores_gemma":[0.0004115948,0.0001718062,0.00003904311,0.0006056115,0.0006344239,0.0003222238,0.000325607,0.0003399829,0.000004799842],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003683697,"about_ca_system_score_gemma":0.0001569696,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001905362,"about_ca_topic_score_gemma":0.01828412,"domain_scores_codex":[0.9978556,0.0002315049,0.0004398239,0.0003319576,0.0005921518,0.00054896],"domain_scores_gemma":[0.9989382,0.0004792823,0.0001597371,0.0002010874,0.00009252957,0.0001291441],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"qualitative","study_design_scores_codex":[0.000005623615,0.0001455537,0.5478673,0.00003936946,0.00003510079,0.00003390112,0.4467611,0.000006284921,0.0003610139,0.004169225,0.0003469616,0.0002285759],"study_design_scores_gemma":[0.001042191,0.00004412037,0.2873902,0.00006271413,0.00001531911,6.906183e-7,0.7103823,0.00002939225,0.00003476147,0.0006744898,0.000172709,0.0001511045],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9863673,0.00474632,0.00004191389,0.0004094843,0.0003111734,0.0004164432,0.0000496051,0.00004042405,0.007617312],"genre_scores_gemma":[0.9959855,0.0006659263,0.002341677,0.0001463452,0.0001869852,0.00009009223,0.00001760981,0.00001535267,0.0005505265],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2636212,"threshold_uncertainty_score":0.9996296,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4376626656","doi":"10.58379/dayb9070","title":"Development of a Spanish generic writing skills scale for the Colombian Graduate Skills Assessment (Saber Pro)","year":2015,"lang":"en","type":"article","venue":"Studies in Language Assessment","topic":"Writing and Handwriting Education","field":"Social Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"La Trobe University","keywords":"Graduation (instrument); Scale (ratio); Context (archaeology); Mathematics education; Scripting language; Psychology; Trait; Test (biology); Writing assessment; Reliability (semiconductor); Pedagogy; Computer science; Geography; Mathematics; Cartography","authors":[{"name":"Ana María Ducasse","is_ca":false},{"name":"Kathryn Hill","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1354379703205154,"gpt":0.4766824069376233,"spread":0.3412444366171078,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004612387,0.0001589292,0.0003224117,0.00007917525,0.0006478963,0.00008066094,0.0002807725,0.00005763131,0.00001343202],"category_scores_gemma":[0.0005927331,0.0001266915,0.00006625184,0.0003452907,0.0003047361,0.0001186639,0.0001349869,0.0001640714,0.000002215073],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007453109,"about_ca_system_score_gemma":0.0009937494,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000444407,"about_ca_topic_score_gemma":0.004810864,"domain_scores_codex":[0.997812,0.0002323639,0.0005305607,0.0002999536,0.0006471022,0.0004779651],"domain_scores_gemma":[0.9983077,0.0006828599,0.0002607066,0.0002161606,0.0004446362,0.000087938],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.00001401824,0.001456786,0.03473744,0.0003031638,0.0003088425,0.000009918087,0.818673,0.00007656615,0.0006227655,0.004913619,0.008758749,0.1301251],"study_design_scores_gemma":[0.0009948866,0.00008912292,0.04586113,0.0003691068,0.00006331105,0.000001491247,0.9424212,0.0001130686,0.0006741986,0.0005276939,0.008589536,0.0002952572],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9762471,0.0009348325,0.0009461925,0.001768635,0.0009524928,0.001319331,0.00001266008,0.0000696745,0.0177491],"genre_scores_gemma":[0.9201474,0.0001247917,0.0775018,0.0001410778,0.0003981052,0.0006584292,0.00001374122,0.00001805027,0.0009966657],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1298299,"threshold_uncertainty_score":0.5166329,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4367592383","doi":"10.58379/homq5772","title":"Exploring shared and individual assessment of paired oral interactions","year":2022,"lang":"en","type":"article","venue":"Studies in Language Assessment","topic":"EFL/ESL Teaching and Learning","field":"Arts and Humanities","cited_by":1,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Concordia University","funders":"","keywords":"Rubric; Psychology; Task (project management); Variation (astronomy); Modality (human–computer interaction); Audiology; Cognitive psychology; Computer science; Medicine; Artificial intelligence; Mathematics education","authors":[{"name":"Pakize Uludag","is_ca":true},{"name":"Kim McDonough","is_ca":true},{"name":"Pavel Trofimovich","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3685810683728511,"gpt":0.4261905241132528,"spread":0.05760945574040166,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.000768922,0.0001213394,0.0002553964,0.0001785073,0.0005304935,0.00005245612,0.0001215545,0.000006601103,0.0009040879],"category_scores_gemma":[0.0000455749,0.0001129356,0.00004532537,0.00005941715,0.0001249146,0.0002344356,0.0004427721,0.0004450447,6.453278e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001683363,"about_ca_system_score_gemma":0.00003493149,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004829704,"about_ca_topic_score_gemma":0.000750738,"domain_scores_codex":[0.9987779,0.0002675606,0.0002750384,0.0002017184,0.0002878354,0.0001899827],"domain_scores_gemma":[0.9994713,0.0002078408,0.0001236703,0.0001409248,0.00003196018,0.00002431195],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.00001482843,0.0003812729,0.02952866,0.0001582327,0.0005140806,0.00008424769,0.904093,0.0005080926,0.0001762413,0.03894755,0.001758743,0.02383508],"study_design_scores_gemma":[0.0006283572,0.0002639533,0.03493162,0.00009970079,0.00005517793,0.000005481365,0.9327574,0.0004106492,0.000009327338,0.0001234323,0.03051106,0.0002038626],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9778717,0.0008324748,0.00001787189,0.0003161829,0.0008714101,0.0001623977,0.00005986465,0.00006103499,0.01980709],"genre_scores_gemma":[0.9973499,0.00005220014,0.001064009,0.00008328466,0.0001273338,0.0002771828,0.0000338347,0.00001490579,0.0009973133],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03882412,"threshold_uncertainty_score":0.9899129,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}