{"meta":{"query_hash":"9bc749b77fef","filters":{"venue":"Studies in Language Assessment"},"cohort_total":3,"direct_labels_cover":0,"predictions_cover":3,"exported":3,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/9bc749b77fef","api":"https://metacan.xera.ac/api/v1/cohort?venue=Studies+in+Language+Assessment"},"results":[{"id":"W4367592383","doi":"10.58379/homq5772","title":"Exploring shared and individual assessment of paired oral interactions","year":2022,"lang":"en","type":"article","venue":"Studies in Language Assessment","topic":"EFL/ESL Teaching and Learning","field":"Arts and Humanities","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Rubric; Psychology; Task (project management); Variation (astronomy); Modality (human–computer interaction); Audiology; Cognitive psychology; Computer science; Medicine; Artificial intelligence; Mathematics education","score_opus":0.3685810683728511,"score_gpt":0.42619052411325276,"score_spread":0.05760945574040166,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4367592383","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.97787166,0.0008324748,0.000017871891,0.00031618294,0.0008714101,0.00016239766,0.00005986465,0.000061034985,0.019807095],"genre_scores_gemma":[0.9973499,0.000052200136,0.0010640088,0.00008328466,0.00012733381,0.00027718284,0.0000338347,0.000014905789,0.0009973133],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.99877787,0.00026756062,0.00027503842,0.00020171839,0.00028783537,0.00018998266],"domain_scores_gemma":[0.9994713,0.0002078408,0.00012367034,0.00014092482,0.00003196018,0.000024311954],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00076892204,0.00012133945,0.00025539644,0.00017850731,0.0005304935,0.00005245612,0.00012155455,0.0000066011025,0.0009040879],"category_scores_gemma":[0.0000455749,0.000112935566,0.000045325374,0.00005941715,0.00012491464,0.00023443559,0.0004427721,0.00044504472,6.4532776e-7],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00001482843,0.0003812729,0.029528663,0.00015823267,0.0005140806,0.000084247695,0.90409297,0.0005080926,0.00017624133,0.038947552,0.0017587428,0.023835076],"study_design_scores_gemma":[0.00062835723,0.00026395335,0.034931622,0.00009970079,0.000055177934,0.000005481365,0.9327574,0.0004106492,0.000009327338,0.00012343226,0.03051106,0.00020386264],"about_ca_topic_score_codex":0.00048297035,"about_ca_topic_score_gemma":0.00075073796,"teacher_disagreement_score":0.038824122,"about_ca_system_score_codex":0.0001683363,"about_ca_system_score_gemma":0.000034931487,"threshold_uncertainty_score":0.98991287},"labels":[],"label_agreement":null},{"id":"W4376626656","doi":"10.58379/dayb9070","title":"Development of a Spanish generic writing skills scale for the Colombian Graduate Skills Assessment (Saber Pro)","year":2015,"lang":"en","type":"article","venue":"Studies in Language Assessment","topic":"Writing and Handwriting Education","field":"Social Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"La Trobe University","keywords":"Graduation (instrument); Scale (ratio); Context (archaeology); Mathematics education; Scripting language; Psychology; Trait; Test (biology); Writing assessment; Reliability (semiconductor); Pedagogy; Computer science; Geography; Mathematics; Cartography","score_opus":0.1354379703205154,"score_gpt":0.47668240693762326,"score_spread":0.34124443661710785,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4376626656","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9762471,0.0009348325,0.0009461925,0.0017686349,0.00095249276,0.001319331,0.000012660079,0.0000696745,0.017749095],"genre_scores_gemma":[0.92014736,0.00012479168,0.0775018,0.00014107779,0.00039810524,0.00065842917,0.000013741219,0.00001805027,0.0009966657],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.99781203,0.00023236389,0.00053056073,0.00029995362,0.00064710225,0.00047796508],"domain_scores_gemma":[0.9983077,0.00068285986,0.0002607066,0.00021616058,0.0004446362,0.000087938],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004612387,0.00015892916,0.00032241168,0.00007917525,0.0006478963,0.00008066094,0.00028077254,0.000057631307,0.000013432021],"category_scores_gemma":[0.0005927331,0.00012669149,0.000066251836,0.00034529073,0.0003047361,0.00011866394,0.0001349869,0.00016407143,0.0000022150734],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000140182365,0.0014567857,0.03473744,0.0003031638,0.00030884251,0.000009918087,0.818673,0.00007656615,0.0006227655,0.0049136193,0.008758749,0.13012512],"study_design_scores_gemma":[0.0009948866,0.00008912292,0.045861132,0.00036910683,0.00006331105,0.0000014912472,0.9424212,0.00011306856,0.0006741986,0.00052769395,0.008589536,0.00029525722],"about_ca_topic_score_codex":0.00044440696,"about_ca_topic_score_gemma":0.0048108636,"teacher_disagreement_score":0.12982987,"about_ca_system_score_codex":0.00074531086,"about_ca_system_score_gemma":0.0009937494,"threshold_uncertainty_score":0.51663285},"labels":[],"label_agreement":null},{"id":"W4376626995","doi":"10.58379/rshg8366","title":"DIF investigations across groups of gender and academic background in a large-scale high-stakes language test ","year":2015,"lang":"en","type":"article","venue":"Studies in Language Assessment","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Queen's University","keywords":"Test (biology); Differential item functioning; Psychology; Quality (philosophy); Reliability (semiconductor); Scale (ratio); Gender bias; Social psychology; Applied psychology; Mathematics education; Medical education; Item response theory; Developmental psychology; Psychometrics; Medicine","score_opus":0.11975842518511098,"score_gpt":0.46502313377722004,"score_spread":0.34526470859210906,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4376626995","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.98636734,0.0047463197,0.00004191389,0.0004094843,0.00031117335,0.00041644325,0.0000496051,0.000040424053,0.007617312],"genre_scores_gemma":[0.9959855,0.0006659263,0.0023416774,0.00014634518,0.00018698524,0.00009009223,0.000017609813,0.00001535267,0.00055052654],"study_design_codex":"observational","study_design_gemma":"qualitative","domain_scores_codex":[0.9978556,0.00023150495,0.0004398239,0.00033195756,0.0005921518,0.00054896],"domain_scores_gemma":[0.9989382,0.00047928235,0.00015973712,0.00020108743,0.00009252957,0.00012914411],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019399914,0.00018653033,0.00040690522,0.00012913356,0.00018604817,0.000043658878,0.00027335633,0.00012447257,0.000032739343],"category_scores_gemma":[0.00041159475,0.00017180621,0.000039043112,0.0006056115,0.00063442386,0.00032222382,0.000325607,0.0003399829,0.0000047998424],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000005623615,0.00014555367,0.5478673,0.00003936946,0.000035100787,0.000033901124,0.4467611,0.000006284921,0.00036101392,0.0041692248,0.0003469616,0.00022857585],"study_design_scores_gemma":[0.0010421908,0.000044120367,0.2873902,0.000062714134,0.00001531911,6.906183e-7,0.7103823,0.00002939225,0.000034761466,0.00067448977,0.00017270898,0.00015110451],"about_ca_topic_score_codex":0.0019053619,"about_ca_topic_score_gemma":0.018284118,"teacher_disagreement_score":0.2636212,"about_ca_system_score_codex":0.0003683697,"about_ca_system_score_gemma":0.00015696963,"threshold_uncertainty_score":0.9996296},"labels":[],"label_agreement":null}]}