{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":12,"total_is_capped":false,"direct_labels_cover":0,"predictions_cover":12,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"f042d3dd4442","filters":{"venue":"Applied Measurement in Education"}},"results":[{"id":"W1969608664","doi":"10.1207/s15324818ame1703_4","title":"Comparability of Bilingual Versions of Assessments: Sources of Incomparability of English and French Versions of Canada's National Achievement Tests","year":2004,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":62,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"University of British Columbia","funders":"","keywords":"Comparability; Differential item functioning; Psychology; Reading (process); Item response theory; Psychometrics; Developmental psychology; Linguistics; Mathematics","authors":[{"name":"Kadriye Ercikan","is_ca":true},{"name":"Mark J. Gierl","is_ca":false},{"name":"Tanya McCreith","is_ca":false},{"name":"Gautam Puhan","is_ca":false},{"name":"Kim Koh","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2715701847682983,"gpt":0.4269062826454618,"spread":0.1553360978771635,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0320853,0.0004879662,0.000537482,0.005197952,0.001374816,0.002484314,0.0009546398,0.0004897254,0.001106408],"category_scores_gemma":[0.1889536,0.0003183168,0.0009230584,0.004289061,0.001523735,0.0009018557,0.002528505,0.0007528128,0.0001518086],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004949719,"about_ca_system_score_gemma":0.003753053,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.1367502,"about_ca_topic_score_gemma":0.1579752,"domain_scores_codex":[0.9503952,0.01915667,0.00426329,0.003551348,0.02090136,0.001732103],"domain_scores_gemma":[0.8395087,0.08366546,0.02170901,0.0120671,0.04122027,0.001829411],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0006855741,0.00006081292,0.9507224,0.0001258675,0.00051026,0.0001776721,0.008728288,0.0004190057,0.001699013,0.0007191888,0.0004441222,0.03570781],"study_design_scores_gemma":[0.00001900461,0.0001257553,0.993152,0.00008943384,0.00009837085,0.000223094,0.002251919,0.0008106164,0.001479798,0.0003582015,0.001363946,0.00002796439],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9926063,0.0004927571,0.002086203,0.0002155927,0.00003336086,0.00006888485,0.0006606175,0.00002577077,0.003810533],"genre_scores_gemma":[0.9983359,0.00006911471,0.0007465294,0.00004521537,0.00001012904,0.00002738183,0.0005189297,0.00001394859,0.000232863],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9950503,"threshold_uncertainty_score":0.2719085,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2053906918","doi":"10.1207/s15324818ame1703_2","title":"Performance of SIBTEST When the Percentage of DIF Items is Large","year":2004,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":39,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Differential item functioning; Statistics; Psychology; Item response theory; Test (biology); Mathematics; Psychometrics","authors":[{"name":"Mark J. Gierl","is_ca":true},{"name":"Andrea Gotzmann","is_ca":false},{"name":"Keith A. Boughton","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3321836598049474,"gpt":0.4109344435671419,"spread":0.07875078376219452,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02477504,0.001641143,0.001771437,0.002318656,0.0007834369,0.002083973,0.001217757,0.001533337,0.004656591],"category_scores_gemma":[0.09194066,0.000654955,0.001489243,0.001507591,0.0008673647,0.002091367,0.001612572,0.001309941,0.002804873],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005502166,"about_ca_system_score_gemma":0.001273194,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00294394,"about_ca_topic_score_gemma":0.003944629,"domain_scores_codex":[0.9811476,0.01004727,0.001889201,0.002806783,0.003459046,0.0006501811],"domain_scores_gemma":[0.9234045,0.05459549,0.006087605,0.005880704,0.008133998,0.001897748],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.008829908,0.001311754,0.5652688,0.001166707,0.001398823,0.001030175,0.004090509,0.01498537,0.02622302,0.002973807,0.01401599,0.3587052],"study_design_scores_gemma":[0.0005640925,0.006697451,0.5920144,0.0006295079,0.0009421539,0.004017978,0.002910102,0.2875109,0.07258778,0.008994949,0.02258573,0.000544895],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8525929,0.001204675,0.1232886,0.0005530255,0.0004545785,0.0007577099,0.002012131,0.003553737,0.01558253],"genre_scores_gemma":[0.9213829,0.0002593753,0.07272808,0.0002804529,0.00003970414,0.0007300063,0.001404329,0.0004083549,0.002766829],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02477504,"threshold_uncertainty_score":0.1310245,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2320000683","doi":"10.1080/08957347.2016.1171768","title":"Evaluating the Psychometric Characteristics of Generated Multiple-Choice Test Items","year":2016,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":33,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Medical Council of Canada; University of Ottawa; University of Alberta","funders":"","keywords":"Item response theory; Item bank; Item analysis; Licensure; Psychology; Test (biology); Psychometrics; Cognition; Multiple choice; Differential item functioning; Applied psychology; Cognitive psychology; Computer science; Clinical psychology; Statistics; Medicine; Medical education","authors":[{"name":"Mark J. Gierl","is_ca":true},{"name":"Hollis Lai","is_ca":true},{"name":"Debra Pugh","is_ca":true},{"name":"Claire Touchie","is_ca":true},{"name":"André-Philippe Boulais","is_ca":true},{"name":"André De Champlain","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1433803510187834,"gpt":0.4009891954820371,"spread":0.2576088444632537,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02704178,0.0005458167,0.0004600293,0.002563701,0.0002821742,0.001159438,0.0009750884,0.0009342115,0.00230499],"category_scores_gemma":[0.1338513,0.0002502147,0.001010013,0.001698875,0.0007970747,0.001305045,0.001064548,0.0007313142,0.00078723],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000534819,"about_ca_system_score_gemma":0.000527347,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003816047,"about_ca_topic_score_gemma":0.0005343449,"domain_scores_codex":[0.9808663,0.008604432,0.003237362,0.0009974996,0.00581453,0.0004798383],"domain_scores_gemma":[0.8425999,0.1144378,0.01145136,0.009852418,0.02064885,0.001009723],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001210173,0.001015507,0.8620313,0.0002039495,0.0004323597,0.0001998793,0.001985159,0.004520538,0.006516681,0.001061137,0.001008292,0.1198151],"study_design_scores_gemma":[0.0001332789,0.00298945,0.9670588,0.0001180545,0.00008626943,0.0005332591,0.001089029,0.01337985,0.01059085,0.001792588,0.002165712,0.00006286136],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9837143,0.0001271725,0.01241734,0.000101322,0.00002857027,0.0003477771,0.0005550879,0.00008641482,0.002622001],"genre_scores_gemma":[0.9845279,0.00007408084,0.01341973,0.000061696,0.00001592673,0.0004001128,0.001055579,0.0000443769,0.0004005267],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02704178,"threshold_uncertainty_score":0.1430123,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2109920068","doi":"10.1080/08957347.2014.905787","title":"Testing Expert-Based Versus Student-Based Cognitive Models for a Grade 3 Diagnostic Mathematics Assessment","year":2014,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Educational and Psychological Assessments","field":"Psychology","cited_by":19,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Medical Council of Canada; University of Alberta","funders":"","keywords":"Cognition; Psychology; Test (biology); Consistency (knowledge bases); Construct (python library); Cognitive test; Cognitive psychology; Statistics; Artificial intelligence; Computer science; Mathematics","authors":[{"name":"Mary Roduta Roberts","is_ca":true},{"name":"Cecilia Alves","is_ca":false},{"name":"Man-Wai Chu","is_ca":true},{"name":"Margaret Thompson","is_ca":true},{"name":"Louise M. Bahry","is_ca":true},{"name":"Andrea Gotzmann","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2185151809927274,"gpt":0.4421785572880547,"spread":0.2236633762953272,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02574051,0.0007133285,0.0005020808,0.002333896,0.0004710192,0.002645901,0.001238123,0.0009193409,0.001057837],"category_scores_gemma":[0.1406411,0.0002860547,0.0009680714,0.0008901856,0.0007609454,0.002293194,0.002075996,0.0009412891,0.0003198976],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001206322,"about_ca_system_score_gemma":0.001778819,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002723901,"about_ca_topic_score_gemma":0.004510007,"domain_scores_codex":[0.9849145,0.007167533,0.001162457,0.001242883,0.005019349,0.0004933695],"domain_scores_gemma":[0.9050599,0.06557801,0.01051451,0.007560438,0.009426943,0.001860186],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0007928482,0.001322072,0.9124775,0.00009003891,0.000244484,0.0001022558,0.004943299,0.004192852,0.001448942,0.001517044,0.0006047045,0.072264],"study_design_scores_gemma":[0.0003140822,0.006683826,0.8313569,0.0002992983,0.0003004514,0.0008110238,0.01123203,0.1309064,0.009188049,0.005843948,0.002870423,0.0001934796],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9910177,0.00004626317,0.006888364,0.00006579638,0.00001673274,0.0001315641,0.00006745982,0.0000594057,0.001706572],"genre_scores_gemma":[0.9924992,0.00003710112,0.006954953,0.00004104253,0.000006136629,0.0001190884,0.0001403267,0.000009283397,0.000192959],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02574051,"threshold_uncertainty_score":0.1361305,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2607007324","doi":"10.1080/08957347.2017.1316276","title":"For Which Boys and Which Girls Are Reading Assessment Items Biased Against? Detection of Differential Item Functioning in Heterogeneous Gender Populations","year":2017,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"School Choice and Performance","field":"Social Sciences","cited_by":14,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"University of British Columbia","funders":"Institute of Education Sciences","keywords":"Differential item functioning; Psychology; Disadvantage; Developmental psychology; Socioeconomic status; Gender bias; Item response theory; Demography; Psychometrics; Social psychology; Population","authors":[{"name":"Raman Grover","is_ca":true},{"name":"Kadriye Ercikan","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1191182427796675,"gpt":0.3618901915618662,"spread":0.2427719487821987,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0133013,0.0003145933,0.000761644,0.001756271,0.0005972525,0.001558517,0.0005744162,0.0007291082,0.001555315],"category_scores_gemma":[0.0424449,0.0002222016,0.0007379734,0.001287418,0.001299051,0.001416907,0.0009649447,0.0005413471,0.000522071],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007135457,"about_ca_system_score_gemma":0.0006652625,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00849327,"about_ca_topic_score_gemma":0.01166703,"domain_scores_codex":[0.9915791,0.004188235,0.000660038,0.001341269,0.001565711,0.0006656476],"domain_scores_gemma":[0.9844714,0.006947741,0.004468632,0.002306802,0.00149288,0.0003125237],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001318703,0.00002009119,0.9649494,0.00004566904,0.0001517375,0.0001223298,0.004935246,0.00008604203,0.001162302,0.0006192533,0.0003829623,0.02739306],"study_design_scores_gemma":[0.000006922896,0.00007816102,0.9901148,0.00009120972,0.0000543998,0.0003694034,0.006009462,0.0004412839,0.0006585334,0.001267754,0.0008886815,0.00001939108],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9948577,0.0005628876,0.001863734,0.0003622836,0.00002320113,0.00003081892,0.0002279033,0.00001147822,0.002059865],"genre_scores_gemma":[0.9988844,0.00009274847,0.0006024002,0.00008453861,0.000007218902,0.00001696846,0.00009628361,0.000006534653,0.0002088077],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0133013,"threshold_uncertainty_score":0.07034481,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3126939008","doi":"10.1080/08957347.2020.1835911","title":"Rethinking Think-Alouds: The Often-Problematic Collection of Response Process Data","year":2021,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Behavioral and Psychological Studies","field":"Psychology","cited_by":14,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Think aloud protocol; Psychology; Unobservable; Process (computing); Test (biology); Cognitive psychology; Data collection; Applied psychology; Computer science; Epistemology; Social science; Sociology","authors":[{"name":"Jacqueline P. Leighton","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3773982575143485,"gpt":0.3923418996521501,"spread":0.01494364213780164,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1472099,0.001614656,0.001324352,0.003825041,0.009103992,0.0138958,0.00649594,0.01104781,0.001256904],"category_scores_gemma":[0.4806538,0.001197504,0.001447118,0.003664316,0.01833821,0.008456752,0.005026215,0.02071768,0.001545724],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.007317377,"about_ca_system_score_gemma":0.00878235,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006561346,"about_ca_topic_score_gemma":0.01082567,"domain_scores_codex":[0.7038115,0.2108245,0.01391123,0.009264038,0.0597176,0.002471147],"domain_scores_gemma":[0.2938145,0.6005114,0.02355027,0.01231515,0.06754475,0.002263907],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0004513697,0.0001036779,0.002787854,0.004687654,0.0002761153,0.00237412,0.3513232,0.0006992815,0.01013589,0.04844603,0.4677808,0.1109341],"study_design_scores_gemma":[0.0001173547,0.0003072708,0.005415726,0.007354957,0.0001542927,0.001929349,0.153758,0.003259834,0.01449705,0.06869075,0.7440034,0.0005120587],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"commentary","genre_gemma":"empirical","genre_scores_codex":[0.01964463,0.008497101,0.1119097,0.7036604,0.1483109,0.0007628314,0.0003295812,0.0007216305,0.00616328],"genre_scores_gemma":[0.2758163,0.009954286,0.1020823,0.4939908,0.1000808,0.003894889,0.0003769848,0.003308508,0.01049505],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8527901,"threshold_uncertainty_score":0.7785296,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2011276392","doi":"10.1080/08957347.2011.607061","title":"An Experimental Test of Student Verbal Reports and Teacher Evaluations as a Source of Validity Evidence for Test Development","year":2011,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Science Education and Pedagogy","field":"Social Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Test (biology); Psychology; CLARITY; Test validity; Set (abstract data type); Association (psychology); Standards for Educational and Psychological Testing; Mathematics education; Content validity; Applied psychology; Social psychology; Psychometrics; Computer science; Higher education; Clinical psychology; Education theory","authors":[{"name":"Jacqueline P. Leighton","is_ca":true},{"name":"Colleen Heffernan","is_ca":true},{"name":"M. Kenneth Cor","is_ca":true},{"name":"Rebecca Gokiert","is_ca":true},{"name":"Ying Cui","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.4437717804134738,"gpt":0.4947924416640539,"spread":0.05102066125058008,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05463069,0.001576458,0.001819986,0.004031057,0.001456684,0.002825055,0.001909738,0.00199498,0.006396119],"category_scores_gemma":[0.2414405,0.00112097,0.002087398,0.003486505,0.003422527,0.004712238,0.003703678,0.002887038,0.001816353],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001234445,"about_ca_system_score_gemma":0.001510908,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0006247304,"about_ca_topic_score_gemma":0.000884552,"domain_scores_codex":[0.909871,0.05313108,0.009758758,0.008578184,0.01748619,0.001174758],"domain_scores_gemma":[0.4834188,0.4368646,0.03248284,0.0254917,0.01997738,0.001764744],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.03212894,0.03775991,0.379723,0.003876914,0.005478818,0.0004929427,0.02288346,0.003463254,0.02854566,0.02128044,0.01354556,0.4508211],"study_design_scores_gemma":[0.009744899,0.09015408,0.7873656,0.00124932,0.001897428,0.001255752,0.007236168,0.02429931,0.02924515,0.01305741,0.03389464,0.0006002625],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8572423,0.0008498717,0.06876655,0.0006781085,0.00109746,0.02138679,0.002569794,0.0008276808,0.04658147],"genre_scores_gemma":[0.8198565,0.0005716055,0.112037,0.0009787478,0.0004368942,0.0569895,0.002736241,0.0002758413,0.006117909],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.05463069,"threshold_uncertainty_score":0.2889181,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4395110387","doi":"10.1080/08957347.2024.2345594","title":"A Critical Review of Fairness from Multiple Perspectives: Implications for Classroom Assessment Theory","year":2024,"lang":"en","type":"review","venue":"Applied Measurement in Education","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Queen's University","funders":"","keywords":"Psychology; Item response theory; Critical theory; Mathematics education; Political science; Developmental psychology; Psychometrics","authors":[{"name":"Amirhossein Rasooli","is_ca":false},{"name":"Christopher DeLuca","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1496372500266458,"gpt":0.4788594395403927,"spread":0.3292221895137469,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04953238,0.001102079,0.002986003,0.01519538,0.002311557,0.008651606,0.002940706,0.004972212,0.002316527],"category_scores_gemma":[0.1309646,0.0006989973,0.001611346,0.01239106,0.008770801,0.01375917,0.004731718,0.008556717,0.0006368609],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.007158659,"about_ca_system_score_gemma":0.02219195,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004511313,"about_ca_topic_score_gemma":0.007596582,"domain_scores_codex":[0.9656672,0.01989538,0.005272135,0.001919638,0.006756948,0.0004887445],"domain_scores_gemma":[0.8308206,0.1432229,0.003993862,0.002565312,0.01837993,0.001017437],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00007071226,0.00005121815,0.0005069683,0.0774194,0.0004003399,0.0002664943,0.009975262,0.0004222593,0.0003535216,0.1527878,0.05686571,0.7008802],"study_design_scores_gemma":[0.00002329956,0.00006632385,0.001428966,0.2134713,0.0004162965,0.0005460929,0.007798503,0.0002576606,0.0003503194,0.1102355,0.6653254,0.00008038062],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.0002029586,0.9769818,0.002044384,0.01721914,0.001940641,0.00003020856,0.0000189587,0.000006917086,0.001555063],"genre_scores_gemma":[0.008312034,0.9780964,0.004137884,0.007013456,0.001883277,0.0001547066,0.00003482511,0.00001404955,0.0003532884],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.04953238,"threshold_uncertainty_score":0.2619553,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2202994334","doi":"10.1080/08957347.2015.1102913","title":"Analyzing Fairness Among Linguistic Minority Populations Using a Latent Class Differential Item Functioning Approach","year":2015,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Social and Intergroup Psychology","field":"Social Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Differential item functioning; Psychology; Item response theory; Race (biology); Latent class model; Ethnic group; Social psychology; Measurement invariance; Test (biology); Statistics; Developmental psychology; Psychometrics; Confirmatory factor analysis; Structural equation modeling; Mathematics; Sociology","authors":[{"name":"María Elena Oliveri","is_ca":false},{"name":"Kadriye Ercikan","is_ca":true},{"name":"Juliette Lyons-Thomas","is_ca":true},{"name":"Steven Holtzman","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1834551797688675,"gpt":0.3591230444973037,"spread":0.1756678647284362,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0374594,0.0006814026,0.0007859257,0.004839371,0.002297813,0.002136794,0.001019182,0.0006540053,0.002500548],"category_scores_gemma":[0.07064552,0.0002579405,0.0016536,0.002867794,0.001630583,0.002367932,0.003806774,0.001156042,0.0002026],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00172761,"about_ca_system_score_gemma":0.001304584,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00530843,"about_ca_topic_score_gemma":0.006192691,"domain_scores_codex":[0.981747,0.0127679,0.001057402,0.001276378,0.002457543,0.0006936964],"domain_scores_gemma":[0.9623741,0.02181972,0.00588298,0.004962764,0.004348951,0.0006115013],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005723527,0.0005560109,0.8678688,0.0001792521,0.0005913507,0.000142047,0.01560388,0.001603775,0.001889628,0.01111702,0.0008562669,0.09901962],"study_design_scores_gemma":[0.0001248992,0.0007187474,0.8907896,0.0002983439,0.0003185984,0.0003042181,0.01706918,0.03987266,0.003334259,0.0433304,0.0036844,0.0001546807],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9267914,0.0001795041,0.06870445,0.0003780628,0.00004707314,0.0004957207,0.000330289,0.00005602792,0.003017368],"genre_scores_gemma":[0.9849309,0.00002736316,0.01420123,0.00005104444,0.00001474219,0.0004250609,0.0001615824,0.00001053476,0.000177487],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0374594,"threshold_uncertainty_score":0.1981066,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4321452091","doi":"10.1080/08957347.2023.2172017","title":"Dissecting Knowledge, Guessing, and Blunder in Multiple Choice Assessments","year":2023,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McMaster University; University of Toronto","funders":"Division of Molecular and Cellular Biosciences; National Institute of General Medical Sciences; National Heart, Lung, and Blood Institute","keywords":"Test (biology); Probabilistic logic; Mistake; Psychology; Proxy (statistics); Robustness (evolution); Bayesian probability; Social psychology; Computer science; Artificial intelligence; Machine learning; Political science","authors":[{"name":"Rashid M. Abu‐Ghazalah","is_ca":true},{"name":"David N. Dubins","is_ca":true},{"name":"Gregory M.K. Poon","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.8152165292421817,"gpt":0.575029629601757,"spread":0.2401868996404247,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.4307819,0.002161389,0.002710931,0.007777183,0.001533775,0.005349502,0.003473873,0.003752753,0.003804288],"category_scores_gemma":[0.7810754,0.001577559,0.005781025,0.005944379,0.0082214,0.006776542,0.006416549,0.004268354,0.0004593405],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002627885,"about_ca_system_score_gemma":0.002148582,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002353266,"about_ca_topic_score_gemma":0.004157053,"domain_scores_codex":[0.5715744,0.3238786,0.03924826,0.0225588,0.04035273,0.002387182],"domain_scores_gemma":[0.08712095,0.8436829,0.03182122,0.02874847,0.008063287,0.0005630993],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.01196509,0.001476282,0.3419473,0.007466592,0.01425037,0.0008803523,0.03576932,0.07935901,0.007740445,0.08375428,0.004709358,0.4106816],"study_design_scores_gemma":[0.00126515,0.007563238,0.2994432,0.003653234,0.003870678,0.001852444,0.005006728,0.3717227,0.04090029,0.2475376,0.01545934,0.001725472],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2967034,0.001612787,0.6894945,0.0008090521,0.0001976747,0.003485162,0.0009010329,0.000772073,0.006024348],"genre_scores_gemma":[0.7667019,0.0003020127,0.227626,0.0003682861,0.0000659451,0.003499249,0.0004943039,0.0001222765,0.0008199154],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.569218,"threshold_uncertainty_score":0.7019472,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4416211129","doi":"10.1080/08957347.2025.2563889","title":"Establishing Cognitive Item Models for Fair and Theory-Grounded Automatic Item Generation: A Large-Scale Assessment Study with Image-Based Math Items","year":2025,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"Fonds National de la Recherche Luxembourg","keywords":"Item response theory; Cognition; Item analysis; Differential item functioning; Test (biology); Equating; Item bank; Standardized test","authors":[{"name":"Philipp Sonnleitner","is_ca":false},{"name":"Steve Bernard","is_ca":false},{"name":"Michael Andreas Michels","is_ca":false},{"name":"Pamela Inostroza-Fernandez","is_ca":false},{"name":"Ulrich Keller","is_ca":false},{"name":"Mark J. Gierl","is_ca":true},{"name":"Pedro Cardoso-Leite","is_ca":false},{"name":"Caroline Hornung","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2627134757698749,"gpt":0.4411525673993796,"spread":0.1784390916295048,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05117789,0.0007503311,0.0006608277,0.002020935,0.0007557858,0.002190012,0.001564421,0.000866116,0.002176311],"category_scores_gemma":[0.1847647,0.0004069969,0.001495628,0.001925,0.001574044,0.001911629,0.002216307,0.001192851,0.0008776564],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001895922,"about_ca_system_score_gemma":0.001652654,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002047197,"about_ca_topic_score_gemma":0.002397181,"domain_scores_codex":[0.9678728,0.02288932,0.001661999,0.003348222,0.0037328,0.0004948641],"domain_scores_gemma":[0.8460369,0.1146894,0.006614748,0.0215278,0.01035392,0.0007772964],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001436796,0.001536863,0.6669604,0.0003956837,0.0005923944,0.0001498693,0.01332681,0.01196126,0.004587791,0.009036559,0.003363338,0.2866523],"study_design_scores_gemma":[0.000854186,0.00370462,0.7694255,0.0004359372,0.0004432409,0.0004908605,0.00532538,0.1660252,0.01276895,0.02791953,0.01236538,0.0002411528],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9021808,0.00008355911,0.09332188,0.0001451102,0.00003694655,0.001590737,0.0004754024,0.0003107462,0.001854767],"genre_scores_gemma":[0.9468212,0.00002472574,0.04963636,0.00005591627,0.000009659628,0.00176521,0.001233989,0.00009250467,0.0003604215],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.05117789,"threshold_uncertainty_score":0.2706578,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4365813887","doi":"10.1080/08957347.2023.2201703","title":"Multi-Group Generalizations of SIBTEST and Crossing-SIBTEST","year":2023,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"York University","funders":"","keywords":"Type I and type II errors; Differential item functioning; Statistics; Mathematics; Monte Carlo method; Logistic regression; Set (abstract data type); Population; Group (periodic table); Statistical power; Applied mathematics; Item response theory; Computer science; Psychometrics; Demography","authors":[{"name":"R. Philip Chalmers","is_ca":true},{"name":"Guoguo Zheng","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5905972101310687,"gpt":0.4788309874553456,"spread":0.1117662226757231,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07060982,0.001179574,0.001801027,0.004774427,0.001081421,0.001809053,0.001971327,0.001255082,0.006555918],"category_scores_gemma":[0.2286084,0.0005244266,0.002053539,0.004070001,0.003230242,0.003623162,0.003174519,0.003479569,0.0008834377],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007330428,"about_ca_system_score_gemma":0.0009908255,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0006824225,"about_ca_topic_score_gemma":0.000710897,"domain_scores_codex":[0.9537348,0.03232123,0.00227607,0.004701456,0.00641697,0.0005494834],"domain_scores_gemma":[0.8039418,0.1509097,0.008712269,0.02882602,0.00672376,0.0008863772],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0007251514,0.0004186223,0.1199749,0.001062124,0.001967234,0.0009160223,0.008062877,0.0359359,0.00312272,0.3862312,0.009397864,0.4321854],"study_design_scores_gemma":[0.0001494253,0.00178273,0.08669873,0.0003880616,0.0003973828,0.002458573,0.002209799,0.1421762,0.005314602,0.7414986,0.01661181,0.0003140419],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.08645695,0.0004992857,0.9027918,0.0002924191,0.0002011733,0.0006685231,0.000743565,0.0008493776,0.00749685],"genre_scores_gemma":[0.6727064,0.000415015,0.3208479,0.0004243528,0.0001853425,0.002512836,0.001223851,0.0002941591,0.001390141],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.07060982,"threshold_uncertainty_score":0.3734249,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}