{"meta":{"query_hash":"f042d3dd4442","filters":{"venue":"Applied Measurement in Education"},"cohort_total":12,"direct_labels_cover":0,"predictions_cover":12,"exported":12,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/f042d3dd4442","api":"https://metacan.xera.ac/api/v1/cohort?venue=Applied+Measurement+in+Education"},"results":[{"id":"W1969608664","doi":"10.1207/s15324818ame1703_4","title":"Comparability of Bilingual Versions of Assessments: Sources of Incomparability of English and French Versions of Canada's National Achievement Tests","year":2004,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":62,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Comparability; Differential item functioning; Psychology; Reading (process); Item response theory; Psychometrics; Developmental psychology; Linguistics; Mathematics","score_opus":0.2715701847682983,"score_gpt":0.4269062826454618,"score_spread":0.15533609787716351,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1969608664","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9926063,0.0004927571,0.0020862026,0.00021559274,0.00003336086,0.00006888485,0.00066061754,0.00002577077,0.003810533],"genre_scores_gemma":[0.9983359,0.000069114714,0.0007465294,0.000045215365,0.000010129036,0.000027381828,0.00051892974,0.000013948587,0.00023286298],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.95039517,0.01915667,0.00426329,0.0035513479,0.02090136,0.0017321032],"domain_scores_gemma":[0.83950865,0.08366546,0.021709014,0.012067095,0.041220274,0.0018294108],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.032085296,0.0004879662,0.00053748203,0.0051979516,0.0013748156,0.0024843141,0.0009546398,0.00048972544,0.0011064084],"category_scores_gemma":[0.18895358,0.00031831683,0.00092305837,0.0042890613,0.0015237349,0.0009018557,0.0025285052,0.00075281283,0.00015180864],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006855741,0.00006081292,0.9507224,0.00012586749,0.00051026,0.00017767215,0.008728288,0.0004190057,0.0016990127,0.00071918877,0.00044412218,0.035707813],"study_design_scores_gemma":[0.00001900461,0.00012575526,0.993152,0.00008943384,0.000098370845,0.00022309397,0.002251919,0.00081061636,0.0014797975,0.00035820153,0.0013639458,0.000027964394],"about_ca_topic_score_codex":0.1367502,"about_ca_topic_score_gemma":0.1579752,"teacher_disagreement_score":0.9950503,"about_ca_system_score_codex":0.0049497187,"about_ca_system_score_gemma":0.0037530526,"threshold_uncertainty_score":0.27190852},"labels":[],"label_agreement":null},{"id":"W2011276392","doi":"10.1080/08957347.2011.607061","title":"An Experimental Test of Student Verbal Reports and Teacher Evaluations as a Source of Validity Evidence for Test Development","year":2011,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Science Education and Pedagogy","field":"Social Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Test (biology); Psychology; CLARITY; Test validity; Set (abstract data type); Association (psychology); Standards for Educational and Psychological Testing; Mathematics education; Content validity; Applied psychology; Social psychology; Psychometrics; Computer science; Higher education; Clinical psychology; Education theory","score_opus":0.4437717804134738,"score_gpt":0.4947924416640539,"score_spread":0.05102066125058008,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2011276392","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8572423,0.00084987166,0.06876655,0.0006781085,0.0010974603,0.02138679,0.0025697944,0.0008276808,0.046581466],"genre_scores_gemma":[0.81985646,0.00057160546,0.11203695,0.0009787478,0.00043689425,0.0569895,0.0027362406,0.00027584127,0.006117909],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.90987104,0.053131085,0.009758758,0.008578184,0.017486192,0.0011747578],"domain_scores_gemma":[0.4834188,0.43686458,0.032482844,0.025491698,0.019977378,0.0017647444],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05463069,0.0015764581,0.0018199864,0.004031057,0.0014566836,0.0028250553,0.0019097378,0.0019949803,0.006396119],"category_scores_gemma":[0.24144053,0.0011209704,0.002087398,0.0034865045,0.0034225266,0.0047122375,0.0037036778,0.0028870378,0.0018163526],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.032128945,0.037759915,0.37972298,0.003876914,0.005478818,0.0004929427,0.022883456,0.0034632543,0.028545659,0.021280441,0.013545561,0.45082107],"study_design_scores_gemma":[0.009744899,0.09015408,0.7873656,0.0012493201,0.0018974277,0.001255752,0.007236168,0.024299309,0.029245153,0.013057413,0.033894636,0.0006002625],"about_ca_topic_score_codex":0.0006247304,"about_ca_topic_score_gemma":0.000884552,"teacher_disagreement_score":0.05463069,"about_ca_system_score_codex":0.001234445,"about_ca_system_score_gemma":0.0015109077,"threshold_uncertainty_score":0.28891814},"labels":[],"label_agreement":null},{"id":"W2053906918","doi":"10.1207/s15324818ame1703_2","title":"Performance of SIBTEST When the Percentage of DIF Items is Large","year":2004,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":39,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Differential item functioning; Statistics; Psychology; Item response theory; Test (biology); Mathematics; Psychometrics","score_opus":0.3321836598049474,"score_gpt":0.4109344435671419,"score_spread":0.07875078376219452,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2053906918","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.85259295,0.0012046751,0.12328864,0.00055302546,0.0004545785,0.0007577099,0.0020121308,0.0035537372,0.015582527],"genre_scores_gemma":[0.9213829,0.00025937526,0.07272808,0.0002804529,0.000039704137,0.00073000626,0.0014043293,0.0004083549,0.002766829],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9811476,0.01004727,0.0018892011,0.0028067834,0.0034590464,0.0006501811],"domain_scores_gemma":[0.92340446,0.054595493,0.0060876054,0.005880704,0.008133998,0.001897748],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.024775045,0.001641143,0.0017714369,0.0023186556,0.0007834369,0.0020839733,0.001217757,0.0015333367,0.0046565905],"category_scores_gemma":[0.09194066,0.000654955,0.0014892429,0.0015075906,0.0008673647,0.002091367,0.0016125722,0.0013099413,0.0028048733],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0088299075,0.0013117541,0.5652688,0.0011667066,0.0013988226,0.0010301752,0.0040905094,0.014985374,0.026223024,0.0029738068,0.014015993,0.35870522],"study_design_scores_gemma":[0.0005640925,0.006697451,0.59201443,0.0006295079,0.0009421539,0.0040179784,0.0029101016,0.28751087,0.07258778,0.008994949,0.02258573,0.000544895],"about_ca_topic_score_codex":0.0029439405,"about_ca_topic_score_gemma":0.0039446293,"teacher_disagreement_score":0.024775045,"about_ca_system_score_codex":0.0005502166,"about_ca_system_score_gemma":0.0012731937,"threshold_uncertainty_score":0.13102454},"labels":[],"label_agreement":null},{"id":"W2109920068","doi":"10.1080/08957347.2014.905787","title":"Testing Expert-Based Versus Student-Based Cognitive Models for a Grade 3 Diagnostic Mathematics Assessment","year":2014,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Educational and Psychological Assessments","field":"Psychology","cited_by":19,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Medical Council of Canada; University of Alberta","funders":"","keywords":"Cognition; Psychology; Test (biology); Consistency (knowledge bases); Construct (python library); Cognitive test; Cognitive psychology; Statistics; Artificial intelligence; Computer science; Mathematics","score_opus":0.21851518099272743,"score_gpt":0.44217855728805466,"score_spread":0.22366337629532723,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2109920068","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9910177,0.000046263172,0.0068883635,0.00006579638,0.000016732736,0.0001315641,0.00006745982,0.000059405702,0.0017065724],"genre_scores_gemma":[0.9924992,0.000037101123,0.006954953,0.000041042535,0.000006136629,0.0001190884,0.00014032672,0.000009283397,0.000192959],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9849145,0.007167533,0.0011624572,0.0012428827,0.005019349,0.00049336953],"domain_scores_gemma":[0.90505993,0.06557801,0.010514509,0.007560438,0.009426943,0.0018601861],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.025740512,0.0007133285,0.00050208083,0.0023338955,0.00047101922,0.0026459012,0.0012381226,0.0009193409,0.0010578366],"category_scores_gemma":[0.14064108,0.00028605468,0.0009680714,0.00089018565,0.0007609454,0.002293194,0.0020759958,0.00094128906,0.00031989758],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007928482,0.0013220715,0.9124775,0.00009003891,0.000244484,0.000102255784,0.0049432986,0.0041928524,0.001448942,0.0015170445,0.00060470455,0.072264],"study_design_scores_gemma":[0.00031408216,0.0066838255,0.83135694,0.0002992983,0.00030045136,0.0008110238,0.011232028,0.1309064,0.009188049,0.005843948,0.0028704235,0.00019347956],"about_ca_topic_score_codex":0.002723901,"about_ca_topic_score_gemma":0.004510007,"teacher_disagreement_score":0.025740512,"about_ca_system_score_codex":0.0012063219,"about_ca_system_score_gemma":0.0017788191,"threshold_uncertainty_score":0.13613051},"labels":[],"label_agreement":null},{"id":"W2202994334","doi":"10.1080/08957347.2015.1102913","title":"Analyzing Fairness Among Linguistic Minority Populations Using a Latent Class Differential Item Functioning Approach","year":2015,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Social and Intergroup Psychology","field":"Social Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Differential item functioning; Psychology; Item response theory; Race (biology); Latent class model; Ethnic group; Social psychology; Measurement invariance; Test (biology); Statistics; Developmental psychology; Psychometrics; Confirmatory factor analysis; Structural equation modeling; Mathematics; Sociology","score_opus":0.1834551797688675,"score_gpt":0.3591230444973037,"score_spread":0.1756678647284362,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2202994334","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9267914,0.00017950406,0.06870445,0.00037806283,0.000047073143,0.0004957207,0.000330289,0.000056027922,0.0030173678],"genre_scores_gemma":[0.9849309,0.000027363163,0.014201233,0.00005104444,0.000014742187,0.00042506092,0.00016158244,0.000010534761,0.00017748697],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98174703,0.012767898,0.0010574016,0.0012763776,0.0024575433,0.00069369643],"domain_scores_gemma":[0.9623741,0.021819718,0.0058829803,0.0049627637,0.0043489514,0.0006115013],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0374594,0.00068140257,0.0007859257,0.004839371,0.0022978133,0.0021367944,0.0010191824,0.00065400533,0.0025005476],"category_scores_gemma":[0.07064552,0.0002579405,0.0016535997,0.0028677941,0.0016305828,0.0023679323,0.0038067738,0.0011560417,0.00020260004],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00057235267,0.0005560109,0.8678688,0.0001792521,0.00059135066,0.00014204696,0.0156038795,0.0016037751,0.0018896278,0.011117022,0.0008562669,0.09901962],"study_design_scores_gemma":[0.0001248992,0.0007187474,0.8907896,0.00029834395,0.00031859838,0.0003042181,0.017069183,0.039872665,0.0033342591,0.043330405,0.0036844003,0.00015468067],"about_ca_topic_score_codex":0.0053084297,"about_ca_topic_score_gemma":0.0061926907,"teacher_disagreement_score":0.0374594,"about_ca_system_score_codex":0.00172761,"about_ca_system_score_gemma":0.0013045836,"threshold_uncertainty_score":0.19810665},"labels":[],"label_agreement":null},{"id":"W2320000683","doi":"10.1080/08957347.2016.1171768","title":"Evaluating the Psychometric Characteristics of Generated Multiple-Choice Test Items","year":2016,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":33,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Medical Council of Canada; University of Ottawa; University of Alberta","funders":"","keywords":"Item response theory; Item bank; Item analysis; Licensure; Psychology; Test (biology); Psychometrics; Cognition; Multiple choice; Differential item functioning; Applied psychology; Cognitive psychology; Computer science; Clinical psychology; Statistics; Medicine; Medical education","score_opus":0.1433803510187834,"score_gpt":0.4009891954820371,"score_spread":0.2576088444632537,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2320000683","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9837143,0.00012717246,0.01241734,0.000101322,0.000028570274,0.00034777712,0.00055508787,0.000086414824,0.0026220009],"genre_scores_gemma":[0.9845279,0.00007408084,0.013419733,0.000061696,0.000015926731,0.00040011283,0.0010555788,0.000044376902,0.0004005267],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9808663,0.0086044315,0.0032373616,0.0009974996,0.0058145304,0.00047983832],"domain_scores_gemma":[0.8425999,0.11443778,0.01145136,0.009852418,0.020648852,0.0010097234],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.027041776,0.00054581667,0.00046002935,0.0025637005,0.0002821742,0.0011594378,0.00097508845,0.00093421154,0.0023049903],"category_scores_gemma":[0.13385129,0.00025021465,0.001010013,0.0016988752,0.0007970747,0.0013050447,0.0010645483,0.0007313142,0.00078723],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001210173,0.0010155069,0.8620313,0.00020394947,0.0004323597,0.00019987926,0.0019851585,0.0045205383,0.0065166806,0.0010611373,0.0010082918,0.11981505],"study_design_scores_gemma":[0.00013327894,0.0029894505,0.9670588,0.0001180545,0.00008626943,0.0005332591,0.0010890294,0.013379854,0.010590854,0.0017925879,0.002165712,0.00006286136],"about_ca_topic_score_codex":0.00038160465,"about_ca_topic_score_gemma":0.0005343449,"teacher_disagreement_score":0.027041776,"about_ca_system_score_codex":0.000534819,"about_ca_system_score_gemma":0.000527347,"threshold_uncertainty_score":0.14301229},"labels":[],"label_agreement":null},{"id":"W2607007324","doi":"10.1080/08957347.2017.1316276","title":"For Which Boys and Which Girls Are Reading Assessment Items Biased Against? Detection of Differential Item Functioning in Heterogeneous Gender Populations","year":2017,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"School Choice and Performance","field":"Social Sciences","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of British Columbia","funders":"Institute of Education Sciences","keywords":"Differential item functioning; Psychology; Disadvantage; Developmental psychology; Socioeconomic status; Gender bias; Item response theory; Demography; Psychometrics; Social psychology; Population","score_opus":0.11911824277966752,"score_gpt":0.36189019156186625,"score_spread":0.2427719487821987,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2607007324","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99485767,0.00056288764,0.0018637335,0.00036228355,0.00002320113,0.000030818923,0.00022790329,0.00001147822,0.0020598646],"genre_scores_gemma":[0.9988844,0.00009274847,0.0006024002,0.00008453861,0.000007218902,0.000016968457,0.00009628361,0.0000065346535,0.0002088077],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99157906,0.004188235,0.00066003803,0.0013412691,0.0015657115,0.00066564756],"domain_scores_gemma":[0.9844714,0.0069477414,0.004468632,0.0023068022,0.0014928796,0.00031252374],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013301302,0.0003145933,0.000761644,0.0017562715,0.0005972525,0.0015585166,0.00057441625,0.0007291082,0.0015553152],"category_scores_gemma":[0.042444896,0.00022220163,0.00073797343,0.0012874183,0.0012990506,0.0014169066,0.00096494466,0.00054134714,0.00052207103],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013187029,0.000020091187,0.96494937,0.000045669036,0.00015173746,0.00012232979,0.0049352464,0.000086042026,0.0011623024,0.0006192533,0.00038296226,0.027393058],"study_design_scores_gemma":[0.0000069228963,0.00007816102,0.9901148,0.00009120972,0.000054399803,0.00036940342,0.0060094623,0.00044128395,0.0006585334,0.001267754,0.0008886815,0.000019391076],"about_ca_topic_score_codex":0.00849327,"about_ca_topic_score_gemma":0.011667029,"teacher_disagreement_score":0.013301302,"about_ca_system_score_codex":0.0007135457,"about_ca_system_score_gemma":0.0006652625,"threshold_uncertainty_score":0.070344806},"labels":[],"label_agreement":null},{"id":"W3126939008","doi":"10.1080/08957347.2020.1835911","title":"Rethinking Think-Alouds: The Often-Problematic Collection of Response Process Data","year":2021,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Behavioral and Psychological Studies","field":"Psychology","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Think aloud protocol; Psychology; Unobservable; Process (computing); Test (biology); Cognitive psychology; Data collection; Applied psychology; Computer science; Epistemology; Social science; Sociology","score_opus":0.37739825751434847,"score_gpt":0.3923418996521501,"score_spread":0.014943642137801638,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3126939008","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01964463,0.008497101,0.111909695,0.70366037,0.1483109,0.0007628314,0.00032958118,0.0007216305,0.0061632795],"genre_scores_gemma":[0.27581632,0.009954286,0.10208232,0.4939908,0.100080766,0.0038948888,0.00037698483,0.0033085076,0.010495051],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.70381147,0.21082446,0.013911232,0.009264038,0.0597176,0.0024711473],"domain_scores_gemma":[0.29381454,0.6005114,0.023550266,0.012315154,0.06754475,0.0022639069],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.14720988,0.0016146562,0.0013243518,0.0038250412,0.009103992,0.013895805,0.00649594,0.011047809,0.0012569035],"category_scores_gemma":[0.48065376,0.0011975038,0.001447118,0.0036643161,0.01833821,0.008456752,0.0050262148,0.020717679,0.001545724],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00045136973,0.0001036779,0.0027878543,0.004687654,0.0002761153,0.0023741198,0.35132322,0.00069928146,0.010135889,0.04844603,0.46778077,0.11093409],"study_design_scores_gemma":[0.000117354735,0.00030727082,0.005415726,0.0073549566,0.0001542927,0.0019293488,0.153758,0.0032598337,0.01449705,0.06869075,0.7440034,0.0005120587],"about_ca_topic_score_codex":0.006561346,"about_ca_topic_score_gemma":0.010825672,"teacher_disagreement_score":0.8527901,"about_ca_system_score_codex":0.007317377,"about_ca_system_score_gemma":0.00878235,"threshold_uncertainty_score":0.7785296},"labels":[],"label_agreement":null},{"id":"W4321452091","doi":"10.1080/08957347.2023.2172017","title":"Dissecting Knowledge, Guessing, and Blunder in Multiple Choice Assessments","year":2023,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University; University of Toronto","funders":"Division of Molecular and Cellular Biosciences; National Institute of General Medical Sciences; National Heart, Lung, and Blood Institute","keywords":"Test (biology); Probabilistic logic; Mistake; Psychology; Proxy (statistics); Robustness (evolution); Bayesian probability; Social psychology; Computer science; Artificial intelligence; Machine learning; Political science","score_opus":0.8152165292421817,"score_gpt":0.575029629601757,"score_spread":0.24018689964042472,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4321452091","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.29670337,0.0016127869,0.6894945,0.00080905214,0.0001976747,0.0034851618,0.00090103294,0.000772073,0.0060243476],"genre_scores_gemma":[0.7667019,0.00030201272,0.22762598,0.0003682861,0.0000659451,0.0034992488,0.00049430394,0.0001222765,0.00081991544],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.57157445,0.32387862,0.03924826,0.022558799,0.04035273,0.002387182],"domain_scores_gemma":[0.08712095,0.84368294,0.031821225,0.028748471,0.008063287,0.0005630993],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.43078193,0.002161389,0.0027109305,0.0077771833,0.0015337755,0.0053495015,0.0034738735,0.0037527531,0.003804288],"category_scores_gemma":[0.7810754,0.0015775589,0.0057810247,0.005944379,0.0082214,0.006776542,0.006416549,0.004268354,0.00045934046],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.011965092,0.0014762825,0.34194726,0.007466592,0.014250371,0.0008803523,0.035769317,0.07935901,0.0077404454,0.08375428,0.0047093583,0.41068164],"study_design_scores_gemma":[0.0012651503,0.0075632385,0.29944324,0.0036532343,0.0038706784,0.0018524438,0.005006728,0.3717227,0.040900294,0.24753758,0.015459335,0.0017254722],"about_ca_topic_score_codex":0.0023532663,"about_ca_topic_score_gemma":0.0041570533,"teacher_disagreement_score":0.56921804,"about_ca_system_score_codex":0.0026278845,"about_ca_system_score_gemma":0.0021485821,"threshold_uncertainty_score":0.7019472},"labels":[],"label_agreement":null},{"id":"W4365813887","doi":"10.1080/08957347.2023.2201703","title":"Multi-Group Generalizations of SIBTEST and Crossing-SIBTEST","year":2023,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Type I and type II errors; Differential item functioning; Statistics; Mathematics; Monte Carlo method; Logistic regression; Set (abstract data type); Population; Group (periodic table); Statistical power; Applied mathematics; Item response theory; Computer science; Psychometrics; Demography","score_opus":0.5905972101310687,"score_gpt":0.4788309874553456,"score_spread":0.11176622267572311,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4365813887","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.086456954,0.0004992857,0.9027918,0.00029241914,0.00020117329,0.00066852313,0.00074356503,0.0008493776,0.0074968496],"genre_scores_gemma":[0.67270637,0.00041501503,0.3208479,0.00042435282,0.00018534255,0.0025128364,0.0012238513,0.00029415908,0.0013901409],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9537348,0.032321226,0.0022760702,0.004701456,0.00641697,0.0005494834],"domain_scores_gemma":[0.80394185,0.15090974,0.008712269,0.028826017,0.00672376,0.0008863772],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.070609815,0.0011795744,0.0018010272,0.004774427,0.0010814206,0.0018090535,0.001971327,0.0012550821,0.006555918],"category_scores_gemma":[0.22860838,0.00052442664,0.0020535393,0.0040700007,0.0032302423,0.003623162,0.0031745187,0.0034795695,0.0008834377],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00072515145,0.00041862234,0.11997495,0.0010621238,0.0019672336,0.0009160223,0.008062877,0.0359359,0.00312272,0.38623118,0.009397864,0.43218535],"study_design_scores_gemma":[0.00014942526,0.0017827305,0.08669873,0.0003880616,0.0003973828,0.002458573,0.0022097994,0.14217621,0.0053146016,0.74149865,0.016611805,0.00031404194],"about_ca_topic_score_codex":0.00068242254,"about_ca_topic_score_gemma":0.000710897,"teacher_disagreement_score":0.070609815,"about_ca_system_score_codex":0.00073304283,"about_ca_system_score_gemma":0.0009908255,"threshold_uncertainty_score":0.3734249},"labels":[],"label_agreement":null},{"id":"W4395110387","doi":"10.1080/08957347.2024.2345594","title":"A Critical Review of Fairness from Multiple Perspectives: Implications for Classroom Assessment Theory","year":2024,"lang":"en","type":"review","venue":"Applied Measurement in Education","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University","funders":"","keywords":"Psychology; Item response theory; Critical theory; Mathematics education; Political science; Developmental psychology; Psychometrics","score_opus":0.1496372500266458,"score_gpt":0.4788594395403927,"score_spread":0.3292221895137469,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4395110387","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00020295857,0.9769818,0.002044384,0.01721914,0.0019406407,0.000030208555,0.000018958699,0.0000069170856,0.0015550626],"genre_scores_gemma":[0.008312034,0.9780964,0.004137884,0.0070134564,0.0018832767,0.0001547066,0.000034825105,0.00001404955,0.00035328837],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9656672,0.01989538,0.0052721347,0.001919638,0.006756948,0.00048874447],"domain_scores_gemma":[0.83082056,0.14322294,0.003993862,0.0025653124,0.018379932,0.0010174372],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.049532376,0.0011020788,0.0029860027,0.015195376,0.002311557,0.008651606,0.0029407064,0.004972212,0.0023165266],"category_scores_gemma":[0.13096462,0.00069899735,0.0016113458,0.012391059,0.008770801,0.0137591725,0.004731718,0.008556717,0.0006368609],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00007071226,0.000051218147,0.0005069683,0.0774194,0.00040033992,0.00026649435,0.009975262,0.00042225933,0.00035352155,0.15278782,0.05686571,0.7008802],"study_design_scores_gemma":[0.000023299564,0.000066323846,0.0014289656,0.2134713,0.00041629653,0.0005460929,0.0077985027,0.00025766063,0.00035031937,0.11023552,0.6653254,0.00008038062],"about_ca_topic_score_codex":0.004511313,"about_ca_topic_score_gemma":0.0075965817,"teacher_disagreement_score":0.049532376,"about_ca_system_score_codex":0.0071586594,"about_ca_system_score_gemma":0.022191951,"threshold_uncertainty_score":0.26195532},"labels":[],"label_agreement":null},{"id":"W4416211129","doi":"10.1080/08957347.2025.2563889","title":"Establishing Cognitive Item Models for Fair and Theory-Grounded Automatic Item Generation: A Large-Scale Assessment Study with Image-Based Math Items","year":2025,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Fonds National de la Recherche Luxembourg","keywords":"Item response theory; Cognition; Item analysis; Differential item functioning; Test (biology); Equating; Item bank; Standardized test","score_opus":0.26271347576987486,"score_gpt":0.44115256739937964,"score_spread":0.17843909162950478,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4416211129","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9021808,0.000083559105,0.09332188,0.00014511016,0.00003694655,0.0015907373,0.00047540243,0.00031074617,0.0018547672],"genre_scores_gemma":[0.9468212,0.000024725745,0.049636364,0.000055916273,0.000009659628,0.00176521,0.0012339886,0.00009250467,0.00036042146],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9678728,0.022889324,0.0016619987,0.0033482215,0.0037328,0.00049486407],"domain_scores_gemma":[0.8460369,0.11468941,0.006614748,0.021527797,0.010353925,0.0007772964],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05117789,0.00075033115,0.00066082773,0.0020209346,0.0007557858,0.0021900118,0.0015644215,0.00086611597,0.0021763109],"category_scores_gemma":[0.18476467,0.00040699693,0.0014956283,0.0019249995,0.0015740441,0.0019116291,0.0022163074,0.0011928515,0.0008776564],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014367958,0.0015368626,0.6669604,0.00039568372,0.0005923944,0.00014986927,0.013326814,0.01196126,0.004587791,0.009036559,0.0033633376,0.28665227],"study_design_scores_gemma":[0.000854186,0.0037046198,0.76942545,0.00043593717,0.00044324095,0.0004908605,0.0053253802,0.16602518,0.012768955,0.027919535,0.012365383,0.00024115283],"about_ca_topic_score_codex":0.0020471974,"about_ca_topic_score_gemma":0.0023971812,"teacher_disagreement_score":0.05117789,"about_ca_system_score_codex":0.0018959219,"about_ca_system_score_gemma":0.0016526545,"threshold_uncertainty_score":0.27065778},"labels":[],"label_agreement":null}]}