{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":26,"total_is_capped":false,"direct_labels_cover":0,"predictions_cover":26,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"07872ab30370","filters":{"venue":"Journal of Educational Measurement"}},"results":[{"id":"W2108611097","doi":"10.1111/j.1745-3984.2004.tb01163.x","title":"The Attribute Hierarchy Method for Cognitive Assessment: A Variation on Tatsuoka's Rule‐Space Approach","year":2004,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Cognitive Science and Mapping","field":"Computer Science","cited_by":393,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Cognition; Space (punctuation); Hierarchy; Task (project management); Psychology; Syllogism; Domain (mathematical analysis); Variation (astronomy); Cognitive psychology; Computer science; Artificial intelligence; Mathematics; Epistemology","authors":[{"name":"Jacqueline P. Leighton","is_ca":true},{"name":"Mark J. Gierl","is_ca":true},{"name":"S. Hunka","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.07125507419111203,"gpt":0.3600736602404125,"spread":0.2888185860493005,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02753371,0.001894766,0.001818007,0.007813892,0.001090568,0.003836848,0.003377898,0.001922542,0.006959303],"category_scores_gemma":[0.06946735,0.0008067979,0.002439426,0.007410011,0.003317839,0.005038893,0.003795875,0.004622648,0.003233179],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001727321,"about_ca_system_score_gemma":0.003573003,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00295605,"about_ca_topic_score_gemma":0.003826217,"domain_scores_codex":[0.9587637,0.02712101,0.00264612,0.001880116,0.009136419,0.000452667],"domain_scores_gemma":[0.9620858,0.02661562,0.001710572,0.003498952,0.005647052,0.000441952],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001516427,0.0003426703,0.005692467,0.001546899,0.0003501979,0.0001332126,0.003818878,0.009675758,0.00427929,0.2331637,0.01053253,0.7303128],"study_design_scores_gemma":[0.0002192193,0.0007331122,0.01524626,0.001195586,0.0001910271,0.00120185,0.001997211,0.09754455,0.005273029,0.7292013,0.1466456,0.0005512938],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001717075,0.0004436853,0.9931809,0.0002299856,0.0001148665,0.0005747491,0.0002021054,0.0005062664,0.003030486],"genre_scores_gemma":[0.02137453,0.0004381928,0.9738349,0.0001884027,0.00005701102,0.002513673,0.0002305598,0.0001449281,0.001217728],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.02753371,"threshold_uncertainty_score":0.1456139,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2166083835","doi":"10.1111/j.1745-3984.2001.tb01121.x","title":"Identifying Sources of Differential Item and Bundle Functioning on Translated Achievement Tests: A Confirmatory Analysis","year":2001,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Educational and Psychological Assessments","field":"Psychology","cited_by":118,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"Social Sciences and Humanities Research Council of Canada; International Association for the Evaluation of Educational Achievement; University of Alberta","keywords":"Differential item functioning; Psychology; Categorization; Item analysis; Set (abstract data type); Achievement test; Test (biology); Item response theory; Social psychology; Standardized test; Mathematics education; Psychometrics; Developmental psychology; Computer science; Artificial intelligence","authors":[{"name":"Mark J. Gierl","is_ca":true},{"name":"Shameem Nyla Khaliq","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1150924720928353,"gpt":0.3772707718796586,"spread":0.2621782997868233,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1063298,0.00222076,0.001753178,0.00894666,0.002293115,0.003350091,0.001710708,0.0009027468,0.003089414],"category_scores_gemma":[0.231848,0.001416625,0.003897454,0.008528724,0.002016179,0.001928467,0.003329297,0.002588059,0.001177479],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002030132,"about_ca_system_score_gemma":0.007338296,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008159914,"about_ca_topic_score_gemma":0.01152415,"domain_scores_codex":[0.9179605,0.04294685,0.008736846,0.006432729,0.02197265,0.001950527],"domain_scores_gemma":[0.6631622,0.1511741,0.01639113,0.03211689,0.1354378,0.001717991],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0009207714,0.0008689326,0.8290794,0.001294017,0.002228993,0.0008928998,0.02424778,0.001505111,0.008416957,0.004312888,0.003320065,0.1229122],"study_design_scores_gemma":[0.0004708767,0.003097218,0.9028767,0.001178859,0.003137708,0.0009751447,0.02592597,0.02704935,0.01688188,0.005650944,0.01250767,0.0002476553],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.863367,0.0006129122,0.1144778,0.0007409758,0.0001962254,0.007724663,0.002639516,0.0005187097,0.00972214],"genre_scores_gemma":[0.9002059,0.0002575825,0.08802927,0.0002285836,0.00006980507,0.005702074,0.003411697,0.0002774172,0.001817678],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1063298,"threshold_uncertainty_score":0.5623326,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2139990047","doi":"10.1111/j.1745-3984.2011.00158.x","title":"Estimating Classification Consistency and Accuracy for Cognitive Diagnostic Assessment","year":2012,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":90,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Consistency (knowledge bases); Reliability (semiconductor); Computation; Subtraction; Statistical inference; Fraction (chemistry); Inference; Sampling (signal processing); Computer science; Statistics; Cognitive test; Artificial intelligence; Cognition; Mathematics; Data mining; Pattern recognition (psychology); Algorithm; Psychology; Arithmetic","authors":[{"name":"Ying Cui","is_ca":true},{"name":"Mark J. Gierl","is_ca":true},{"name":"Hua‐Hua Chang","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7019996993223337,"gpt":0.5564925005972196,"spread":0.1455071987251142,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1035545,0.00169812,0.002388696,0.01376382,0.00157261,0.005045421,0.003601267,0.002957342,0.001857414],"category_scores_gemma":[0.5174043,0.0008104962,0.00202365,0.006973857,0.004957703,0.006458142,0.005271896,0.003715405,0.0008630933],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002312784,"about_ca_system_score_gemma":0.002480052,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002135807,"about_ca_topic_score_gemma":0.001497065,"domain_scores_codex":[0.9127699,0.04862287,0.00713484,0.008315929,0.02199535,0.001161218],"domain_scores_gemma":[0.5240027,0.3866173,0.02332029,0.03908265,0.02594883,0.001028326],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008542884,0.0003406424,0.1748996,0.0009191374,0.002282127,0.0003230358,0.002510667,0.08907442,0.003343957,0.1580759,0.005752421,0.5616237],"study_design_scores_gemma":[0.000175953,0.0004266956,0.07021218,0.0005814144,0.0005332922,0.001019019,0.0008064468,0.5072801,0.00823833,0.4042968,0.006069818,0.0003600944],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.04193288,0.0007359284,0.9522573,0.0003169184,0.00009658703,0.0003139553,0.0002930441,0.0006537765,0.003399593],"genre_scores_gemma":[0.4975609,0.0003908419,0.4986362,0.0002340657,0.0002247493,0.001152976,0.0009064447,0.0003176629,0.0005761306],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.1035545,"threshold_uncertainty_score":0.5476553,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1991537194","doi":"10.1111/j.1745-3984.2007.00042.x","title":"Making Diagnostic Inferences About Cognitive Attributes Using the Rule‐Space Model and Attribute Hierarchy Method","year":2007,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Intelligent Tutoring Systems and Adaptive Learning","field":"Computer Science","cited_by":82,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Hierarchy; Computer science; Artificial intelligence; Cognition; Space (punctuation); Machine learning; Task (project management); Data mining; Psychology","authors":[{"name":"Mark J. Gierl","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1755289445562674,"gpt":0.3829384330597237,"spread":0.2074094885034563,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02212287,0.0009037805,0.001049006,0.005978038,0.0008259345,0.005109258,0.00252898,0.001456976,0.002283567],"category_scores_gemma":[0.1604934,0.0004916869,0.001356088,0.003369964,0.004617839,0.01257772,0.003034557,0.002628354,0.0005661948],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001514582,"about_ca_system_score_gemma":0.002603307,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004156739,"about_ca_topic_score_gemma":0.002313836,"domain_scores_codex":[0.974508,0.01442784,0.001572687,0.001859445,0.007097976,0.0005339132],"domain_scores_gemma":[0.8798083,0.0941042,0.005371542,0.007992624,0.0115044,0.001218984],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0004109491,0.0005558629,0.03832071,0.0006506504,0.0002774556,0.0003115832,0.009455105,0.03082909,0.003839663,0.3760841,0.002337866,0.536927],"study_design_scores_gemma":[0.0001284931,0.0002255743,0.01091773,0.0002303683,0.00008972907,0.0003375324,0.002009592,0.3317765,0.005029579,0.644531,0.004542942,0.0001809684],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.04450251,0.0001386641,0.9503236,0.0004718787,0.00003495371,0.0001713918,0.0001122964,0.0003503471,0.00389434],"genre_scores_gemma":[0.4259765,0.0002044068,0.5723229,0.0001951576,0.00004437795,0.0003733494,0.0002502362,0.00006458972,0.0005685282],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.02212287,"threshold_uncertainty_score":0.1169983,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2171625237","doi":"10.1111/j.1745-3984.2007.00024.x","title":"An Investigation into the Dimensionality of TOEFL Using Conditional Covariance‐Based Nonparametric Approach","year":2007,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":82,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Test of English as a Foreign Language; Reading comprehension; Curse of dimensionality; Psychology; Covariance; Nonparametric statistics; Natural language processing; Computer science; Reading (process); Artificial intelligence; Statistics; Mathematics education; Mathematics; Linguistics; Language assessment","authors":[{"name":"Eunice Eunhee Jang","is_ca":true},{"name":"Louis A. Roussos","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.6245000768597356,"gpt":0.5087043214551444,"spread":0.1157957554045912,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02306184,0.0004081151,0.0005474323,0.001588857,0.0008350664,0.001792825,0.0007877942,0.0004549866,0.001814711],"category_scores_gemma":[0.1397669,0.0002460915,0.0008093397,0.001612285,0.00210804,0.002040643,0.002328658,0.00128944,0.0001321937],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008675858,"about_ca_system_score_gemma":0.00196344,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002110985,"about_ca_topic_score_gemma":0.002133855,"domain_scores_codex":[0.9851901,0.009948391,0.0006062987,0.00107539,0.002876422,0.000303426],"domain_scores_gemma":[0.7991765,0.173641,0.007003104,0.01260695,0.007066263,0.0005061703],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006108332,0.0004146124,0.429662,0.000513825,0.0004827114,0.000542769,0.01675755,0.02342327,0.01227218,0.2059584,0.001843206,0.3075187],"study_design_scores_gemma":[0.00009790945,0.0009090285,0.4606661,0.0002679,0.0001921649,0.001545497,0.007533888,0.3215256,0.01282653,0.1858819,0.008219657,0.000333825],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5296407,0.0001265546,0.4646347,0.0003519653,0.00002211698,0.0002915275,0.0002076243,0.0001049154,0.004620022],"genre_scores_gemma":[0.9193838,0.00006375724,0.07963959,0.00004680542,0.00001536673,0.000382803,0.0002027707,0.00002273708,0.0002423697],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02306184,"threshold_uncertainty_score":0.1219642,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1991728049","doi":"10.1111/j.1745-3984.2009.00091.x","title":"The Hierarchy Consistency Index: Evaluating Person Fit for Cognitive Diagnostic Assessment","year":2009,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Cognitive Science and Mapping","field":"Computer Science","cited_by":66,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Statistic; Consistency (knowledge bases); Cognition; Hierarchy; Computer science; Item response theory; Goodness of fit; Psychology; Statistics; Cognitive psychology; Artificial intelligence; Mathematics; Machine learning; Psychometrics","authors":[{"name":"Ying Cui","is_ca":true},{"name":"Jacqueline P. Leighton","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1652812041663947,"gpt":0.4007072928289228,"spread":0.2354260886625281,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04028628,0.00142489,0.001466349,0.01138919,0.0009375611,0.002314147,0.001430061,0.001648258,0.001772447],"category_scores_gemma":[0.1837069,0.0004745412,0.002699914,0.005963977,0.001405267,0.003511467,0.002516699,0.001683503,0.000424212],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001077442,"about_ca_system_score_gemma":0.001809147,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002622323,"about_ca_topic_score_gemma":0.00264546,"domain_scores_codex":[0.9690507,0.0144768,0.003363532,0.002143691,0.01035103,0.0006143017],"domain_scores_gemma":[0.852834,0.1089663,0.01211604,0.01054813,0.01392554,0.001609993],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007911876,0.0005154195,0.6703907,0.0005125803,0.00236406,0.0002868977,0.002571625,0.02628441,0.002915663,0.01352655,0.00456242,0.2752784],"study_design_scores_gemma":[0.0003054241,0.003031833,0.5715205,0.0004512722,0.0006600335,0.001472179,0.002647988,0.3432082,0.006256807,0.06007173,0.009700412,0.0006736076],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4015845,0.0009301627,0.5818649,0.0004963723,0.0002626381,0.001224219,0.001572083,0.001693899,0.01037121],"genre_scores_gemma":[0.8808327,0.0001649726,0.1162176,0.0001153963,0.0000647169,0.001060524,0.001044006,0.0001872714,0.0003129323],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.04028628,"threshold_uncertainty_score":0.2130567,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2153713169","doi":"10.1111/j.1745-3984.2003.tb01148.x","title":"Identifying Content and Cognitive Skills that Produce Gender Differences in Mathematics: A Demonstration of the Multidimensionality‐Based DIF Analysis Paradigm","year":2003,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Cognitive and developmental aspects of mathematical skills","field":"Mathematics","cited_by":65,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Cognition; Curriculum; Psychology; Mathematics education; Content analysis; Test (biology); Strengths and weaknesses; Social psychology; Pedagogy; Social science","authors":[{"name":"Mark J. Gierl","is_ca":true},{"name":"Jeffrey Bisanz","is_ca":true},{"name":"Gay L. Bisanz","is_ca":true},{"name":"Keith A. Boughton","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1922588375550472,"gpt":0.3347692788854235,"spread":0.1425104413303763,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05059307,0.001176614,0.0009367539,0.006186645,0.001616153,0.002457251,0.0009688728,0.0009340945,0.003349516],"category_scores_gemma":[0.1015512,0.0004266941,0.00134076,0.003352332,0.003617139,0.002351465,0.004860975,0.001987621,0.0004932191],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000998655,"about_ca_system_score_gemma":0.001282702,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001568045,"about_ca_topic_score_gemma":0.001466371,"domain_scores_codex":[0.9739986,0.01730303,0.001617912,0.001988311,0.004556136,0.0005360515],"domain_scores_gemma":[0.8878945,0.08726515,0.005413227,0.01002274,0.0084682,0.0009362372],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.0008773472,0.0007071695,0.3258897,0.001006218,0.00049255,0.00081876,0.07322314,0.00186836,0.0149986,0.1653703,0.005154125,0.4095937],"study_design_scores_gemma":[0.0004368256,0.001524527,0.4421041,0.000795966,0.0003634254,0.00363427,0.0202802,0.04329656,0.01503528,0.4405518,0.03149883,0.0004782097],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3449115,0.0008235936,0.6199695,0.002747656,0.0002767287,0.001459129,0.001241397,0.0002963285,0.02827415],"genre_scores_gemma":[0.6771537,0.0002686685,0.3185329,0.0006211884,0.00008719527,0.002016054,0.0002988738,0.00007975228,0.0009415932],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.05059307,"threshold_uncertainty_score":0.267565,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2146894730","doi":"10.1111/j.1745-3984.2011.00142.x","title":"Using the Attribute Hierarchy Method to Make Diagnostic Inferences about Examinees’ Cognitive Skills in Critical Reading","year":2011,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":57,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Cognition; Reading (process); Psychology; Reading comprehension; Set (abstract data type); Test (biology); Sample (material); Cognitive psychology; Hierarchy; Comprehension; Natural language processing; Computer science; Artificial intelligence; Linguistics","authors":[{"name":"Changjiang Wang","is_ca":false},{"name":"Mark J. Gierl","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7841432219145653,"gpt":0.5727164674921034,"spread":0.2114267544224619,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02750866,0.00070694,0.0005801899,0.007300245,0.0009026969,0.001501422,0.0008959151,0.0006487184,0.001706337],"category_scores_gemma":[0.1561389,0.0003806228,0.0008458025,0.00343336,0.00105243,0.002847646,0.002113256,0.001489539,0.0003360336],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007873774,"about_ca_system_score_gemma":0.001360202,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003685861,"about_ca_topic_score_gemma":0.003990437,"domain_scores_codex":[0.9807233,0.01271524,0.001544718,0.001073845,0.00357627,0.0003665242],"domain_scores_gemma":[0.8633758,0.1120493,0.007571429,0.007722528,0.008312535,0.0009683975],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0009178545,0.0006146923,0.5174929,0.0004183814,0.0004396198,0.0003045912,0.01340887,0.01012385,0.006253977,0.01928587,0.00266322,0.4280763],"study_design_scores_gemma":[0.0004324087,0.002032999,0.4664549,0.00063933,0.0004621661,0.002257249,0.01223818,0.3471308,0.01696848,0.1421456,0.008839974,0.0003978748],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5181855,0.0002239227,0.4738452,0.000333885,0.00007915948,0.0007196076,0.0004571902,0.000592844,0.005562588],"genre_scores_gemma":[0.7599263,0.00009530682,0.2387074,0.00005409036,0.00002480349,0.0005987055,0.0002665868,0.00003863987,0.0002881046],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02750866,"threshold_uncertainty_score":0.1454815,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2969964033","doi":"10.1111/jedm.12237","title":"Students’ Interpretation of Formative Assessment Feedback: Three Claims for Why We Know So Little About Something So Important","year":2019,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":45,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Formative assessment; Psychology; Interpretation (philosophy); Cognition; Process (computing); Mathematics education; Cognitive psychology; Computer science","authors":[{"name":"Jacqueline P. Leighton","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04422115994093499,"gpt":0.3915110005329427,"spread":0.3472898405920077,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1629836,0.0008757368,0.001202251,0.00323218,0.003163223,0.01170128,0.004797573,0.006133221,0.001664882],"category_scores_gemma":[0.4511096,0.0009209597,0.00111679,0.001632337,0.03786018,0.01205946,0.009296358,0.009498495,0.0003998954],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005403239,"about_ca_system_score_gemma":0.006995072,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002013419,"about_ca_topic_score_gemma":0.002004466,"domain_scores_codex":[0.8235787,0.1040138,0.01459309,0.007272645,0.04707832,0.003463482],"domain_scores_gemma":[0.3995936,0.4467385,0.05477543,0.04046233,0.05357383,0.004856498],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.001444832,0.0006019319,0.0905017,0.001575773,0.0003112352,0.0007102685,0.7034534,0.0005789089,0.003211124,0.06146973,0.004617074,0.1315242],"study_design_scores_gemma":[0.0004270425,0.001858364,0.08856123,0.006809203,0.0005060669,0.002356007,0.5160545,0.01041008,0.01806762,0.3194277,0.0346782,0.000843998],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7810838,0.003834429,0.07590194,0.1132113,0.001180053,0.0003101662,0.0001030984,0.0003777187,0.02399758],"genre_scores_gemma":[0.9909039,0.0003840305,0.004905378,0.003014287,0.00008412426,0.0001292041,0.00001925099,0.00003106646,0.0005287761],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1629836,"threshold_uncertainty_score":0.8619502,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2024075312","doi":"10.1111/j.1745-3984.2009.00082.x","title":"Reliability and Attribute‐Based Scoring in Cognitive Diagnostic Assessment","year":2009,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":45,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Reliability (semiconductor); Variance (accounting); Cognition; Set (abstract data type); Strengths and weaknesses; Computer science; Test (biology); Sample (material); Psychology; Statistics; Natural language processing; Artificial intelligence; Mathematics; Social psychology","authors":[{"name":"Mark J. Gierl","is_ca":true},{"name":"Ying Cui","is_ca":true},{"name":"Jiawen Zhou","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5837310786203939,"gpt":0.5286242359275425,"spread":0.05510684269285138,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1286489,0.0009235752,0.0009249049,0.006987551,0.000955777,0.002242624,0.00160036,0.001601599,0.0006779776],"category_scores_gemma":[0.4079525,0.0006413809,0.001197902,0.005657394,0.004009214,0.002709043,0.003055232,0.002625741,0.0004848331],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001430486,"about_ca_system_score_gemma":0.001697572,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002632343,"about_ca_topic_score_gemma":0.001912742,"domain_scores_codex":[0.8255391,0.1314585,0.007313102,0.005498216,0.02915481,0.001036252],"domain_scores_gemma":[0.5798919,0.3372153,0.01787547,0.02524729,0.03865531,0.001114718],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0006749326,0.0003513521,0.3333179,0.000894058,0.001006202,0.0002660692,0.008039462,0.02322665,0.003143356,0.08456835,0.003926045,0.5405855],"study_design_scores_gemma":[0.0003134171,0.002561566,0.3704106,0.002061608,0.0009383241,0.002693837,0.004757944,0.328522,0.0110198,0.2582112,0.0179132,0.0005965414],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2616036,0.004319722,0.7141907,0.001016384,0.0004179922,0.0009358364,0.0003291982,0.0004632559,0.01672328],"genre_scores_gemma":[0.8555698,0.0007489757,0.1419206,0.0001183298,0.0002321704,0.0007375018,0.0001881034,0.00008303639,0.0004014235],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.1286489,"threshold_uncertainty_score":0.6803685,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1996977567","doi":"10.1111/j.1745-3984.2001.tb01114.x","title":"Stability of School Academic Performance Across Subject Areas","year":2001,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"School Choice and Performance","field":"Social Sciences","cited_by":43,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Mathematics education; Context (archaeology); Subject (documents); Academic achievement; Multilevel model; Psychology; Reading (process); School climate; Statistical analysis; Multivariate analysis; Geography; Computer science; Mathematics; Political science; Statistics","authors":[{"name":"Xin Ma","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1420175177625125,"gpt":0.3951489073590436,"spread":0.2531313895965311,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003616924,0.0002236308,0.0006851017,0.004603892,0.0008198137,0.001333556,0.0007528935,0.0004080116,0.001195715],"category_scores_gemma":[0.01898141,0.0001929378,0.0004883689,0.004873426,0.0008488816,0.0009663969,0.001778901,0.0006568879,0.000400633],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001074484,"about_ca_system_score_gemma":0.0007322723,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01567269,"about_ca_topic_score_gemma":0.01648006,"domain_scores_codex":[0.9954383,0.001018187,0.000500484,0.001287676,0.001291107,0.0004642372],"domain_scores_gemma":[0.9788093,0.004084039,0.007390462,0.003002521,0.0050859,0.001627821],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001333173,0.00002937652,0.9895706,0.00002050034,0.0001428797,0.0000252934,0.0004515346,0.0001761367,0.000449963,0.000103753,0.0001488658,0.008747648],"study_design_scores_gemma":[6.749323e-7,0.00002272803,0.9996044,0.000002133752,0.000005120065,0.00001190149,0.00008830988,0.00006800664,0.00006839194,0.00003132877,0.00009468703,0.000002285604],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9965234,0.0003756692,0.000473593,0.00006612086,0.00001349165,0.00001529603,0.0008017693,0.00003537875,0.001695099],"genre_scores_gemma":[0.9989604,0.00005236621,0.00009639256,0.00001292497,0.000006551687,0.00001043725,0.0006849952,0.000007534375,0.0001683333],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01567269,"threshold_uncertainty_score":0.03116292,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1595860368","doi":"10.1111/jedm.12072","title":"Extended Mixed‐Effects Item Response Models With the MH‐RM Algorithm","year":2015,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":42,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"York University","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Item response theory; Random effects model; Curse of dimensionality; Rasch model; Mixed model; Mathematics; Algorithm; Statistics; Monte Carlo method; Linear regression; Generalized linear mixed model; Computer science; Econometrics; Psychometrics; Meta-analysis","authors":[{"name":"R. Philip Chalmers","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.6020280900847433,"gpt":0.4600375066203918,"spread":0.1419905834643515,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04233491,0.002666317,0.003660246,0.002778801,0.001336912,0.002938427,0.007811948,0.003052759,0.01690565],"category_scores_gemma":[0.09757704,0.002376015,0.006290316,0.004015164,0.001173923,0.003547044,0.004334075,0.006422726,0.005866083],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001579715,"about_ca_system_score_gemma":0.003707427,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005591919,"about_ca_topic_score_gemma":0.006589008,"domain_scores_codex":[0.9573171,0.03636257,0.001424581,0.002429919,0.002010043,0.0004557975],"domain_scores_gemma":[0.942917,0.04656323,0.001587391,0.005178472,0.003429011,0.0003250109],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0009586306,0.0005421058,0.003967281,0.001116188,0.002409448,0.0004479235,0.001392117,0.2139029,0.001077621,0.2119027,0.01357695,0.5487062],"study_design_scores_gemma":[0.0002537974,0.0002569006,0.0009524213,0.0001698241,0.0002639262,0.0002013225,0.0001191741,0.8602836,0.000694845,0.1273035,0.0093821,0.0001185208],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001398726,0.0001191958,0.9966128,0.0001282701,0.00002699276,0.0004513468,0.0002593437,0.0006395495,0.0003636922],"genre_scores_gemma":[0.01471472,0.00009222391,0.9811599,0.0001011332,0.00003249483,0.002415219,0.000436129,0.000154369,0.0008938286],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.04233491,"threshold_uncertainty_score":0.223891,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2151713426","doi":"10.1111/j.1745-3984.2007.00052.x","title":"Using the Attribute Hierarchy Method to Identify and Interpret Cognitive Skills that Produce Group Differences","year":2008,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Multi-Criteria Decision Making","field":"Decision Sciences","cited_by":32,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Cognition; Set (abstract data type); Task (project management); Hierarchy; Test (biology); Psychology; Group (periodic table); Sample (material); Artificial intelligence; Natural language processing; Computer science; Cognitive psychology; Machine learning","authors":[{"name":"Mark J. Gierl","is_ca":true},{"name":"Yinggan Zheng","is_ca":true},{"name":"Ying Cui","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5348286662951659,"gpt":0.5307739533614363,"spread":0.00405471293372961,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01128878,0.0008653685,0.0007057085,0.004535574,0.0006938365,0.001456446,0.0006099587,0.0006924932,0.003253415],"category_scores_gemma":[0.0445303,0.0001861182,0.001002531,0.002644661,0.001190209,0.001955598,0.001360408,0.001210931,0.0003888903],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005730412,"about_ca_system_score_gemma":0.0007106799,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001719923,"about_ca_topic_score_gemma":0.001011675,"domain_scores_codex":[0.9945158,0.002940902,0.0003310493,0.0005740871,0.001433695,0.0002044591],"domain_scores_gemma":[0.960232,0.03229464,0.002560238,0.002393441,0.002076738,0.0004430222],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00111677,0.0008162144,0.4001149,0.0004691407,0.00120562,0.0003757548,0.008261373,0.0162355,0.01869079,0.04326965,0.002431099,0.5070133],"study_design_scores_gemma":[0.0003423849,0.0023182,0.5312116,0.0002804834,0.0005271959,0.001203661,0.004940471,0.235763,0.01637016,0.2003069,0.006448251,0.0002876874],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.378914,0.000239889,0.6132509,0.0003908694,0.0001194613,0.0004981799,0.0004610039,0.0006888352,0.005436854],"genre_scores_gemma":[0.8218656,0.00008190877,0.1765932,0.0001125893,0.00004095327,0.0004684333,0.0002750712,0.00007128829,0.0004909451],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01128878,"threshold_uncertainty_score":0.0597015,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1968457467","doi":"10.1111/j.1745-3984.2006.00019.x","title":"Testing Features of Graphical DIF: Application of a Regression Correction to Three Nonparametric Statistical Tests","year":2006,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":22,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Differential item functioning; Nonparametric statistics; Statistics; Statistical hypothesis testing; Context (archaeology); Mathematics; Statistical power; Item response theory; Matching (statistics); Test (biology); Regression analysis; Econometrics; Computer science; Psychometrics","authors":[{"name":"Daniel M. Bolt","is_ca":false},{"name":"Mark J. Gierl","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3249506735001434,"gpt":0.4596520375010046,"spread":0.1347013640008612,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06474233,0.001853949,0.002105466,0.006680104,0.001571124,0.002878376,0.003628447,0.002015731,0.009785803],"category_scores_gemma":[0.4333227,0.0007167858,0.003499131,0.00805457,0.003733657,0.003458266,0.004225963,0.003883761,0.001130418],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001721895,"about_ca_system_score_gemma":0.002906276,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003569512,"about_ca_topic_score_gemma":0.002426129,"domain_scores_codex":[0.8836843,0.08471628,0.005511287,0.008542153,0.01590874,0.001637338],"domain_scores_gemma":[0.5796313,0.3401114,0.02035946,0.03776416,0.02086657,0.001267136],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001990931,0.0007305348,0.1222739,0.0009157629,0.001856219,0.001506125,0.003384214,0.04665831,0.006337458,0.1170039,0.007649415,0.6896933],"study_design_scores_gemma":[0.0006746186,0.003143013,0.1556843,0.0003357382,0.0008224499,0.002159478,0.001608188,0.6654788,0.01115452,0.1456164,0.01275317,0.0005692784],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.06067903,0.0001066401,0.9306547,0.0004195487,0.0001529343,0.001009731,0.0004492673,0.001802215,0.004725803],"genre_scores_gemma":[0.5149449,0.00007352533,0.4808297,0.0001681346,0.00006683151,0.002129553,0.0004250572,0.000351605,0.001010713],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.06474233,"threshold_uncertainty_score":0.3423943,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1995404757","doi":"10.1111/j.1745-3984.2009.01067.x","title":"The Reliability of Difference Scores in Populations and Samples","year":2009,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Statistical Methods and Bayesian Inference","field":"Mathematics","cited_by":17,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Carleton University","funders":"","keywords":"Reliability (semiconductor); Statistics; Population; Variance (accounting); Mathematics; Sample (material); Sample size determination; Standard deviation; Econometrics; Demography; Physics","authors":[{"name":"Donald W. Zimmerman","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2134094557378299,"gpt":0.4190955226912946,"spread":0.2056860669534647,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0680208,0.0004848641,0.001222443,0.003740811,0.0006008011,0.002639203,0.001553563,0.001551407,0.001080431],"category_scores_gemma":[0.4520124,0.000879377,0.0008822267,0.00214699,0.00543419,0.003381425,0.003787454,0.00187198,0.0003787413],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001119111,"about_ca_system_score_gemma":0.0008857125,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001755256,"about_ca_topic_score_gemma":0.0008082017,"domain_scores_codex":[0.924015,0.0484737,0.003912327,0.009264891,0.01358661,0.0007474637],"domain_scores_gemma":[0.6228648,0.3158165,0.01335595,0.03185407,0.01531482,0.0007937996],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001801536,0.0002639465,0.5846543,0.000950475,0.002116921,0.0005371086,0.01180402,0.07848589,0.006271826,0.1029192,0.001598546,0.2085962],"study_design_scores_gemma":[0.0002631333,0.001351576,0.4651974,0.0005820784,0.0007287806,0.002412417,0.003328127,0.2423487,0.01044961,0.2657985,0.00711423,0.0004254018],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.6710046,0.0009633605,0.3228044,0.0002749214,0.000101941,0.0002264955,0.0003789733,0.0003167696,0.003928586],"genre_scores_gemma":[0.9742308,0.0001642169,0.02488701,0.00004689796,0.00002778729,0.0001269017,0.000295719,0.00003502387,0.0001857362],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9319792,"threshold_uncertainty_score":0.3597327,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2920811067","doi":"10.1111/jedm.12205","title":"Modeling Response Styles in Cross‐Country Self‐Reports: An Application of a Multilevel Multidimensional Nominal Response Model","year":2019,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":16,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"","keywords":"Comparability; Psychology; Multilevel model; Structural equation modeling; Econometrics; Social psychology; Cross-cultural; Computer science; Statistics; Mathematics; Political science","authors":[{"name":"Unhee Ju","is_ca":false},{"name":"Carl F. Falk","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.350099387849287,"gpt":0.4756613456886337,"spread":0.1255619578393468,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08161074,0.001106274,0.001218685,0.002214247,0.001248005,0.002506109,0.002965224,0.001483268,0.004781013],"category_scores_gemma":[0.2033185,0.0007954191,0.004051659,0.002836017,0.001478763,0.002063053,0.003385937,0.003395799,0.0009324734],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001990812,"about_ca_system_score_gemma":0.00153676,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009676145,"about_ca_topic_score_gemma":0.007088503,"domain_scores_codex":[0.9010826,0.08632831,0.002909865,0.005447207,0.003381832,0.0008501815],"domain_scores_gemma":[0.7500985,0.2063738,0.01364013,0.01890544,0.01005601,0.0009260858],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001316544,0.000859368,0.6423956,0.0007921098,0.005026666,0.0004774995,0.009562686,0.1742573,0.00176274,0.04212899,0.004152671,0.1172678],"study_design_scores_gemma":[0.0002305921,0.001094709,0.09044692,0.0003089618,0.0005838107,0.0002446085,0.002983067,0.8490579,0.001724526,0.04895565,0.004076416,0.0002928507],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2994718,0.0001198784,0.6952124,0.0008624285,0.0001345345,0.0009686263,0.001351019,0.0004388809,0.001440535],"genre_scores_gemma":[0.8261194,0.00005386201,0.1700528,0.0001634994,0.00002732203,0.001833366,0.001116499,0.00007281319,0.0005604278],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.08161074,"threshold_uncertainty_score":0.431604,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2153172866","doi":"10.1111/j.1745-3984.2006.00016.x","title":"Evaluating DETECT Classification Accuracy and Consistency When Data Display Complex Structure","year":2006,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Advanced Statistical Modeling Techniques","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Curse of dimensionality; Correlation; Consistency (knowledge bases); Sample (material); Sample size determination; Dimension (graph theory); Nonparametric statistics; Statistics; Computer science; Pattern recognition (psychology); Artificial intelligence; Data mining; Mathematics","authors":[{"name":"Mark J. Gierl","is_ca":true},{"name":"Jacqueline P. Leighton","is_ca":true},{"name":"Xuan Tan","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3012466859744121,"gpt":0.4266774629592089,"spread":0.1254307769847969,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07423042,0.001437119,0.002126177,0.004969912,0.0009607854,0.003642156,0.001722194,0.002253542,0.001509457],"category_scores_gemma":[0.2885753,0.0006763989,0.002201176,0.00326317,0.001985449,0.004076316,0.003103537,0.001888467,0.000757969],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001128913,"about_ca_system_score_gemma":0.001030326,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001511113,"about_ca_topic_score_gemma":0.001721616,"domain_scores_codex":[0.9527615,0.02475442,0.004813812,0.005639229,0.0110933,0.0009378019],"domain_scores_gemma":[0.6071247,0.3350248,0.01799477,0.02543871,0.01326288,0.001154216],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.004587154,0.000844828,0.7039278,0.0007354329,0.002542292,0.000372561,0.002777412,0.06279698,0.006623793,0.005530509,0.005048821,0.2042124],"study_design_scores_gemma":[0.0006358747,0.004071621,0.446038,0.0003355289,0.001166824,0.001406302,0.002467751,0.4914848,0.02599031,0.0178416,0.008140066,0.000421329],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8397788,0.0008048527,0.1490337,0.0007176889,0.0002172589,0.0005872597,0.0012514,0.0008935242,0.006715689],"genre_scores_gemma":[0.9492918,0.0001789475,0.04730465,0.000257047,0.00005349113,0.0004771228,0.001371107,0.0001997292,0.0008660383],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.07423042,"threshold_uncertainty_score":0.3925726,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4308426657","doi":"10.1111/jedm.12347","title":"A Unified Comparison of IRT‐Based Effect Sizes for DIF Investigations","year":2022,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"York University","funders":"","keywords":"Differential item functioning; Estimator; Statistics; Item response theory; Sample size determination; Differential (mechanical device); Population; Sample (material); Monte Carlo method; Econometrics; Computer science; Mathematics; Psychometrics","authors":[{"name":"R. Philip Chalmers","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.6842492147562678,"gpt":0.529819503327333,"spread":0.1544297114289348,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2831473,0.001685141,0.002795767,0.009645748,0.0007734505,0.004376698,0.003176507,0.002372331,0.006707405],"category_scores_gemma":[0.5785996,0.000814014,0.004200751,0.004932922,0.005442849,0.006470828,0.004595218,0.002655801,0.0006767204],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001809064,"about_ca_system_score_gemma":0.001246189,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004062358,"about_ca_topic_score_gemma":0.0002944522,"domain_scores_codex":[0.6938615,0.2651159,0.0125706,0.007918072,0.01947602,0.001057895],"domain_scores_gemma":[0.3614603,0.5787924,0.01387793,0.02860053,0.01622714,0.001041695],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.006689505,0.0008788242,0.082348,0.006144334,0.007450565,0.0003228353,0.008059801,0.03617782,0.00784832,0.2927403,0.006120402,0.5452193],"study_design_scores_gemma":[0.002877319,0.01800943,0.2465201,0.005475199,0.007240993,0.001663565,0.007087232,0.3160987,0.02077991,0.3453749,0.02756812,0.00130457],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1108289,0.003375586,0.8689085,0.0006394912,0.0003757113,0.002711447,0.00109387,0.0009651435,0.01110127],"genre_scores_gemma":[0.6286783,0.0005624779,0.3639965,0.0002993806,0.0001140245,0.004834724,0.0006942198,0.0003589564,0.0004614204],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.2831473,"threshold_uncertainty_score":0.884007,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2956271099","doi":"10.1111/jedm.12207","title":"Performance of Person‐Fit Statistics Under Model Misspecification","year":2019,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"","keywords":"Statistic; Econometrics; Item response theory; Inference; Latent variable; Latent variable model; Parametric statistics; Statistics; Statistical inference; Goodness of fit; Parametric model; Computer science; Variable (mathematics); Specification; Empirical research; Aggregate (composite); Mathematics; Psychometrics; Artificial intelligence","authors":[{"name":"Seong Eun Hong","is_ca":false},{"name":"Scott Monroe","is_ca":false},{"name":"Carl F. Falk","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7529540980675968,"gpt":0.4796196803409436,"spread":0.2733344177266532,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1546481,0.001245679,0.001819421,0.004553275,0.001107121,0.002518932,0.00189838,0.002791509,0.001892153],"category_scores_gemma":[0.5015508,0.0005854602,0.0022377,0.003975161,0.004038498,0.005430296,0.003203576,0.003520278,0.0003947525],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001904218,"about_ca_system_score_gemma":0.002567612,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003741663,"about_ca_topic_score_gemma":0.00157258,"domain_scores_codex":[0.8514829,0.1211385,0.006607599,0.009830968,0.009398459,0.001541604],"domain_scores_gemma":[0.216853,0.7306257,0.01912949,0.02515949,0.00700608,0.001226265],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.006497463,0.0009333358,0.3576297,0.0007353555,0.005174615,0.001493058,0.004683972,0.3427283,0.003969203,0.05869642,0.003954154,0.2135044],"study_design_scores_gemma":[0.0002243594,0.002556718,0.06484885,0.0002071179,0.0003845656,0.0008094183,0.001564545,0.8708146,0.008026956,0.04854339,0.001761947,0.0002576604],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6669508,0.0006071152,0.3276013,0.0004336275,0.0001291792,0.0002412588,0.0003847898,0.0009813119,0.002670538],"genre_scores_gemma":[0.973537,0.00004030173,0.02566272,0.00006388922,0.00001200132,0.0001136767,0.0003410297,0.0001018838,0.0001274983],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8453519,"threshold_uncertainty_score":0.8178669,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4388574245","doi":"10.1111/jedm.12380","title":"Incorporating Test‐Taking Engagement into Multistage Adaptive Testing Design for Large‐Scale Assessments","year":2023,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Operationalization; Computerized adaptive testing; Test (biology); Item response theory; Premise; Scale (ratio); Computer science; Test design; Reliability (semiconductor); Psychology; Applied psychology; Reliability engineering; Psychometrics; Statistics; Test method; Mathematics; Engineering; Clinical psychology","authors":[{"name":"Okan Bulut","is_ca":true},{"name":"Guher Gorgun","is_ca":true},{"name":"Hacer Karamese","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.8135852760237042,"gpt":0.547201763889805,"spread":0.2663835121338992,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0544481,0.001120078,0.001013719,0.001430539,0.0005934411,0.001374537,0.002086142,0.001062347,0.002785292],"category_scores_gemma":[0.1143834,0.0009288852,0.001187059,0.001014941,0.001352158,0.001445156,0.002151364,0.001795675,0.0003053778],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001464484,"about_ca_system_score_gemma":0.002019703,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001605403,"about_ca_topic_score_gemma":0.002718061,"domain_scores_codex":[0.9399657,0.0535828,0.001501577,0.001967381,0.00252439,0.0004580639],"domain_scores_gemma":[0.8539311,0.1237603,0.007735856,0.007303696,0.006039959,0.001229156],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00733927,0.004464655,0.08690108,0.00114174,0.001498597,0.0002975975,0.004118375,0.349202,0.01775998,0.03776472,0.00183483,0.4876771],"study_design_scores_gemma":[0.0005078462,0.005707873,0.01963861,0.0001132501,0.0001653675,0.00005734214,0.0001965099,0.9477413,0.004967511,0.01893658,0.001859839,0.0001079353],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.09671128,0.000058739,0.898973,0.00009943646,0.00003830065,0.002823567,0.00005767325,0.0004189435,0.0008189985],"genre_scores_gemma":[0.3860466,0.00003565036,0.6073614,0.00005798008,0.00001451145,0.006062838,0.00009207285,0.0000436244,0.0002852839],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0544481,"threshold_uncertainty_score":0.2879525,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4400898279","doi":"10.1111/jedm.12406","title":"Using Automated Procedures to Score Educational Essays Written in Three Languages","year":2024,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Mathematics education; Natural language processing; Computer science; Psychology; Linguistics; Artificial intelligence; Philosophy","authors":[{"name":"Tahereh Firoozi","is_ca":true},{"name":"Hamid Mohammadi","is_ca":true},{"name":"Mark J. Gierl","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0603400789110201,"gpt":0.3634531269538653,"spread":0.3031130480428452,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005157715,0.001032616,0.0006608579,0.003692593,0.0004969728,0.002299851,0.001045723,0.0006058632,0.004119306],"category_scores_gemma":[0.03298691,0.0002484437,0.0003722198,0.001465018,0.0003699122,0.00129249,0.001557643,0.0006799394,0.002691472],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006144473,"about_ca_system_score_gemma":0.001010972,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002250241,"about_ca_topic_score_gemma":0.004657552,"domain_scores_codex":[0.9920464,0.003361837,0.0008698298,0.001234125,0.002262732,0.0002251882],"domain_scores_gemma":[0.9688612,0.01304521,0.003167753,0.002100682,0.01195374,0.0008714346],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0008439936,0.0005127,0.04003774,0.000469165,0.0001557472,0.0003305466,0.00131051,0.006618808,0.04646496,0.0009735536,0.004463994,0.8978182],"study_design_scores_gemma":[0.0005791047,0.00287867,0.2662421,0.0004202122,0.0003353503,0.002128891,0.005289431,0.4717295,0.2102603,0.005865796,0.0337549,0.0005157078],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7465224,0.0003807118,0.2235245,0.0002522572,0.0002095983,0.001177902,0.00218063,0.01197834,0.01377381],"genre_scores_gemma":[0.818852,0.0001523614,0.1724462,0.00006588506,0.00007373051,0.0004400876,0.002106361,0.0002581722,0.005605296],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.005157715,"threshold_uncertainty_score":0.02727687,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2258138870","doi":"10.1111/jedm.12095","title":"Rutkowski, L., vonDavier, M., &amp; Rutkowski, D. (Eds.). (2014). Handbook of International Large‐Scale Assessments: Background, Technical Issues, and Methods of Data Analysis. Boca Raton, FL: CRC Press.","year":2015,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Educational Assessment and Pedagogy","field":"Social Sciences","cited_by":3,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Victoria","funders":"","keywords":"Library science; Curriculum; Christian ministry; Citation; Sociology; Political science; Computer science; Law; Pedagogy","authors":[{"name":"Todd Milford","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2646006784507445,"gpt":0.5359710732399001,"spread":0.2713703947891556,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007822851,0.002603237,0.002032731,0.008295077,0.0008133197,0.004925746,0.00228251,0.001651389,0.01974174],"category_scores_gemma":[0.01788167,0.003098825,0.001258726,0.007864966,0.002287453,0.007100932,0.001781183,0.004176905,0.01515815],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002455055,"about_ca_system_score_gemma":0.006545411,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01420581,"about_ca_topic_score_gemma":0.03181202,"domain_scores_codex":[0.9969546,0.0008738,0.00052543,0.0002953797,0.001236838,0.0001140541],"domain_scores_gemma":[0.9889132,0.006643809,0.001596395,0.0005935329,0.001849969,0.000402938],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00005351301,0.00006776856,0.001205508,0.002843217,0.00006335463,0.00006230071,0.0006509589,0.0005188353,0.0004364987,0.00395517,0.2482828,0.7418601],"study_design_scores_gemma":[0.00003399698,0.0001719703,0.01380027,0.008146564,0.0003377225,0.001472079,0.001263169,0.001221529,0.002919488,0.02175441,0.9486513,0.0002275463],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.002838082,0.8979868,0.05351649,0.01261588,0.003392748,0.0003462246,0.004021936,0.00170178,0.02358018],"genre_scores_gemma":[0.01108922,0.9090179,0.06008702,0.0006631971,0.0007785491,0.0003375878,0.001827082,0.0003943084,0.01580515],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.01974174,"threshold_uncertainty_score":0.06604272,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4403847593","doi":"10.1111/jedm.12420","title":"Algorithmic Bias in BERT for Response Accuracy Prediction: A Case Study for Investigating Population Validity","year":2024,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Concordia University of Edmonton; University of Alberta","funders":"","keywords":"Item response theory; Population; Psychology; Test validity; Predictive validity; Statistics; Computer science; Econometrics; Psychometrics; Mathematics; Clinical psychology; Demography","authors":[{"name":"Guher Gorgun","is_ca":true},{"name":"Seyma N. Yildirim‐Erbasli","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3090948321123259,"gpt":0.4135517798954063,"spread":0.1044569477830803,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05274212,0.000623413,0.0006988132,0.001080537,0.0009960097,0.00197478,0.001684462,0.001478726,0.001558737],"category_scores_gemma":[0.1854301,0.0003285185,0.0008627902,0.001666339,0.001864269,0.002004898,0.001741286,0.002739415,0.0004667262],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002296565,"about_ca_system_score_gemma":0.00163816,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008060279,"about_ca_topic_score_gemma":0.008064169,"domain_scores_codex":[0.9670199,0.02681012,0.001095811,0.002762471,0.001809713,0.0005019567],"domain_scores_gemma":[0.7589012,0.2026378,0.008372414,0.01981615,0.009201323,0.001071099],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.001233786,0.0009111991,0.7872154,0.000150769,0.0004441109,0.000671887,0.004194601,0.08539019,0.001101402,0.01234552,0.003997508,0.1023437],"study_design_scores_gemma":[0.0001604948,0.000753551,0.153401,0.0002311953,0.0001980655,0.0006604039,0.002299721,0.7998552,0.007226409,0.02894317,0.006122136,0.0001486947],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9255655,0.0002005982,0.069655,0.001038499,0.00007127145,0.0001933204,0.0003778416,0.0002574976,0.002640413],"genre_scores_gemma":[0.9834839,0.00002326019,0.01569756,0.0001237459,0.00001802472,0.00009938664,0.0002714812,0.00003913281,0.0002434786],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.05274212,"threshold_uncertainty_score":0.2789304,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4399234968","doi":"10.1111/jedm.12401","title":"Modeling Response Styles in Cross‐Classified Data Using a Cross‐Classified Multidimensional Nominal Response Model","year":2024,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"","keywords":"Covariate; Item response theory; Cross-validation; Computer science; Data set; Statistics; Multilevel model; Set (abstract data type); Econometrics; Psychology; Mathematics; Psychometrics","authors":[{"name":"Sijia Huang","is_ca":false},{"name":"Seungwon Chung","is_ca":false},{"name":"Carl F. Falk","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.8252373857984466,"gpt":0.5741859983791489,"spread":0.2510513874192978,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07947585,0.001296734,0.001753189,0.002068011,0.001007203,0.003086992,0.00423625,0.002512205,0.006293873],"category_scores_gemma":[0.1645372,0.0008902518,0.003717752,0.002602156,0.001959665,0.003366494,0.003079965,0.003995992,0.001251198],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002157638,"about_ca_system_score_gemma":0.001428102,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004000181,"about_ca_topic_score_gemma":0.003607636,"domain_scores_codex":[0.9221564,0.06459911,0.002489588,0.006756665,0.003109836,0.0008884183],"domain_scores_gemma":[0.8190155,0.1297656,0.0130082,0.02754881,0.009401483,0.001260408],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001660294,0.001725503,0.3250718,0.0007911224,0.002752827,0.0006782479,0.005594833,0.3139183,0.003512091,0.13823,0.004875772,0.2011893],"study_design_scores_gemma":[0.00009885678,0.0004846179,0.02515786,0.0001265826,0.0001415083,0.000175276,0.0006866321,0.9242594,0.001079787,0.04541073,0.002258689,0.0001201378],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1393396,0.0001251282,0.8573038,0.0005629463,0.0001244041,0.0004866946,0.0005661221,0.000450153,0.001041219],"genre_scores_gemma":[0.7150561,0.00007145038,0.2808152,0.0003036848,0.00005474499,0.001312811,0.0009730661,0.00009578402,0.001317138],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.07947585,"threshold_uncertainty_score":0.4203135,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4409353748","doi":"10.1111/jedm.12433","title":"Theory‐Driven IRT Modeling of Vocabulary Development: Matthew Effects and the Case for Unipolar IRT","year":2025,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Reading and Literacy Development","field":"Psychology","cited_by":1,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Item response theory; Vocabulary; Psychology; Econometrics; Psychometrics; Natural language processing; Mathematics education; Computer science; Linguistics; Mathematics; Developmental psychology; Philosophy","authors":[{"name":"Qi Huang","is_ca":false},{"name":"Daniel M. Bolt","is_ca":false},{"name":"Xiangyi Liao","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03195175338742903,"gpt":0.3215903201546934,"spread":0.2896385667672643,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01480785,0.0006319998,0.0008315068,0.001348655,0.0005177821,0.002506624,0.002547101,0.001070283,0.003550506],"category_scores_gemma":[0.05797334,0.0005493956,0.001197602,0.001083702,0.00218356,0.002018278,0.001823943,0.002184513,0.0005307751],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001461548,"about_ca_system_score_gemma":0.001136443,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007877668,"about_ca_topic_score_gemma":0.006594165,"domain_scores_codex":[0.9928917,0.005051938,0.0002325321,0.000899583,0.0006376204,0.0002865901],"domain_scores_gemma":[0.957216,0.03248308,0.003346471,0.003935016,0.002414485,0.0006050644],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002075667,0.00020263,0.05799901,0.0002232017,0.0002996269,0.0005124057,0.002379901,0.2657606,0.001376124,0.5894811,0.002940197,0.07861752],"study_design_scores_gemma":[0.00002085447,0.00011613,0.009257175,0.00008265002,0.00005688025,0.000197924,0.0002574286,0.8021434,0.0003109643,0.1856209,0.001885816,0.00004978212],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1435361,0.000327575,0.8437998,0.001664844,0.00007495825,0.0001355654,0.0002363808,0.0003228962,0.009901877],"genre_scores_gemma":[0.903881,0.000164986,0.09267253,0.000269832,0.00004673441,0.0002263385,0.0001450383,0.00008855668,0.002504835],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01480785,"threshold_uncertainty_score":0.07831234,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4406376912","doi":"10.1111/jedm.12424","title":"Using Multilabel Neural Network to Score High‐Dimensional Assessments for Different Use Foci: An Example with College Major Preference Assessment","year":2025,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Advanced Text Analysis Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Preference; Artificial neural network; Artificial intelligence; Psychology; Machine learning; Computer science; Evaluation methods; Statistics; Mathematics; Reliability engineering","authors":[{"name":"Shaobin Hu","is_ca":true},{"name":"Amery D. Wu","is_ca":true},{"name":"Jake E. Stone","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.233287845927402,"gpt":0.3977295805474502,"spread":0.1644417346200483,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002768577,0.0006699571,0.0004048567,0.001216507,0.000385263,0.0008630711,0.0003768483,0.0005529083,0.002456608],"category_scores_gemma":[0.01053473,0.000107432,0.000342778,0.001020438,0.0002424124,0.0008844138,0.0008079978,0.0007691093,0.0006899665],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006062814,"about_ca_system_score_gemma":0.000469534,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006222336,"about_ca_topic_score_gemma":0.01466361,"domain_scores_codex":[0.9985649,0.0007206277,0.0001010114,0.0002345613,0.0003007391,0.00007819398],"domain_scores_gemma":[0.9949344,0.003058722,0.0002754562,0.0004375096,0.001079325,0.0002147515],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008671696,0.0006704953,0.1347505,0.0001984006,0.0001957039,0.0003497834,0.0007296992,0.03269896,0.01385582,0.001789955,0.007876349,0.8060172],"study_design_scores_gemma":[0.0000643161,0.000513527,0.09974927,0.00006860498,0.00009061274,0.0002546253,0.001086741,0.8698592,0.01523591,0.008103236,0.00487856,0.00009544262],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.842434,0.0003027613,0.1450103,0.0006970361,0.0001573841,0.0002564804,0.0009669043,0.001566618,0.008608528],"genre_scores_gemma":[0.9348248,0.00005787489,0.06269716,0.00007884552,0.00001804417,0.00009417657,0.0004772876,0.00003567875,0.001716202],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.006222336,"threshold_uncertainty_score":0.01464182,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}