{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":24,"total_is_capped":false,"direct_labels_cover":0,"predictions_cover":24,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"5003ca732a82","filters":{"venue":"International Journal of Testing"}},"results":[{"id":"W2126572511","doi":"10.1207/s15327574ijt0403_1","title":"Validating the Beck Depression Inventory-II for Hong Kong Community Adolescents","year":2004,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Child and Adolescent Psychosocial and Emotional Development","field":"Psychology","cited_by":160,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"University of Ottawa","funders":"","keywords":"Psychology; Confirmatory factor analysis; Beck Depression Inventory; Structural equation modeling; Exploratory factor analysis; Clinical psychology; Internal consistency; Depression (economics); Psychometrics; Developmental psychology; Psychiatry; Anxiety; Statistics; Mathematics","authors":[{"name":"Barbara M. Byrne","is_ca":true},{"name":"Sunita M. Stewart","is_ca":false},{"name":"Peter W. H. Lee","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.08080420797592054,"gpt":0.3520861026986411,"spread":0.2712818947227206,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005318687,0.0005221917,0.0004841716,0.0007110846,0.0007354456,0.0007783482,0.0004335044,0.0002433734,0.001165472],"category_scores_gemma":[0.005428912,0.0003046601,0.0005138507,0.000547352,0.0002749271,0.0004196651,0.0006449377,0.0006743865,0.0004574624],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005509093,"about_ca_system_score_gemma":0.001302277,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01149898,"about_ca_topic_score_gemma":0.02894436,"domain_scores_codex":[0.9987746,0.0004095666,0.0003199228,0.0001180008,0.0002651259,0.0001128021],"domain_scores_gemma":[0.9982496,0.0002808905,0.0002679384,0.0002119876,0.0007942531,0.0001952834],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001446301,0.000261561,0.9640049,0.00008333279,0.00006086272,0.0001351203,0.002239183,0.0001663968,0.00147743,0.0001477934,0.001431134,0.0298476],"study_design_scores_gemma":[0.00005234908,0.0003946709,0.9933525,0.00004614128,0.00004037739,0.0001223492,0.002140064,0.0007994132,0.0007077327,0.0000748984,0.00225528,0.00001425067],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9935241,0.0001563808,0.00163744,0.00009910436,0.00005716754,0.00118088,0.0009088669,0.00002175554,0.002414356],"genre_scores_gemma":[0.9815859,0.000412674,0.01071899,0.0001930325,0.00002576303,0.002767743,0.002344758,0.00001238813,0.001938955],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01149898,"threshold_uncertainty_score":0.02812827,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2142413505","doi":"10.1080/15305058.2011.635830","title":"The Role of Item Models in Automatic Item Generation","year":2012,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Intelligent Tutoring Systems and Adaptive Learning","field":"Computer Science","cited_by":73,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Item bank; Item response theory; Field (mathematics); Process (computing); Task (project management); Item analysis; Artificial intelligence; Machine learning; Psychometrics; Psychology","authors":[{"name":"Mark J. Gierl","is_ca":true},{"name":"Hollis Lai","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.05584327543240598,"gpt":0.2802359057096199,"spread":0.224392630277214,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1279199,0.002776089,0.00282673,0.008547199,0.001303519,0.008516186,0.005290098,0.002853358,0.004128389],"category_scores_gemma":[0.418778,0.002515118,0.002862836,0.008665964,0.004301609,0.01465584,0.00476228,0.007323967,0.002568312],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003782161,"about_ca_system_score_gemma":0.003877409,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0025931,"about_ca_topic_score_gemma":0.002607672,"domain_scores_codex":[0.8342605,0.1430801,0.004869926,0.004279421,0.01280252,0.0007074144],"domain_scores_gemma":[0.5033818,0.4442065,0.006742728,0.02469528,0.02012955,0.0008440106],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000395873,0.0005847348,0.0231175,0.00175484,0.001287175,0.000244258,0.005975557,0.06319576,0.001612983,0.2520176,0.0108443,0.6389694],"study_design_scores_gemma":[0.0002815787,0.0004358502,0.007168454,0.001271338,0.0003344533,0.0004171213,0.001044127,0.5068424,0.003528201,0.4621869,0.01610634,0.000383202],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.006905769,0.000599454,0.9866475,0.0008926291,0.00009327484,0.0008523762,0.0002101879,0.001167729,0.002631098],"genre_scores_gemma":[0.09355135,0.0006672812,0.9005472,0.0004997245,0.0001000172,0.002896419,0.000587077,0.000459108,0.0006918836],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.1279199,"threshold_uncertainty_score":0.676513,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1966255248","doi":"10.1080/15305050701438058","title":"The Beck Depression Inventory-II: Testing for Measurement Equivalence and Factor Mean Differences Across Hong Kong and American Adolescents","year":2007,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Child and Adolescent Psychosocial and Emotional Development","field":"Psychology","cited_by":68,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Ottawa","funders":"","keywords":"Beck Depression Inventory; Psychology; Confirmatory factor analysis; Equivalence (formal languages); Measurement invariance; Clinical psychology; Structural equation modeling; Statistics; Psychiatry; Mathematics","authors":[{"name":"Barbara M. Byrne","is_ca":true},{"name":"Sunita M. Stewart","is_ca":false},{"name":"Betsy D. Kennard","is_ca":false},{"name":"Peter W. H. Lee","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1069246491615596,"gpt":0.3636558479182934,"spread":0.2567311987567337,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007582041,0.0004861342,0.0007511285,0.001189446,0.000727645,0.000731427,0.0004779398,0.0002040873,0.001155365],"category_scores_gemma":[0.01191847,0.0004879339,0.0006950072,0.001538004,0.0004157963,0.0005904298,0.0009742313,0.0007708975,0.0002375603],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007606253,"about_ca_system_score_gemma":0.001584982,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01452586,"about_ca_topic_score_gemma":0.02107512,"domain_scores_codex":[0.9967822,0.0009820291,0.0007967342,0.0004123422,0.0008694895,0.0001572738],"domain_scores_gemma":[0.9959059,0.001225774,0.0007593696,0.0004932769,0.001385669,0.0002299558],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001978785,0.000202657,0.9414118,0.0001783217,0.0003782418,0.00009042663,0.003495994,0.0002896673,0.001207503,0.0009276852,0.001963017,0.04965674],"study_design_scores_gemma":[0.00003408438,0.0001929855,0.9954796,0.00003889563,0.00006142441,0.00006753284,0.001228262,0.0008284771,0.0003675235,0.000264598,0.001421489,0.00001521138],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9858144,0.000269749,0.006458774,0.0001225817,0.00006150023,0.001284185,0.00223215,0.00004104393,0.003715738],"genre_scores_gemma":[0.9738324,0.0003580947,0.01790782,0.00008125863,0.00002238537,0.003139893,0.003808897,0.00001881565,0.0008304485],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01452586,"threshold_uncertainty_score":0.04009813,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2076222948","doi":"10.1080/15305058.2010.509554","title":"Using the Attribute Hierarchy Method to Make Diagnostic Inferences about Examinees’ Knowledge and Skills in Mathematics: An Operational Implementation of Cognitive Diagnostic Assessment","year":2010,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Cognitive and developmental aspects of mathematical skills","field":"Mathematics","cited_by":55,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Alberta Advanced Education; University of Alberta","funders":"","keywords":"Cognition; Hierarchy; Set (abstract data type); Item response theory; Test (biology); Computer science; Computerized adaptive testing; Psychology; Psychometrics; Artificial intelligence; Mathematics education; Developmental psychology","authors":[{"name":"Mark J. Gierl","is_ca":true},{"name":"Cecilia Alves","is_ca":true},{"name":"Renate Taylor Majeau","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0804734892655436,"gpt":0.4593924747952735,"spread":0.3789189855297299,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02309198,0.0007183744,0.0006282204,0.007309075,0.0008255675,0.001634968,0.0009319086,0.0005345265,0.001713617],"category_scores_gemma":[0.09861593,0.0003338464,0.0008437354,0.003259613,0.001031617,0.002546708,0.002806899,0.001427926,0.0004311668],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008487222,"about_ca_system_score_gemma":0.002145456,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002908744,"about_ca_topic_score_gemma":0.003578496,"domain_scores_codex":[0.9815035,0.0102482,0.001812632,0.001017772,0.005052428,0.0003654484],"domain_scores_gemma":[0.9122828,0.05752273,0.006586579,0.006369063,0.0163078,0.0009309986],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004352081,0.0006045733,0.2361581,0.0004511515,0.0002680024,0.0001315703,0.008084876,0.004902322,0.008199023,0.01987999,0.003378235,0.7175069],"study_design_scores_gemma":[0.0006369217,0.003001531,0.5050828,0.001341807,0.0005699167,0.002734494,0.01101524,0.2465844,0.03826294,0.1513313,0.03873865,0.0007001229],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2530797,0.0003084558,0.7299366,0.0005612499,0.0001354223,0.001837388,0.0007283093,0.001073317,0.01233951],"genre_scores_gemma":[0.5108288,0.0001998006,0.4860537,0.0001198093,0.00003952426,0.001476336,0.0004303482,0.00008564436,0.0007660359],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02309198,"threshold_uncertainty_score":0.1221235,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2135248568","doi":"10.1080/15305058.2011.602810","title":"A Generalized Logistic Regression Procedure to Detect Differential Item Functioning Among Multiple Groups","year":2011,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":46,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université du Québec à Montréal","funders":"","keywords":"Differential item functioning; Logistic regression; Completeness (order theory); Statistics; Item response theory; Mathematics; Set (abstract data type); Extension (predicate logic); Differential (mechanical device); Flexibility (engineering); Regression; Psychology; Psychometrics; Computer science","authors":[{"name":"David Magis","is_ca":false},{"name":"Gilles Raîche","is_ca":true},{"name":"Sébastien Béland","is_ca":true},{"name":"Paul Gérard","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.548040852468272,"gpt":0.4478112341211973,"spread":0.1002296183470748,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02482094,0.002602845,0.002291553,0.004490952,0.001013135,0.001029098,0.003077067,0.001272232,0.008413578],"category_scores_gemma":[0.07430244,0.0008670276,0.003508095,0.005101036,0.001142049,0.001776825,0.004033432,0.003338331,0.002410328],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006076544,"about_ca_system_score_gemma":0.002807016,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002813347,"about_ca_topic_score_gemma":0.002551824,"domain_scores_codex":[0.9686525,0.02626705,0.0008563373,0.001977835,0.00176201,0.0004842472],"domain_scores_gemma":[0.9692172,0.02014408,0.00224015,0.005483858,0.002655143,0.0002595033],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.000886876,0.0005574807,0.04813306,0.001302951,0.004338192,0.001413936,0.002094596,0.03195885,0.0092157,0.06153109,0.01909071,0.8194765],"study_design_scores_gemma":[0.001353886,0.004456861,0.09473854,0.0008849564,0.002583298,0.005267627,0.001964333,0.5710397,0.01331999,0.2407903,0.06259857,0.001001944],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01327661,0.0001588738,0.9826073,0.0003830783,0.00007637838,0.0007876079,0.0005554376,0.001446726,0.0007079623],"genre_scores_gemma":[0.1334035,0.0003626586,0.8568074,0.0002607273,0.0001022761,0.004892964,0.001102277,0.0003475309,0.00272061],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.02482094,"threshold_uncertainty_score":0.1312672,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2086483769","doi":"10.1080/15305058.2011.552748","title":"Teachers' Perceptions of Large-Scale Assessment Programs Within Low-Stakes Accountability Frameworks","year":2011,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Educational Assessment and Improvement","field":"Decision Sciences","cited_by":41,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"Centre for Advancing Health Outcomes; University of Alberta; Queen's University","funders":"","keywords":"Accountability; Seriousness; Scale (ratio); Perception; Psychology; Standardized test; Educational assessment; Medical education; Pedagogy; Mathematics education; Political science; Geography; Medicine","authors":[{"name":"Don A. Klinger","is_ca":true},{"name":"W. Todd Rogers","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1565396694431699,"gpt":0.4547954859236611,"spread":0.2982558164804912,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02081436,0.0001943476,0.0003157317,0.001383398,0.003842449,0.005183813,0.001272318,0.0009747926,0.001587548],"category_scores_gemma":[0.05710805,0.0003817413,0.0002383519,0.001241452,0.00485959,0.002028201,0.003083557,0.001769517,0.0001447689],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01376163,"about_ca_system_score_gemma":0.02032387,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.1943175,"about_ca_topic_score_gemma":0.2922613,"domain_scores_codex":[0.9664225,0.0165961,0.00111376,0.0008693414,0.01209591,0.002902421],"domain_scores_gemma":[0.9186791,0.03657488,0.01259856,0.003374234,0.01567777,0.01309541],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.0003477769,0.0007258248,0.3018779,0.0004650147,0.00006956033,0.001230522,0.593231,0.001663686,0.006157496,0.008553403,0.002692101,0.08298569],"study_design_scores_gemma":[0.00008795376,0.0007580242,0.355478,0.0006942841,0.00005613773,0.0003705258,0.5927958,0.003078928,0.001764314,0.003235447,0.04153534,0.0001451933],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9849037,0.0001836597,0.001484515,0.00130637,0.00001478605,0.00007940503,0.0000156376,0.00003037849,0.01198151],"genre_scores_gemma":[0.9987609,0.00007286895,0.0004057414,0.0000788859,0.000003881808,0.00002342591,0.000007935982,0.000004702429,0.0006416196],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1943175,"threshold_uncertainty_score":0.3863729,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2057990449","doi":"10.1080/15305058.2012.738266","title":"Analysis of Sources of Latent Class Differential Item Functioning in International Assessments","year":2013,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":39,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Comparability; Differential item functioning; Psychology; Multinomial logistic regression; Latent variable; Item response theory; Latent class model; Logistic regression; Matching (statistics); Statistics; Construct validity; Linear discriminant analysis; Construct (python library); Psychometrics; Developmental psychology; Mathematics; Computer science","authors":[{"name":"María Elena Oliveri","is_ca":false},{"name":"Kadriye Ercikan","is_ca":true},{"name":"Bruno D. Zumbo","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3977077293797573,"gpt":0.4811063293577611,"spread":0.0833985999780038,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04880499,0.0009021793,0.001037727,0.006239638,0.001197269,0.003048713,0.001171213,0.0007204641,0.00220331],"category_scores_gemma":[0.1818059,0.0004293474,0.001559654,0.006572268,0.001744204,0.002354417,0.004437665,0.001343792,0.0002737916],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002044651,"about_ca_system_score_gemma":0.001123223,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002551458,"about_ca_topic_score_gemma":0.00253981,"domain_scores_codex":[0.9550427,0.02893994,0.003589596,0.003093112,0.008136739,0.001197963],"domain_scores_gemma":[0.799454,0.1402417,0.02151155,0.02450112,0.01335392,0.0009377279],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003180439,0.0001206951,0.911645,0.0001243579,0.0005199052,0.0001038883,0.007648692,0.002138515,0.0007745656,0.005972971,0.0004973162,0.07013607],"study_design_scores_gemma":[0.00005722743,0.0003444664,0.9146644,0.0004151006,0.0003767563,0.0006327135,0.00880005,0.04542857,0.002515102,0.02275866,0.003861639,0.0001452841],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9288171,0.0003129909,0.064822,0.000379294,0.00004148305,0.00025859,0.0007497686,0.0001273381,0.004491407],"genre_scores_gemma":[0.9937603,0.00003366061,0.00529974,0.00001905237,0.00001099147,0.0001447037,0.0005459947,0.00002435857,0.0001612081],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.04880499,"threshold_uncertainty_score":0.2581085,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2063611796","doi":"10.1080/15305058.2011.617475","title":"Methodologies for Investigating Item- and Test-Level Measurement Equivalence in International Large-Scale Assessments","year":2012,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":32,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"University of British Columbia","funders":"","keywords":"Differential item functioning; Comparability; Psychology; Item response theory; Equivalence (formal languages); Statistics; Nonparametric statistics; Test (biology); Psychometrics; Consistency (knowledge bases); Item analysis; Logistic regression; Mathematics","authors":[{"name":"María Elena Oliveri","is_ca":true},{"name":"Brent F. Olson","is_ca":true},{"name":"Kadriye Ercikan","is_ca":true},{"name":"Bruno D. Zumbo","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.84777911019985,"gpt":0.5833143230805201,"spread":0.2644647871193299,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2524046,0.001994926,0.002176189,0.01036387,0.001944027,0.004823984,0.002678857,0.001393407,0.00247911],"category_scores_gemma":[0.6103416,0.001068847,0.002668686,0.01317993,0.003510874,0.003791661,0.006213052,0.002989943,0.0007309797],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002998105,"about_ca_system_score_gemma":0.002870495,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003367323,"about_ca_topic_score_gemma":0.003741974,"domain_scores_codex":[0.6212884,0.288602,0.02540317,0.0162807,0.04702232,0.001403384],"domain_scores_gemma":[0.384278,0.4201937,0.06418706,0.08047258,0.04932238,0.001546309],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001065334,0.0009261222,0.3314597,0.003001188,0.004963999,0.0002311059,0.01359762,0.005574865,0.005091996,0.05039796,0.003323115,0.580367],"study_design_scores_gemma":[0.0008775741,0.008266871,0.7560436,0.003398437,0.00272999,0.001183188,0.009461529,0.03848691,0.01929531,0.1116626,0.04789537,0.0006986004],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1242371,0.002880443,0.845134,0.0004684778,0.0004247422,0.007480901,0.0009797027,0.0005634695,0.01783124],"genre_scores_gemma":[0.4690783,0.0009669635,0.5004395,0.0004656877,0.0002656163,0.02605327,0.001368839,0.0003146579,0.001047125],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.2524046,"threshold_uncertainty_score":0.9219183,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2113879845","doi":"10.1080/15305058.2012.690140","title":"Investigating Sources of Differential Item Functioning in International Large-Scale Assessments Using a Confirmatory Approach","year":2013,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Educational and Psychological Assessments","field":"Psychology","cited_by":28,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Differential item functioning; Psychology; Equivalence (formal languages); Measurement invariance; Scale (ratio); Item response theory; Pairwise comparison; Cognition; Psychometrics; Differential (mechanical device); Confirmatory factor analysis; Clinical psychology; Developmental psychology; Social psychology; Statistics; Structural equation modeling","authors":[{"name":"Debra Sandilands","is_ca":true},{"name":"María Elena Oliveri","is_ca":true},{"name":"Bruno D. Zumbo","is_ca":true},{"name":"Kadriye Ercikan","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1081283061996754,"gpt":0.4028085569126335,"spread":0.2946802507129581,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0956163,0.001691659,0.001016909,0.006218793,0.002612157,0.003242086,0.001220341,0.000635368,0.001861455],"category_scores_gemma":[0.2434673,0.0007817209,0.00174654,0.005217271,0.0018581,0.002170713,0.003297314,0.00187248,0.0004895721],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001091148,"about_ca_system_score_gemma":0.002842626,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0055069,"about_ca_topic_score_gemma":0.01182105,"domain_scores_codex":[0.9176844,0.05714621,0.006968529,0.005026359,0.01168505,0.001489374],"domain_scores_gemma":[0.6540079,0.2081744,0.02805685,0.04881015,0.05882347,0.002127318],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005104074,0.0004359476,0.8876627,0.0004950857,0.001204041,0.0003623157,0.01715233,0.001110302,0.005736074,0.004103389,0.001067459,0.08015995],"study_design_scores_gemma":[0.0002178547,0.002222561,0.9265637,0.000649801,0.0009463417,0.0009500582,0.02483567,0.01541302,0.01289755,0.0102583,0.004834448,0.0002107493],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.852775,0.0002926653,0.1353057,0.0004324314,0.0001214972,0.001561305,0.0005086912,0.0002458927,0.00875677],"genre_scores_gemma":[0.9491001,0.00006655626,0.04852404,0.0001034397,0.00002839455,0.00105064,0.0006591186,0.00007532669,0.0003923565],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.0956163,"threshold_uncertainty_score":0.5056733,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1999798470","doi":"10.1080/15305050701193520","title":"Using Exploratory and Confirmatory Methods to Identify the Cognitive Dimensions In a Large-Scale Science Assessment","year":2007,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Cognitive Science and Mapping","field":"Computer Science","cited_by":20,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Confirmatory factor analysis; Psychology; Scale (ratio); Item response theory; Cognition; Psychometrics; Measurement invariance; Test validity; Applied psychology; Structural equation modeling; Clinical psychology; Statistics; Mathematics","authors":[{"name":"Jacqueline P. Leighton","is_ca":true},{"name":"Rebecca Gokiert","is_ca":true},{"name":"Ying Cui","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1334967275173401,"gpt":0.4887037303380774,"spread":0.3552070028207374,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1385485,0.002148249,0.001386193,0.0118995,0.002285648,0.005326781,0.001882213,0.00101674,0.001481842],"category_scores_gemma":[0.3141305,0.0005751437,0.002255669,0.008380096,0.003259844,0.003502182,0.003463504,0.002099477,0.000365654],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001821474,"about_ca_system_score_gemma":0.006787986,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002601851,"about_ca_topic_score_gemma":0.004275487,"domain_scores_codex":[0.8990149,0.07353093,0.00597624,0.004854453,0.01586615,0.0007573824],"domain_scores_gemma":[0.4625481,0.4196969,0.02122556,0.049677,0.04465639,0.00219615],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.000830178,0.002035336,0.4357994,0.004139626,0.003294248,0.001395234,0.0451854,0.009029874,0.01222912,0.0818956,0.003219771,0.4009462],"study_design_scores_gemma":[0.001437351,0.004913772,0.3735577,0.003530915,0.003549748,0.002413043,0.07080033,0.1798064,0.02197842,0.31624,0.02086328,0.0009088885],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4081896,0.0007046505,0.5713021,0.00113586,0.0001912349,0.007188111,0.0006762049,0.0005763896,0.01003589],"genre_scores_gemma":[0.5959285,0.0002049496,0.3983764,0.0001633299,0.00003920872,0.004427065,0.0004925718,0.00004033218,0.000327635],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.1385485,"threshold_uncertainty_score":0.7327231,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2089954256","doi":"10.1080/15305058.2010.501536","title":"Evaluating the Bookmark Standard Setting Method: The Impact of Random Item Ordering","year":2011,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":19,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Dalhousie University","funders":"","keywords":"Licensure; Assertion; Test (biology); Computer science; Psychology; Process (computing); Mathematics education; Statistics; Medical education; Mathematics; Medicine; Programming language","authors":[{"name":"Susan Davis-Becker","is_ca":false},{"name":"Chad W. Buckendahl","is_ca":false},{"name":"Jack D. Gerrow","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7272170666147368,"gpt":0.606127092720526,"spread":0.1210899738942108,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.357548,0.002143259,0.002252157,0.003234189,0.002042145,0.004618255,0.003781863,0.002741862,0.003008903],"category_scores_gemma":[0.7159848,0.001073983,0.001776584,0.004570171,0.003652348,0.005118246,0.004330048,0.004077772,0.001013491],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003286357,"about_ca_system_score_gemma":0.003632868,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003825306,"about_ca_topic_score_gemma":0.006205426,"domain_scores_codex":[0.4238163,0.4982771,0.01247504,0.01312155,0.05130249,0.001007639],"domain_scores_gemma":[0.116538,0.8171533,0.02342523,0.02558533,0.01583722,0.001461011],"domain_codex":"methods","domain_gemma":"methods","domain_candidate":"methods","domain_consensus":"methods","study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.01476602,0.002900686,0.162186,0.001813332,0.002425641,0.0003402984,0.009942658,0.01753962,0.005427731,0.02629081,0.01457524,0.741792],"study_design_scores_gemma":[0.006122467,0.02896084,0.2682913,0.004636158,0.00390276,0.001994533,0.007465896,0.4410382,0.04193072,0.1272738,0.06640621,0.001977104],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3924102,0.006477902,0.5602587,0.003932684,0.001482885,0.007143352,0.0005401916,0.001030811,0.02672324],"genre_scores_gemma":[0.6447042,0.0009092847,0.3450716,0.002226205,0.000329016,0.003098569,0.0005271231,0.0004081761,0.00272578],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.642452,"threshold_uncertainty_score":0.7922577,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2058922083","doi":"10.1080/15305058.2014.891223","title":"Uncovering Substantive Patterns in Student Responses in International Large-Scale Assessments—Comparing a Latent Class to a Manifest DIF Approach","year":2014,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":19,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Generalizability theory; Differential item functioning; Psychology; Item response theory; Latent class model; Homogeneous; Contrast (vision); Homogeneity (statistics); Reading comprehension; Cognitive psychology; Scale (ratio); Comprehension; Social psychology; Psychometrics; Developmental psychology; Reading (process); Statistics; Mathematics","authors":[{"name":"María Elena Oliveri","is_ca":false},{"name":"Kadriye Ercikan","is_ca":true},{"name":"Bruno D. Zumbo","is_ca":true},{"name":"René Lawless","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3759875606329405,"gpt":0.4999896769691466,"spread":0.1240021163362061,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01994707,0.0006750675,0.0006070706,0.005246732,0.001131296,0.002312585,0.00086457,0.0006845196,0.001780127],"category_scores_gemma":[0.09614702,0.0002597173,0.0009012523,0.002872599,0.001973452,0.002862958,0.003451065,0.001192603,0.0003282583],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001248699,"about_ca_system_score_gemma":0.0007018272,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002234352,"about_ca_topic_score_gemma":0.003508831,"domain_scores_codex":[0.9852965,0.00825106,0.001551965,0.00169013,0.002553241,0.0006570265],"domain_scores_gemma":[0.9124393,0.04720398,0.01558067,0.01583679,0.007758869,0.001180266],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005327921,0.0002886349,0.9081659,0.0001397534,0.0001776163,0.00008635254,0.01370962,0.0007333749,0.003488576,0.002552374,0.0004146491,0.06971031],"study_design_scores_gemma":[0.0000371864,0.0004708674,0.9700216,0.00009341798,0.00008054546,0.000315803,0.01122789,0.006535296,0.002948329,0.00674133,0.001453207,0.00007454099],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9594349,0.0001316115,0.03625572,0.0002079072,0.00002684653,0.0001710674,0.0002890869,0.00008334314,0.003399526],"genre_scores_gemma":[0.9938675,0.00002859587,0.005526263,0.00002670204,0.000009942876,0.0001219404,0.0002281725,0.00002171316,0.0001692212],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9800529,"threshold_uncertainty_score":0.1054915,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2025305573","doi":"10.1080/15305050903106859","title":"Uncovering the Psychometric Properties of Scales Measuring Individualist and Collectivist Orientations","year":2009,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Cultural Differences and Values","field":"Psychology","cited_by":17,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Calgary","funders":"","keywords":"Collectivism; Psychology; Individualism; Social psychology; Scale (ratio); Psychometrics; Developmental psychology; Geography; Political science","authors":[{"name":"Stephanie Paquet","is_ca":false},{"name":"Theresa J. B. Kline","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2054654203050422,"gpt":0.3769399820431952,"spread":0.171474561738153,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07318483,0.000529505,0.0008448009,0.003814337,0.001129179,0.002871454,0.0008072351,0.0006806938,0.00157967],"category_scores_gemma":[0.1647083,0.0004701727,0.001459037,0.004531128,0.002632674,0.003191556,0.002204413,0.001585465,0.0003240745],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001204265,"about_ca_system_score_gemma":0.001970092,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002040573,"about_ca_topic_score_gemma":0.003401031,"domain_scores_codex":[0.975729,0.01220241,0.002337057,0.001261648,0.008040883,0.0004290068],"domain_scores_gemma":[0.8035138,0.1484286,0.01149371,0.01272663,0.02203905,0.001798216],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0003766842,0.000286941,0.7868913,0.0005678041,0.001074415,0.00006502649,0.01265933,0.0009017155,0.001831137,0.008637514,0.001621985,0.1850861],"study_design_scores_gemma":[0.00007989541,0.001102708,0.9512107,0.0007089816,0.0003665493,0.0001762237,0.01228824,0.006677801,0.002311916,0.01652995,0.00844615,0.0001008455],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9404186,0.002086773,0.03203439,0.0009643604,0.0002837622,0.0009340167,0.0004286809,0.0001128065,0.02273666],"genre_scores_gemma":[0.9801107,0.0004520365,0.01775592,0.0001342675,0.00003845396,0.0006717805,0.0003673734,0.00004402853,0.0004254104],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.07318483,"threshold_uncertainty_score":0.387043,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2051773947","doi":"10.1080/15305058.2014.957382","title":"Reading Proficiency and Comparability of Mathematics and Science Scores for Students From English and Non-English Backgrounds: An International Perspective","year":2014,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"School Choice and Performance","field":"Social Sciences","cited_by":17,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"University of Ottawa; University of Victoria; University of British Columbia","funders":"","keywords":"Comparability; Reading (process); Mathematics education; Perspective (graphical); Language proficiency; Meaning (existential); English language; Variance (accounting); Psychology; Point (geometry); Mathematics; Linguistics; Accounting","authors":[{"name":"Kadriye Ercikan","is_ca":true},{"name":"Michelle Y. Chen","is_ca":true},{"name":"Juliette Lyons-Thomas","is_ca":true},{"name":"Shawna Goodrich","is_ca":true},{"name":"Debra Sandilands","is_ca":true},{"name":"Wolff‐Michael Roth","is_ca":true},{"name":"Marielle Simon","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0523961827382444,"gpt":0.4029235874767592,"spread":0.3505274047385147,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002356726,0.0002400496,0.0004023557,0.003368993,0.0003242958,0.00150662,0.000328289,0.0002675747,0.002529525],"category_scores_gemma":[0.01078504,0.00009186512,0.0002803852,0.002372385,0.0007581547,0.001001279,0.001638738,0.0004791015,0.0005012631],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002863297,"about_ca_system_score_gemma":0.0003590401,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005417131,"about_ca_topic_score_gemma":0.008708037,"domain_scores_codex":[0.9980095,0.0005965905,0.0002635035,0.0004051238,0.0004612438,0.0002639992],"domain_scores_gemma":[0.9920765,0.002788341,0.002216448,0.0006401367,0.001559682,0.0007189717],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001988066,0.0000403042,0.9737081,0.00005447695,0.0001499775,0.0002089149,0.002550237,0.00006544158,0.002003411,0.0007236141,0.000198454,0.0200983],"study_design_scores_gemma":[0.000002563428,0.00008363733,0.997405,0.00002155094,0.00002092469,0.0001782278,0.001326465,0.00005651111,0.0003203894,0.0001256655,0.0004550435,0.000004005646],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9895851,0.0004880358,0.0003946346,0.0001121398,0.00001688842,0.000008073349,0.0003738736,0.000008471777,0.00901268],"genre_scores_gemma":[0.9989367,0.0001144909,0.0001697015,0.00001944332,0.000009004294,0.000004984171,0.0003533165,0.000006729745,0.0003855677],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.005417131,"threshold_uncertainty_score":0.01246369,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1983043858","doi":"10.1080/15305058.2001.9669474","title":"Illustrating the Use of Nonparametric Regression to Assess Differential Item and Bundle Functioning Among Multiple Groups","year":2001,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":15,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Nonparametric statistics; Differential item functioning; Bundle; Nonparametric regression; Differential (mechanical device); Statistics; Regression analysis; Regression; Smoothing; Psychology; Mathematics; Econometrics; Item response theory; Psychometrics","authors":[{"name":"Mark J. Gierl","is_ca":true},{"name":"Daniel M. Bolt","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.6770030026306908,"gpt":0.4656857700680094,"spread":0.2113172325626814,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02344842,0.0009637806,0.000978173,0.00237133,0.0007120112,0.001137061,0.001140366,0.00116007,0.003882654],"category_scores_gemma":[0.07151907,0.0003611837,0.001022406,0.00350588,0.001575477,0.001458557,0.002198332,0.002168772,0.001014791],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006076327,"about_ca_system_score_gemma":0.001193266,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004265834,"about_ca_topic_score_gemma":0.004118616,"domain_scores_codex":[0.9840091,0.01282834,0.0004315347,0.0007126469,0.001674243,0.0003440487],"domain_scores_gemma":[0.9365717,0.05473804,0.002055869,0.003516247,0.00286988,0.000248196],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008490105,0.0007435362,0.05374749,0.0005846064,0.0005144472,0.001677874,0.005513666,0.1111519,0.01134158,0.202057,0.0118575,0.5999613],"study_design_scores_gemma":[0.0001736405,0.0008415909,0.0510978,0.0002283718,0.0001380728,0.002843538,0.001633465,0.6673836,0.01169833,0.2327791,0.03086143,0.0003211814],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02633488,0.0002402594,0.9663532,0.0005948885,0.00005301656,0.0001187243,0.0001478242,0.0008316708,0.005325493],"genre_scores_gemma":[0.3107259,0.0003469388,0.6854911,0.0002307226,0.00005276468,0.0005067617,0.0002160585,0.0003927439,0.00203697],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.02344842,"threshold_uncertainty_score":0.1240086,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2137207467","doi":"10.1080/15305058.2014.977444","title":"Explore the Usefulness of Person-Fit Analysis on Large-Scale Assessment","year":2014,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Mental Health Research Topics","field":"Psychology","cited_by":11,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"Centre for Health Evaluation and Outcome Sciences; University of Alberta","funders":"","keywords":"Item response theory; Scale (ratio); Psychology; Econometrics; Statistics; Psychometrics; Developmental psychology; Mathematics","authors":[{"name":"Ying Cui","is_ca":true},{"name":"Amin Mousavi","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2900361297675365,"gpt":0.4846693249959824,"spread":0.1946331952284459,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05024396,0.0005829573,0.0006077781,0.002282026,0.00089678,0.001425701,0.0007361777,0.0005775121,0.002219973],"category_scores_gemma":[0.1836652,0.0002545913,0.001417972,0.001873532,0.001304727,0.002071483,0.001634846,0.001337492,0.0002439903],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001012277,"about_ca_system_score_gemma":0.001590971,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00668305,"about_ca_topic_score_gemma":0.01012355,"domain_scores_codex":[0.9638001,0.02901836,0.001351269,0.001335371,0.004092183,0.0004027237],"domain_scores_gemma":[0.7359005,0.2290809,0.01058292,0.01459672,0.008705566,0.001133321],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006930951,0.0003342919,0.8890489,0.0001345959,0.0007396505,0.0001817715,0.007222434,0.006810475,0.002692989,0.003211068,0.0007327056,0.08819823],"study_design_scores_gemma":[0.00004111027,0.001583077,0.9172494,0.00008732593,0.0001427638,0.0003026621,0.005545057,0.06406844,0.004119236,0.004537971,0.002199115,0.0001237906],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9370547,0.00009825474,0.05917822,0.0001441951,0.00003086414,0.0001452923,0.0001938186,0.0001928477,0.002961901],"genre_scores_gemma":[0.9889268,0.00001148059,0.01073558,0.00001491577,0.000004681949,0.00006194379,0.0000809593,0.00002542847,0.0001382051],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.05024396,"threshold_uncertainty_score":0.2657186,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4400119116","doi":"10.1080/15305058.2024.2364174","title":"Can the dark core of personality be measured briefly, multidimensionally, and invariantly? The D25 measure","year":2024,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Personality Traits and Psychology","field":"Psychology","cited_by":10,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Western University","funders":"","keywords":"Measure (data warehouse); Psychology; Personality; Core (optical fiber); Cognitive psychology; Social psychology; Computer science; Data mining","authors":[{"name":"Pedro Pechorro","is_ca":false},{"name":"Bruno Bonfá-Araújo","is_ca":true},{"name":"João Marôco","is_ca":false},{"name":"Mário R. Simões","is_ca":false},{"name":"Matt DeLisi","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1511349496781008,"gpt":0.3789092397915193,"spread":0.2277742901134185,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00660455,0.000612004,0.0006035256,0.00120885,0.0005325276,0.001766515,0.000692247,0.000593979,0.001370266],"category_scores_gemma":[0.02566118,0.0002989398,0.0009024324,0.001504992,0.0009326463,0.002151335,0.001682813,0.00164889,0.0003722326],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007346877,"about_ca_system_score_gemma":0.001041082,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00283612,"about_ca_topic_score_gemma":0.004784461,"domain_scores_codex":[0.9974307,0.0009255858,0.0004094284,0.0003538877,0.0006827827,0.0001976222],"domain_scores_gemma":[0.987698,0.004820707,0.003466972,0.0017554,0.001444019,0.0008150023],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0003292854,0.0002372449,0.6317467,0.000742679,0.0007691758,0.0001968115,0.004253084,0.0007567188,0.002698634,0.008463546,0.005665611,0.3441407],"study_design_scores_gemma":[0.00003878412,0.0007934723,0.9499642,0.0005628059,0.0002376801,0.0004763897,0.002736204,0.002389696,0.001070046,0.02248434,0.0191339,0.0001124608],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9356973,0.005127687,0.04097673,0.00342325,0.001856678,0.0002687574,0.001140402,0.0001508074,0.01135836],"genre_scores_gemma":[0.9719548,0.001589407,0.02283767,0.0008875937,0.0002563329,0.0003624923,0.001083886,0.00003200407,0.0009958122],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.00660455,"threshold_uncertainty_score":0.03492862,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2956918498","doi":"10.1080/15305058.2019.1632316","title":"Migration Background in PISA’s Measure of Social Belonging: Using a Diffractive Lens to Interpret Multi-Method DIF Studies","year":2019,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Intergenerational and Educational Inequality Studies","field":"Social Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Ordered logit; Differential item functioning; Logistic regression; Immigration; Measure (data warehouse); Psychology; Through-the-lens metering; Econometrics; Social psychology; Measurement invariance; Differential (mechanical device); Item response theory; Lens (geology); Psychometrics; Statistics; Structural equation modeling; Computer science; Mathematics; Geography; Developmental psychology; Confirmatory factor analysis; Data mining","authors":[{"name":"Nathan D. Roberson","is_ca":true},{"name":"Bruno D. Zumbo","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2921427318247282,"gpt":0.5026481723540723,"spread":0.2105054405293441,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07505506,0.0007960955,0.001000404,0.008998937,0.00338305,0.005741064,0.001453045,0.0007055296,0.001667849],"category_scores_gemma":[0.1385447,0.0005413881,0.001279836,0.006295325,0.007111507,0.004446707,0.007412516,0.001836194,0.0001768709],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002912898,"about_ca_system_score_gemma":0.00163403,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004163511,"about_ca_topic_score_gemma":0.004365618,"domain_scores_codex":[0.9285812,0.05790731,0.003596107,0.002588486,0.006580059,0.0007467683],"domain_scores_gemma":[0.9012624,0.07276145,0.007993388,0.0118448,0.005490968,0.0006470034],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0004294116,0.0003355669,0.4383104,0.0007114658,0.0005632195,0.0006106831,0.1569779,0.002200905,0.003513753,0.1380428,0.001148267,0.2571558],"study_design_scores_gemma":[0.0001209373,0.001017285,0.6555176,0.0007645566,0.0003560634,0.001136147,0.1341413,0.02925879,0.004841446,0.1532302,0.01939807,0.000217606],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6515424,0.0008606274,0.321272,0.001759001,0.0001948761,0.0009656313,0.0002324756,0.000139722,0.02303321],"genre_scores_gemma":[0.9364111,0.0001103001,0.06203032,0.0001290719,0.00002858224,0.0007237304,0.0000804358,0.00002891778,0.000457471],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.07505506,"threshold_uncertainty_score":0.3969339,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3211365142","doi":"10.1207/s15327574ijt0601_7","title":"Book Review","year":2006,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Behavioral and Psychological Studies","field":"Psychology","cited_by":4,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Psychology","authors":[{"name":"Kadriye Ercikan","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2545338026231972,"gpt":0.4185244620667977,"spread":0.1639906594436004,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0007153057,0.0007104868,0.0008350855,0.003183057,0.0009994217,0.003300687,0.001223393,0.001702502,0.3265489],"category_scores_gemma":[0.003938408,0.0003282693,0.000440194,0.00287798,0.000531023,0.001920102,0.001293391,0.002171582,0.3063519],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001496862,"about_ca_system_score_gemma":0.002413413,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003640998,"about_ca_topic_score_gemma":0.01049215,"domain_scores_codex":[0.999387,0.00005667765,0.00001834048,0.00006166652,0.0004263365,0.00004987871],"domain_scores_gemma":[0.9977272,0.0003973966,0.0001000404,0.0001426014,0.001210585,0.0004222014],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.000003966655,0.000006435054,0.00001609957,0.00005833083,0.00000108494,0.0000122384,0.000004794972,0.00001998054,0.00003056493,0.0007315258,0.9560799,0.0430351],"study_design_scores_gemma":[0.000001866134,0.000003274567,0.00005891779,0.0000644629,0.000001274796,0.00002979053,0.00000728264,0.00001109667,0.00001624615,0.0003904456,0.9994137,0.000001553902],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"other","genre_gemma":"review","genre_scores_codex":[0.0004370353,0.1403212,0.002031759,0.04116434,0.1013963,0.0002035463,0.00127456,0.0007862075,0.7123851],"genre_scores_gemma":[0.0008196783,0.02339952,0.0004651819,0.005606645,0.01068715,0.00004584565,0.0004471327,0.0001559303,0.958373],"genre_candidate":"review","genre_consensus":null,"teacher_disagreement_score":0.3265489,"threshold_uncertainty_score":0.9605963,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4309375705","doi":"10.1080/15305058.2022.2070755","title":"Generating reading comprehension items using automated processes","year":2022,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Topic Modeling","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Reading comprehension; Blank; Comprehension; Computer science; Natural language processing; Test (biology); Reading (process); Artificial intelligence; Salient; Process (computing); Psychology; Linguistics","authors":[{"name":"Jinnie Shin","is_ca":false},{"name":"Mark J. Gierl","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.08765853027184589,"gpt":0.3270988022823678,"spread":0.2394402720105219,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005174801,0.0021493,0.001158099,0.003313177,0.0008187149,0.00189393,0.001901855,0.001229293,0.009178868],"category_scores_gemma":[0.03433377,0.0008219539,0.001469813,0.002132979,0.0008327854,0.002139599,0.002091763,0.001731563,0.006756426],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006868548,"about_ca_system_score_gemma":0.001272682,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001508119,"about_ca_topic_score_gemma":0.001922296,"domain_scores_codex":[0.9938393,0.002801723,0.0004933787,0.001828728,0.0009000025,0.0001368335],"domain_scores_gemma":[0.9609355,0.02903366,0.001308864,0.003726272,0.004781394,0.0002143193],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003477226,0.0006516719,0.008139097,0.0005188125,0.0001202471,0.0002916741,0.002671367,0.01173136,0.03431162,0.003541599,0.005421973,0.9322529],"study_design_scores_gemma":[0.0003609036,0.001169014,0.02351566,0.0001588897,0.0002569489,0.0008262675,0.001792656,0.791585,0.1268428,0.02796001,0.02530022,0.0002316466],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03576569,0.00006690312,0.9465036,0.0001058673,0.00003910319,0.001096561,0.000802841,0.01396907,0.001650323],"genre_scores_gemma":[0.1217831,0.00006730525,0.8692374,0.00007398934,0.00004312238,0.002213731,0.003403415,0.0009616341,0.002216341],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009178868,"threshold_uncertainty_score":0.03070641,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4381282730","doi":"10.1080/15305058.2023.2214648","title":"The analysis of TIMSS 2015 data with confirmatory mixture item response theory: A multidimensional approach","year":2023,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Confirmatory factor analysis; Item response theory; Class (philosophy); Psychology; Mathematics education; Structural equation modeling; Polytomous Rasch model; Sample (material); Latent class model; Cognition; Psychometrics; Mathematics; Statistics; Developmental psychology; Artificial intelligence; Computer science","authors":[{"name":"Sedat Şen","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5081435997123916,"gpt":0.5085350331339626,"spread":0.0003914334215709969,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08827574,0.001824078,0.001745859,0.007909446,0.001970379,0.00276646,0.001874459,0.001200834,0.002120323],"category_scores_gemma":[0.2100561,0.0008273516,0.003838536,0.006537267,0.001477276,0.002674483,0.002489498,0.002765583,0.0008789264],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001359534,"about_ca_system_score_gemma":0.002342463,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005727297,"about_ca_topic_score_gemma":0.007945015,"domain_scores_codex":[0.8808525,0.09972867,0.004383442,0.004851108,0.009433193,0.0007510623],"domain_scores_gemma":[0.8089708,0.1295568,0.01208488,0.0300507,0.01846858,0.0008682027],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002067165,0.001114994,0.5752985,0.001232345,0.005406568,0.0009470583,0.01437525,0.03321552,0.008335246,0.03086676,0.005675683,0.3214648],"study_design_scores_gemma":[0.0003023472,0.002765831,0.3621863,0.0007056919,0.001294134,0.001494479,0.008152303,0.5457085,0.008841392,0.05733724,0.01067957,0.0005321028],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2673938,0.0003498615,0.7267593,0.0005150533,0.00009509329,0.001222971,0.0007534854,0.0007306436,0.002179864],"genre_scores_gemma":[0.7023676,0.0001023329,0.2937261,0.0001639916,0.00003670043,0.001696911,0.001264468,0.0001501518,0.0004918586],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.08827574,"threshold_uncertainty_score":0.4668523,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4391876290","doi":"10.1080/15305058.2024.2318424","title":"A meta-analysis of the relationship between Wonderlic test scores and school success","year":2024,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Calgary; Wilfrid Laurier University","funders":"","keywords":"Psychology; Test (biology); Clinical psychology; Meta-analysis; Medicine; Internal medicine","authors":[{"name":"Chet Robie","is_ca":true},{"name":"Sabah Rasheed","is_ca":true},{"name":"Stephen D. Risavy","is_ca":true},{"name":"Piers Steel","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.8254326103415369,"gpt":0.5486442116530132,"spread":0.2767883986885237,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01377521,0.00214229,0.00930846,0.004806068,0.0005526883,0.002702993,0.001387162,0.001393144,0.003258475],"category_scores_gemma":[0.03333592,0.0009955714,0.03440816,0.004575432,0.000498049,0.001192386,0.0009914658,0.001882787,0.0003424975],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001369018,"about_ca_system_score_gemma":0.001591755,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004046486,"about_ca_topic_score_gemma":0.01013132,"domain_scores_codex":[0.994346,0.002854101,0.001345738,0.000801223,0.0005030963,0.0001499001],"domain_scores_gemma":[0.9803283,0.01576904,0.001897637,0.0009346674,0.0008743145,0.0001961418],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"meta_analysis","study_design_gemma":"meta_analysis","study_design_scores_codex":[0.003699594,0.00003841312,0.007366245,0.07485893,0.8951992,0.00010909,0.00005082404,0.0006507484,0.00044055,0.000157975,0.0006875177,0.01674098],"study_design_scores_gemma":[0.0004830758,0.0002818408,0.005729937,0.003766055,0.987958,0.00007160617,0.00001860101,0.0001435744,0.0001799249,0.0001952382,0.001159547,0.00001258772],"study_design_candidate":"meta_analysis","study_design_consensus":"meta_analysis","genre_codex":"review","genre_gemma":"empirical","genre_scores_codex":[0.02830361,0.9655197,0.002476459,0.0004336393,0.0004349413,0.0002794511,0.001671205,0.00008293656,0.0007980941],"genre_scores_gemma":[0.5755548,0.4124998,0.005835451,0.001420458,0.0005264725,0.0008545871,0.002434997,0.00009959101,0.0007739114],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01377521,"threshold_uncertainty_score":0.07285118,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2266762729","doi":"10.1080/15305058.2015.1057826","title":"Developing a Validity Argument Through Abductive Reasoning with an Empirical Demonstration of the Latent Class Analysis","year":2015,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"University of British Columbia","funders":"","keywords":"Abductive reasoning; Test (biology); Argument (complex analysis); Psychology; Class (philosophy); Empirical research; Computer science; Latent class model; Cognitive psychology; Empirical evidence; Artificial intelligence; Social psychology; Mathematics education; Natural language processing; Machine learning; Epistemology","authors":[{"name":"Amery D. Wu","is_ca":true},{"name":"Jake E. Stone","is_ca":false},{"name":"Yan Liu","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7377369571260765,"gpt":0.5358460428535601,"spread":0.2018909142725164,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.1971869,0.002369007,0.002382092,0.01008926,0.004830462,0.007869864,0.005846988,0.004112136,0.005739453],"category_scores_gemma":[0.4462955,0.001293962,0.004293016,0.006118151,0.02881241,0.01441802,0.009742077,0.01055868,0.0007398881],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00629708,"about_ca_system_score_gemma":0.00901892,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007938749,"about_ca_topic_score_gemma":0.006144678,"domain_scores_codex":[0.7411476,0.2067892,0.009179895,0.01168555,0.02928401,0.001913794],"domain_scores_gemma":[0.4173669,0.5092107,0.01579154,0.03424363,0.02216599,0.001221164],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001455894,0.0002316489,0.01195599,0.0003343477,0.0003046629,0.0003063136,0.004717346,0.008575756,0.0003640899,0.9299337,0.001341536,0.04178896],"study_design_scores_gemma":[0.0001370225,0.0001172707,0.002074491,0.0004261898,0.00008103697,0.0001726604,0.001468057,0.06192169,0.0008602627,0.9286144,0.004063247,0.00006368937],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02112207,0.0003424566,0.9617059,0.008123072,0.0001324591,0.0005287238,0.0001599594,0.0001233832,0.007761993],"genre_scores_gemma":[0.3169364,0.0002440854,0.6782689,0.001076352,0.0002072122,0.001951156,0.000202394,0.00004144438,0.001072044],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8028131,"threshold_uncertainty_score":0.9900115,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2119846802","doi":"10.1080/15305058.2014.976865","title":"Impact of Inclusion of Varying Percentages of Repeaters on Equating","year":2015,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"School Choice and Performance","field":"Social Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Centre for Advancing Health Outcomes; University of Alberta","funders":"","keywords":"Equating; Statistics; Representativeness heuristic; Population; Sample (material); Psychology; Mathematics; Demography; Econometrics; Chemistry","authors":[{"name":"W. Todd Rogers","is_ca":true},{"name":"Nizam Radwan","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1350884152148236,"gpt":0.4379068574010745,"spread":0.3028184421862509,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2797308,0.001202103,0.002169776,0.002323333,0.003155825,0.002743464,0.003840372,0.00281641,0.00500303],"category_scores_gemma":[0.5668571,0.001101519,0.002414171,0.002437483,0.00359644,0.003644667,0.006707739,0.002371948,0.001095567],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001646072,"about_ca_system_score_gemma":0.002310542,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004577909,"about_ca_topic_score_gemma":0.004950827,"domain_scores_codex":[0.5058275,0.3870644,0.03692492,0.0218675,0.04382946,0.004486189],"domain_scores_gemma":[0.3658268,0.5106341,0.0346576,0.05865694,0.02644522,0.003779335],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.03346798,0.006572183,0.4787297,0.002365313,0.003051482,0.001442927,0.023039,0.006091436,0.009425642,0.006559615,0.009710088,0.4195447],"study_design_scores_gemma":[0.001171961,0.03103091,0.8406858,0.003038573,0.003652463,0.002499811,0.0128988,0.01751357,0.03655127,0.006705536,0.04379459,0.0004566635],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9232235,0.002624818,0.04799759,0.002866888,0.001099857,0.005076257,0.0009637241,0.000477321,0.01566999],"genre_scores_gemma":[0.9407181,0.0004019178,0.04811924,0.001945939,0.0002013348,0.005138139,0.0007163245,0.0001977834,0.00256131],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2797308,"threshold_uncertainty_score":0.8882202,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}