{"meta":{"query_hash":"5003ca732a82","filters":{"venue":"International Journal of Testing"},"cohort_total":24,"direct_labels_cover":0,"predictions_cover":24,"exported":24,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/5003ca732a82","api":"https://metacan.xera.ac/api/v1/cohort?venue=International+Journal+of+Testing"},"results":[{"id":"W1966255248","doi":"10.1080/15305050701438058","title":"The Beck Depression Inventory-II: Testing for Measurement Equivalence and Factor Mean Differences Across Hong Kong and American Adolescents","year":2007,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Child and Adolescent Psychosocial and Emotional Development","field":"Psychology","cited_by":68,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Beck Depression Inventory; Psychology; Confirmatory factor analysis; Equivalence (formal languages); Measurement invariance; Clinical psychology; Structural equation modeling; Statistics; Psychiatry; Mathematics","score_opus":0.10692464916155962,"score_gpt":0.36365584791829336,"score_spread":0.2567311987567337,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1966255248","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9858144,0.00026974897,0.0064587737,0.00012258165,0.00006150023,0.0012841847,0.00223215,0.00004104393,0.0037157382],"genre_scores_gemma":[0.9738324,0.00035809472,0.017907815,0.00008125863,0.000022385371,0.0031398928,0.003808897,0.000018815652,0.0008304485],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9967822,0.0009820291,0.0007967342,0.0004123422,0.0008694895,0.0001572738],"domain_scores_gemma":[0.9959059,0.0012257743,0.00075936964,0.00049327686,0.0013856686,0.0002299558],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007582041,0.0004861342,0.0007511285,0.0011894464,0.000727645,0.00073142705,0.00047793976,0.00020408732,0.0011553647],"category_scores_gemma":[0.011918468,0.00048793387,0.0006950072,0.0015380043,0.00041579633,0.0005904298,0.0009742313,0.0007708975,0.0002375603],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00019787851,0.00020265704,0.9414118,0.00017832172,0.00037824185,0.000090426634,0.0034959943,0.0002896673,0.0012075026,0.0009276852,0.0019630173,0.049656738],"study_design_scores_gemma":[0.000034084376,0.00019298554,0.9954796,0.000038895632,0.00006142441,0.00006753284,0.0012282622,0.0008284771,0.00036752352,0.000264598,0.0014214887,0.000015211381],"about_ca_topic_score_codex":0.014525862,"about_ca_topic_score_gemma":0.021075124,"teacher_disagreement_score":0.014525862,"about_ca_system_score_codex":0.0007606253,"about_ca_system_score_gemma":0.0015849817,"threshold_uncertainty_score":0.04009813},"labels":[],"label_agreement":null},{"id":"W1983043858","doi":"10.1080/15305058.2001.9669474","title":"Illustrating the Use of Nonparametric Regression to Assess Differential Item and Bundle Functioning Among Multiple Groups","year":2001,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Nonparametric statistics; Differential item functioning; Bundle; Nonparametric regression; Differential (mechanical device); Statistics; Regression analysis; Regression; Smoothing; Psychology; Mathematics; Econometrics; Item response theory; Psychometrics","score_opus":0.6770030026306908,"score_gpt":0.4656857700680094,"score_spread":0.21131723256268142,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1983043858","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.026334884,0.00024025944,0.96635324,0.0005948885,0.000053016556,0.00011872433,0.00014782416,0.00083167077,0.005325493],"genre_scores_gemma":[0.31072593,0.00034693885,0.68549114,0.00023072261,0.00005276468,0.0005067617,0.00021605848,0.00039274385,0.0020369699],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98400915,0.012828342,0.00043153475,0.00071264687,0.0016742428,0.0003440487],"domain_scores_gemma":[0.9365717,0.05473804,0.0020558685,0.0035162473,0.00286988,0.00024819598],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.023448415,0.00096378056,0.000978173,0.00237133,0.00071201124,0.0011370606,0.0011403663,0.0011600698,0.003882654],"category_scores_gemma":[0.07151907,0.0003611837,0.0010224058,0.0035058798,0.0015754768,0.0014585569,0.0021983322,0.002168772,0.0010147913],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008490105,0.00074353616,0.05374749,0.00058460643,0.0005144472,0.0016778742,0.005513666,0.111151926,0.011341585,0.20205705,0.011857503,0.5999613],"study_design_scores_gemma":[0.00017364047,0.0008415909,0.0510978,0.00022837182,0.00013807276,0.002843538,0.0016334648,0.66738355,0.011698326,0.23277906,0.030861428,0.00032118143],"about_ca_topic_score_codex":0.0042658336,"about_ca_topic_score_gemma":0.0041186158,"teacher_disagreement_score":0.023448415,"about_ca_system_score_codex":0.00060763274,"about_ca_system_score_gemma":0.0011932657,"threshold_uncertainty_score":0.124008596},"labels":[],"label_agreement":null},{"id":"W1999798470","doi":"10.1080/15305050701193520","title":"Using Exploratory and Confirmatory Methods to Identify the Cognitive Dimensions In a Large-Scale Science Assessment","year":2007,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Cognitive Science and Mapping","field":"Computer Science","cited_by":20,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Confirmatory factor analysis; Psychology; Scale (ratio); Item response theory; Cognition; Psychometrics; Measurement invariance; Test validity; Applied psychology; Structural equation modeling; Clinical psychology; Statistics; Mathematics","score_opus":0.13349672751734007,"score_gpt":0.4887037303380774,"score_spread":0.35520700282073736,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1999798470","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.40818956,0.00070465053,0.5713021,0.0011358603,0.00019123494,0.0071881106,0.0006762049,0.0005763896,0.010035895],"genre_scores_gemma":[0.5959285,0.00020494955,0.39837638,0.00016332993,0.000039208717,0.0044270647,0.0004925718,0.000040332183,0.000327635],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.8990149,0.073530935,0.00597624,0.004854453,0.015866155,0.0007573824],"domain_scores_gemma":[0.4625481,0.4196969,0.02122556,0.049677003,0.044656392,0.00219615],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.13854848,0.002148249,0.0013861933,0.011899505,0.0022856484,0.005326781,0.0018822128,0.0010167399,0.0014818425],"category_scores_gemma":[0.31413054,0.0005751437,0.0022556686,0.008380096,0.003259844,0.003502182,0.0034635044,0.0020994772,0.00036565398],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00083017803,0.0020353363,0.43579942,0.004139626,0.0032942481,0.0013952343,0.0451854,0.009029874,0.012229122,0.081895605,0.0032197712,0.40094623],"study_design_scores_gemma":[0.0014373512,0.004913772,0.37355766,0.0035309151,0.003549748,0.0024130426,0.070800334,0.17980644,0.021978416,0.31624,0.020863278,0.00090888847],"about_ca_topic_score_codex":0.002601851,"about_ca_topic_score_gemma":0.0042754873,"teacher_disagreement_score":0.13854848,"about_ca_system_score_codex":0.0018214736,"about_ca_system_score_gemma":0.0067879865,"threshold_uncertainty_score":0.7327231},"labels":[],"label_agreement":null},{"id":"W2025305573","doi":"10.1080/15305050903106859","title":"Uncovering the Psychometric Properties of Scales Measuring Individualist and Collectivist Orientations","year":2009,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Cultural Differences and Values","field":"Psychology","cited_by":17,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Collectivism; Psychology; Individualism; Social psychology; Scale (ratio); Psychometrics; Developmental psychology; Geography; Political science","score_opus":0.2054654203050422,"score_gpt":0.3769399820431952,"score_spread":0.17147456173815298,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2025305573","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9404186,0.0020867726,0.032034386,0.0009643604,0.0002837622,0.00093401666,0.0004286809,0.00011280653,0.022736663],"genre_scores_gemma":[0.9801107,0.0004520365,0.017755924,0.00013426745,0.000038453963,0.0006717805,0.00036737343,0.00004402853,0.00042541043],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.97572905,0.012202411,0.0023370574,0.0012616476,0.008040883,0.00042900676],"domain_scores_gemma":[0.8035138,0.14842857,0.011493705,0.012726626,0.022039054,0.0017982156],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07318483,0.00052950496,0.0008448009,0.0038143366,0.0011291794,0.0028714545,0.0008072351,0.0006806938,0.0015796699],"category_scores_gemma":[0.16470826,0.00047017273,0.0014590368,0.0045311283,0.002632674,0.003191556,0.0022044133,0.0015854654,0.00032407447],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00037668418,0.00028694098,0.78689134,0.00056780415,0.0010744153,0.00006502649,0.012659332,0.0009017155,0.0018311373,0.008637514,0.0016219845,0.18508615],"study_design_scores_gemma":[0.00007989541,0.0011027076,0.9512107,0.00070898165,0.0003665493,0.00017622368,0.0122882435,0.006677801,0.0023119156,0.016529948,0.0084461495,0.000100845486],"about_ca_topic_score_codex":0.002040573,"about_ca_topic_score_gemma":0.0034010315,"teacher_disagreement_score":0.07318483,"about_ca_system_score_codex":0.0012042646,"about_ca_system_score_gemma":0.0019700918,"threshold_uncertainty_score":0.387043},"labels":[],"label_agreement":null},{"id":"W2051773947","doi":"10.1080/15305058.2014.957382","title":"Reading Proficiency and Comparability of Mathematics and Science Scores for Students From English and Non-English Backgrounds: An International Perspective","year":2014,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"School Choice and Performance","field":"Social Sciences","cited_by":17,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Ottawa; University of Victoria; University of British Columbia","funders":"","keywords":"Comparability; Reading (process); Mathematics education; Perspective (graphical); Language proficiency; Meaning (existential); English language; Variance (accounting); Psychology; Point (geometry); Mathematics; Linguistics; Accounting","score_opus":0.052396182738244396,"score_gpt":0.40292358747675916,"score_spread":0.35052740473851474,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2051773947","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9895851,0.00048803582,0.00039463458,0.000112139795,0.000016888423,0.000008073349,0.00037387363,0.000008471777,0.00901268],"genre_scores_gemma":[0.9989367,0.00011449085,0.0001697015,0.000019443323,0.000009004294,0.000004984171,0.00035331646,0.000006729745,0.00038556775],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9980095,0.0005965905,0.0002635035,0.00040512384,0.00046124382,0.00026399925],"domain_scores_gemma":[0.9920765,0.002788341,0.0022164478,0.00064013666,0.0015596816,0.0007189717],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002356726,0.00024004957,0.00040235574,0.0033689926,0.00032429578,0.0015066197,0.000328289,0.00026757465,0.0025295252],"category_scores_gemma":[0.01078504,0.00009186512,0.0002803852,0.0023723848,0.0007581547,0.0010012786,0.0016387384,0.00047910147,0.00050126313],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00019880658,0.0000403042,0.9737081,0.000054476954,0.00014997752,0.00020891495,0.0025502366,0.00006544158,0.002003411,0.0007236141,0.00019845404,0.020098295],"study_design_scores_gemma":[0.0000025634279,0.00008363733,0.997405,0.000021550939,0.000020924692,0.00017822783,0.0013264646,0.00005651111,0.00032038937,0.00012566554,0.00045504345,0.000004005646],"about_ca_topic_score_codex":0.005417131,"about_ca_topic_score_gemma":0.008708037,"teacher_disagreement_score":0.005417131,"about_ca_system_score_codex":0.00028632974,"about_ca_system_score_gemma":0.00035904007,"threshold_uncertainty_score":0.012463689},"labels":[],"label_agreement":null},{"id":"W2057990449","doi":"10.1080/15305058.2012.738266","title":"Analysis of Sources of Latent Class Differential Item Functioning in International Assessments","year":2013,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":39,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Comparability; Differential item functioning; Psychology; Multinomial logistic regression; Latent variable; Item response theory; Latent class model; Logistic regression; Matching (statistics); Statistics; Construct validity; Linear discriminant analysis; Construct (python library); Psychometrics; Developmental psychology; Mathematics; Computer science","score_opus":0.3977077293797573,"score_gpt":0.4811063293577611,"score_spread":0.0833985999780038,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2057990449","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9288171,0.0003129909,0.064821996,0.00037929404,0.000041483047,0.00025859,0.0007497686,0.0001273381,0.0044914074],"genre_scores_gemma":[0.9937603,0.000033660606,0.00529974,0.000019052373,0.000010991474,0.00014470368,0.0005459947,0.000024358573,0.00016120814],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9550427,0.028939938,0.0035895957,0.003093112,0.008136739,0.0011979631],"domain_scores_gemma":[0.799454,0.1402417,0.021511551,0.024501124,0.013353916,0.0009377279],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.048804987,0.0009021793,0.0010377275,0.006239638,0.0011972693,0.003048713,0.0011712125,0.0007204641,0.0022033101],"category_scores_gemma":[0.18180592,0.0004293474,0.0015596539,0.006572268,0.0017442044,0.0023544165,0.004437665,0.001343792,0.0002737916],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00031804392,0.00012069513,0.911645,0.00012435789,0.0005199052,0.000103888255,0.0076486915,0.0021385145,0.0007745656,0.005972971,0.00049731624,0.07013607],"study_design_scores_gemma":[0.000057227426,0.00034446636,0.91466445,0.0004151006,0.00037675627,0.0006327135,0.00880005,0.045428574,0.0025151016,0.022758657,0.0038616392,0.00014528407],"about_ca_topic_score_codex":0.0025514583,"about_ca_topic_score_gemma":0.0025398098,"teacher_disagreement_score":0.048804987,"about_ca_system_score_codex":0.0020446514,"about_ca_system_score_gemma":0.0011232225,"threshold_uncertainty_score":0.2581085},"labels":[],"label_agreement":null},{"id":"W2058922083","doi":"10.1080/15305058.2014.891223","title":"Uncovering Substantive Patterns in Student Responses in International Large-Scale Assessments—Comparing a Latent Class to a Manifest DIF Approach","year":2014,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":19,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Generalizability theory; Differential item functioning; Psychology; Item response theory; Latent class model; Homogeneous; Contrast (vision); Homogeneity (statistics); Reading comprehension; Cognitive psychology; Scale (ratio); Comprehension; Social psychology; Psychometrics; Developmental psychology; Reading (process); Statistics; Mathematics","score_opus":0.3759875606329405,"score_gpt":0.4999896769691466,"score_spread":0.12400211633620611,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2058922083","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9594349,0.00013161152,0.03625572,0.00020790719,0.000026846532,0.00017106743,0.00028908692,0.00008334314,0.0033995262],"genre_scores_gemma":[0.99386746,0.000028595874,0.005526263,0.000026702039,0.000009942876,0.000121940364,0.00022817249,0.00002171316,0.00016922124],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98529655,0.00825106,0.001551965,0.0016901295,0.0025532413,0.0006570265],"domain_scores_gemma":[0.91243935,0.047203984,0.015580672,0.01583679,0.007758869,0.0011802657],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.019947065,0.0006750675,0.00060707063,0.0052467324,0.001131296,0.0023125845,0.00086456997,0.00068451965,0.001780127],"category_scores_gemma":[0.09614702,0.00025971726,0.00090125226,0.0028725988,0.001973452,0.0028629575,0.0034510647,0.0011926027,0.00032825835],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005327921,0.00028863485,0.90816593,0.00013975344,0.00017761633,0.00008635254,0.013709619,0.0007333749,0.0034885756,0.0025523743,0.00041464914,0.069710314],"study_design_scores_gemma":[0.000037186404,0.0004708674,0.9700216,0.000093417984,0.00008054546,0.000315803,0.011227887,0.006535296,0.002948329,0.0067413305,0.0014532065,0.00007454099],"about_ca_topic_score_codex":0.0022343518,"about_ca_topic_score_gemma":0.0035088314,"teacher_disagreement_score":0.98005295,"about_ca_system_score_codex":0.0012486993,"about_ca_system_score_gemma":0.0007018272,"threshold_uncertainty_score":0.10549146},"labels":[],"label_agreement":null},{"id":"W2063611796","doi":"10.1080/15305058.2011.617475","title":"Methodologies for Investigating Item- and Test-Level Measurement Equivalence in International Large-Scale Assessments","year":2012,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":32,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Differential item functioning; Comparability; Psychology; Item response theory; Equivalence (formal languages); Statistics; Nonparametric statistics; Test (biology); Psychometrics; Consistency (knowledge bases); Item analysis; Logistic regression; Mathematics","score_opus":0.84777911019985,"score_gpt":0.5833143230805201,"score_spread":0.26446478711932986,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2063611796","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12423715,0.002880443,0.84513396,0.00046847775,0.00042474223,0.007480901,0.0009797027,0.00056346954,0.017831244],"genre_scores_gemma":[0.4690783,0.00096696353,0.5004395,0.00046568766,0.00026561628,0.026053268,0.0013688386,0.00031465787,0.0010471245],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.6212884,0.28860202,0.02540317,0.016280696,0.04702232,0.001403384],"domain_scores_gemma":[0.384278,0.42019373,0.064187065,0.08047258,0.04932238,0.0015463089],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.25240457,0.0019949262,0.0021761886,0.010363872,0.0019440269,0.0048239836,0.0026788574,0.0013934068,0.0024791097],"category_scores_gemma":[0.6103416,0.0010688468,0.0026686862,0.01317993,0.0035108745,0.003791661,0.006213052,0.0029899434,0.00073097966],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010653341,0.0009261222,0.33145967,0.0030011882,0.0049639987,0.00023110588,0.013597616,0.0055748653,0.005091996,0.05039796,0.003323115,0.58036697],"study_design_scores_gemma":[0.00087757414,0.008266871,0.7560436,0.003398437,0.0027299896,0.0011831878,0.009461529,0.03848691,0.019295309,0.11166259,0.04789537,0.0006986004],"about_ca_topic_score_codex":0.003367323,"about_ca_topic_score_gemma":0.0037419738,"teacher_disagreement_score":0.25240457,"about_ca_system_score_codex":0.0029981053,"about_ca_system_score_gemma":0.0028704952,"threshold_uncertainty_score":0.9219183},"labels":[],"label_agreement":null},{"id":"W2076222948","doi":"10.1080/15305058.2010.509554","title":"Using the Attribute Hierarchy Method to Make Diagnostic Inferences about Examinees’ Knowledge and Skills in Mathematics: An Operational Implementation of Cognitive Diagnostic Assessment","year":2010,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Cognitive and developmental aspects of mathematical skills","field":"Mathematics","cited_by":55,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Alberta Advanced Education; University of Alberta","funders":"","keywords":"Cognition; Hierarchy; Set (abstract data type); Item response theory; Test (biology); Computer science; Computerized adaptive testing; Psychology; Psychometrics; Artificial intelligence; Mathematics education; Developmental psychology","score_opus":0.0804734892655436,"score_gpt":0.4593924747952735,"score_spread":0.3789189855297299,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2076222948","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.25307974,0.00030845575,0.7299366,0.0005612499,0.00013542232,0.0018373883,0.00072830933,0.0010733174,0.012339506],"genre_scores_gemma":[0.5108288,0.00019980059,0.4860537,0.000119809316,0.000039524257,0.0014763363,0.00043034824,0.00008564436,0.0007660359],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9815035,0.010248203,0.0018126316,0.001017772,0.005052428,0.0003654484],"domain_scores_gemma":[0.91228276,0.057522733,0.0065865787,0.0063690627,0.016307801,0.00093099865],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.023091976,0.00071837445,0.0006282204,0.0073090754,0.00082556746,0.0016349683,0.00093190855,0.0005345265,0.0017136175],"category_scores_gemma":[0.09861593,0.0003338464,0.0008437354,0.003259613,0.0010316166,0.0025467083,0.0028068987,0.0014279255,0.00043116685],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00043520812,0.0006045733,0.23615813,0.00045115146,0.0002680024,0.00013157031,0.0080848755,0.004902322,0.008199023,0.019879987,0.0033782353,0.7175069],"study_design_scores_gemma":[0.00063692173,0.0030015307,0.5050828,0.001341807,0.0005699167,0.0027344944,0.011015245,0.24658436,0.03826294,0.15133134,0.03873865,0.0007001229],"about_ca_topic_score_codex":0.002908744,"about_ca_topic_score_gemma":0.0035784962,"teacher_disagreement_score":0.023091976,"about_ca_system_score_codex":0.00084872224,"about_ca_system_score_gemma":0.0021454564,"threshold_uncertainty_score":0.12212348},"labels":[],"label_agreement":null},{"id":"W2086483769","doi":"10.1080/15305058.2011.552748","title":"Teachers' Perceptions of Large-Scale Assessment Programs Within Low-Stakes Accountability Frameworks","year":2011,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Educational Assessment and Improvement","field":"Decision Sciences","cited_by":41,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Centre for Advancing Health Outcomes; University of Alberta; Queen's University","funders":"","keywords":"Accountability; Seriousness; Scale (ratio); Perception; Psychology; Standardized test; Educational assessment; Medical education; Pedagogy; Mathematics education; Political science; Geography; Medicine","score_opus":0.15653966944316988,"score_gpt":0.4547954859236611,"score_spread":0.2982558164804912,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2086483769","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9849037,0.0001836597,0.001484515,0.0013063696,0.000014786047,0.00007940503,0.000015637597,0.000030378491,0.011981514],"genre_scores_gemma":[0.99876094,0.00007286895,0.00040574142,0.000078885896,0.0000038818075,0.000023425908,0.000007935982,0.0000047024287,0.00064161955],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.9664225,0.016596103,0.0011137597,0.0008693414,0.012095911,0.002902421],"domain_scores_gemma":[0.9186791,0.036574878,0.012598565,0.0033742336,0.01567777,0.013095414],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.020814361,0.00019434764,0.00031573174,0.0013833981,0.0038424488,0.0051838127,0.0012723178,0.0009747926,0.0015875477],"category_scores_gemma":[0.057108052,0.0003817413,0.00023835189,0.0012414521,0.0048595895,0.0020282008,0.0030835571,0.0017695172,0.0001447689],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00034777695,0.0007258248,0.30187795,0.00046501475,0.00006956033,0.0012305217,0.59323096,0.0016636858,0.006157496,0.008553403,0.002692101,0.08298569],"study_design_scores_gemma":[0.00008795376,0.00075802417,0.355478,0.0006942841,0.000056137727,0.00037052578,0.59279585,0.0030789275,0.0017643138,0.003235447,0.041535337,0.00014519335],"about_ca_topic_score_codex":0.1943175,"about_ca_topic_score_gemma":0.2922613,"teacher_disagreement_score":0.1943175,"about_ca_system_score_codex":0.013761631,"about_ca_system_score_gemma":0.020323869,"threshold_uncertainty_score":0.38637292},"labels":[],"label_agreement":null},{"id":"W2089954256","doi":"10.1080/15305058.2010.501536","title":"Evaluating the Bookmark Standard Setting Method: The Impact of Random Item Ordering","year":2011,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":19,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Licensure; Assertion; Test (biology); Computer science; Psychology; Process (computing); Mathematics education; Statistics; Medical education; Mathematics; Medicine; Programming language","score_opus":0.7272170666147368,"score_gpt":0.606127092720526,"score_spread":0.12108997389421083,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2089954256","genre_codex":"methods","genre_gemma":"empirical","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.39241016,0.0064779017,0.56025875,0.003932684,0.001482885,0.007143352,0.0005401916,0.001030811,0.02672324],"genre_scores_gemma":[0.6447042,0.0009092847,0.34507155,0.0022262048,0.000329016,0.0030985693,0.0005271231,0.00040817613,0.0027257805],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.42381626,0.49827707,0.012475043,0.013121548,0.05130249,0.0010076388],"domain_scores_gemma":[0.116538,0.8171533,0.023425225,0.025585333,0.015837219,0.0014610105],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.357548,0.0021432594,0.0022521568,0.0032341885,0.0020421448,0.004618255,0.0037818628,0.002741862,0.0030089025],"category_scores_gemma":[0.7159848,0.0010739829,0.0017765843,0.004570171,0.003652348,0.0051182457,0.0043300483,0.004077772,0.0010134908],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.014766022,0.0029006856,0.16218597,0.0018133323,0.0024256413,0.0003402984,0.009942658,0.017539624,0.0054277307,0.026290813,0.014575238,0.741792],"study_design_scores_gemma":[0.0061224666,0.02896084,0.26829132,0.0046361582,0.0039027596,0.0019945325,0.007465896,0.4410382,0.04193072,0.12727383,0.06640621,0.0019771045],"about_ca_topic_score_codex":0.0038253064,"about_ca_topic_score_gemma":0.0062054256,"teacher_disagreement_score":0.642452,"about_ca_system_score_codex":0.0032863568,"about_ca_system_score_gemma":0.0036328684,"threshold_uncertainty_score":0.7922577},"labels":[],"label_agreement":null},{"id":"W2113879845","doi":"10.1080/15305058.2012.690140","title":"Investigating Sources of Differential Item Functioning in International Large-Scale Assessments Using a Confirmatory Approach","year":2013,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Educational and Psychological Assessments","field":"Psychology","cited_by":28,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Differential item functioning; Psychology; Equivalence (formal languages); Measurement invariance; Scale (ratio); Item response theory; Pairwise comparison; Cognition; Psychometrics; Differential (mechanical device); Confirmatory factor analysis; Clinical psychology; Developmental psychology; Social psychology; Statistics; Structural equation modeling","score_opus":0.1081283061996754,"score_gpt":0.4028085569126335,"score_spread":0.2946802507129581,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2113879845","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.85277504,0.00029266527,0.13530572,0.00043243138,0.00012149723,0.0015613049,0.0005086912,0.00024589268,0.00875677],"genre_scores_gemma":[0.9491001,0.00006655626,0.048524044,0.00010343966,0.000028394548,0.00105064,0.0006591186,0.000075326694,0.0003923565],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9176844,0.05714621,0.006968529,0.005026359,0.011685052,0.0014893744],"domain_scores_gemma":[0.65400785,0.20817436,0.02805685,0.048810147,0.058823466,0.0021273182],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.095616296,0.001691659,0.0010169089,0.0062187933,0.0026121568,0.0032420857,0.0012203407,0.000635368,0.0018614552],"category_scores_gemma":[0.24346726,0.0007817209,0.00174654,0.0052172714,0.0018580997,0.002170713,0.0032973143,0.0018724798,0.0004895721],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00051040744,0.0004359476,0.8876627,0.00049508567,0.0012040413,0.0003623157,0.017152326,0.0011103017,0.0057360744,0.0041033886,0.0010674592,0.080159955],"study_design_scores_gemma":[0.00021785471,0.002222561,0.92656374,0.00064980105,0.0009463417,0.0009500582,0.024835674,0.015413019,0.012897548,0.010258296,0.0048344475,0.00021074926],"about_ca_topic_score_codex":0.0055068997,"about_ca_topic_score_gemma":0.011821049,"teacher_disagreement_score":0.095616296,"about_ca_system_score_codex":0.0010911485,"about_ca_system_score_gemma":0.0028426258,"threshold_uncertainty_score":0.50567335},"labels":[],"label_agreement":null},{"id":"W2119846802","doi":"10.1080/15305058.2014.976865","title":"Impact of Inclusion of Varying Percentages of Repeaters on Equating","year":2015,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"School Choice and Performance","field":"Social Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Centre for Advancing Health Outcomes; University of Alberta","funders":"","keywords":"Equating; Statistics; Representativeness heuristic; Population; Sample (material); Psychology; Mathematics; Demography; Econometrics; Chemistry","score_opus":0.13508841521482362,"score_gpt":0.43790685740107455,"score_spread":0.3028184421862509,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2119846802","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9232235,0.002624818,0.047997586,0.0028668884,0.0010998573,0.0050762566,0.0009637241,0.00047732104,0.01566999],"genre_scores_gemma":[0.9407181,0.00040191785,0.048119236,0.0019459394,0.0002013348,0.0051381392,0.0007163245,0.00019778343,0.00256131],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.5058275,0.38706443,0.036924917,0.021867504,0.043829456,0.0044861888],"domain_scores_gemma":[0.3658268,0.5106341,0.034657598,0.058656942,0.026445216,0.0037793354],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.27973077,0.0012021031,0.0021697765,0.0023233327,0.0031558252,0.0027434637,0.0038403724,0.0028164096,0.00500303],"category_scores_gemma":[0.5668571,0.0011015193,0.0024141714,0.0024374826,0.0035964397,0.003644667,0.0067077386,0.002371948,0.0010955668],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.033467982,0.0065721828,0.4787297,0.0023653135,0.0030514821,0.0014429268,0.023038998,0.0060914364,0.009425642,0.0065596155,0.009710088,0.41954467],"study_design_scores_gemma":[0.001171961,0.031030908,0.84068584,0.003038573,0.0036524634,0.0024998111,0.012898796,0.017513571,0.036551267,0.006705536,0.04379459,0.00045666355],"about_ca_topic_score_codex":0.0045779087,"about_ca_topic_score_gemma":0.004950827,"teacher_disagreement_score":0.27973077,"about_ca_system_score_codex":0.0016460725,"about_ca_system_score_gemma":0.0023105424,"threshold_uncertainty_score":0.8882202},"labels":[],"label_agreement":null},{"id":"W2126572511","doi":"10.1207/s15327574ijt0403_1","title":"Validating the Beck Depression Inventory-II for Hong Kong Community Adolescents","year":2004,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Child and Adolescent Psychosocial and Emotional Development","field":"Psychology","cited_by":160,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Ottawa","funders":"","keywords":"Psychology; Confirmatory factor analysis; Beck Depression Inventory; Structural equation modeling; Exploratory factor analysis; Clinical psychology; Internal consistency; Depression (economics); Psychometrics; Developmental psychology; Psychiatry; Anxiety; Statistics; Mathematics","score_opus":0.08080420797592054,"score_gpt":0.3520861026986411,"score_spread":0.2712818947227206,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2126572511","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9935241,0.00015638076,0.0016374403,0.000099104356,0.00005716754,0.0011808795,0.00090886693,0.00002175554,0.0024143565],"genre_scores_gemma":[0.98158586,0.000412674,0.010718986,0.00019303248,0.00002576303,0.0027677433,0.0023447578,0.000012388134,0.0019389549],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9987746,0.00040956656,0.0003199228,0.00011800085,0.0002651259,0.00011280206],"domain_scores_gemma":[0.9982496,0.0002808905,0.0002679384,0.00021198764,0.0007942531,0.00019528341],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005318687,0.0005221917,0.00048417159,0.00071108463,0.0007354456,0.0007783482,0.00043350438,0.00024337342,0.0011654722],"category_scores_gemma":[0.005428912,0.00030466006,0.0005138507,0.00054735196,0.00027492712,0.00041966507,0.0006449377,0.0006743865,0.00045746242],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014463007,0.000261561,0.96400493,0.00008333279,0.000060862716,0.00013512027,0.002239183,0.00016639679,0.0014774296,0.00014779341,0.0014311342,0.029847596],"study_design_scores_gemma":[0.00005234908,0.00039467087,0.99335253,0.000046141282,0.00004037739,0.00012234919,0.0021400643,0.00079941325,0.00070773275,0.0000748984,0.0022552796,0.000014250673],"about_ca_topic_score_codex":0.011498976,"about_ca_topic_score_gemma":0.02894436,"teacher_disagreement_score":0.011498976,"about_ca_system_score_codex":0.00055090926,"about_ca_system_score_gemma":0.0013022765,"threshold_uncertainty_score":0.028128266},"labels":[],"label_agreement":null},{"id":"W2135248568","doi":"10.1080/15305058.2011.602810","title":"A Generalized Logistic Regression Procedure to Detect Differential Item Functioning Among Multiple Groups","year":2011,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":46,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Montréal","funders":"","keywords":"Differential item functioning; Logistic regression; Completeness (order theory); Statistics; Item response theory; Mathematics; Set (abstract data type); Extension (predicate logic); Differential (mechanical device); Flexibility (engineering); Regression; Psychology; Psychometrics; Computer science","score_opus":0.548040852468272,"score_gpt":0.4478112341211973,"score_spread":0.10022961834707478,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2135248568","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013276606,0.00015887378,0.9826073,0.00038307832,0.00007637838,0.00078760786,0.0005554376,0.0014467258,0.0007079623],"genre_scores_gemma":[0.13340347,0.00036265855,0.8568074,0.00026072733,0.00010227606,0.004892964,0.0011022774,0.00034753088,0.0027206098],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9686525,0.026267046,0.00085633725,0.001977835,0.0017620099,0.00048424723],"domain_scores_gemma":[0.96921724,0.020144077,0.00224015,0.005483858,0.0026551432,0.00025950334],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.024820944,0.002602845,0.0022915527,0.0044909525,0.0010131352,0.0010290983,0.0030770674,0.0012722319,0.008413578],"category_scores_gemma":[0.07430244,0.00086702756,0.0035080947,0.005101036,0.0011420491,0.0017768254,0.004033432,0.0033383314,0.0024103285],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00088687596,0.0005574807,0.048133057,0.0013029515,0.004338192,0.0014139358,0.002094596,0.031958852,0.0092157,0.061531093,0.019090708,0.81947654],"study_design_scores_gemma":[0.0013538859,0.004456861,0.094738536,0.00088495645,0.0025832984,0.0052676266,0.0019643328,0.57103974,0.01331999,0.24079026,0.06259857,0.0010019444],"about_ca_topic_score_codex":0.0028133471,"about_ca_topic_score_gemma":0.0025518239,"teacher_disagreement_score":0.024820944,"about_ca_system_score_codex":0.0006076544,"about_ca_system_score_gemma":0.002807016,"threshold_uncertainty_score":0.13126725},"labels":[],"label_agreement":null},{"id":"W2137207467","doi":"10.1080/15305058.2014.977444","title":"Explore the Usefulness of Person-Fit Analysis on Large-Scale Assessment","year":2014,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Mental Health Research Topics","field":"Psychology","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Centre for Health Evaluation and Outcome Sciences; University of Alberta","funders":"","keywords":"Item response theory; Scale (ratio); Psychology; Econometrics; Statistics; Psychometrics; Developmental psychology; Mathematics","score_opus":0.29003612976753645,"score_gpt":0.48466932499598236,"score_spread":0.1946331952284459,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2137207467","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9370547,0.000098254735,0.05917822,0.00014419515,0.00003086414,0.00014529226,0.00019381865,0.00019284771,0.0029619008],"genre_scores_gemma":[0.98892677,0.000011480586,0.010735578,0.00001491577,0.0000046819487,0.000061943785,0.0000809593,0.000025428466,0.00013820505],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.96380013,0.029018357,0.0013512693,0.0013353712,0.004092183,0.00040272373],"domain_scores_gemma":[0.7359005,0.22908086,0.010582917,0.014596719,0.008705566,0.0011333205],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.050243963,0.0005829573,0.0006077781,0.0022820255,0.00089678,0.0014257012,0.00073617767,0.0005775121,0.0022199727],"category_scores_gemma":[0.18366522,0.00025459126,0.0014179724,0.0018735318,0.0013047273,0.002071483,0.0016348463,0.0013374921,0.00024399027],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006930951,0.00033429192,0.8890489,0.0001345959,0.0007396505,0.00018177145,0.007222434,0.006810475,0.0026929888,0.0032110682,0.00073270564,0.08819823],"study_design_scores_gemma":[0.000041110274,0.0015830775,0.9172494,0.00008732593,0.00014276376,0.00030266208,0.0055450574,0.06406844,0.0041192356,0.0045379708,0.0021991152,0.00012379057],"about_ca_topic_score_codex":0.00668305,"about_ca_topic_score_gemma":0.010123552,"teacher_disagreement_score":0.050243963,"about_ca_system_score_codex":0.0010122774,"about_ca_system_score_gemma":0.0015909707,"threshold_uncertainty_score":0.26571864},"labels":[],"label_agreement":null},{"id":"W2142413505","doi":"10.1080/15305058.2011.635830","title":"The Role of Item Models in Automatic Item Generation","year":2012,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Intelligent Tutoring Systems and Adaptive Learning","field":"Computer Science","cited_by":73,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Item bank; Item response theory; Field (mathematics); Process (computing); Task (project management); Item analysis; Artificial intelligence; Machine learning; Psychometrics; Psychology","score_opus":0.055843275432405984,"score_gpt":0.2802359057096199,"score_spread":0.22439263027721396,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2142413505","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006905769,0.00059945404,0.9866475,0.0008926291,0.00009327484,0.0008523762,0.00021018786,0.0011677288,0.0026310985],"genre_scores_gemma":[0.09355135,0.0006672812,0.9005472,0.0004997245,0.00010001723,0.0028964195,0.000587077,0.00045910798,0.0006918836],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8342605,0.14308015,0.004869926,0.0042794207,0.0128025245,0.0007074144],"domain_scores_gemma":[0.50338185,0.44420654,0.006742728,0.024695277,0.020129554,0.00084401056],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.12791987,0.0027760894,0.0028267296,0.008547199,0.0013035187,0.008516186,0.0052900985,0.0028533577,0.0041283886],"category_scores_gemma":[0.41877803,0.0025151179,0.0028628362,0.008665964,0.0043016095,0.014655843,0.00476228,0.0073239673,0.0025683125],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00039587295,0.00058473484,0.0231175,0.0017548396,0.0012871751,0.00024425803,0.0059755566,0.06319576,0.0016129826,0.25201765,0.010844298,0.6389694],"study_design_scores_gemma":[0.0002815787,0.00043585023,0.007168454,0.0012713382,0.00033445327,0.00041712134,0.0010441274,0.50684243,0.003528201,0.4621869,0.01610634,0.00038320196],"about_ca_topic_score_codex":0.0025930996,"about_ca_topic_score_gemma":0.002607672,"teacher_disagreement_score":0.12791987,"about_ca_system_score_codex":0.003782161,"about_ca_system_score_gemma":0.0038774086,"threshold_uncertainty_score":0.676513},"labels":[],"label_agreement":null},{"id":"W2266762729","doi":"10.1080/15305058.2015.1057826","title":"Developing a Validity Argument Through Abductive Reasoning with an Empirical Demonstration of the Latent Class Analysis","year":2015,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Abductive reasoning; Test (biology); Argument (complex analysis); Psychology; Class (philosophy); Empirical research; Computer science; Latent class model; Cognitive psychology; Empirical evidence; Artificial intelligence; Social psychology; Mathematics education; Natural language processing; Machine learning; Epistemology","score_opus":0.7377369571260765,"score_gpt":0.5358460428535601,"score_spread":0.20189091427251638,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2266762729","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.021122066,0.00034245657,0.9617059,0.008123072,0.00013245908,0.0005287238,0.00015995941,0.00012338316,0.007761993],"genre_scores_gemma":[0.31693643,0.00024408537,0.6782689,0.0010763524,0.00020721223,0.0019511556,0.00020239402,0.000041444382,0.0010720438],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.7411476,0.20678915,0.009179895,0.011685546,0.029284006,0.0019137936],"domain_scores_gemma":[0.41736692,0.5092107,0.015791535,0.034243632,0.022165991,0.0012211641],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.19718692,0.002369007,0.0023820922,0.010089263,0.004830462,0.007869864,0.0058469884,0.0041121356,0.005739453],"category_scores_gemma":[0.44629553,0.001293962,0.0042930157,0.0061181514,0.028812412,0.014418022,0.009742077,0.010558676,0.00073988806],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014558938,0.00023164891,0.011955989,0.0003343477,0.0003046629,0.0003063136,0.004717346,0.008575756,0.0003640899,0.92993367,0.0013415361,0.04178896],"study_design_scores_gemma":[0.00013702252,0.00011727068,0.0020744908,0.00042618983,0.00008103697,0.00017266038,0.0014680569,0.061921686,0.0008602627,0.9286144,0.004063247,0.000063689375],"about_ca_topic_score_codex":0.007938749,"about_ca_topic_score_gemma":0.006144678,"teacher_disagreement_score":0.80281305,"about_ca_system_score_codex":0.00629708,"about_ca_system_score_gemma":0.00901892,"threshold_uncertainty_score":0.99001145},"labels":[],"label_agreement":null},{"id":"W2956918498","doi":"10.1080/15305058.2019.1632316","title":"Migration Background in PISA’s Measure of Social Belonging: Using a Diffractive Lens to Interpret Multi-Method DIF Studies","year":2019,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Intergenerational and Educational Inequality Studies","field":"Social Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Ordered logit; Differential item functioning; Logistic regression; Immigration; Measure (data warehouse); Psychology; Through-the-lens metering; Econometrics; Social psychology; Measurement invariance; Differential (mechanical device); Item response theory; Lens (geology); Psychometrics; Statistics; Structural equation modeling; Computer science; Mathematics; Geography; Developmental psychology; Confirmatory factor analysis; Data mining","score_opus":0.2921427318247282,"score_gpt":0.5026481723540723,"score_spread":0.2105054405293441,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2956918498","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6515424,0.00086062745,0.32127205,0.0017590007,0.00019487612,0.0009656313,0.00023247558,0.00013972199,0.023033211],"genre_scores_gemma":[0.93641114,0.00011030008,0.062030315,0.00012907185,0.000028582243,0.00072373037,0.0000804358,0.000028917784,0.000457471],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.92858124,0.057907313,0.0035961072,0.002588486,0.0065800594,0.0007467683],"domain_scores_gemma":[0.9012624,0.072761446,0.007993388,0.011844796,0.0054909685,0.0006470034],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07505506,0.00079609547,0.0010004039,0.008998937,0.0033830502,0.005741064,0.0014530448,0.00070552964,0.001667849],"category_scores_gemma":[0.13854468,0.0005413881,0.0012798364,0.0062953252,0.007111507,0.004446707,0.0074125156,0.0018361937,0.0001768709],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004294116,0.00033556693,0.43831035,0.0007114658,0.00056321954,0.0006106831,0.15697789,0.0022009055,0.0035137527,0.13804278,0.0011482673,0.25715578],"study_design_scores_gemma":[0.000120937315,0.0010172854,0.65551764,0.00076455664,0.00035606336,0.0011361471,0.13414125,0.029258791,0.004841446,0.15323016,0.019398067,0.00021760602],"about_ca_topic_score_codex":0.004163511,"about_ca_topic_score_gemma":0.0043656183,"teacher_disagreement_score":0.07505506,"about_ca_system_score_codex":0.0029128983,"about_ca_system_score_gemma":0.0016340299,"threshold_uncertainty_score":0.39693385},"labels":[],"label_agreement":null},{"id":"W3211365142","doi":"10.1207/s15327574ijt0601_7","title":"Book Review","year":2006,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Behavioral and Psychological Studies","field":"Psychology","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Psychology","score_opus":0.25453380262319725,"score_gpt":0.41852446206679766,"score_spread":0.16399065944360042,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3211365142","genre_codex":"other","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0004370353,0.14032118,0.0020317594,0.041164342,0.10139634,0.00020354627,0.0012745602,0.0007862075,0.7123851],"genre_scores_gemma":[0.0008196783,0.023399517,0.00046518186,0.005606645,0.01068715,0.000045845645,0.00044713265,0.00015593028,0.95837295],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.999387,0.00005667765,0.000018340485,0.00006166652,0.0004263365,0.000049878712],"domain_scores_gemma":[0.9977272,0.00039739656,0.00010004043,0.00014260139,0.0012105847,0.00042220138],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0007153057,0.00071048684,0.0008350855,0.0031830568,0.0009994217,0.003300687,0.0012233934,0.0017025021,0.3265489],"category_scores_gemma":[0.003938408,0.0003282693,0.000440194,0.00287798,0.000531023,0.0019201018,0.0012933908,0.0021715818,0.30635187],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000003966655,0.0000064350543,0.00001609957,0.000058330832,0.0000010849404,0.000012238402,0.0000047949725,0.00001998054,0.000030564934,0.0007315258,0.9560799,0.0430351],"study_design_scores_gemma":[0.0000018661336,0.000003274567,0.000058917787,0.000064462896,0.0000012747961,0.00002979053,0.00000728264,0.000011096666,0.00001624615,0.00039044564,0.9994137,0.0000015539017],"about_ca_topic_score_codex":0.0036409982,"about_ca_topic_score_gemma":0.010492145,"teacher_disagreement_score":0.3265489,"about_ca_system_score_codex":0.0014968623,"about_ca_system_score_gemma":0.0024134126,"threshold_uncertainty_score":0.96059626},"labels":[],"label_agreement":null},{"id":"W4309375705","doi":"10.1080/15305058.2022.2070755","title":"Generating reading comprehension items using automated processes","year":2022,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Topic Modeling","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Reading comprehension; Blank; Comprehension; Computer science; Natural language processing; Test (biology); Reading (process); Artificial intelligence; Salient; Process (computing); Psychology; Linguistics","score_opus":0.08765853027184589,"score_gpt":0.32709880228236776,"score_spread":0.23944027201052187,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4309375705","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.03576569,0.00006690312,0.94650364,0.00010586727,0.000039103186,0.0010965605,0.000802841,0.013969071,0.0016503228],"genre_scores_gemma":[0.121783085,0.00006730525,0.86923736,0.00007398934,0.00004312238,0.0022137314,0.0034034154,0.0009616341,0.0022163412],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9938393,0.002801723,0.0004933787,0.0018287277,0.0009000025,0.00013683349],"domain_scores_gemma":[0.9609355,0.029033665,0.0013088643,0.0037262721,0.004781394,0.0002143193],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005174801,0.0021493,0.0011580989,0.003313177,0.0008187149,0.0018939304,0.0019018549,0.001229293,0.009178868],"category_scores_gemma":[0.034333766,0.0008219539,0.0014698132,0.002132979,0.0008327854,0.0021395986,0.002091763,0.0017315635,0.006756426],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00034772264,0.0006516719,0.008139097,0.0005188125,0.000120247096,0.00029167414,0.0026713668,0.011731364,0.034311622,0.003541599,0.0054219733,0.93225294],"study_design_scores_gemma":[0.0003609036,0.0011690138,0.02351566,0.0001588897,0.00025694893,0.00082626747,0.0017926564,0.79158497,0.12684284,0.027960006,0.025300218,0.0002316466],"about_ca_topic_score_codex":0.001508119,"about_ca_topic_score_gemma":0.0019222962,"teacher_disagreement_score":0.009178868,"about_ca_system_score_codex":0.0006868548,"about_ca_system_score_gemma":0.0012726821,"threshold_uncertainty_score":0.030706406},"labels":[],"label_agreement":null},{"id":"W4381282730","doi":"10.1080/15305058.2023.2214648","title":"The analysis of TIMSS 2015 data with confirmatory mixture item response theory: A multidimensional approach","year":2023,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Confirmatory factor analysis; Item response theory; Class (philosophy); Psychology; Mathematics education; Structural equation modeling; Polytomous Rasch model; Sample (material); Latent class model; Cognition; Psychometrics; Mathematics; Statistics; Developmental psychology; Artificial intelligence; Computer science","score_opus":0.5081435997123916,"score_gpt":0.5085350331339626,"score_spread":0.0003914334215709969,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4381282730","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.26739377,0.00034986154,0.72675925,0.00051505334,0.00009509329,0.0012229705,0.0007534854,0.0007306436,0.0021798636],"genre_scores_gemma":[0.7023676,0.00010233293,0.29372606,0.00016399156,0.00003670043,0.0016969113,0.0012644683,0.0001501518,0.0004918586],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8808525,0.099728666,0.0043834425,0.004851108,0.009433193,0.0007510623],"domain_scores_gemma":[0.8089708,0.12955682,0.012084884,0.030050704,0.018468583,0.00086820265],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08827574,0.001824078,0.0017458592,0.007909446,0.0019703787,0.0027664602,0.0018744593,0.0012008339,0.0021203232],"category_scores_gemma":[0.21005613,0.0008273516,0.0038385359,0.0065372675,0.001477276,0.0026744835,0.0024894977,0.002765583,0.00087892637],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0020671654,0.0011149936,0.57529855,0.0012323448,0.0054065683,0.00094705826,0.014375249,0.033215515,0.008335246,0.030866757,0.005675683,0.3214648],"study_design_scores_gemma":[0.00030234715,0.002765831,0.36218628,0.00070569187,0.0012941338,0.0014944791,0.008152303,0.54570854,0.008841392,0.057337243,0.010679571,0.00053210283],"about_ca_topic_score_codex":0.005727297,"about_ca_topic_score_gemma":0.007945015,"teacher_disagreement_score":0.08827574,"about_ca_system_score_codex":0.0013595335,"about_ca_system_score_gemma":0.0023424625,"threshold_uncertainty_score":0.4668523},"labels":[],"label_agreement":null},{"id":"W4391876290","doi":"10.1080/15305058.2024.2318424","title":"A meta-analysis of the relationship between Wonderlic test scores and school success","year":2024,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary; Wilfrid Laurier University","funders":"","keywords":"Psychology; Test (biology); Clinical psychology; Meta-analysis; Medicine; Internal medicine","score_opus":0.8254326103415369,"score_gpt":0.5486442116530132,"score_spread":0.2767883986885237,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4391876290","genre_codex":"review","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.028303614,0.9655197,0.0024764594,0.0004336393,0.0004349413,0.00027945108,0.0016712053,0.00008293656,0.00079809414],"genre_scores_gemma":[0.57555485,0.41249976,0.0058354507,0.0014204582,0.0005264725,0.0008545871,0.0024349971,0.00009959101,0.00077391136],"study_design_codex":"meta_analysis","study_design_gemma":"meta_analysis","domain_scores_codex":[0.99434596,0.002854101,0.001345738,0.000801223,0.00050309626,0.00014990008],"domain_scores_gemma":[0.98032826,0.015769038,0.0018976374,0.00093466736,0.00087431446,0.00019614183],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013775211,0.00214229,0.00930846,0.004806068,0.0005526883,0.002702993,0.0013871619,0.001393144,0.0032584746],"category_scores_gemma":[0.033335917,0.0009955714,0.034408163,0.0045754323,0.000498049,0.0011923857,0.0009914658,0.0018827871,0.00034249746],"study_design_candidate":"meta_analysis","study_design_consensus":"meta_analysis","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0036995944,0.000038413124,0.007366245,0.074858926,0.8951992,0.00010908996,0.000050824037,0.0006507484,0.00044055,0.00015797501,0.0006875177,0.016740976],"study_design_scores_gemma":[0.00048307577,0.00028184077,0.0057299365,0.0037660555,0.987958,0.00007160617,0.000018601013,0.00014357439,0.00017992487,0.00019523824,0.0011595471,0.000012587719],"about_ca_topic_score_codex":0.0040464858,"about_ca_topic_score_gemma":0.010131315,"teacher_disagreement_score":0.013775211,"about_ca_system_score_codex":0.0013690178,"about_ca_system_score_gemma":0.0015917547,"threshold_uncertainty_score":0.07285118},"labels":[],"label_agreement":null},{"id":"W4400119116","doi":"10.1080/15305058.2024.2364174","title":"Can the dark core of personality be measured briefly, multidimensionally, and invariantly? The D25 measure","year":2024,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Personality Traits and Psychology","field":"Psychology","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Measure (data warehouse); Psychology; Personality; Core (optical fiber); Cognitive psychology; Social psychology; Computer science; Data mining","score_opus":0.1511349496781008,"score_gpt":0.3789092397915193,"score_spread":0.22777429011341851,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4400119116","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9356973,0.0051276865,0.040976726,0.00342325,0.0018566779,0.00026875737,0.0011404024,0.0001508074,0.011358355],"genre_scores_gemma":[0.97195476,0.0015894074,0.022837674,0.00088759366,0.00025633295,0.00036249234,0.0010838864,0.000032004074,0.0009958122],"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99743074,0.0009255858,0.0004094284,0.0003538877,0.00068278273,0.00019762218],"domain_scores_gemma":[0.987698,0.004820707,0.003466972,0.0017554,0.0014440194,0.0008150023],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00660455,0.000612004,0.00060352555,0.0012088496,0.0005325276,0.0017665153,0.000692247,0.00059397897,0.0013702661],"category_scores_gemma":[0.025661182,0.00029893982,0.0009024324,0.0015049916,0.0009326463,0.0021513351,0.0016828128,0.0016488896,0.00037223258],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00032928537,0.00023724491,0.6317467,0.000742679,0.00076917576,0.00019681147,0.0042530843,0.0007567188,0.0026986336,0.008463546,0.005665611,0.34414068],"study_design_scores_gemma":[0.000038784117,0.0007934723,0.9499642,0.00056280586,0.0002376801,0.00047638972,0.0027362043,0.002389696,0.0010700462,0.022484342,0.0191339,0.00011246084],"about_ca_topic_score_codex":0.00283612,"about_ca_topic_score_gemma":0.004784461,"teacher_disagreement_score":0.00660455,"about_ca_system_score_codex":0.0007346877,"about_ca_system_score_gemma":0.001041082,"threshold_uncertainty_score":0.03492862},"labels":[],"label_agreement":null}]}