{"meta":{"query_hash":"07872ab30370","filters":{"venue":"Journal of Educational Measurement"},"cohort_total":26,"direct_labels_cover":0,"predictions_cover":26,"exported":26,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/07872ab30370","api":"https://metacan.xera.ac/api/v1/cohort?venue=Journal+of+Educational+Measurement"},"results":[{"id":"W1595860368","doi":"10.1111/jedm.12072","title":"Extended Mixed‐Effects Item Response Models With the MH‐RM Algorithm","year":2015,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":42,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Item response theory; Random effects model; Curse of dimensionality; Rasch model; Mixed model; Mathematics; Algorithm; Statistics; Monte Carlo method; Linear regression; Generalized linear mixed model; Computer science; Econometrics; Psychometrics; Meta-analysis","score_opus":0.6020280900847433,"score_gpt":0.46003750662039183,"score_spread":0.1419905834643515,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1595860368","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0013987259,0.00011919579,0.99661285,0.00012827013,0.000026992755,0.0004513468,0.00025934368,0.00063954946,0.00036369223],"genre_scores_gemma":[0.014714716,0.000092223905,0.98115987,0.00010113323,0.000032494827,0.0024152193,0.000436129,0.00015436897,0.0008938286],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9573171,0.036362566,0.0014245812,0.0024299186,0.002010043,0.00045579748],"domain_scores_gemma":[0.942917,0.046563227,0.0015873907,0.0051784716,0.0034290105,0.00032501091],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.042334907,0.0026663167,0.0036602463,0.002778801,0.0013369119,0.002938427,0.0078119477,0.0030527594,0.016905654],"category_scores_gemma":[0.09757704,0.0023760148,0.006290316,0.0040151644,0.0011739228,0.0035470442,0.0043340754,0.0064227264,0.0058660833],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009586306,0.0005421058,0.003967281,0.0011161875,0.0024094477,0.0004479235,0.0013921169,0.21390292,0.001077621,0.21190266,0.013576947,0.5487062],"study_design_scores_gemma":[0.00025379742,0.00025690056,0.0009524213,0.00016982405,0.00026392617,0.00020132246,0.00011917409,0.86028355,0.00069484505,0.12730354,0.0093821,0.00011852079],"about_ca_topic_score_codex":0.0055919187,"about_ca_topic_score_gemma":0.0065890076,"teacher_disagreement_score":0.042334907,"about_ca_system_score_codex":0.001579715,"about_ca_system_score_gemma":0.0037074273,"threshold_uncertainty_score":0.22389102},"labels":[],"label_agreement":null},{"id":"W1968457467","doi":"10.1111/j.1745-3984.2006.00019.x","title":"Testing Features of Graphical DIF: Application of a Regression Correction to Three Nonparametric Statistical Tests","year":2006,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":22,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Differential item functioning; Nonparametric statistics; Statistics; Statistical hypothesis testing; Context (archaeology); Mathematics; Statistical power; Item response theory; Matching (statistics); Test (biology); Regression analysis; Econometrics; Computer science; Psychometrics","score_opus":0.32495067350014345,"score_gpt":0.45965203750100464,"score_spread":0.1347013640008612,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1968457467","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.060679033,0.00010664005,0.9306547,0.00041954868,0.00015293426,0.001009731,0.00044926733,0.0018022147,0.004725803],"genre_scores_gemma":[0.51494485,0.00007352533,0.48082966,0.00016813463,0.00006683151,0.002129553,0.0004250572,0.00035160498,0.001010713],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8836843,0.08471628,0.005511287,0.008542153,0.015908742,0.001637338],"domain_scores_gemma":[0.5796313,0.3401114,0.020359457,0.03776416,0.020866567,0.0012671356],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.064742334,0.0018539486,0.0021054659,0.006680104,0.0015711242,0.0028783756,0.0036284474,0.0020157306,0.009785803],"category_scores_gemma":[0.43332267,0.0007167858,0.0034991314,0.00805457,0.0037336566,0.0034582664,0.0042259633,0.0038837607,0.0011304176],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019909306,0.0007305348,0.1222739,0.0009157629,0.0018562195,0.0015061247,0.003384214,0.04665831,0.006337458,0.117003866,0.0076494147,0.68969333],"study_design_scores_gemma":[0.0006746186,0.0031430132,0.15568432,0.00033573818,0.0008224499,0.0021594777,0.0016081885,0.6654788,0.011154523,0.14561641,0.012753172,0.00056927843],"about_ca_topic_score_codex":0.0035695117,"about_ca_topic_score_gemma":0.0024261293,"teacher_disagreement_score":0.064742334,"about_ca_system_score_codex":0.0017218951,"about_ca_system_score_gemma":0.0029062761,"threshold_uncertainty_score":0.3423943},"labels":[],"label_agreement":null},{"id":"W1991537194","doi":"10.1111/j.1745-3984.2007.00042.x","title":"Making Diagnostic Inferences About Cognitive Attributes Using the Rule‐Space Model and Attribute Hierarchy Method","year":2007,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Intelligent Tutoring Systems and Adaptive Learning","field":"Computer Science","cited_by":82,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Hierarchy; Computer science; Artificial intelligence; Cognition; Space (punctuation); Machine learning; Task (project management); Data mining; Psychology","score_opus":0.17552894455626744,"score_gpt":0.3829384330597237,"score_spread":0.20740948850345625,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1991537194","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.044502508,0.0001386641,0.9503236,0.00047187868,0.000034953708,0.00017139182,0.00011229639,0.00035034705,0.0038943402],"genre_scores_gemma":[0.42597654,0.0002044068,0.5723229,0.0001951576,0.000044377946,0.00037334944,0.00025023625,0.00006458972,0.0005685282],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.97450805,0.014427836,0.0015726874,0.0018594447,0.0070979763,0.0005339132],"domain_scores_gemma":[0.8798083,0.0941042,0.005371542,0.007992624,0.011504397,0.0012189843],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.022122867,0.00090378046,0.0010490062,0.0059780376,0.0008259345,0.005109258,0.0025289804,0.0014569756,0.0022835669],"category_scores_gemma":[0.16049342,0.0004916869,0.001356088,0.0033699644,0.0046178387,0.012577722,0.0030345574,0.0026283544,0.00056619477],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00041094908,0.0005558629,0.03832071,0.0006506504,0.00027745558,0.00031158316,0.009455105,0.030829089,0.0038396632,0.3760841,0.002337866,0.536927],"study_design_scores_gemma":[0.00012849309,0.00022557435,0.010917726,0.00023036827,0.000089729074,0.00033753243,0.0020095916,0.33177653,0.0050295787,0.64453095,0.004542942,0.00018096839],"about_ca_topic_score_codex":0.0041567395,"about_ca_topic_score_gemma":0.0023138358,"teacher_disagreement_score":0.022122867,"about_ca_system_score_codex":0.0015145823,"about_ca_system_score_gemma":0.0026033067,"threshold_uncertainty_score":0.116998315},"labels":[],"label_agreement":null},{"id":"W1991728049","doi":"10.1111/j.1745-3984.2009.00091.x","title":"The Hierarchy Consistency Index: Evaluating Person Fit for Cognitive Diagnostic Assessment","year":2009,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Cognitive Science and Mapping","field":"Computer Science","cited_by":66,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Statistic; Consistency (knowledge bases); Cognition; Hierarchy; Computer science; Item response theory; Goodness of fit; Psychology; Statistics; Cognitive psychology; Artificial intelligence; Mathematics; Machine learning; Psychometrics","score_opus":0.16528120416639475,"score_gpt":0.4007072928289228,"score_spread":0.23542608866252807,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1991728049","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.40158448,0.00093016267,0.5818649,0.00049637235,0.00026263806,0.0012242194,0.0015720834,0.0016938989,0.010371211],"genre_scores_gemma":[0.88083273,0.00016497256,0.11621759,0.000115396324,0.0000647169,0.0010605239,0.0010440064,0.00018727136,0.0003129323],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9690507,0.014476798,0.0033635318,0.0021436913,0.010351035,0.00061430165],"domain_scores_gemma":[0.852834,0.1089663,0.012116035,0.010548134,0.013925537,0.0016099929],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.040286276,0.0014248895,0.0014663489,0.011389187,0.0009375611,0.002314147,0.0014300606,0.0016482577,0.0017724474],"category_scores_gemma":[0.1837069,0.00047454116,0.0026999137,0.005963977,0.0014052673,0.0035114668,0.0025166986,0.0016835027,0.000424212],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007911876,0.00051541947,0.67039067,0.0005125803,0.0023640601,0.00028689767,0.0025716252,0.026284406,0.0029156634,0.0135265505,0.00456242,0.27527845],"study_design_scores_gemma":[0.00030542412,0.003031833,0.5715205,0.0004512722,0.00066003355,0.0014721787,0.0026479876,0.34320822,0.006256807,0.060071733,0.009700412,0.00067360763],"about_ca_topic_score_codex":0.0026223226,"about_ca_topic_score_gemma":0.0026454597,"teacher_disagreement_score":0.040286276,"about_ca_system_score_codex":0.0010774421,"about_ca_system_score_gemma":0.0018091473,"threshold_uncertainty_score":0.21305674},"labels":[],"label_agreement":null},{"id":"W1995404757","doi":"10.1111/j.1745-3984.2009.01067.x","title":"The Reliability of Difference Scores in Populations and Samples","year":2009,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Statistical Methods and Bayesian Inference","field":"Mathematics","cited_by":17,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"","keywords":"Reliability (semiconductor); Statistics; Population; Variance (accounting); Mathematics; Sample (material); Sample size determination; Standard deviation; Econometrics; Demography; Physics","score_opus":0.21340945573782985,"score_gpt":0.4190955226912946,"score_spread":0.20568606695346472,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1995404757","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6710046,0.0009633605,0.32280442,0.0002749214,0.00010194098,0.00022649554,0.00037897332,0.00031676955,0.0039285864],"genre_scores_gemma":[0.97423077,0.00016421691,0.024887014,0.000046897963,0.00002778729,0.00012690171,0.000295719,0.000035023866,0.00018573622],"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.924015,0.048473705,0.0039123273,0.009264891,0.013586608,0.0007474637],"domain_scores_gemma":[0.6228648,0.31581652,0.013355953,0.031854067,0.015314822,0.0007937996],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0680208,0.00048486408,0.001222443,0.0037408113,0.00060080114,0.0026392029,0.0015535627,0.0015514067,0.0010804309],"category_scores_gemma":[0.45201245,0.000879377,0.00088222674,0.00214699,0.0054341904,0.003381425,0.0037874542,0.0018719798,0.00037874133],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0018015358,0.00026394645,0.5846543,0.00095047505,0.002116921,0.0005371086,0.011804019,0.07848589,0.0062718256,0.102919236,0.0015985462,0.20859617],"study_design_scores_gemma":[0.0002631333,0.001351576,0.46519735,0.00058207836,0.0007287806,0.0024124174,0.0033281266,0.2423487,0.010449614,0.2657985,0.00711423,0.00042540175],"about_ca_topic_score_codex":0.001755256,"about_ca_topic_score_gemma":0.00080820173,"teacher_disagreement_score":0.9319792,"about_ca_system_score_codex":0.0011191112,"about_ca_system_score_gemma":0.0008857125,"threshold_uncertainty_score":0.3597327},"labels":[],"label_agreement":null},{"id":"W1996977567","doi":"10.1111/j.1745-3984.2001.tb01114.x","title":"Stability of School Academic Performance Across Subject Areas","year":2001,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"School Choice and Performance","field":"Social Sciences","cited_by":43,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Mathematics education; Context (archaeology); Subject (documents); Academic achievement; Multilevel model; Psychology; Reading (process); School climate; Statistical analysis; Multivariate analysis; Geography; Computer science; Mathematics; Political science; Statistics","score_opus":0.14201751776251245,"score_gpt":0.39514890735904357,"score_spread":0.25313138959653114,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1996977567","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99652344,0.0003756692,0.000473593,0.00006612086,0.000013491647,0.00001529603,0.0008017693,0.000035378755,0.0016950987],"genre_scores_gemma":[0.9989604,0.000052366206,0.00009639256,0.000012924971,0.0000065516874,0.000010437247,0.0006849952,0.000007534375,0.00016833331],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9954383,0.001018187,0.00050048396,0.001287676,0.0012911068,0.00046423718],"domain_scores_gemma":[0.9788093,0.0040840385,0.007390462,0.0030025213,0.0050859,0.0016278208],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003616924,0.00022363079,0.0006851017,0.0046038916,0.0008198137,0.001333556,0.0007528935,0.0004080116,0.0011957148],"category_scores_gemma":[0.01898141,0.00019293776,0.0004883689,0.004873426,0.00084888155,0.00096639694,0.0017789012,0.0006568879,0.00040063303],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013331728,0.000029376524,0.9895706,0.000020500336,0.00014287971,0.000025293399,0.00045153464,0.00017613666,0.00044996303,0.00010375298,0.00014886582,0.008747648],"study_design_scores_gemma":[6.749323e-7,0.000022728027,0.9996044,0.0000021337519,0.0000051200645,0.000011901488,0.000088309884,0.00006800664,0.000068391935,0.000031328775,0.00009468703,0.0000022856043],"about_ca_topic_score_codex":0.015672693,"about_ca_topic_score_gemma":0.016480058,"teacher_disagreement_score":0.015672693,"about_ca_system_score_codex":0.0010744843,"about_ca_system_score_gemma":0.00073227234,"threshold_uncertainty_score":0.031162918},"labels":[],"label_agreement":null},{"id":"W2024075312","doi":"10.1111/j.1745-3984.2009.00082.x","title":"Reliability and Attribute‐Based Scoring in Cognitive Diagnostic Assessment","year":2009,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":45,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Reliability (semiconductor); Variance (accounting); Cognition; Set (abstract data type); Strengths and weaknesses; Computer science; Test (biology); Sample (material); Psychology; Statistics; Natural language processing; Artificial intelligence; Mathematics; Social psychology","score_opus":0.5837310786203939,"score_gpt":0.5286242359275425,"score_spread":0.05510684269285138,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2024075312","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.26160362,0.0043197223,0.7141907,0.0010163835,0.00041799224,0.0009358364,0.0003291982,0.00046325586,0.016723279],"genre_scores_gemma":[0.85556984,0.0007489757,0.14192063,0.000118329786,0.00023217038,0.0007375018,0.0001881034,0.00008303639,0.00040142352],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.82553905,0.1314585,0.0073131016,0.0054982156,0.029154813,0.0010362525],"domain_scores_gemma":[0.5798919,0.33721533,0.017875466,0.025247294,0.038655307,0.0011147182],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.12864889,0.0009235752,0.0009249049,0.006987551,0.000955777,0.0022426238,0.00160036,0.0016015993,0.0006779776],"category_scores_gemma":[0.40795246,0.0006413809,0.0011979019,0.0056573944,0.0040092138,0.0027090427,0.0030552319,0.0026257406,0.00048483312],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00067493255,0.00035135212,0.33331794,0.00089405803,0.0010062024,0.00026606923,0.008039462,0.023226649,0.003143356,0.08456835,0.003926045,0.5405855],"study_design_scores_gemma":[0.0003134171,0.002561566,0.37041062,0.0020616078,0.0009383241,0.002693837,0.004757944,0.328522,0.011019801,0.2582112,0.0179132,0.00059654145],"about_ca_topic_score_codex":0.0026323425,"about_ca_topic_score_gemma":0.0019127424,"teacher_disagreement_score":0.12864889,"about_ca_system_score_codex":0.0014304862,"about_ca_system_score_gemma":0.0016975721,"threshold_uncertainty_score":0.68036854},"labels":[],"label_agreement":null},{"id":"W2108611097","doi":"10.1111/j.1745-3984.2004.tb01163.x","title":"The Attribute Hierarchy Method for Cognitive Assessment: A Variation on Tatsuoka's Rule‐Space Approach","year":2004,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Cognitive Science and Mapping","field":"Computer Science","cited_by":393,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Cognition; Space (punctuation); Hierarchy; Task (project management); Psychology; Syllogism; Domain (mathematical analysis); Variation (astronomy); Cognitive psychology; Computer science; Artificial intelligence; Mathematics; Epistemology","score_opus":0.07125507419111203,"score_gpt":0.36007366024041254,"score_spread":0.2888185860493005,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2108611097","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0017170749,0.00044368528,0.9931809,0.0002299856,0.00011486648,0.00057474914,0.00020210535,0.00050626637,0.0030304864],"genre_scores_gemma":[0.021374527,0.0004381928,0.9738349,0.00018840274,0.00005701102,0.0025136734,0.00023055976,0.00014492807,0.0012177277],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9587637,0.027121006,0.0026461205,0.0018801161,0.009136419,0.00045266698],"domain_scores_gemma":[0.9620858,0.026615622,0.0017105717,0.003498952,0.0056470516,0.000441952],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.027533708,0.0018947662,0.0018180073,0.007813892,0.0010905676,0.0038368478,0.0033778981,0.0019225423,0.006959303],"category_scores_gemma":[0.06946735,0.0008067979,0.0024394256,0.0074100113,0.0033178395,0.0050388933,0.0037958745,0.004622648,0.003233179],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001516427,0.00034267033,0.0056924666,0.0015468985,0.00035019786,0.00013321263,0.003818878,0.009675758,0.00427929,0.23316373,0.010532531,0.73031276],"study_design_scores_gemma":[0.00021921928,0.00073311216,0.015246256,0.0011955864,0.0001910271,0.0012018499,0.0019972108,0.09754455,0.005273029,0.72920126,0.14664556,0.00055129384],"about_ca_topic_score_codex":0.00295605,"about_ca_topic_score_gemma":0.0038262173,"teacher_disagreement_score":0.027533708,"about_ca_system_score_codex":0.0017273206,"about_ca_system_score_gemma":0.0035730035,"threshold_uncertainty_score":0.14561391},"labels":[],"label_agreement":null},{"id":"W2139990047","doi":"10.1111/j.1745-3984.2011.00158.x","title":"Estimating Classification Consistency and Accuracy for Cognitive Diagnostic Assessment","year":2012,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":90,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Consistency (knowledge bases); Reliability (semiconductor); Computation; Subtraction; Statistical inference; Fraction (chemistry); Inference; Sampling (signal processing); Computer science; Statistics; Cognitive test; Artificial intelligence; Cognition; Mathematics; Data mining; Pattern recognition (psychology); Algorithm; Psychology; Arithmetic","score_opus":0.7019996993223337,"score_gpt":0.5564925005972196,"score_spread":0.1455071987251142,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2139990047","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.041932877,0.00073592836,0.95225734,0.00031691845,0.000096587035,0.00031395533,0.00029304408,0.0006537765,0.003399593],"genre_scores_gemma":[0.49756086,0.00039084186,0.49863622,0.00023406571,0.00022474925,0.0011529757,0.0009064447,0.00031766293,0.00057613064],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.91276985,0.04862287,0.00713484,0.008315929,0.021995347,0.0011612182],"domain_scores_gemma":[0.5240027,0.38661727,0.023320291,0.039082654,0.025948832,0.001028326],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.10355454,0.00169812,0.0023886962,0.01376382,0.0015726103,0.005045421,0.0036012665,0.0029573417,0.0018574144],"category_scores_gemma":[0.51740426,0.00081049616,0.0020236503,0.006973857,0.004957703,0.0064581423,0.0052718963,0.0037154055,0.0008630933],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008542884,0.00034064244,0.17489964,0.0009191374,0.0022821273,0.0003230358,0.0025106668,0.08907442,0.0033439565,0.15807588,0.0057524214,0.5616237],"study_design_scores_gemma":[0.00017595301,0.00042669557,0.07021218,0.0005814144,0.0005332922,0.0010190186,0.00080644677,0.50728005,0.0082383305,0.4042968,0.006069818,0.00036009445],"about_ca_topic_score_codex":0.0021358074,"about_ca_topic_score_gemma":0.0014970647,"teacher_disagreement_score":0.10355454,"about_ca_system_score_codex":0.0023127836,"about_ca_system_score_gemma":0.002480052,"threshold_uncertainty_score":0.5476553},"labels":[],"label_agreement":null},{"id":"W2146894730","doi":"10.1111/j.1745-3984.2011.00142.x","title":"Using the Attribute Hierarchy Method to Make Diagnostic Inferences about Examinees’ Cognitive Skills in Critical Reading","year":2011,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":57,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Cognition; Reading (process); Psychology; Reading comprehension; Set (abstract data type); Test (biology); Sample (material); Cognitive psychology; Hierarchy; Comprehension; Natural language processing; Computer science; Artificial intelligence; Linguistics","score_opus":0.7841432219145653,"score_gpt":0.5727164674921034,"score_spread":0.21142675442246195,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2146894730","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5181855,0.0002239227,0.4738452,0.000333885,0.00007915948,0.0007196076,0.00045719015,0.00059284404,0.005562588],"genre_scores_gemma":[0.7599263,0.00009530682,0.23870742,0.000054090364,0.00002480349,0.0005987055,0.00026658675,0.00003863987,0.00028810458],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9807233,0.01271524,0.0015447176,0.0010738454,0.0035762703,0.00036652415],"domain_scores_gemma":[0.86337584,0.11204933,0.0075714285,0.007722528,0.008312535,0.00096839754],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.027508656,0.00070693996,0.00058018987,0.007300245,0.0009026969,0.0015014217,0.00089591515,0.00064871844,0.0017063373],"category_scores_gemma":[0.15613888,0.00038062278,0.00084580254,0.0034333596,0.0010524297,0.0028476461,0.0021132564,0.0014895388,0.00033603355],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00091785454,0.00061469234,0.5174929,0.0004183814,0.00043961976,0.00030459123,0.013408873,0.010123854,0.006253977,0.01928587,0.00266322,0.42807627],"study_design_scores_gemma":[0.00043240873,0.0020329987,0.46645492,0.00063932996,0.00046216612,0.0022572486,0.01223818,0.3471308,0.016968481,0.14214556,0.008839974,0.00039787483],"about_ca_topic_score_codex":0.0036858614,"about_ca_topic_score_gemma":0.0039904374,"teacher_disagreement_score":0.027508656,"about_ca_system_score_codex":0.0007873774,"about_ca_system_score_gemma":0.0013602019,"threshold_uncertainty_score":0.14548147},"labels":[],"label_agreement":null},{"id":"W2151713426","doi":"10.1111/j.1745-3984.2007.00052.x","title":"Using the Attribute Hierarchy Method to Identify and Interpret Cognitive Skills that Produce Group Differences","year":2008,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Multi-Criteria Decision Making","field":"Decision Sciences","cited_by":32,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Cognition; Set (abstract data type); Task (project management); Hierarchy; Test (biology); Psychology; Group (periodic table); Sample (material); Artificial intelligence; Natural language processing; Computer science; Cognitive psychology; Machine learning","score_opus":0.5348286662951659,"score_gpt":0.5307739533614363,"score_spread":0.0040547129337296095,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2151713426","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.378914,0.00023988898,0.6132509,0.00039086945,0.00011946127,0.00049817987,0.0004610039,0.0006888352,0.005436854],"genre_scores_gemma":[0.8218656,0.000081908765,0.17659323,0.00011258934,0.00004095327,0.00046843334,0.0002750712,0.00007128829,0.00049094507],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99451584,0.0029409016,0.00033104932,0.00057408714,0.0014336945,0.00020445914],"domain_scores_gemma":[0.960232,0.032294642,0.0025602384,0.0023934406,0.002076738,0.00044302223],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011288782,0.0008653685,0.0007057085,0.0045355735,0.0006938365,0.0014564458,0.00060995866,0.00069249317,0.0032534145],"category_scores_gemma":[0.044530302,0.0001861182,0.0010025306,0.0026446606,0.0011902086,0.0019555981,0.0013604078,0.0012109309,0.00038889027],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011167696,0.00081621436,0.40011486,0.00046914065,0.0012056201,0.0003757548,0.008261373,0.016235504,0.018690795,0.043269653,0.0024310988,0.50701326],"study_design_scores_gemma":[0.00034238488,0.0023182004,0.53121156,0.0002804834,0.0005271959,0.0012036613,0.004940471,0.23576303,0.016370157,0.20030694,0.006448251,0.00028768744],"about_ca_topic_score_codex":0.0017199231,"about_ca_topic_score_gemma":0.0010116753,"teacher_disagreement_score":0.011288782,"about_ca_system_score_codex":0.0005730412,"about_ca_system_score_gemma":0.00071067986,"threshold_uncertainty_score":0.059701502},"labels":[],"label_agreement":null},{"id":"W2153172866","doi":"10.1111/j.1745-3984.2006.00016.x","title":"Evaluating DETECT Classification Accuracy and Consistency When Data Display Complex Structure","year":2006,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Advanced Statistical Modeling Techniques","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Curse of dimensionality; Correlation; Consistency (knowledge bases); Sample (material); Sample size determination; Dimension (graph theory); Nonparametric statistics; Statistics; Computer science; Pattern recognition (psychology); Artificial intelligence; Data mining; Mathematics","score_opus":0.30124668597441207,"score_gpt":0.42667746295920894,"score_spread":0.12543077698479688,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2153172866","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8397788,0.0008048527,0.14903368,0.0007176889,0.00021725893,0.00058725965,0.0012513995,0.0008935242,0.0067156893],"genre_scores_gemma":[0.9492918,0.00017894752,0.04730465,0.000257047,0.00005349113,0.00047712284,0.001371107,0.00019972921,0.0008660383],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.95276153,0.024754418,0.004813812,0.005639229,0.011093303,0.0009378019],"domain_scores_gemma":[0.6071247,0.3350248,0.01799477,0.025438711,0.013262876,0.0011542155],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07423042,0.0014371189,0.0021261768,0.004969912,0.0009607854,0.0036421556,0.0017221943,0.0022535417,0.0015094574],"category_scores_gemma":[0.28857526,0.0006763989,0.0022011758,0.0032631704,0.0019854486,0.004076316,0.0031035375,0.001888467,0.00075796904],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0045871544,0.00084482797,0.7039278,0.0007354329,0.0025422922,0.000372561,0.0027774118,0.06279698,0.0066237934,0.0055305087,0.0050488207,0.20421238],"study_design_scores_gemma":[0.00063587475,0.0040716208,0.446038,0.00033552886,0.0011668243,0.0014063015,0.0024677513,0.49148482,0.025990315,0.017841596,0.008140066,0.00042132896],"about_ca_topic_score_codex":0.0015111127,"about_ca_topic_score_gemma":0.0017216164,"teacher_disagreement_score":0.07423042,"about_ca_system_score_codex":0.0011289126,"about_ca_system_score_gemma":0.0010303265,"threshold_uncertainty_score":0.39257264},"labels":[],"label_agreement":null},{"id":"W2153713169","doi":"10.1111/j.1745-3984.2003.tb01148.x","title":"Identifying Content and Cognitive Skills that Produce Gender Differences in Mathematics: A Demonstration of the Multidimensionality‐Based DIF Analysis Paradigm","year":2003,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Cognitive and developmental aspects of mathematical skills","field":"Mathematics","cited_by":65,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Cognition; Curriculum; Psychology; Mathematics education; Content analysis; Test (biology); Strengths and weaknesses; Social psychology; Pedagogy; Social science","score_opus":0.19225883755504722,"score_gpt":0.3347692788854235,"score_spread":0.1425104413303763,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2153713169","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.34491146,0.00082359364,0.61996955,0.0027476563,0.0002767287,0.0014591294,0.0012413965,0.00029632848,0.02827415],"genre_scores_gemma":[0.6771537,0.0002686685,0.3185329,0.00062118843,0.00008719527,0.0020160535,0.00029887375,0.00007975228,0.0009415932],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.9739986,0.017303031,0.0016179121,0.001988311,0.004556136,0.0005360515],"domain_scores_gemma":[0.8878945,0.08726515,0.005413227,0.01002274,0.0084681995,0.0009362372],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.050593074,0.0011766141,0.00093675393,0.0061866455,0.0016161527,0.0024572508,0.0009688728,0.0009340945,0.003349516],"category_scores_gemma":[0.101551205,0.00042669408,0.0013407597,0.0033523317,0.0036171388,0.0023514647,0.0048609753,0.001987621,0.00049321906],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008773472,0.00070716947,0.32588974,0.0010062179,0.00049255,0.00081875996,0.073223144,0.0018683604,0.014998595,0.16537029,0.0051541254,0.40959367],"study_design_scores_gemma":[0.00043682562,0.0015245272,0.44210407,0.00079596596,0.0003634254,0.00363427,0.020280203,0.04329656,0.015035285,0.44055185,0.031498827,0.00047820967],"about_ca_topic_score_codex":0.0015680455,"about_ca_topic_score_gemma":0.0014663711,"teacher_disagreement_score":0.050593074,"about_ca_system_score_codex":0.000998655,"about_ca_system_score_gemma":0.0012827024,"threshold_uncertainty_score":0.26756495},"labels":[],"label_agreement":null},{"id":"W2166083835","doi":"10.1111/j.1745-3984.2001.tb01121.x","title":"Identifying Sources of Differential Item and Bundle Functioning on Translated Achievement Tests: A Confirmatory Analysis","year":2001,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Educational and Psychological Assessments","field":"Psychology","cited_by":118,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Social Sciences and Humanities Research Council of Canada; International Association for the Evaluation of Educational Achievement; University of Alberta","keywords":"Differential item functioning; Psychology; Categorization; Item analysis; Set (abstract data type); Achievement test; Test (biology); Item response theory; Social psychology; Standardized test; Mathematics education; Psychometrics; Developmental psychology; Computer science; Artificial intelligence","score_opus":0.11509247209283534,"score_gpt":0.37727077187965863,"score_spread":0.2621782997868233,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2166083835","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.863367,0.00061291223,0.11447777,0.00074097584,0.00019622545,0.007724663,0.0026395165,0.0005187097,0.00972214],"genre_scores_gemma":[0.90020585,0.00025758252,0.088029265,0.00022858361,0.00006980507,0.005702074,0.0034116965,0.00027741725,0.0018176782],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.91796046,0.042946845,0.008736846,0.006432729,0.021972647,0.001950527],"domain_scores_gemma":[0.66316223,0.15117405,0.01639113,0.03211689,0.13543776,0.0017179911],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.10632983,0.0022207596,0.0017531777,0.00894666,0.0022931155,0.0033500907,0.0017107079,0.0009027468,0.0030894144],"category_scores_gemma":[0.23184796,0.0014166253,0.003897454,0.008528724,0.0020161786,0.0019284666,0.0033292973,0.0025880593,0.0011774786],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009207714,0.0008689326,0.8290794,0.001294017,0.0022289928,0.0008928998,0.02424778,0.0015051112,0.008416957,0.004312888,0.0033200653,0.12291215],"study_design_scores_gemma":[0.0004708767,0.0030972178,0.9028767,0.0011788589,0.0031377084,0.00097514474,0.025925972,0.027049346,0.016881883,0.0056509436,0.012507668,0.00024765526],"about_ca_topic_score_codex":0.008159914,"about_ca_topic_score_gemma":0.011524146,"teacher_disagreement_score":0.10632983,"about_ca_system_score_codex":0.0020301319,"about_ca_system_score_gemma":0.0073382957,"threshold_uncertainty_score":0.56233263},"labels":[],"label_agreement":null},{"id":"W2171625237","doi":"10.1111/j.1745-3984.2007.00024.x","title":"An Investigation into the Dimensionality of TOEFL Using Conditional Covariance‐Based Nonparametric Approach","year":2007,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":82,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Test of English as a Foreign Language; Reading comprehension; Curse of dimensionality; Psychology; Covariance; Nonparametric statistics; Natural language processing; Computer science; Reading (process); Artificial intelligence; Statistics; Mathematics education; Mathematics; Linguistics; Language assessment","score_opus":0.6245000768597356,"score_gpt":0.5087043214551444,"score_spread":0.1157957554045912,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2171625237","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5296407,0.0001265546,0.46463466,0.00035196528,0.000022116976,0.00029152745,0.00020762427,0.00010491535,0.0046200217],"genre_scores_gemma":[0.9193838,0.000063757245,0.07963959,0.000046805417,0.000015366728,0.00038280297,0.00020277071,0.000022737077,0.00024236974],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9851901,0.009948391,0.0006062987,0.0010753898,0.0028764217,0.00030342597],"domain_scores_gemma":[0.7991765,0.17364098,0.007003104,0.012606949,0.007066263,0.0005061703],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.023061838,0.00040811507,0.00054743234,0.0015888566,0.0008350664,0.0017928248,0.00078779424,0.00045498658,0.0018147108],"category_scores_gemma":[0.13976693,0.00024609154,0.00080933975,0.0016122852,0.00210804,0.0020406428,0.0023286585,0.00128944,0.00013219366],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00061083323,0.0004146124,0.42966202,0.00051382504,0.0004827114,0.000542769,0.016757553,0.023423275,0.012272178,0.20595837,0.0018432061,0.30751866],"study_design_scores_gemma":[0.00009790945,0.0009090285,0.4606661,0.00026790003,0.00019216487,0.0015454965,0.007533888,0.32152557,0.012826527,0.18588191,0.008219657,0.00033382504],"about_ca_topic_score_codex":0.002110985,"about_ca_topic_score_gemma":0.0021338551,"teacher_disagreement_score":0.023061838,"about_ca_system_score_codex":0.00086758577,"about_ca_system_score_gemma":0.0019634399,"threshold_uncertainty_score":0.12196416},"labels":[],"label_agreement":null},{"id":"W2258138870","doi":"10.1111/jedm.12095","title":"Rutkowski, L., vonDavier, M., &amp; Rutkowski, D. (Eds.). (2014). Handbook of International Large‐Scale Assessments: Background, Technical Issues, and Methods of Data Analysis. Boca Raton, FL: CRC Press.","year":2015,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Educational Assessment and Pedagogy","field":"Social Sciences","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria","funders":"","keywords":"Library science; Curriculum; Christian ministry; Citation; Sociology; Political science; Computer science; Law; Pedagogy","score_opus":0.2646006784507445,"score_gpt":0.5359710732399001,"score_spread":0.27137039478915564,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2258138870","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0028380821,0.89798677,0.053516492,0.012615882,0.003392748,0.00034622464,0.0040219356,0.0017017804,0.023580182],"genre_scores_gemma":[0.011089221,0.9090179,0.06008702,0.00066319713,0.0007785491,0.0003375878,0.0018270824,0.0003943084,0.015805153],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99695456,0.00087379996,0.00052542996,0.00029537966,0.0012368382,0.00011405409],"domain_scores_gemma":[0.98891324,0.006643809,0.0015963947,0.0005935329,0.0018499686,0.000402938],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007822851,0.0026032373,0.0020327314,0.008295077,0.0008133197,0.0049257465,0.0022825098,0.0016513892,0.01974174],"category_scores_gemma":[0.01788167,0.0030988245,0.0012587263,0.007864966,0.0022874528,0.007100932,0.0017811831,0.0041769054,0.015158146],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00005351301,0.00006776856,0.0012055082,0.0028432175,0.00006335463,0.000062300714,0.0006509589,0.00051883527,0.00043649873,0.0039551696,0.2482828,0.7418601],"study_design_scores_gemma":[0.000033996985,0.00017197029,0.013800272,0.0081465645,0.00033772254,0.0014720786,0.001263169,0.001221529,0.0029194884,0.021754414,0.94865125,0.00022754633],"about_ca_topic_score_codex":0.014205809,"about_ca_topic_score_gemma":0.031812023,"teacher_disagreement_score":0.01974174,"about_ca_system_score_codex":0.0024550555,"about_ca_system_score_gemma":0.006545411,"threshold_uncertainty_score":0.06604272},"labels":[],"label_agreement":null},{"id":"W2920811067","doi":"10.1111/jedm.12205","title":"Modeling Response Styles in Cross‐Country Self‐Reports: An Application of a Multilevel Multidimensional Nominal Response Model","year":2019,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":16,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Comparability; Psychology; Multilevel model; Structural equation modeling; Econometrics; Social psychology; Cross-cultural; Computer science; Statistics; Mathematics; Political science","score_opus":0.35009938784928696,"score_gpt":0.4756613456886337,"score_spread":0.12556195783934676,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2920811067","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.2994718,0.000119878365,0.69521236,0.0008624285,0.0001345345,0.0009686263,0.001351019,0.0004388809,0.0014405353],"genre_scores_gemma":[0.8261194,0.000053862008,0.1700528,0.0001634994,0.000027322034,0.0018333659,0.0011164993,0.00007281319,0.00056042784],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.90108263,0.08632831,0.0029098645,0.0054472075,0.0033818318,0.0008501815],"domain_scores_gemma":[0.75009847,0.20637384,0.013640135,0.01890544,0.010056013,0.0009260858],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08161074,0.0011062736,0.0012186848,0.002214247,0.0012480047,0.0025061092,0.0029652242,0.0014832675,0.0047810134],"category_scores_gemma":[0.20331852,0.0007954191,0.004051659,0.0028360174,0.0014787631,0.0020630527,0.0033859373,0.003395799,0.0009324734],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013165439,0.000859368,0.64239556,0.0007921098,0.005026666,0.00047749953,0.009562686,0.1742573,0.0017627396,0.04212899,0.0041526714,0.11726783],"study_design_scores_gemma":[0.00023059212,0.0010947094,0.09044692,0.0003089618,0.00058381073,0.0002446085,0.0029830667,0.8490579,0.0017245264,0.048955645,0.004076416,0.00029285075],"about_ca_topic_score_codex":0.009676145,"about_ca_topic_score_gemma":0.0070885033,"teacher_disagreement_score":0.08161074,"about_ca_system_score_codex":0.0019908121,"about_ca_system_score_gemma":0.0015367599,"threshold_uncertainty_score":0.43160403},"labels":[],"label_agreement":null},{"id":"W2956271099","doi":"10.1111/jedm.12207","title":"Performance of Person‐Fit Statistics Under Model Misspecification","year":2019,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Statistic; Econometrics; Item response theory; Inference; Latent variable; Latent variable model; Parametric statistics; Statistics; Statistical inference; Goodness of fit; Parametric model; Computer science; Variable (mathematics); Specification; Empirical research; Aggregate (composite); Mathematics; Psychometrics; Artificial intelligence","score_opus":0.7529540980675968,"score_gpt":0.4796196803409436,"score_spread":0.27333441772665323,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2956271099","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.66695076,0.0006071152,0.32760134,0.00043362752,0.00012917923,0.00024125884,0.0003847898,0.0009813119,0.0026705377],"genre_scores_gemma":[0.97353697,0.00004030173,0.025662716,0.00006388922,0.000012001316,0.00011367674,0.00034102972,0.000101883816,0.00012749831],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.85148287,0.12113853,0.006607599,0.0098309675,0.009398459,0.0015416037],"domain_scores_gemma":[0.21685298,0.73062575,0.019129489,0.025159488,0.0070060804,0.0012262654],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.15464807,0.0012456795,0.0018194207,0.0045532747,0.0011071207,0.002518932,0.0018983803,0.0027915095,0.0018921528],"category_scores_gemma":[0.5015508,0.00058546016,0.0022376997,0.003975161,0.004038498,0.0054302956,0.0032035764,0.0035202776,0.00039475245],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0064974627,0.0009333358,0.3576297,0.00073535554,0.005174615,0.001493058,0.0046839723,0.34272835,0.0039692027,0.05869642,0.0039541544,0.21350445],"study_design_scores_gemma":[0.00022435938,0.0025567177,0.06484885,0.00020711793,0.00038456556,0.0008094183,0.0015645447,0.87081456,0.008026956,0.048543386,0.0017619468,0.00025766043],"about_ca_topic_score_codex":0.0037416627,"about_ca_topic_score_gemma":0.0015725797,"teacher_disagreement_score":0.84535193,"about_ca_system_score_codex":0.001904218,"about_ca_system_score_gemma":0.0025676116,"threshold_uncertainty_score":0.8178669},"labels":[],"label_agreement":null},{"id":"W2969964033","doi":"10.1111/jedm.12237","title":"Students’ Interpretation of Formative Assessment Feedback: Three Claims for Why We Know So Little About Something So Important","year":2019,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":45,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Formative assessment; Psychology; Interpretation (philosophy); Cognition; Process (computing); Mathematics education; Cognitive psychology; Computer science","score_opus":0.044221159940934986,"score_gpt":0.39151100053294274,"score_spread":0.34728984059200774,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2969964033","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7810838,0.0038344292,0.07590194,0.11321128,0.0011800526,0.00031016622,0.00010309841,0.00037771874,0.023997579],"genre_scores_gemma":[0.9909039,0.00038403049,0.0049053784,0.003014287,0.00008412426,0.00012920407,0.00001925099,0.000031066458,0.00052877615],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.82357866,0.104013816,0.014593094,0.007272645,0.047078315,0.003463482],"domain_scores_gemma":[0.39959356,0.44673845,0.054775428,0.04046233,0.05357383,0.004856498],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.16298364,0.00087573676,0.0012022514,0.0032321804,0.0031632232,0.011701284,0.004797573,0.006133221,0.0016648823],"category_scores_gemma":[0.45110956,0.0009209597,0.00111679,0.0016323373,0.037860185,0.012059464,0.009296358,0.009498495,0.00039989545],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014448323,0.0006019319,0.090501696,0.0015757732,0.00031123517,0.0007102685,0.70345336,0.00057890895,0.003211124,0.06146973,0.004617074,0.13152416],"study_design_scores_gemma":[0.00042704245,0.0018583636,0.08856123,0.006809203,0.0005060669,0.0023560068,0.51605445,0.010410075,0.018067623,0.3194277,0.0346782,0.00084399804],"about_ca_topic_score_codex":0.0020134193,"about_ca_topic_score_gemma":0.002004466,"teacher_disagreement_score":0.16298364,"about_ca_system_score_codex":0.0054032393,"about_ca_system_score_gemma":0.006995072,"threshold_uncertainty_score":0.86195016},"labels":[],"label_agreement":null},{"id":"W4308426657","doi":"10.1111/jedm.12347","title":"A Unified Comparison of IRT‐Based Effect Sizes for DIF Investigations","year":2022,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Differential item functioning; Estimator; Statistics; Item response theory; Sample size determination; Differential (mechanical device); Population; Sample (material); Monte Carlo method; Econometrics; Computer science; Mathematics; Psychometrics","score_opus":0.6842492147562678,"score_gpt":0.529819503327333,"score_spread":0.1544297114289348,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4308426657","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.110828936,0.0033755861,0.8689085,0.0006394912,0.00037571133,0.0027114467,0.0010938699,0.0009651435,0.011101267],"genre_scores_gemma":[0.62867826,0.0005624779,0.36399654,0.0002993806,0.00011402448,0.004834724,0.0006942198,0.00035895637,0.00046142036],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.69386154,0.26511586,0.012570596,0.007918072,0.019476015,0.0010578948],"domain_scores_gemma":[0.3614603,0.5787924,0.013877929,0.028600534,0.016227141,0.0010416945],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2831473,0.0016851408,0.0027957668,0.009645748,0.0007734505,0.004376698,0.0031765066,0.0023723308,0.0067074047],"category_scores_gemma":[0.57859963,0.000814014,0.0042007514,0.0049329223,0.005442849,0.006470828,0.0045952178,0.0026558014,0.0006767204],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.006689505,0.00087882415,0.082348004,0.0061443336,0.0074505648,0.00032283535,0.008059801,0.036177818,0.00784832,0.29274035,0.0061204024,0.5452193],"study_design_scores_gemma":[0.0028773192,0.018009432,0.24652013,0.0054751993,0.0072409925,0.0016635646,0.007087232,0.3160987,0.02077991,0.34537485,0.027568119,0.00130457],"about_ca_topic_score_codex":0.00040623583,"about_ca_topic_score_gemma":0.0002944522,"teacher_disagreement_score":0.2831473,"about_ca_system_score_codex":0.0018090636,"about_ca_system_score_gemma":0.0012461885,"threshold_uncertainty_score":0.884007},"labels":[],"label_agreement":null},{"id":"W4388574245","doi":"10.1111/jedm.12380","title":"Incorporating Test‐Taking Engagement into Multistage Adaptive Testing Design for Large‐Scale Assessments","year":2023,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Operationalization; Computerized adaptive testing; Test (biology); Item response theory; Premise; Scale (ratio); Computer science; Test design; Reliability (semiconductor); Psychology; Applied psychology; Reliability engineering; Psychometrics; Statistics; Test method; Mathematics; Engineering; Clinical psychology","score_opus":0.8135852760237042,"score_gpt":0.547201763889805,"score_spread":0.2663835121338992,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4388574245","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09671128,0.000058739002,0.89897305,0.00009943646,0.000038300648,0.0028235675,0.00005767325,0.00041894347,0.0008189985],"genre_scores_gemma":[0.38604656,0.000035650355,0.60736144,0.00005798008,0.000014511453,0.0060628382,0.00009207285,0.000043624397,0.0002852839],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.93996567,0.0535828,0.0015015772,0.0019673805,0.0025243904,0.00045806394],"domain_scores_gemma":[0.85393107,0.12376032,0.007735856,0.0073036957,0.006039959,0.0012291558],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0544481,0.001120078,0.0010137188,0.0014305387,0.00059344113,0.0013745368,0.002086142,0.0010623469,0.0027852922],"category_scores_gemma":[0.11438338,0.0009288852,0.0011870589,0.0010149408,0.0013521584,0.0014451563,0.0021513638,0.0017956755,0.00030537776],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0073392703,0.004464655,0.086901076,0.0011417397,0.0014985973,0.00029759752,0.004118375,0.34920198,0.017759977,0.03776472,0.0018348298,0.4876771],"study_design_scores_gemma":[0.0005078462,0.005707873,0.019638615,0.00011325011,0.0001653675,0.000057342142,0.0001965099,0.9477413,0.004967511,0.018936584,0.0018598391,0.00010793527],"about_ca_topic_score_codex":0.0016054034,"about_ca_topic_score_gemma":0.0027180612,"teacher_disagreement_score":0.0544481,"about_ca_system_score_codex":0.0014644838,"about_ca_system_score_gemma":0.002019703,"threshold_uncertainty_score":0.28795248},"labels":[],"label_agreement":null},{"id":"W4399234968","doi":"10.1111/jedm.12401","title":"Modeling Response Styles in Cross‐Classified Data Using a Cross‐Classified Multidimensional Nominal Response Model","year":2024,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Covariate; Item response theory; Cross-validation; Computer science; Data set; Statistics; Multilevel model; Set (abstract data type); Econometrics; Psychology; Mathematics; Psychometrics","score_opus":0.8252373857984466,"score_gpt":0.5741859983791489,"score_spread":0.2510513874192978,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4399234968","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.13933955,0.00012512822,0.8573038,0.00056294625,0.00012440406,0.00048669457,0.0005661221,0.000450153,0.0010412192],"genre_scores_gemma":[0.7150561,0.00007145038,0.28081515,0.00030368482,0.000054744993,0.0013128114,0.0009730661,0.000095784024,0.001317138],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9221564,0.06459911,0.0024895878,0.0067566647,0.0031098356,0.0008884183],"domain_scores_gemma":[0.8190155,0.12976564,0.013008202,0.027548809,0.0094014825,0.001260408],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07947585,0.0012967342,0.0017531894,0.0020680113,0.0010072034,0.003086992,0.0042362497,0.0025122054,0.0062938733],"category_scores_gemma":[0.1645372,0.0008902518,0.0037177522,0.0026021565,0.0019596647,0.003366494,0.003079965,0.0039959922,0.0012511977],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0016602937,0.0017255031,0.3250718,0.0007911224,0.0027528272,0.00067824795,0.0055948333,0.31391826,0.003512091,0.13823,0.0048757717,0.20118931],"study_design_scores_gemma":[0.00009885678,0.00048461792,0.025157863,0.00012658258,0.00014150831,0.00017527603,0.00068663206,0.9242594,0.0010797867,0.045410734,0.0022586887,0.00012013779],"about_ca_topic_score_codex":0.0040001813,"about_ca_topic_score_gemma":0.0036076356,"teacher_disagreement_score":0.07947585,"about_ca_system_score_codex":0.0021576376,"about_ca_system_score_gemma":0.0014281016,"threshold_uncertainty_score":0.42031348},"labels":[],"label_agreement":null},{"id":"W4400898279","doi":"10.1111/jedm.12406","title":"Using Automated Procedures to Score Educational Essays Written in Three Languages","year":2024,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Mathematics education; Natural language processing; Computer science; Psychology; Linguistics; Artificial intelligence; Philosophy","score_opus":0.0603400789110201,"score_gpt":0.3634531269538653,"score_spread":0.30311304804284517,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4400898279","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7465224,0.00038071183,0.22352445,0.00025225722,0.00020959828,0.001177902,0.00218063,0.011978339,0.013773814],"genre_scores_gemma":[0.818852,0.0001523614,0.17244616,0.00006588506,0.00007373051,0.00044008764,0.0021063606,0.0002581722,0.005605296],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99204636,0.0033618375,0.0008698298,0.0012341252,0.0022627325,0.00022518815],"domain_scores_gemma":[0.9688612,0.013045206,0.003167753,0.0021006821,0.011953738,0.0008714346],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0051577147,0.0010326157,0.00066085794,0.0036925934,0.00049697276,0.002299851,0.001045723,0.00060586317,0.0041193063],"category_scores_gemma":[0.03298691,0.00024844366,0.0003722198,0.0014650179,0.00036991216,0.00129249,0.0015576427,0.0006799394,0.0026914722],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008439936,0.0005127,0.040037744,0.00046916495,0.0001557472,0.00033054658,0.0013105095,0.0066188076,0.046464965,0.00097355363,0.004463994,0.8978182],"study_design_scores_gemma":[0.0005791047,0.0028786703,0.2662421,0.0004202122,0.0003353503,0.0021288912,0.005289431,0.47172955,0.21026033,0.0058657955,0.033754904,0.00051570777],"about_ca_topic_score_codex":0.0022502409,"about_ca_topic_score_gemma":0.004657552,"teacher_disagreement_score":0.0051577147,"about_ca_system_score_codex":0.00061444734,"about_ca_system_score_gemma":0.001010972,"threshold_uncertainty_score":0.027276874},"labels":[],"label_agreement":null},{"id":"W4403847593","doi":"10.1111/jedm.12420","title":"Algorithmic Bias in BERT for Response Accuracy Prediction: A Case Study for Investigating Population Validity","year":2024,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University of Edmonton; University of Alberta","funders":"","keywords":"Item response theory; Population; Psychology; Test validity; Predictive validity; Statistics; Computer science; Econometrics; Psychometrics; Mathematics; Clinical psychology; Demography","score_opus":0.3090948321123259,"score_gpt":0.41355177989540626,"score_spread":0.10445694778308035,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4403847593","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.92556554,0.0002005982,0.069655,0.0010384992,0.000071271446,0.00019332042,0.00037784158,0.00025749757,0.0026404134],"genre_scores_gemma":[0.98348385,0.000023260194,0.015697556,0.00012374591,0.000018024723,0.00009938664,0.00027148123,0.000039132814,0.00024347863],"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.96701986,0.02681012,0.0010958107,0.002762471,0.001809713,0.0005019567],"domain_scores_gemma":[0.75890124,0.20263779,0.008372414,0.019816155,0.009201323,0.0010710986],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.052742124,0.00062341295,0.00069881324,0.001080537,0.0009960097,0.0019747803,0.0016844623,0.0014787264,0.0015587371],"category_scores_gemma":[0.18543008,0.00032851848,0.0008627902,0.0016663389,0.0018642695,0.0020048984,0.0017412861,0.0027394148,0.00046672617],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012337862,0.0009111991,0.78721535,0.00015076905,0.00044411092,0.000671887,0.004194601,0.08539019,0.0011014024,0.012345524,0.0039975075,0.102343656],"study_design_scores_gemma":[0.00016049476,0.000753551,0.15340105,0.00023119531,0.00019806554,0.00066040386,0.0022997214,0.7998552,0.007226409,0.028943168,0.006122136,0.00014869466],"about_ca_topic_score_codex":0.008060279,"about_ca_topic_score_gemma":0.008064169,"teacher_disagreement_score":0.052742124,"about_ca_system_score_codex":0.0022965653,"about_ca_system_score_gemma":0.0016381603,"threshold_uncertainty_score":0.27893037},"labels":[],"label_agreement":null},{"id":"W4406376912","doi":"10.1111/jedm.12424","title":"Using Multilabel Neural Network to Score High‐Dimensional Assessments for Different Use Foci: An Example with College Major Preference Assessment","year":2025,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Advanced Text Analysis Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Preference; Artificial neural network; Artificial intelligence; Psychology; Machine learning; Computer science; Evaluation methods; Statistics; Mathematics; Reliability engineering","score_opus":0.23328784592740195,"score_gpt":0.3977295805474502,"score_spread":0.16444173462004827,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4406376912","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.842434,0.00030276133,0.1450103,0.0006970361,0.00015738406,0.0002564804,0.00096690434,0.0015666175,0.008608528],"genre_scores_gemma":[0.93482476,0.000057874888,0.06269716,0.00007884552,0.000018044175,0.00009417657,0.00047728757,0.000035678746,0.001716202],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9985649,0.0007206277,0.00010101139,0.00023456126,0.00030073914,0.00007819398],"domain_scores_gemma":[0.9949344,0.0030587225,0.00027545623,0.00043750956,0.0010793246,0.0002147515],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0027685766,0.0006699571,0.00040485666,0.0012165074,0.000385263,0.0008630711,0.00037684833,0.0005529083,0.002456608],"category_scores_gemma":[0.010534732,0.000107431995,0.00034277805,0.0010204382,0.00024241237,0.0008844138,0.00080799777,0.00076910935,0.0006899665],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008671696,0.0006704953,0.13475047,0.00019840058,0.0001957039,0.00034978343,0.0007296992,0.03269896,0.013855819,0.0017899547,0.007876349,0.8060172],"study_design_scores_gemma":[0.0000643161,0.000513527,0.099749275,0.000068604975,0.00009061274,0.00025462534,0.0010867413,0.8698592,0.0152359065,0.008103236,0.0048785596,0.00009544262],"about_ca_topic_score_codex":0.006222336,"about_ca_topic_score_gemma":0.014663607,"teacher_disagreement_score":0.006222336,"about_ca_system_score_codex":0.0006062814,"about_ca_system_score_gemma":0.00046953405,"threshold_uncertainty_score":0.014641821},"labels":[],"label_agreement":null},{"id":"W4409353748","doi":"10.1111/jedm.12433","title":"Theory‐Driven IRT Modeling of Vocabulary Development: Matthew Effects and the Case for Unipolar IRT","year":2025,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Reading and Literacy Development","field":"Psychology","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Item response theory; Vocabulary; Psychology; Econometrics; Psychometrics; Natural language processing; Mathematics education; Computer science; Linguistics; Mathematics; Developmental psychology; Philosophy","score_opus":0.031951753387429026,"score_gpt":0.32159032015469335,"score_spread":0.28963856676726435,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4409353748","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.14353609,0.00032757502,0.8437998,0.0016648441,0.00007495825,0.00013556537,0.0002363808,0.0003228962,0.009901877],"genre_scores_gemma":[0.903881,0.00016498605,0.092672534,0.00026983197,0.00004673441,0.00022633848,0.00014503826,0.00008855668,0.0025048347],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99289167,0.0050519384,0.00023253213,0.00089958304,0.0006376204,0.00028659008],"domain_scores_gemma":[0.95721596,0.03248308,0.0033464709,0.003935016,0.0024144847,0.0006050644],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0148078455,0.0006319998,0.0008315068,0.001348655,0.00051778206,0.0025066242,0.0025471007,0.0010702835,0.003550506],"category_scores_gemma":[0.057973336,0.0005493956,0.0011976018,0.0010837023,0.0021835598,0.002018278,0.0018239425,0.0021845128,0.00053077505],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020756669,0.00020263005,0.05799901,0.00022320171,0.00029962693,0.0005124057,0.0023799012,0.26576063,0.0013761239,0.5894811,0.0029401972,0.07861752],"study_design_scores_gemma":[0.000020854473,0.000116130024,0.009257175,0.00008265002,0.00005688025,0.00019792402,0.00025742862,0.8021434,0.00031096433,0.1856209,0.0018858163,0.000049782124],"about_ca_topic_score_codex":0.007877668,"about_ca_topic_score_gemma":0.006594165,"teacher_disagreement_score":0.0148078455,"about_ca_system_score_codex":0.0014615476,"about_ca_system_score_gemma":0.0011364435,"threshold_uncertainty_score":0.07831234},"labels":[],"label_agreement":null}]}