{"meta":{"query_hash":"e5913b510d38","filters":{"venue":"Applied Psychological Measurement"},"cohort_total":34,"direct_labels_cover":1,"predictions_cover":34,"exported":34,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/e5913b510d38","api":"https://metacan.xera.ac/api/v1/cohort?venue=Applied+Psychological+Measurement"},"results":[{"id":"W1942728350","doi":"10.1177/0146621608316603","title":"Computer Software Review: Conducting Automated Test Assembly Using the Premium Solver Platform Version 7.0 With Microsoft Excel and the Large-Scale LP/QP Solver Engine Add-In","year":2008,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Manufacturing Process and Optimization","field":"Engineering","cited_by":14,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Solver; Computer science; Microsoft excel; Scale (ratio); Software; Test (biology); Programming language; Computational science; Software engineering; Operating system; Cartography","score_opus":0.04766665868336487,"score_gpt":0.24687560586079704,"score_spread":0.19920894717743218,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1942728350","genre_codex":"methods","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02787815,0.07107179,0.62676454,0.026134046,0.019180583,0.005615072,0.022871152,0.07734317,0.123141415],"genre_scores_gemma":[0.11046432,0.06668252,0.5208767,0.0068442808,0.009171831,0.004739448,0.039773863,0.028361896,0.21308511],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9908564,0.002249602,0.0015317373,0.0005276205,0.004662689,0.0001719337],"domain_scores_gemma":[0.8873472,0.02898402,0.005102083,0.0066120783,0.07037739,0.0015772659],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009237908,0.000671649,0.0013262086,0.0071471594,0.00054954254,0.0015103078,0.001788403,0.0006626453,0.056000035],"category_scores_gemma":[0.065158434,0.00059421,0.00074514473,0.0064984546,0.0006348281,0.0012007471,0.00090579,0.0009991551,0.040530298],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00012236439,0.000038189093,0.0008291856,0.0021906614,0.0000791165,0.000088343695,0.00006295127,0.00051682326,0.0029657332,0.0013216361,0.44898108,0.54280394],"study_design_scores_gemma":[0.0001555921,0.00024997286,0.009652043,0.0011464708,0.00025753374,0.0009894853,0.00009932523,0.00579053,0.010683563,0.002501794,0.96838766,0.00008614117],"about_ca_topic_score_codex":0.0041567273,"about_ca_topic_score_gemma":0.007083481,"teacher_disagreement_score":0.056000035,"about_ca_system_score_codex":0.0011167715,"about_ca_system_score_gemma":0.0067453603,"threshold_uncertainty_score":0.18733877},"labels":[],"label_agreement":null},{"id":"W1975836040","doi":"10.1177/0146621602239476","title":"Determining the Significance of Correlations Corrected for Unreliability and Range Restriction","year":2003,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":103,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Thompson Rivers University","funders":"","keywords":"Statistics; Mathematics; Sampling (signal processing); Variance (accounting); Range (aeronautics); Sample size determination; Monte Carlo method; Population; Correlation coefficient; Correlation; Population variance; Sample (material); Demography; Physics","score_opus":0.32356157863681795,"score_gpt":0.4344033213096365,"score_spread":0.11084174267281854,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1975836040","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09349423,0.00041309753,0.9019857,0.00032794327,0.0001345188,0.00029681093,0.000108424014,0.0006536697,0.0025856728],"genre_scores_gemma":[0.71999717,0.00018788452,0.27774394,0.00017886926,0.00012267036,0.0007253013,0.00017466878,0.00029088982,0.00057859323],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.89826274,0.066334665,0.004971558,0.012059741,0.016567733,0.0018035842],"domain_scores_gemma":[0.37121946,0.5483487,0.01454726,0.04661589,0.018057942,0.0012107652],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.09475825,0.0013734396,0.0021119446,0.0037870347,0.0012681391,0.0026068315,0.0032745092,0.0017467055,0.0025818322],"category_scores_gemma":[0.5681546,0.0009817764,0.0020919214,0.003091001,0.0056561017,0.0043664537,0.0031215067,0.004287876,0.0005523044],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012383665,0.00041008927,0.178503,0.0010484552,0.0028137877,0.003106719,0.004631654,0.09788832,0.015666958,0.124563776,0.0037817478,0.5663471],"study_design_scores_gemma":[0.00035922657,0.001729678,0.1336105,0.00049497397,0.0010302919,0.0031170645,0.0010480108,0.60618514,0.027769554,0.21640782,0.007911499,0.00033629205],"about_ca_topic_score_codex":0.002290088,"about_ca_topic_score_gemma":0.0011555044,"teacher_disagreement_score":0.09475825,"about_ca_system_score_codex":0.0011807582,"about_ca_system_score_gemma":0.0027865707,"threshold_uncertainty_score":0.50113547},"labels":[],"label_agreement":null},{"id":"W2019817087","doi":"10.1177/01466216045280142","title":"SIMCAT 1.0: A SAS Computer Program for Simulating Computer Adaptive Testing","year":2006,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Software Reliability and Analysis Research","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal; Université du Québec à Montréal","funders":"","keywords":"Computerized adaptive testing; Computer science; Computer program; Programming language; Statistics; Psychometrics; Mathematics","score_opus":0.13975375466909867,"score_gpt":0.3452510035012429,"score_spread":0.2054972488321442,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2019817087","genre_codex":"methods","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.050170712,0.00018814547,0.7960635,0.00032968292,0.00038366244,0.0016139603,0.031983312,0.10115884,0.018108187],"genre_scores_gemma":[0.18119003,0.00035197198,0.7649874,0.0002601543,0.00016422897,0.00890279,0.017585242,0.016520558,0.010037603],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9982437,0.0010097307,0.00016221768,0.00015783972,0.00027753986,0.00014908578],"domain_scores_gemma":[0.98797256,0.009414878,0.00047259845,0.0009922256,0.0009758868,0.00017180743],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003713722,0.00092402665,0.0009472751,0.0010344938,0.00034211093,0.0009881398,0.002022883,0.0006919773,0.051307134],"category_scores_gemma":[0.015466015,0.00069422513,0.00080013316,0.0012192305,0.0002829061,0.0007267922,0.00078295136,0.0025946025,0.0066448227],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0030094062,0.0016534751,0.0330772,0.00225329,0.0012613878,0.0005448892,0.001425883,0.17067786,0.015674127,0.06108665,0.39243364,0.31690225],"study_design_scores_gemma":[0.0012499702,0.0011655793,0.019138817,0.00022561893,0.000427332,0.00043514493,0.00027259698,0.7467606,0.02388241,0.042708598,0.1635111,0.00022233551],"about_ca_topic_score_codex":0.0071854456,"about_ca_topic_score_gemma":0.0061656367,"teacher_disagreement_score":0.051307134,"about_ca_system_score_codex":0.0004828829,"about_ca_system_score_gemma":0.001466839,"threshold_uncertainty_score":0.1716395},"labels":[],"label_agreement":null},{"id":"W2029082333","doi":"10.1177/0146621607301094","title":"Effects of Semantic Incompatibility on Rating Response","year":2008,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":18,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Psychology; Rating scale; Semantic differential; Internal consistency; Consistency (knowledge bases); Scale (ratio); Cognitive psychology; Social psychology; Statistics; Psychometrics; Developmental psychology; Artificial intelligence; Computer science; Mathematics","score_opus":0.6035678497989727,"score_gpt":0.4659181755804515,"score_spread":0.1376496742185212,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2029082333","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9870746,0.00020282889,0.0073926626,0.00019509306,0.00007511272,0.00021960732,0.00006846321,0.00012430566,0.004647487],"genre_scores_gemma":[0.99340075,0.00008346887,0.00538465,0.0001691776,0.000047788133,0.00022350789,0.000120693796,0.00009188417,0.00047799986],"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.8827703,0.08423266,0.009837208,0.0053008427,0.016824437,0.0010345279],"domain_scores_gemma":[0.39354575,0.5504494,0.026725095,0.019248966,0.008028414,0.002002345],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.043829538,0.0007789284,0.0007457315,0.0009152116,0.00064808346,0.0010592293,0.000613721,0.00072554,0.0037562288],"category_scores_gemma":[0.24285506,0.0007323997,0.00079852325,0.00078287604,0.001542595,0.0012312686,0.0017006423,0.0014290906,0.00058659876],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.055292346,0.0052443836,0.4411224,0.0014019347,0.0013879902,0.0010530638,0.015473139,0.0057779835,0.20439307,0.003672724,0.0018870409,0.26329395],"study_design_scores_gemma":[0.00078989775,0.01115619,0.92682767,0.00023445819,0.00065274077,0.0014551489,0.0019831955,0.008545023,0.041189104,0.0037436027,0.003147267,0.0002755488],"about_ca_topic_score_codex":0.0002824568,"about_ca_topic_score_gemma":0.00040117442,"teacher_disagreement_score":0.043829538,"about_ca_system_score_codex":0.00066412444,"about_ca_system_score_gemma":0.00044869227,"threshold_uncertainty_score":0.23179555},"labels":[],"label_agreement":null},{"id":"W2035434565","doi":"10.1177/01466216010251006","title":"The Extra-Factor Phenomenon Revisited: Unidimensional Unfolding as Quadratic Factor Analysis","year":2001,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Sensory Analysis and Statistical Methods","field":"Agricultural and Biological Sciences","cited_by":18,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Phenomenon; Factor (programming language); Covariance; Quadratic equation; Metric (unit); Factor analysis; Mathematics; Set (abstract data type); Applied mathematics; Statistics; Computer science; Physics; Geometry","score_opus":0.14005892954195845,"score_gpt":0.33388675036949617,"score_spread":0.19382782082753772,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2035434565","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.031636015,0.0028703997,0.950754,0.0020930741,0.0004940338,0.00015182167,0.00006273931,0.0002870943,0.011650747],"genre_scores_gemma":[0.6019787,0.0015835117,0.39281154,0.00076516793,0.00040344827,0.0004780405,0.00010369435,0.00017720423,0.001698728],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9768024,0.015578277,0.0011549154,0.002210146,0.0037453817,0.0005089307],"domain_scores_gemma":[0.9240366,0.054104444,0.0049510933,0.012277077,0.0041174605,0.0005133107],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.030741105,0.0015539747,0.0013113087,0.0030933425,0.0017878006,0.0049788174,0.0021313,0.0015651851,0.003220956],"category_scores_gemma":[0.11437712,0.0007261214,0.0015506152,0.007342659,0.012307242,0.011378566,0.005565487,0.00566833,0.0004294178],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00012695808,0.000054801923,0.0036099493,0.00042312345,0.0001334637,0.00028271275,0.008362156,0.001923048,0.0016118491,0.87184507,0.0017641783,0.1098628],"study_design_scores_gemma":[0.000024537074,0.000097884695,0.004252256,0.00019210328,0.00003627981,0.00051578536,0.0012272077,0.021022942,0.00093433855,0.9628034,0.008803538,0.00008960732],"about_ca_topic_score_codex":0.0011896152,"about_ca_topic_score_gemma":0.0010006946,"teacher_disagreement_score":0.030741105,"about_ca_system_score_codex":0.0014551351,"about_ca_system_score_gemma":0.0017982046,"threshold_uncertainty_score":0.1625765},"labels":[],"label_agreement":null},{"id":"W2037069694","doi":"10.1177/01466210022031741","title":"Restriction of Range and Correlation in Outlier-Prone Distributions","year":2000,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":71,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"","keywords":"Outlier; Statistics; Correlation; Range (aeronautics); Mathematics; Normal distribution; Gaussian; Physics","score_opus":0.22316477148681457,"score_gpt":0.41767165415843643,"score_spread":0.19450688267162186,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2037069694","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.2324826,0.0004653796,0.76242745,0.00035250717,0.000039533086,0.00013671348,0.00015064205,0.00026467818,0.0036805586],"genre_scores_gemma":[0.93736154,0.00026494934,0.06123194,0.000111112364,0.000050407576,0.00030019542,0.0002018069,0.00006752011,0.00041057565],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.96992075,0.019622194,0.002043364,0.0034768577,0.004217788,0.0007189141],"domain_scores_gemma":[0.7091357,0.22984871,0.021609416,0.03159796,0.006390184,0.0014180278],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.020142073,0.0006536433,0.001410478,0.0015855922,0.00060240173,0.002394759,0.0013391816,0.001046472,0.001792678],"category_scores_gemma":[0.19699238,0.0005467002,0.0009778584,0.0017467005,0.00391418,0.0039977767,0.003582285,0.0024622597,0.00025415956],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012004756,0.0003122943,0.10801323,0.00077921944,0.000762646,0.0029247787,0.004772806,0.20249207,0.021376988,0.46401727,0.002091635,0.19125657],"study_design_scores_gemma":[0.00010407718,0.0004747852,0.04594912,0.0001963885,0.00014746026,0.0022124788,0.0008070283,0.33211648,0.010530903,0.6030562,0.00417918,0.00022588835],"about_ca_topic_score_codex":0.00043599054,"about_ca_topic_score_gemma":0.00030033704,"teacher_disagreement_score":0.020142073,"about_ca_system_score_codex":0.00062938593,"about_ca_system_score_gemma":0.0008566484,"threshold_uncertainty_score":0.10652274},"labels":[],"label_agreement":null},{"id":"W2055728918","doi":"10.1177/0146621608329503","title":"A Monte Carlo Study of the Effect of Item Characteristic Curve Estimation on the Accuracy of Three Person-Fit Statistics","year":2009,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval; Université de Sherbrooke","funders":"","keywords":"Nonparametric statistics; Statistics; Monte Carlo method; Logistic regression; Parametric statistics; Mathematics; Item response theory; Sample size determination; Econometrics; Psychometrics","score_opus":0.5775002634706006,"score_gpt":0.46070135321883504,"score_spread":0.11679891025176553,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2055728918","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6320564,0.0017823497,0.35942057,0.00057368766,0.0001383762,0.001244937,0.00022829842,0.0006014991,0.003953765],"genre_scores_gemma":[0.8871796,0.00018860798,0.111164324,0.00017749403,0.000030958323,0.00071790465,0.00015287857,0.00013160468,0.0002565377],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.7120539,0.25961098,0.0072466824,0.008103768,0.012040577,0.00094414555],"domain_scores_gemma":[0.04116737,0.92746454,0.008218995,0.016989665,0.0058909724,0.00026849078],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2860002,0.001012602,0.00170299,0.0024983005,0.0012322969,0.0022357777,0.0016011603,0.0024767406,0.0014645464],"category_scores_gemma":[0.7602907,0.001024936,0.0021927382,0.002536174,0.0030292214,0.0034958974,0.0022354566,0.0024333228,0.00029452832],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.020785397,0.0016586296,0.2839131,0.0015354072,0.0050472324,0.0008561473,0.011073929,0.28431243,0.0058336705,0.053190377,0.0038796007,0.3279141],"study_design_scores_gemma":[0.000828818,0.0059493203,0.0977667,0.00063178374,0.001502893,0.0016687294,0.0011108726,0.8550518,0.009802617,0.021435376,0.0037228635,0.0005282085],"about_ca_topic_score_codex":0.003365141,"about_ca_topic_score_gemma":0.0024574215,"teacher_disagreement_score":0.2860002,"about_ca_system_score_codex":0.002140573,"about_ca_system_score_gemma":0.001436138,"threshold_uncertainty_score":0.8804889},"labels":[],"label_agreement":null},{"id":"W2056123061","doi":"10.1177/01466210122032127","title":"Book Review","year":2001,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Behavioral and Psychological Studies","field":"Psychology","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Psychology","score_opus":0.4091965530648787,"score_gpt":0.3927407493978079,"score_spread":0.01645580366707078,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2056123061","genre_codex":"other","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00038388095,0.12646891,0.0024985734,0.024528926,0.050793163,0.00018703744,0.0013958642,0.0007696669,0.79297394],"genre_scores_gemma":[0.00062559533,0.022125412,0.000507275,0.0033346333,0.0048999293,0.000042195963,0.00047919445,0.00016116668,0.9678247],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99947184,0.0000493246,0.000015676214,0.000057614518,0.00035971525,0.00004583007],"domain_scores_gemma":[0.99859995,0.00027640516,0.000059221413,0.000101005295,0.0007097389,0.00025377114],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.00064296025,0.00075545564,0.0008720522,0.0032729993,0.0010404002,0.00336596,0.0012353432,0.0014811461,0.35056096],"category_scores_gemma":[0.0029023143,0.00036170712,0.00045340913,0.0034311218,0.0005100829,0.0020535286,0.0013873483,0.0020044222,0.3359389],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000004987595,0.000008322657,0.00001940028,0.000081302474,0.0000012379755,0.0000107635005,0.0000074916597,0.000027435515,0.000040894356,0.0013469732,0.93318987,0.06526138],"study_design_scores_gemma":[0.000001618251,0.0000030640842,0.000059843434,0.00006472031,0.0000011597003,0.000022483124,0.000008634619,0.000011550805,0.000016544627,0.00051160424,0.9992974,0.0000014990859],"about_ca_topic_score_codex":0.0042694444,"about_ca_topic_score_gemma":0.012353524,"teacher_disagreement_score":0.35056096,"about_ca_system_score_codex":0.0015265805,"about_ca_system_score_gemma":0.0023820854,"threshold_uncertainty_score":0.92634594},"labels":[],"label_agreement":null},{"id":"W2066165827","doi":"10.1177/01466210122032046","title":"Nonparametric Item Response Function Estimation for Assessing Parametric Model Fit","year":2001,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":80,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"McGill University","keywords":"Nonparametric statistics; Item response theory; Identifiability; Resampling; Parametric statistics; Consistency (knowledge bases); Econometrics; Parametric model; Statistics; Mathematics; Differential item functioning; Computer science; Artificial intelligence; Psychometrics","score_opus":0.7555750990116348,"score_gpt":0.5231085521292439,"score_spread":0.23246654688239088,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2066165827","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.002591745,0.0002827854,0.9947173,0.000073135314,0.000037735907,0.0003046503,0.000267609,0.0008141253,0.00091098965],"genre_scores_gemma":[0.07210263,0.00051454053,0.9209173,0.00016801908,0.000069038,0.0039297557,0.0011324466,0.0006119418,0.0005543533],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9174658,0.06670265,0.0024570115,0.0036376922,0.009091212,0.0006456491],"domain_scores_gemma":[0.7379347,0.21166149,0.011848469,0.025380455,0.012535391,0.0006394714],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.059926376,0.0035920423,0.0036754888,0.010636371,0.0014088813,0.003024122,0.0047420207,0.0034265302,0.009989274],"category_scores_gemma":[0.33674666,0.0014032371,0.003161358,0.01393562,0.0023428057,0.005339304,0.004274278,0.006501303,0.0038232682],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00038480293,0.00080924097,0.025891764,0.0030360417,0.0022269392,0.0005829183,0.0021224136,0.10591016,0.0056698387,0.15342756,0.018797284,0.681141],"study_design_scores_gemma":[0.00023654527,0.0012648738,0.033715885,0.0013426776,0.000679397,0.0026409333,0.0016502888,0.58963054,0.0064956974,0.3225759,0.03897921,0.00078809564],"about_ca_topic_score_codex":0.0021119267,"about_ca_topic_score_gemma":0.0022937735,"teacher_disagreement_score":0.059926376,"about_ca_system_score_codex":0.0013098221,"about_ca_system_score_gemma":0.0031509928,"threshold_uncertainty_score":0.31692475},"labels":[],"label_agreement":null},{"id":"W2070673350","doi":"10.1177/0146621606292215","title":"Investigation of IRT-Based Equating Methods in the Presence of Outlier Common Items","year":2008,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":39,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Equating; Outlier; Statistics; Item response theory; Calibration; Comparability; Mathematics; Econometrics; Computer science; Psychometrics","score_opus":0.8304468687797645,"score_gpt":0.5388212625480718,"score_spread":0.29162560623169265,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2070673350","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10012729,0.00039053132,0.89489365,0.00017940773,0.00010834182,0.00085790484,0.00007739105,0.00066705747,0.0026984764],"genre_scores_gemma":[0.3569662,0.00014327047,0.64047045,0.00014307632,0.00003256529,0.0012774199,0.00023534783,0.00032576692,0.0004058995],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.7399748,0.22434708,0.010512128,0.010986891,0.013406131,0.00077301764],"domain_scores_gemma":[0.37656498,0.5199229,0.02338755,0.052942168,0.02638422,0.00079821877],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.22465484,0.0018643253,0.0018275297,0.0032009478,0.0012325483,0.0029577974,0.0035339377,0.0018974824,0.002831019],"category_scores_gemma":[0.57839274,0.00088604254,0.00210609,0.004959769,0.0023874193,0.004695791,0.0048019188,0.0031964474,0.000942643],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0023567697,0.0007740978,0.071980774,0.0011380992,0.002573541,0.00021778033,0.0072445897,0.04874792,0.007406957,0.03818785,0.0017046134,0.81766695],"study_design_scores_gemma":[0.00089785666,0.004252087,0.074001655,0.0010251654,0.0013226883,0.0016225664,0.003344226,0.79235965,0.03406962,0.07382856,0.012657282,0.00061853515],"about_ca_topic_score_codex":0.0008502225,"about_ca_topic_score_gemma":0.0010278,"teacher_disagreement_score":0.22465484,"about_ca_system_score_codex":0.0016264879,"about_ca_system_score_gemma":0.001925302,"threshold_uncertainty_score":0.9561386},"labels":[],"label_agreement":null},{"id":"W2078503709","doi":"10.1177/0146621614557272","title":"Evaluating Person Fit for Cognitive Diagnostic Assessment","year":2014,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":23,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba; University of Alberta","funders":"","keywords":"Statistic; Cognition; Psychology; Item response theory; Conformity; Cognitive psychology; Context (archaeology); Statistics; Social psychology; Applied psychology; Psychometrics; Clinical psychology; Mathematics","score_opus":0.8911900554521754,"score_gpt":0.6108802067461848,"score_spread":0.2803098487059906,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2078503709","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.4412414,0.00062030647,0.5464425,0.00056773436,0.0001798862,0.0021180871,0.0008069832,0.00078135874,0.0072417306],"genre_scores_gemma":[0.85459274,0.00011849588,0.14223677,0.00014597389,0.00003644099,0.0018223892,0.0006088745,0.00008380241,0.0003545378],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9080693,0.057092633,0.008657043,0.00556268,0.01972795,0.00089042954],"domain_scores_gemma":[0.5832041,0.3291888,0.036061052,0.025114816,0.024504751,0.0019264821],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.084394254,0.0011610466,0.001323027,0.0066064615,0.0010887407,0.0034455946,0.0015674782,0.0020638276,0.0022331977],"category_scores_gemma":[0.35784176,0.0004870988,0.0022128273,0.0046022157,0.0016400799,0.0040762657,0.0034689363,0.0017526203,0.00051748776],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001909032,0.00090716686,0.6706119,0.00060534826,0.0015249989,0.00020029458,0.004733304,0.011524509,0.0020160975,0.013993056,0.0027269511,0.28924736],"study_design_scores_gemma":[0.00065382407,0.007396821,0.4839167,0.0009120623,0.0010340684,0.0019704106,0.007883376,0.3789693,0.014733691,0.08851072,0.01321493,0.0008041261],"about_ca_topic_score_codex":0.00087183365,"about_ca_topic_score_gemma":0.0009785715,"teacher_disagreement_score":0.084394254,"about_ca_system_score_codex":0.0013523664,"about_ca_system_score_gemma":0.0016517264,"threshold_uncertainty_score":0.44632483},"labels":[],"label_agreement":null},{"id":"W2097506538","doi":"10.1177/01466216010251011","title":"Computer Program Exchange","year":2001,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Distributed and Parallel Computing Systems","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Lakehead University","funders":"Lakehead University","keywords":"Computer program; Computer science; Psychology; Statistics; Mathematics; Programming language","score_opus":0.0944139960001945,"score_gpt":0.30833941338232707,"score_spread":0.21392541738213255,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2097506538","genre_codex":"other","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008158066,0.00019998054,0.08599443,0.0014354505,0.0010066467,0.0009573349,0.008636622,0.029765463,0.86384606],"genre_scores_gemma":[0.048954315,0.00023436513,0.021246916,0.00047746123,0.0002852429,0.00058477547,0.017315304,0.006669187,0.9042324],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9985839,0.0003198709,0.000080079444,0.0002406845,0.00053251476,0.00024292085],"domain_scores_gemma":[0.99588543,0.0005231347,0.000091072005,0.0022949725,0.0007805686,0.0004248235],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0015972255,0.0008587234,0.0007425613,0.0021503547,0.0015134383,0.0026990988,0.0015829493,0.0009666742,0.5037364],"category_scores_gemma":[0.0060952245,0.00050876866,0.0006041103,0.0020163907,0.00043302757,0.0028652835,0.0035171811,0.0013785817,0.31156263],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00058482366,0.000445777,0.000773551,0.00012295872,0.00002187675,0.00014755287,0.00026171637,0.0009285879,0.0037373693,0.058146287,0.6285829,0.30624655],"study_design_scores_gemma":[0.000095191775,0.00006992184,0.00077981764,0.000030397392,0.000013271739,0.00013879864,0.00007729043,0.0037139356,0.0054138643,0.014574736,0.97507405,0.000018660045],"about_ca_topic_score_codex":0.0012619356,"about_ca_topic_score_gemma":0.0011063736,"teacher_disagreement_score":0.5037364,"about_ca_system_score_codex":0.000722299,"about_ca_system_score_gemma":0.0012318909,"threshold_uncertainty_score":0.7078598},"labels":[],"label_agreement":null},{"id":"W2100391776","doi":"10.1177/0146621606286206","title":"The Effect of Examinee Motivation on Test Construction Within an IRT Framework","year":2006,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":41,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Lakehead University","funders":"","keywords":"Item response theory; Test (biology); Psychology; Statistics; Econometrics; Bayesian probability; Differential item functioning; Equating; Response bias; Computerized adaptive testing; Logistic regression; Social psychology; Mathematics; Psychometrics; Rasch model","score_opus":0.39513929299412376,"score_gpt":0.43041902804549487,"score_spread":0.03527973505137111,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2100391776","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.95984054,0.00035312455,0.036396474,0.00057089963,0.000021331442,0.00011672553,0.00005234686,0.0000959704,0.0025526246],"genre_scores_gemma":[0.9898694,0.00006733354,0.009456737,0.00015367317,0.000015987733,0.00008328701,0.00004978581,0.000044503013,0.0002592801],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8567997,0.1208176,0.0033029132,0.006267493,0.011092766,0.0017195104],"domain_scores_gemma":[0.17079099,0.77458835,0.023191422,0.024156038,0.005506573,0.0017667213],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.15426579,0.00069631427,0.0009100254,0.0012470507,0.0008873567,0.0030462835,0.0011026547,0.0017941352,0.001824368],"category_scores_gemma":[0.5076049,0.0007908639,0.00094954413,0.0008996676,0.002951695,0.002377841,0.0032646458,0.0026915504,0.00030302771],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0043977574,0.00062914117,0.9158244,0.00015646724,0.00047654758,0.00036035923,0.0039402787,0.0068225292,0.005235731,0.0041496777,0.0003418887,0.057665307],"study_design_scores_gemma":[0.00022924009,0.0039385394,0.9400472,0.000115068935,0.00039927335,0.000894251,0.0011977721,0.036715828,0.0072851134,0.007924582,0.0011394942,0.00011370872],"about_ca_topic_score_codex":0.001445298,"about_ca_topic_score_gemma":0.0014712303,"teacher_disagreement_score":0.15426579,"about_ca_system_score_codex":0.0015385066,"about_ca_system_score_gemma":0.001272641,"threshold_uncertainty_score":0.81584525},"labels":[],"label_agreement":null},{"id":"W2128248024","doi":"10.1177/0146621609336540","title":"An Iterative Maximum a Posteriori Estimation of Proficiency Level to Detect Multiple Local Likelihood Maxima","year":2009,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Montréal","funders":"","keywords":"Maximum a posteriori estimation; Estimator; Maxima; Maximum likelihood; Mathematics; Statistics; Focus (optics); A priori and a posteriori; Restricted maximum likelihood; M-estimator; Maximum likelihood sequence estimation; Estimation theory; Computer science","score_opus":0.4601168525429778,"score_gpt":0.45762144688310985,"score_spread":0.002495405659867944,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2128248024","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0041563064,0.00007315559,0.995086,0.00006994295,0.000009262442,0.000030957952,0.000012948478,0.0001224252,0.0004390202],"genre_scores_gemma":[0.12079941,0.00012483582,0.8773136,0.00008245512,0.00003048664,0.00028190223,0.00008733316,0.00012804777,0.0011518472],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99664176,0.0021405118,0.00013180055,0.0004017243,0.0005755988,0.00010858464],"domain_scores_gemma":[0.98313797,0.013641455,0.0007304851,0.0008238151,0.0014934418,0.00017283492],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006674437,0.0009878488,0.0013221325,0.001448376,0.0005666669,0.0013367069,0.0016441278,0.0014310988,0.0027339347],"category_scores_gemma":[0.037657384,0.000876271,0.0012798638,0.0010583003,0.0010849739,0.0020819542,0.0022426706,0.0019304869,0.00077189395],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003621545,0.00023315627,0.01028391,0.00062627794,0.00064113946,0.00023085477,0.001068059,0.22398329,0.018486885,0.047953527,0.00290626,0.6932246],"study_design_scores_gemma":[0.000058434012,0.00028724837,0.0044996436,0.000094898525,0.00009685184,0.00041165075,0.00013708435,0.94081765,0.00837616,0.041491777,0.0036341047,0.000094406205],"about_ca_topic_score_codex":0.0013376513,"about_ca_topic_score_gemma":0.0012607799,"teacher_disagreement_score":0.006674437,"about_ca_system_score_codex":0.00045191398,"about_ca_system_score_gemma":0.0015719015,"threshold_uncertainty_score":0.03529823},"labels":[],"label_agreement":null},{"id":"W2134979859","doi":"10.1177/01466210022031606","title":"Cross-Validation Sample Sizes","year":2000,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":23,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Statistics; Sample size determination; Mathematics; Correlation coefficient; Mean squared error; Correlation; Pearson product-moment correlation coefficient; Linear regression; Sample (material); Cross-validation; Coefficient of determination; Chemistry","score_opus":0.33440989904627344,"score_gpt":0.4815746876227396,"score_spread":0.14716478857646614,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2134979859","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.22190288,0.003689748,0.58441603,0.0016459249,0.0052807373,0.085700944,0.016742308,0.0028667217,0.077754766],"genre_scores_gemma":[0.50312436,0.0011178828,0.31576645,0.0020282213,0.00046351412,0.1426243,0.012876855,0.0019913132,0.020007167],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9074318,0.05174052,0.01013065,0.00865514,0.020130586,0.0019113073],"domain_scores_gemma":[0.6292523,0.2282657,0.005946336,0.053834915,0.080706574,0.0019941889],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.13420501,0.0014286981,0.0024764803,0.004117292,0.0028436412,0.0024506452,0.0038750651,0.0027022194,0.025402045],"category_scores_gemma":[0.47251132,0.001185172,0.0031643931,0.002276931,0.002279284,0.0026185275,0.004583098,0.0036399863,0.0070187747],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.006178437,0.002973127,0.08606475,0.0025464455,0.0019625456,0.00060365937,0.013242358,0.014041782,0.008594897,0.063497365,0.10761947,0.6926752],"study_design_scores_gemma":[0.0052210293,0.008853916,0.24145111,0.0046384656,0.004282487,0.002364971,0.0062563145,0.06624738,0.048145477,0.09329955,0.5185439,0.00069531216],"about_ca_topic_score_codex":0.0020135448,"about_ca_topic_score_gemma":0.0024239477,"teacher_disagreement_score":0.865795,"about_ca_system_score_codex":0.0011051238,"about_ca_system_score_gemma":0.0032512855,"threshold_uncertainty_score":0.70975244},"labels":[],"label_agreement":null},{"id":"W2143619291","doi":"10.1177/0146621603254799","title":"A New Look at the Influence of Guessing on the Reliability of Multiple-Choice Tests","year":2003,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":59,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"","keywords":"Variance (accounting); Reliability (semiconductor); Test (biology); Statistics; Econometrics; Psychology; Mathematics","score_opus":0.2678450942987462,"score_gpt":0.4308893442137286,"score_spread":0.1630442499149824,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2143619291","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.20080265,0.038571727,0.6678993,0.04971242,0.0019020564,0.00008438898,0.0003895318,0.001297344,0.0393407],"genre_scores_gemma":[0.8830085,0.012210345,0.08928097,0.0028774028,0.00470623,0.000069654336,0.00019530217,0.0009731274,0.00667848],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.96777,0.018432349,0.0013005421,0.002724738,0.009016134,0.0007562079],"domain_scores_gemma":[0.49859798,0.44512215,0.0096696345,0.027148567,0.018083543,0.0013781015],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03635688,0.0011261341,0.0020839334,0.0034385992,0.0009726277,0.0054693446,0.0028413394,0.0023045528,0.005035478],"category_scores_gemma":[0.33552316,0.0011904445,0.0019657202,0.002396918,0.0070899376,0.013887647,0.0029438722,0.007951532,0.00089677057],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007197473,0.00027865547,0.07418545,0.0009171611,0.0010679801,0.0017314275,0.006217902,0.033498935,0.009697593,0.23699357,0.014476394,0.62021524],"study_design_scores_gemma":[0.00011447373,0.0011923483,0.117135815,0.0010424498,0.00077679765,0.0040623243,0.0020069939,0.1799316,0.013110081,0.64294904,0.03667842,0.0009996843],"about_ca_topic_score_codex":0.003920957,"about_ca_topic_score_gemma":0.0035241852,"teacher_disagreement_score":0.03635688,"about_ca_system_score_codex":0.0014782315,"about_ca_system_score_gemma":0.0010902901,"threshold_uncertainty_score":0.19227588},"labels":[],"label_agreement":null},{"id":"W2144652829","doi":"10.1177/0146621606288556","title":"Book Review: Adapting Educational and Psychological Tests for Cross-Cultural Assessment","year":2006,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Educational and Psychological Assessments","field":"Psychology","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Psychology; Cross-cultural; Psychological testing; Applied psychology; Social psychology; Clinical psychology; Sociology; Anthropology","score_opus":0.18844240901473244,"score_gpt":0.4865119053793811,"score_spread":0.29806949636464863,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2144652829","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0014947654,0.62015665,0.021352459,0.1311476,0.18647093,0.0009094111,0.0011521344,0.0011707433,0.03614528],"genre_scores_gemma":[0.009206559,0.5100559,0.04243768,0.15686288,0.08346388,0.0013998206,0.0018410721,0.001760505,0.19297181],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9954898,0.0015999844,0.0004093812,0.00030456748,0.0020862059,0.00011003355],"domain_scores_gemma":[0.9726663,0.0149751855,0.00091715105,0.0007932694,0.010031525,0.00061656436],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005962428,0.0014047547,0.0023806659,0.004528864,0.0006603861,0.0017544299,0.0017842063,0.0027530089,0.009936193],"category_scores_gemma":[0.02480399,0.0006920046,0.0010572412,0.0044336664,0.001258857,0.0023537187,0.0010887696,0.0048459843,0.013951939],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00002627824,0.000047971127,0.00027543603,0.00076093164,0.000026220263,0.000056505312,0.00002687856,0.00010202929,0.0002461481,0.0005468036,0.7961593,0.2017254],"study_design_scores_gemma":[0.0000570319,0.00010903788,0.0043512164,0.0021717735,0.00010018769,0.001160507,0.00006500787,0.00035243743,0.0005443008,0.0022483694,0.9887838,0.0000562586],"about_ca_topic_score_codex":0.007930885,"about_ca_topic_score_gemma":0.025705956,"teacher_disagreement_score":0.009936193,"about_ca_system_score_codex":0.0017003136,"about_ca_system_score_gemma":0.002444275,"threshold_uncertainty_score":0.03323984},"labels":[],"label_agreement":null},{"id":"W2151525783","doi":"10.1177/0146621610378289","title":"A Test-Length Correction to the Estimation of Extreme Proficiency Levels","year":2010,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Montréal","funders":"","keywords":"Maximum a posteriori estimation; Estimator; Statistics; Rasch model; Mathematics; Bayes estimator; Item response theory; Bayesian probability; Estimation; Bias of an estimator; Scale (ratio); Econometrics; Maximum likelihood; Minimum-variance unbiased estimator; Psychometrics","score_opus":0.6476178436147106,"score_gpt":0.4734027822600229,"score_spread":0.17421506135468773,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2151525783","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05025891,0.0004284943,0.9453156,0.0007198913,0.00037727464,0.00017902856,0.00017595555,0.00096900825,0.0015758766],"genre_scores_gemma":[0.42388493,0.00024909127,0.5707935,0.0007073468,0.00022542206,0.00043104694,0.00034216035,0.00039888697,0.0029676491],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9875668,0.006707657,0.0008936035,0.0019084979,0.0027099615,0.0002135283],"domain_scores_gemma":[0.8425143,0.12034612,0.010419404,0.01441097,0.011498903,0.00081037043],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.014464312,0.00081769243,0.0007674324,0.0013122715,0.00068280706,0.0012243278,0.0017166319,0.0012274629,0.0029470425],"category_scores_gemma":[0.24309874,0.0003956406,0.00067800045,0.001754723,0.0011890279,0.0016769177,0.0019737396,0.0026786255,0.0010324867],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009957389,0.00027758072,0.041797627,0.00084419624,0.00039460455,0.0007523396,0.0015102428,0.028092276,0.026358986,0.03676597,0.005724751,0.8564857],"study_design_scores_gemma":[0.0003108663,0.0025103244,0.1596428,0.0007902439,0.00067598873,0.004976157,0.000880156,0.5830349,0.106901735,0.10397035,0.035724547,0.0005820056],"about_ca_topic_score_codex":0.0014046277,"about_ca_topic_score_gemma":0.0018220675,"teacher_disagreement_score":0.014464312,"about_ca_system_score_codex":0.0006759015,"about_ca_system_score_gemma":0.0013728112,"threshold_uncertainty_score":0.07649553},"labels":[],"label_agreement":null},{"id":"W2169517221","doi":"10.1177/0146621610391777","title":"Accuracy of Person-Fit Statistics","year":2011,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Advanced Text Analysis Techniques","field":"Computer Science","cited_by":28,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval; Université de Sherbrooke","funders":"","keywords":"Statistics; Cheating; Monte Carlo method; Mathematics; Econometrics; Psychology; Social psychology","score_opus":0.24308051572562275,"score_gpt":0.34340061958845114,"score_spread":0.10032010386282839,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2169517221","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8019421,0.0004197682,0.17949001,0.0003535234,0.00014613246,0.00070556795,0.0007901518,0.0010858861,0.015066776],"genre_scores_gemma":[0.98561096,0.00005758883,0.012626367,0.00007410775,0.000020130046,0.00019817139,0.00031221868,0.00015910843,0.00094135443],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9520745,0.024668708,0.004808754,0.008370388,0.008795697,0.0012819505],"domain_scores_gemma":[0.4484861,0.4514304,0.03982987,0.043614548,0.015100657,0.0015384483],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04380894,0.00074738456,0.0011242764,0.0018077277,0.00045115792,0.002905105,0.0009182058,0.0017810024,0.0059001204],"category_scores_gemma":[0.4940274,0.00049063633,0.0011334367,0.0013780922,0.0017011798,0.0057670665,0.0025837573,0.0017218024,0.0010817961],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.015110283,0.0014353876,0.44398,0.0010112957,0.0017262072,0.00037283087,0.011438966,0.064362414,0.03489734,0.040260345,0.0034486267,0.38195625],"study_design_scores_gemma":[0.00047567228,0.007966646,0.6039726,0.00029773198,0.00075702835,0.0014002187,0.0014438964,0.24675654,0.06868179,0.057924367,0.009689617,0.0006338442],"about_ca_topic_score_codex":0.0013354752,"about_ca_topic_score_gemma":0.00061869127,"teacher_disagreement_score":0.04380894,"about_ca_system_score_codex":0.00088933145,"about_ca_system_score_gemma":0.0006506518,"threshold_uncertainty_score":0.23168659},"labels":[],"label_agreement":null},{"id":"W2171716385","doi":"10.1177/0146621614520958","title":"Maximum-Likelihood Estimation of Noncompensatory IRT Models With the MH-RM Algorithm","year":2014,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":26,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Item response theory; Estimation; Maximum likelihood; Latent variable; Statistics; Computer science; Econometrics; Population; Estimation theory; Expectation–maximization algorithm; Mathematics; Algorithm; Artificial intelligence; Machine learning; Psychometrics; Engineering","score_opus":0.3757797696663633,"score_gpt":0.40160231143503256,"score_spread":0.02582254176866927,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2171716385","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02005583,0.0001229838,0.97859657,0.00011852439,0.000009868882,0.00008596419,0.000031038497,0.0004547232,0.0005244662],"genre_scores_gemma":[0.22213191,0.000095457515,0.7751131,0.00012055918,0.0000231499,0.00037057066,0.00033132712,0.00018432902,0.0016296465],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.995344,0.0035890313,0.00020076797,0.00037969288,0.00033868468,0.00014781949],"domain_scores_gemma":[0.9670488,0.029326227,0.0008588543,0.0014774158,0.0010809356,0.00020769543],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011348171,0.000997425,0.0015775498,0.0011304903,0.0006880196,0.0011098593,0.003430546,0.0016413485,0.0031800356],"category_scores_gemma":[0.03877758,0.0009495133,0.0012775279,0.0011227711,0.0009635956,0.00179572,0.0016496732,0.0027175196,0.00094197853],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00055924506,0.00023429883,0.0041232053,0.00024576468,0.00026854247,0.00022401623,0.00044701857,0.8011401,0.0018800094,0.050454017,0.0014788666,0.1389448],"study_design_scores_gemma":[0.000030015142,0.000028478238,0.00024196025,0.000009692762,0.000009269774,0.000025505316,0.00001607525,0.9918011,0.00027475692,0.0073431917,0.00020793629,0.000012013266],"about_ca_topic_score_codex":0.0071859113,"about_ca_topic_score_gemma":0.0074937204,"teacher_disagreement_score":0.011348171,"about_ca_system_score_codex":0.00087255955,"about_ca_system_score_gemma":0.0018779367,"threshold_uncertainty_score":0.06001562},"labels":[],"label_agreement":null},{"id":"W2580371235","doi":"10.1177/0146621616684584","title":"An Evaluation of Interrater Reliability Measures on Binary Tasks Using <i>d-Prime</i>","year":2016,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":35,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Inter-rater reliability; Kappa; Prime (order theory); Psychology; Statistics; Reliability (semiconductor); Cohen's kappa; Binary number; Agreement; Psychometrics; Social psychology; Mathematics; Combinatorics; Arithmetic; Rating scale; Linguistics","score_opus":0.5204254440661797,"score_gpt":0.4693431790011876,"score_spread":0.05108226506499214,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2580371235","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.40826514,0.0013781099,0.5665505,0.00050033315,0.00046525072,0.003672213,0.0006822516,0.00074933504,0.017736835],"genre_scores_gemma":[0.7268816,0.00027136088,0.2677065,0.00015569974,0.000058229372,0.0037083947,0.00029848857,0.00015271301,0.00076698646],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.71934634,0.21449116,0.027536687,0.009409014,0.027879296,0.001337506],"domain_scores_gemma":[0.42313984,0.45292208,0.023963835,0.030817023,0.067894824,0.0012624176],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2886595,0.0011340556,0.0011822506,0.0049196575,0.002584416,0.0024020392,0.0016675456,0.0011057467,0.001202315],"category_scores_gemma":[0.4241366,0.0009815239,0.0018132799,0.0047852555,0.0035757346,0.0026756998,0.0034936073,0.0017200361,0.00071887055],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005113521,0.00093513716,0.44907635,0.0053842845,0.003329968,0.00037026824,0.052743904,0.011538175,0.025835559,0.044901535,0.01013549,0.39063582],"study_design_scores_gemma":[0.0009052373,0.011752636,0.5599464,0.0030183482,0.002156993,0.0035598602,0.026714208,0.19321002,0.087705314,0.07292041,0.036598586,0.0015119048],"about_ca_topic_score_codex":0.0008587345,"about_ca_topic_score_gemma":0.002157314,"teacher_disagreement_score":0.7113405,"about_ca_system_score_codex":0.001606336,"about_ca_system_score_gemma":0.0019927174,"threshold_uncertainty_score":0.8772095},"labels":[],"label_agreement":null},{"id":"W2582841787","doi":"10.1177/0146621615597894","title":"faoutlier","year":2015,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":24,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Exploratory factor analysis; Computer science; Confirmatory factor analysis; Regression analysis; Software; Extant taxon; Factor (programming language); Statistics; Statistical analysis; Regression; Artificial intelligence; Machine learning; Mathematics; Structural equation modeling; Programming language; Biology","score_opus":0.6421002834531417,"score_gpt":0.5022808864825751,"score_spread":0.13981939697056667,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2582841787","genre_codex":"other","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0048513953,0.0032736973,0.116566755,0.00670093,0.0070794723,0.00041909656,0.02606467,0.06620541,0.76883864],"genre_scores_gemma":[0.04234795,0.0021374277,0.087451234,0.002020441,0.0009754526,0.0004324429,0.029211016,0.019294746,0.8161293],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9980465,0.0003654924,0.00011132769,0.00045679274,0.0008680969,0.00015182627],"domain_scores_gemma":[0.9959913,0.00105247,0.00019199072,0.0011526927,0.0012079563,0.0004035665],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0026793862,0.0013696731,0.000872977,0.0035267067,0.0014553831,0.005014893,0.0017400003,0.0019313747,0.5931423],"category_scores_gemma":[0.012411586,0.00050623505,0.00082614855,0.0019473972,0.00073978124,0.0024842115,0.0023101608,0.0013568643,0.37753943],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017223612,0.00005274525,0.00066130713,0.00022591955,0.000017683544,0.00016446503,0.00024383888,0.00048740135,0.0013204113,0.020380678,0.5905657,0.38570768],"study_design_scores_gemma":[0.000016360067,0.000012943756,0.0002734261,0.000056683333,0.0000039287684,0.0001914081,0.000036556383,0.0006726859,0.00070256635,0.0038244235,0.9941987,0.0000104338005],"about_ca_topic_score_codex":0.0042863414,"about_ca_topic_score_gemma":0.0052732965,"teacher_disagreement_score":0.40685773,"about_ca_system_score_codex":0.0012283132,"about_ca_system_score_gemma":0.0018710063,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W2590325518","doi":"10.1177/0146621617692079","title":"Plausible-Value Imputation Statistics for Detecting Item Misfit","year":2017,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":31,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Statistics; Statistic; Item response theory; Trait; Imputation (statistics); Econometrics; Parametric statistics; Test statistic; Mathematics; Statistical hypothesis testing; Differential item functioning; Latent variable model; Item analysis; Null hypothesis; Latent variable; Computer science; Psychometrics; Missing data","score_opus":0.72207883373125,"score_gpt":0.5322352636234017,"score_spread":0.18984357010784836,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2590325518","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00640875,0.00022360108,0.99123186,0.00025635623,0.000058260553,0.00034382386,0.00025519563,0.0004282956,0.00079385174],"genre_scores_gemma":[0.16702248,0.00022660434,0.82894576,0.00019149562,0.0000754752,0.0022145284,0.0007270878,0.00024095792,0.0003555094],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8352187,0.13783608,0.0077658873,0.00634974,0.01212587,0.00070369424],"domain_scores_gemma":[0.41021833,0.51168805,0.021889655,0.041915655,0.013285346,0.0010029922],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.116890624,0.0014360612,0.0026731726,0.005757773,0.001440663,0.0031130235,0.005699732,0.0033705477,0.009745712],"category_scores_gemma":[0.5533647,0.0011597179,0.0026078483,0.008477095,0.003739392,0.006097394,0.0034165438,0.006426449,0.0019444913],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010355696,0.00049489754,0.051862523,0.002283193,0.0023999773,0.0007567042,0.0037778062,0.062285557,0.0019612212,0.32348493,0.0167042,0.5329533],"study_design_scores_gemma":[0.0004404788,0.0010935109,0.026750349,0.0013202692,0.00060424465,0.0016624891,0.0010215297,0.3778016,0.006255635,0.56232977,0.020289129,0.00043108012],"about_ca_topic_score_codex":0.00072461617,"about_ca_topic_score_gemma":0.00095667987,"teacher_disagreement_score":0.116890624,"about_ca_system_score_codex":0.0013015319,"about_ca_system_score_gemma":0.0024652013,"threshold_uncertainty_score":0.6181841},"labels":[],"label_agreement":null},{"id":"W2745464303","doi":"10.1177/0146621617726788","title":"Using Automatic Item Generation to Create Solutions and Rationales for Computerized Formative Testing","year":2017,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Intelligent Tutoring Systems and Adaptive Learning","field":"Computer Science","cited_by":33,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Formative assessment; Computer science; Item bank; Computerized adaptive testing; Test (biology); Quality (philosophy); Item response theory; Psychometrics; Psychology; Mathematics education","score_opus":0.534223811307965,"score_gpt":0.38532894042215204,"score_spread":0.148894870885813,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2745464303","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005644991,0.00008036325,0.98535556,0.00020800495,0.00010483133,0.0015333325,0.00027156505,0.0055967313,0.0012046363],"genre_scores_gemma":[0.019606011,0.00006410777,0.9777033,0.00006526697,0.00003487245,0.0011031699,0.00050336507,0.00040765997,0.00051229616],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9654917,0.022338608,0.0033498781,0.002096359,0.00639554,0.000327939],"domain_scores_gemma":[0.7930138,0.14564808,0.010693058,0.022881392,0.02685905,0.0009044861],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.038242444,0.0026802884,0.0010500981,0.0066094827,0.0009641433,0.003421476,0.0034072872,0.0017223622,0.008732769],"category_scores_gemma":[0.17452992,0.001339741,0.0014769714,0.003413301,0.0014714502,0.0032568967,0.0025507207,0.0028020912,0.0034844654],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00043690414,0.0007394668,0.003939663,0.0007960885,0.000108571134,0.00042817343,0.0020014169,0.013687823,0.012785654,0.02358065,0.009504001,0.93199164],"study_design_scores_gemma":[0.0016344822,0.0018427203,0.005021922,0.0018835395,0.00034337182,0.0019260047,0.00153875,0.6633273,0.10298045,0.13556167,0.08314712,0.0007926568],"about_ca_topic_score_codex":0.0010465622,"about_ca_topic_score_gemma":0.0018193508,"teacher_disagreement_score":0.038242444,"about_ca_system_score_codex":0.0014157251,"about_ca_system_score_gemma":0.0036502143,"threshold_uncertainty_score":0.2022478},"labels":[],"label_agreement":null},{"id":"W3016903275","doi":"10.1177/0146621620909897","title":"The Monotonic Polynomial Graded Response Model: Implementation and a Comparative Study","year":2020,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"Fonds de recherche du Québec – Nature et technologies","keywords":"Monotonic function; Mathematics; Categorical variable; Probit; Probit model; Heteroscedasticity; Polynomial; Applied mathematics; Logistic regression; Function (biology); Statistics; Econometrics","score_opus":0.8339036917039917,"score_gpt":0.5454023379535109,"score_spread":0.2885013537504808,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3016903275","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.20221096,0.0006973566,0.77523583,0.0016619122,0.00008444696,0.0011233329,0.0010223244,0.00210919,0.015854707],"genre_scores_gemma":[0.47648117,0.0007441873,0.51656353,0.00026489963,0.00003827003,0.0008515225,0.0008149195,0.00045258773,0.0037888384],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99394834,0.0047939154,0.00015374148,0.0003566475,0.0006120965,0.0001352245],"domain_scores_gemma":[0.9779479,0.016487924,0.0004804542,0.0025619995,0.0023120597,0.00020971241],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.014394528,0.0006651503,0.0007542479,0.0008172605,0.00037978188,0.0016709636,0.0027085685,0.0012877102,0.009166408],"category_scores_gemma":[0.051919516,0.0003472061,0.0009198419,0.0016647577,0.0005549758,0.0026631067,0.0013813239,0.0018611647,0.0019797583],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017797138,0.0019365952,0.021846406,0.00079528167,0.00024246995,0.00047228334,0.0014762367,0.17633666,0.0032834245,0.08687114,0.008371662,0.6965882],"study_design_scores_gemma":[0.0001583082,0.000520749,0.004560205,0.0000701331,0.000057278976,0.00020660264,0.0003831415,0.9691421,0.0011260511,0.01873575,0.0049598985,0.0000798631],"about_ca_topic_score_codex":0.01917642,"about_ca_topic_score_gemma":0.010027316,"teacher_disagreement_score":0.01917642,"about_ca_system_score_codex":0.0016223814,"about_ca_system_score_gemma":0.0016962085,"threshold_uncertainty_score":0.0761264},"labels":[],"label_agreement":null},{"id":"W3022866891","doi":"10.1177/0146621620909898","title":"Partially and Fully Noncompensatory Response Models for Dichotomous and Polytomous Items","year":2020,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Polytomous Rasch model; Item response theory; Econometrics; Set (abstract data type); Statistics; Computer science; Psychometrics; Mathematics","score_opus":0.700374042316265,"score_gpt":0.4526023993021298,"score_spread":0.24777164301413518,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3022866891","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.117278755,0.00015306691,0.87733215,0.0005400858,0.000071080496,0.00082224974,0.00056723785,0.0004052413,0.0028301117],"genre_scores_gemma":[0.61222047,0.0002595301,0.37782168,0.00043223947,0.00008279874,0.0021909145,0.0020538364,0.0002018614,0.0047366736],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9787758,0.014494766,0.0012520008,0.0026878214,0.0022585175,0.00053109275],"domain_scores_gemma":[0.90320194,0.07369729,0.0052516,0.01318026,0.0040322975,0.00063665956],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02729426,0.0020490452,0.0017150285,0.002182194,0.00095473893,0.002366508,0.0053609842,0.0023180565,0.009326401],"category_scores_gemma":[0.095306925,0.0012030476,0.0030569998,0.0021841375,0.0025378247,0.0043101446,0.0032566774,0.0037685814,0.0019863984],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019072376,0.0011653041,0.04500903,0.0010281928,0.00095762516,0.0012227515,0.0047648237,0.29309663,0.0064965975,0.35553282,0.004077533,0.2847414],"study_design_scores_gemma":[0.00015652252,0.00071864977,0.016154354,0.00013022563,0.00014856002,0.0012397199,0.0004267542,0.77658355,0.0015265418,0.19983521,0.002878798,0.00020110027],"about_ca_topic_score_codex":0.002260014,"about_ca_topic_score_gemma":0.003266378,"teacher_disagreement_score":0.02729426,"about_ca_system_score_codex":0.0016064721,"about_ca_system_score_gemma":0.0018312826,"threshold_uncertainty_score":0.14434761},"labels":[],"label_agreement":null},{"id":"W3035107461","doi":"10.1177/0146621620929431","title":"OpenMx: A Modular Research Environment for Item Response Theory Method Development","year":2020,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"National Institute on Drug Abuse; National Institutes of Health","keywords":"Modular design; Computer science; Implementation; Item response theory; Source code; Code (set theory); Selection (genetic algorithm); Software; Software engineering; Theoretical computer science; Programming language; Machine learning; Statistics; Mathematics; Psychometrics","score_opus":0.9218223146811826,"score_gpt":0.5923631288612036,"score_spread":0.329459185819979,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3035107461","genre_codex":"methods","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0020387438,0.00043988824,0.8400437,0.0005524766,0.00040260033,0.0050020227,0.020849803,0.12370127,0.006969558],"genre_scores_gemma":[0.00762141,0.00044558282,0.9188676,0.0004001409,0.00019188976,0.025220538,0.0112964595,0.028103897,0.007852394],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98446345,0.009105291,0.002166183,0.0014467768,0.002421096,0.0003972553],"domain_scores_gemma":[0.90671265,0.072571285,0.0031283312,0.008035748,0.008319978,0.0012319757],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.028800748,0.0032176066,0.002255056,0.0044087046,0.00088458194,0.003797815,0.003863147,0.0014326437,0.19105405],"category_scores_gemma":[0.09500965,0.0031192626,0.002844665,0.0035273822,0.0009204316,0.0037728585,0.0066808127,0.003779792,0.07626463],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015960414,0.00059422385,0.0033141626,0.0061501986,0.0006171274,0.00031271376,0.002637252,0.002951776,0.0062681013,0.015428358,0.34205717,0.6180728],"study_design_scores_gemma":[0.0025619995,0.0010473953,0.013105939,0.0032828748,0.0005353376,0.00082509033,0.00061084295,0.02514863,0.018758394,0.0818213,0.8516812,0.00062113046],"about_ca_topic_score_codex":0.0008198289,"about_ca_topic_score_gemma":0.0014782957,"teacher_disagreement_score":0.19105405,"about_ca_system_score_codex":0.0007549652,"about_ca_system_score_gemma":0.0028391785,"threshold_uncertainty_score":0.6391394},"labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"not_applicable","genre":"software","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":[],"domain":null,"study_design":"not_applicable","genre":"software","about_ca_system":false,"about_ca_topic":false,"confidence":"high"}],"label_agreement":"agree"},{"id":"W3037823530","doi":"10.1177/0146621620931190","title":"An Exploratory Strategy to Identify and Define Sources of Differential Item Functioning","year":2020,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Advanced Statistical Modeling Techniques","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"Ministry of Science and Technology","keywords":"Differential item functioning; Item response theory; Differential (mechanical device); Set (abstract data type); Computer science; Dimension (graph theory); Psychology; Process (computing); Data mining; Cognitive psychology; Psychometrics; Mathematics; Developmental psychology","score_opus":0.15829898309091692,"score_gpt":0.3541875478248856,"score_spread":0.19588856473396868,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3037823530","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.053596567,0.00015590618,0.9334416,0.00037054744,0.000062268016,0.0071565816,0.00050415547,0.0009364516,0.0037758797],"genre_scores_gemma":[0.13225318,0.00010521167,0.852722,0.00022755451,0.000017548695,0.012845924,0.0004513127,0.00010886402,0.0012683999],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.95962137,0.031799942,0.0021119984,0.0025003653,0.0033774883,0.0005887546],"domain_scores_gemma":[0.90133476,0.0722547,0.006121399,0.010812252,0.008865034,0.0006118379],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.043637738,0.0030237741,0.0015888527,0.009674067,0.0026841904,0.0032192403,0.0020866017,0.0019611882,0.0061854874],"category_scores_gemma":[0.12449251,0.0012241692,0.0023461094,0.0058102915,0.0022300815,0.003813637,0.0052497196,0.0019096633,0.0013741127],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014687733,0.001380774,0.037812967,0.0040593874,0.0010631767,0.001324481,0.081773296,0.00873835,0.03387816,0.11681495,0.0113939885,0.7002918],"study_design_scores_gemma":[0.0015673867,0.006304012,0.05819171,0.0032915224,0.0017035262,0.006008894,0.07040374,0.3178892,0.08321841,0.3393129,0.110676944,0.0014316543],"about_ca_topic_score_codex":0.0014570972,"about_ca_topic_score_gemma":0.0030731792,"teacher_disagreement_score":0.043637738,"about_ca_system_score_codex":0.0015211159,"about_ca_system_score_gemma":0.0043884222,"threshold_uncertainty_score":0.2307812},"labels":[],"label_agreement":null},{"id":"W4223957752","doi":"10.1177/01466216221084210","title":"A Comparison of Modern and Popular Approaches to Calculating Reliability for Dichotomously Scored Items","year":2022,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Multi-Criteria Decision Making","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University; Université de Montréal","funders":"","keywords":"Cronbach's alpha; Reliability (semiconductor); Monte Carlo method; Statistics; Mathematics; Econometrics; Psychology; Computer science; Psychometrics","score_opus":0.7494451842918853,"score_gpt":0.49012840491475185,"score_spread":0.2593167793771335,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4223957752","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.15044172,0.022689434,0.7707635,0.0061908425,0.0009948574,0.00062508835,0.0006168027,0.00049675105,0.047180954],"genre_scores_gemma":[0.52492726,0.009622931,0.46008316,0.00080091425,0.00040938932,0.0015314776,0.00052795326,0.00027154025,0.0018254229],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.91981125,0.054617,0.0039258264,0.0036436731,0.017389754,0.00061256473],"domain_scores_gemma":[0.8078433,0.14245756,0.008833358,0.012349837,0.027620818,0.0008951352],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0769159,0.001092385,0.00085285713,0.0062230495,0.0011178278,0.0027085957,0.001833847,0.0010841308,0.00260749],"category_scores_gemma":[0.22165397,0.0005023901,0.0011229978,0.008510004,0.0028233822,0.005230124,0.0031770575,0.0033314119,0.00076891034],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00082943076,0.00036467868,0.0535571,0.003534798,0.0014052291,0.000117576834,0.017876817,0.0073218555,0.0026429535,0.2913171,0.015699387,0.6053331],"study_design_scores_gemma":[0.0006205178,0.0032899352,0.26650307,0.010905367,0.0015322207,0.0025041113,0.02134194,0.100218154,0.010583541,0.45807582,0.123394735,0.0010305825],"about_ca_topic_score_codex":0.0020598941,"about_ca_topic_score_gemma":0.0046336134,"teacher_disagreement_score":0.0769159,"about_ca_system_score_codex":0.0024431325,"about_ca_system_score_gemma":0.002243564,"threshold_uncertainty_score":0.406775},"labels":[],"label_agreement":null},{"id":"W4293408802","doi":"10.1177/01466216221124089","title":"Item Selection With Collaborative Filtering in On-The-Fly Multistage Adaptive Testing","year":2022,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computerized adaptive testing; Item bank; Selection (genetic algorithm); Computer science; Item response theory; Collaborative filtering; On the fly; Feature selection; Test (biology); Machine learning; Data mining; Artificial intelligence; Statistics; Recommender system; Mathematics; Psychometrics","score_opus":0.6812333426754545,"score_gpt":0.43299204654842544,"score_spread":0.2482412961270291,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4293408802","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017067062,0.00017688044,0.98099786,0.00006572378,0.000038285703,0.0007097546,0.000033098648,0.00045278235,0.00045854424],"genre_scores_gemma":[0.16416025,0.00014235973,0.83363986,0.0001179524,0.000051182582,0.0012964455,0.00013784865,0.000055476055,0.00039861572],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.96020716,0.031063288,0.0015918833,0.0025480397,0.0040825335,0.000507108],"domain_scores_gemma":[0.9283035,0.058953047,0.0021396962,0.004619695,0.00543072,0.000553369],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03210677,0.0014757104,0.0025918693,0.0048186784,0.0011200645,0.001360172,0.003086034,0.001821515,0.0030142],"category_scores_gemma":[0.079203494,0.00090908154,0.0022950266,0.0036527016,0.0013059543,0.0020173457,0.0021725139,0.0018495235,0.0007884575],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009384935,0.0010778358,0.013412399,0.00065307243,0.0009294539,0.00024815486,0.0010429864,0.07481388,0.005763336,0.0068575833,0.0014972547,0.89276564],"study_design_scores_gemma":[0.0003253664,0.0015605259,0.015888404,0.000179749,0.0003498522,0.00039124142,0.00022261712,0.9535317,0.008527355,0.015664527,0.0031722428,0.00018643583],"about_ca_topic_score_codex":0.0075335354,"about_ca_topic_score_gemma":0.008993585,"teacher_disagreement_score":0.03210677,"about_ca_system_score_codex":0.0011275407,"about_ca_system_score_gemma":0.0019279602,"threshold_uncertainty_score":0.16979885},"labels":[],"label_agreement":null},{"id":"W4317423393","doi":"10.1177/01466216231151704","title":"A New Approach to Desirable Responding: Multidimensional Item Response Model of Overclaiming Data","year":2023,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Social and Intergroup Psychology","field":"Social Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"Social Sciences and Humanities Research Council of Canada; Ministry of Science and Technology, Taiwan","keywords":"Item response theory; Variety (cybernetics); Set (abstract data type); Computer science; Selection (genetic algorithm); Response bias; Empirical research; Artificial intelligence; Machine learning; Psychology; Econometrics; Cognitive psychology; Statistics; Psychometrics; Social psychology; Mathematics","score_opus":0.4958442413042139,"score_gpt":0.4335076058483659,"score_spread":0.062336635455848,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4317423393","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.004143841,0.000114437484,0.99378294,0.0004275456,0.00004625196,0.00031612543,0.0001724254,0.000252508,0.0007439771],"genre_scores_gemma":[0.1381454,0.00024484936,0.85603136,0.00050507364,0.00012237128,0.0034602,0.00048273875,0.00013759687,0.0008703853],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9207672,0.061836477,0.0028239398,0.0063498793,0.00754886,0.000673705],"domain_scores_gemma":[0.91064996,0.064350665,0.0057190657,0.011825258,0.006911328,0.00054375234],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.06895237,0.0028959506,0.0025765195,0.0062607196,0.0011034659,0.0050874315,0.005808744,0.002788966,0.0039019752],"category_scores_gemma":[0.14808644,0.0011601952,0.00372815,0.0075012073,0.0044350303,0.0072384533,0.0035403683,0.0058091874,0.0012985088],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00034006216,0.0006499801,0.023354426,0.0010059766,0.001284163,0.00036773644,0.0076182373,0.07721433,0.0031245733,0.69765526,0.006127176,0.18125814],"study_design_scores_gemma":[0.00012759707,0.00050732034,0.005358212,0.00021754584,0.0001044867,0.00047749962,0.00070028007,0.5708858,0.0009135424,0.41143617,0.009069922,0.0002015798],"about_ca_topic_score_codex":0.0022258805,"about_ca_topic_score_gemma":0.0016094935,"teacher_disagreement_score":0.9310476,"about_ca_system_score_codex":0.0033903923,"about_ca_system_score_gemma":0.002857936,"threshold_uncertainty_score":0.3646593},"labels":[],"label_agreement":null},{"id":"W4327910164","doi":"10.1177/01466216231165299","title":"Confidence Screening Detector: A New Method for Detecting Test Collusion","year":2023,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"National Natural Science Foundation of China","keywords":"Collusion; Cheating; Clique; Computer science; Test (biology); Detector; Item response theory; Scale (ratio); Statistical hypothesis testing; Variable (mathematics); Similarity (geometry); Selection (genetic algorithm); Statistics; Data mining; Algorithm; Machine learning; Artificial intelligence; Mathematics; Psychology; Psychometrics; Social psychology","score_opus":0.7210023253769497,"score_gpt":0.531043618285663,"score_spread":0.1899587070912867,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4327910164","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.024393748,0.00016157971,0.9734673,0.00016995176,0.0000653062,0.0002458928,0.00010743172,0.00067735504,0.0007114435],"genre_scores_gemma":[0.279286,0.00011508236,0.718148,0.00017811288,0.00008714262,0.00048040785,0.00033278784,0.000095018,0.0012774544],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99353397,0.0024759048,0.00043635827,0.0010648917,0.002192798,0.00029607993],"domain_scores_gemma":[0.9699812,0.021205392,0.0024547414,0.0019666427,0.003597509,0.00079451595],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007594911,0.0009653773,0.001491888,0.004691035,0.00084212533,0.0015526157,0.0027763771,0.0016545226,0.0023872796],"category_scores_gemma":[0.042699818,0.00051146286,0.00095041574,0.0023156924,0.0012486427,0.0018397857,0.0029688256,0.0016604245,0.00065666257],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00086663413,0.00051461917,0.031741746,0.00028982796,0.00039888386,0.00032156415,0.00041322171,0.04259134,0.015449873,0.020673128,0.004297736,0.8824415],"study_design_scores_gemma":[0.00012175021,0.0003573005,0.008672311,0.000041496325,0.000087341665,0.0006861259,0.00008110157,0.963706,0.008776341,0.014523526,0.0028497158,0.00009697982],"about_ca_topic_score_codex":0.001883643,"about_ca_topic_score_gemma":0.0018373452,"teacher_disagreement_score":0.007594911,"about_ca_system_score_codex":0.0008657331,"about_ca_system_score_gemma":0.0020688765,"threshold_uncertainty_score":0.0401662},"labels":[],"label_agreement":null},{"id":"W4405622011","doi":"10.1177/01466216241310600","title":"An Information Manifold Perspective for Analyzing Test Data","year":2024,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ottawa Hospital; McGill University","funders":"","keywords":"Item response theory; Mathematics; Measure (data warehouse); Metric (unit); Computer science; Test (biology); Manifold (fluid mechanics); Perspective (graphical); Scale (ratio); Artificial intelligence; Data mining; Statistics; Psychometrics","score_opus":0.7563916288387372,"score_gpt":0.5558183455944733,"score_spread":0.20057328324426393,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4405622011","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0049732532,0.001125401,0.9892964,0.0011512467,0.00005154523,0.00008007485,0.0002785446,0.00016148547,0.0028820327],"genre_scores_gemma":[0.2916406,0.0026258181,0.7000664,0.00071777863,0.000805143,0.00081812445,0.0011781356,0.00022589364,0.0019220838],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.97753364,0.0140606165,0.0014015994,0.0021480997,0.0044065844,0.0004493516],"domain_scores_gemma":[0.913956,0.0638996,0.0049640522,0.01084638,0.005551019,0.00078295986],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.019905165,0.0016065203,0.0018630357,0.014864382,0.0012959347,0.0075818254,0.0026725878,0.0018389034,0.003270471],"category_scores_gemma":[0.08319007,0.0007592049,0.0033443498,0.011235579,0.008535625,0.010935001,0.0049248496,0.004466482,0.0007268071],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000054427812,0.000086264154,0.0056783548,0.00033247317,0.00026984775,0.00021405081,0.0012390654,0.02267304,0.00075966597,0.8630878,0.0018832566,0.10372182],"study_design_scores_gemma":[0.000011244878,0.000078132376,0.0024952313,0.000093381386,0.000047049914,0.00014932282,0.0002516714,0.10018691,0.00049396773,0.8902158,0.0059295916,0.000047603204],"about_ca_topic_score_codex":0.002850842,"about_ca_topic_score_gemma":0.0014477947,"teacher_disagreement_score":0.019905165,"about_ca_system_score_codex":0.0033478453,"about_ca_system_score_gemma":0.0020601617,"threshold_uncertainty_score":0.10526985},"labels":[],"label_agreement":null},{"id":"W4412156054","doi":"10.1177/01466216251358492","title":"Including Empirical Prior Information in the Reliable Change Index","year":2025,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Index (typography); Statistics; Econometrics; Mathematics; Psychology; Computer science","score_opus":0.6224068475520583,"score_gpt":0.5555954167953175,"score_spread":0.06681143075674079,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4412156054","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.039775964,0.0006432856,0.9541922,0.00054072065,0.00013325596,0.000416644,0.00065068196,0.0007631676,0.0028841035],"genre_scores_gemma":[0.52216434,0.00047089442,0.4723026,0.0004313485,0.00019925392,0.0011299908,0.0016156599,0.00038457444,0.0013013182],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9666463,0.0209972,0.002004796,0.00406889,0.0056616208,0.00062115566],"domain_scores_gemma":[0.69480497,0.23673347,0.01190254,0.04327318,0.012480131,0.00080571533],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.053754322,0.0013270406,0.0021853808,0.0031986407,0.0006910494,0.0031638625,0.0027556876,0.0023704625,0.00504943],"category_scores_gemma":[0.30425036,0.00096337154,0.0018962023,0.00339486,0.0024351152,0.0045494447,0.002817374,0.004676475,0.0013453248],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014817609,0.0008751136,0.12896106,0.001363776,0.0017018155,0.000651159,0.0018676925,0.15416774,0.0055112904,0.12559006,0.008146776,0.56968176],"study_design_scores_gemma":[0.00028469996,0.0013125888,0.101905905,0.0007775544,0.001083784,0.0012179671,0.00043410627,0.63771266,0.010598385,0.22525847,0.018886331,0.00052757544],"about_ca_topic_score_codex":0.0020626325,"about_ca_topic_score_gemma":0.0018509255,"teacher_disagreement_score":0.9462457,"about_ca_system_score_codex":0.0011018462,"about_ca_system_score_gemma":0.001611942,"threshold_uncertainty_score":0.2842834},"labels":[],"label_agreement":null}]}