{"meta":{"query_hash":"4cda1ec5ea24","filters":{"venue":"Educational and Psychological Measurement"},"cohort_total":101,"direct_labels_cover":1,"predictions_cover":101,"exported":101,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/4cda1ec5ea24","api":"https://metacan.xera.ac/api/v1/cohort?venue=Educational+and+Psychological+Measurement"},"results":[{"id":"W1501970797","doi":"10.1177/0013164415593777","title":"Testing Mediation in Structural Equation Modeling","year":2015,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Attachment and Relationship Dynamics","field":"Psychology","cited_by":93,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa; Carleton University","funders":"","keywords":"Bootstrapping (finance); Structural equation modeling; Monte Carlo method; Latent variable; Mediation; Econometrics; Contrast (vision); Statistical hypothesis testing; Statistics; Computer science; Latent variable model; Mathematics; Artificial intelligence","score_opus":0.43403025857533684,"score_gpt":0.4648977677929242,"score_spread":0.030867509217587352,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1501970797","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09694225,0.001064893,0.89751667,0.00086580386,0.00016957737,0.00086696766,0.00017435336,0.00045377968,0.0019456071],"genre_scores_gemma":[0.67844576,0.00055575056,0.3181223,0.00022546673,0.00007185145,0.0021409038,0.000173665,0.00009444813,0.00016989576],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.67152387,0.30907428,0.003748598,0.006581169,0.007957934,0.0011140703],"domain_scores_gemma":[0.28815937,0.67906773,0.007022022,0.021123517,0.0040732347,0.0005540933],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.23703267,0.0023507022,0.0030254177,0.00442196,0.0023247413,0.0033900978,0.005358595,0.0029438876,0.0049116076],"category_scores_gemma":[0.5670361,0.0017875138,0.004604875,0.0060415403,0.005515979,0.006506245,0.0047511416,0.00496945,0.0003896622],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0024332493,0.0015901036,0.1540186,0.0036881478,0.020773213,0.0009969682,0.0074256905,0.1390159,0.002862118,0.32387605,0.0021479237,0.34117198],"study_design_scores_gemma":[0.001060028,0.0030784651,0.023505477,0.00086709706,0.0024908602,0.00044982368,0.0012224606,0.6202002,0.0040631923,0.3398099,0.00301269,0.00023976754],"about_ca_topic_score_codex":0.0028816208,"about_ca_topic_score_gemma":0.0024612783,"teacher_disagreement_score":0.23703267,"about_ca_system_score_codex":0.001445974,"about_ca_system_score_gemma":0.00488297,"threshold_uncertainty_score":0.9408746},"labels":[],"label_agreement":null},{"id":"W1763331641","doi":"10.1177/0013164415584576","title":"It Might Not Make a Big DIF","year":2015,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":130,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Differential item functioning; Item response theory; Statistics; Polytomous Rasch model; Computer science; Monte Carlo method; Econometrics; Type I and type II errors; Statistical hypothesis testing; Machine learning; Data mining; Artificial intelligence; Psychometrics; Mathematics","score_opus":0.9118226372485674,"score_gpt":0.5444501445426981,"score_spread":0.36737249270586925,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1763331641","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.507188,0.0036132762,0.32010278,0.042221792,0.003926119,0.001132477,0.002983561,0.0009312081,0.117900826],"genre_scores_gemma":[0.9268292,0.0006785416,0.05959286,0.0067532733,0.00041002527,0.0005861601,0.00087526964,0.00016154662,0.004113044],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.97681534,0.0121103,0.0023646087,0.0038341952,0.0038554582,0.0010199228],"domain_scores_gemma":[0.9281565,0.04206962,0.005700678,0.014328975,0.008164345,0.0015798676],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.026595317,0.0010026346,0.0014048376,0.002353047,0.0018717927,0.003930259,0.0012949032,0.0019027295,0.009022163],"category_scores_gemma":[0.13336219,0.00056955084,0.0013877427,0.0027637542,0.004509213,0.0059392448,0.0032459758,0.0032808757,0.002697587],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000886063,0.00052652654,0.27727637,0.0013869725,0.0012279156,0.0011228849,0.010022792,0.00484191,0.0031096577,0.2879284,0.030241854,0.38142863],"study_design_scores_gemma":[0.00026430085,0.0009543953,0.15681735,0.001069598,0.0008158433,0.0031303177,0.0111289825,0.024367949,0.0043027634,0.71054465,0.086266354,0.00033756977],"about_ca_topic_score_codex":0.0026392106,"about_ca_topic_score_gemma":0.0038812214,"teacher_disagreement_score":0.026595317,"about_ca_system_score_codex":0.0018170928,"about_ca_system_score_gemma":0.0020642518,"threshold_uncertainty_score":0.1406511},"labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"simulation_or_modeling","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":[],"domain":null,"study_design":"design_other","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"low"}],"label_agreement":"split"},{"id":"W1966169084","doi":"10.1177/0013164410387382","title":"Invariance of the Measurement Model Underlying the Wechsler Adult Intelligence Scale-IV in the United States and Canada","year":2010,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Cognitive Abilities and Testing","field":"Psychology","cited_by":48,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Calgary; BC Mental Health & Substance Use Services; University of British Columbia","funders":"American Psychological Association; American Educational Research Association","keywords":"Psychology; Wechsler Adult Intelligence Scale; Measurement invariance; Normative; Generality; Construct validity; Intelligence quotient; Latent variable; Wechsler Preschool and Primary Scale of Intelligence; Psychometrics; Cognition; Developmental psychology; Construct (python library); Scale (ratio); Set (abstract data type); Latent variable model; Wechsler Intelligence Scale for Children; Sample (material); Statistics; Confirmatory factor analysis; Structural equation modeling; Mathematics","score_opus":0.23908308271066525,"score_gpt":0.35532753374293286,"score_spread":0.1162444510322676,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1966169084","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8356461,0.0018790732,0.09027081,0.003158946,0.00029977903,0.0017176308,0.0044817077,0.0002851632,0.06226087],"genre_scores_gemma":[0.9835427,0.00040428783,0.012594963,0.00017498093,0.000021230917,0.00032373978,0.0017414273,0.000047321664,0.0011493361],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.98578656,0.0045432006,0.0007904061,0.0018779027,0.0057247053,0.0012771394],"domain_scores_gemma":[0.9847156,0.004395668,0.0010091483,0.0016244326,0.0077518225,0.00050337694],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.017354436,0.00039127097,0.0006133231,0.0018688892,0.0025316773,0.0021200539,0.0011828414,0.00031041127,0.0014573046],"category_scores_gemma":[0.04863909,0.00033977197,0.0010615598,0.0027791746,0.003011089,0.0008633182,0.001425598,0.0010616619,0.00021101841],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027699958,0.00011656941,0.76849115,0.0001542829,0.00057877257,0.00025198184,0.0057114195,0.00925592,0.0010105994,0.08587023,0.006813721,0.12146839],"study_design_scores_gemma":[0.000050561735,0.00009403777,0.95107543,0.00021532441,0.00016863059,0.00017855992,0.0027941887,0.017263252,0.000737808,0.018164586,0.009164607,0.00009299513],"about_ca_topic_score_codex":0.921281,"about_ca_topic_score_gemma":0.8928343,"teacher_disagreement_score":0.07871902,"about_ca_system_score_codex":0.018845836,"about_ca_system_score_gemma":0.03347472,"threshold_uncertainty_score":0.15836519},"labels":[],"label_agreement":null},{"id":"W1973036726","doi":"10.1177/0013164410379335","title":"Confidence Intervals for Squared Semipartial Correlation Coefficients: The Effect of Nonnormality","year":2010,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Statistics; Confidence interval; Mathematics; Percentile; Coverage probability; Robust confidence intervals; Sample size determination; CDF-based nonparametric confidence interval; Regression analysis; Correlation coefficient; Confidence distribution; Correlation; Linear regression; Regression","score_opus":0.23018771376746072,"score_gpt":0.4782251453698139,"score_spread":0.2480374316023532,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1973036726","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.18037322,0.0122004,0.793868,0.0014739764,0.0005701699,0.00046672937,0.001255485,0.0017996208,0.007992443],"genre_scores_gemma":[0.8875648,0.0010507979,0.10873977,0.00036604135,0.00018954964,0.00044526075,0.0007954333,0.00033434614,0.0005141498],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.81569386,0.12487312,0.010130211,0.015068358,0.032419764,0.0018146972],"domain_scores_gemma":[0.08986766,0.83863837,0.020034246,0.035885263,0.014733678,0.00084074546],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.14152561,0.0012771818,0.0024012874,0.0061262087,0.0011299875,0.004141991,0.0050481223,0.0040591755,0.002640755],"category_scores_gemma":[0.7278201,0.00095927936,0.0023729424,0.0054450226,0.004140815,0.0058596693,0.004144151,0.004593807,0.00049144187],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005682211,0.00038069565,0.22582586,0.003843403,0.0073092864,0.0019514242,0.008101428,0.11194485,0.005164646,0.10548676,0.00943855,0.5148708],"study_design_scores_gemma":[0.0006973886,0.002537248,0.2209021,0.004374925,0.0030637714,0.0056337975,0.0031037217,0.5281291,0.021806927,0.18402605,0.024730649,0.0009942973],"about_ca_topic_score_codex":0.0030186337,"about_ca_topic_score_gemma":0.0014031663,"teacher_disagreement_score":0.14152561,"about_ca_system_score_codex":0.0012242688,"about_ca_system_score_gemma":0.0011426978,"threshold_uncertainty_score":0.7484679},"labels":[],"label_agreement":null},{"id":"W1973081171","doi":"10.1177/0013164408322017","title":"A Cross-Cultural Examination of the Psychometric Properties of Responses to the Achievement Goal Questionnaire","year":2008,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Education, Achievement, and Giftedness","field":"Psychology","cited_by":51,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Psychology; Confirmatory factor analysis; Structural equation modeling; Measurement invariance; Metric (unit); Psychometrics; Test validity; Academic achievement; Developmental psychology; Social psychology; Statistics; Mathematics","score_opus":0.205160770575988,"score_gpt":0.388235285087074,"score_spread":0.183074514511086,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1973081171","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9977609,0.00006449643,0.00050118554,0.000051075403,0.00001898899,0.000044915847,0.00012871521,0.0000048093393,0.0014247802],"genre_scores_gemma":[0.9980737,0.00007499825,0.00095867703,0.000060331444,0.000006890254,0.00006666215,0.00040929325,0.000008249874,0.00034106337],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99648774,0.0014836022,0.0004499592,0.00037298765,0.001038771,0.00016694171],"domain_scores_gemma":[0.97377837,0.011790529,0.0035977657,0.0027006066,0.007170162,0.0009625412],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010848724,0.00030168038,0.00036217153,0.0015408281,0.0008746164,0.000646867,0.00034678547,0.00034010253,0.0008524554],"category_scores_gemma":[0.023870962,0.00023796494,0.0006608287,0.0015550968,0.0009375964,0.00044921995,0.0010054552,0.00074385985,0.000199613],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018656212,0.00028699246,0.9473292,0.000071092545,0.00037313902,0.0001282482,0.015311923,0.0002060017,0.0036549743,0.0003757741,0.0005183576,0.031557713],"study_design_scores_gemma":[0.000013605403,0.00023834941,0.99266875,0.000022519525,0.000045420467,0.00018441537,0.0042592515,0.00036322462,0.0008077688,0.00011585101,0.001257172,0.00002357756],"about_ca_topic_score_codex":0.008786448,"about_ca_topic_score_gemma":0.013598733,"teacher_disagreement_score":0.010848724,"about_ca_system_score_codex":0.0006670722,"about_ca_system_score_gemma":0.00087295583,"threshold_uncertainty_score":0.05737424},"labels":[],"label_agreement":null},{"id":"W1975494033","doi":"10.1177/0013164413487738","title":"False Positives in Multiple Regression","year":2013,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":42,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Type I and type II errors; Statistics; Regression; False positive paradox; Regression analysis; Econometrics; Observational error; Regression diagnostic; Nominal level; Inflation (cosmology); Computer science; Linear regression; False positives and false negatives; Mathematics; Polynomial regression; Confidence interval","score_opus":0.450798048209222,"score_gpt":0.4850311437518074,"score_spread":0.03423309554258541,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1975494033","genre_codex":"methods","genre_gemma":"methods","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.034633208,0.013775577,0.9046436,0.016183363,0.006716312,0.0018145865,0.000626518,0.0010391901,0.02056756],"genre_scores_gemma":[0.5604682,0.004587308,0.39622825,0.023475807,0.0037245075,0.004779649,0.00048456318,0.00053979555,0.005711957],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.3761152,0.47960368,0.029408796,0.0374252,0.075044155,0.0024029275],"domain_scores_gemma":[0.12664762,0.76625586,0.043633476,0.04157297,0.02087446,0.0010156987],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.39021522,0.0024339443,0.00471727,0.006002978,0.0025615336,0.007766079,0.005515475,0.008163368,0.0030596007],"category_scores_gemma":[0.7631719,0.0017363499,0.0037061856,0.0055253515,0.0134350285,0.008979673,0.0063312585,0.01024615,0.0012641961],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0024001515,0.00044155982,0.08810469,0.006320099,0.005298319,0.0061073103,0.015040606,0.021035187,0.0020275463,0.44906813,0.03849889,0.36565757],"study_design_scores_gemma":[0.0005227712,0.0008230583,0.027346581,0.005658079,0.0015598926,0.0060820826,0.00260744,0.063855276,0.007832984,0.8337375,0.04934424,0.0006301118],"about_ca_topic_score_codex":0.0015351818,"about_ca_topic_score_gemma":0.0012601352,"teacher_disagreement_score":0.6097848,"about_ca_system_score_codex":0.0040688044,"about_ca_system_score_gemma":0.0032534346,"threshold_uncertainty_score":0.7519732},"labels":[],"label_agreement":null},{"id":"W1976267793","doi":"10.1177/0013164403258444","title":"Gender and Language Differences on the Test of Workplace Essential Skills: Using Overall Mean Scores and Item-Level Differential Item Functioning Analyses","year":2004,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Teacher Professional Development and Motivation","field":"Social Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Psychology; Differential item functioning; Numeracy; Test (biology); Reading (process); Developmental psychology; Item response theory; Psychometrics; Literacy; Pedagogy","score_opus":0.29669886693486586,"score_gpt":0.40945114458084786,"score_spread":0.112752277645982,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1976267793","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99837095,0.000056182464,0.00033694177,0.000031626092,0.0000070558062,0.000021294829,0.00026884663,0.000004213576,0.00090298516],"genre_scores_gemma":[0.99851173,0.000027489592,0.0005623043,0.00001555639,0.0000060053353,0.000028437717,0.00037786353,0.000004788241,0.00046583486],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9986639,0.00032755695,0.00011872733,0.00024140724,0.0004145562,0.00023387885],"domain_scores_gemma":[0.99750525,0.0010826669,0.00043339026,0.00017582084,0.0005466083,0.00025617916],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002854484,0.00045258884,0.00033319395,0.0015606848,0.0003756319,0.00055325933,0.00038677052,0.0002414095,0.0019349258],"category_scores_gemma":[0.007069681,0.00017269749,0.00051706715,0.0006934306,0.0005575316,0.00054233096,0.0005876603,0.00036451654,0.00028538975],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013701148,0.00004852591,0.9910926,0.000008997596,0.000048069003,0.00006532903,0.0007666841,0.000031780703,0.0012463466,0.000058540292,0.00010073529,0.006395286],"study_design_scores_gemma":[0.000005216545,0.000119618715,0.9984755,0.0000040212276,0.000020086418,0.000092977905,0.00047690637,0.00016231339,0.00037781685,0.000073133866,0.00018783558,0.000004493222],"about_ca_topic_score_codex":0.016390366,"about_ca_topic_score_gemma":0.02783994,"teacher_disagreement_score":0.016390366,"about_ca_system_score_codex":0.00040052267,"about_ca_system_score_gemma":0.00061980676,"threshold_uncertainty_score":0.032589912},"labels":[],"label_agreement":null},{"id":"W1977230984","doi":"10.1177/00164402062003002","title":"Pairwise Multiple Comparison Tests when Data are Nonnormal","year":2002,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Statistical Methods in Clinical Trials","field":"Mathematics","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Statistics; Type I and type II errors; Pairwise comparison; Heteroscedasticity; Statistic; Mathematics; Statistical hypothesis testing; Test statistic; Truncated mean; Econometrics; Multiple comparisons problem; Estimator","score_opus":0.9427542988485699,"score_gpt":0.6099393060666746,"score_spread":0.3328149927818953,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1977230984","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08985565,0.0027029517,0.85024875,0.0022912528,0.004421245,0.010469358,0.0034233548,0.0034778952,0.03310949],"genre_scores_gemma":[0.31518537,0.0011090832,0.65561414,0.0008883321,0.0004983471,0.020333955,0.0015490365,0.00059878355,0.0042229528],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.89954257,0.06459972,0.009168925,0.007383708,0.017884003,0.0014210395],"domain_scores_gemma":[0.56760496,0.37068024,0.0191603,0.02332052,0.017333668,0.0019002312],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06277763,0.0016614445,0.0034158567,0.0043614376,0.001628859,0.0024408058,0.0042070057,0.0022430804,0.023696782],"category_scores_gemma":[0.33999985,0.0007344553,0.0017773279,0.0056884144,0.0032748545,0.0044054408,0.00391187,0.005762063,0.0020967906],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.008032095,0.003108909,0.03800447,0.011377189,0.0050440445,0.0036512986,0.012109645,0.005589785,0.013174079,0.10712468,0.070806,0.72197783],"study_design_scores_gemma":[0.003040181,0.021279244,0.13565728,0.0048575746,0.0025320326,0.007095351,0.010727943,0.08853656,0.040756583,0.45039123,0.23417492,0.0009510909],"about_ca_topic_score_codex":0.0004106751,"about_ca_topic_score_gemma":0.00083080074,"teacher_disagreement_score":0.06277763,"about_ca_system_score_codex":0.0012415722,"about_ca_system_score_gemma":0.002709549,"threshold_uncertainty_score":0.33200377},"labels":[],"label_agreement":null},{"id":"W1977836768","doi":"10.1177/0013164402239324","title":"Psychometric Properties Of The French Canadian Version Of The State-Trait Anxiety Inventory For Children","year":2003,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Child and Adolescent Psychosocial and Emotional Development","field":"Psychology","cited_by":70,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Institut universitaire en santé mentale de Montréal","funders":"","keywords":"State-Trait Anxiety Inventory; Psychology; Anxiety; Psychometrics; Trait anxiety; Trait; Clinical psychology; Developmental psychology; Internal consistency; Psychiatry","score_opus":0.07757421657594854,"score_gpt":0.27656635187134304,"score_spread":0.1989921352953945,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1977836768","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.97686416,0.0027170873,0.0017829369,0.00038402234,0.000101673926,0.00028157077,0.00404109,0.00010188086,0.013725555],"genre_scores_gemma":[0.9870948,0.0016369071,0.004636479,0.000094800576,0.0000357681,0.00027698488,0.0040671164,0.000022419787,0.0021346512],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9981006,0.0003551083,0.0001598874,0.00015210218,0.001003726,0.00022858361],"domain_scores_gemma":[0.99435943,0.0011248563,0.00060722465,0.00022101423,0.003337338,0.00035020878],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0034835716,0.0004766224,0.000413977,0.001818897,0.0008316724,0.0009079008,0.0004594401,0.00025887007,0.0016485536],"category_scores_gemma":[0.010868222,0.00016817871,0.00086081534,0.0018344739,0.0004141398,0.00032226255,0.00051847444,0.00051837065,0.00024355101],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025034125,0.00011416295,0.88295233,0.00019889609,0.00020686082,0.00009587646,0.0016001423,0.000736399,0.000794677,0.00089920283,0.003926785,0.10822432],"study_design_scores_gemma":[0.0000121825005,0.000111441914,0.9950787,0.00004048004,0.00005368332,0.00009082413,0.000319608,0.0003783731,0.00019952795,0.00009927675,0.0035976993,0.00001829609],"about_ca_topic_score_codex":0.49047238,"about_ca_topic_score_gemma":0.5938983,"teacher_disagreement_score":0.49047238,"about_ca_system_score_codex":0.004738129,"about_ca_system_score_gemma":0.0055926694,"threshold_uncertainty_score":0.97523504},"labels":[],"label_agreement":null},{"id":"W1977904348","doi":"10.1177/0013164404264840","title":"Testing the Structure of Psychological Empowerment: Does Gender Make a Difference?","year":2004,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Community Health and Development","field":"Health Professions","cited_by":83,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University; Université de Montréal","funders":"","keywords":"Psychology; Confirmatory factor analysis; Competence (human resources); Social psychology; Construct validity; Structural equation modeling; Developmental psychology; Group analysis; Empowerment; Psychometrics; Statistics; Mathematics","score_opus":0.39198687972440754,"score_gpt":0.47928748055148107,"score_spread":0.08730060082707353,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1977904348","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99368423,0.00015303206,0.0019838896,0.0007740734,0.00011360756,0.00008537213,0.00013240526,0.000006263367,0.0030670885],"genre_scores_gemma":[0.99848807,0.000050811643,0.000823182,0.00012829596,0.000020190437,0.00008298163,0.00009424624,0.000007207558,0.00030495596],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99475324,0.0030012527,0.0002903087,0.0008057023,0.0007337735,0.00041569056],"domain_scores_gemma":[0.95828146,0.03156959,0.003719569,0.003129241,0.0020416535,0.0012585857],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013686054,0.0003938175,0.00045007566,0.00078231335,0.0007229849,0.0009626962,0.00078555173,0.0006173751,0.0077777207],"category_scores_gemma":[0.054098994,0.00023111147,0.00086647045,0.00064428925,0.0028125716,0.0021933068,0.001477542,0.00084042555,0.0004378335],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015452091,0.00066800404,0.9084852,0.00016967297,0.00026707002,0.0003342053,0.02085996,0.00021002108,0.0043444107,0.0075068227,0.00073671446,0.05487264],"study_design_scores_gemma":[0.00015508945,0.0019948771,0.96742034,0.00014498341,0.0001465266,0.00031962138,0.017903332,0.0020326907,0.0017811346,0.0059012338,0.0021683003,0.000031831925],"about_ca_topic_score_codex":0.002920931,"about_ca_topic_score_gemma":0.0021542062,"teacher_disagreement_score":0.013686054,"about_ca_system_score_codex":0.0006900464,"about_ca_system_score_gemma":0.0015752945,"threshold_uncertainty_score":0.07237965},"labels":[],"label_agreement":null},{"id":"W1978985895","doi":"10.1177/0013164409344498","title":"Testing the Second-Order Factor Structure and Measurement Equivalence of the Wong and Law Emotional Intelligence Scale Across Gender and Ethnicity","year":2009,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Emotional Intelligence and Performance","field":"Psychology","cited_by":65,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Marriott International (Canada)","funders":"","keywords":"Equivalence (formal languages); Psychology; Ethnic group; Emotional intelligence; Scale (ratio); Social psychology; Context (archaeology); Mathematics; Law; Political science","score_opus":0.33375031387670345,"score_gpt":0.4099216136148018,"score_spread":0.07617129973809833,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1978985895","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99402124,0.000047851463,0.003982076,0.00006261039,0.000022536104,0.000057776062,0.000045919933,0.000010759533,0.00174909],"genre_scores_gemma":[0.99787855,0.000018715333,0.0017060775,0.0000145942795,0.0000075109433,0.000065215056,0.00012520615,0.00000462648,0.00017954771],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9971015,0.0013013467,0.00028560523,0.00034855498,0.00078493415,0.00017802515],"domain_scores_gemma":[0.98681414,0.0074582812,0.0018158683,0.0014065955,0.0020632409,0.00044188285],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007973208,0.00040681055,0.00035113402,0.0010407418,0.0004651953,0.00067084486,0.00035459892,0.00025414428,0.00226442],"category_scores_gemma":[0.032617,0.00016900223,0.0005768852,0.0006397177,0.0010656574,0.0009207876,0.0010886809,0.0005580245,0.00028309494],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003924284,0.00028778618,0.9345315,0.00004181516,0.00017689931,0.00014162515,0.0043289093,0.0007791134,0.0033978922,0.0036061776,0.0003511756,0.051964737],"study_design_scores_gemma":[0.000081661514,0.001224604,0.98002625,0.000037297694,0.000050530718,0.0002683688,0.0026168197,0.008527734,0.0019288327,0.0040029264,0.0012123729,0.000022719618],"about_ca_topic_score_codex":0.0018351435,"about_ca_topic_score_gemma":0.0020918725,"teacher_disagreement_score":0.007973208,"about_ca_system_score_codex":0.00038650288,"about_ca_system_score_gemma":0.0009307953,"threshold_uncertainty_score":0.04216689},"labels":[],"label_agreement":null},{"id":"W1981221874","doi":"10.1177/0013164403261051","title":"A Note on How to Quantify and Report Whether Irt Parameter Invariance Holds: When Pearson Correlations are Not Enough","year":2004,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":37,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Item response theory; Measurement invariance; Pearson product-moment correlation coefficient; Mathematics; Econometrics; Statistics; Scale (ratio); Measure (data warehouse); Correlation; Psychology; Psychometrics; Confirmatory factor analysis; Computer science; Structural equation modeling; Data mining","score_opus":0.7338274295775041,"score_gpt":0.4936132193884701,"score_spread":0.24021421018903405,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1981221874","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.03634246,0.0056259283,0.8888081,0.04407723,0.0056412886,0.00041145942,0.0009260071,0.001871537,0.016296001],"genre_scores_gemma":[0.43538758,0.0023201073,0.5333365,0.016655194,0.0033697889,0.00156164,0.0011969352,0.0017661854,0.004405999],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8392582,0.10590537,0.016571384,0.011730448,0.024794336,0.0017403071],"domain_scores_gemma":[0.47578344,0.37843347,0.02895502,0.07097142,0.04410402,0.0017526484],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1506162,0.0020782573,0.0031994737,0.004878646,0.0034892987,0.008190199,0.0046109334,0.00501013,0.004168706],"category_scores_gemma":[0.619444,0.0011190329,0.0017450217,0.0070382566,0.013183006,0.01757051,0.006083035,0.012616939,0.0030016091],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000563,0.00032098568,0.08642982,0.0017231652,0.0011457143,0.00212811,0.0150858825,0.003987019,0.007481706,0.40710378,0.1081945,0.3658364],"study_design_scores_gemma":[0.00008690739,0.00075933186,0.046236906,0.0016486573,0.00028938675,0.0041746213,0.00951839,0.023322286,0.0099882325,0.8226894,0.08062448,0.0006612969],"about_ca_topic_score_codex":0.0040511237,"about_ca_topic_score_gemma":0.0031728863,"teacher_disagreement_score":0.84938383,"about_ca_system_score_codex":0.0017413965,"about_ca_system_score_gemma":0.0028690828,"threshold_uncertainty_score":0.79654413},"labels":[],"label_agreement":null},{"id":"W1981571713","doi":"10.1177/0013164403258407","title":"Balancing the Need for Reliability and Time Efficiency: Short Forms of the Wechsler Adult Intelligence Scale-III","year":2004,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Cognitive Abilities and Testing","field":"Psychology","cited_by":72,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"","keywords":"Wechsler Adult Intelligence Scale; Wechsler Preschool and Primary Scale of Intelligence; Psychology; Reliability (semiconductor); Short Forms; Scale (ratio); Wechsler Intelligence Scale for Children; Intelligence quotient; Statistics; Psychometrics; Raw score; Developmental psychology; Clinical psychology; Mathematics; Cognition; Psychiatry; Cartography; Raw data","score_opus":0.08200673823526182,"score_gpt":0.3386034828471236,"score_spread":0.25659674461186177,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1981571713","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.46068132,0.007760885,0.3659449,0.007617565,0.003553404,0.007930641,0.013153192,0.0028488294,0.13050927],"genre_scores_gemma":[0.5906684,0.0027068516,0.36407697,0.001539044,0.0009082091,0.011212013,0.011862102,0.0009722202,0.016054222],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.97680855,0.011906745,0.0040412047,0.0007886215,0.00611239,0.00034243238],"domain_scores_gemma":[0.943731,0.027824707,0.0039037752,0.007793777,0.016232515,0.0005142044],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.026198754,0.0006137763,0.0009955235,0.003469749,0.00058251346,0.0013058112,0.000777333,0.0005056787,0.0030488742],"category_scores_gemma":[0.104757,0.00035749067,0.00084393646,0.0030694238,0.0009644304,0.001573907,0.0017300039,0.0012136925,0.0020492033],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009915286,0.00033493034,0.11767707,0.0007296276,0.00052977813,0.00024063721,0.0035928038,0.0015602983,0.0040452825,0.015081482,0.08286619,0.7723504],"study_design_scores_gemma":[0.00042169192,0.0016944736,0.75530154,0.000844778,0.00053458894,0.002312943,0.0020612953,0.008213628,0.009901731,0.038099043,0.18032527,0.00028910162],"about_ca_topic_score_codex":0.0011387939,"about_ca_topic_score_gemma":0.0035615966,"teacher_disagreement_score":0.97380126,"about_ca_system_score_codex":0.0005579282,"about_ca_system_score_gemma":0.0012641912,"threshold_uncertainty_score":0.13855392},"labels":[],"label_agreement":null},{"id":"W1989677836","doi":"10.1177/0013164408322027","title":"Comparing Treatment and Control Groups on Multiple Outcomes","year":2008,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Statistical Methods in Clinical Trials","field":"Mathematics","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba; University of British Columbia; Simon Fraser University; University of Saskatchewan","funders":"","keywords":"Statistics; Mathematics; Normality; Type I and type II errors; Covariance; Homogeneity (statistics); Population; Statistical hypothesis testing; Treatment and control groups; Multivariate normal distribution; Analysis of covariance; A priori and a posteriori; Multivariate statistics; Econometrics","score_opus":0.8792290284703227,"score_gpt":0.5762263579324098,"score_spread":0.30300267053791285,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1989677836","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.83526516,0.014607214,0.11944022,0.0021471418,0.0031092605,0.00983875,0.0013245337,0.00036388033,0.013903948],"genre_scores_gemma":[0.94619775,0.0014355686,0.03757886,0.0009871959,0.00047054977,0.011739849,0.0005926113,0.000048726008,0.0009487801],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.91148084,0.06886275,0.004774786,0.004904822,0.008771035,0.0012057527],"domain_scores_gemma":[0.81643265,0.16008666,0.010546818,0.008844273,0.0031357273,0.0009538234],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.070192106,0.0011611853,0.0038532473,0.002813085,0.00088919763,0.0017131991,0.0016287931,0.0041764393,0.0062547415],"category_scores_gemma":[0.22184137,0.0003771553,0.002976521,0.0015300936,0.002180768,0.0025511647,0.002353525,0.0022828009,0.0005805904],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.2752313,0.0141553655,0.064210914,0.008282738,0.018039586,0.0007474482,0.0043584276,0.004858613,0.0056929844,0.042479426,0.004417355,0.55752593],"study_design_scores_gemma":[0.07691313,0.31907383,0.24389206,0.004907254,0.019351024,0.0014104056,0.006095948,0.04368875,0.025706662,0.23333502,0.024748009,0.0008778861],"about_ca_topic_score_codex":0.0003980865,"about_ca_topic_score_gemma":0.0003001507,"teacher_disagreement_score":0.9298079,"about_ca_system_score_codex":0.00084670645,"about_ca_system_score_gemma":0.0014350449,"threshold_uncertainty_score":0.37121576},"labels":[],"label_agreement":null},{"id":"W1995196170","doi":"10.1177/0013164403256358","title":"Approximate Confidence Intervals for Effect Sizes","year":2003,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Statistical Methods in Clinical Trials","field":"Mathematics","cited_by":70,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Statistics; Confidence interval; Interval (graph theory); Contrast (vision); Coverage probability; Mathematics; Population; Credible interval; Tolerance interval; Econometrics; Demography; Computer science; Combinatorics","score_opus":0.7704275307910567,"score_gpt":0.5976349069448019,"score_spread":0.17279262384625482,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1995196170","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0058090906,0.0068156384,0.97727853,0.0007973336,0.00066626136,0.00048832013,0.0004032902,0.0007844003,0.0069570746],"genre_scores_gemma":[0.28691903,0.0049370322,0.69554836,0.0017356252,0.001549387,0.0059229075,0.0011386926,0.00069698645,0.0015519653],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.79371184,0.14504868,0.011603238,0.01383749,0.033814706,0.0019840333],"domain_scores_gemma":[0.23890181,0.6879552,0.023063336,0.027970772,0.02116275,0.0009460434],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.15918179,0.0023454889,0.004802814,0.010241572,0.0012597205,0.0062584477,0.006613303,0.006251829,0.0069791824],"category_scores_gemma":[0.6684543,0.0012198328,0.0041880566,0.0063484316,0.00562123,0.008308349,0.0057610413,0.009521582,0.0017836094],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019350543,0.00023940907,0.008565735,0.0062651583,0.0029126108,0.00066052866,0.0040526353,0.058570158,0.0019096342,0.5783422,0.015084079,0.3214628],"study_design_scores_gemma":[0.0009828587,0.0020334895,0.011265345,0.008276918,0.0018443888,0.002851969,0.0015689227,0.18905778,0.007830199,0.6869249,0.0867114,0.00065182184],"about_ca_topic_score_codex":0.0015884587,"about_ca_topic_score_gemma":0.00062103785,"teacher_disagreement_score":0.8408182,"about_ca_system_score_codex":0.0030639933,"about_ca_system_score_gemma":0.0019602142,"threshold_uncertainty_score":0.84184384},"labels":[],"label_agreement":null},{"id":"W1996585332","doi":"10.1177/0013164413514053","title":"Examining Student Factors in Sources of Setting Accommodation DIF","year":2013,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Disability Education and Employment","field":"Social Sciences","cited_by":18,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Saskatchewan","funders":"University of Toronto","keywords":"Covariate; Psychology; Accommodation; Multilevel model; Differential item functioning; Item response theory; Latent class model; Odds; Scale (ratio); Logistic regression; Reading (process); Statistics; Developmental psychology; Psychometrics; Mathematics","score_opus":0.2872603315525131,"score_gpt":0.41974628872881425,"score_spread":0.13248595717630113,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1996585332","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99632025,0.00007046691,0.0027824594,0.00009871064,0.0000059423382,0.000030421417,0.00011101723,0.000011985252,0.0005688331],"genre_scores_gemma":[0.9989808,0.000020288633,0.0007853471,0.000013375967,0.0000033899178,0.00001856159,0.0000884302,0.0000032998962,0.00008660732],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.97903126,0.01356486,0.0019321529,0.0012876369,0.0033550176,0.0008290794],"domain_scores_gemma":[0.9117693,0.057397697,0.016558012,0.007229015,0.0056961887,0.0013498489],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.018013569,0.0004906515,0.000753314,0.002518858,0.0009346303,0.0019084058,0.0009310955,0.0005712348,0.0014957108],"category_scores_gemma":[0.0876783,0.00034867987,0.0008212841,0.002468509,0.0011969723,0.0013286878,0.0040080827,0.0010488224,0.0001642019],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006367475,0.000052018462,0.98536795,0.000025106025,0.000056168392,0.000066535984,0.0046479073,0.0001354152,0.00017321174,0.00035295487,0.00007040548,0.008988764],"study_design_scores_gemma":[0.000008562685,0.0002705002,0.9824554,0.000064872125,0.00005029033,0.0003216033,0.011941705,0.002379657,0.00074433745,0.0009955554,0.0007332016,0.000034426495],"about_ca_topic_score_codex":0.0029830316,"about_ca_topic_score_gemma":0.0045742835,"teacher_disagreement_score":0.018013569,"about_ca_system_score_codex":0.001161744,"about_ca_system_score_gemma":0.0010330677,"threshold_uncertainty_score":0.095265985},"labels":[],"label_agreement":null},{"id":"W2001638213","doi":"10.1177/0013164406288162","title":"Automated Simultaneous Assembly of Multistage Testlets for a High-Stakes Licensing Examination","year":2007,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Spreadsheets and End-User Computing","field":"Computer Science","cited_by":28,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia, Okanagan Campus; University of British Columbia","funders":"","keywords":"Computerized adaptive testing; Test (biology); Computer science; Certification; Constraint (computer-aided design); Integer programming; Test Management Approach; Extension (predicate logic); Algorithm; Operations research; Reliability engineering; Programming language; Mathematics; Psychometrics; Statistics; Engineering","score_opus":0.1158456593923128,"score_gpt":0.34457860127844137,"score_spread":0.22873294188612858,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2001638213","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07970939,0.000074946016,0.90494806,0.00021096726,0.000083291256,0.0023047107,0.0004298201,0.0063435906,0.0058952416],"genre_scores_gemma":[0.13929568,0.0000578798,0.8548047,0.000060237606,0.000046743302,0.0011923442,0.0006043904,0.0004260483,0.0035120477],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99335974,0.003570787,0.000512451,0.0008021641,0.0013929822,0.00036197115],"domain_scores_gemma":[0.95729715,0.028889058,0.002574678,0.0059710247,0.0042079655,0.0010602033],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006776715,0.0009746244,0.0012517596,0.001860381,0.0006974376,0.0019432054,0.002005804,0.0009441206,0.016437888],"category_scores_gemma":[0.035577875,0.0012397269,0.0008095472,0.0015407541,0.00058682746,0.0015011651,0.002046428,0.0012685661,0.005707617],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001757474,0.0016215781,0.011887752,0.0003463914,0.00008953126,0.00045736093,0.00068216154,0.052966587,0.04328314,0.008004614,0.006543816,0.8723596],"study_design_scores_gemma":[0.000626323,0.0057897796,0.04675235,0.00021732066,0.0002554831,0.0012045366,0.00096306106,0.6887117,0.1687695,0.03629547,0.050027054,0.00038731773],"about_ca_topic_score_codex":0.0016804392,"about_ca_topic_score_gemma":0.0033792146,"teacher_disagreement_score":0.016437888,"about_ca_system_score_codex":0.0009855527,"about_ca_system_score_gemma":0.0019057809,"threshold_uncertainty_score":0.054990232},"labels":[],"label_agreement":null},{"id":"W2004501768","doi":"10.1177/0013164402239317","title":"Differential Item Functioning Results May Change Depending On How An Item Is Scored: An Illustration With The Center For Epidemiologic Studies Depression Scale","year":2003,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":97,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Differential item functioning; Psychology; Item response theory; Logistic regression; Statistics; Psychometrics; Ordered logit; Scale (ratio); Clinical psychology; Center for Epidemiologic Studies Depression Scale; Persistence (discontinuity); Depressive symptoms; Mathematics; Cognition; Psychiatry","score_opus":0.8833118557082188,"score_gpt":0.5341469955629262,"score_spread":0.3491648601452926,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2004501768","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5910213,0.0039508613,0.37366343,0.005951896,0.0008108044,0.0013283711,0.0012699424,0.00044876052,0.021554643],"genre_scores_gemma":[0.8847415,0.00047090292,0.11059059,0.0010602074,0.0001390784,0.0014331962,0.00039605604,0.00015739222,0.0010111297],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8474614,0.12999642,0.008542595,0.0035511567,0.009527577,0.0009207956],"domain_scores_gemma":[0.78539497,0.17913638,0.006884169,0.015333996,0.012905109,0.00034544372],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.110103294,0.0008094083,0.0008445587,0.0025492047,0.0010544313,0.0014437882,0.0007531806,0.00074487145,0.0018444336],"category_scores_gemma":[0.24252976,0.0004457911,0.0010929784,0.003879474,0.0021005454,0.0016050289,0.0017909424,0.0014805616,0.0006207458],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013235213,0.0003024794,0.51997954,0.00091783836,0.0009734336,0.0007584551,0.014972398,0.001881381,0.0068087955,0.02379938,0.008826286,0.41945654],"study_design_scores_gemma":[0.00026387358,0.001222141,0.87735325,0.00091962516,0.0005125468,0.0046745506,0.0050468785,0.015716393,0.011638758,0.049859177,0.032517195,0.0002755079],"about_ca_topic_score_codex":0.0008041074,"about_ca_topic_score_gemma":0.0019617875,"teacher_disagreement_score":0.110103294,"about_ca_system_score_codex":0.000876496,"about_ca_system_score_gemma":0.0005070374,"threshold_uncertainty_score":0.58228886},"labels":[],"label_agreement":null},{"id":"W2004549974","doi":"10.1177/0013164403258402","title":"The Effect of Multicollinearity on Multilevel Modeling Parameter Estimates and Standard Errors","year":2003,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":127,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Multicollinearity; Statistics; Mathematics; Multilevel model; Standard error; Covariance; Variance inflation factor; Variance (accounting); Econometrics; Correlation; Standard deviation; Linear regression","score_opus":0.35109228647864826,"score_gpt":0.4841609772101677,"score_spread":0.13306869073151945,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2004549974","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.16761747,0.0030186013,0.8206576,0.0019501891,0.0005252395,0.0008279909,0.000765846,0.0009323199,0.0037047458],"genre_scores_gemma":[0.8504645,0.0006871521,0.14536688,0.0004638892,0.00013033062,0.0010564626,0.0005632136,0.00051695626,0.00075056544],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.6671812,0.24958797,0.024365284,0.01945669,0.036727022,0.0026818193],"domain_scores_gemma":[0.18380651,0.70606005,0.028355459,0.06260685,0.018407809,0.0007632436],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.265844,0.0018776524,0.002347583,0.0043644123,0.002174397,0.0051248837,0.0023413717,0.0022870721,0.001741762],"category_scores_gemma":[0.7292315,0.0018761649,0.0030012296,0.007371744,0.003610288,0.005040203,0.0043199537,0.006050773,0.00048402086],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013221799,0.00046556117,0.49286473,0.0016306996,0.012512197,0.0008695704,0.018247876,0.08573009,0.005404716,0.08835412,0.007091534,0.2855067],"study_design_scores_gemma":[0.00047892967,0.0016304315,0.41697234,0.0025014626,0.0044875643,0.0022115726,0.005069297,0.31442913,0.023988908,0.20969407,0.017317086,0.0012192092],"about_ca_topic_score_codex":0.005476817,"about_ca_topic_score_gemma":0.006574877,"teacher_disagreement_score":0.265844,"about_ca_system_score_codex":0.0023252922,"about_ca_system_score_gemma":0.0024082186,"threshold_uncertainty_score":0.9053451},"labels":[],"label_agreement":null},{"id":"W2009687691","doi":"10.1177/0013164403251283","title":"The Effects of Nonnormality on Parametric, Nonparametric, and Model Comparison Approaches to Pairwise Comparisons","year":2003,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Statistical Methods in Clinical Trials","field":"Mathematics","cited_by":27,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba; York University","funders":"","keywords":"Type I and type II errors; Statistics; Nonparametric statistics; Statistic; Pairwise comparison; Econometrics; Mathematics; Normality; F-test of equality of variances; Parametric statistics; Levene's test; Sample size determination; Statistical hypothesis testing; Test statistic; Nominal level; Homogeneity (statistics); Confidence interval","score_opus":0.8627862254850819,"score_gpt":0.551136597639037,"score_spread":0.3116496278460449,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2009687691","genre_codex":"methods","genre_gemma":"empirical","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0072292355,0.0019328484,0.97831434,0.0019406695,0.0017251087,0.001541808,0.0001461194,0.0006454343,0.0065245237],"genre_scores_gemma":[0.09396631,0.002028507,0.88806313,0.0027751718,0.0008233045,0.010049779,0.00016295206,0.00066435087,0.0014664707],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.34674892,0.56434345,0.018159663,0.016650857,0.052334134,0.001763003],"domain_scores_gemma":[0.19359492,0.7135195,0.02129693,0.0523364,0.018150607,0.0011017156],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.37031418,0.0046020364,0.0048837303,0.0063330973,0.0040060747,0.007194043,0.0070947455,0.003688915,0.007265429],"category_scores_gemma":[0.6709563,0.002009535,0.0041077244,0.008796138,0.023062224,0.01130647,0.009894947,0.019076625,0.001479182],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017259247,0.0007977262,0.011253756,0.008164276,0.003868678,0.0013487588,0.014977401,0.020244505,0.005147753,0.51461875,0.02435509,0.3934974],"study_design_scores_gemma":[0.00035591415,0.0023361607,0.009173786,0.0022086487,0.0006329909,0.0014357135,0.002399349,0.06262351,0.007954362,0.8569311,0.053391464,0.0005570827],"about_ca_topic_score_codex":0.0017951457,"about_ca_topic_score_gemma":0.0035665485,"teacher_disagreement_score":0.6296858,"about_ca_system_score_codex":0.005304707,"about_ca_system_score_gemma":0.0069719455,"threshold_uncertainty_score":0.7765147},"labels":[],"label_agreement":null},{"id":"W2012610170","doi":"10.1177/0013164403260196","title":"The Analysis of Repeated Measurements with Mixed-Model Adjusted F Tests","year":2004,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Statistical Methods in Clinical Trials","field":"Mathematics","cited_by":130,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Type I and type II errors; Statistics; Repeated measures design; Sample size determination; Mixed model; Mathematics; Covariance; Univariate; Statistic; Homogeneity (statistics); Normality; Analysis of covariance; Heteroscedasticity; Statistical hypothesis testing; Econometrics; Multivariate statistics","score_opus":0.7953401039095214,"score_gpt":0.5668979603801602,"score_spread":0.2284421435293612,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2012610170","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.025150744,0.0006444898,0.9560199,0.00029168313,0.0013902121,0.0061464813,0.0030253737,0.0029428233,0.0043882327],"genre_scores_gemma":[0.091918916,0.00041170104,0.87485313,0.00026261323,0.00031054782,0.025980595,0.001470807,0.0012735593,0.003518119],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9197448,0.046445325,0.005754528,0.011659729,0.014603309,0.0017922635],"domain_scores_gemma":[0.8270303,0.13155398,0.00803186,0.019111078,0.013665456,0.00060734455],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.071263775,0.0035733164,0.0061685154,0.0058360416,0.0016384451,0.0035575274,0.005671605,0.0026285332,0.019056907],"category_scores_gemma":[0.24204777,0.0014178724,0.007020762,0.006947887,0.0021231016,0.003627313,0.002298709,0.005388203,0.0026633726],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.009081597,0.0026711945,0.028000208,0.007502518,0.0094188405,0.0016871621,0.0064363973,0.022874717,0.008785673,0.08701814,0.044923656,0.7715999],"study_design_scores_gemma":[0.0035985294,0.030074108,0.11089509,0.0027072236,0.007251528,0.002876336,0.003822005,0.40607587,0.0479278,0.16998145,0.21289876,0.0018912611],"about_ca_topic_score_codex":0.0027508421,"about_ca_topic_score_gemma":0.0021884076,"teacher_disagreement_score":0.071263775,"about_ca_system_score_codex":0.0018574921,"about_ca_system_score_gemma":0.0039055285,"threshold_uncertainty_score":0.3768834},"labels":[],"label_agreement":null},{"id":"W2014421030","doi":"10.1177/00131640021970970","title":"Structural Equation Models and the Regression Bias for Measuring Correlates of Change","year":2000,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":38,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Lakehead University; University of Manitoba","funders":"","keywords":"Structural equation modeling; Skewness; Analysis of covariance; Regression analysis; Regression; Statistics; Psychology; Linear regression; Econometrics; Regression toward the mean; Covariance; Mathematics","score_opus":0.9410559504515326,"score_gpt":0.523874003364629,"score_spread":0.4171819470869036,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2014421030","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.020714827,0.0022671178,0.96503186,0.0031831942,0.00041556967,0.0005871979,0.00072409556,0.00068688375,0.006389298],"genre_scores_gemma":[0.3769737,0.003943465,0.6074966,0.0015967545,0.00059594534,0.004823543,0.0013967276,0.00037707153,0.002796114],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8753643,0.10379204,0.0036591962,0.0044136667,0.012088986,0.0006818061],"domain_scores_gemma":[0.6912038,0.26774538,0.016200729,0.016199369,0.00808679,0.0005639958],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.10043377,0.0019313663,0.0023330452,0.0044688764,0.0012391838,0.0034231904,0.0021262455,0.002248523,0.004834599],"category_scores_gemma":[0.3616139,0.0013377285,0.0020570387,0.008421897,0.0042206873,0.005493256,0.0027591255,0.005865569,0.001266781],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00033238856,0.00021727096,0.06514169,0.0013499791,0.0021990347,0.00020898628,0.0021161125,0.049557716,0.0008098585,0.6477726,0.009570892,0.22072354],"study_design_scores_gemma":[0.00019137468,0.0005900718,0.032427076,0.0008211828,0.00060841616,0.0005128214,0.00091147865,0.1766082,0.0016962048,0.76507455,0.02034733,0.0002113236],"about_ca_topic_score_codex":0.005290819,"about_ca_topic_score_gemma":0.0062310905,"teacher_disagreement_score":0.10043377,"about_ca_system_score_codex":0.0026311683,"about_ca_system_score_gemma":0.0038849285,"threshold_uncertainty_score":0.5311509},"labels":[],"label_agreement":null},{"id":"W2016558976","doi":"10.1177/0013164402062004013","title":"Stability of the Reliability of LibQual+™ Scores a Reliability Generalization Meta-Analysis Study","year":2002,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Digital Mental Health Interventions","field":"Psychology","cited_by":45,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Generalization; Reliability (semiconductor); Meta-analysis; Psychology; Statistics; Scale (ratio); Mathematics; Medicine; Geography","score_opus":0.43370644915744266,"score_gpt":0.43993877657209346,"score_spread":0.006232327414650796,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2016558976","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8137792,0.16051996,0.018623384,0.00079271535,0.00046539423,0.000929633,0.0015842473,0.00026649117,0.0030390322],"genre_scores_gemma":[0.9877511,0.0070935753,0.003496045,0.00024473428,0.00013093287,0.00026618026,0.0007359965,0.00004414699,0.00023721751],"study_design_codex":"meta_analysis","study_design_gemma":"meta_analysis","domain_scores_codex":[0.9606385,0.028160458,0.003225075,0.0036557051,0.00396653,0.00035374405],"domain_scores_gemma":[0.90391123,0.069023535,0.008787248,0.011562511,0.0062152753,0.0005002064],"candidate_categories":["metaresearch","metaepi_broad"],"consensus_categories":[],"category_scores_codex":[0.07466488,0.001155581,0.0035171509,0.0021563547,0.0005585457,0.001998423,0.0011412308,0.0007994667,0.0007195793],"category_scores_gemma":[0.115492925,0.0009972483,0.006367256,0.0019504701,0.0013326609,0.0010565721,0.0012698784,0.0009715636,0.0001602433],"study_design_candidate":"meta_analysis","study_design_consensus":"meta_analysis","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.012607645,0.00044184361,0.353006,0.015400411,0.46654356,0.0003550049,0.002314871,0.004547618,0.0040347837,0.0004895355,0.0019390773,0.1383197],"study_design_scores_gemma":[0.003077442,0.007377129,0.45140946,0.0027789555,0.51351964,0.0011662631,0.0007628944,0.003838215,0.005951783,0.001551839,0.008320473,0.0002458745],"about_ca_topic_score_codex":0.0027933007,"about_ca_topic_score_gemma":0.0044813016,"teacher_disagreement_score":0.99648285,"about_ca_system_score_codex":0.0011058489,"about_ca_system_score_gemma":0.0013769278,"threshold_uncertainty_score":0.39487034},"labels":[],"label_agreement":null},{"id":"W2019602618","doi":"10.1177/0013164404267277","title":"Validity Studies Psychometric Properties of Scores on the French and Korean Versions of the Hexaco Personality Inventory","year":2004,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Personality Traits and Psychology","field":"Psychology","cited_by":39,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Montréal; Brock University; University of Calgary; Concordia University","funders":"Agence Nationale de la Recherche","keywords":"Psychology; Personality; Internal consistency; Psychometrics; Personality Assessment Inventory; California Psychological Inventory; Personality test; Big Five personality traits; Scale (ratio); Test validity; Social psychology; Clinical psychology","score_opus":0.47261731157670445,"score_gpt":0.3908928201723001,"score_spread":0.08172449140440435,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2019602618","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.98991513,0.00044322282,0.0013452459,0.00014857038,0.000058615962,0.00021870216,0.0006800599,0.000018749282,0.007171618],"genre_scores_gemma":[0.9942926,0.00028474096,0.0022032557,0.00009489939,0.00003193413,0.00031446732,0.0014114337,0.000015350597,0.0013513649],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9973532,0.00077951583,0.0004103574,0.0003812853,0.0008797082,0.00019606436],"domain_scores_gemma":[0.9893065,0.0036047117,0.0022129402,0.000776089,0.0034869392,0.00061282027],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005514913,0.00045222687,0.00033234403,0.001527986,0.0006603553,0.00064984005,0.0003289717,0.00029026295,0.0023378704],"category_scores_gemma":[0.01849396,0.00016176683,0.00073411484,0.0012417152,0.0007650724,0.0006009899,0.00084856333,0.00051691907,0.00043540285],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00026887257,0.0002229138,0.95516765,0.00011773616,0.0003075471,0.00010167763,0.0013514812,0.0002494905,0.0013464133,0.00066953397,0.00070414954,0.039492585],"study_design_scores_gemma":[0.00002616262,0.00021262748,0.9958175,0.00003936226,0.00005665447,0.00018002557,0.0008523804,0.00036173224,0.00054316066,0.00027904424,0.0016172491,0.000014255278],"about_ca_topic_score_codex":0.004604862,"about_ca_topic_score_gemma":0.007101,"teacher_disagreement_score":0.005514913,"about_ca_system_score_codex":0.0006409987,"about_ca_system_score_gemma":0.00082343403,"threshold_uncertainty_score":0.029166043},"labels":[],"label_agreement":null},{"id":"W2019613650","doi":"10.1177/0013164411410878","title":"A Demonstration of the Impact of Outliers on the Decisions About the Number of Factors in Exploratory Factor Analysis","year":2011,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":20,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Outlier; Econometrics; Exploratory factor analysis; Statistics; Exploratory research; Exploratory analysis; Computer science; Psychology; Mathematics; Psychometrics; Data science","score_opus":0.599656771734609,"score_gpt":0.500432737447792,"score_spread":0.09922403428681692,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2019613650","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6220443,0.0005069398,0.36973807,0.0014978818,0.0001517794,0.00049765175,0.00014575645,0.00033856308,0.0050790347],"genre_scores_gemma":[0.8089329,0.000100412595,0.19006002,0.00016702419,0.00003860879,0.00036422376,0.000067962195,0.000079036414,0.00018991972],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8857547,0.086382106,0.007929902,0.004004084,0.014972624,0.0009566249],"domain_scores_gemma":[0.24015297,0.68758696,0.024864351,0.027186459,0.01904485,0.0011643266],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.11762837,0.0012086551,0.0009916145,0.0018845631,0.0014728332,0.002843518,0.0012167356,0.0014869261,0.0019032665],"category_scores_gemma":[0.53508425,0.0006340245,0.001226563,0.002168115,0.0035335636,0.0039621233,0.0029219186,0.003661135,0.00028365394],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.010824657,0.0021742287,0.17779663,0.0026742793,0.0014126486,0.0017334587,0.05441677,0.060369965,0.06744647,0.0839179,0.0042780107,0.532955],"study_design_scores_gemma":[0.0013090039,0.0112320185,0.2642266,0.0025134024,0.0011004537,0.0022956948,0.017973369,0.33556235,0.110488996,0.23454848,0.017390946,0.0013586903],"about_ca_topic_score_codex":0.0006761514,"about_ca_topic_score_gemma":0.00095569773,"teacher_disagreement_score":0.8823716,"about_ca_system_score_codex":0.0009907287,"about_ca_system_score_gemma":0.0014967582,"threshold_uncertainty_score":0.6220857},"labels":[],"label_agreement":null},{"id":"W2021178079","doi":"10.1177/0013164403261762","title":"The Nature and Measurement of Emotional Intelligence Abilities: Basic Dimensions and Their Relationships with Other Cognitive Ability and Personality Variables","year":2004,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Emotional Intelligence and Performance","field":"Psychology","cited_by":106,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Psychology; Personality; Alexithymia; Cognition; Emotional intelligence; Developmental psychology; Big Five personality traits; Construct (python library); Congruence (geometry); Social psychology; Cognitive psychology","score_opus":0.17145077923785593,"score_gpt":0.3521081209423749,"score_spread":0.180657341704519,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2021178079","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9964631,0.00017607654,0.00095433684,0.000028605173,0.000003736007,0.000019913527,0.00013025237,0.000006490167,0.0022176101],"genre_scores_gemma":[0.99846786,0.000056985453,0.0010699829,0.0000057889106,0.000004911191,0.00001594469,0.00014169165,0.0000013488113,0.00023541332],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9995497,0.00014649291,0.00007701743,0.00004372542,0.00014013395,0.000043016826],"domain_scores_gemma":[0.9969254,0.0013410522,0.00085545663,0.00020759998,0.00038437184,0.00028617666],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00129615,0.00029528662,0.00018421494,0.0009457853,0.00016545245,0.00050610886,0.0002694406,0.00020869756,0.0012544122],"category_scores_gemma":[0.0067810947,0.00007871596,0.00015241666,0.00068244373,0.0003970208,0.00041227235,0.00046610838,0.00037488778,0.00022001652],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013635417,0.00018024723,0.94224155,0.00006952782,0.000049591014,0.0000859179,0.00045559622,0.0003296997,0.0032379327,0.0003976768,0.00013373468,0.052682158],"study_design_scores_gemma":[0.0000030326687,0.00010460682,0.99814737,0.000008214619,0.000005918004,0.00016399965,0.000098047705,0.00037006315,0.00061944965,0.00024429278,0.00023230136,0.0000027658964],"about_ca_topic_score_codex":0.0004983226,"about_ca_topic_score_gemma":0.00096718076,"teacher_disagreement_score":0.00129615,"about_ca_system_score_codex":0.0001478465,"about_ca_system_score_gemma":0.0001846347,"threshold_uncertainty_score":0.0068547726},"labels":[],"label_agreement":null},{"id":"W2021930444","doi":"10.1177/0013164409355698","title":"The Motivation at Work Scale: Validation Evidence in Two Languages","year":2010,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Motivation and Self-Concept in Sports","field":"Psychology","cited_by":749,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"HEC Montréal; Université du Québec à Montréal; Université de Montréal; Concordia University","funders":"","keywords":"Conceptualization; Scale (ratio); Psychology; Work (physics); Intrinsic motivation; Social psychology; Work motivation; Cognitive psychology; Computer science; Artificial intelligence; Geography; Physics","score_opus":0.1709997786686356,"score_gpt":0.4045055228999631,"score_spread":0.2335057442313275,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2021930444","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.98838973,0.00067117444,0.0015768916,0.00032950277,0.0001142546,0.0007625597,0.0008301532,0.000028726026,0.0072969752],"genre_scores_gemma":[0.9843428,0.0008496289,0.0058899606,0.0005471739,0.00006448535,0.002167891,0.0028474655,0.00006962502,0.0032208199],"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99489236,0.0022557944,0.00057006266,0.00044498086,0.0015479795,0.00028879836],"domain_scores_gemma":[0.98636484,0.0069536194,0.0018136409,0.0009781569,0.003096293,0.0007934379],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.012355281,0.0005180751,0.00055715814,0.002316435,0.0012084473,0.0014400259,0.00084750034,0.0008103568,0.0016099035],"category_scores_gemma":[0.021446627,0.00034711376,0.00086509733,0.0014416504,0.0014895897,0.0010642887,0.0023228652,0.0011377437,0.00082397234],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010662623,0.002104366,0.8697723,0.0004242138,0.0002921578,0.00023267721,0.012919998,0.00030449915,0.003208876,0.0021403006,0.0026829015,0.104851365],"study_design_scores_gemma":[0.00023460043,0.0011793493,0.9813498,0.0002936678,0.00009381588,0.00034488222,0.0042767613,0.0004844748,0.0010944536,0.0007783664,0.009822729,0.000046966197],"about_ca_topic_score_codex":0.0044960785,"about_ca_topic_score_gemma":0.0066090855,"teacher_disagreement_score":0.012355281,"about_ca_system_score_codex":0.00071537046,"about_ca_system_score_gemma":0.0016242091,"threshold_uncertainty_score":0.06534177},"labels":[],"label_agreement":null},{"id":"W2026285281","doi":"10.1177/0013164412448652","title":"Linking Cut-Scores Given Changes in the Decision-Making Process, Administration Time, and Proportions of Item Types Between Successive Administrations of a Test for a Large-Scale Assessment Program","year":2012,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Test (biology); Process (computing); Scale (ratio); Psychology; Equating; Test score; Psychometrics; Computer science; Applied psychology; Statistics; Standardized test; Clinical psychology; Mathematics education; Mathematics; Developmental psychology","score_opus":0.4302050027001809,"score_gpt":0.5329682362061104,"score_spread":0.10276323350592953,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2026285281","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.59351623,0.0008007159,0.38252124,0.00081465545,0.00043539586,0.0039057883,0.0009415171,0.0012882644,0.015776245],"genre_scores_gemma":[0.61320156,0.00035388744,0.3772735,0.00026519535,0.00010000483,0.0051856395,0.0015825264,0.0003114085,0.001726259],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9169076,0.05218448,0.010062963,0.0048657386,0.014989881,0.0009894002],"domain_scores_gemma":[0.8363246,0.10739033,0.011726671,0.020335073,0.023227414,0.0009959559],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0684631,0.0010450508,0.0009241351,0.007338514,0.0008482218,0.0026632904,0.0015944435,0.0012303517,0.0024289512],"category_scores_gemma":[0.24036866,0.0006092686,0.0014456292,0.0040660636,0.0013038043,0.0023171788,0.0025673416,0.0017122575,0.0010376727],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0018859021,0.0014778861,0.3078662,0.00078861986,0.0008135404,0.00023950204,0.0038418814,0.006164502,0.011037222,0.00898793,0.0037990473,0.6530978],"study_design_scores_gemma":[0.00065104215,0.0066045374,0.7813703,0.0008514739,0.0010138713,0.001679283,0.005448718,0.050190967,0.07123389,0.052939385,0.027584678,0.00043182995],"about_ca_topic_score_codex":0.00088754273,"about_ca_topic_score_gemma":0.00136663,"teacher_disagreement_score":0.0684631,"about_ca_system_score_codex":0.001512473,"about_ca_system_score_gemma":0.0015170822,"threshold_uncertainty_score":0.3620718},"labels":[],"label_agreement":null},{"id":"W2026405046","doi":"10.1177/0013164404268675","title":"Effect Sizes and their Intervals: The Two-Level Repeated Measures Case","year":2005,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Statistical Methods in Clinical Trials","field":"Mathematics","cited_by":45,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Statistics; Mathematics; Confidence interval; Estimator; Sample size determination; Variance (accounting); Coverage probability; Population; Econometrics; Demography","score_opus":0.7635696793982186,"score_gpt":0.5823470726920558,"score_spread":0.18122260670616286,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2026405046","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12860109,0.012783932,0.8431151,0.0017616733,0.00060789636,0.0031668067,0.0010179897,0.0007673077,0.008178186],"genre_scores_gemma":[0.7579745,0.0016321479,0.23088394,0.0005611402,0.00044631635,0.00698944,0.00059355045,0.00018228157,0.00073666085],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.63217336,0.25986072,0.02269395,0.03030143,0.051988523,0.0029819817],"domain_scores_gemma":[0.12862132,0.7836609,0.03310798,0.046487544,0.0072576855,0.00086453295],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.30783778,0.0017972523,0.0058579557,0.008233403,0.001059847,0.005130376,0.0060198717,0.006889583,0.005577095],"category_scores_gemma":[0.76415676,0.0013397365,0.006169863,0.005609395,0.009275529,0.008243088,0.004456731,0.005810344,0.0005949762],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.014188443,0.0010358997,0.12569517,0.008694645,0.024401173,0.0052611944,0.011610678,0.04332822,0.005362151,0.2858289,0.006517736,0.46807584],"study_design_scores_gemma":[0.003053326,0.011470093,0.12640068,0.0039846622,0.014327626,0.014211216,0.0040101237,0.28619415,0.012500222,0.49690813,0.025814211,0.0011256355],"about_ca_topic_score_codex":0.00078429293,"about_ca_topic_score_gemma":0.00044789317,"teacher_disagreement_score":0.6921622,"about_ca_system_score_codex":0.0023388357,"about_ca_system_score_gemma":0.0016077979,"threshold_uncertainty_score":0.85355926},"labels":[],"label_agreement":null},{"id":"W2027051144","doi":"10.1177/00131640021970655","title":"Development and Validation of Scores on a Two-Dimensional Workplace Friendship Scale","year":2000,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Job Satisfaction and Organizational Behavior","field":"Business, Management and Accounting","cited_by":343,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Quest University Canada","funders":"","keywords":"Friendship; Nomological network; Psychology; Scale (ratio); Discriminant validity; Construct validity; Sample (material); Convergent validity; Predictive validity; Construct (python library); Social psychology; Test validity; Likert scale; External validity; Internal consistency; Replicate; Applied psychology; Psychometrics; Developmental psychology; Statistics; Mathematics; Computer science","score_opus":0.07775349235747162,"score_gpt":0.2954924167858354,"score_spread":0.21773892442836376,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2027051144","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.98641914,0.00008860528,0.0060175937,0.00012890824,0.000043510165,0.0013677862,0.0004870731,0.00005129949,0.0053961403],"genre_scores_gemma":[0.9680807,0.00011803024,0.02645213,0.00006470244,0.000021891674,0.0023564065,0.0011805602,0.000023842525,0.0017016035],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9958845,0.001423871,0.0006406277,0.000218938,0.0015948621,0.00023717606],"domain_scores_gemma":[0.98540753,0.0047913664,0.001674762,0.0013028911,0.005824737,0.000998715],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008408917,0.0003792092,0.00040304943,0.0026361935,0.0005265762,0.0009509084,0.0006612842,0.0005299016,0.0012737687],"category_scores_gemma":[0.019743808,0.00030208536,0.0004745615,0.00091753685,0.0006710616,0.00090024463,0.0012395445,0.0009486877,0.00054302486],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00029495393,0.0013698154,0.8442301,0.000115115894,0.000109222085,0.00014266305,0.0056963796,0.000610764,0.006626706,0.0012738324,0.0017049701,0.13782547],"study_design_scores_gemma":[0.00008959853,0.0012813001,0.98454976,0.00004881754,0.000032625358,0.00021407979,0.0028232038,0.0029265354,0.002408317,0.00067597436,0.0049112476,0.000038546837],"about_ca_topic_score_codex":0.001203924,"about_ca_topic_score_gemma":0.0027596662,"teacher_disagreement_score":0.008408917,"about_ca_system_score_codex":0.00042294472,"about_ca_system_score_gemma":0.0010154601,"threshold_uncertainty_score":0.044471145},"labels":[],"label_agreement":null},{"id":"W2033678552","doi":"10.1177/0013164409344548","title":"The Impact of Outliers on Cronbach’s Coefficient Alpha Estimate of Reliability: Ordinal/Rating Scale Item Responses","year":2009,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":96,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Cronbach's alpha; Outlier; Categorical variable; Ordinal data; Statistics; Likert scale; Mathematics; Econometrics; Reliability (semiconductor); Sample (material); Rating scale; Psychology; Psychometrics","score_opus":0.28035999649463217,"score_gpt":0.5147372816258765,"score_spread":0.23437728513124434,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2033678552","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.24052294,0.004403801,0.7396466,0.002160801,0.0008428625,0.0007223861,0.0005052238,0.0009265595,0.010268838],"genre_scores_gemma":[0.8805726,0.00054580625,0.11552735,0.0006674029,0.00015299043,0.0009533029,0.0003851949,0.00047630587,0.0007190965],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.64855593,0.272423,0.01771374,0.014371026,0.044977877,0.0019583888],"domain_scores_gemma":[0.16834484,0.7197886,0.028396007,0.046570435,0.036053535,0.0008465383],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.23493809,0.001367934,0.0022523392,0.0040113926,0.0016859326,0.0035156072,0.001865773,0.001717782,0.0010967609],"category_scores_gemma":[0.67336404,0.001537164,0.0023198195,0.0050228485,0.00538587,0.0036764718,0.0034036995,0.004681607,0.00068331836],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0033116855,0.00042481945,0.42386466,0.0025751137,0.0067588505,0.0011757326,0.025148474,0.056897104,0.007098335,0.065679744,0.017077856,0.3899876],"study_design_scores_gemma":[0.00054549833,0.0033083262,0.43277994,0.0038034993,0.0028760731,0.003983109,0.007874336,0.28823984,0.03342257,0.17986298,0.042005423,0.0012985192],"about_ca_topic_score_codex":0.0030546307,"about_ca_topic_score_gemma":0.0022155906,"teacher_disagreement_score":0.7650619,"about_ca_system_score_codex":0.0021725295,"about_ca_system_score_gemma":0.0015412179,"threshold_uncertainty_score":0.94345754},"labels":[],"label_agreement":null},{"id":"W2036299295","doi":"10.1177/0013164405275668","title":"A Comparison of Four Methods for Detecting Differential Item Functioning in Ordered Response Items","year":2005,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":92,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia; University of Ottawa","funders":"","keywords":"Differential item functioning; Statistics; Psychology; Logistic regression; Item response theory; Type I and type II errors; Linear discriminant analysis; Ordinal regression; Skewness; Ordered logit; Discriminant function analysis; Sample (material); Psychometrics; Mathematics","score_opus":0.8267139799800711,"score_gpt":0.6035828191741548,"score_spread":0.22313116080591633,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2036299295","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.15665454,0.011659986,0.80449736,0.0020571405,0.0010116324,0.0063424692,0.0011279458,0.0017226576,0.014926267],"genre_scores_gemma":[0.30930856,0.003924056,0.6738115,0.00046980233,0.00016201117,0.009068754,0.0008828549,0.0002808028,0.0020917456],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.75288755,0.1907703,0.012979692,0.005789268,0.036526494,0.0010466792],"domain_scores_gemma":[0.560478,0.36963478,0.021830026,0.017486736,0.0292569,0.0013135562],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.16902219,0.0024267246,0.0020666744,0.012224796,0.0010005583,0.003131854,0.002697342,0.0017035396,0.0023320764],"category_scores_gemma":[0.37034252,0.001081281,0.0028054763,0.008472043,0.0026255122,0.0048666922,0.0042465646,0.002573623,0.0013136063],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0038090758,0.00061110186,0.11270615,0.0029183691,0.0033281688,0.00007035809,0.00304068,0.003614762,0.0017883341,0.016105266,0.0038747636,0.8481329],"study_design_scores_gemma":[0.0044502905,0.01463205,0.6568034,0.0057837735,0.0040531894,0.0028898036,0.007900243,0.13921654,0.013716047,0.10787171,0.040605064,0.0020778538],"about_ca_topic_score_codex":0.002046957,"about_ca_topic_score_gemma":0.0040303855,"teacher_disagreement_score":0.16902219,"about_ca_system_score_codex":0.002796349,"about_ca_system_score_gemma":0.0025929702,"threshold_uncertainty_score":0.89388543},"labels":[],"label_agreement":null},{"id":"W2036831393","doi":"10.1177/0013164411409929","title":"Difference Scores From the Point of View of Reliability and Repeated-Measures ANOVA","year":2011,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":167,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia; Carleton University","funders":"","keywords":"Reliability (semiconductor); Repeated measures design; Significant difference; Statistics; Psychology; Analysis of variance; Point (geometry); Mean difference; Mathematics; Econometrics; Confidence interval","score_opus":0.7554307011056853,"score_gpt":0.4653795213841227,"score_spread":0.29005117972156264,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2036831393","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.16630603,0.0022132217,0.77550614,0.0036667928,0.0017714024,0.0016973463,0.0012649138,0.0011009503,0.046473123],"genre_scores_gemma":[0.66756546,0.00087851175,0.32216483,0.00079932326,0.00078173826,0.0030440586,0.0007282104,0.00033579572,0.003702067],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8814825,0.05940815,0.008236702,0.006536648,0.04328181,0.0010542293],"domain_scores_gemma":[0.74646825,0.18789722,0.011263445,0.029481227,0.023411624,0.001478129],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.061656177,0.00078156864,0.001549852,0.0038122407,0.0007275421,0.0032368859,0.0017068898,0.0013973289,0.004538093],"category_scores_gemma":[0.29449415,0.0004892759,0.0014579014,0.0037779897,0.005322215,0.005092952,0.0028865945,0.0033808965,0.0013393845],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002802676,0.0011605717,0.1240618,0.0030062348,0.0017980475,0.0005434881,0.012668114,0.004557147,0.011259976,0.28324255,0.018025981,0.5368734],"study_design_scores_gemma":[0.00057579996,0.008810143,0.21937962,0.0010190859,0.001401491,0.002606885,0.010079017,0.03300102,0.020858357,0.61714476,0.08453586,0.0005879815],"about_ca_topic_score_codex":0.00047224047,"about_ca_topic_score_gemma":0.0004831886,"teacher_disagreement_score":0.061656177,"about_ca_system_score_codex":0.00090295455,"about_ca_system_score_gemma":0.0012283213,"threshold_uncertainty_score":0.32607293},"labels":[],"label_agreement":null},{"id":"W2037678252","doi":"10.1177/00131640021970998","title":"Testing Repeated Measures Hypotheses When Covariance Matrices are Heterogeneous: Revisiting the Robustness of the Welch-James Test Again","year":2000,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":42,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Statistics; Bootstrapping (finance); Estimator; Mathematics; Covariance; Robustness (evolution); Type I and type II errors; Sample size determination; Repeated measures design; Covariance matrix; Statistical hypothesis testing; Analysis of covariance; Econometrics","score_opus":0.350129595397415,"score_gpt":0.40376489889502787,"score_spread":0.05363530349761286,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2037678252","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1722465,0.00093512353,0.8184868,0.001336311,0.00082601886,0.0005486699,0.00024231446,0.0005504141,0.004827939],"genre_scores_gemma":[0.8181394,0.00023827505,0.17837328,0.00050517544,0.00046498992,0.0007610613,0.00019648875,0.00028677378,0.0010344591],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.80057037,0.14017634,0.009676896,0.023292007,0.02426554,0.0020188955],"domain_scores_gemma":[0.17360505,0.75323296,0.016094057,0.043935828,0.011791474,0.0013405684],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2089843,0.0015561397,0.0031325507,0.003951907,0.002216222,0.004192012,0.004479904,0.0026025826,0.0038887481],"category_scores_gemma":[0.6522658,0.0010355598,0.0033731132,0.00387179,0.01074369,0.007337268,0.004064492,0.005482898,0.00054178044],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00681205,0.0010060675,0.19354737,0.0021903964,0.013223948,0.0037741624,0.020735063,0.03481223,0.013195666,0.224079,0.0053916643,0.48123237],"study_design_scores_gemma":[0.0010604761,0.008105994,0.22606036,0.0008354219,0.0031507271,0.0020959706,0.005293248,0.28261375,0.023278192,0.42791414,0.018735845,0.00085593306],"about_ca_topic_score_codex":0.0029904123,"about_ca_topic_score_gemma":0.0014954745,"teacher_disagreement_score":0.2089843,"about_ca_system_score_codex":0.0014352369,"about_ca_system_score_gemma":0.0033673553,"threshold_uncertainty_score":0.9754632},"labels":[],"label_agreement":null},{"id":"W2042963988","doi":"10.1177/0013164406292038","title":"The Telephone Interview Probe","year":2007,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Attention Deficit Hyperactivity Disorder","field":"Medicine","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University; University of Toronto; Dalhousie University","funders":"","keywords":"Generalizability theory; Psychology; Impulsivity; Evening; Outcome (game theory); Clinical psychology; Reliability (semiconductor); Attention deficit hyperactivity disorder; Rating scale; Psychometrics; Item response theory; Test validity; Test (biology); Developmental psychology","score_opus":0.2604149209764455,"score_gpt":0.41315371948435314,"score_spread":0.15273879850790767,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2042963988","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.18392146,0.003111975,0.3256716,0.0092945425,0.007998759,0.12263935,0.06179518,0.009022975,0.27654418],"genre_scores_gemma":[0.24255338,0.0025163968,0.3205698,0.008167915,0.0012857126,0.26019913,0.023296094,0.0008641931,0.14054726],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9922348,0.0053183786,0.000650229,0.00070741633,0.0006331253,0.00045608616],"domain_scores_gemma":[0.98699886,0.005419749,0.00086221437,0.0016232303,0.004168075,0.00092780177],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0077167624,0.0010649296,0.00076534954,0.0017815094,0.0011726633,0.0010021043,0.0013289277,0.0012774488,0.06087326],"category_scores_gemma":[0.03034435,0.00045831857,0.00051965367,0.0013613974,0.00059145206,0.0010804619,0.0027553195,0.0021355432,0.027757121],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.003511095,0.0012396852,0.011946337,0.0010449794,0.000055319702,0.0010824933,0.011755737,0.0009853337,0.010290745,0.011477315,0.30863345,0.6379775],"study_design_scores_gemma":[0.0015849499,0.0035174314,0.03875047,0.0007457706,0.00008072239,0.0023699657,0.014256681,0.0073810564,0.008508439,0.017558023,0.90495986,0.0002865372],"about_ca_topic_score_codex":0.001731313,"about_ca_topic_score_gemma":0.0022115,"teacher_disagreement_score":0.06087326,"about_ca_system_score_codex":0.001230789,"about_ca_system_score_gemma":0.0023590345,"threshold_uncertainty_score":0.20364136},"labels":[],"label_agreement":null},{"id":"W2045458669","doi":"10.1177/0013164409355689","title":"Construct Commensurability and the Analysis of Change","year":2009,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"University of British Columbia","keywords":"Commensurability (mathematics); Construct (python library); Construct validity; Perspective (graphical); Psychology; Epistemology; Computer science; Psychometrics; Developmental psychology; Mathematics; Artificial intelligence","score_opus":0.8713064096796247,"score_gpt":0.5426906703775654,"score_spread":0.32861573930205934,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2045458669","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.14175297,0.0050733495,0.7945843,0.006897616,0.0003594719,0.0012543261,0.00033068258,0.00035294396,0.049394313],"genre_scores_gemma":[0.71864676,0.0010801294,0.27600738,0.0004183496,0.00016938643,0.002533667,0.00016641876,0.000088975234,0.00088888773],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.92055035,0.063292116,0.002789381,0.003916002,0.008622889,0.0008292287],"domain_scores_gemma":[0.84105325,0.13158165,0.009106885,0.012036987,0.0054083853,0.0008128516],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.057323933,0.0011472934,0.0011256197,0.00806177,0.0020352025,0.005929779,0.001420608,0.0012133728,0.0024295973],"category_scores_gemma":[0.16302514,0.0005107443,0.0016106341,0.007658264,0.018441055,0.006095366,0.0063905576,0.0034140702,0.000222853],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000104354054,0.000099853016,0.027793841,0.000621189,0.00033234427,0.00011906305,0.011713915,0.003568126,0.00044688873,0.7924362,0.0009296232,0.16183473],"study_design_scores_gemma":[0.000033274235,0.00029413728,0.03012095,0.00052922446,0.000106079235,0.00022609528,0.0051364154,0.011488002,0.00093262934,0.9395583,0.011494392,0.00008039272],"about_ca_topic_score_codex":0.0023988078,"about_ca_topic_score_gemma":0.0015603743,"teacher_disagreement_score":0.057323933,"about_ca_system_score_codex":0.004272616,"about_ca_system_score_gemma":0.00452855,"threshold_uncertainty_score":0.30316156},"labels":[],"label_agreement":null},{"id":"W2046847367","doi":"10.1177/0013164414523618","title":"Binary Logistic Regression Analysis for Detecting Differential Item Functioning","year":2014,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Statistics; Differential item functioning; Sample size determination; Type I and type II errors; Logistic regression; Mathematics; Statistical power; Statistical hypothesis testing; Regression analysis; Psychology; Econometrics; Item response theory; Psychometrics","score_opus":0.7639754128351917,"score_gpt":0.5122407613224709,"score_spread":0.2517346515127208,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2046847367","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.110342905,0.005152935,0.8719209,0.0017411826,0.0009244745,0.002248324,0.0008673589,0.0017091881,0.005092722],"genre_scores_gemma":[0.44130018,0.001687068,0.55129856,0.00047571174,0.00017441956,0.0028752415,0.0004253384,0.0002871847,0.001476271],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.86916673,0.10590152,0.00760111,0.003626318,0.013063847,0.00064046594],"domain_scores_gemma":[0.49117666,0.45299387,0.02983912,0.0139930425,0.011201776,0.00079548114],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0840964,0.0021549484,0.0026684615,0.014532635,0.0008500083,0.0023368862,0.0026403829,0.0014353927,0.003691639],"category_scores_gemma":[0.4065508,0.00085773686,0.0031467255,0.009305721,0.0014701419,0.0031700146,0.0022064343,0.0036907834,0.0011660568],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0035144216,0.0011151081,0.24156225,0.0038188086,0.0036862923,0.0010790122,0.0012748193,0.014897587,0.0036621303,0.021411305,0.009119377,0.6948589],"study_design_scores_gemma":[0.0015769275,0.012929824,0.34476674,0.00418336,0.004405518,0.009797643,0.0018623093,0.49287245,0.01901721,0.08146269,0.026097955,0.0010274336],"about_ca_topic_score_codex":0.0009422232,"about_ca_topic_score_gemma":0.0012374765,"teacher_disagreement_score":0.0840964,"about_ca_system_score_codex":0.0010749757,"about_ca_system_score_gemma":0.0017156246,"threshold_uncertainty_score":0.4447496},"labels":[],"label_agreement":null},{"id":"W2054014836","doi":"10.1177/00131640021970411","title":"Psychometric Properties of the Nonverbal Personality Questionnaire in Korea","year":2000,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Personality Traits and Psychology","field":"Psychology","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Psychology; Personality; Big Five personality traits; Nonverbal communication; Reliability (semiconductor); Internal consistency; Sample (material); Psychometrics; Consistency (knowledge bases); Clinical psychology; Developmental psychology; Social psychology; Computer science; Artificial intelligence","score_opus":0.17720356351181837,"score_gpt":0.3474471441320922,"score_spread":0.17024358062027384,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2054014836","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99700147,0.00017526609,0.000694173,0.000097723925,0.000025069377,0.000103728,0.0003323889,0.000011394014,0.0015587085],"genre_scores_gemma":[0.99715185,0.00012091476,0.001706114,0.00005296933,0.000007549746,0.0001116431,0.00043828777,0.0000052366677,0.0004053501],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9987925,0.00048679547,0.00022662307,0.000125455,0.00029680887,0.00007173499],"domain_scores_gemma":[0.99473333,0.0016957045,0.0014541781,0.00042076554,0.0012516632,0.00044443476],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0030901164,0.0002779761,0.000231307,0.000915264,0.00023563384,0.00040542244,0.0002706765,0.0002247277,0.0014327862],"category_scores_gemma":[0.009079445,0.00016677057,0.0005042259,0.0006735101,0.00028453232,0.00048137503,0.0005395974,0.00046918978,0.00024945982],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003077573,0.00035397973,0.9172939,0.00019293731,0.00029989058,0.00028330807,0.00096953555,0.0006138421,0.0027433664,0.000381066,0.00076250645,0.075797945],"study_design_scores_gemma":[0.000025659883,0.00040142026,0.995952,0.000031618198,0.000037321202,0.00035572954,0.0006136098,0.0008571018,0.00036530112,0.0001535997,0.001191251,0.000015433598],"about_ca_topic_score_codex":0.0012366469,"about_ca_topic_score_gemma":0.0015474572,"teacher_disagreement_score":0.0030901164,"about_ca_system_score_codex":0.0002740026,"about_ca_system_score_gemma":0.00040728573,"threshold_uncertainty_score":0.016342282},"labels":[],"label_agreement":null},{"id":"W2054970172","doi":"10.1177/0013164407305589","title":"Population Validity and Cross-Validity","year":2007,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Statistical Methods and Bayesian Inference","field":"Mathematics","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Statistics; Confidence interval; Correlation coefficient; Sample size determination; Cross-validation; Mathematics; Population; Econometrics; Demography","score_opus":0.5024942114162912,"score_gpt":0.5054909374568204,"score_spread":0.0029967260405291407,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2054970172","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07861874,0.0216645,0.7195072,0.00627124,0.002389026,0.0026828488,0.0019106431,0.0006276176,0.16632822],"genre_scores_gemma":[0.7964696,0.0058572288,0.18001689,0.0032082067,0.000958878,0.005590814,0.0014659371,0.0003532435,0.0060791373],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8470782,0.091522984,0.0095486045,0.015648669,0.034457017,0.0017444422],"domain_scores_gemma":[0.62603897,0.26780143,0.017796258,0.045035418,0.04156229,0.0017656519],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.11569013,0.0008757047,0.0023381917,0.007816762,0.0022034508,0.005660276,0.002167103,0.0022726313,0.006533147],"category_scores_gemma":[0.42415634,0.000676861,0.0023782288,0.0058823097,0.010062091,0.007285752,0.0076786675,0.003067211,0.0013858897],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022015524,0.00020762162,0.11592708,0.0023464432,0.002171598,0.00035427613,0.0070472257,0.0054172105,0.00054083293,0.5184434,0.010662771,0.3366615],"study_design_scores_gemma":[0.00014934018,0.000390878,0.13568386,0.0033877161,0.0010270714,0.001838777,0.0048049456,0.014382504,0.0018908144,0.7394696,0.09675703,0.000217457],"about_ca_topic_score_codex":0.0035833507,"about_ca_topic_score_gemma":0.00317894,"teacher_disagreement_score":0.8843099,"about_ca_system_score_codex":0.003045771,"about_ca_system_score_gemma":0.005637296,"threshold_uncertainty_score":0.6118352},"labels":[],"label_agreement":null},{"id":"W2062055237","doi":"10.1177/00131640021970871","title":"Type I Error Rate Comparisons of Post Hoc Procedures for I j Chi-Square Tables","year":2000,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":444,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Post hoc; Post-hoc analysis; Statistics; Pairwise comparison; Contingency table; Type I and type II errors; Homogeneity (statistics); Mathematics; Chi-square test; Null hypothesis; Monte Carlo method; Econometrics; Medicine; Dentistry","score_opus":0.40958901005991827,"score_gpt":0.48838846708274464,"score_spread":0.07879945702282637,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2062055237","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.04381328,0.00083013216,0.90931195,0.0004903566,0.006088754,0.022643553,0.002541358,0.003681977,0.010598634],"genre_scores_gemma":[0.16223785,0.00037471348,0.77180713,0.00092867354,0.0005666726,0.054944593,0.0010675103,0.0033276053,0.004745311],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.64360887,0.21798325,0.03626953,0.034581017,0.06303941,0.004517992],"domain_scores_gemma":[0.2907483,0.5869867,0.022094904,0.06578185,0.032732148,0.0016561069],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.19845198,0.0035378123,0.005202488,0.007497001,0.0028865573,0.0044475077,0.006298112,0.004805256,0.023299437],"category_scores_gemma":[0.62486094,0.0023071342,0.006165245,0.005827657,0.006466301,0.0048884526,0.004396603,0.010800588,0.0037826265],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.033178274,0.005548229,0.034212958,0.009792011,0.011898947,0.0020477748,0.016763087,0.020219732,0.019367157,0.17192248,0.08337733,0.59167206],"study_design_scores_gemma":[0.0067137606,0.042787753,0.105774656,0.0059768,0.00848917,0.0030531543,0.006532361,0.21070756,0.13360126,0.316906,0.15704937,0.0024081864],"about_ca_topic_score_codex":0.0009747614,"about_ca_topic_score_gemma":0.0013228656,"teacher_disagreement_score":0.801548,"about_ca_system_score_codex":0.002973573,"about_ca_system_score_gemma":0.0033171568,"threshold_uncertainty_score":0.9884514},"labels":[],"label_agreement":null},{"id":"W2064379877","doi":"10.1177/0013164402238082","title":"A Monte Carlo Comparison of Item and Person Statistics Based on Item Response Theory versus Classical Test Theory","year":2002,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":121,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Item response theory; Classical test theory; Monte Carlo method; Statistics; Psychology; Econometrics; Psychometrics; Test theory; Item analysis; Computerized adaptive testing; Test (biology); Differential item functioning; Statistical hypothesis testing; Mathematics","score_opus":0.7790233134897627,"score_gpt":0.505780321916664,"score_spread":0.2732429915730987,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2064379877","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.59162825,0.00050303404,0.4023365,0.00027183857,0.000068181886,0.0003875229,0.0002574084,0.00057727005,0.00397],"genre_scores_gemma":[0.8921206,0.000105846986,0.106538996,0.00010658462,0.000015597741,0.00027834385,0.00048065902,0.000102695165,0.00025067735],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.95788324,0.033956416,0.0010225143,0.0026878358,0.0040680417,0.00038187078],"domain_scores_gemma":[0.50831884,0.45161185,0.007853303,0.02348077,0.0077849645,0.0009503145],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06936503,0.0005999351,0.0009441296,0.0030695847,0.00044563875,0.0019286217,0.0012994627,0.001379331,0.001585485],"category_scores_gemma":[0.35797602,0.00046711604,0.0007666678,0.001840892,0.0021217058,0.0033398725,0.0016674831,0.0012703629,0.00031025475],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0067143003,0.0007161052,0.2153496,0.0007124517,0.0020188787,0.00029116275,0.0029466893,0.33991218,0.006033674,0.17583005,0.0032147449,0.24626017],"study_design_scores_gemma":[0.0002483882,0.0016289363,0.06803903,0.00016856854,0.00022403098,0.00071410346,0.00048805564,0.86553967,0.0041229287,0.057059474,0.0015995724,0.00016728512],"about_ca_topic_score_codex":0.001463618,"about_ca_topic_score_gemma":0.0015602286,"teacher_disagreement_score":0.06936503,"about_ca_system_score_codex":0.0012042617,"about_ca_system_score_gemma":0.0009909576,"threshold_uncertainty_score":0.36684173},"labels":[],"label_agreement":null},{"id":"W2065030780","doi":"10.1177/0013164404273942","title":"Understanding Parameter Invariance in Unidimensional IRT Models","year":2006,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":108,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia; University of Ottawa","funders":"","keywords":"Item response theory; Measurement invariance; Set (abstract data type); Differential item functioning; Psychology; Feature (linguistics); Property (philosophy); Econometrics; Variable (mathematics); Psychometrics; Cognitive psychology; Mathematics; Statistics; Applied mathematics; Computer science; Structural equation modeling; Confirmatory factor analysis; Mathematical analysis; Epistemology","score_opus":0.9212118758900417,"score_gpt":0.4959208972683364,"score_spread":0.42529097862170534,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2065030780","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.049224123,0.00027932585,0.9454246,0.00075593963,0.000031888347,0.00006848929,0.00013793098,0.00028712134,0.0037905872],"genre_scores_gemma":[0.8198638,0.00044330515,0.17710838,0.00042036083,0.00012784496,0.00046313572,0.00041329945,0.00020528429,0.00095458],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.97170526,0.018435486,0.001526841,0.0037961034,0.0036129209,0.00092336675],"domain_scores_gemma":[0.8665839,0.10271645,0.009123728,0.017097896,0.0038791131,0.0005990163],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03624367,0.0011784453,0.0019288383,0.0025559573,0.00087733613,0.0047078766,0.003231896,0.0015623621,0.0028774997],"category_scores_gemma":[0.19022271,0.00093359477,0.0018394127,0.0027905938,0.004701466,0.0090110935,0.005262831,0.004177316,0.00068948243],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013765207,0.00014760421,0.024691865,0.00021742356,0.00033985457,0.00026853447,0.0028756896,0.09835404,0.001337707,0.7711339,0.0012050006,0.099290796],"study_design_scores_gemma":[0.000021178945,0.00006115049,0.0050070407,0.00005262039,0.000045776895,0.0001578182,0.00033628874,0.22793761,0.00046396253,0.7648473,0.0010088647,0.000060344588],"about_ca_topic_score_codex":0.002499028,"about_ca_topic_score_gemma":0.0009855054,"teacher_disagreement_score":0.03624367,"about_ca_system_score_codex":0.0016351271,"about_ca_system_score_gemma":0.001410566,"threshold_uncertainty_score":0.1916771},"labels":[],"label_agreement":null},{"id":"W2066219327","doi":"10.1177/0013164403063003007","title":"Is the Test Attitude Survey Psychometrically Sound?","year":2003,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Employer Branding and e-HRM","field":"Business, Management and Accounting","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University; University of Toronto","funders":"","keywords":"Psychology; Test (biology); Test validity; Psychometrics; Personality; Convergent validity; Criterion validity; Personality test; Measure (data warehouse); Applied psychology; Realm; Psychological testing; Social psychology; Clinical psychology; Construct validity; Internal consistency; Computer science; Data mining","score_opus":0.2665399833300074,"score_gpt":0.3411793357157336,"score_spread":0.07463935238572622,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2066219327","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.85732603,0.0069369036,0.024249583,0.057838835,0.003590825,0.0009386345,0.002904085,0.00031076637,0.045904342],"genre_scores_gemma":[0.9837568,0.0020309754,0.006327807,0.0045090807,0.00087392755,0.00048167657,0.0013944694,0.000042388303,0.00058283453],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9746378,0.014322537,0.0025971034,0.0010176458,0.0065998216,0.00082513865],"domain_scores_gemma":[0.822926,0.099038996,0.024850303,0.013328311,0.03483318,0.0050232033],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.055418707,0.0004042115,0.0008547498,0.0023628585,0.00072772644,0.0023351058,0.0010123893,0.002553362,0.0031800566],"category_scores_gemma":[0.22339079,0.00033172173,0.0011304633,0.0038495462,0.0030330662,0.0031296262,0.0010557887,0.0015537211,0.0015700025],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003630939,0.00040365566,0.775507,0.00041548684,0.000276281,0.00009179164,0.0012792929,0.00045870792,0.00041919982,0.004632748,0.008051235,0.2081014],"study_design_scores_gemma":[0.0002739502,0.0023339393,0.9382725,0.002169781,0.0003051342,0.0007034083,0.006804167,0.0041703098,0.0010254276,0.012875224,0.030967755,0.00009835898],"about_ca_topic_score_codex":0.0025029392,"about_ca_topic_score_gemma":0.0028850755,"teacher_disagreement_score":0.055418707,"about_ca_system_score_codex":0.0008804292,"about_ca_system_score_gemma":0.00231458,"threshold_uncertainty_score":0.2930857},"labels":[],"label_agreement":null},{"id":"W2066906964","doi":"10.1177/0013164409344520","title":"Athletes’ Perceptions of Coaching Competency Scale II-High School Teams","year":2009,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Sport Psychology and Performance","field":"Psychology","cited_by":40,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Psychology; Coaching; Athletes; Confirmatory factor analysis; Applied psychology; Construct validity; Scale (ratio); Construct (python library); Exploratory factor analysis; Structural equation modeling; Clinical psychology; Psychometrics; Statistics; Physical therapy; Mathematics; Medicine","score_opus":0.060808801704178836,"score_gpt":0.3496966861001845,"score_spread":0.28888788439600566,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2066906964","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9971956,0.000028542756,0.00018979923,0.00003914843,0.000007892757,0.0000976186,0.000079441576,0.000003741086,0.0023582804],"genre_scores_gemma":[0.9979931,0.00005957083,0.0007074401,0.000043249274,0.000010861118,0.0001764093,0.00024963805,0.0000037112372,0.00075610395],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9983596,0.0004431729,0.0002165803,0.00013100055,0.0005866638,0.00026299004],"domain_scores_gemma":[0.99534637,0.00071751565,0.0017717594,0.00018544492,0.0009630831,0.0010158254],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0027920112,0.00029036257,0.00041333365,0.0012660549,0.00070826575,0.0009402641,0.00034160021,0.00048071652,0.0020491234],"category_scores_gemma":[0.004918126,0.00021805632,0.0004366648,0.00051345385,0.000506934,0.00048293002,0.0010238342,0.0009032162,0.00031714453],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014980923,0.00066521997,0.98070854,0.000055691013,0.000102716105,0.000084355175,0.003361312,0.00024120927,0.002065177,0.00017866677,0.0008009726,0.011586395],"study_design_scores_gemma":[0.000018324687,0.00031583646,0.99601835,0.000020598069,0.000013356386,0.00007373343,0.0024011869,0.00027560408,0.0002504856,0.000075906355,0.00052879186,0.000007897911],"about_ca_topic_score_codex":0.0032494133,"about_ca_topic_score_gemma":0.0075311684,"teacher_disagreement_score":0.0032494133,"about_ca_system_score_codex":0.00039129838,"about_ca_system_score_gemma":0.0006694653,"threshold_uncertainty_score":0.014765739},"labels":[],"label_agreement":null},{"id":"W2070370199","doi":"10.1177/0013164407301530","title":"Concurrent Validity of Wechsler Adult Intelligence Scales–Third Edition Index Score Short Forms in the Canadian Standardization Sample","year":2007,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Dementia and Cognitive Impairment Research","field":"Medicine","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"BC Mental Health & Substance Use Services; University of British Columbia","funders":"","keywords":"Wechsler Adult Intelligence Scale; Psychology; Short Forms; Concurrent validity; Index (typography); Wechsler Preschool and Primary Scale of Intelligence; Sample (material); Intelligence quotient; Test validity; Psychometrics; Developmental psychology; Statistics; Clinical psychology; Wechsler Intelligence Scale for Children; Cognition; Mathematics; Psychiatry; Computer science","score_opus":0.19603925661791266,"score_gpt":0.41298764835950535,"score_spread":0.2169483917415927,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2070370199","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9849952,0.0006599594,0.0017493028,0.00018061178,0.00008650506,0.00039071793,0.0027137902,0.00005259407,0.009171366],"genre_scores_gemma":[0.9925028,0.00030387266,0.0024060404,0.000058636502,0.0000149591615,0.00019008486,0.003348609,0.000018891802,0.0011561743],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9929547,0.0009325182,0.00060031825,0.00082100864,0.004084181,0.0006072336],"domain_scores_gemma":[0.98481905,0.0018905979,0.0012142898,0.0011862513,0.010277557,0.00061225734],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009742713,0.0006072272,0.0006890049,0.0028608607,0.0020230245,0.0012086856,0.001402833,0.00030377024,0.001970467],"category_scores_gemma":[0.035982363,0.000386455,0.0008142782,0.002523518,0.0012811738,0.0006558145,0.0013655885,0.0006883952,0.0002777909],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025968955,0.00009624931,0.95564634,0.000115922136,0.00033953213,0.00011158175,0.002857017,0.00039110647,0.00066329614,0.0009245606,0.0017675831,0.03682715],"study_design_scores_gemma":[0.000026201133,0.000071149894,0.99619687,0.00003058176,0.00005455959,0.00009153007,0.0006552067,0.0005286494,0.0003063484,0.00016412215,0.0018514004,0.000023355273],"about_ca_topic_score_codex":0.81584203,"about_ca_topic_score_gemma":0.86105835,"teacher_disagreement_score":0.81584203,"about_ca_system_score_codex":0.0054197954,"about_ca_system_score_gemma":0.009980041,"threshold_uncertainty_score":0.370485},"labels":[],"label_agreement":null},{"id":"W2081705014","doi":"10.1177/0013164414527449","title":"Seeing Perfectly Fitting Factor Models That Are Causally Misspecified","year":2014,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":53,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Factor (programming language); Factor analysis; Causal model; Econometrics; Causal structure; Psychology; Statistics; Mathematics; Computer science","score_opus":0.8554756584236994,"score_gpt":0.49012879108660357,"score_spread":0.36534686733709587,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2081705014","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07365671,0.0021922186,0.872153,0.026035532,0.0012273823,0.00025582832,0.0005775931,0.0013266827,0.022575157],"genre_scores_gemma":[0.780479,0.0015967303,0.21018764,0.0035905314,0.00036343644,0.00039100606,0.0007021316,0.000564537,0.0021250555],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.90753436,0.05963896,0.0045214826,0.008298874,0.018469192,0.0015371378],"domain_scores_gemma":[0.6456573,0.23543505,0.028209,0.068434685,0.019946191,0.0023178314],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.09443253,0.0025550919,0.001953439,0.005058376,0.0041171354,0.010711286,0.002775316,0.0034822908,0.0083917305],"category_scores_gemma":[0.43829748,0.0020607165,0.0023082143,0.0049337554,0.01635314,0.023909058,0.007653606,0.009037802,0.0015993615],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00037499625,0.00019552124,0.0405574,0.0010367328,0.00080701406,0.0010449984,0.027039755,0.012586547,0.0016069134,0.7771694,0.01715642,0.120424315],"study_design_scores_gemma":[0.000040958552,0.000092419985,0.005282768,0.0006207416,0.00013276242,0.0005185347,0.005971455,0.019833056,0.0013970549,0.94874525,0.017210325,0.00015474793],"about_ca_topic_score_codex":0.0060840207,"about_ca_topic_score_gemma":0.00622576,"teacher_disagreement_score":0.90556747,"about_ca_system_score_codex":0.0047491603,"about_ca_system_score_gemma":0.0067839506,"threshold_uncertainty_score":0.49941295},"labels":[],"label_agreement":null},{"id":"W2083403230","doi":"10.1177/0013164406292030","title":"Confidence Intervals for an Effect Size Measure in Multiple Linear Regression","year":2007,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":34,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Statistics; Confidence interval; Coverage probability; Mathematics; CDF-based nonparametric confidence interval; Percentile; Linear regression; Robust confidence intervals; Sample size determination; Regression analysis; Tolerance interval; Measure (data warehouse); Confidence distribution; Regression; Computer science","score_opus":0.4771766274732445,"score_gpt":0.5316271763859817,"score_spread":0.05445054891273715,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2083403230","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.046755254,0.014865801,0.9203819,0.0014410174,0.0009720125,0.00097559165,0.001728675,0.0017610706,0.01111876],"genre_scores_gemma":[0.6331522,0.0029308388,0.35318097,0.0009742263,0.00084747537,0.004548928,0.0022847077,0.0007157833,0.0013648691],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8202316,0.1224042,0.009804853,0.014980251,0.031133521,0.0014455816],"domain_scores_gemma":[0.14754722,0.79816264,0.017556705,0.021720232,0.014196471,0.00081672263],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.18546052,0.0019006912,0.0039060977,0.008597727,0.0012858356,0.005265768,0.00603358,0.005526269,0.0058940575],"category_scores_gemma":[0.69811124,0.001098303,0.0043425816,0.006609645,0.0046128985,0.0058235363,0.00464481,0.0071467534,0.0011239005],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005988445,0.00056761026,0.05738403,0.009282594,0.009814113,0.0016256057,0.0053006336,0.09336489,0.004027056,0.3540374,0.019649647,0.43895802],"study_design_scores_gemma":[0.0011802671,0.0035842222,0.084571704,0.008856179,0.004981779,0.0036626053,0.002150237,0.35534865,0.013368141,0.4671459,0.05414916,0.0010011229],"about_ca_topic_score_codex":0.002088189,"about_ca_topic_score_gemma":0.00086808566,"teacher_disagreement_score":0.8145395,"about_ca_system_score_codex":0.0021736089,"about_ca_system_score_gemma":0.0013004519,"threshold_uncertainty_score":0.9808207},"labels":[],"label_agreement":null},{"id":"W2084244869","doi":"10.1177/0013164403258450","title":"Measurement and Validity Characteristics of the Short Version of the Social and Emotional Loneliness Scale for Adults","year":2004,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Health disparities and outcomes","field":"Social Sciences","cited_by":373,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of New Brunswick","funders":"","keywords":"Loneliness; Psychology; Discriminant validity; Convergent validity; UCLA Loneliness Scale; Construct validity; Concurrent validity; Scale (ratio); Clinical psychology; Test validity; Developmental psychology; Psychometrics; Social psychology; Internal consistency","score_opus":0.22830131559293207,"score_gpt":0.40131588898674714,"score_spread":0.17301457339381507,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2084244869","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9955087,0.00030358066,0.0008186268,0.00014664039,0.000037613852,0.00023582265,0.0005531618,0.000009128257,0.0023867618],"genre_scores_gemma":[0.9956365,0.00014860694,0.0023701396,0.00007255002,0.000023313505,0.00045518283,0.00089755957,0.00000687815,0.0003892479],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99694985,0.0011889997,0.0006252472,0.00023790509,0.0008084119,0.00018968208],"domain_scores_gemma":[0.9910183,0.0036247948,0.002398518,0.00034927044,0.0019899227,0.00061917136],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0058224737,0.00028124946,0.00045469048,0.0011371272,0.00054909644,0.00057173974,0.00033821102,0.00044925744,0.001014729],"category_scores_gemma":[0.021890333,0.0002245251,0.00076628296,0.00088262145,0.0003838754,0.00076133094,0.0009653525,0.0005497144,0.00021968679],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00016165314,0.00019150559,0.97905207,0.00004633026,0.00010708123,0.00004747914,0.0010146686,0.00016185846,0.00037290697,0.00016623987,0.0004642668,0.018213904],"study_design_scores_gemma":[0.000015907177,0.00035863824,0.99726605,0.000020601541,0.000017844763,0.00017780339,0.0006196273,0.00045069045,0.00011814048,0.0001470634,0.00079825294,0.000009340981],"about_ca_topic_score_codex":0.0011857338,"about_ca_topic_score_gemma":0.002992627,"teacher_disagreement_score":0.0058224737,"about_ca_system_score_codex":0.0003313121,"about_ca_system_score_gemma":0.00055864634,"threshold_uncertainty_score":0.030792594},"labels":[],"label_agreement":null},{"id":"W2090570025","doi":"10.1177/00131640021970330","title":"Number-Right, Item-Response, and Finite-State Scoring: Robustness with Respect to Lack of Equally Classifiable Options and Item Option Independence","year":2000,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Robustness (evolution); Independence (probability theory); Mathematics; Statistics; Econometrics","score_opus":0.6325820280120732,"score_gpt":0.4842413224829055,"score_spread":0.14834070552916767,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2090570025","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.41471025,0.00034622024,0.5738542,0.00078392174,0.00019051987,0.0013339581,0.00055774447,0.0011806368,0.0070425803],"genre_scores_gemma":[0.89016557,0.00008753088,0.106285706,0.00031230153,0.000051233856,0.0011639157,0.00077528326,0.00021057046,0.0009477975],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.62660915,0.29904014,0.01614802,0.022086175,0.0335278,0.0025887885],"domain_scores_gemma":[0.22029728,0.6100158,0.03222367,0.11610878,0.01880526,0.0025492918],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.3059008,0.0016902585,0.002752322,0.0038895612,0.0018265115,0.0048261452,0.005090983,0.0027336706,0.0030253544],"category_scores_gemma":[0.6409774,0.0018898832,0.0037312205,0.0030953798,0.009517221,0.008932685,0.008489493,0.005304048,0.0012635466],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.014078318,0.0014300721,0.35634914,0.0011429398,0.008234247,0.00064909767,0.009809849,0.14478478,0.007638257,0.082970895,0.005007856,0.36790448],"study_design_scores_gemma":[0.00075442233,0.0028234613,0.20499575,0.00044331996,0.00066007755,0.0011662834,0.0010713881,0.65579814,0.011984335,0.11569458,0.0037005057,0.00090777763],"about_ca_topic_score_codex":0.0041770046,"about_ca_topic_score_gemma":0.0042924755,"teacher_disagreement_score":0.3059008,"about_ca_system_score_codex":0.0022886796,"about_ca_system_score_gemma":0.0019484385,"threshold_uncertainty_score":0.85594785},"labels":[],"label_agreement":null},{"id":"W2093980226","doi":"10.1177/00131640021971005","title":"Implications of Test Dimensionality for Unidimensional Irt Scoring: An Investigation of a High-Stakes Testing Program","year":2000,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Item response theory; Psychology; Curse of dimensionality; Test (biology); Statistics; Psychometrics; Item analysis; Equating; Test validity; Homogeneous; Social psychology; Econometrics; Mathematics; Clinical psychology; Developmental psychology; Rasch model","score_opus":0.7984940592344482,"score_gpt":0.517856493671935,"score_spread":0.2806375655625132,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2093980226","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.96816796,0.00006977489,0.02498816,0.0010865562,0.00001956998,0.00028381692,0.00003177697,0.000029380513,0.0053229453],"genre_scores_gemma":[0.98319155,0.000033702996,0.01627031,0.00011728507,0.00001277857,0.00019984166,0.000030805444,0.000011692751,0.00013214574],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.89809966,0.06667744,0.005146307,0.0028878753,0.025530085,0.001658629],"domain_scores_gemma":[0.5025364,0.38738126,0.031914562,0.04567884,0.02930013,0.0031887863],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.14192522,0.0005112703,0.00089884497,0.0020937398,0.0022742783,0.0039168266,0.0013920591,0.0009106979,0.0008696135],"category_scores_gemma":[0.3998035,0.00041763496,0.0012152455,0.002296017,0.004238203,0.005243861,0.0044235266,0.003051098,0.00013837106],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006520304,0.0015661538,0.72345376,0.00020450454,0.00026193584,0.00037161232,0.021507911,0.007050486,0.0024621808,0.05876672,0.0009917617,0.18271093],"study_design_scores_gemma":[0.00015170181,0.0023961237,0.7549863,0.00041328542,0.00021671671,0.0012999817,0.012754019,0.13798676,0.0064318418,0.078123674,0.0050088223,0.00023078197],"about_ca_topic_score_codex":0.0014410588,"about_ca_topic_score_gemma":0.00242594,"teacher_disagreement_score":0.14192522,"about_ca_system_score_codex":0.004550585,"about_ca_system_score_gemma":0.0040649124,"threshold_uncertainty_score":0.75058126},"labels":[],"label_agreement":null},{"id":"W2116643860","doi":"10.1177/0013164410366683","title":"Using Cochran’s Z Statistic to Test the Kernel-Smoothed Item Response Function Differences Between Focal and Reference Groups","year":2010,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Type I and type II errors; Mathematics; Statistics; Kernel smoother; Kernel (algebra); Statistic; Smoothing; Nonparametric statistics; Test statistic; Differential item functioning; Kernel method; Statistical hypothesis testing; Item response theory; Computer science; Radial basis function kernel; Artificial intelligence; Psychometrics; Support vector machine","score_opus":0.7546464432633119,"score_gpt":0.5131096502165755,"score_spread":0.24153679304673636,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2116643860","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.27729392,0.0005069083,0.71494985,0.00021680293,0.0002240832,0.0011071742,0.00057313393,0.0014821514,0.0036459304],"genre_scores_gemma":[0.8466109,0.00019726215,0.15063357,0.000092465045,0.000038444723,0.0010426313,0.00045648648,0.0001981177,0.00073013175],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9780636,0.012573053,0.0015749453,0.0029259915,0.0044301357,0.00043227847],"domain_scores_gemma":[0.8750342,0.09551158,0.0057255644,0.013668758,0.0096066855,0.00045309775],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.028701022,0.0010688661,0.001440451,0.0045866347,0.00079241826,0.0013462391,0.0015747456,0.0010173663,0.004596252],"category_scores_gemma":[0.17606217,0.00037706218,0.0019660513,0.005382382,0.0014116276,0.002935753,0.0018574011,0.0016876768,0.0007870582],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002613935,0.0009553971,0.23934712,0.0015519187,0.0057097697,0.0005966735,0.0065902,0.020705396,0.017705172,0.031585563,0.0056119175,0.66702694],"study_design_scores_gemma":[0.00054318056,0.00856915,0.6040725,0.00037148147,0.0026701249,0.0023777364,0.004581446,0.24578308,0.047565784,0.058079477,0.024565248,0.00082084374],"about_ca_topic_score_codex":0.0025022728,"about_ca_topic_score_gemma":0.0018646546,"teacher_disagreement_score":0.028701022,"about_ca_system_score_codex":0.00060623256,"about_ca_system_score_gemma":0.0013478429,"threshold_uncertainty_score":0.15178734},"labels":[],"label_agreement":null},{"id":"W2122573908","doi":"10.1177/0013164415574086","title":"A Ratio Test of Interrater Agreement With High Specificity","year":2015,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Trois-Rivières; University of Ottawa","funders":"","keywords":"Inter-rater reliability; Agreement; Psychology; Validation test; Test validity; Test (biology); Psychometrics; Statistics; Clinical psychology; Developmental psychology; Rating scale; Mathematics; Geology","score_opus":0.4746679401283067,"score_gpt":0.40888115156470517,"score_spread":0.06578678856360154,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2122573908","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07318521,0.0014357545,0.87282765,0.0010666294,0.00083103176,0.0022651763,0.0019615295,0.0020112093,0.04441579],"genre_scores_gemma":[0.74206364,0.0004019749,0.24749644,0.00073772675,0.0004470583,0.0029778343,0.0011457447,0.0004992673,0.004230266],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.83689827,0.09302918,0.012295284,0.02226278,0.033769947,0.0017446056],"domain_scores_gemma":[0.41974065,0.50057584,0.020496406,0.027792366,0.0298749,0.0015199357],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08930669,0.0016366763,0.0021464732,0.0070171696,0.0013427205,0.0041065933,0.0028101944,0.0028332018,0.012198562],"category_scores_gemma":[0.48236296,0.00078605977,0.0022458343,0.005844935,0.0044036172,0.0064115385,0.00395574,0.0026773135,0.0043639294],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0025028407,0.00062157074,0.16045557,0.003281934,0.0051320856,0.0011363216,0.0044287248,0.020909907,0.007461214,0.14112453,0.029794278,0.62315106],"study_design_scores_gemma":[0.0010884246,0.00583754,0.15959969,0.0024098095,0.0032180245,0.0139087085,0.0049932944,0.35051557,0.023434428,0.35547158,0.078384876,0.0011381132],"about_ca_topic_score_codex":0.00080281345,"about_ca_topic_score_gemma":0.0007070383,"teacher_disagreement_score":0.08930669,"about_ca_system_score_codex":0.0011032337,"about_ca_system_score_gemma":0.0021438368,"threshold_uncertainty_score":0.47230458},"labels":[],"label_agreement":null},{"id":"W2123520859","doi":"10.1177/0013164407313371","title":"Note on a Confidence Interval for the Squared Semipartial Correlation Coefficient","year":2008,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Statistics; Confidence interval; Percentile; Mathematics; Coverage probability; Correlation coefficient; Sample size determination; Correlation; Mean squared error; Regression analysis; Linear regression; Interval (graph theory); Combinatorics","score_opus":0.7435488238248646,"score_gpt":0.511461499220875,"score_spread":0.23208732460398962,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2123520859","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0519309,0.00939521,0.8096012,0.009188525,0.0063813888,0.0013350948,0.0059944745,0.004311058,0.10186215],"genre_scores_gemma":[0.6457612,0.0021013473,0.32887036,0.0038892396,0.0022361006,0.0036325033,0.004671015,0.0012033896,0.0076348274],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9365912,0.029383546,0.0044137337,0.007513641,0.020575786,0.0015220238],"domain_scores_gemma":[0.32665092,0.5765321,0.017890628,0.032583475,0.04443521,0.0019076483],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05890374,0.0012622452,0.0020103995,0.0062210476,0.001529787,0.0049644234,0.0039387974,0.0059008845,0.02236817],"category_scores_gemma":[0.49560937,0.0006609972,0.0020324741,0.004830171,0.0028378023,0.0037125014,0.004150272,0.007679874,0.0053725326],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0038958464,0.00067166955,0.037740193,0.0027020583,0.0012522975,0.0018784661,0.004295079,0.0236414,0.0067487294,0.2791852,0.10808314,0.5299059],"study_design_scores_gemma":[0.0008851186,0.004320874,0.102223694,0.01076397,0.0012472052,0.008603926,0.005787636,0.13907018,0.036269795,0.22027576,0.46909982,0.0014520672],"about_ca_topic_score_codex":0.0031540554,"about_ca_topic_score_gemma":0.0008514216,"teacher_disagreement_score":0.05890374,"about_ca_system_score_codex":0.0011813213,"about_ca_system_score_gemma":0.0014678835,"threshold_uncertainty_score":0.31151646},"labels":[],"label_agreement":null},{"id":"W2124517593","doi":"10.1177/0013164414536184","title":"Application of the Overclaiming Technique to Scholastic Assessment","year":2014,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Personality Traits and Psychology","field":"Psychology","cited_by":28,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Psychology; Robustness (evolution); Statistics; Reliability (semiconductor); Index (typography); Measure (data warehouse); Social psychology; Computer science; Mathematics; Data mining","score_opus":0.11770683296098142,"score_gpt":0.40411838869564654,"score_spread":0.28641155573466515,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2124517593","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7016383,0.0002951056,0.2872452,0.00017966956,0.00011448627,0.0009014063,0.00048700738,0.0006633139,0.008475407],"genre_scores_gemma":[0.7966987,0.00019360521,0.19981354,0.000099691555,0.000059943504,0.0006612363,0.00027075972,0.00015629394,0.0020462102],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.9954572,0.0021255612,0.00042900737,0.0004614695,0.001404986,0.000121744444],"domain_scores_gemma":[0.94666404,0.033898298,0.0061703487,0.0047334954,0.008003047,0.0005306792],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0056362883,0.0005536157,0.0003293966,0.0025897007,0.00031417637,0.00086069445,0.00044347497,0.0002746185,0.0017904745],"category_scores_gemma":[0.057726946,0.0002259599,0.0002680028,0.0023337998,0.00059629895,0.00065543957,0.00085518375,0.00072611205,0.00029588965],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00061817747,0.00020445648,0.123486936,0.00034144457,0.00014892849,0.00013855593,0.0028398642,0.0027602625,0.025658116,0.003569583,0.0015170322,0.8387166],"study_design_scores_gemma":[0.0001258277,0.0023830733,0.84200704,0.000166632,0.00012741867,0.0012765214,0.0014553189,0.061570313,0.0591285,0.014375357,0.017122772,0.000261113],"about_ca_topic_score_codex":0.0019609875,"about_ca_topic_score_gemma":0.003229453,"teacher_disagreement_score":0.0056362883,"about_ca_system_score_codex":0.00041684523,"about_ca_system_score_gemma":0.0008527641,"threshold_uncertainty_score":0.029807925},"labels":[],"label_agreement":null},{"id":"W2130969147","doi":"10.1177/0013164412452564","title":"The Relationship Between Root Mean Square Error of Approximation and Model Misspecification in Confirmatory Factor Analysis Models","year":2012,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":123,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Structural equation modeling; Confirmatory factor analysis; Statistics; Mathematics; Population; Cutoff; Factor analysis; Econometrics; Physics","score_opus":0.8678825713483123,"score_gpt":0.5198963884873063,"score_spread":0.3479861828610059,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2130969147","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.13741542,0.005828385,0.84530234,0.0024119387,0.0004981753,0.0005119695,0.000483854,0.0012137778,0.0063341134],"genre_scores_gemma":[0.8385486,0.0010014517,0.15660472,0.00079007156,0.0001504039,0.00090845267,0.00063726306,0.0005109898,0.0008479962],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.7399422,0.17573975,0.025360558,0.020317174,0.0369775,0.0016627467],"domain_scores_gemma":[0.16622312,0.74928313,0.032368857,0.035596814,0.01582608,0.0007019519],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.19580229,0.002246962,0.0025966899,0.0056803264,0.0021160035,0.0035835584,0.00281203,0.0028372651,0.0015181957],"category_scores_gemma":[0.608685,0.0016625276,0.0030645865,0.008241455,0.0053189495,0.005609893,0.004452802,0.0060983337,0.0005405008],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00084034447,0.00058602757,0.42039835,0.0031898844,0.008460755,0.0020086507,0.012264065,0.1406432,0.0032500783,0.08837739,0.0076587745,0.3123224],"study_design_scores_gemma":[0.00023439596,0.0020074751,0.25977698,0.0030650827,0.0022727994,0.0035968765,0.003637693,0.45232642,0.009448632,0.2485607,0.014082955,0.0009900036],"about_ca_topic_score_codex":0.003908596,"about_ca_topic_score_gemma":0.005779337,"teacher_disagreement_score":0.19580229,"about_ca_system_score_codex":0.0031705645,"about_ca_system_score_gemma":0.0034716078,"threshold_uncertainty_score":0.99171895},"labels":[],"label_agreement":null},{"id":"W2138135002","doi":"10.1177/0013164406299101","title":"An Item Response Theory Examination of Two Popular Goal Orientation Measures","year":2007,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Motivation and Self-Concept in Sports","field":"Psychology","cited_by":29,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Marriott International (Canada)","funders":"","keywords":"Goal orientation; Construct (python library); Orientation (vector space); Item response theory; Psychology; Scale (ratio); Psychometrics; Construct validity; Cognitive psychology; Social psychology; Computer science; Developmental psychology; Mathematics","score_opus":0.11772278215911086,"score_gpt":0.3977912221514822,"score_spread":0.28006843999237135,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2138135002","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.89028823,0.00031771485,0.08896964,0.00069756695,0.00014184549,0.0016496126,0.00094515324,0.00021655478,0.016773665],"genre_scores_gemma":[0.9360654,0.00014315959,0.058444332,0.00016623725,0.000033949334,0.0031108537,0.0011689579,0.000060032275,0.00080711837],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.97612053,0.012988794,0.0024868585,0.00124843,0.006693516,0.0004617925],"domain_scores_gemma":[0.818973,0.14729384,0.0077628507,0.0054266043,0.01969558,0.0008480659],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0378865,0.00080514286,0.00082892075,0.005060553,0.000703131,0.0022571103,0.0011987301,0.0011100915,0.0028073885],"category_scores_gemma":[0.13810033,0.000454907,0.001772394,0.0049664285,0.0012313355,0.002282221,0.0015052137,0.0017036785,0.0006400113],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010455131,0.0029438576,0.6739477,0.0008425671,0.0010396672,0.00022621386,0.010781531,0.005049507,0.004785129,0.031881455,0.0033979248,0.2640589],"study_design_scores_gemma":[0.00041598626,0.0045953733,0.8872856,0.00056880875,0.0004520827,0.0006453649,0.009852299,0.048896484,0.0074585997,0.026710369,0.012892517,0.00022655747],"about_ca_topic_score_codex":0.00068543776,"about_ca_topic_score_gemma":0.00071851816,"teacher_disagreement_score":0.0378865,"about_ca_system_score_codex":0.0013926525,"about_ca_system_score_gemma":0.0014847697,"threshold_uncertainty_score":0.20036536},"labels":[],"label_agreement":null},{"id":"W2139940744","doi":"10.1177/0013164404268668","title":"Reliability Generalization of Responses by Care Providers to the Center for Epidemiologic Studies-Depression Scale","year":2004,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Mental Health Treatment and Access","field":"Psychology","cited_by":51,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Center for Epidemiologic Studies Depression Scale; Reliability (semiconductor); Scale (ratio); Generalization; Psychology; Clinical psychology; Depression (economics); Psychometrics; Item response theory; Gerontology; Psychiatry; Depressive symptoms; Medicine; Cognition; Mathematics","score_opus":0.24454511919170627,"score_gpt":0.4761799233039707,"score_spread":0.23163480411226442,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2139940744","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.94394684,0.012715038,0.026407933,0.0009366084,0.0003435469,0.0016353101,0.0042952662,0.00016141178,0.009558076],"genre_scores_gemma":[0.98687416,0.0016561369,0.00719308,0.00026251067,0.00007922967,0.00083993835,0.002628219,0.000032749787,0.00043393954],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9422205,0.03797644,0.008360803,0.003224885,0.007757574,0.00045984593],"domain_scores_gemma":[0.8782243,0.07817225,0.0130785275,0.010973276,0.019074252,0.00047741726],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.086696684,0.00037509855,0.0012570245,0.0031456326,0.00051950436,0.001034383,0.0008813088,0.0004933975,0.00082999526],"category_scores_gemma":[0.15480183,0.00052641134,0.0022556484,0.0027354602,0.0008700893,0.00068121555,0.0015410667,0.00088958733,0.00023698095],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00062823034,0.000110345434,0.9388577,0.0010462995,0.007064506,0.000051955252,0.0031678632,0.0004801608,0.0008395207,0.00048260286,0.0020739494,0.04519677],"study_design_scores_gemma":[0.00013698857,0.0005596632,0.98789525,0.00050015195,0.0024660097,0.00021900506,0.0014775041,0.0012372506,0.0012197475,0.0009072947,0.0033233399,0.000057807632],"about_ca_topic_score_codex":0.002090549,"about_ca_topic_score_gemma":0.0036491842,"teacher_disagreement_score":0.086696684,"about_ca_system_score_codex":0.00069275755,"about_ca_system_score_gemma":0.00062770833,"threshold_uncertainty_score":0.4585014},"labels":[],"label_agreement":null},{"id":"W2140588557","doi":"10.1177/0013164414548894","title":"A Cautionary Note on the Use of the Vale and Maurelli Method to Generate Multivariate, Nonnormal Data for Simulation Purposes","year":2014,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Statistical Methods and Bayesian Inference","field":"Mathematics","cited_by":37,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Kurtosis; Skewness; Statistics; Univariate; Mathematics; Monte Carlo method; Population; Variable (mathematics); Multivariate statistics; Sample (material); Econometrics; Algorithm","score_opus":0.6134090036945616,"score_gpt":0.49396079300045054,"score_spread":0.1194482106941111,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2140588557","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.021744736,0.00885955,0.48707992,0.3831297,0.07107913,0.0014994668,0.0021790727,0.0063988445,0.018029658],"genre_scores_gemma":[0.1306675,0.0035281489,0.646181,0.1690458,0.017459925,0.0034785038,0.00046229197,0.0031296443,0.026047276],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.82531196,0.13747689,0.0117634805,0.005738563,0.018772487,0.00093660696],"domain_scores_gemma":[0.43019906,0.4683334,0.009434226,0.029766437,0.060473353,0.0017935312],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.14919408,0.0023046196,0.0031139245,0.0035005365,0.004273951,0.007271471,0.009923424,0.006520729,0.005656888],"category_scores_gemma":[0.5352716,0.0015044083,0.0036328267,0.0041737785,0.010081617,0.0060670953,0.00423345,0.02753326,0.0056310636],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014864459,0.0002861936,0.016561719,0.0021969774,0.0009433393,0.0022386294,0.011766899,0.009386298,0.0030300657,0.1334917,0.6966916,0.12192017],"study_design_scores_gemma":[0.00073431584,0.0007249418,0.016098844,0.006065868,0.00052819314,0.0031198487,0.004953667,0.07260272,0.01192517,0.23964675,0.6422994,0.0013003106],"about_ca_topic_score_codex":0.011273417,"about_ca_topic_score_gemma":0.023079634,"teacher_disagreement_score":0.85080594,"about_ca_system_score_codex":0.0031587037,"about_ca_system_score_gemma":0.0045493604,"threshold_uncertainty_score":0.7890231},"labels":[],"label_agreement":null},{"id":"W2143769021","doi":"10.1177/0013164406296976","title":"The Impact of Outliers on Cronbach's Coefficient Alpha Estimate of Reliability: Visual Analogue Scales","year":2007,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":63,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Cronbach's alpha; Outlier; Statistics; Sample (material); Population; Reliability (semiconductor); Statistic; Context (archaeology); Mathematics; Econometrics; Psychometrics; Demography; Geography; Chemistry","score_opus":0.24588333650656144,"score_gpt":0.5254813432007601,"score_spread":0.27959800669419865,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2143769021","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.58990455,0.0053537255,0.3698321,0.0016898805,0.0013277534,0.0007005275,0.00094097195,0.00092654256,0.029324122],"genre_scores_gemma":[0.9416931,0.00052894355,0.055151653,0.0002951319,0.0001649416,0.0005582468,0.00034111371,0.00036570968,0.00090123445],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8172595,0.11715135,0.014280176,0.007310149,0.04273529,0.0012635745],"domain_scores_gemma":[0.27255532,0.6298522,0.02966625,0.03317141,0.033562962,0.0011918987],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.10087269,0.00089280604,0.0017402588,0.003892526,0.0010157528,0.0033029625,0.0017400689,0.00095573236,0.0018867584],"category_scores_gemma":[0.5628919,0.0007039043,0.0013631067,0.0055403668,0.0035263847,0.0029014894,0.0028026602,0.002470445,0.000626791],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0029558707,0.0003310863,0.4529665,0.0030831324,0.0032393113,0.00081811677,0.024362493,0.014806461,0.008272148,0.03304342,0.01630089,0.43982053],"study_design_scores_gemma":[0.00023482268,0.0032350754,0.76709753,0.0020373352,0.0016129703,0.0026839483,0.012560753,0.04821462,0.02148692,0.10635398,0.03375062,0.00073149527],"about_ca_topic_score_codex":0.0012637145,"about_ca_topic_score_gemma":0.0014638292,"teacher_disagreement_score":0.8991273,"about_ca_system_score_codex":0.0010536084,"about_ca_system_score_gemma":0.0010313655,"threshold_uncertainty_score":0.5334722},"labels":[],"label_agreement":null},{"id":"W2145368831","doi":"10.1177/0013164404267286","title":"Items in Context: Assessing the Dimensionality of Raven’s Advanced Progressive Matrices","year":2004,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Cognitive Abilities and Testing","field":"Psychology","cited_by":29,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"The Scarborough Hospital; University of Toronto; Université de Moncton","funders":"","keywords":"Rasch model; Principal component analysis; Raven's Progressive Matrices; Curse of dimensionality; Context (archaeology); Set (abstract data type); Psychology; Test (biology); Artificial intelligence; Cognitive psychology; Mathematics; Statistics; Computer science; Cognition","score_opus":0.15614162299139392,"score_gpt":0.4156424825958814,"score_spread":0.25950085960448743,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2145368831","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.98034865,0.0005897121,0.012690186,0.00023661472,0.00006118294,0.00025871242,0.00024654702,0.000051272054,0.005517062],"genre_scores_gemma":[0.9778376,0.00025555762,0.020553926,0.00007372071,0.00004734853,0.0003484383,0.00023945223,0.000015328791,0.00062860065],"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.995327,0.0020441818,0.0005328071,0.00066661317,0.0012724701,0.0001570234],"domain_scores_gemma":[0.9866044,0.0076708836,0.0025758042,0.0014907249,0.0012528417,0.0004053644],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.005582013,0.000880918,0.0006172109,0.002561743,0.00063798303,0.0014736517,0.00089228054,0.0006379809,0.0016748777],"category_scores_gemma":[0.04156088,0.00027440602,0.00050240115,0.0014441141,0.00077889237,0.0032198324,0.0023361025,0.0014517661,0.00033185995],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014931925,0.0005200079,0.53077096,0.00045690534,0.0006209049,0.00080283545,0.012796233,0.002387778,0.010075311,0.009985344,0.0031003465,0.42699024],"study_design_scores_gemma":[0.00024299095,0.0028083592,0.9107593,0.00026327415,0.00028769634,0.0035912576,0.0056995596,0.0059724264,0.009381332,0.047498956,0.013276521,0.00021836645],"about_ca_topic_score_codex":0.00079029624,"about_ca_topic_score_gemma":0.0015356321,"teacher_disagreement_score":0.99441797,"about_ca_system_score_codex":0.0003341196,"about_ca_system_score_gemma":0.00080280047,"threshold_uncertainty_score":0.02952087},"labels":[],"label_agreement":null},{"id":"W2147389406","doi":"10.1177/0013164404267293","title":"Employment-Related Motivational Distortion: Its Nature, Measurement, and Reduction","year":2005,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Personality Traits and Psychology","field":"Psychology","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Psychology; Scale (ratio); Statistics; Reliability (semiconductor); Facet (psychology); Econometrics; California Psychological Inventory; Personality; Minnesota Multiphasic Personality Inventory; Social psychology; Mathematics; Big Five personality traits","score_opus":0.16023899951099507,"score_gpt":0.3733470839528351,"score_spread":0.21310808444184004,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2147389406","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9978788,0.00016199362,0.000813469,0.00008206486,0.000006161318,0.00006074506,0.000068023,0.0000036179097,0.00092515245],"genre_scores_gemma":[0.99905723,0.000033233766,0.0007311684,0.000011639067,0.0000032872827,0.000021801932,0.00006322041,0.0000011574915,0.00007713057],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99891603,0.00032094453,0.000099443045,0.00009667412,0.0004678497,0.000099123485],"domain_scores_gemma":[0.9969145,0.00080958067,0.0011973399,0.00034529966,0.00044124655,0.00029205083],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0027664944,0.00019840276,0.00025778907,0.00076820946,0.0003539307,0.00067306444,0.0004239979,0.00021437427,0.0004897441],"category_scores_gemma":[0.009013965,0.00017693535,0.00027052997,0.0006428846,0.000539815,0.0003521399,0.0012340217,0.0006259418,0.00006355934],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00012796465,0.00014561074,0.972219,0.000022584734,0.000029395096,0.000027693808,0.0007704571,0.00008947185,0.0009077554,0.0003974341,0.00006722293,0.025195364],"study_design_scores_gemma":[0.0000042987604,0.00009083903,0.99811804,0.0000074297177,0.000006963485,0.00009956545,0.0003663093,0.0005313914,0.0003782127,0.00016736033,0.00022429912,0.0000053020226],"about_ca_topic_score_codex":0.0022589907,"about_ca_topic_score_gemma":0.0040534544,"teacher_disagreement_score":0.0027664944,"about_ca_system_score_codex":0.000638791,"about_ca_system_score_gemma":0.00058312755,"threshold_uncertainty_score":0.0146307945},"labels":[],"label_agreement":null},{"id":"W2151034533","doi":"10.1177/0013164411429821","title":"Impact of Outliers Arising From Unintended and Unknowingly Included Subpopulations on the Decisions About the Number of Factors in Exploratory Factor Analysis","year":2012,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Outlier; Principal component analysis; Exploratory factor analysis; Affect (linguistics); Sample (material); Statistics; Econometrics; Psychology; Mathematics; Psychometrics; Chemistry","score_opus":0.5576272671228929,"score_gpt":0.5227089697684599,"score_spread":0.03491829735443297,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2151034533","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.79753304,0.0009979077,0.19528252,0.0009780225,0.00018541356,0.001168103,0.00019400918,0.00020411176,0.0034569271],"genre_scores_gemma":[0.89459217,0.00023382441,0.103542924,0.00016079162,0.000046875433,0.0008509792,0.00015752712,0.000086605345,0.00032822875],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.75706255,0.182622,0.021621492,0.008923021,0.027731307,0.0020396928],"domain_scores_gemma":[0.20247439,0.7181613,0.030292457,0.029441757,0.01796434,0.0016657419],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.19454311,0.0011324352,0.0015676507,0.001955065,0.0019778947,0.0036582318,0.0014145956,0.0012220523,0.0021740848],"category_scores_gemma":[0.5845958,0.0006746706,0.0020936918,0.0023142651,0.0041992837,0.004404801,0.0034801138,0.0024486482,0.0003235216],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0087729115,0.0012351199,0.41314617,0.0018377521,0.002159357,0.000902328,0.047303606,0.01763098,0.011399418,0.025181139,0.0026397742,0.46779144],"study_design_scores_gemma":[0.00077333447,0.0063953125,0.6896786,0.0032995495,0.002037134,0.0013720322,0.04462188,0.09712959,0.040149238,0.098848894,0.014574017,0.0011203616],"about_ca_topic_score_codex":0.0014541827,"about_ca_topic_score_gemma":0.0026216991,"teacher_disagreement_score":0.19454311,"about_ca_system_score_codex":0.0017129978,"about_ca_system_score_gemma":0.0026483007,"threshold_uncertainty_score":0.99327177},"labels":[],"label_agreement":null},{"id":"W2154413108","doi":"10.1177/0013164406299132","title":"Correction for Attenuation With Biased Reliability Estimates and Correlated Errors in Populations and Samples","year":2007,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Statistical Methods and Bayesian Inference","field":"Mathematics","cited_by":34,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"","keywords":"Statistics; Reliability (semiconductor); Monte Carlo method; Correction for attenuation; Attenuation; Sample size determination; Observational error; Mathematics; Population; Sampling error; Sample (material); Sampling (signal processing); Random variable; Econometrics; Computer science; Physics; Demography; Optics","score_opus":0.34262566925646354,"score_gpt":0.449982568421525,"score_spread":0.10735689916506147,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2154413108","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017196974,0.00041832848,0.9802776,0.00045241127,0.000107773354,0.00024694446,0.00006198874,0.0002934617,0.00094451796],"genre_scores_gemma":[0.47753626,0.0006049871,0.5177509,0.00042651105,0.00019080988,0.0014355,0.00017325427,0.00031252505,0.0015692135],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.81852823,0.14861983,0.006939017,0.009681499,0.014721603,0.0015097918],"domain_scores_gemma":[0.22824623,0.68512684,0.024867635,0.04816501,0.012981579,0.00061274774],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.17967556,0.0019829746,0.0024213803,0.003913106,0.0014095932,0.002722097,0.0034448367,0.0028610292,0.0027901067],"category_scores_gemma":[0.728368,0.0015981139,0.002294332,0.004668631,0.0065981527,0.0047782506,0.0053975405,0.0045482013,0.0005412932],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010470311,0.00020480664,0.085673496,0.0012737586,0.0021587738,0.0018296053,0.0072504464,0.16651462,0.0023324331,0.4726632,0.004436365,0.2546155],"study_design_scores_gemma":[0.00018975473,0.0005734818,0.032553867,0.0010535277,0.00082450075,0.0018588927,0.00067197275,0.44082317,0.0045623975,0.5090791,0.0075457245,0.00026358257],"about_ca_topic_score_codex":0.004496467,"about_ca_topic_score_gemma":0.004130697,"teacher_disagreement_score":0.17967556,"about_ca_system_score_codex":0.0024684938,"about_ca_system_score_gemma":0.004260959,"threshold_uncertainty_score":0.95022655},"labels":[],"label_agreement":null},{"id":"W2154633345","doi":"10.1177/0013164403258393","title":"Impact of Test Design, Item Quality, and Item Bank Size on the Psychometric Properties of Computer-Based Credentialing Examinations","year":2004,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":36,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ministry of Education and Child Care","funders":"","keywords":"Credentialing; Computerized adaptive testing; Item bank; Test (biology); Quality (philosophy); Computer science; Consistency (knowledge bases); Test design; Item response theory; Psychology; Psychometrics; Applied psychology; Statistics; Reliability engineering; Artificial intelligence; Medical education; Test method; Medicine; Mathematics; Clinical psychology","score_opus":0.8330425941791564,"score_gpt":0.5172334143779688,"score_spread":0.3158091798011876,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2154633345","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.97546357,0.0013148438,0.019870764,0.0006619621,0.00008386803,0.00064757006,0.00014818963,0.00014505835,0.0016642923],"genre_scores_gemma":[0.9718269,0.00024326167,0.02639953,0.00032472942,0.00005266113,0.0005436009,0.00022713395,0.00008458787,0.00029745922],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8400878,0.11616241,0.020715702,0.0055458825,0.01602304,0.0014653364],"domain_scores_gemma":[0.18149914,0.75943774,0.022576282,0.01998978,0.013641792,0.0028553726],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.15272738,0.00095652585,0.0010241654,0.0017594687,0.00071503076,0.0024893568,0.0010261833,0.0015973214,0.0014618057],"category_scores_gemma":[0.45808607,0.0008054582,0.0015745964,0.0024214885,0.0023883735,0.0027231134,0.0018932249,0.001730985,0.000322833],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.019662056,0.0027388567,0.7362366,0.0007592489,0.0013757233,0.0004749639,0.0032418184,0.012819691,0.016461425,0.0024826652,0.00084041,0.20290656],"study_design_scores_gemma":[0.0025609918,0.023203237,0.915878,0.00050144625,0.0013293633,0.0015535874,0.0009260727,0.028072326,0.017726712,0.0049397256,0.0030150327,0.00029348815],"about_ca_topic_score_codex":0.0011035564,"about_ca_topic_score_gemma":0.0013639592,"teacher_disagreement_score":0.84727263,"about_ca_system_score_codex":0.0018790514,"about_ca_system_score_gemma":0.002214581,"threshold_uncertainty_score":0.8077092},"labels":[],"label_agreement":null},{"id":"W2158599033","doi":"10.1177/0013164407313368","title":"Factorial Invariance of the Academic Amotivation Inventory (AAI) Across Gender and Grade in a Sample of Canadian High School Students","year":2008,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Motivation and Self-Concept in Sports","field":"Psychology","cited_by":65,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Ottawa; Université du Québec en Outaouais","funders":"","keywords":"Amotivation; Psychology; Measurement invariance; Metric (unit); Sample (material); Internal consistency; Factorial; Construct validity; Confirmatory factor analysis; Developmental psychology; Test validity; Psychometrics; Social psychology; Structural equation modeling; Statistics; Mathematics; Intrinsic motivation","score_opus":0.25205896513744275,"score_gpt":0.3812125439226223,"score_spread":0.12915357878517958,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2158599033","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99922955,0.000021698152,0.00008800055,0.000018373987,0.0000032474447,0.000024993124,0.00009717373,0.0000023010793,0.0005145942],"genre_scores_gemma":[0.99910766,0.000037925784,0.00026207548,0.000010977648,0.0000017316419,0.000025969415,0.00030840194,0.0000028111126,0.0002424267],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9988783,0.0001454206,0.000075561016,0.00015736543,0.0004986961,0.0002446429],"domain_scores_gemma":[0.9981541,0.0003689644,0.00033103637,0.00020557124,0.00064712303,0.00029316425],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0027926008,0.00028568812,0.0003624962,0.0014173033,0.0018022844,0.001176139,0.00067027035,0.00024209732,0.0009586598],"category_scores_gemma":[0.007057243,0.00024118336,0.00048280047,0.0013329104,0.001298583,0.0002583816,0.00070766936,0.00054741144,0.00012725873],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006350619,0.00009226078,0.98565316,0.000010325422,0.000029695146,0.00003231023,0.0030273455,0.000053703778,0.00057027076,0.00022369511,0.00018323801,0.010060494],"study_design_scores_gemma":[0.0000028121276,0.000038153332,0.9988519,0.0000027856227,0.000004845682,0.000018802853,0.00071607507,0.00009559465,0.00006161974,0.00003613084,0.00016806049,0.0000031988347],"about_ca_topic_score_codex":0.6154601,"about_ca_topic_score_gemma":0.69596696,"teacher_disagreement_score":0.3845399,"about_ca_system_score_codex":0.0039347024,"about_ca_system_score_gemma":0.005175908,"threshold_uncertainty_score":0.77360904},"labels":[],"label_agreement":null},{"id":"W2160937459","doi":"10.1177/0013164406288161","title":"Confidence Interval Coverage for Cohen's Effect Size Statistic","year":2006,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":62,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Statistics; Confidence interval; Percentile; Statistic; Mathematics; Sample size determination; Coverage probability; Population; Robust confidence intervals; Truncated mean; Econometrics; Medicine","score_opus":0.24095559011322293,"score_gpt":0.46794666524031703,"score_spread":0.2269910751270941,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2160937459","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.030219637,0.020646797,0.88992786,0.0053074425,0.0035898152,0.0032044502,0.0031866312,0.002367435,0.041549888],"genre_scores_gemma":[0.5017838,0.0026690813,0.4755859,0.0036210176,0.0010358754,0.011021617,0.0016332704,0.0011850044,0.0014644618],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.6795232,0.19314423,0.029118845,0.024510408,0.071518436,0.0021847975],"domain_scores_gemma":[0.15784213,0.7421102,0.021725534,0.03116147,0.045952477,0.0012082009],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.21538055,0.0014111499,0.0038529048,0.017276173,0.0017281832,0.0044661746,0.005948187,0.0051718834,0.0077434774],"category_scores_gemma":[0.795851,0.0010210552,0.0048705386,0.009613401,0.005667309,0.006883324,0.0065379515,0.00608347,0.0016062532],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.004078426,0.00038092167,0.046641126,0.012839703,0.0067499257,0.00072372635,0.0074734534,0.018720046,0.00216035,0.2945437,0.064241275,0.5414473],"study_design_scores_gemma":[0.002153245,0.0028807076,0.08668202,0.019964186,0.006014736,0.00447019,0.004583667,0.1006359,0.019506382,0.54481786,0.20684741,0.0014436372],"about_ca_topic_score_codex":0.0026469824,"about_ca_topic_score_gemma":0.0014232498,"teacher_disagreement_score":0.78461945,"about_ca_system_score_codex":0.0032455376,"about_ca_system_score_gemma":0.0026067223,"threshold_uncertainty_score":0.9675755},"labels":[],"label_agreement":null},{"id":"W2161220067","doi":"10.1177/0013164404272499","title":"Can Percentiles Replace Raw Scores in the Statistical Analysis of Test Data?","year":2005,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":25,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia; Carleton University","funders":"","keywords":"Percentile; Raw score; Statistics; Nonparametric statistics; Percentile rank; Statistical power; Raw data; Mathematics; Statistical hypothesis testing; Test (biology); Statistical analysis; Econometrics","score_opus":0.4758787201349256,"score_gpt":0.5112399896517614,"score_spread":0.035361269516835825,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2161220067","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.021876428,0.01203671,0.932255,0.009735646,0.009121055,0.00042637007,0.0015581816,0.004347015,0.008643444],"genre_scores_gemma":[0.2994039,0.007844217,0.67194086,0.0054068626,0.006311821,0.0018990032,0.00173369,0.0028120286,0.0026475927],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.7165908,0.21619889,0.016689591,0.012454831,0.035965167,0.0021006537],"domain_scores_gemma":[0.3593826,0.48752525,0.036962986,0.09217679,0.021395158,0.0025571939],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.18767147,0.0037573213,0.006288129,0.010684953,0.0017755023,0.009201833,0.0072979745,0.003963209,0.00561705],"category_scores_gemma":[0.6883726,0.0026329309,0.0029892283,0.018574707,0.012993097,0.025935413,0.008078875,0.0133979665,0.004341407],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010967104,0.00023442286,0.053576197,0.0025347031,0.0019342746,0.0004930436,0.004381908,0.007497372,0.0014518845,0.13786773,0.053144943,0.73578674],"study_design_scores_gemma":[0.00045209058,0.0028591729,0.06545676,0.0041742157,0.0009795666,0.0024892718,0.0040030875,0.059432704,0.0062164087,0.6687022,0.18398352,0.0012510656],"about_ca_topic_score_codex":0.0034609328,"about_ca_topic_score_gemma":0.003360061,"teacher_disagreement_score":0.8123285,"about_ca_system_score_codex":0.0021003846,"about_ca_system_score_gemma":0.0032004002,"threshold_uncertainty_score":0.9925134},"labels":[],"label_agreement":null},{"id":"W2166456938","doi":"10.1177/0013164406292089","title":"A Test of the Age-Based Measurement Invariance and Temporal Stability of Antonovsky's Sense of Coherence Scale","year":2007,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Health, psychology, and well-being","field":"Health Professions","cited_by":33,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Measurement invariance; Structural equation modeling; Psychology; Scale (ratio); Stability (learning theory); Population; Test (biology); Statistics; Developmental psychology; Mathematics; Demography; Confirmatory factor analysis; Geography; Computer science","score_opus":0.26464359229387174,"score_gpt":0.4371949212201265,"score_spread":0.17255132892625474,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2166456938","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.991791,0.00011011813,0.003158648,0.00012021081,0.000030077475,0.0001409037,0.0005169128,0.000017983168,0.0041142358],"genre_scores_gemma":[0.99680555,0.000046431676,0.0018770788,0.000033025874,0.000016139116,0.00019071347,0.00070353644,0.000008554026,0.00031889952],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99810237,0.00041094242,0.00035693066,0.0002393366,0.0007089585,0.00018155247],"domain_scores_gemma":[0.98152965,0.005769949,0.006509701,0.0017685695,0.0037419896,0.0006800669],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0041541485,0.00022529665,0.00025217232,0.0013034783,0.00064718514,0.00051038095,0.0004183827,0.00031865478,0.0015315558],"category_scores_gemma":[0.025364826,0.00017820043,0.00056750065,0.0009951029,0.0007182953,0.00092027895,0.00093025493,0.0006224179,0.00025963012],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020759947,0.00017385482,0.97330564,0.000032137646,0.00012294855,0.000053474523,0.0013047981,0.0003113514,0.0015235385,0.0011239356,0.00052017753,0.021320475],"study_design_scores_gemma":[0.000015265192,0.0002797901,0.99673057,0.00000903456,0.000013415191,0.000083898856,0.000523873,0.00086848775,0.0003145657,0.00049794285,0.0006529749,0.000010145196],"about_ca_topic_score_codex":0.0071241204,"about_ca_topic_score_gemma":0.009033336,"teacher_disagreement_score":0.0071241204,"about_ca_system_score_codex":0.00045632158,"about_ca_system_score_gemma":0.0010325945,"threshold_uncertainty_score":0.021969497},"labels":[],"label_agreement":null},{"id":"W2168109053","doi":"10.1177/0013164413492419","title":"Effectiveness of Combining Statistical Tests and Effect Sizes When Using Logistic Discriminant Function Regression to Detect Differential Item Functioning for Polytomous Items","year":2013,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":43,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Statistics; Differential item functioning; Polytomous Rasch model; Discriminant function analysis; Sample size determination; Mathematics; Logistic regression; Linear discriminant analysis; Psychology; Statistical hypothesis testing; Econometrics; Psychometrics; Item response theory","score_opus":0.5320350509278347,"score_gpt":0.4801596014508845,"score_spread":0.051875449476950164,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2168109053","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.3835739,0.0024596115,0.60217524,0.0010656534,0.00031912047,0.0022891744,0.00037651096,0.0029265895,0.0048142043],"genre_scores_gemma":[0.534894,0.000280232,0.46211204,0.000388493,0.00015415002,0.0013637947,0.00023544334,0.00026154518,0.00031034744],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.63420105,0.29157746,0.02262489,0.02150294,0.028325124,0.0017685288],"domain_scores_gemma":[0.19802198,0.7619671,0.015715545,0.016384818,0.0065903515,0.0013201699],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.25121787,0.0040311087,0.006580664,0.00864746,0.0012393137,0.0049412926,0.0035482077,0.0041698604,0.001864635],"category_scores_gemma":[0.5401216,0.0018639598,0.004293303,0.005805308,0.00399727,0.008270468,0.0038812694,0.004516764,0.0009083062],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.023578681,0.002277807,0.21145597,0.0022108972,0.010026844,0.0014159151,0.0015305172,0.07319367,0.021618254,0.006829483,0.0025672868,0.6432947],"study_design_scores_gemma":[0.0033356056,0.024189241,0.14268173,0.0010768679,0.006908021,0.0032664821,0.0013387422,0.7064618,0.06194783,0.0397512,0.0074290778,0.0016133828],"about_ca_topic_score_codex":0.00049876305,"about_ca_topic_score_gemma":0.00086031354,"teacher_disagreement_score":0.74878216,"about_ca_system_score_codex":0.0012131758,"about_ca_system_score_gemma":0.0019853183,"threshold_uncertainty_score":0.9233817},"labels":[],"label_agreement":null},{"id":"W2309234137","doi":"10.1177/0013164415596421","title":"Improving the Factor Structure of Psychological Scales","year":2015,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Child and Adolescent Psychosocial and Emotional Development","field":"Psychology","cited_by":58,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Likert scale; Psychology; Scale (ratio); Confirmatory factor analysis; Exploratory factor analysis; Acquiescence; Guttman scale; Psychometrics; Social psychology; Statistics; Clinical psychology; Structural equation modeling; Developmental psychology; Mathematics","score_opus":0.17015467455922587,"score_gpt":0.3575145933061743,"score_spread":0.18735991874694843,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2309234137","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1531443,0.0004681765,0.8334032,0.00082568225,0.00057250663,0.00398598,0.0012047187,0.001748186,0.00464723],"genre_scores_gemma":[0.33158448,0.00028683094,0.6579429,0.00016943947,0.00014305375,0.005953148,0.0022788432,0.00039486942,0.001246442],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9750011,0.016439334,0.0027014704,0.0024693639,0.0028446324,0.00054412853],"domain_scores_gemma":[0.89631325,0.06616926,0.0024071543,0.011136026,0.023476921,0.0004973845],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.053563204,0.0019966348,0.0013125645,0.0031381918,0.0009470576,0.0026379416,0.0010324985,0.00078848604,0.007156626],"category_scores_gemma":[0.18771556,0.0007389382,0.0025577752,0.003254511,0.0008403275,0.0031660001,0.0020040236,0.0022573501,0.0021579538],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008101315,0.00076384173,0.06505643,0.0013089675,0.00070881384,0.00022123572,0.008032576,0.0074003763,0.013724883,0.01544623,0.011938863,0.8745876],"study_design_scores_gemma":[0.0020134572,0.004677021,0.3428464,0.0028763348,0.0017886978,0.00080779433,0.012230433,0.33921754,0.03521235,0.15139015,0.10603058,0.00090920035],"about_ca_topic_score_codex":0.0010962073,"about_ca_topic_score_gemma":0.0014835586,"teacher_disagreement_score":0.053563204,"about_ca_system_score_codex":0.00074497046,"about_ca_system_score_gemma":0.0015814187,"threshold_uncertainty_score":0.28327268},"labels":[],"label_agreement":null},{"id":"W2329897787","doi":"10.1177/0013164415618240","title":"The Impact of Ignoring the Level of Nesting Structure in Nonparametric Multilevel Latent Class Models","year":2015,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Statistical Methods and Bayesian Inference","field":"Mathematics","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Nesting (process); Nonparametric statistics; Latent class model; Class (philosophy); Econometrics; Multilevel model; Statistics; Structural equation modeling; Mathematics; Psychology; Computer science; Artificial intelligence; Engineering","score_opus":0.6967470229892968,"score_gpt":0.4920068167406266,"score_spread":0.20474020624867023,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2329897787","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.11596159,0.0006609621,0.8798058,0.0016908894,0.00007558203,0.00014853297,0.00011216371,0.00016714702,0.0013772927],"genre_scores_gemma":[0.7502662,0.00038706616,0.24793376,0.0004972626,0.00006823384,0.00026226824,0.00017052892,0.00006627866,0.00034832713],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8696067,0.11116012,0.004212779,0.0048285103,0.008974906,0.0012169903],"domain_scores_gemma":[0.43817082,0.5058205,0.020610133,0.02580079,0.008400633,0.0011971575],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.11207558,0.000886059,0.0015919928,0.0014196903,0.0018689408,0.003192744,0.0029750012,0.0022272386,0.0011923267],"category_scores_gemma":[0.4296844,0.0010149896,0.0020699056,0.0023285719,0.003903744,0.0067381533,0.0035419348,0.0042217835,0.00017290987],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011128867,0.0004385553,0.15565123,0.0010438056,0.0019129711,0.0013509813,0.0069719325,0.4044527,0.0035207244,0.19648553,0.002427085,0.2246316],"study_design_scores_gemma":[0.00008446158,0.00046150776,0.023648653,0.0003776077,0.00042446365,0.00047374205,0.00079235015,0.8269434,0.0024563225,0.14263041,0.0015657607,0.0001414213],"about_ca_topic_score_codex":0.01047292,"about_ca_topic_score_gemma":0.01552334,"teacher_disagreement_score":0.88792443,"about_ca_system_score_codex":0.0025484143,"about_ca_system_score_gemma":0.004250127,"threshold_uncertainty_score":0.59271944},"labels":[],"label_agreement":null},{"id":"W2406198090","doi":"10.1177/0013164416651116","title":"Multidimensional Extension of Multiple Indicators Multiple Causes Models to Detect DIF","year":2016,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Advanced Statistical Modeling Techniques","field":"Computer Science","cited_by":33,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Differential item functioning; Item response theory; Type I and type II errors; Statistics; Statistical power; Sample size determination; Context (archaeology); Correlation; Mathematics; Econometrics; Psychometrics","score_opus":0.16975496614616864,"score_gpt":0.3494013428645477,"score_spread":0.17964637671837907,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2406198090","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.116475396,0.00023974759,0.8780479,0.000457709,0.00010002939,0.001400478,0.00041729622,0.00052009063,0.0023412942],"genre_scores_gemma":[0.72779065,0.0001900864,0.266775,0.00020566552,0.000066155706,0.00330363,0.0006409167,0.00009170046,0.0009362183],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9064398,0.07745803,0.0026942769,0.006508716,0.00581317,0.0010860147],"domain_scores_gemma":[0.8164668,0.14186105,0.013877458,0.019913562,0.0069347695,0.0009462706],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08211504,0.0023281865,0.002368686,0.0055868775,0.0016851175,0.0024828305,0.0028119416,0.001769171,0.005597267],"category_scores_gemma":[0.19344327,0.0011902949,0.0058284607,0.004226541,0.0029649665,0.0042709853,0.0053122733,0.0028841044,0.0006434841],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0023030827,0.0011103824,0.3860543,0.0011187331,0.005962396,0.0010904587,0.00910757,0.12376725,0.0016461173,0.1780763,0.00421683,0.2855465],"study_design_scores_gemma":[0.0004358294,0.0014740966,0.06490911,0.00029662254,0.0010403543,0.000901202,0.0010758855,0.6904556,0.0013970574,0.23348701,0.0043043997,0.0002228146],"about_ca_topic_score_codex":0.003051388,"about_ca_topic_score_gemma":0.0027379456,"teacher_disagreement_score":0.08211504,"about_ca_system_score_codex":0.0018253156,"about_ca_system_score_gemma":0.0026546863,"threshold_uncertainty_score":0.43427104},"labels":[],"label_agreement":null},{"id":"W2467932880","doi":"10.1177/0013164416654740","title":"An Unbiased Estimate of Global Interrater Agreement","year":2016,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Trois-Rivières; University of Ottawa","funders":"","keywords":"Inter-rater reliability; Statistics; Agreement; Econometrics; Psychology; Mathematics; Rating scale; Linguistics","score_opus":0.40228873007278076,"score_gpt":0.47602807594491,"score_spread":0.07373934587212921,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2467932880","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.046910383,0.0028422817,0.921293,0.0007432716,0.00049534335,0.0015753513,0.001454757,0.0012105639,0.023474952],"genre_scores_gemma":[0.48611504,0.0010169434,0.50237346,0.00073732034,0.00030944555,0.003585681,0.0015015523,0.0005038658,0.0038566713],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8571511,0.08960382,0.014246089,0.013913982,0.023240449,0.0018445507],"domain_scores_gemma":[0.7436058,0.14335428,0.022531113,0.037334055,0.051830333,0.0013444525],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.11173745,0.0012763311,0.0022708618,0.006856731,0.0014789425,0.0035644225,0.0022730702,0.0019164279,0.0047904793],"category_scores_gemma":[0.31011483,0.0007442116,0.0016912936,0.0045722644,0.0025624388,0.0040072966,0.004541899,0.0021334856,0.002434815],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008912151,0.0002817409,0.143088,0.005251277,0.0034862347,0.00040551176,0.01290353,0.0071291807,0.013923464,0.10208275,0.021628708,0.6889284],"study_design_scores_gemma":[0.00029033687,0.0025124743,0.3621488,0.007763541,0.0040243757,0.0044889757,0.012039755,0.079113066,0.044707816,0.29542714,0.18643004,0.0010537049],"about_ca_topic_score_codex":0.0011345586,"about_ca_topic_score_gemma":0.002481141,"teacher_disagreement_score":0.88826257,"about_ca_system_score_codex":0.001036482,"about_ca_system_score_gemma":0.0023877965,"threshold_uncertainty_score":0.5909312},"labels":[],"label_agreement":null},{"id":"W2529050713","doi":"10.1177/0013164416667987","title":"Perspectives on the Use of Null Hypothesis Statistical Testing. Part II: Is Null Hypothesis Statistical Testing an Irregular Bulk of Masonry?","year":2016,"lang":"en","type":"editorial","venue":"Educational and Psychological Measurement","topic":"Geophysical Methods and Applications","field":"Engineering","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Null hypothesis; Statistical hypothesis testing; Null (SQL); Alternative hypothesis; Statistical analysis; Statistics; Null distribution; Mathematics; Econometrics; Test statistic; Computer science; Data mining","score_opus":0.2622178999809283,"score_gpt":0.3365527785065162,"score_spread":0.0743348785255879,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2529050713","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00003290385,0.062625095,0.001532318,0.122096166,0.8125397,0.000019314088,0.000061816754,0.00004907838,0.0010435274],"genre_scores_gemma":[0.00054299843,0.021036878,0.00074444944,0.039259497,0.93672305,0.000042727817,0.000019891611,0.000058557605,0.001571948],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.94227785,0.019193923,0.009569594,0.0045918217,0.023459757,0.0009070438],"domain_scores_gemma":[0.4898607,0.4361389,0.0077986373,0.00836457,0.05023435,0.0076027624],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.085902944,0.0041843075,0.008837526,0.00767444,0.00410656,0.014309826,0.009827795,0.02453602,0.0047737584],"category_scores_gemma":[0.27017263,0.003021593,0.003948033,0.0039473283,0.029690202,0.014897836,0.00384317,0.069111824,0.0050985436],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000071037655,0.000026511212,0.0000838097,0.0011066863,0.00010412902,0.00014264275,0.00016094661,0.00012988823,0.000082811006,0.00985912,0.96510303,0.02312942],"study_design_scores_gemma":[0.00013219463,0.000086866676,0.0005628931,0.003219508,0.00013481994,0.0005436613,0.00020973307,0.0006638482,0.00016006861,0.048545357,0.94562435,0.000116690964],"about_ca_topic_score_codex":0.0038417699,"about_ca_topic_score_gemma":0.007153598,"teacher_disagreement_score":0.9140971,"about_ca_system_score_codex":0.0062221563,"about_ca_system_score_gemma":0.0077544698,"threshold_uncertainty_score":0.45430362},"labels":[],"label_agreement":null},{"id":"W2529333171","doi":"10.1177/0013164416667986","title":"Perspectives on the Use of Null Hypothesis Statistical Testing. Part I: The Mighty Frames of Scientific and Statistical Inference","year":2016,"lang":"en","type":"editorial","venue":"Educational and Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Statistical hypothesis testing; Statistical inference; Null hypothesis; Inference; Statistical analysis; Null (SQL); Alternative hypothesis; Fiducial inference; Econometrics; Psychology; Statistics; Frequentist inference; Mathematics; Computer science; Artificial intelligence; Bayesian inference; Data mining; Bayesian probability","score_opus":0.544732837323388,"score_gpt":0.4694654802050009,"score_spread":0.07526735711838706,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2529333171","genre_codex":"editorial","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000032386444,0.101026334,0.0028473297,0.112598136,0.7824247,0.000019618059,0.000069990885,0.000055371205,0.0009262746],"genre_scores_gemma":[0.00079179136,0.034619045,0.001478976,0.03926591,0.9221106,0.000063701846,0.000026659347,0.000069984344,0.0015733262],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.925047,0.03628803,0.01008735,0.0044141575,0.023275094,0.00088838587],"domain_scores_gemma":[0.4791613,0.46302998,0.0067911926,0.0066907466,0.03932732,0.0049993927],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.088718735,0.0046540517,0.00867084,0.008339807,0.0035969813,0.015800199,0.010371064,0.022576455,0.00473416],"category_scores_gemma":[0.26916665,0.002536519,0.004905343,0.0040234295,0.027672637,0.01625223,0.0037009441,0.06984937,0.0041487017],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001162197,0.000030024981,0.00007412087,0.0018884552,0.00019455288,0.00014469585,0.00024112882,0.00022428678,0.0000852978,0.024063261,0.948755,0.024182947],"study_design_scores_gemma":[0.00023669361,0.0000992345,0.00045037776,0.004593119,0.00025408418,0.0005128685,0.00025539967,0.0011315274,0.00021178063,0.13108256,0.86102974,0.00014262823],"about_ca_topic_score_codex":0.0030477594,"about_ca_topic_score_gemma":0.005476804,"teacher_disagreement_score":0.9112813,"about_ca_system_score_codex":0.007291907,"about_ca_system_score_gemma":0.008544339,"threshold_uncertainty_score":0.46919513},"labels":[],"label_agreement":null},{"id":"W2529752630","doi":"10.1177/0013164416667988","title":"Perspectives on the Use of Null Hypothesis Statistical Testing. Part III: The Various Nuts and Bolts of Statistical and Hypothesis Testing","year":2016,"lang":"en","type":"editorial","venue":"Educational and Psychological Measurement","topic":"Fault Detection and Control Systems","field":"Engineering","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Statistical hypothesis testing; Nuts and bolts; Null hypothesis; Statistical analysis; Alternative hypothesis; Null (SQL); Statistics; One- and two-tailed tests; Econometrics; Statistical power; Mathematics; Null distribution; Computer science; Test statistic; Data mining; Geometry","score_opus":0.14158344641718815,"score_gpt":0.28863508568802093,"score_spread":0.14705163927083278,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2529752630","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00003508788,0.0988956,0.002049082,0.08723481,0.81079644,0.000025277142,0.0000720935,0.000059554866,0.0008319856],"genre_scores_gemma":[0.00065371924,0.035827633,0.0014721117,0.04696561,0.9133806,0.000075051554,0.000029828972,0.00007666623,0.0015188633],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9187316,0.033593543,0.012707994,0.0049748803,0.029002119,0.0009899389],"domain_scores_gemma":[0.40633476,0.5160125,0.0075952173,0.007859838,0.05644149,0.0057562436],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.09868935,0.0047302856,0.009508522,0.008161435,0.00378954,0.015309236,0.011774452,0.02367705,0.005002778],"category_scores_gemma":[0.30861166,0.0028627901,0.0047009015,0.0046018534,0.027233887,0.014555476,0.003396367,0.06606051,0.0050678854],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00011721126,0.00003590636,0.00009963075,0.0019865728,0.00016522755,0.00014623643,0.00016509855,0.00016953584,0.00009551781,0.008688057,0.95771503,0.030615853],"study_design_scores_gemma":[0.00026861666,0.0001783296,0.00075632427,0.005743283,0.00026851677,0.00072874513,0.00028925028,0.0011533459,0.00028820557,0.065472625,0.9246698,0.00018305996],"about_ca_topic_score_codex":0.003381176,"about_ca_topic_score_gemma":0.006315056,"teacher_disagreement_score":0.9013107,"about_ca_system_score_codex":0.006156667,"about_ca_system_score_gemma":0.008661557,"threshold_uncertainty_score":0.5219254},"labels":[],"label_agreement":null},{"id":"W2568498297","doi":"10.1177/0013164416685599","title":"Retrofitting Diagnostic Classification Models to Responses From IRT-Based Assessment Forms","year":2017,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":55,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Retrofitting; Item response theory; Computer science; Process (computing); Test (biology); Data mining; Engineering; Psychometrics; Mathematics; Statistics","score_opus":0.8783454710157835,"score_gpt":0.5694813197426731,"score_spread":0.3088641512731104,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2568498297","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12580858,0.00041905433,0.85981965,0.0017599642,0.00030912983,0.0031038101,0.00038749925,0.0016450213,0.0067471922],"genre_scores_gemma":[0.4852329,0.00025840566,0.50636464,0.0009392323,0.00009100777,0.003972671,0.0011763715,0.0003630456,0.0016018805],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.74311584,0.20164734,0.014859806,0.00947623,0.029255478,0.0016453672],"domain_scores_gemma":[0.51825434,0.32483014,0.025581017,0.07802348,0.052368414,0.0009426157],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1992908,0.002216241,0.0017137562,0.005093104,0.0014624972,0.006025801,0.003623856,0.0019018676,0.0017320664],"category_scores_gemma":[0.526748,0.0011935522,0.0019160258,0.005317295,0.0030182134,0.0050761946,0.005054854,0.0046936586,0.0017691919],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011000249,0.0011107809,0.1449798,0.0013855606,0.0009200572,0.00041109556,0.015347096,0.03496497,0.0045925295,0.045994252,0.008160531,0.7410332],"study_design_scores_gemma":[0.00046369294,0.0027007572,0.08964564,0.0025940614,0.0009024887,0.0016561485,0.013442857,0.57433975,0.027167032,0.2440321,0.04231981,0.0007355958],"about_ca_topic_score_codex":0.0030100243,"about_ca_topic_score_gemma":0.0038555742,"teacher_disagreement_score":0.1992908,"about_ca_system_score_codex":0.004165726,"about_ca_system_score_gemma":0.0035059866,"threshold_uncertainty_score":0.987417},"labels":[],"label_agreement":null},{"id":"W2758319537","doi":"10.1177/0013164417719111","title":"Recommendations on the Sample Sizes for Multilevel Latent Class Models","year":2017,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Bayesian Methods and Mixture Models","field":"Computer Science","cited_by":93,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Latent class model; Sample size determination; Statistics; Sample (material); Rule of thumb; Nested set model; Computer science; Model selection; Econometrics; Data mining; Mathematics; Algorithm","score_opus":0.4657980968857349,"score_gpt":0.4110614061339838,"score_spread":0.05473669075175114,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2758319537","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01623651,0.010236389,0.82493705,0.09214284,0.0065096337,0.00919601,0.004324317,0.003798852,0.03261851],"genre_scores_gemma":[0.036068276,0.0020834303,0.9355454,0.008439772,0.0008675208,0.0133793,0.0009884235,0.0005949481,0.002032962],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.79654664,0.15188245,0.01594535,0.005603977,0.028408516,0.0016130407],"domain_scores_gemma":[0.2837661,0.62458247,0.01107376,0.020654242,0.05594732,0.0039760717],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.18888693,0.0025417518,0.003536518,0.006723372,0.002762413,0.0050533316,0.009194675,0.010825462,0.013216441],"category_scores_gemma":[0.61779624,0.0029966072,0.0035645356,0.004481142,0.005070776,0.007952618,0.0044595203,0.01326516,0.0049963975],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0021706047,0.0010440048,0.009650072,0.005767098,0.0003505098,0.0006716263,0.004993355,0.018228447,0.00432466,0.15823993,0.2538105,0.54074913],"study_design_scores_gemma":[0.0061491183,0.0020639084,0.026008975,0.043946333,0.0011282085,0.0016842769,0.006370808,0.13778655,0.02014394,0.41864344,0.33507854,0.0009958874],"about_ca_topic_score_codex":0.006847762,"about_ca_topic_score_gemma":0.008592522,"teacher_disagreement_score":0.18888693,"about_ca_system_score_codex":0.0031842766,"about_ca_system_score_gemma":0.008553986,"threshold_uncertainty_score":0.9989415},"labels":[],"label_agreement":null},{"id":"W2904094333","doi":"10.1177/0013164418817801","title":"Centering in Multiple Regression Does Not Always Reduce Multicollinearity: How to Tell When Your Estimates Will Not Benefit From Centering","year":2018,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":24,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Multicollinearity; Independence (probability theory); Regression; Econometrics; Correlation; Regression analysis; Statistics; Context (archaeology); Joint probability distribution; Linear regression; Mathematics; Random variable; Psychology","score_opus":0.4401330808779662,"score_gpt":0.45631741001503445,"score_spread":0.016184329137068243,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2904094333","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013719942,0.006087285,0.93953216,0.031574223,0.0019256722,0.00035365237,0.0002314163,0.0023167345,0.004258923],"genre_scores_gemma":[0.1728633,0.004347252,0.8089175,0.0077085407,0.0021126093,0.0011993913,0.00027197946,0.0010682379,0.0015112947],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.93153036,0.05128394,0.0037694518,0.0051448545,0.007402312,0.0008690533],"domain_scores_gemma":[0.67944974,0.23209853,0.028259687,0.036997855,0.020843659,0.0023505327],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.102989756,0.0018899387,0.0046298476,0.0022484837,0.0024859891,0.004611903,0.0034224617,0.004612428,0.0041137],"category_scores_gemma":[0.46341732,0.0016115176,0.002563253,0.004568258,0.0063327313,0.013569091,0.003186834,0.009887461,0.0029822616],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00064625154,0.00028140223,0.020149238,0.0026281818,0.0012218591,0.00037148036,0.005941348,0.01660902,0.0030964536,0.15284553,0.06857893,0.7276304],"study_design_scores_gemma":[0.0004878509,0.001063176,0.025234122,0.0043141125,0.0007231971,0.0005782869,0.002750156,0.084111564,0.012524436,0.7809659,0.08634124,0.00090590026],"about_ca_topic_score_codex":0.0030548382,"about_ca_topic_score_gemma":0.0033465184,"teacher_disagreement_score":0.89701027,"about_ca_system_score_codex":0.0024563544,"about_ca_system_score_gemma":0.003794061,"threshold_uncertainty_score":0.54466844},"labels":[],"label_agreement":null},{"id":"W2912880345","doi":"10.1177/0013164419829855","title":"Item Response Tree Models to Investigate Acquiescence and Extreme Response Styles in Likert-Type Rating Scales","year":2019,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":39,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Acquiescence; Psychology; Likert scale; Rating scale; Item response theory; Social psychology; Explanatory model; Scale (ratio); Psychometrics; Statistics; Developmental psychology; Mathematics","score_opus":0.7658315465227954,"score_gpt":0.4754891438004715,"score_spread":0.29034240272232387,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2912880345","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.04385599,0.00024093955,0.9494154,0.00044379,0.00007822646,0.0012926474,0.0011734356,0.00071401946,0.0027856089],"genre_scores_gemma":[0.49249578,0.00044356612,0.4938554,0.00044027716,0.00009646725,0.007609114,0.0025293878,0.0002634081,0.0022665395],"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.92306316,0.06641823,0.002183153,0.0038420171,0.0038322106,0.0006612543],"domain_scores_gemma":[0.790507,0.17814524,0.011932047,0.010405222,0.008137131,0.00087336276],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06369835,0.002504179,0.0016737308,0.003937178,0.0008310747,0.003113451,0.0031403422,0.0019513866,0.006341824],"category_scores_gemma":[0.16030636,0.0012013419,0.0041281614,0.007071619,0.0017317499,0.004632549,0.002464921,0.004146539,0.0024237598],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010078566,0.0016272613,0.25822905,0.0014871941,0.0035583645,0.0005062705,0.014762586,0.21869746,0.0022655718,0.23736,0.015441912,0.24505645],"study_design_scores_gemma":[0.00014785441,0.00060517946,0.02725408,0.00030494668,0.00028202284,0.00030176426,0.00160474,0.8135861,0.00068403705,0.14692846,0.008102952,0.0001979088],"about_ca_topic_score_codex":0.002596328,"about_ca_topic_score_gemma":0.0031590264,"teacher_disagreement_score":0.06369835,"about_ca_system_score_codex":0.0021119115,"about_ca_system_score_gemma":0.0015270276,"threshold_uncertainty_score":0.3368731},"labels":[],"label_agreement":null},{"id":"W2921505365","doi":"10.1177/0013164419834607","title":"Comparing Age- and Grade-Based Norms on the Woodcock–Johnson III Normative Update","year":2019,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Medical Education and Admissions","field":"Medicine","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University","funders":"","keywords":"Woodcock; Normative; Psychology; Developmental psychology; Statistics; Mathematics; Epistemology; Philosophy","score_opus":0.20948185716706838,"score_gpt":0.37079014919839487,"score_spread":0.1613082920313265,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2921505365","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.98521405,0.00017624848,0.003239672,0.00004506699,0.00006478528,0.00012108794,0.0007595789,0.000054141903,0.010325323],"genre_scores_gemma":[0.993782,0.000102820464,0.0031278129,0.00003707055,0.000023087912,0.00016512851,0.0016896763,0.00003385741,0.0010386338],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9950435,0.0016591949,0.00073101243,0.0003874152,0.0019456184,0.00023325534],"domain_scores_gemma":[0.9805941,0.0065644095,0.003653496,0.0018690947,0.0067354273,0.00058353],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005762063,0.00029249952,0.0002639591,0.0029645478,0.00031689883,0.00092180853,0.0004996074,0.00032103536,0.001362993],"category_scores_gemma":[0.028429914,0.00014168872,0.00035005342,0.0014285016,0.00045091764,0.0006804772,0.0010935378,0.00036793857,0.0004612168],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006367423,0.00021571395,0.9403602,0.000054201344,0.00018342286,0.00010807552,0.0022947537,0.0008415634,0.0019384895,0.0012957794,0.0019100665,0.050161004],"study_design_scores_gemma":[0.000015595733,0.0003889059,0.9922821,0.00002635383,0.00003084941,0.0001811845,0.001219052,0.0009169483,0.0017266823,0.00040810002,0.002783753,0.000020490997],"about_ca_topic_score_codex":0.006673001,"about_ca_topic_score_gemma":0.016991887,"teacher_disagreement_score":0.006673001,"about_ca_system_score_codex":0.000704692,"about_ca_system_score_gemma":0.00034754287,"threshold_uncertainty_score":0.030473053},"labels":[],"label_agreement":null},{"id":"W2941810097","doi":"10.1177/0013164419844305","title":"A Measurement Is a Choice and Stevens’ Scales of Measurement Do Not Help Make It: A Response to Chalmers","year":2019,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":51,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Relevance (law); Confusion; Reliability (semiconductor); Task (project management); Psychology; Test (biology); Epistemology; Measure (data warehouse); Computer science; Philosophy; Psychoanalysis; Data mining; Economics","score_opus":0.4019735413709748,"score_gpt":0.46501596832292,"score_spread":0.06304242695194523,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2941810097","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0005104172,0.0046412125,0.004253727,0.98302704,0.005949965,0.000011423234,0.000023548853,0.00004350796,0.0015391732],"genre_scores_gemma":[0.052111495,0.0064854478,0.015241661,0.8958993,0.025979636,0.00024147097,0.000044303975,0.00023565697,0.0037610556],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.858235,0.09077865,0.009191961,0.011783118,0.028192589,0.0018185221],"domain_scores_gemma":[0.5638769,0.3698992,0.008753917,0.01270807,0.041814778,0.002947015],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1031428,0.0017645924,0.0032137993,0.004982799,0.007084665,0.014888485,0.0059962445,0.030475035,0.0024876948],"category_scores_gemma":[0.29584166,0.0014802882,0.0020919223,0.0055321734,0.072825134,0.025877168,0.0078069274,0.075952634,0.0023157056],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000087027285,0.000032683194,0.00041023068,0.0002545789,0.00004474529,0.00018489559,0.008900225,0.00028049597,0.00018033659,0.49305615,0.47738624,0.01918242],"study_design_scores_gemma":[0.00006843042,0.00005380696,0.0006852086,0.0014588769,0.000040105548,0.00057820795,0.0065888586,0.0017375635,0.0006086336,0.6069768,0.38093773,0.00026567827],"about_ca_topic_score_codex":0.008271144,"about_ca_topic_score_gemma":0.0059512723,"teacher_disagreement_score":0.8968572,"about_ca_system_score_codex":0.011617165,"about_ca_system_score_gemma":0.00843697,"threshold_uncertainty_score":0.54547775},"labels":[],"label_agreement":null},{"id":"W2978741138","doi":"10.1177/0013164419878861","title":"A Propensity Score Method for Investigating Differential Item Functioning in Performance Assessment","year":2019,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Propensity score matching; Differential item functioning; Matching (statistics); Context (archaeology); Psychology; Proxy (statistics); Language proficiency; Aptitude; Set (abstract data type); Test (biology); Computer science; Psychometrics; Statistics; Natural language processing; Cognitive psychology; Item response theory; Machine learning; Developmental psychology; Mathematics; Mathematics education","score_opus":0.7918302834411759,"score_gpt":0.5152538123684256,"score_spread":0.2765764710727503,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2978741138","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.031380277,0.00029954722,0.963048,0.00026052207,0.0001364237,0.0021239915,0.0009945903,0.00048675085,0.0012699855],"genre_scores_gemma":[0.40756503,0.00036305116,0.57576764,0.00039350512,0.00026741266,0.010099207,0.0027189865,0.0002188125,0.0026063712],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.93286586,0.051444747,0.003017652,0.0057881367,0.006180018,0.0007034746],"domain_scores_gemma":[0.8926273,0.07358639,0.008486122,0.019536426,0.004950298,0.0008134057],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.071316615,0.0013075648,0.0018427541,0.0060955742,0.0013153232,0.0018123637,0.0019526993,0.00171977,0.0062226364],"category_scores_gemma":[0.16425541,0.00046675306,0.0025883769,0.006221991,0.0016773192,0.001935495,0.0031808564,0.0022735256,0.0012535314],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014632124,0.0011059833,0.258122,0.00069939764,0.0044267015,0.00040706195,0.0016689684,0.017893331,0.0027440875,0.10337561,0.010431739,0.5976618],"study_design_scores_gemma":[0.0011922766,0.00427792,0.25910178,0.0005909908,0.00266752,0.0017144912,0.0014570603,0.37648606,0.0075356592,0.280224,0.06423457,0.0005177132],"about_ca_topic_score_codex":0.0018313794,"about_ca_topic_score_gemma":0.0010417834,"teacher_disagreement_score":0.071316615,"about_ca_system_score_codex":0.0009724184,"about_ca_system_score_gemma":0.0022124746,"threshold_uncertainty_score":0.3771628},"labels":[],"label_agreement":null},{"id":"W3006067352","doi":"10.1177/0013164420903770","title":"The Role of Item Distributions on Reliability Estimation: The Case of Cronbach’s Coefficient Alpha","year":2020,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Statistical Distribution Estimation and Applications","field":"Mathematics","cited_by":19,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Cronbach's alpha; Alpha (finance); Reliability (semiconductor); Random variable; Bounded function; Range (aeronautics); Code (set theory); Mathematics; Correlation coefficient; Applied mathematics; Computer science; Statistics; Discrete mathematics; Mathematical analysis; Physics; Psychometrics","score_opus":0.18206716658744782,"score_gpt":0.4010203161917416,"score_spread":0.2189531496042938,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3006067352","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.038600866,0.012448079,0.90635586,0.015691407,0.0005261168,0.00011935427,0.00028761156,0.00043069426,0.025539966],"genre_scores_gemma":[0.78612006,0.006211679,0.20109288,0.0022641376,0.0015649995,0.00065544085,0.00017195361,0.0006099477,0.0013088475],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.71265733,0.24523991,0.0052396525,0.0117326835,0.02311186,0.0020185772],"domain_scores_gemma":[0.14732535,0.79162747,0.012168739,0.03621148,0.011754764,0.0009121817],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.27411178,0.0024478203,0.0028786792,0.0073852283,0.0024125148,0.0079391245,0.0040223747,0.0060561956,0.002388577],"category_scores_gemma":[0.70561403,0.0021680002,0.002081028,0.008605311,0.022129606,0.02280493,0.008509593,0.012940673,0.0011281251],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00031028522,0.00005088701,0.02037946,0.000774033,0.0007475175,0.00043458672,0.004604073,0.022671249,0.0005448322,0.78881085,0.00496147,0.15571074],"study_design_scores_gemma":[0.000043380507,0.00015378348,0.008627857,0.001150393,0.00017708642,0.0005169721,0.00070001645,0.054652944,0.001062784,0.9272585,0.0055180066,0.0001382995],"about_ca_topic_score_codex":0.003517208,"about_ca_topic_score_gemma":0.0015969352,"teacher_disagreement_score":0.27411178,"about_ca_system_score_codex":0.0033035276,"about_ca_system_score_gemma":0.0027554033,"threshold_uncertainty_score":0.8951494},"labels":[],"label_agreement":null},{"id":"W3011484504","doi":"10.1177/0013164420911136","title":"Evaluating the Performances of Missing Data Handling Methods in Ability Estimation From Sparse Data","year":2020,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":79,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Missing data; Imputation (statistics); Statistics; Cart; Data set; Regression; Mean squared error; Mathematics; Computer science; Regression analysis; Data mining; Engineering","score_opus":0.9728668887097844,"score_gpt":0.6848813766788585,"score_spread":0.2879855120309259,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3011484504","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.32892534,0.0015008454,0.66609377,0.0006489591,0.000082963685,0.00071018556,0.00028417216,0.0004362183,0.0013174255],"genre_scores_gemma":[0.61004835,0.0004926162,0.3876494,0.0001566788,0.000034878074,0.0008507068,0.00043674547,0.00007363135,0.00025695676],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.93086416,0.060322218,0.0024476317,0.002448373,0.003346636,0.0005710047],"domain_scores_gemma":[0.52725285,0.4387398,0.01153651,0.012817855,0.008629246,0.0010236026],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.12178798,0.0012061675,0.001533128,0.0026949032,0.00092107896,0.0014425692,0.0017943103,0.002019501,0.001014554],"category_scores_gemma":[0.29502496,0.000678451,0.0019577174,0.0021307312,0.0014139271,0.0030630266,0.0020592755,0.0023173476,0.0002548246],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0038970932,0.0010589585,0.15905572,0.0018029277,0.0038175946,0.0002984569,0.0037553117,0.42324144,0.0027079182,0.017399717,0.0017599792,0.3812049],"study_design_scores_gemma":[0.00036272922,0.001463851,0.030578544,0.00042063606,0.000426618,0.00027711445,0.00051088305,0.9443923,0.0040932097,0.015855432,0.001400216,0.00021849528],"about_ca_topic_score_codex":0.004171839,"about_ca_topic_score_gemma":0.004536853,"teacher_disagreement_score":0.12178798,"about_ca_system_score_codex":0.001187276,"about_ca_system_score_gemma":0.0023352436,"threshold_uncertainty_score":0.6440841},"labels":[],"label_agreement":null},{"id":"W3131054533","doi":"10.1177/0013164421991211","title":"A Polytomous Scoring Approach to Handle Not-Reached Items in Low-Stakes Assessments","year":2021,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":27,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Polytomous Rasch model; Test (biology); Psychology; Item response theory; Statistics; Psychometrics; Clinical psychology; Mathematics","score_opus":0.8074745264456583,"score_gpt":0.5362121694680764,"score_spread":0.27126235697758194,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3131054533","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07969949,0.00012869251,0.9143369,0.00021667079,0.0001060377,0.001988378,0.00020489049,0.0010448503,0.0022740506],"genre_scores_gemma":[0.22442277,0.00009562118,0.7717571,0.000108515334,0.00004688502,0.0014316924,0.00033690204,0.00014702328,0.001653472],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9754165,0.0119683305,0.0024059755,0.003551614,0.006083833,0.0005738548],"domain_scores_gemma":[0.94364905,0.026167387,0.007738001,0.0085356925,0.012993481,0.0009164298],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.014778289,0.0016805704,0.0015549895,0.0047336835,0.0012580418,0.0016669609,0.002823241,0.0010794861,0.006284274],"category_scores_gemma":[0.0714834,0.0006352294,0.0011545329,0.0046291864,0.0018593312,0.0024578716,0.0031560939,0.0020436514,0.001433049],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00063532486,0.00067324634,0.05511461,0.00047178182,0.0003356997,0.00035159092,0.0015087677,0.027475106,0.009001994,0.012223333,0.0058511426,0.8863573],"study_design_scores_gemma":[0.000449437,0.0022075141,0.091997504,0.0003468897,0.00036763845,0.0021854234,0.0015250823,0.83416384,0.01123809,0.03925587,0.015700415,0.00056216953],"about_ca_topic_score_codex":0.005511226,"about_ca_topic_score_gemma":0.009199074,"teacher_disagreement_score":0.014778289,"about_ca_system_score_codex":0.0009391127,"about_ca_system_score_gemma":0.0029607264,"threshold_uncertainty_score":0.078155994},"labels":[],"label_agreement":null},{"id":"W3162676432","doi":"10.1177/00131644211014261","title":"On the Performance of Semi- and Nonparametric Item Response Functions in Computer Adaptive Tests","year":2021,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computerized adaptive testing; Nonparametric statistics; Item response theory; Monotonic function; Parametric statistics; Selection (genetic algorithm); Statistics; Smoothing; Polynomial; Kernel (algebra); Mathematics; Function (biology); Differential item functioning; Sample (material); Computer science; Econometrics; Psychometrics; Artificial intelligence","score_opus":0.622595515931154,"score_gpt":0.4554608671959295,"score_spread":0.16713464873522454,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3162676432","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.19488904,0.0025169684,0.7937525,0.0007469563,0.00009975757,0.0007248163,0.0002177271,0.0011398748,0.00591231],"genre_scores_gemma":[0.74232584,0.0005130407,0.25510284,0.0002783749,0.000036517285,0.00066862855,0.00030981842,0.00023317974,0.0005317702],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.7961515,0.18343575,0.004898556,0.004946114,0.009789319,0.000778804],"domain_scores_gemma":[0.2782423,0.67785275,0.010652094,0.01975233,0.012780247,0.00072040246],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.17680906,0.0020506333,0.0014398029,0.0039250096,0.00080967025,0.003357177,0.0023783452,0.0032371785,0.0018206666],"category_scores_gemma":[0.53477454,0.0008160496,0.0016618281,0.0034815792,0.0036022146,0.006733907,0.003569522,0.0026219895,0.0009468826],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0041009486,0.0007284935,0.087488696,0.0012244286,0.0013460073,0.00022743396,0.0025237675,0.35976878,0.002440447,0.05242177,0.0028181619,0.48491105],"study_design_scores_gemma":[0.00021672141,0.0016328199,0.030897213,0.00053345953,0.00018752454,0.00045139686,0.00054593367,0.92326736,0.0028272446,0.036816027,0.0024107257,0.00021348805],"about_ca_topic_score_codex":0.0035283004,"about_ca_topic_score_gemma":0.0021467593,"teacher_disagreement_score":0.17680906,"about_ca_system_score_codex":0.0023502805,"about_ca_system_score_gemma":0.002160482,"threshold_uncertainty_score":0.9350668},"labels":[],"label_agreement":null},{"id":"W3181535716","doi":"10.1177/00131644211023569","title":"The Importance of Thinking Multivariately When Setting Subscale Cutoff Scores","year":2021,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Counterintuitive; Cutoff; Test (biology); Psychology; Mathematics; Value (mathematics); Econometrics; Psychometrics; Property (philosophy); Process (computing); Cognitive psychology; Statistics; Computer science; Epistemology","score_opus":0.1154940239194557,"score_gpt":0.335637612308858,"score_spread":0.22014358838940234,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3181535716","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014039262,0.0005257285,0.9723351,0.007374946,0.00076223974,0.00043724204,0.00019645752,0.0009291841,0.0033998627],"genre_scores_gemma":[0.15360692,0.00046441538,0.8399976,0.0023079563,0.0008192183,0.0010723242,0.00021931091,0.0005384606,0.00097385526],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.87599117,0.09446384,0.008598741,0.0076470757,0.012227529,0.0010716047],"domain_scores_gemma":[0.6424254,0.26997393,0.01949256,0.043279927,0.022500036,0.0023281907],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.13460891,0.0022695519,0.0033829457,0.0045067966,0.0030416138,0.012039245,0.005098568,0.0030941926,0.0045433613],"category_scores_gemma":[0.45762718,0.0011760752,0.0020396379,0.0043688486,0.008373415,0.012485894,0.005410853,0.015555898,0.0021667134],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010137318,0.00056853436,0.057808563,0.0014483241,0.0010658301,0.0007694536,0.010616577,0.01554082,0.006823072,0.21452662,0.027338296,0.66248024],"study_design_scores_gemma":[0.00022236486,0.0008846576,0.018663816,0.0016364187,0.00038246927,0.001082267,0.0055351225,0.09197053,0.015602161,0.8283787,0.035149872,0.0004915119],"about_ca_topic_score_codex":0.0032036633,"about_ca_topic_score_gemma":0.0052093384,"teacher_disagreement_score":0.13460891,"about_ca_system_score_codex":0.0020891747,"about_ca_system_score_gemma":0.0052730064,"threshold_uncertainty_score":0.71188843},"labels":[],"label_agreement":null},{"id":"W4205671165","doi":"10.1177/00131644211069406","title":"Effects of Response Option Order on Likert-Type Psychometric Properties and Reactions","year":2022,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Behavioral and Psychological Studies","field":"Psychology","cited_by":18,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Wilfrid Laurier University","funders":"","keywords":"Psychology; Item response theory; Equivalence (formal languages); Likert scale; Valence (chemistry); Psychometrics; Statistics; Econometrics; Social psychology; Cognitive psychology; Clinical psychology; Developmental psychology; Mathematics","score_opus":0.4480482305994032,"score_gpt":0.380515059367472,"score_spread":0.0675331712319312,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4205671165","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9578205,0.00028629805,0.026465809,0.00040991686,0.000259637,0.0023895467,0.0005199314,0.00034099948,0.01150723],"genre_scores_gemma":[0.977499,0.000107543325,0.0175205,0.00032770957,0.00007356822,0.0027237905,0.00039091078,0.00021891104,0.0011381172],"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.7627006,0.19297478,0.018456243,0.0071298108,0.01645799,0.002280531],"domain_scores_gemma":[0.2803453,0.64773744,0.018334284,0.03816608,0.013110592,0.002306297],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.12323033,0.0011250087,0.00092990714,0.0012859557,0.00068017177,0.0015766968,0.0009955657,0.001174481,0.007419448],"category_scores_gemma":[0.32046375,0.00064318057,0.0010580734,0.0010617751,0.0021633718,0.0016417181,0.0020841884,0.0021611052,0.001293742],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.049495142,0.008285428,0.53084886,0.0016978495,0.0012671984,0.00051100936,0.013258822,0.0036827077,0.09773931,0.0061196424,0.0030056897,0.2840883],"study_design_scores_gemma":[0.00095627474,0.012580327,0.9274251,0.0002739222,0.0003024577,0.00058792357,0.0018952476,0.008751741,0.03632037,0.004529429,0.006063336,0.00031392757],"about_ca_topic_score_codex":0.0002932948,"about_ca_topic_score_gemma":0.00043335382,"teacher_disagreement_score":0.87676966,"about_ca_system_score_codex":0.0007083947,"about_ca_system_score_gemma":0.00060828344,"threshold_uncertainty_score":0.65171206},"labels":[],"label_agreement":null},{"id":"W4213257957","doi":"10.1177/0013164411430486","title":"Erratum","year":2011,"lang":"en","type":"erratum","venue":"Educational and Psychological Measurement","topic":"Psychological and Temporal Perspectives Research","field":"Psychology","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Psychology","score_opus":0.34380546116296895,"score_gpt":0.42857137976583604,"score_spread":0.08476591860286709,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4213257957","genre_codex":"editorial","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00025619366,0.0028120868,0.00074984337,0.06292241,0.8851158,0.000094124596,0.0036184024,0.0003925537,0.044038568],"genre_scores_gemma":[0.0065887035,0.012110551,0.0028737027,0.09203784,0.1153933,0.00029282874,0.008265367,0.0013085201,0.7611292],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99579513,0.0006072593,0.0007906687,0.00045916607,0.0020992826,0.00024845006],"domain_scores_gemma":[0.9754631,0.0041465,0.000989699,0.00132199,0.01720578,0.0008730107],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0026497897,0.0014866656,0.0012462182,0.0035000758,0.0040158737,0.0036716524,0.002176577,0.004017045,0.17124379],"category_scores_gemma":[0.0468503,0.0007108936,0.0011764348,0.0024527514,0.0013304359,0.002796768,0.001923603,0.0064053293,0.10828752],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000018007267,0.0000036450326,0.000038630904,0.000058744932,0.0000022445092,0.00010428076,0.000015212251,0.000011108641,0.000012663922,0.00049664715,0.9934916,0.0057472256],"study_design_scores_gemma":[0.00000942143,0.0000069219027,0.00018959303,0.00022073151,0.000006551501,0.00025256723,0.00005986704,0.000018630004,0.00006917524,0.00045225583,0.99870336,0.00001098531],"about_ca_topic_score_codex":0.02444808,"about_ca_topic_score_gemma":0.031215174,"teacher_disagreement_score":0.8287562,"about_ca_system_score_codex":0.004454588,"about_ca_system_score_gemma":0.0053369245,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W4241133324","doi":"10.1177/0013164408318769","title":"Invariance of the Measurement Model Underlying the Wechsler Adult Intelligence Scale—III in the United States and Canada","year":2008,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":19,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Calgary; BC Mental Health & Substance Use Services; University of British Columbia","funders":"","keywords":"Measurement invariance; Psychology; Normative; Latent variable; Statistics; Wechsler Adult Intelligence Scale; Latent variable model; Psychometrics; Test (biology); Item response theory; Sample (material); Level of measurement; Scale (ratio); Structural equation modeling; Confirmatory factor analysis; Intelligence quotient; Set (abstract data type); Developmental psychology; Mathematics; Cognition","score_opus":0.774923581148864,"score_gpt":0.45804181837841057,"score_spread":0.3168817627704534,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4241133324","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8497218,0.0015329109,0.08014093,0.0037749384,0.00025688627,0.0013959636,0.0031444847,0.00021437835,0.05981771],"genre_scores_gemma":[0.9813689,0.00041096486,0.015033712,0.00018507986,0.000021923353,0.0003189134,0.0012542211,0.000035375364,0.0013710306],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9871416,0.0039933147,0.000751987,0.0013856369,0.005515001,0.001212517],"domain_scores_gemma":[0.9872364,0.0034918862,0.00095943303,0.0014714021,0.0063899346,0.00045093743],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.014490281,0.00031215211,0.00046761878,0.0018005318,0.0022197254,0.0018548851,0.0010763042,0.00029626398,0.0012129726],"category_scores_gemma":[0.046890117,0.00024308216,0.0008146771,0.002519886,0.0027791997,0.0008306258,0.0012375201,0.0008848517,0.00015882238],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025289092,0.00011246158,0.7021437,0.00014278326,0.0004014843,0.00024912244,0.006541098,0.0062866323,0.0013463941,0.12409434,0.006563387,0.15186572],"study_design_scores_gemma":[0.00003917235,0.00009985606,0.9547053,0.00020271275,0.00013597905,0.00016920833,0.0032934533,0.012479676,0.0011167718,0.017958483,0.009718726,0.00008062995],"about_ca_topic_score_codex":0.8914824,"about_ca_topic_score_gemma":0.8588823,"teacher_disagreement_score":0.10851759,"about_ca_system_score_codex":0.016853817,"about_ca_system_score_gemma":0.03312525,"threshold_uncertainty_score":0.21831328},"labels":[],"label_agreement":null},{"id":"W4280512083","doi":"10.1177/00131644221096431","title":"Investigating Confidence Intervals of Item Parameters When Some Item Parameters Take Priors in the 2PL and 3PL Models","year":2022,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Prior probability; Statistics; Covariance; Mathematics; Marginal likelihood; Standard error; Maximum a posteriori estimation; Restricted maximum likelihood; Confidence interval; Maximization; Econometrics; Estimation theory; Bayesian probability; Maximum likelihood; Mathematical optimization","score_opus":0.7746316401685195,"score_gpt":0.4702359430135424,"score_spread":0.3043956971549771,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4280512083","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.37104642,0.002504181,0.617074,0.000705291,0.00017494091,0.00034582423,0.00063083234,0.000747943,0.006770506],"genre_scores_gemma":[0.93433905,0.0003013765,0.063524134,0.00013362794,0.000037380127,0.00032029516,0.0008164824,0.00012028102,0.00040736617],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.92859155,0.047234192,0.004305055,0.010655672,0.007805499,0.0014080559],"domain_scores_gemma":[0.31278458,0.64212424,0.011294737,0.025066942,0.007762274,0.00096728344],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1100365,0.0012951826,0.001334945,0.0032837882,0.000886466,0.004545169,0.0036287524,0.0031761546,0.0040466664],"category_scores_gemma":[0.4893781,0.0008790126,0.0024764673,0.0035836927,0.0033612265,0.0069697336,0.0038143655,0.0037336263,0.00052539527],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0058634602,0.0009734302,0.29158807,0.0029202336,0.0051945965,0.0022300726,0.013987282,0.127468,0.011429129,0.12010238,0.004411762,0.4138316],"study_design_scores_gemma":[0.00054149766,0.002652184,0.23550789,0.0017217593,0.002928493,0.0051744236,0.0075157364,0.548168,0.023558253,0.16158302,0.009934865,0.0007138458],"about_ca_topic_score_codex":0.002116651,"about_ca_topic_score_gemma":0.0011919229,"teacher_disagreement_score":0.1100365,"about_ca_system_score_codex":0.0011554692,"about_ca_system_score_gemma":0.0011203485,"threshold_uncertainty_score":0.5819356},"labels":[],"label_agreement":null},{"id":"W4288758431","doi":"10.1177/00131644221104220","title":"Supervised Classes, Unsupervised Mixing Proportions: Detection of Bots in a Likert-Type Questionnaire","year":2022,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Survey Sampling and Estimation Techniques","field":"Mathematics","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Mahalanobis distance; Cutoff; Sample (material); Statistics; Likert scale; Computer science; Calibration; Sample size determination; Mixture model; Artificial intelligence; Mathematics","score_opus":0.26873442613628207,"score_gpt":0.39222254678309215,"score_spread":0.12348812064681008,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4288758431","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.27806985,0.000046148296,0.71702766,0.00018335695,0.000037227215,0.0017490047,0.0002551186,0.0006573,0.001974238],"genre_scores_gemma":[0.79131556,0.000024861547,0.20545039,0.00014140045,0.000021022994,0.0017067279,0.00042247903,0.00006250442,0.00085499237],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.97642267,0.015995713,0.0012581453,0.0031221735,0.0027008385,0.0005004764],"domain_scores_gemma":[0.93278146,0.04350198,0.0067882775,0.011319429,0.004896697,0.0007121276],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.033610523,0.0006356824,0.0007292659,0.0014142711,0.0007830644,0.0011627388,0.0017544709,0.0011758069,0.0015392049],"category_scores_gemma":[0.095752224,0.0005038696,0.0006921712,0.0010729255,0.001700036,0.0016402683,0.001818312,0.0012018472,0.0006468746],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0020784084,0.0011517958,0.46439895,0.00050334574,0.0004954372,0.0001839231,0.007991171,0.028031534,0.018026777,0.029732859,0.004368402,0.44303736],"study_design_scores_gemma":[0.00020603437,0.0010858739,0.21813461,0.00017782491,0.0001510851,0.0005162684,0.0021597005,0.6865774,0.034569472,0.048563767,0.007672351,0.00018553981],"about_ca_topic_score_codex":0.0011978694,"about_ca_topic_score_gemma":0.0014361085,"teacher_disagreement_score":0.033610523,"about_ca_system_score_codex":0.0008917633,"about_ca_system_score_gemma":0.00088817003,"threshold_uncertainty_score":0.17775154},"labels":[],"label_agreement":null},{"id":"W4292454731","doi":"10.1177/00131644221111402","title":"Comparing the Psychometric Properties of a Scale Across Three Likert and Three Alternative Formats: An Application to the Rosenberg Self-Esteem Scale","year":2022,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia; York University","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Likert scale; Scale (ratio); Psychology; Acquiescence; Psychometrics; Computer science; Statistics; Clinical psychology; Mathematics","score_opus":0.591184351862449,"score_gpt":0.45387219246827853,"score_spread":0.13731215939417046,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4292454731","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9111381,0.00084799074,0.07617774,0.0007189187,0.00032647516,0.0019309302,0.00035696384,0.00018253831,0.008320282],"genre_scores_gemma":[0.8690338,0.0004561188,0.12643267,0.00022807506,0.00007065652,0.0027240333,0.00036281825,0.00004313449,0.00064869947],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9637477,0.024867361,0.0031306,0.001288663,0.0066153435,0.00035038663],"domain_scores_gemma":[0.8959635,0.08321857,0.0044779647,0.004434232,0.011171838,0.00073390134],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.041457195,0.0006904273,0.0006326079,0.0022225946,0.00054544245,0.0012761732,0.0009393244,0.00078964024,0.00260348],"category_scores_gemma":[0.12048446,0.00046393322,0.002484449,0.002490418,0.0009489662,0.0024510184,0.0015603148,0.0014198398,0.00037878175],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.004661033,0.002840686,0.30676895,0.0011063662,0.0023600534,0.00031564262,0.00803786,0.0042022113,0.008316975,0.006956805,0.0036019941,0.65083146],"study_design_scores_gemma":[0.0034960695,0.014800355,0.8371206,0.0012542187,0.0017905622,0.0013881308,0.011177515,0.07900029,0.012717345,0.021071224,0.015580224,0.00060347153],"about_ca_topic_score_codex":0.0006418151,"about_ca_topic_score_gemma":0.0010581994,"teacher_disagreement_score":0.9585428,"about_ca_system_score_codex":0.0006181066,"about_ca_system_score_gemma":0.00081186014,"threshold_uncertainty_score":0.21924919},"labels":[],"label_agreement":null},{"id":"W4321330224","doi":"10.1177/00131644231155804","title":"The Impact of Measurement Model Misspecification on Coefficient Omega Estimates of Composite Reliability","year":2023,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":20,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Omega; Statistics; Reliability (semiconductor); Mathematics; Econometrics; Scale (ratio); Population; Factor analysis; Composite index; Hierarchical database model; Computer science; Physics; Thermodynamics; Demography; Data mining; Composite indicator","score_opus":0.7526933176330004,"score_gpt":0.5302071217753532,"score_spread":0.22248619585764717,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4321330224","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1905513,0.0023642676,0.798028,0.0015136839,0.00038431428,0.00046282474,0.00045046688,0.00081967574,0.005425464],"genre_scores_gemma":[0.85483164,0.00043401634,0.14191356,0.0005499952,0.0000709585,0.00055868144,0.0004906186,0.00045259282,0.0006979946],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.7688427,0.18296157,0.012051502,0.013817479,0.020773524,0.0015531965],"domain_scores_gemma":[0.26927018,0.6242859,0.029404832,0.056592867,0.019771349,0.0006748629],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.19223729,0.0018815222,0.0016868085,0.0028637322,0.0015705049,0.0036722943,0.0018473197,0.0015268233,0.001455002],"category_scores_gemma":[0.64049923,0.0012977275,0.002486538,0.0042948523,0.003572934,0.0039991215,0.00361336,0.003674996,0.0005325736],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011575883,0.00031118013,0.45928878,0.0015592511,0.0062737223,0.0009857275,0.011904117,0.1036697,0.0043245335,0.0960083,0.0077857645,0.30673137],"study_design_scores_gemma":[0.0002953528,0.0012909083,0.29806006,0.0025709579,0.0025049264,0.0025515975,0.0042517073,0.45798334,0.021565909,0.18795955,0.020189034,0.00077674305],"about_ca_topic_score_codex":0.0074430867,"about_ca_topic_score_gemma":0.0075586354,"teacher_disagreement_score":0.80776274,"about_ca_system_score_codex":0.0025112794,"about_ca_system_score_gemma":0.0028342851,"threshold_uncertainty_score":0.9961152},"labels":[],"label_agreement":null},{"id":"W4378220707","doi":"10.1177/00131644231165520","title":"The Accuracy of Bayesian Model Fit Indices in Selecting Among Multidimensional Item Response Theory Models","year":2023,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Curse of dimensionality; Nested set model; Deviance information criterion; Bayesian probability; Item response theory; Statistics; Bayesian information criterion; Computer science; Mathematics; Econometrics; Bayesian inference; Data mining; Psychometrics","score_opus":0.7180011966789275,"score_gpt":0.5115401562574108,"score_spread":0.2064610404215167,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4378220707","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.28380957,0.0029426794,0.70126754,0.0014671675,0.0002012656,0.0007717238,0.0008532475,0.0011464482,0.0075402916],"genre_scores_gemma":[0.7757697,0.0007244527,0.2200823,0.00046005516,0.0000808296,0.0005922201,0.0014522886,0.00032168956,0.0005164143],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9094523,0.06947468,0.0047551338,0.006020337,0.009254299,0.0010432127],"domain_scores_gemma":[0.5936813,0.3655339,0.011513424,0.015267033,0.012131193,0.0018731083],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.17340252,0.0025811093,0.0031153103,0.008536808,0.0021414787,0.006639207,0.0033113523,0.0035175672,0.0019350584],"category_scores_gemma":[0.42290363,0.0012285046,0.0032128936,0.0055850875,0.0025694587,0.008110695,0.0033197305,0.004496467,0.0008401877],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0023453708,0.0007667696,0.19601549,0.0012602789,0.0047004703,0.0005853856,0.0037107295,0.40270224,0.0017433305,0.06180993,0.007931056,0.31642905],"study_design_scores_gemma":[0.00028480473,0.000617032,0.022379981,0.0007658119,0.000578331,0.00027692976,0.000834453,0.90878147,0.0015518204,0.06104468,0.0025848632,0.00029989882],"about_ca_topic_score_codex":0.007304178,"about_ca_topic_score_gemma":0.0068991682,"teacher_disagreement_score":0.17340252,"about_ca_system_score_codex":0.0024106095,"about_ca_system_score_gemma":0.0036219454,"threshold_uncertainty_score":0.91705114},"labels":[],"label_agreement":null},{"id":"W4388140417","doi":"10.1177/00131644231202949","title":"Comparing RMSEA-Based Indices for Assessing Measurement Invariance in Confirmatory Factor Models","year":2023,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":33,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Structural equation modeling; Confirmatory factor analysis; Mathematics; Goodness of fit; Statistics","score_opus":0.9282427079429465,"score_gpt":0.5543654165441689,"score_spread":0.37387729139877757,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4388140417","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12552603,0.005802119,0.8225994,0.0020565463,0.0013318359,0.0034499445,0.0056878724,0.0030853786,0.030460881],"genre_scores_gemma":[0.43536672,0.0024055582,0.54492486,0.0007539476,0.00016633258,0.007094022,0.0061258893,0.0011955401,0.0019671556],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9152467,0.046050973,0.010844103,0.006209433,0.020572659,0.0010760431],"domain_scores_gemma":[0.65701485,0.25732344,0.02017212,0.026416047,0.03758247,0.0014910004],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.112180136,0.0028881044,0.002913631,0.010380131,0.002016999,0.0041857823,0.0033081654,0.00204172,0.005334449],"category_scores_gemma":[0.38651615,0.0013399879,0.0066565853,0.015502418,0.0021215917,0.0066555673,0.0033351423,0.006055458,0.0019780293],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00076126336,0.0010321928,0.22516456,0.0050497665,0.010548151,0.00054564973,0.008905067,0.03428402,0.004553065,0.051332656,0.03417374,0.6236499],"study_design_scores_gemma":[0.0011214917,0.0039249277,0.37337917,0.009590582,0.007076245,0.0015441362,0.013451478,0.27479306,0.017241387,0.19528013,0.10082761,0.0017698496],"about_ca_topic_score_codex":0.007166058,"about_ca_topic_score_gemma":0.013048151,"teacher_disagreement_score":0.112180136,"about_ca_system_score_codex":0.0026403945,"about_ca_system_score_gemma":0.006553366,"threshold_uncertainty_score":0.5932723},"labels":[],"label_agreement":null},{"id":"W4406779237","doi":"10.1177/00131644241308528","title":"A Comparison of the Next Eigenvalue Sufficiency Test to Other Stopping Rules for the Number of Factors in Factor Analysis","year":2025,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université TÉLUQ","funders":"","keywords":"Curse of dimensionality; Exploratory factor analysis; Statistics; Mathematics; Test (biology); Eigenvalues and eigenvectors; Sample (material); Computer science; Identification (biology); Hull; Factor (programming language); Algorithm; Psychometrics; Engineering","score_opus":0.7892882399583666,"score_gpt":0.5763748813874294,"score_spread":0.21291335857093718,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4406779237","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.21508054,0.0013238384,0.7745118,0.0009448504,0.00029934547,0.0011191586,0.00039818042,0.0016342523,0.0046879505],"genre_scores_gemma":[0.49603465,0.0003420348,0.49961507,0.0002163888,0.00006658932,0.0017199754,0.000862666,0.00046522272,0.00067743135],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9289995,0.058207467,0.0031412854,0.003429884,0.0053538154,0.00086809014],"domain_scores_gemma":[0.38538015,0.56487846,0.011760581,0.016204886,0.019585244,0.0021905866],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.09957658,0.0017532879,0.002249634,0.0039767814,0.0019153449,0.0027980558,0.0023264496,0.0024323887,0.0030714148],"category_scores_gemma":[0.43624148,0.0007485096,0.0030956944,0.0035027147,0.0029988252,0.0052736793,0.0023541967,0.0028928872,0.00074350624],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.013066043,0.0017229463,0.121593714,0.0020920094,0.002539822,0.0006373856,0.0050096004,0.22922952,0.005084743,0.08247748,0.010192251,0.5263545],"study_design_scores_gemma":[0.001569429,0.0051668123,0.028697656,0.00069646875,0.00047394232,0.0005947705,0.0014364285,0.8913356,0.008445565,0.056125402,0.005118797,0.00033907423],"about_ca_topic_score_codex":0.0027894964,"about_ca_topic_score_gemma":0.0026386369,"teacher_disagreement_score":0.9004234,"about_ca_system_score_codex":0.0015685547,"about_ca_system_score_gemma":0.0035147,"threshold_uncertainty_score":0.5266175},"labels":[],"label_agreement":null},{"id":"W4407928271","doi":"10.1177/00131644251319047","title":"Shortening Psychological Scales: Semantic Similarity Matters","year":2025,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Similarity (geometry); Sentence; Semantic similarity; Scale (ratio); Computer science; Natural language processing; Sample (material); Artificial intelligence; Embedding; Correlation; Information retrieval; Mathematics","score_opus":0.6635170864862416,"score_gpt":0.5275220275597801,"score_spread":0.13599505892646158,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4407928271","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12196916,0.0010875349,0.8636836,0.0012316018,0.001005413,0.0007787163,0.0008701748,0.0015562002,0.007817555],"genre_scores_gemma":[0.52155685,0.0006901092,0.4704561,0.000754787,0.00028060202,0.0014103382,0.0013226733,0.0006315443,0.0028969795],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98202574,0.011446118,0.0019294547,0.0017409426,0.002683741,0.00017402893],"domain_scores_gemma":[0.90873694,0.05961351,0.0056496714,0.015318403,0.0099886395,0.00069285545],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.016976148,0.0010952062,0.00077332155,0.0016564684,0.0006726329,0.0024234739,0.0012126998,0.00083211676,0.005972361],"category_scores_gemma":[0.15990122,0.00043663543,0.0007581067,0.0021058617,0.0015643403,0.00571476,0.0022620244,0.0017380401,0.0016797554],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006780094,0.00022842514,0.020511556,0.0015736643,0.000305482,0.00026627022,0.005232442,0.003815875,0.01777663,0.057859477,0.008461975,0.88329023],"study_design_scores_gemma":[0.00037460242,0.0030028974,0.16198544,0.0015860803,0.0007914954,0.0029626116,0.008773412,0.1690064,0.050995935,0.43266788,0.16705583,0.00079753547],"about_ca_topic_score_codex":0.00046236374,"about_ca_topic_score_gemma":0.00078443304,"teacher_disagreement_score":0.016976148,"about_ca_system_score_codex":0.0006512043,"about_ca_system_score_gemma":0.0007522814,"threshold_uncertainty_score":0.089779496},"labels":[],"label_agreement":null},{"id":"W4416195809","doi":"10.1177/00131644251389891","title":"Reliability as Projection in Operator-Theoretic Test Theory: Conditional Expectation, Hilbert Space Geometry, and Implications for Psychometric Practice","year":2025,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Reliability (semiconductor); Projection (relational algebra); Mathematical proof; Hilbert space; Complement (music); Statistical hypothesis testing; Space (punctuation); Conditional expectation; Perspective (graphical)","score_opus":0.3733883313779877,"score_gpt":0.5068659574544272,"score_spread":0.13347762607643948,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4416195809","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.020206975,0.002720129,0.94339657,0.01279497,0.00027924866,0.00007582847,0.00011939804,0.00025034556,0.020156521],"genre_scores_gemma":[0.7897363,0.0020668535,0.20185623,0.0019414505,0.0011833108,0.00056503876,0.00013799655,0.0002583057,0.0022545902],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9266005,0.05891288,0.0018907028,0.003790638,0.007758444,0.0010468074],"domain_scores_gemma":[0.78938115,0.18242306,0.005116096,0.012962599,0.008653703,0.001463427],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06540857,0.0015700975,0.0024339352,0.004268439,0.002051339,0.008346199,0.0030797399,0.0030674895,0.0032321236],"category_scores_gemma":[0.20467888,0.0010823765,0.0018274462,0.0043165996,0.04297528,0.018197494,0.0087713525,0.007245893,0.00057832047],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00001451899,0.000010301594,0.0004797597,0.00003929001,0.000022604678,0.00002596946,0.000494765,0.0015767363,0.000041101077,0.9886284,0.0003206658,0.008345864],"study_design_scores_gemma":[0.000006402974,0.000016473668,0.00022610862,0.00001976088,0.000004411697,0.000024519024,0.00006238629,0.005094914,0.000047802394,0.99398524,0.00050029566,0.00001163048],"about_ca_topic_score_codex":0.0036168948,"about_ca_topic_score_gemma":0.0012039371,"teacher_disagreement_score":0.06540857,"about_ca_system_score_codex":0.004611222,"about_ca_system_score_gemma":0.004220174,"threshold_uncertainty_score":0.3459177},"labels":[],"label_agreement":null},{"id":"W4417427433","doi":"10.1177/00131644251393483","title":"From Linear Geometry to Nonlinear and Information-Geometric Settings in Test Theory: Bregman Projections as a Unifying Framework","year":2025,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Bregman divergence; Nonlinear system; Hilbert space; Projection (relational algebra); Regular polygon; Reliability (semiconductor); Statistical hypothesis testing; Space (punctuation); Information geometry","score_opus":0.3273493193826945,"score_gpt":0.4780451314572261,"score_spread":0.1506958120745316,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4417427433","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009562892,0.001220658,0.9767835,0.0030189597,0.00006843333,0.000031425057,0.00006303893,0.00008615431,0.009164972],"genre_scores_gemma":[0.5584139,0.0023794377,0.43434015,0.00091741397,0.00042281914,0.00029538764,0.0001564592,0.00017931056,0.0028951238],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9880271,0.008865726,0.00033983466,0.0008078985,0.001730006,0.00022949824],"domain_scores_gemma":[0.97746587,0.01681303,0.0012821481,0.0023430134,0.0016815749,0.00041451785],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01285269,0.0013395292,0.0013726216,0.003450484,0.0011629503,0.0054179635,0.0017777008,0.001618666,0.0025802809],"category_scores_gemma":[0.039339297,0.0006175369,0.0012068696,0.0030602103,0.017812937,0.009610323,0.0056072306,0.00589313,0.0005354515],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000041408425,0.0000069903213,0.00014491516,0.000016631735,0.000008028986,0.000017495055,0.000110263834,0.0033377914,0.000043368826,0.9895438,0.00016238645,0.006604244],"study_design_scores_gemma":[0.0000021449605,0.000010158629,0.000105613646,0.000014748981,0.0000022435215,0.000018358662,0.000029455528,0.010138731,0.00004926056,0.98874915,0.00087439676,0.0000056719837],"about_ca_topic_score_codex":0.0014398147,"about_ca_topic_score_gemma":0.0008245929,"teacher_disagreement_score":0.01285269,"about_ca_system_score_codex":0.0025961725,"about_ca_system_score_gemma":0.001925707,"threshold_uncertainty_score":0.0679723},"labels":[],"label_agreement":null}]}