{"meta":{"query_hash":"8e83b7261a16","filters":{"venue":"Methodology"},"cohort_total":15,"direct_labels_cover":1,"predictions_cover":15,"exported":15,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/8e83b7261a16","api":"https://metacan.xera.ac/api/v1/cohort?venue=Methodology"},"results":[{"id":"W1898119662","doi":"10.1027/1614-2241/a000012","title":"Accentuating the Negative?","year":2010,"lang":"en","type":"article","venue":"Methodology","topic":"Electoral Systems and Political Participation","field":"Social Sciences","cited_by":22,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Acquiescence; Framing (construction); Politics; Psychology; Social psychology; Survey data collection; Attribution; Political science; Law; Engineering; Statistics","score_opus":0.32215961902123946,"score_gpt":0.5012206608623628,"score_spread":0.17906104184112337,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1898119662","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8665037,0.00045792008,0.00424538,0.009023454,0.0006429701,0.000115257084,0.00019431289,0.00011300712,0.1187039],"genre_scores_gemma":[0.9891661,0.00018719834,0.0011888661,0.0036425753,0.00014808934,0.0000896334,0.000054653814,0.000042504238,0.005480356],"study_design_codex":"observational","study_design_gemma":"not_applicable","domain_scores_codex":[0.99457586,0.0024039277,0.00019991402,0.000643375,0.0016912599,0.00048558242],"domain_scores_gemma":[0.9857292,0.00690882,0.002574149,0.0016735418,0.0023062818,0.0008078982],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009539915,0.0003612815,0.00040013154,0.00071316067,0.0014730926,0.0022703263,0.00041329698,0.00078354706,0.009109534],"category_scores_gemma":[0.036115967,0.00021987349,0.00019485845,0.0005512502,0.0045334385,0.001589396,0.0019039487,0.0016431286,0.00093645364],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017675604,0.0008341505,0.34659097,0.00080537354,0.00017747068,0.0009934126,0.09902233,0.00035267227,0.037654594,0.14367166,0.038360924,0.3297689],"study_design_scores_gemma":[0.00015322554,0.00075070286,0.69281346,0.000506044,0.00021293374,0.0012205521,0.08205377,0.0011258776,0.017250398,0.06998288,0.13376005,0.00017007996],"about_ca_topic_score_codex":0.0034689312,"about_ca_topic_score_gemma":0.0062293755,"teacher_disagreement_score":0.009539915,"about_ca_system_score_codex":0.0010177051,"about_ca_system_score_gemma":0.000971784,"threshold_uncertainty_score":0.05045253},"labels":[],"label_agreement":null},{"id":"W2110497623","doi":"10.1027/1614-1881.1.2.71","title":"Modelling Behaviour with Multivariate Multilevel Growth Curves","year":2005,"lang":"en","type":"article","venue":"Methodology","topic":"Income, Poverty, and Inequality","field":"Social Sciences","cited_by":13,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Multivariate statistics; Multilevel model; Multivariate analysis; Econometrics; Longitudinal data; Multilevel modelling; Measure (data warehouse); Psychology; Set (abstract data type); Statistics; Mathematics; Demography; Computer science; Sociology; Data mining","score_opus":0.29716268945923674,"score_gpt":0.42785576713879614,"score_spread":0.1306930776795594,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2110497623","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.24920572,0.00080827525,0.73522973,0.0020341242,0.0001644776,0.00030953612,0.00599046,0.0011549854,0.005102685],"genre_scores_gemma":[0.8265387,0.0007452459,0.1620077,0.00014410002,0.0000678983,0.00091223133,0.004411995,0.00023855614,0.004933633],"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9968272,0.0021526197,0.00013469202,0.00037222763,0.00025766593,0.0002556527],"domain_scores_gemma":[0.98181283,0.013211412,0.0017530525,0.0013410199,0.0014493198,0.00043234442],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007914653,0.0008946306,0.0012550522,0.0025957748,0.0007752403,0.0020548806,0.0022705412,0.0016399386,0.0058649075],"category_scores_gemma":[0.035355557,0.0008285697,0.0032494226,0.0037034769,0.00088877365,0.0015364755,0.002457888,0.002915054,0.00068516214],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014553242,0.00010758361,0.0573591,0.00013725657,0.0006314464,0.00015926232,0.0010217171,0.8383353,0.00022538996,0.0778704,0.0024028246,0.021604283],"study_design_scores_gemma":[0.000017738163,0.000034865203,0.0054159234,0.00004502659,0.00005398324,0.000028125349,0.00014132155,0.9689141,0.00006258839,0.023291692,0.0019718471,0.000022759643],"about_ca_topic_score_codex":0.09576661,"about_ca_topic_score_gemma":0.062094226,"teacher_disagreement_score":0.09576661,"about_ca_system_score_codex":0.002807327,"about_ca_system_score_gemma":0.0017788614,"threshold_uncertainty_score":0.19041836},"labels":[],"label_agreement":null},{"id":"W2126367292","doi":"10.1027/1614-2241/a000032","title":"Two-Part Modeling of Semicontinuous Longitudinal Variables","year":2011,"lang":"en","type":"article","venue":"Methodology","topic":"Statistical Methods and Bayesian Inference","field":"Mathematics","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Covariate; Outcome (game theory); Zero (linguistics); Mathematics; Statistics; Variable (mathematics); Interpretation (philosophy); Econometrics; Range (aeronautics); Latent variable; Growth curve (statistics); Maximum likelihood; Continuous variable; Computer science; Mathematical economics; Engineering; Mathematical analysis","score_opus":0.48186026290138945,"score_gpt":0.43865334274944784,"score_spread":0.04320692015194161,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2126367292","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.050532587,0.00051102455,0.9443005,0.0009936449,0.00009550725,0.00016673509,0.0006459872,0.00025983754,0.0024942253],"genre_scores_gemma":[0.7434474,0.0013608787,0.23080376,0.00050634315,0.00022739291,0.0014491723,0.0017921993,0.00017020339,0.020242615],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99060947,0.00564895,0.00036101305,0.0016940936,0.0010266289,0.00065975054],"domain_scores_gemma":[0.96462715,0.026442429,0.0040886304,0.0025102727,0.0016264627,0.00070506847],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01918726,0.0017371658,0.0025725425,0.0021722545,0.0009791277,0.0034456241,0.0061830757,0.0031041529,0.007653124],"category_scores_gemma":[0.03943049,0.0019643651,0.003295989,0.0026964429,0.0034508677,0.0039307987,0.004169484,0.0037021982,0.0010677151],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00041192054,0.00022106261,0.025096457,0.00019078555,0.00053723773,0.0009061423,0.0015483378,0.40706092,0.0011355052,0.5276424,0.0014496568,0.033799488],"study_design_scores_gemma":[0.00003756948,0.000110248904,0.003150979,0.000055788423,0.00007850145,0.00013121669,0.0001034669,0.8392617,0.00026396688,0.15511139,0.001638621,0.000056577865],"about_ca_topic_score_codex":0.009595095,"about_ca_topic_score_gemma":0.009593559,"teacher_disagreement_score":0.01918726,"about_ca_system_score_codex":0.0017202359,"about_ca_system_score_gemma":0.0024364383,"threshold_uncertainty_score":0.10147315},"labels":[],"label_agreement":null},{"id":"W2157428947","doi":"10.1027/1614-2241/a000051","title":"Non-Graphical Solutions for Cattell’s Scree Test","year":2012,"lang":"en","type":"article","venue":"Methodology","topic":"Sensory Analysis and Statistical Methods","field":"Agricultural and Biological Sciences","cited_by":355,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal; Université du Québec à Montréal","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Principal component analysis; Eigenvalues and eigenvectors; Plot (graphics); Test (biology); Computer science; Matrix (chemical analysis); Factor (programming language); Mathematics; Statistics; Artificial intelligence; Geology","score_opus":0.35031273622427517,"score_gpt":0.39547294823846263,"score_spread":0.04516021201418746,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2157428947","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0025788906,0.00019962437,0.9935213,0.0005084844,0.00012993523,0.00025073823,0.00008884183,0.00056959473,0.0021526702],"genre_scores_gemma":[0.09477952,0.00033355525,0.8986651,0.00041946146,0.00022128763,0.0020221965,0.00036321188,0.00059716223,0.0025985322],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.92328376,0.059271727,0.0030583483,0.004754713,0.008690926,0.00094059855],"domain_scores_gemma":[0.7367117,0.22949953,0.007134252,0.012953782,0.012840387,0.0008603299],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.046978097,0.003429899,0.0028140938,0.006930928,0.0016611392,0.0050532664,0.00533579,0.003998377,0.029310467],"category_scores_gemma":[0.340421,0.0011114405,0.0026104692,0.0063400897,0.006586189,0.00595498,0.0044863587,0.0037479035,0.008710055],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00036455135,0.00032079022,0.004662303,0.0011475477,0.00039091054,0.0007708353,0.0019108703,0.05047138,0.0021593051,0.52500933,0.026501216,0.38629094],"study_design_scores_gemma":[0.00014437237,0.00029057846,0.0028524736,0.0003475264,0.000090972666,0.0008853965,0.00065466913,0.4752788,0.0026208502,0.49697548,0.019579766,0.00027909462],"about_ca_topic_score_codex":0.0014432047,"about_ca_topic_score_gemma":0.0011089895,"teacher_disagreement_score":0.046978097,"about_ca_system_score_codex":0.0013660067,"about_ca_system_score_gemma":0.0022115,"threshold_uncertainty_score":0.24844694},"labels":[],"label_agreement":null},{"id":"W2166565928","doi":"10.1027/1614-2241/a000061","title":"A Multiple-Process Latent Transition Model of Poverty and Health","year":2012,"lang":"en","type":"article","venue":"Methodology","topic":"Global Health Care Issues","field":"Health Professions","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Public Health Ontario; University of Toronto","funders":"Economic and Social Research Council","keywords":"Poverty; British Household Panel Survey; Covariate; Longitudinal data; Longitudinal study; Psychology; Latent growth modeling; Econometrics; Demographic economics; Developmental psychology; Economics; Demography; Statistics; Mathematics; Sociology; Economic growth","score_opus":0.5234643545063861,"score_gpt":0.570236664049345,"score_spread":0.04677230954295897,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2166565928","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.39932093,0.0015229522,0.56596744,0.010563206,0.00037407174,0.00096572365,0.0069462843,0.0007015006,0.013637882],"genre_scores_gemma":[0.94494635,0.0007180443,0.041290678,0.0003208403,0.000113037124,0.0012807545,0.0015933017,0.000038372593,0.009698633],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9983752,0.00091884617,0.000054990254,0.0003017256,0.0001346463,0.00021462172],"domain_scores_gemma":[0.9971957,0.0019010351,0.00033409498,0.00016492642,0.00023259173,0.00017168156],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0034833332,0.0008052357,0.0010382363,0.0013360248,0.00082989444,0.0019480065,0.0018111556,0.0015401843,0.008297219],"category_scores_gemma":[0.007936199,0.00046130957,0.00150077,0.0016802354,0.0012035198,0.0023129398,0.0018512072,0.0022750632,0.0011059205],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008950811,0.0010446764,0.11627798,0.00047478316,0.0008548579,0.0010774717,0.0059827208,0.23268045,0.0013041941,0.558641,0.011258408,0.069508314],"study_design_scores_gemma":[0.00028836797,0.0003708045,0.019232554,0.0001555653,0.00027844717,0.00038490884,0.0009929799,0.65654075,0.00018763021,0.3146885,0.006784816,0.00009475161],"about_ca_topic_score_codex":0.015388105,"about_ca_topic_score_gemma":0.012207701,"teacher_disagreement_score":0.015388105,"about_ca_system_score_codex":0.0015719008,"about_ca_system_score_gemma":0.0020629682,"threshold_uncertainty_score":0.03059709},"labels":[],"label_agreement":null},{"id":"W2171914249","doi":"10.1027/1614-2241/a000041","title":"An Improved Model for Evaluating Change in Randomized Pretest, Posttest, Follow-Up Designs","year":2011,"lang":"en","type":"article","venue":"Methodology","topic":"Advanced Causal Inference Techniques","field":"Mathematics","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Treatment and control groups; Research design; Monte Carlo method; Randomized controlled trial; Randomized experiment; Treatment effect; Computer science; Psychology; Mathematics education; Statistics; Mathematics; Medicine","score_opus":0.8674030637400533,"score_gpt":0.5803188037493868,"score_spread":0.28708425999066645,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2171914249","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0072591067,0.0002631918,0.9886896,0.00052423566,0.00011551533,0.0014210255,0.0005328584,0.00036943023,0.0008251372],"genre_scores_gemma":[0.19026336,0.0006123575,0.7877144,0.00084094197,0.0002003649,0.015791908,0.00086229685,0.00013186323,0.003582468],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.87929004,0.10517727,0.0020552704,0.0065346956,0.005476304,0.0014663801],"domain_scores_gemma":[0.6556242,0.3142026,0.008675078,0.013614464,0.006880514,0.0010031359],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1501059,0.002963284,0.004538244,0.0029136408,0.0008858121,0.002526221,0.0060912743,0.0052762036,0.011488091],"category_scores_gemma":[0.25311694,0.0015598142,0.0043362346,0.0032632546,0.0028552075,0.005073072,0.0025746897,0.0064022527,0.0015420545],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0051168106,0.0012004437,0.009233175,0.0014369299,0.0020059666,0.0002987837,0.0012650484,0.39123264,0.001432777,0.44031832,0.0065200487,0.13993916],"study_design_scores_gemma":[0.0013334363,0.001996881,0.001879725,0.00018446516,0.00064925296,0.00009392904,0.00007340176,0.82646614,0.0007843894,0.16191547,0.0045326976,0.00009021066],"about_ca_topic_score_codex":0.005907551,"about_ca_topic_score_gemma":0.0037549892,"teacher_disagreement_score":0.8498941,"about_ca_system_score_codex":0.00391392,"about_ca_system_score_gemma":0.0052828747,"threshold_uncertainty_score":0.7938453},"labels":[],"label_agreement":null},{"id":"W2597906635","doi":"10.1027/1614-2241/a000159","title":"Validity","year":2018,"lang":"en","type":"article","venue":"Methodology","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Citation; Library science; Psychology; Delphi method; Computer science; Artificial intelligence","score_opus":0.941291787059819,"score_gpt":0.6278904871636637,"score_spread":0.3134012998961553,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2597906635","genre_codex":"other","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09583727,0.0023564624,0.3140443,0.008053278,0.0011866917,0.01280633,0.0056911325,0.0007491865,0.55927545],"genre_scores_gemma":[0.73065364,0.0014783054,0.20300922,0.0033591331,0.0008711063,0.019060692,0.0059083346,0.00066528,0.03499431],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.86794645,0.05772228,0.013619358,0.012574064,0.04517452,0.0029632526],"domain_scores_gemma":[0.64300704,0.1764017,0.014482578,0.059917264,0.10360776,0.0025836993],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.09392503,0.0014537935,0.001496493,0.012106275,0.0040653045,0.008853206,0.0022553094,0.0017177215,0.033591047],"category_scores_gemma":[0.36570343,0.001090178,0.0035317035,0.0070842295,0.006405062,0.007128796,0.0073223067,0.0029490092,0.0093521075],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00033987314,0.00072189234,0.12262327,0.0025287308,0.00072340196,0.00015834357,0.0114019485,0.0016174286,0.001758337,0.31388363,0.02527745,0.5189656],"study_design_scores_gemma":[0.00041471308,0.0008108205,0.20220357,0.008180894,0.0015711377,0.0015871727,0.015318873,0.0130602,0.012858735,0.45813093,0.28556037,0.00030258994],"about_ca_topic_score_codex":0.0050639394,"about_ca_topic_score_gemma":0.0049414164,"teacher_disagreement_score":0.09392503,"about_ca_system_score_codex":0.0055768173,"about_ca_system_score_gemma":0.019146368,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W2601443004","doi":"10.1027/1614-2241/a000122","title":"Using the Errors-in-Variables Method in Two-Group Pretest-Posttest Designs","year":2017,"lang":"en","type":"article","venue":"Methodology","topic":"Statistical Methods in Clinical Trials","field":"Mathematics","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Analysis of covariance; Covariate; Statistics; Reliability (semiconductor); Covariance; Mathematics; Econometrics; Observational error; Sample size determination; Psychology; Power (physics)","score_opus":0.918746052008132,"score_gpt":0.6893558059739121,"score_spread":0.22939024603421987,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2601443004","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02475348,0.0009966156,0.94319147,0.000631099,0.0029066221,0.021284211,0.0007783726,0.0011297413,0.0043283375],"genre_scores_gemma":[0.19604647,0.00044902874,0.7269285,0.0008032103,0.0004361572,0.071912915,0.0004214706,0.00041122618,0.002590942],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.554712,0.3824385,0.016627057,0.019365424,0.025043087,0.001813929],"domain_scores_gemma":[0.48040482,0.41260177,0.03077209,0.055554196,0.019691631,0.0009755195],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2588413,0.0029565461,0.0043215742,0.0033944922,0.0015356987,0.002572425,0.00349503,0.0037713517,0.011419959],"category_scores_gemma":[0.4867173,0.0018836458,0.004830058,0.0033001222,0.004173485,0.0037947404,0.0029640123,0.0054666973,0.0021005734],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.024308171,0.0048354366,0.03402016,0.010379949,0.014672966,0.00034616067,0.0067315977,0.016588258,0.007440264,0.110443234,0.016834307,0.75339943],"study_design_scores_gemma":[0.02241291,0.09550362,0.13712388,0.00646113,0.012172635,0.0009807752,0.003000399,0.19567266,0.059331536,0.31960356,0.14599526,0.0017416226],"about_ca_topic_score_codex":0.0014445714,"about_ca_topic_score_gemma":0.0014921728,"teacher_disagreement_score":0.2588413,"about_ca_system_score_codex":0.0019375962,"about_ca_system_score_gemma":0.002912476,"threshold_uncertainty_score":0.9139806},"labels":[],"label_agreement":null},{"id":"W2902135892","doi":"10.1027/1614-2241/a000156","title":"Examining Validity Evidence of Self-Report Measures Using Differential Item Functioning","year":2018,"lang":"en","type":"article","venue":"Methodology","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Centre for Advancing Health Outcomes; Learning Partnership; University of British Columbia; Providence Health Care Research Institute; Providence Health Care","funders":"","keywords":"Differential item functioning; Item response theory; Psychology; Nonparametric statistics; Ordinal data; Scale (ratio); Ordinal Scale; Multilevel model; Logistic regression; Latent variable; Statistics; Econometrics; Psychometrics; Clinical psychology; Mathematics","score_opus":0.9393714709572591,"score_gpt":0.5778324970126306,"score_spread":0.36153897394462853,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2902135892","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9103033,0.0033459913,0.061276555,0.0023705,0.00029227315,0.00069834443,0.001034064,0.00009086569,0.020588053],"genre_scores_gemma":[0.9810209,0.00032847308,0.017117595,0.0002752918,0.000052120402,0.0006175798,0.00039407844,0.00002878609,0.0001650533],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.6747955,0.23407978,0.025409533,0.012555982,0.05108921,0.0020699843],"domain_scores_gemma":[0.1872105,0.67161685,0.057802506,0.03971547,0.042197503,0.0014571493],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.25560936,0.00087534677,0.0014365106,0.007956739,0.0015888036,0.003994548,0.0022595192,0.0018013573,0.0023942343],"category_scores_gemma":[0.6038061,0.00089812675,0.0019826074,0.00816028,0.007414379,0.004303734,0.005596996,0.0020476065,0.0004564299],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00044420737,0.00024088111,0.9379139,0.0008045697,0.0021148177,0.00006667265,0.0035014353,0.0007894042,0.00045405223,0.0077633928,0.0006969494,0.04520986],"study_design_scores_gemma":[0.00026225566,0.0017808216,0.93976474,0.0022879813,0.001334009,0.0007321142,0.007567297,0.015638147,0.0037782916,0.020856988,0.0058262562,0.0001710762],"about_ca_topic_score_codex":0.0013550887,"about_ca_topic_score_gemma":0.0015999409,"teacher_disagreement_score":0.25560936,"about_ca_system_score_codex":0.0019620173,"about_ca_system_score_gemma":0.001631441,"threshold_uncertainty_score":0.9179662},"labels":[],"label_agreement":null},{"id":"W3149010529","doi":"10.5964/meth.4495","title":"Analytic and bootstrap confidence intervals for the common-language effect size estimate","year":2021,"lang":"en","type":"article","venue":"Methodology","topic":"Consumer Market Behavior and Pricing","field":"Business, Management and Accounting","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"University of Manitoba","keywords":"Estimator; Confidence interval; Statistics; Parametric statistics; Type I and type II errors; Mathematics; Standard error; Econometrics; Computer science","score_opus":0.12452210094722825,"score_gpt":0.4010031702919732,"score_spread":0.2764810693447449,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3149010529","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.039170966,0.003266852,0.9452249,0.0008384679,0.00030288412,0.0010428978,0.0016359478,0.0015604696,0.0069565414],"genre_scores_gemma":[0.44813815,0.0012410897,0.5432196,0.0003672725,0.00018887449,0.0035046076,0.0020946474,0.00041653082,0.0008291249],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8677504,0.10507462,0.003997026,0.007640074,0.014667375,0.0008704742],"domain_scores_gemma":[0.31760374,0.62943214,0.014620518,0.022518719,0.015035733,0.00078920537],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.13989884,0.0013947928,0.0026080816,0.008160204,0.00083104667,0.0026671917,0.0043972163,0.0034086865,0.00866741],"category_scores_gemma":[0.5855771,0.0007421531,0.003195091,0.0059563094,0.004196011,0.0046820804,0.003770277,0.0039270106,0.0010251709],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0026955672,0.00049061683,0.044466957,0.003903273,0.0035512415,0.0008917234,0.0026811392,0.116511606,0.0023675587,0.43093535,0.020102294,0.3714028],"study_design_scores_gemma":[0.0012116932,0.002132756,0.05800724,0.0038169948,0.0019832642,0.0024780817,0.002041392,0.54433906,0.008203001,0.3370115,0.03815531,0.00061976357],"about_ca_topic_score_codex":0.0028010604,"about_ca_topic_score_gemma":0.0014146502,"teacher_disagreement_score":0.86010116,"about_ca_system_score_codex":0.0017809566,"about_ca_system_score_gemma":0.0019867802,"threshold_uncertainty_score":0.7398646},"labels":[],"label_agreement":null},{"id":"W4221124934","doi":"10.5964/meth.8575","title":"Welcome message from the new editors-in-chief","year":2022,"lang":"en","type":"article","venue":"Methodology","topic":"Mental Health Research Topics","field":"Psychology","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Citation; License; Library science; XML; Download; Computer science; Editor in chief; World Wide Web; Management; Operating system","score_opus":0.3201864956255316,"score_gpt":0.5072122021254595,"score_spread":0.1870257064999279,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4221124934","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000386061,0.0017835608,0.0005812454,0.21246806,0.76397204,0.00034491476,0.0004900666,0.001058192,0.018915854],"genre_scores_gemma":[0.002290963,0.002539047,0.0014992547,0.19674045,0.45227945,0.0006200534,0.00063574413,0.000968006,0.34242693],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9908647,0.0011588413,0.00072518544,0.0009947602,0.005483195,0.0007734241],"domain_scores_gemma":[0.92332804,0.009083483,0.0039508455,0.002869656,0.039774284,0.020993682],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0115478095,0.0028217256,0.0022354939,0.0021783381,0.0029256328,0.009414466,0.0030676108,0.018978471,0.22726871],"category_scores_gemma":[0.06470721,0.0012700604,0.0018334341,0.0010833803,0.0016317555,0.009078802,0.0053475075,0.014071987,0.20985673],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00003509828,0.000015684622,0.000027857935,0.000057740603,0.0000022242343,0.00006288327,0.000018997933,0.000008862023,0.00007468256,0.00008641059,0.99532485,0.0042846734],"study_design_scores_gemma":[0.000050336617,0.000044829572,0.00023632639,0.00008827833,0.000006671059,0.00015341814,0.00015727035,0.00004570678,0.000099709185,0.00039575185,0.99869376,0.00002803884],"about_ca_topic_score_codex":0.0005754939,"about_ca_topic_score_gemma":0.0019413762,"teacher_disagreement_score":0.22726871,"about_ca_system_score_codex":0.001411945,"about_ca_system_score_gemma":0.0044736904,"threshold_uncertainty_score":0.76028955},"labels":[],"label_agreement":null},{"id":"W4283719121","doi":"10.5964/meth.8467","title":"Bootstrap confidence intervals for 11 robust correlations in the presence of outliers and leverage observations","year":2022,"lang":"en","type":"article","venue":"Methodology","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Outlier; Confidence interval; Leverage (statistics); Statistics; Bivariate analysis; Percentile; Correlation; Robust confidence intervals; Standard deviation; Econometrics; Statistic; Mathematics","score_opus":0.7145503611330684,"score_gpt":0.5126216750297369,"score_spread":0.20192868610333148,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4283719121","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10025852,0.002857764,0.8857316,0.0004857809,0.00025187494,0.0003734193,0.001462707,0.0018381885,0.006740163],"genre_scores_gemma":[0.72092974,0.00095596735,0.27329952,0.00021966288,0.00016762642,0.0009244282,0.0022348508,0.0004734178,0.0007947606],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9668394,0.020757895,0.0017571251,0.003924488,0.006096912,0.0006242469],"domain_scores_gemma":[0.5885692,0.3495641,0.018463612,0.023079393,0.018807504,0.0015160857],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.055352572,0.0011982865,0.0015500048,0.004854666,0.00097533554,0.0027255504,0.002795525,0.0017541043,0.005491269],"category_scores_gemma":[0.38944197,0.0005355212,0.0023063298,0.0042114286,0.002450446,0.0035515474,0.0027245318,0.0029751088,0.0010214171],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0025148958,0.00041733566,0.10226071,0.0019839215,0.0023185846,0.0018971483,0.0028319953,0.18356225,0.0044207512,0.22141138,0.015561829,0.46081924],"study_design_scores_gemma":[0.00039326586,0.0014905344,0.06839534,0.002213583,0.00087795017,0.002152988,0.001904182,0.6914203,0.011228382,0.19385934,0.02555159,0.00051254814],"about_ca_topic_score_codex":0.0025497808,"about_ca_topic_score_gemma":0.0017308787,"teacher_disagreement_score":0.055352572,"about_ca_system_score_codex":0.0011329656,"about_ca_system_score_gemma":0.0018685822,"threshold_uncertainty_score":0.29273587},"labels":[],"label_agreement":null},{"id":"W4382393838","doi":"10.5964/meth.10863","title":"The logics of and strategies to enhance generalization of mixed methods research findings","year":2023,"lang":"en","type":"article","venue":"Methodology","topic":"Health Policy Implementation Science","field":"Health Professions","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Generalization; Context (archaeology); Computer science; Interpretation (philosophy); Management science; Artificial intelligence; Psychology; Epistemology; Engineering; Biology","score_opus":0.9500912121363324,"score_gpt":0.8438520423046605,"score_spread":0.10623916983167192,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4382393838","genre_codex":"methods","genre_gemma":"methods","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0038184312,0.0020620737,0.9403061,0.031906072,0.00040017252,0.008282295,0.00011735175,0.0004583072,0.012649225],"genre_scores_gemma":[0.038203556,0.0006894445,0.93828285,0.0029723065,0.00014310458,0.019166166,0.00003961532,0.00006906662,0.0004339386],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.111936346,0.8223876,0.032195628,0.008752771,0.023211291,0.0015163788],"domain_scores_gemma":[0.102227,0.75500375,0.0308625,0.08546739,0.024398316,0.0020411098],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.8022134,0.0030563837,0.0039346,0.017561436,0.0087766275,0.0229679,0.0080032665,0.008698304,0.0052696583],"category_scores_gemma":[0.77194875,0.004512405,0.0058400854,0.010441494,0.048735574,0.033320095,0.034651395,0.014365723,0.0019243024],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025076888,0.00018700241,0.0028051995,0.005675783,0.00048321,0.00025162147,0.041222677,0.0026108164,0.0008385855,0.7661972,0.003632922,0.17584428],"study_design_scores_gemma":[0.0003822915,0.0002817884,0.0008270177,0.008765155,0.00025157677,0.00034711172,0.007286596,0.008423394,0.0027397394,0.9347352,0.035773218,0.0001869166],"about_ca_topic_score_codex":0.0017889462,"about_ca_topic_score_gemma":0.0020091035,"teacher_disagreement_score":0.19778663,"about_ca_system_score_codex":0.015317715,"about_ca_system_score_gemma":0.031777438,"threshold_uncertainty_score":0.2439062},"labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"theoretical_or_conceptual","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":["metaresearch"],"domain":"methods","study_design":"theoretical_or_conceptual","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"medium"}],"label_agreement":"split"},{"id":"W4390021842","doi":"10.5964/meth.8285","title":"Which robust regression technique is appropriate under violated assumptions? A simulation study","year":2023,"lang":"en","type":"article","venue":"Methodology","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Robust regression; Statistics; Ordinary least squares; Regression; Regression analysis; Heteroscedasticity; Outlier; Mathematics; Mean squared error; Regression diagnostic; Econometrics; Monte Carlo method; Linear regression; Polynomial regression","score_opus":0.590566386328184,"score_gpt":0.5569675912452756,"score_spread":0.03359879508290842,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4390021842","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6725632,0.0046410016,0.29520282,0.004167082,0.0002985068,0.0013340258,0.0014636653,0.0004716261,0.019858122],"genre_scores_gemma":[0.94820803,0.0010901267,0.04864128,0.0002999873,0.000049428254,0.00042527248,0.00041394198,0.000084867526,0.00078711327],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.97807056,0.018004809,0.0007831091,0.0013304319,0.0013433369,0.00046781253],"domain_scores_gemma":[0.7631434,0.21259417,0.007155711,0.008363544,0.00810607,0.00063715165],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.035661213,0.00065202126,0.001378423,0.00096913404,0.00069183885,0.0017190384,0.001539336,0.0019139735,0.0049239965],"category_scores_gemma":[0.14876536,0.0003106902,0.0016784271,0.0012880948,0.0012010364,0.0026321583,0.0008874147,0.0018635445,0.0007003977],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.006707752,0.0022852465,0.08788011,0.004466409,0.002157709,0.002523083,0.0023720262,0.48620862,0.00482747,0.16712847,0.018531783,0.21491128],"study_design_scores_gemma":[0.0009243079,0.0028428717,0.018684419,0.0007397662,0.0008230834,0.000713589,0.0017330726,0.8915694,0.004201494,0.06627635,0.011280578,0.00021101399],"about_ca_topic_score_codex":0.0046396805,"about_ca_topic_score_gemma":0.00300576,"teacher_disagreement_score":0.035661213,"about_ca_system_score_codex":0.0012017236,"about_ca_system_score_gemma":0.0014516348,"threshold_uncertainty_score":0.18859673},"labels":[],"label_agreement":null},{"id":"W4411809104","doi":"10.5964/meth.14733","title":"A practical guide to conducting dose-response meta-analyses in epidemiology","year":2025,"lang":"en","type":"article","venue":"Methodology","topic":"Alcohol Consumption and Health Effects","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Public Health Ontario; University of Toronto; Centre for Addiction and Mental Health","funders":"National Institute on Alcohol Abuse and Alcoholism; National Institutes of Health","keywords":"Epidemiology; Meta-analysis; Medicine; Internal medicine","score_opus":0.9429413618181373,"score_gpt":0.7269228172101364,"score_spread":0.21601854460800085,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4411809104","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00055507425,0.034867458,0.8457785,0.030162346,0.007665045,0.01813862,0.025779162,0.012955888,0.024097914],"genre_scores_gemma":[0.001416584,0.0101612015,0.9594797,0.004724492,0.00091231905,0.014159789,0.0023696094,0.0010766068,0.0056996564],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.94479656,0.041125536,0.008353375,0.0014088848,0.004024624,0.00029097585],"domain_scores_gemma":[0.6890879,0.27342227,0.00796639,0.00990288,0.017741099,0.0018794433],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.079118595,0.0037740578,0.0045410995,0.01070867,0.0009885742,0.004747905,0.0065209516,0.006382195,0.08263435],"category_scores_gemma":[0.25799254,0.0039102724,0.0074083316,0.011227953,0.0018388253,0.0038223423,0.0031057675,0.010264663,0.028719971],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00040474537,0.000253763,0.0006446196,0.028990084,0.0016316317,0.0005324673,0.0007745651,0.0048331553,0.0008189414,0.038279485,0.635297,0.28753957],"study_design_scores_gemma":[0.0011636599,0.00033240407,0.0013521694,0.019267716,0.00090563454,0.0010339712,0.00028571548,0.009090902,0.00067379646,0.11633708,0.84930545,0.0002515053],"about_ca_topic_score_codex":0.0045876317,"about_ca_topic_score_gemma":0.009978844,"teacher_disagreement_score":0.9208814,"about_ca_system_score_codex":0.002148338,"about_ca_system_score_gemma":0.015176706,"threshold_uncertainty_score":0.41842413},"labels":[],"label_agreement":null}]}