{"meta":{"query_hash":"4f6799dd99f6","filters":{"topic":"Reliability and Agreement in Measurement"},"cohort_total":305,"direct_labels_cover":3,"predictions_cover":305,"exported":305,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/4f6799dd99f6","api":"https://metacan.xera.ac/api/v1/cohort?topic=Reliability+and+Agreement+in+Measurement"},"results":[{"id":"W1518867746","doi":"10.1108/09526861311297325","title":"A comparison of two diagnostic performance measures","year":2013,"lang":"en","type":"article","venue":"International Journal of Health Care Quality Assurance","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Measure (data warehouse); Point (geometry); Receiver operating characteristic; Signal-to-noise ratio (imaging); Taguchi methods; Noise (video); Diagnostic accuracy; Computer science; Index (typography); Statistics; Mathematics; Artificial intelligence; Data mining; Medicine; Radiology","score_opus":0.2317686654379214,"score_gpt":0.5212233067730002,"score_spread":0.2894546413350788,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1518867746","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.30363944,0.04325384,0.62463206,0.002644514,0.0011908646,0.0014527193,0.0020621743,0.0015060162,0.019618433],"genre_scores_gemma":[0.8483333,0.0035173735,0.1446058,0.0005702725,0.0002968612,0.0008542235,0.0007918378,0.000121922065,0.0009085464],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.91978306,0.04279786,0.00693347,0.0062248954,0.023379227,0.0008814704],"domain_scores_gemma":[0.7835103,0.17690071,0.017786544,0.0056265704,0.015127802,0.0010479752],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.057010148,0.00171041,0.0020026555,0.0077968314,0.000502049,0.004117482,0.0015711668,0.0020226827,0.0016881403],"category_scores_gemma":[0.16365805,0.00035911676,0.002016668,0.0047003925,0.0025827682,0.0027754242,0.0016377565,0.0013023962,0.00079171895],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0041118474,0.0011275625,0.24358465,0.008503393,0.0032331496,0.0003641729,0.0018167538,0.022358758,0.016460473,0.016179707,0.004193918,0.67806554],"study_design_scores_gemma":[0.00078436,0.022265589,0.45785692,0.008110264,0.0076577244,0.0076343645,0.00639868,0.26336795,0.08750176,0.0697056,0.067555144,0.0011616335],"about_ca_topic_score_codex":0.00063321204,"about_ca_topic_score_gemma":0.00040275985,"teacher_disagreement_score":0.057010148,"about_ca_system_score_codex":0.0019404847,"about_ca_system_score_gemma":0.0019639612,"threshold_uncertainty_score":0.30150205},"labels":[],"label_agreement":null},{"id":"W1754785110","doi":"10.1186/1756-0500-7-939","title":"A note on statistical and biological communication: a case study of the 2009 H1N1 pandemic","year":2014,"lang":"en","type":"letter","venue":"BMC Research Notes","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"University of Waterloo; York University","keywords":"Pandemic; Coronavirus disease 2019 (COVID-19); 2019-20 coronavirus outbreak; Severe acute respiratory syndrome coronavirus 2 (SARS-CoV-2); H1n1 pandemic; Medicine; Data science; Computer science; Virology; Outbreak; Pathology; Disease; Infectious disease (medical specialty)","score_opus":0.7445059638980688,"score_gpt":0.555417270094464,"score_spread":0.18908869380360482,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1754785110","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"reporting","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"reporting","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010448752,0.0030273793,0.0054353937,0.96842897,0.004531145,0.00010969801,0.00012564904,0.000048474827,0.007844546],"genre_scores_gemma":[0.21278691,0.012843866,0.037908707,0.70476586,0.018073972,0.000776752,0.00014143756,0.00025340467,0.012449142],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.8404771,0.1264574,0.0081456,0.0049225385,0.016796721,0.0032006344],"domain_scores_gemma":[0.44895953,0.510717,0.009734277,0.00810437,0.018617492,0.0038673058],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1331258,0.0009880625,0.0017747503,0.0025637152,0.012964106,0.008934104,0.004741004,0.032429297,0.00625371],"category_scores_gemma":[0.35711223,0.0010093556,0.0032495803,0.0037831657,0.009525562,0.0123006,0.004466143,0.020736929,0.0014456814],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027345426,0.0002463184,0.012406218,0.002333681,0.00020657963,0.18392017,0.11758151,0.0011734508,0.00055557594,0.09365205,0.48483974,0.10281125],"study_design_scores_gemma":[0.00012860486,0.00028747832,0.004737805,0.0055693197,0.00020377249,0.1060821,0.099090815,0.003138817,0.0009086181,0.0936949,0.6858483,0.00030945265],"about_ca_topic_score_codex":0.013833452,"about_ca_topic_score_gemma":0.022740476,"teacher_disagreement_score":0.8668742,"about_ca_system_score_codex":0.010954875,"about_ca_system_score_gemma":0.0141249765,"threshold_uncertainty_score":0.70404494},"labels":[],"label_agreement":null},{"id":"W1829168467","doi":"10.1191/0962280204sm365ra","title":"Sample size requirements for the design of reliability study: review and new results","year":2004,"lang":"en","type":"article","venue":"Statistical Methods in Medical Research","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":468,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Intraclass correlation; Sample size determination; Reliability (semiconductor); Variance (accounting); Statistics; Sample (material); Computer science; Mathematics; Reliability engineering; Psychometrics","score_opus":0.7388653050513273,"score_gpt":0.6767105014196586,"score_spread":0.0621548036316687,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1829168467","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0016903144,0.9316053,0.055108465,0.00448324,0.0024661182,0.0020551947,0.00046792906,0.00014607115,0.001977405],"genre_scores_gemma":[0.019856714,0.7844866,0.1728505,0.0040110988,0.0028628611,0.014081824,0.00093136483,0.00020768025,0.00071127136],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8679073,0.0625247,0.033891555,0.0060917065,0.02890284,0.0006819613],"domain_scores_gemma":[0.48804334,0.4582752,0.0154827675,0.0071071056,0.030353334,0.0007382764],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1698967,0.0017832079,0.010847425,0.0077190525,0.00073181366,0.0030030424,0.0053953677,0.0050020544,0.0035893708],"category_scores_gemma":[0.3808528,0.0017506593,0.0046136347,0.0058780173,0.0028664595,0.005736259,0.0020736163,0.0035390412,0.0014460407],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012654215,0.00012734534,0.0011966771,0.11435394,0.0012815387,0.00036211516,0.0003874899,0.0014858264,0.0018695905,0.0074499203,0.013518125,0.85670215],"study_design_scores_gemma":[0.0059087654,0.007839526,0.033078175,0.32168245,0.03182968,0.008435185,0.0012641529,0.010141595,0.012962937,0.067926586,0.497986,0.0009449044],"about_ca_topic_score_codex":0.0019230228,"about_ca_topic_score_gemma":0.0025164005,"teacher_disagreement_score":0.8301033,"about_ca_system_score_codex":0.0034605167,"about_ca_system_score_gemma":0.008207438,"threshold_uncertainty_score":0.8985104},"labels":[],"label_agreement":null},{"id":"W1881569770","doi":"10.1002/9781118445112.stat05243","title":"Kappa and Its Dependence on Marginal Rates","year":2014,"lang":"en","type":"other","venue":"Wiley StatsRef: Statistics Reference Online","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":40,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Kappa; Cohen's kappa; Statistic; Statistics; Measure (data warehouse); Mathematics; Econometrics; Computer science; Data mining; Geometry","score_opus":0.18230828496112722,"score_gpt":0.4110886459547939,"score_spread":0.22878036099366666,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1881569770","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.061824903,0.012180896,0.8756861,0.0056828284,0.0012728932,0.00037575155,0.0015306171,0.00092237047,0.040523767],"genre_scores_gemma":[0.8261549,0.0037518267,0.15963328,0.0010925421,0.0012797693,0.00084413367,0.0008242474,0.000741116,0.0056781895],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.7691673,0.15654738,0.011082335,0.02276102,0.038201965,0.0022399523],"domain_scores_gemma":[0.1893239,0.7242617,0.018351477,0.04143479,0.024994556,0.001633632],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.16018932,0.0010075734,0.0027029007,0.00845749,0.0019542454,0.007363737,0.003909732,0.0021157507,0.0105707925],"category_scores_gemma":[0.6394528,0.0012065753,0.0023891442,0.00886359,0.012268229,0.009608658,0.006138598,0.0049255714,0.002173976],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006901461,0.000057028054,0.04519963,0.0014347774,0.0012336959,0.00023580734,0.004892434,0.019244788,0.0004585148,0.7124016,0.014163476,0.19998798],"study_design_scores_gemma":[0.000040093662,0.00012553077,0.021196077,0.0008841442,0.0002346579,0.00071331515,0.0006174185,0.047471877,0.000856935,0.9131123,0.014526711,0.00022105608],"about_ca_topic_score_codex":0.004621143,"about_ca_topic_score_gemma":0.002457384,"teacher_disagreement_score":0.16018932,"about_ca_system_score_codex":0.0035611233,"about_ca_system_score_gemma":0.0026319467,"threshold_uncertainty_score":0.8471722},"labels":[],"label_agreement":null},{"id":"W1887790309","doi":"10.1186/1742-5573-3-11","title":"New patient-oriented summary measure of net total gain in certainty for dichotomous diagnostic tests","year":2006,"lang":"en","type":"article","venue":"Epidemiologic Perspectives & Innovations","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":96,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Reciprocal; Measure (data warehouse); Certainty; Youden's J statistic; Index (typography); Medicine; Statistics; Population; Disease; Computer science; Test (biology); Predictive value; Mathematics; Data mining; Internal medicine","score_opus":0.08524577208288033,"score_gpt":0.3642964651287134,"score_spread":0.2790506930458331,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1887790309","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.20120822,0.0027155983,0.7805951,0.0016366936,0.00031517644,0.0005673528,0.0030997996,0.00082283333,0.00903921],"genre_scores_gemma":[0.842776,0.0006447379,0.1533754,0.0002462777,0.00033717495,0.00054076227,0.0014092932,0.000055169687,0.0006152781],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9884488,0.0053788857,0.001265137,0.0010669224,0.0036613992,0.00017884672],"domain_scores_gemma":[0.9273159,0.052353494,0.009375686,0.003856254,0.006204836,0.00089375715],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.015946561,0.00075942633,0.0012070381,0.0042178463,0.000297095,0.0021728922,0.0011644994,0.00085688353,0.0030030124],"category_scores_gemma":[0.1050719,0.0002437917,0.0011783728,0.0032820096,0.001028181,0.0029448003,0.0014888658,0.0012803522,0.00038912243],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0016498428,0.0003702053,0.37424928,0.0013433744,0.0019497002,0.00038916018,0.000853256,0.0744962,0.0024972635,0.053050444,0.006274959,0.48287633],"study_design_scores_gemma":[0.00032998342,0.00470858,0.32060727,0.00058293686,0.001626874,0.0044295825,0.0005968041,0.4894123,0.0064713345,0.15688217,0.013907178,0.00044499128],"about_ca_topic_score_codex":0.00054083293,"about_ca_topic_score_gemma":0.00054244394,"teacher_disagreement_score":0.98405343,"about_ca_system_score_codex":0.0010566869,"about_ca_system_score_gemma":0.0009813602,"threshold_uncertainty_score":0.08433449},"labels":[],"label_agreement":null},{"id":"W1949714730","doi":"10.5435/00124635-200207000-00007","title":"Classification Systems in Orthopaedics","year":2002,"lang":"en","type":"review","venue":"Journal of the American Academy of Orthopaedic Surgeons","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":164,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Medicine; Reliability (semiconductor); Documentation; Kappa; Measure (data warehouse); Orthopedic surgery; Medical physics; Cohen's kappa; Reliability engineering; Data mining; Machine learning; Computer science; Surgery","score_opus":0.24293474394203074,"score_gpt":0.4163155049620289,"score_spread":0.17338076101999816,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1949714730","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0004957415,0.9663518,0.010061287,0.0067734593,0.005323781,0.00024007309,0.0002850955,0.000121326986,0.0103473775],"genre_scores_gemma":[0.009345684,0.93522155,0.038625024,0.004496975,0.0047741206,0.00056526344,0.00087931025,0.000050398463,0.0060417107],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99134517,0.0029493659,0.0018581472,0.0008399073,0.0028040882,0.00020332777],"domain_scores_gemma":[0.9858407,0.0078972615,0.001765861,0.00068360445,0.0034652194,0.0003474036],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009099592,0.002023842,0.0032002707,0.014962687,0.0014950089,0.0042710826,0.0035254166,0.0034613821,0.009638134],"category_scores_gemma":[0.024306677,0.000627287,0.001641672,0.017641438,0.0048073772,0.00706436,0.002509146,0.0039541037,0.005890471],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000038173686,0.000058408383,0.001164124,0.013509613,0.00012743252,0.00018730474,0.0005892822,0.00083145435,0.00022837993,0.068244696,0.08568151,0.8293396],"study_design_scores_gemma":[0.0000230902,0.000075277516,0.0028887247,0.014081005,0.000072631774,0.0015834991,0.0006117728,0.0004570868,0.00014183081,0.061450213,0.91854596,0.00006905844],"about_ca_topic_score_codex":0.0038993722,"about_ca_topic_score_gemma":0.003931344,"teacher_disagreement_score":0.014962687,"about_ca_system_score_codex":0.004565349,"about_ca_system_score_gemma":0.0060785217,"threshold_uncertainty_score":0.048123777},"labels":[],"label_agreement":null},{"id":"W1955533988","doi":"10.6000/1929-6029.2015.04.02.2","title":"On the Relationship between the Reliability and Accuracy of Bio-Behavioral Diagnoses: Simple Math to the Rescue","year":2015,"lang":"en","type":"article","venue":"International Journal of Statistics in Medical Research","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Medical diagnosis; Kappa; Mathematics; Statistics; Cohen's kappa; Equivalence (formal languages); Statistic; Youden's J statistic; Combinatorics; Psychology; Medicine; Discrete mathematics; Pathology; Receiver operating characteristic; Geometry","score_opus":0.5558141781385264,"score_gpt":0.5812588006269411,"score_spread":0.025444622488414725,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1955533988","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1341599,0.0065764543,0.77505845,0.024420489,0.0010906957,0.00052711956,0.0011731823,0.0006519246,0.056341715],"genre_scores_gemma":[0.7232857,0.0022991614,0.263975,0.0032376773,0.0008563174,0.0008568435,0.00046585553,0.00021929806,0.0048041972],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9737587,0.01648511,0.0013512783,0.004404689,0.0036696224,0.00033057702],"domain_scores_gemma":[0.67391473,0.29891717,0.006809124,0.012113494,0.0076805525,0.0005650052],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.050236385,0.0016805313,0.0025172362,0.0054590907,0.0011623529,0.003649302,0.0026481356,0.00340312,0.0062343245],"category_scores_gemma":[0.346624,0.0011535442,0.0022944752,0.0028601263,0.012176323,0.0069989855,0.0051569487,0.0038336436,0.0016561358],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00067970145,0.00027947934,0.09642831,0.0010403782,0.002039261,0.0007740232,0.005428107,0.083076954,0.0019086055,0.5116899,0.016437253,0.2802181],"study_design_scores_gemma":[0.0001393438,0.0005725859,0.024059296,0.0006378466,0.00024916808,0.0010784668,0.0009277313,0.15573576,0.0008009255,0.807289,0.008322484,0.00018746378],"about_ca_topic_score_codex":0.006811299,"about_ca_topic_score_gemma":0.0024795025,"teacher_disagreement_score":0.9497636,"about_ca_system_score_codex":0.00295246,"about_ca_system_score_gemma":0.0012868623,"threshold_uncertainty_score":0.26567858},"labels":[],"label_agreement":null},{"id":"W1968667761","doi":"10.1016/j.ijnurstu.2011.01.016","title":"Guidelines for Reporting Reliability and Agreement Studies (GRRAS) were proposed","year":2011,"lang":"en","type":"article","venue":"International Journal of Nursing Studies","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":985,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto; Western University","funders":"","keywords":"Agreement; Reliability (semiconductor); Psychology; Physics","score_opus":0.7846223701604345,"score_gpt":0.5880428148793927,"score_spread":0.19657955528104176,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1968667761","genre_codex":"methods","genre_gemma":"methods","domain_codex":"methods","domain_gemma":"reporting","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"reporting","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011182481,0.020299945,0.8627846,0.011716408,0.006606252,0.056460008,0.008025568,0.002698998,0.02022576],"genre_scores_gemma":[0.03699348,0.0039653312,0.88057494,0.0021366505,0.00055782794,0.07140197,0.0024523465,0.00038369087,0.0015336523],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.25273782,0.39817032,0.2785601,0.010392906,0.056238994,0.0038999764],"domain_scores_gemma":[0.12738091,0.5842614,0.04647023,0.05347933,0.18662399,0.0017842345],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.5019003,0.0042235157,0.0060663424,0.025742877,0.007892279,0.014885435,0.0099873785,0.009721867,0.005153972],"category_scores_gemma":[0.7899961,0.0039438293,0.011672264,0.022229267,0.008885155,0.010549389,0.010494096,0.012691756,0.0042113904],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015982866,0.0007071302,0.037930824,0.06308522,0.004791379,0.0012221955,0.027475676,0.005372055,0.003541815,0.25289917,0.12060581,0.4807704],"study_design_scores_gemma":[0.0019527922,0.0029390657,0.043737587,0.10792846,0.007957038,0.0038575965,0.027584387,0.025256865,0.019719139,0.3059967,0.45122254,0.0018477367],"about_ca_topic_score_codex":0.006504402,"about_ca_topic_score_gemma":0.008856425,"teacher_disagreement_score":0.49809968,"about_ca_system_score_codex":0.010262817,"about_ca_system_score_gemma":0.025734425,"threshold_uncertainty_score":0.61424565},"labels":[],"label_agreement":null},{"id":"W1970325005","doi":"10.1037/a0029315","title":"When can categorical variables be treated as continuous? A comparison of robust continuous and categorical SEM estimation methods under suboptimal conditions.","year":2012,"lang":"en","type":"article","venue":"Psychological Methods","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":2534,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Categorical variable; Statistics; Mathematics; Normality; Continuous variable; Sample size determination; Ordinal data; Sample (material); Latent variable; Confirmatory factor analysis; Econometrics; Structural equation modeling","score_opus":0.35917610160414,"score_gpt":0.5393551820295689,"score_spread":0.1801790804254289,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1970325005","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.021141026,0.00081698404,0.9742245,0.0011790813,0.000119162,0.00022701826,0.00020054152,0.00040262134,0.0016889924],"genre_scores_gemma":[0.31972712,0.00036485106,0.6776032,0.00043273784,0.00006936018,0.00086116715,0.00031661798,0.00026544757,0.0003595275],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.7808656,0.19783688,0.0041539418,0.0059556486,0.010490451,0.0006974708],"domain_scores_gemma":[0.5048312,0.44588098,0.012231586,0.023324842,0.012968239,0.00076321606],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.16756894,0.0007757712,0.0015717668,0.0021138478,0.0008731722,0.0034273556,0.0021813004,0.002006901,0.0027879674],"category_scores_gemma":[0.5875014,0.0008818818,0.0018426786,0.003849228,0.0037483932,0.0044853473,0.0024771956,0.0024174834,0.0006994708],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0022826034,0.00026824774,0.040434245,0.0026935723,0.002570498,0.0004127681,0.005495862,0.053921618,0.0036387406,0.24708107,0.010106775,0.631094],"study_design_scores_gemma":[0.0005078312,0.00095821125,0.02687798,0.0015137085,0.0005347121,0.00070125493,0.0027753033,0.44512802,0.0058605936,0.50112164,0.013703029,0.00031775204],"about_ca_topic_score_codex":0.0022630824,"about_ca_topic_score_gemma":0.002712318,"teacher_disagreement_score":0.8324311,"about_ca_system_score_codex":0.0015315914,"about_ca_system_score_gemma":0.0031041438,"threshold_uncertainty_score":0.88619983},"labels":[],"label_agreement":null},{"id":"W1970971885","doi":"10.1016/j.jclinepi.2011.10.019","title":"A confidence interval approach to sample size estimation for interobserver agreement studies with multiple raters and outcomes","year":2012,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":131,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University; York University","funders":"","keywords":"Confidence interval; Triage; Sample size determination; Reliability (semiconductor); Medicine; Estimation; Medical physics; Sample (material); Interval estimation; Statistics; Scale (ratio); Mathematics; Psychiatry; Power (physics)","score_opus":0.7278829789470725,"score_gpt":0.5892656106725227,"score_spread":0.13861736827454985,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1970971885","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0014141628,0.0008695023,0.99608034,0.00020824379,0.00013713447,0.00042221742,0.00010588424,0.00022080845,0.00054168055],"genre_scores_gemma":[0.08291865,0.0007531751,0.9103679,0.00039073316,0.00032598941,0.0038641272,0.00035870756,0.00022344581,0.00079724845],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.577203,0.35263616,0.017011499,0.021957772,0.02943282,0.0017587283],"domain_scores_gemma":[0.14896697,0.8083075,0.008988395,0.021254713,0.011801913,0.0006805764],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.36426076,0.003350027,0.008748183,0.012417684,0.0020263118,0.00524682,0.0117466645,0.007999947,0.0058258697],"category_scores_gemma":[0.7199979,0.0026826756,0.008032386,0.007963128,0.005384813,0.0064809155,0.0051811896,0.011124054,0.0010182477],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0031985051,0.0006857861,0.021681376,0.0043388843,0.0120968735,0.00088637107,0.004365866,0.062737375,0.0019681738,0.22336192,0.011988166,0.6526906],"study_design_scores_gemma":[0.001330653,0.003185797,0.018761594,0.0035132724,0.0063524353,0.0028197798,0.0010964124,0.6489965,0.0043762205,0.28571668,0.02329763,0.00055305916],"about_ca_topic_score_codex":0.004969955,"about_ca_topic_score_gemma":0.0020870534,"teacher_disagreement_score":0.36426076,"about_ca_system_score_codex":0.0023271998,"about_ca_system_score_gemma":0.0041436045,"threshold_uncertainty_score":0.78397965},"labels":[],"label_agreement":null},{"id":"W1976786126","doi":"10.1002/sim.911","title":"A general goodness‐of‐fit approach for inference procedures concerning the kappa statistic","year":2001,"lang":"en","type":"article","venue":"Statistics in Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":37,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Goodness of fit; Statistics; Polytomous Rasch model; Statistic; Cohen's kappa; Inference; Mathematics; Statistical inference; Test statistic; Multinomial distribution; Dirichlet distribution; Outcome (game theory); Kappa; Range (aeronautics); Confidence interval; Econometrics; Statistical hypothesis testing; Computer science; Item response theory; Psychometrics; Artificial intelligence","score_opus":0.2882924109126018,"score_gpt":0.4485972092231941,"score_spread":0.1603047983105923,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1976786126","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0014451456,0.00019572937,0.9966989,0.00020420761,0.00005303442,0.00030994517,0.00006888304,0.00022276618,0.00080128055],"genre_scores_gemma":[0.0755984,0.00041244773,0.9193069,0.00044848424,0.00019587556,0.0029837321,0.00026359197,0.00024315766,0.0005474819],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.72980374,0.21978481,0.009939073,0.014206622,0.024517473,0.001748266],"domain_scores_gemma":[0.53927386,0.39773837,0.01441923,0.028407883,0.019188154,0.00097248895],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1990702,0.003046685,0.0048069824,0.01446625,0.0030317123,0.004993923,0.007185344,0.0065245754,0.0072053317],"category_scores_gemma":[0.5594519,0.0021054598,0.006545209,0.00837079,0.009444383,0.007726405,0.008252952,0.008232064,0.0026768008],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00051988865,0.00025334742,0.013343384,0.0027974849,0.0029693514,0.0007033141,0.004285059,0.07976567,0.0028313883,0.46637496,0.012542287,0.41361395],"study_design_scores_gemma":[0.00022058973,0.00070437137,0.0060994816,0.0009915559,0.00046812507,0.0011656906,0.000807247,0.19807033,0.0022495731,0.7758346,0.013044262,0.00034414956],"about_ca_topic_score_codex":0.0028964474,"about_ca_topic_score_gemma":0.0022632354,"teacher_disagreement_score":0.1990702,"about_ca_system_score_codex":0.0027174188,"about_ca_system_score_gemma":0.004752644,"threshold_uncertainty_score":0.987689},"labels":[],"label_agreement":null},{"id":"W1978765295","doi":"10.2202/1557-4679.1275","title":"Sample Size Requirements for Interval Estimation of the Kappa Statistic for Interobserver Agreement Studies with a Binary Outcome and Multiple Raters","year":2010,"lang":"en","type":"article","venue":"The International Journal of Biostatistics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":127,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Statistics; Cohen's kappa; Confidence interval; Kappa; Intraclass correlation; Mathematics; Interval estimation; Statistic; Sample size determination; Sample (material); Binary number; Limit (mathematics); Interval (graph theory); Psychometrics; Combinatorics","score_opus":0.2216258336390316,"score_gpt":0.43800712383045454,"score_spread":0.21638129019142294,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1978765295","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017150404,0.0012700787,0.9575879,0.0013345417,0.0005864576,0.008586189,0.0011863108,0.0006231448,0.011675022],"genre_scores_gemma":[0.13673833,0.0010202107,0.8089746,0.0013515002,0.00052799174,0.04652979,0.0019396343,0.00059599825,0.0023219078],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.79998744,0.13028161,0.020785455,0.004278774,0.04277185,0.001894894],"domain_scores_gemma":[0.24536298,0.70366955,0.009069589,0.01281633,0.028058892,0.0010226863],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.17861864,0.0010694263,0.0029891576,0.0050496985,0.0012189965,0.0027049787,0.0041686567,0.0048182644,0.010825089],"category_scores_gemma":[0.5975481,0.0011060634,0.0016743371,0.002851962,0.0016209324,0.0026992282,0.0028399348,0.0028836958,0.0035946083],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.014262786,0.0013480182,0.02602221,0.0053842026,0.0004330233,0.0020249274,0.0046388023,0.036681812,0.020519309,0.14635795,0.047664132,0.6946628],"study_design_scores_gemma":[0.008194519,0.023979662,0.09354905,0.010985365,0.0014282943,0.011244902,0.0034470283,0.30837074,0.08315584,0.30145442,0.15320922,0.0009808949],"about_ca_topic_score_codex":0.0006303696,"about_ca_topic_score_gemma":0.0006430093,"teacher_disagreement_score":0.82138133,"about_ca_system_score_codex":0.0010351203,"about_ca_system_score_gemma":0.0025573082,"threshold_uncertainty_score":0.94463694},"labels":[],"label_agreement":null},{"id":"W1979334793","doi":"10.1111/1467-9884.00266","title":"Statistical Inferences For Interobserver Agreement Studies With Nominal Outcome Data","year":2001,"lang":"en","type":"article","venue":"Journal of the Royal Statistical Society Series D (The Statistician)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University; Queen's University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Categorical variable; Outcome (game theory); Statistical inference; Statistics; Econometrics; Statistical hypothesis testing; Nominal level; Inference; Multiple comparisons problem; Focus (optics); Computer science; Mathematics; Artificial intelligence; Confidence interval","score_opus":0.35846836881799066,"score_gpt":0.4458766577488586,"score_spread":0.08740828893086794,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1979334793","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.007276509,0.0008105836,0.983344,0.000686281,0.00055916,0.0036910367,0.0007422524,0.0006316752,0.0022584423],"genre_scores_gemma":[0.14153044,0.00067966065,0.8317397,0.0010872667,0.00064619194,0.022239765,0.00087897055,0.0005642855,0.00063373364],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.49166128,0.37449288,0.038146224,0.024753468,0.0680653,0.0028808124],"domain_scores_gemma":[0.12625293,0.789893,0.029263508,0.038255416,0.015334003,0.0010012081],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.38531208,0.0025398557,0.00469477,0.01152085,0.0033099207,0.004863068,0.0078008166,0.0054190764,0.010007134],"category_scores_gemma":[0.80511475,0.001819368,0.008909072,0.009228381,0.008915828,0.007414894,0.007335611,0.013703521,0.0023676497],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0054258723,0.00072692276,0.045157705,0.018932046,0.013116632,0.0017676492,0.011418681,0.024907043,0.004010779,0.27204943,0.043698344,0.5587889],"study_design_scores_gemma":[0.0018582874,0.0030028885,0.030377325,0.0057804245,0.0047772555,0.001825762,0.0024166782,0.12507288,0.011203524,0.7719132,0.04118445,0.00058738247],"about_ca_topic_score_codex":0.0009954314,"about_ca_topic_score_gemma":0.00067850045,"teacher_disagreement_score":0.38531208,"about_ca_system_score_codex":0.002835888,"about_ca_system_score_gemma":0.004313281,"threshold_uncertainty_score":0.7580197},"labels":[],"label_agreement":null},{"id":"W1983075605","doi":"10.1038/nmeth.2659","title":"Error bars","year":2013,"lang":"en","type":"article","venue":"Nature Methods","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":289,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Canada's Michael Smith Genome Sciences Centre","funders":"","keywords":"Computer science; Chemistry","score_opus":0.22189996935963935,"score_gpt":0.5448362889887357,"score_spread":0.32293631962909636,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1983075605","genre_codex":"methods","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05733129,0.012671838,0.3454002,0.011324137,0.09114092,0.0028180738,0.15780266,0.06677206,0.25473884],"genre_scores_gemma":[0.37043574,0.006311566,0.24540442,0.011843547,0.0043664225,0.012703535,0.12314377,0.025567181,0.20022383],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.96848005,0.009353418,0.0030748479,0.0065166797,0.0086893,0.0038857523],"domain_scores_gemma":[0.9208025,0.030678557,0.0044797496,0.02271541,0.019154599,0.0021692433],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.015919408,0.004834888,0.0053542205,0.0059474427,0.0039109522,0.005495085,0.0057599163,0.0116832275,0.09772328],"category_scores_gemma":[0.06665467,0.0021165079,0.003732589,0.0054753055,0.004174754,0.005193331,0.0074615795,0.015606611,0.09854192],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0031626984,0.0022174392,0.005075125,0.0072149416,0.001345059,0.00063417526,0.0020339382,0.007401219,0.037738137,0.056089967,0.6577661,0.21932133],"study_design_scores_gemma":[0.0007518114,0.0014269712,0.08731077,0.0043280516,0.0015458023,0.0022025516,0.004091929,0.020010073,0.14492416,0.07022363,0.6620224,0.001161795],"about_ca_topic_score_codex":0.004768458,"about_ca_topic_score_gemma":0.0041675125,"teacher_disagreement_score":0.9840806,"about_ca_system_score_codex":0.0024073722,"about_ca_system_score_gemma":0.0035567165,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W1987916785","doi":"10.1016/j.jclinepi.2008.05.003","title":"Commentary on “Alternative graphs for diagnostic tests: the agreement chart and the receiver operating characteristic curve”","year":2008,"lang":"en","type":"letter","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"St. Joseph’s Healthcare Hamilton; McMaster University","funders":"","keywords":"Receiver operating characteristic; Computer science; Chart; Perception; Feature (linguistics); Artificial intelligence; Information retrieval; Statistics; Psychology; Mathematics; Machine learning; Linguistics","score_opus":0.49507110752261396,"score_gpt":0.520213486178791,"score_spread":0.025142378656177078,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1987916785","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"reporting","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"reporting","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00014569558,0.00039626326,0.00028820807,0.98530895,0.013142224,0.000013737855,0.000086808854,0.000031093245,0.0005869181],"genre_scores_gemma":[0.0011559376,0.000152836,0.0005163142,0.9783343,0.018942026,0.000051412248,0.000022116412,0.000022412352,0.00080266554],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.957238,0.021811508,0.0052860975,0.004542283,0.009129465,0.0019926294],"domain_scores_gemma":[0.7740983,0.18592183,0.0064255395,0.0035838117,0.025241934,0.004728658],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.040257007,0.0015087439,0.0036462643,0.0024949708,0.0056357672,0.006425636,0.008357363,0.114373624,0.0073445714],"category_scores_gemma":[0.22898783,0.0025304817,0.0031648986,0.0026410287,0.009821454,0.007194918,0.0030641393,0.09486851,0.0067416267],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00007986269,0.00001482016,0.00023914145,0.00006777426,0.00002765759,0.000350748,0.00018284065,0.00006426101,0.00005993242,0.004222491,0.99093467,0.0037557257],"study_design_scores_gemma":[0.0007625199,0.00015094403,0.002462462,0.0017394067,0.0002142697,0.001841226,0.00094315904,0.0022977025,0.00059601327,0.043884594,0.94476753,0.0003402465],"about_ca_topic_score_codex":0.015470743,"about_ca_topic_score_gemma":0.022929467,"teacher_disagreement_score":0.959743,"about_ca_system_score_codex":0.008926266,"about_ca_system_score_gemma":0.0077120685,"threshold_uncertainty_score":0.21290195},"labels":[],"label_agreement":null},{"id":"W1989853314","doi":"10.1186/1471-2288-9-5","title":"Measuring agreement of administrative data with chart data using prevalence unadjusted and adjusted kappa","year":2009,"lang":"en","type":"article","venue":"BMC Medical Research Methodology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":177,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Calgary General Hospital; Alberta Bone and Joint Health Institute; University of Calgary","funders":"Canadian Institutes of Health Research; Fondation pour la Recherche Médicale","keywords":"Kappa; Cohen's kappa; Statistics; Medicine; Sampling (signal processing); Sample size determination; Sample (material); Mathematics; Computer science","score_opus":0.9684346225908497,"score_gpt":0.6570201568897845,"score_spread":0.3114144657010651,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1989853314","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8066431,0.002740497,0.17648962,0.00033546274,0.00029629224,0.0009678778,0.0027997463,0.0005193895,0.009207902],"genre_scores_gemma":[0.96250516,0.00026388903,0.03545959,0.000056134384,0.000052594005,0.00048957876,0.00082364125,0.00005459042,0.000294936],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.888696,0.059595425,0.018069344,0.01033305,0.021707844,0.0015982793],"domain_scores_gemma":[0.68822825,0.19704968,0.05584993,0.017273948,0.0400996,0.0014985314],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.09648629,0.0006123471,0.0012071416,0.01005391,0.0009573254,0.0023580235,0.001874339,0.0007150345,0.0011621037],"category_scores_gemma":[0.22629862,0.0007431574,0.0019151779,0.006129305,0.001578982,0.00244429,0.0031760216,0.0010925984,0.00025802216],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00049877877,0.00004925606,0.9485668,0.0008216667,0.0017748154,0.000076476055,0.0037318796,0.002294669,0.0012188145,0.0015223895,0.0011121996,0.03833212],"study_design_scores_gemma":[0.0000670308,0.0005188764,0.96400183,0.0004484807,0.00068198325,0.00076816574,0.0030723421,0.01589035,0.0034692844,0.0066927485,0.0042255204,0.00016341987],"about_ca_topic_score_codex":0.005808953,"about_ca_topic_score_gemma":0.005312883,"teacher_disagreement_score":0.09648629,"about_ca_system_score_codex":0.0018566365,"about_ca_system_score_gemma":0.0015644319,"threshold_uncertainty_score":0.5102744},"labels":[],"label_agreement":null},{"id":"W1990424977","doi":"10.1007/s00180-013-0424-7","title":"Evaluation of confidence intervals for the kappa statistic when the assumption of marginal homogeneity is violated","year":2013,"lang":"en","type":"article","venue":"Computational Statistics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University; McMaster University; Ontario Clinical Oncology Group","funders":"","keywords":"Homogeneity (statistics); Kappa; Statistic; Confidence interval; Statistics; Mathematics; Cohen's kappa; Econometrics; Test statistic; Statistical hypothesis testing","score_opus":0.3043425736713799,"score_gpt":0.4321275538967644,"score_spread":0.12778498022538448,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1990424977","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.073323935,0.002771979,0.9172407,0.0004792771,0.00017607416,0.0004001933,0.0005425734,0.0009459017,0.0041194423],"genre_scores_gemma":[0.67752755,0.0007464086,0.3181504,0.00021218021,0.00015395392,0.0011277908,0.0010702196,0.0004939915,0.00051759393],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8245244,0.11995759,0.01055061,0.011572305,0.03111967,0.0022753223],"domain_scores_gemma":[0.1213315,0.83095354,0.013651309,0.01658328,0.016276332,0.0012040116],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.17931671,0.0017526771,0.003406157,0.008491982,0.0014878659,0.0062702587,0.0073499586,0.004897726,0.0038516733],"category_scores_gemma":[0.7070058,0.000975482,0.0030147329,0.0055462387,0.0038094835,0.005673708,0.005083294,0.0047140294,0.00054372224],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.010567649,0.0007392391,0.07471381,0.0060346765,0.006857466,0.0018070145,0.008683347,0.15680146,0.0063100657,0.22679918,0.0102643445,0.49042168],"study_design_scores_gemma":[0.001040688,0.002450743,0.04099452,0.003341505,0.0020752803,0.0032461064,0.0031640339,0.66421455,0.014697911,0.25349116,0.010646775,0.00063674676],"about_ca_topic_score_codex":0.0024257356,"about_ca_topic_score_gemma":0.0013195454,"teacher_disagreement_score":0.8206833,"about_ca_system_score_codex":0.0017779997,"about_ca_system_score_gemma":0.0026412283,"threshold_uncertainty_score":0.94832873},"labels":[],"label_agreement":null},{"id":"W1992959707","doi":"10.1093/ps/79.8.1194","title":"Bacteriological and Histological Profile of Turkeys Condemned for Cyanosis","year":2000,"lang":"en","type":"article","venue":"Poultry Science","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Health Canada; University of Guelph","funders":"Health Canada","keywords":"Salmonella; Veterinary medicine; Rappaport; Medicine; Biology; Bacteria","score_opus":0.17528353550879233,"score_gpt":0.38849228119078877,"score_spread":0.21320874568199644,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1992959707","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9993524,0.0001393397,0.000067316374,0.0000042251904,0.0000048428556,0.0000114929935,0.000083845225,0.0000041873427,0.00033231877],"genre_scores_gemma":[0.9989241,0.00013631175,0.0002347618,0.000017615228,0.000004919657,0.000007269852,0.00020969426,0.000002888396,0.00046256004],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9996635,0.000038289356,0.00004237897,0.00010063447,0.00008994683,0.0000651985],"domain_scores_gemma":[0.9991736,0.000077764955,0.00021584779,0.000033744185,0.0002677642,0.00023124448],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0003700792,0.0003657474,0.00033182578,0.0021832294,0.00044376656,0.00035913938,0.00016675291,0.00033894987,0.00093899644],"category_scores_gemma":[0.0006677611,0.00028938398,0.0002480659,0.00048619235,0.0004719669,0.0001775099,0.0002183503,0.00030179604,0.0002606306],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0016833637,0.00043077325,0.7892316,0.00010416743,0.00007383745,0.005555419,0.0012734598,0.000117340394,0.19585453,0.000033476597,0.000114994575,0.0055271224],"study_design_scores_gemma":[0.000004456424,0.00088250375,0.9932549,0.000005653544,0.000020706071,0.0019696532,0.00051334605,0.000071822,0.00316596,0.0000052822716,0.00009986811,0.000005821548],"about_ca_topic_score_codex":0.004537906,"about_ca_topic_score_gemma":0.007297933,"teacher_disagreement_score":0.004537906,"about_ca_system_score_codex":0.00038149478,"about_ca_system_score_gemma":0.00019925056,"threshold_uncertainty_score":0.009023011},"labels":[],"label_agreement":null},{"id":"W1993809841","doi":"10.1016/j.jclinepi.2004.11.026","title":"The problem of imperfect reference standards","year":2005,"lang":"en","type":"letter","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Gold standard (test); Imperfect; Class (philosophy); Latent class model; Standard error; Statistics; Scopus; Computer science; Econometrics; Mathematics; MEDLINE; Artificial intelligence; Philosophy; Linguistics; Political science","score_opus":0.6177846126145073,"score_gpt":0.5901486659943236,"score_spread":0.02763594662018376,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1993809841","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0003920656,0.0013479788,0.0024569281,0.9902164,0.0034243958,0.000007866902,0.000033880573,0.000023485043,0.0020969787],"genre_scores_gemma":[0.017814554,0.0012520842,0.0076897605,0.95280224,0.018617975,0.00007979719,0.000032877157,0.000053066025,0.0016576793],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.8649081,0.08366036,0.012536297,0.008089771,0.028428394,0.0023769324],"domain_scores_gemma":[0.4737705,0.46343383,0.01057105,0.014088841,0.032820348,0.005315377],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.12034727,0.00069969887,0.0029563804,0.0024253041,0.005081879,0.006610998,0.0055038794,0.06983295,0.0039996416],"category_scores_gemma":[0.42942888,0.0015687257,0.001473682,0.0024345268,0.018821172,0.012350505,0.0052747875,0.061532967,0.0025959034],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001336196,0.0000471867,0.0025342717,0.00026438799,0.00009275954,0.0023505818,0.0019815054,0.00045655953,0.00013625761,0.15117222,0.7724724,0.06835827],"study_design_scores_gemma":[0.00026914335,0.00009563907,0.0028094854,0.0015098396,0.000098689474,0.007039781,0.0019375006,0.0034401251,0.00043700341,0.41750348,0.5646502,0.00020909126],"about_ca_topic_score_codex":0.009724223,"about_ca_topic_score_gemma":0.012596081,"teacher_disagreement_score":0.87965274,"about_ca_system_score_codex":0.006447302,"about_ca_system_score_gemma":0.007702525,"threshold_uncertainty_score":0.63646483},"labels":[],"label_agreement":null},{"id":"W1994298865","doi":"10.1371/journal.pone.0052221","title":"Assessing Diagnostic Tests: How to Correct for the Combined Effects of Interpretation and Reference Standard","year":2012,"lang":"en","type":"article","venue":"PLoS ONE","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"SUNY Downstate Medical Center; National Institutes of Health; National Institute of Neurological Disorders and Stroke; York University; State University of New York","keywords":"Sensitivity (control systems); Reliability (semiconductor); Diagnostic accuracy; Gold standard (test); Reference values; Standard deviation; Computer science; Interpreter; Diagnostic test; Statistics; Standard error; Calibration; Interpretation (philosophy); Medical physics; Medicine; Mathematics; Radiology; Internal medicine; Pediatrics; Physics","score_opus":0.2178926583735101,"score_gpt":0.3706645710522915,"score_spread":0.1527719126787814,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1994298865","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0034328469,0.00073509506,0.9926682,0.0016843745,0.00015951808,0.00018642105,0.000073637944,0.0005619512,0.0004980106],"genre_scores_gemma":[0.030583937,0.00049110496,0.96775645,0.000289684,0.00009525281,0.00029517364,0.00006672276,0.0001446437,0.00027706],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.942035,0.035766084,0.004121707,0.004957615,0.012563364,0.00055622024],"domain_scores_gemma":[0.8013542,0.14554219,0.011101799,0.017748583,0.02321382,0.0010394303],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.09031046,0.0025195,0.00428048,0.0050427965,0.0013035727,0.0043425346,0.004304928,0.00555703,0.0026078124],"category_scores_gemma":[0.37583193,0.001800897,0.0024883943,0.0037391628,0.0048009595,0.007539719,0.004581641,0.004378718,0.0024980237],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025507045,0.00018475947,0.020504495,0.0017123614,0.0014460498,0.00034523802,0.0016043006,0.052600697,0.0057901796,0.036652382,0.011090701,0.86781377],"study_design_scores_gemma":[0.00030470206,0.0008570163,0.026900284,0.0018422456,0.0012340863,0.00325227,0.0010891755,0.44166452,0.024978476,0.46275908,0.03410146,0.0010166629],"about_ca_topic_score_codex":0.0064261565,"about_ca_topic_score_gemma":0.005418115,"teacher_disagreement_score":0.90968955,"about_ca_system_score_codex":0.0015971259,"about_ca_system_score_gemma":0.005220817,"threshold_uncertainty_score":0.4776131},"labels":[],"label_agreement":null},{"id":"W1994361491","doi":"10.1016/j.rhum.2003.07.008","title":"Évaluation des destructions dans les articulations analysées individuellement au cours de la polyarthrite rhumatoïde : une nouvelle méthode fondée sur celle de Larsen","year":2003,"lang":"fr","type":"article","venue":"Revue du Rhumatisme","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"St. Michael's Hospital; Sunnybrook Hospital; Mount Sinai Hospital","funders":"","keywords":"Medicine; Humanities; Gynecology; Philosophy","score_opus":0.15403118193672483,"score_gpt":0.33993183251218906,"score_spread":0.18590065057546423,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1994361491","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8543964,0.004154917,0.13494948,0.000263277,0.00024977702,0.00065418833,0.00038970422,0.00022109212,0.0047212853],"genre_scores_gemma":[0.941461,0.0012134782,0.05353999,0.00005830664,0.00007876642,0.0005271446,0.00015880464,0.00011437222,0.002848035],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.97293615,0.011089201,0.003330922,0.002359824,0.009307961,0.00097587204],"domain_scores_gemma":[0.9432805,0.040862918,0.003497471,0.0033552356,0.008415569,0.0005882711],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.024833066,0.0012888145,0.00193608,0.0051268316,0.0013672562,0.0028624649,0.0015077522,0.0023806354,0.0016809521],"category_scores_gemma":[0.053898633,0.001141974,0.0018440991,0.00285261,0.003106745,0.0021959227,0.0022064447,0.0015884277,0.00074718375],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005907588,0.00035087258,0.4167138,0.0016653576,0.0016895117,0.0009757752,0.026271036,0.004402746,0.12058436,0.0019333921,0.00057697564,0.41892856],"study_design_scores_gemma":[0.00018650241,0.0026565813,0.89166087,0.0003159822,0.0014689557,0.0044540307,0.008520162,0.015332774,0.06788507,0.0019109872,0.005209266,0.00039898627],"about_ca_topic_score_codex":0.0047628605,"about_ca_topic_score_gemma":0.0071869562,"teacher_disagreement_score":0.024833066,"about_ca_system_score_codex":0.0006530527,"about_ca_system_score_gemma":0.0011703662,"threshold_uncertainty_score":0.13133138},"labels":[],"label_agreement":null},{"id":"W1995530352","doi":"10.2466/pr0.2000.87.3.791","title":"Expertise Sensitive Item Selection","year":2000,"lang":"en","type":"article","venue":"Psychological Reports","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute for Christian Studies; University of Toronto; Nipissing University","funders":"","keywords":"Certification; Index (typography); Test (biology); Selection (genetic algorithm); Psychology; Computer science; Applied psychology; Statistics; Artificial intelligence; Mathematics; World Wide Web; Management","score_opus":0.1941270554244931,"score_gpt":0.44065364488865594,"score_spread":0.24652658946416284,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1995530352","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.06711492,0.0006381038,0.8912103,0.0006165513,0.0004775122,0.01645689,0.0014694748,0.0028313335,0.019184813],"genre_scores_gemma":[0.20234878,0.0005041721,0.7520398,0.0016020617,0.00031866133,0.028850423,0.0038231718,0.0007306769,0.009782318],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.94035155,0.03859961,0.0050547495,0.0035693024,0.011241752,0.001183142],"domain_scores_gemma":[0.92076534,0.046751864,0.0028019955,0.012735445,0.016142705,0.0008025004],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03855979,0.0014785405,0.0014134801,0.0058608972,0.0012291581,0.0016078026,0.0018758184,0.0012296442,0.014851547],"category_scores_gemma":[0.13408516,0.00065844454,0.0014246044,0.003973017,0.00086609944,0.0015219026,0.0037543718,0.00187519,0.007966044],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011864159,0.00088981655,0.02355,0.0010233456,0.00032240484,0.0006217178,0.0032442461,0.0033232216,0.021021968,0.01984463,0.03006347,0.8949088],"study_design_scores_gemma":[0.0019274068,0.0069906544,0.20615785,0.0019858554,0.0011652091,0.007621402,0.004903688,0.09197935,0.10494086,0.16068898,0.41059864,0.0010400896],"about_ca_topic_score_codex":0.00062197173,"about_ca_topic_score_gemma":0.0014243299,"teacher_disagreement_score":0.03855979,"about_ca_system_score_codex":0.00069407723,"about_ca_system_score_gemma":0.0017516145,"threshold_uncertainty_score":0.20392615},"labels":[],"label_agreement":null},{"id":"W2004544084","doi":"10.1016/j.jclinepi.2006.02.006","title":"Interrater reliability of measurements of comorbid illness should be reported","year":2006,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":59,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Baycrest Hospital; Queen's University","funders":"Cancer Care Ontario","keywords":"Inter-rater reliability; Intraclass correlation; Medicine; Reliability (semiconductor); Rating scale; Comorbidity; Physical therapy; Psychometrics; Statistics; Psychiatry; Clinical psychology","score_opus":0.7802261328157349,"score_gpt":0.5869670242980766,"score_spread":0.19325910851765837,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2004544084","genre_codex":"empirical","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.61838216,0.010362919,0.29145265,0.011055021,0.008944585,0.0046680705,0.005313286,0.0019289382,0.047892418],"genre_scores_gemma":[0.87964827,0.0010642298,0.10879119,0.0010174629,0.0010685982,0.0028360032,0.002196429,0.00041424212,0.0029637106],"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.7651232,0.13250674,0.056324348,0.00738445,0.035923228,0.0027380493],"domain_scores_gemma":[0.36789894,0.33940762,0.048822206,0.0807601,0.15979238,0.0033187547],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.13182515,0.00093988876,0.0034175294,0.00469615,0.0023506081,0.0028352423,0.0019463254,0.0028665399,0.0019219321],"category_scores_gemma":[0.5261459,0.0009963551,0.0025774387,0.0032732734,0.0017285065,0.0032256562,0.0024189004,0.0031136952,0.0018177727],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0032709122,0.00066151755,0.5829631,0.0054147504,0.0030393903,0.0010263217,0.020139204,0.0024505793,0.015795944,0.010097723,0.049111553,0.306029],"study_design_scores_gemma":[0.00038469167,0.001787012,0.8341867,0.0041924897,0.0016596306,0.004463231,0.00892091,0.027615067,0.03668544,0.026876679,0.052459907,0.0007682351],"about_ca_topic_score_codex":0.0021960188,"about_ca_topic_score_gemma":0.004049331,"teacher_disagreement_score":0.86817485,"about_ca_system_score_codex":0.0012468832,"about_ca_system_score_gemma":0.0029630682,"threshold_uncertainty_score":0.6971663},"labels":[],"label_agreement":null},{"id":"W2007345088","doi":"10.1371/journal.pone.0073990","title":"The Case for Using the Repeatability Coefficient When Calculating Test–Retest Reliability","year":2013,"lang":"en","type":"article","venue":"PLoS ONE","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":474,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"Curtin University of Technology","keywords":"Intraclass correlation; Repeatability; Reliability (semiconductor); Strengths and weaknesses; Computer science; Pearson product-moment correlation coefficient; Statistics; Test (biology); Measure (data warehouse); Reliability engineering; Correlation coefficient; Data mining; Medical physics; Machine learning; Mathematics; Reproducibility; Medicine; Psychology; Engineering","score_opus":0.29659504026263267,"score_gpt":0.3528709709396792,"score_spread":0.056275930677046504,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2007345088","genre_codex":"methods","genre_gemma":"methods","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.022636656,0.067898974,0.78341293,0.08140676,0.019213496,0.00081530167,0.00040819234,0.0011895875,0.023018071],"genre_scores_gemma":[0.32290435,0.011258649,0.6215421,0.028390285,0.009178137,0.001747906,0.00022328731,0.0015846683,0.0031706046],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.35330552,0.48940197,0.050079014,0.032399442,0.07223766,0.00257642],"domain_scores_gemma":[0.14611794,0.7178635,0.031999543,0.05380201,0.048271496,0.0019455937],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.49403524,0.002530921,0.0057273973,0.0099740075,0.0036647636,0.010625553,0.006213953,0.008707317,0.0014409894],"category_scores_gemma":[0.75715,0.0019766185,0.0048917686,0.011240251,0.01495066,0.0162407,0.007405201,0.018820535,0.0015467029],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011568863,0.00018546298,0.11460004,0.009080076,0.006611285,0.0013797516,0.02302811,0.004791981,0.0032849512,0.18713537,0.054505255,0.5942408],"study_design_scores_gemma":[0.00046192392,0.0036496073,0.085278414,0.03127594,0.004109183,0.008933462,0.01298787,0.034526546,0.011260624,0.5341878,0.27140227,0.0019264184],"about_ca_topic_score_codex":0.008443343,"about_ca_topic_score_gemma":0.008540183,"teacher_disagreement_score":0.50596476,"about_ca_system_score_codex":0.0043788617,"about_ca_system_score_gemma":0.009408763,"threshold_uncertainty_score":0.62394464},"labels":[],"label_agreement":null},{"id":"W2008192038","doi":"10.1007/s00477-012-0561-5","title":"Parameter and quantile estimation of the 2-parameter kappa distribution by maximum likelihood","year":2012,"lang":"en","type":"article","venue":"Stochastic Environmental Research and Risk Assessment","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Moncton","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Quantile; Kappa; Mathematics; Statistics; Maximum likelihood; Shape parameter; Estimation theory; Estimation; Distribution (mathematics); Applied mathematics; Econometrics; Mathematical analysis; Economics","score_opus":0.07148164151909714,"score_gpt":0.3891359155073917,"score_spread":0.31765427398829454,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2008192038","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.020370541,0.00012417813,0.9783669,0.00011308823,0.00001118916,0.000026011136,0.00012111509,0.00025350798,0.0006134637],"genre_scores_gemma":[0.718945,0.00029500978,0.27670074,0.00008524412,0.000051641375,0.00024391671,0.00073888106,0.00035705106,0.0025824336],"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9946293,0.003314373,0.00023925946,0.0006745563,0.00070906326,0.00043348633],"domain_scores_gemma":[0.97591406,0.01879042,0.0010871164,0.0024340167,0.0014883373,0.00028610486],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011836763,0.00068210653,0.0015055721,0.002110238,0.00074080133,0.0020524208,0.0018226304,0.0015615381,0.0036878404],"category_scores_gemma":[0.05873289,0.00083625806,0.0016389505,0.0021525957,0.001424922,0.002496235,0.0029264425,0.0020899225,0.000979424],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00056079467,0.00012254671,0.016553503,0.00029097436,0.0002727342,0.00018897073,0.0007747023,0.6853499,0.004903702,0.12553035,0.0024849104,0.1629669],"study_design_scores_gemma":[0.000024066343,0.000030725598,0.0051742136,0.00004610453,0.000022845785,0.000113836555,0.00010108374,0.9249043,0.0012786075,0.06736534,0.0008761786,0.00006273374],"about_ca_topic_score_codex":0.0056740358,"about_ca_topic_score_gemma":0.0032295682,"teacher_disagreement_score":0.011836763,"about_ca_system_score_codex":0.0010589502,"about_ca_system_score_gemma":0.0017686842,"threshold_uncertainty_score":0.06259954},"labels":[],"label_agreement":null},{"id":"W2012185914","doi":"10.1016/j.prevetmed.2009.07.011","title":"Traditional descriptive analysis and novel visual representation of diagnostic repeatability and reproducibility: Application to an infectious salmon anaemia virus RT-PCR assay","year":2009,"lang":"en","type":"article","venue":"Preventive Veterinary Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":15,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Fisheries and Oceans Canada; University of Prince Edward Island","funders":"","keywords":"Repeatability; Reproducibility; Homogenization (climate); Transferability; Replicate; Biology; Statistics; Veterinary medicine; Mathematics; Pathology; Medicine; Ecology","score_opus":0.17558859261345333,"score_gpt":0.41348204531252536,"score_spread":0.23789345269907203,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2012185914","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09021333,0.00026665532,0.9061217,0.00014644874,0.000094292736,0.00025460692,0.0004738875,0.0009743992,0.0014547908],"genre_scores_gemma":[0.6217125,0.0001678116,0.37610313,0.00010206486,0.0001044017,0.00056789315,0.00046551117,0.0001823714,0.0005942772],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.97067297,0.016900588,0.003304955,0.0029316826,0.005863264,0.00032649812],"domain_scores_gemma":[0.8549585,0.114407815,0.00983762,0.008001636,0.012367815,0.00042673055],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.039672922,0.0009133288,0.00096799986,0.004874698,0.00060016563,0.0028481863,0.001352939,0.0010261348,0.0013187942],"category_scores_gemma":[0.087218724,0.00046639124,0.0011255136,0.0029477964,0.0014452876,0.0019792053,0.0011607739,0.0012845222,0.00030853273],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002813047,0.0009413748,0.14166245,0.001966044,0.001686134,0.00040685487,0.005203924,0.029308718,0.050757624,0.025410078,0.004421604,0.7354222],"study_design_scores_gemma":[0.00024776053,0.0025348135,0.22027169,0.00034191148,0.0009124528,0.0024761644,0.0033171289,0.6725572,0.04006417,0.047668338,0.008939809,0.0006685688],"about_ca_topic_score_codex":0.0014067581,"about_ca_topic_score_gemma":0.0020007237,"teacher_disagreement_score":0.039672922,"about_ca_system_score_codex":0.0009285414,"about_ca_system_score_gemma":0.0010302106,"threshold_uncertainty_score":0.209813},"labels":[],"label_agreement":null},{"id":"W2014089987","doi":"10.1002/j.2334-5837.2007.tb02909.x","title":"4.6.3 A Self‐assessment Scheme and an Evaluation of its Reliability based on ISO 9004:2000","year":2007,"lang":"en","type":"article","venue":"INCOSE International Symposium","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"","keywords":"Reliability (semiconductor); Audit; Computer science; Quality (philosophy); Self-assessment; Process (computing); Scheme (mathematics); Quality audit; Reliability engineering; Risk analysis (engineering); Process management; Business; Accounting; Mathematics; Engineering; Psychology","score_opus":0.09485833129002842,"score_gpt":0.4272861330272782,"score_spread":0.3324278017372498,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2014089987","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.91350406,0.00020046541,0.05936473,0.00032062372,0.00017567874,0.0018716697,0.00047142475,0.00060670904,0.023484636],"genre_scores_gemma":[0.9347226,0.000097056625,0.06095643,0.00003637077,0.000026574273,0.0008093994,0.00043324236,0.00004310494,0.0028753283],"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.95584464,0.020337848,0.005605108,0.0011945453,0.016366357,0.0006515558],"domain_scores_gemma":[0.8847031,0.04235464,0.007775784,0.008435303,0.055400457,0.0013306807],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.038498532,0.00036831494,0.00044957575,0.0039499723,0.00075541495,0.001776756,0.0007181023,0.0005819544,0.0026537208],"category_scores_gemma":[0.07056085,0.00025547197,0.0011062667,0.0021149404,0.00093502627,0.0012693282,0.0012690858,0.0005729139,0.00081233797],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001797375,0.0013526557,0.5664302,0.0010973029,0.00041126672,0.00019136953,0.013093911,0.006649464,0.026059898,0.0070075043,0.0046638884,0.3712452],"study_design_scores_gemma":[0.00022593996,0.006097696,0.82353806,0.00066499214,0.0004610692,0.00069374806,0.015457234,0.06756592,0.05232719,0.0045561222,0.028083937,0.00032810288],"about_ca_topic_score_codex":0.0013237535,"about_ca_topic_score_gemma":0.0009875322,"teacher_disagreement_score":0.9615015,"about_ca_system_score_codex":0.0011563358,"about_ca_system_score_gemma":0.0014488698,"threshold_uncertainty_score":0.20360214},"labels":[],"label_agreement":null},{"id":"W2016242508","doi":"10.1016/j.jclinepi.2010.12.001","title":"The difference between reliability and agreement","year":2011,"lang":"en","type":"letter","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":93,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Scopus; Inter-rater reliability; Intraclass correlation; Reliability (semiconductor); Kappa; Cohen's kappa; Statistics; Psychology; Medicine; Mathematics; MEDLINE; Physics; Psychometrics; Political science","score_opus":0.6917992205636752,"score_gpt":0.5490965920628558,"score_spread":0.14270262850081938,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2016242508","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.002081647,0.002918512,0.0031780475,0.9792037,0.007287101,0.000020339075,0.000054305594,0.000028266328,0.005228137],"genre_scores_gemma":[0.10353607,0.0020035978,0.0075666388,0.84890735,0.0346866,0.0002527263,0.0000625804,0.000071210125,0.0029132334],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.7752062,0.14168583,0.02765923,0.011085534,0.041467693,0.0028955596],"domain_scores_gemma":[0.25365347,0.6922848,0.011147041,0.01187921,0.027306648,0.0037287418],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.13723786,0.00049354264,0.002328253,0.0023468672,0.0029912358,0.0060911993,0.002580834,0.02689106,0.0034976818],"category_scores_gemma":[0.5732886,0.0012484096,0.0012994949,0.0016709357,0.015554502,0.00922126,0.0049464293,0.03307545,0.0025814874],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008965942,0.00014644874,0.027535569,0.0010026584,0.00039443802,0.0029971187,0.00533125,0.0005052766,0.00056783616,0.15648338,0.5777726,0.22636685],"study_design_scores_gemma":[0.0007078043,0.0006110605,0.036727708,0.0040281564,0.00042367994,0.016234994,0.004474833,0.0064382707,0.0015745689,0.54356915,0.38467172,0.0005380408],"about_ca_topic_score_codex":0.0033258372,"about_ca_topic_score_gemma":0.0057178144,"teacher_disagreement_score":0.86276215,"about_ca_system_score_codex":0.006234543,"about_ca_system_score_gemma":0.0057281684,"threshold_uncertainty_score":0.7257919},"labels":[],"label_agreement":null},{"id":"W2017183230","doi":"10.1002/bsl.730","title":"Do tests of malingering concur? Concordance among malingering measures","year":2006,"lang":"en","type":"article","venue":"Behavioral Sciences & the Law","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":20,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Columbia College","funders":"","keywords":"Malingering; Concordance; Psychology; Clinical psychology; Psychiatry; Medicine; Internal medicine","score_opus":0.22399606406696035,"score_gpt":0.40694419476798366,"score_spread":0.1829481307010233,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2017183230","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9849814,0.0017061429,0.006958142,0.0006943495,0.00009787282,0.00004574158,0.00022899969,0.000080960555,0.0052063684],"genre_scores_gemma":[0.99881554,0.00012453251,0.0007898684,0.000047435646,0.00002605963,0.000008972259,0.00010061817,0.000009698457,0.00007732223],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.969244,0.013679046,0.0044019935,0.0030113782,0.008277702,0.0013859018],"domain_scores_gemma":[0.7651659,0.15167826,0.028192965,0.026783109,0.02525269,0.0029270565],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03480305,0.00038891513,0.0010553574,0.004788473,0.00057043205,0.0022258435,0.0013250893,0.0010365364,0.0007415709],"category_scores_gemma":[0.2091997,0.0004757613,0.0005584317,0.0026932354,0.0029904693,0.0025756275,0.0024935687,0.0013799585,0.0005120946],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000111090645,0.000034783698,0.97321194,0.00007511459,0.00029930755,0.00010373053,0.002156035,0.00024204569,0.0006056425,0.00085000397,0.00027183112,0.0220385],"study_design_scores_gemma":[0.000008588946,0.00016969412,0.98767394,0.00009191893,0.00010243273,0.0007732659,0.0017634756,0.0022084627,0.0011975194,0.005075757,0.00090622366,0.000028672828],"about_ca_topic_score_codex":0.002110479,"about_ca_topic_score_gemma":0.0022205368,"teacher_disagreement_score":0.03480305,"about_ca_system_score_codex":0.00054607476,"about_ca_system_score_gemma":0.0007229997,"threshold_uncertainty_score":0.18405831},"labels":[],"label_agreement":null},{"id":"W2018205196","doi":"10.1111/j.0006-341x.2001.00584.x","title":"Inference Procedures for Assessing Interobserver Agreement among Multiple Raters","year":2001,"lang":"en","type":"article","venue":"Biometrics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":37,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Statistics; Goodness of fit; Mathematics; Nominal level; Confidence interval; Binomial distribution; Range (aeronautics); Inference; Sample size determination; Binomial (polynomial); Multiple comparisons problem; Statistical inference; Computer science; Artificial intelligence","score_opus":0.3335008582243348,"score_gpt":0.43055005559190307,"score_spread":0.09704919736756829,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2018205196","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0011511123,0.00008218994,0.99765235,0.00007696337,0.00003113794,0.00035323843,0.000049638853,0.00016783144,0.00043552555],"genre_scores_gemma":[0.023723813,0.00010284247,0.97321963,0.000102578095,0.00008544866,0.0023816107,0.00012450668,0.00008963341,0.0001700327],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.6355671,0.27729884,0.021945398,0.019881198,0.043229107,0.0020784491],"domain_scores_gemma":[0.26398894,0.62777704,0.031344682,0.039254308,0.0363327,0.001302217],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3137946,0.002474973,0.0032275596,0.0127914585,0.0036082682,0.0042681657,0.008994936,0.00434158,0.004996895],"category_scores_gemma":[0.66430575,0.0023067938,0.0038974744,0.0079578115,0.006298745,0.007081587,0.0065880087,0.00793683,0.00228904],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007740678,0.00035168475,0.017661769,0.0016791597,0.0015594678,0.00049887475,0.006548977,0.023866387,0.0033534307,0.27150992,0.0066649,0.66553134],"study_design_scores_gemma":[0.00058680464,0.0011572525,0.019794693,0.0014940882,0.000978157,0.0014979638,0.0013148692,0.2538045,0.013575442,0.6868187,0.018306728,0.00067076896],"about_ca_topic_score_codex":0.0025975236,"about_ca_topic_score_gemma":0.0024075692,"teacher_disagreement_score":0.6862054,"about_ca_system_score_codex":0.0027285109,"about_ca_system_score_gemma":0.005126656,"threshold_uncertainty_score":0.8462134},"labels":[],"label_agreement":null},{"id":"W2022913092","doi":"10.1007/s11135-013-9919-0","title":"On the choice of measures of reliability and validity in the content-analysis of texts","year":2013,"lang":"en","type":"article","venue":"Quality & Quantity","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":61,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Reliability (semiconductor); Rhetorical question; Interpretation (philosophy); Reading comprehension; Complement (music); Reading (process); Kappa; Computer science; Measure (data warehouse); Content (measure theory); Psychology; Natural language processing; Content validity; Comprehension; Linguistics; Statistics; Social psychology; Cognitive psychology; Mathematics; Psychometrics; Data mining; Philosophy","score_opus":0.6107004055274742,"score_gpt":0.45660162382610464,"score_spread":0.15409878170136954,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2022913092","genre_codex":"methods","genre_gemma":"methods","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08002254,0.011890804,0.85046566,0.026995623,0.0010705246,0.0034296422,0.0010585455,0.0005415359,0.024525113],"genre_scores_gemma":[0.46108064,0.0032940032,0.52452266,0.002612823,0.00087725767,0.005605782,0.0005927028,0.00035728962,0.0010567965],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.3475615,0.5517341,0.035997637,0.014540157,0.048032332,0.0021342533],"domain_scores_gemma":[0.071137205,0.87970287,0.007860939,0.017089872,0.023207607,0.001001566],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.541793,0.002545875,0.008126822,0.01661878,0.0051503354,0.020903287,0.009393757,0.014587307,0.0020897374],"category_scores_gemma":[0.7980718,0.002844259,0.0052091456,0.01394614,0.025711529,0.026892982,0.010540254,0.014545096,0.0013305976],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0021858213,0.0006913263,0.02868072,0.004095567,0.0028428042,0.00041903535,0.018702412,0.0065667825,0.00353463,0.66924006,0.008258676,0.2547823],"study_design_scores_gemma":[0.0008728753,0.001227992,0.03435435,0.008274422,0.0011306629,0.0007761896,0.008267,0.06552855,0.0062478185,0.8629308,0.009479401,0.00090996816],"about_ca_topic_score_codex":0.004079759,"about_ca_topic_score_gemma":0.0047167414,"teacher_disagreement_score":0.458207,"about_ca_system_score_codex":0.009846215,"about_ca_system_score_gemma":0.012262019,"threshold_uncertainty_score":0.56505084},"labels":[],"label_agreement":null},{"id":"W2023293941","doi":"10.2190/iq.29.3.c","title":"High-Risk Patients' Readiness to Undergo BMD Testing for Osteoporosis Diagnosis in Pennsylvania","year":2009,"lang":"en","type":"article","venue":"International Quarterly of Community Health Education","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"National Institute of Arthritis and Musculoskeletal and Skin Diseases; Canadian Institutes of Health Research; U.S. Public Health Service","keywords":"Osteoporosis; Medicine; Psychological intervention; Bone mineral; Physical therapy; Randomized controlled trial; Summative assessment; Internal medicine; Psychology; Formative assessment","score_opus":0.12825880433268882,"score_gpt":0.4289646787318542,"score_spread":0.30070587439916535,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2023293941","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9989513,0.00008200707,0.00007528019,0.0002624712,0.0000024179262,0.000015130513,0.00006480232,0.0000029544753,0.00054360146],"genre_scores_gemma":[0.9996238,0.00004652633,0.00006870515,0.000084866486,0.0000031982765,0.000012154527,0.00007916645,5.5167664e-7,0.000081022416],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99948287,0.00018936594,0.000059810493,0.00006949555,0.000107297165,0.00009103691],"domain_scores_gemma":[0.997407,0.0009186768,0.0009383268,0.00005469259,0.00020509107,0.00047618165],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00050749024,0.00008222573,0.00020971906,0.0004251844,0.0005091269,0.0004947878,0.00019470933,0.0003891818,0.0021011203],"category_scores_gemma":[0.006163472,0.00017283701,0.000217113,0.00034621975,0.00022857357,0.00048711244,0.0004547247,0.0006262858,0.00020648015],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013606633,0.0002918398,0.98953575,0.000019129093,0.000018332556,0.0000717832,0.000405474,0.000053874817,0.00010027775,0.000041753177,0.00033927505,0.008986525],"study_design_scores_gemma":[0.000039797385,0.0006071152,0.9965934,0.00002214135,0.000025301462,0.00020068383,0.0011133765,0.00041148637,0.00012476486,0.0001274442,0.00072484516,0.000009619044],"about_ca_topic_score_codex":0.006950635,"about_ca_topic_score_gemma":0.009100565,"teacher_disagreement_score":0.006950635,"about_ca_system_score_codex":0.0004116446,"about_ca_system_score_gemma":0.00077389873,"threshold_uncertainty_score":0.01382035},"labels":[],"label_agreement":null},{"id":"W2030560722","doi":"10.1136/bmj.b4012","title":"Risk of bias versus quality assessment of randomised controlled trials: cross sectional study","year":2009,"lang":"en","type":"article","venue":"BMJ","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":345,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Jadad scale; Medicine; Kappa; Publication bias; Funnel plot; Sample size determination; Cohen's kappa; Statistics; Meta-analysis; Correlation; Relative risk; Internal medicine; Mathematics; Confidence interval","score_opus":0.553386919390064,"score_gpt":0.5654401656422524,"score_spread":0.012053246252188399,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2030560722","genre_codex":"review","genre_gemma":"empirical","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.027368743,0.70195293,0.17657278,0.006816653,0.008190444,0.066644855,0.0065945326,0.0007838161,0.0050751553],"genre_scores_gemma":[0.44355804,0.08471297,0.21605623,0.0077274046,0.0039069657,0.23896076,0.0033691088,0.0004740024,0.0012344477],"study_design_codex":"systematic_review","study_design_gemma":"observational","domain_scores_codex":[0.13440698,0.5255243,0.26352724,0.020299204,0.055048347,0.0011939718],"domain_scores_gemma":[0.072443016,0.708156,0.16469733,0.025208896,0.028318837,0.0011759304],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.62162554,0.003618134,0.018930169,0.019019455,0.0020668635,0.011122542,0.0048343195,0.009234565,0.005329171],"category_scores_gemma":[0.8567865,0.0029269073,0.027356619,0.018548092,0.006578136,0.012176076,0.0063338387,0.0055038873,0.0008179558],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.013940983,0.00022126785,0.059655912,0.51508796,0.27413046,0.00031076247,0.0028515414,0.0022162094,0.0008158575,0.0133719975,0.0058749756,0.11152202],"study_design_scores_gemma":[0.020218356,0.007683179,0.07802325,0.50227904,0.27340585,0.002998584,0.0019487008,0.016715195,0.0039221034,0.049545415,0.04221043,0.001049789],"about_ca_topic_score_codex":0.0018476519,"about_ca_topic_score_gemma":0.0018713493,"teacher_disagreement_score":0.37837446,"about_ca_system_score_codex":0.010633135,"about_ca_system_score_gemma":0.013354653,"threshold_uncertainty_score":0.4666031},"labels":[],"label_agreement":null},{"id":"W2032172756","doi":"10.1016/j.ygyno.2007.07.064","title":"p16 and MIB1 improve the sensitivity and specificity of the diagnosis of high grade squamous intraepithelial lesions: Methodological issues in a report of 447 biopsies with consensus diagnosis and HPV HCII testing","year":2007,"lang":"en","type":"article","venue":"Gynecologic Oncology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":34,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Vancouver General Hospital; BC Cancer Agency","funders":"National Cancer Institute","keywords":"Medicine; Grading (engineering); Biopsy; Pathology; Atypia; Intraepithelial neoplasia; Internal medicine; Cancer; Biology","score_opus":0.2530757024059997,"score_gpt":0.41026272798023233,"score_spread":0.15718702557423264,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2032172756","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9845361,0.0038555553,0.008326978,0.00029049104,0.000122028134,0.00028986807,0.00024802837,0.000026491323,0.0023044823],"genre_scores_gemma":[0.9948856,0.00021933795,0.004223004,0.000114074064,0.00003725942,0.000099066085,0.00018835366,0.0000214234,0.00021191598],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.8524094,0.10438451,0.014283462,0.0070758117,0.019581538,0.0022652887],"domain_scores_gemma":[0.70310235,0.22242701,0.01506753,0.026068311,0.03219316,0.0011416111],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.11474821,0.00076402037,0.0016119857,0.0025080387,0.0015362252,0.0023519201,0.0026854442,0.0016910697,0.00056865776],"category_scores_gemma":[0.20979936,0.0014908946,0.002211538,0.0021535512,0.0023740116,0.001015224,0.0018416072,0.0013716135,0.0003188076],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0022004547,0.00022757956,0.95351475,0.0005337234,0.0039167516,0.0002681425,0.0050046165,0.00093947904,0.0033741416,0.00037131133,0.00053027924,0.029118795],"study_design_scores_gemma":[0.00019872468,0.0014354783,0.9690447,0.00019902359,0.0036551168,0.0016003742,0.0022484036,0.0044805557,0.013292385,0.0006609037,0.003101352,0.00008303408],"about_ca_topic_score_codex":0.008168779,"about_ca_topic_score_gemma":0.015445894,"teacher_disagreement_score":0.11474821,"about_ca_system_score_codex":0.0013331922,"about_ca_system_score_gemma":0.0012775328,"threshold_uncertainty_score":0.6068538},"labels":[],"label_agreement":null},{"id":"W2036060563","doi":"10.1186/1471-2288-10-82","title":"Inter-rater agreement and reliability of the COSMIN (COnsensus-based Standards for the selection of health status Measurement Instruments) Checklist","year":2010,"lang":"en","type":"article","venue":"BMC Medical Research Methodology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":289,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"Vrije Universiteit Amsterdam; University of Oxford; McMaster University; Goddard Space Flight Center; University of Washington","keywords":"Checklist; Kappa; Inter-rater reliability; Intraclass correlation; Cohen's kappa; Reliability (semiconductor); Medicine; Quality (philosophy); Agreement; Terminology; Psychology; Applied psychology; Physical therapy; Medical physics; Clinical psychology; Statistics; Psychometrics; Rating scale; Mathematics","score_opus":0.5948043968788056,"score_gpt":0.5666070490965269,"score_spread":0.02819734778227867,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2036060563","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.593768,0.045159806,0.24682477,0.0033928805,0.0031500857,0.071436144,0.012320443,0.0012210748,0.022726713],"genre_scores_gemma":[0.68431085,0.0052682725,0.2060467,0.0005434036,0.0004476904,0.09748134,0.004410341,0.0004011316,0.0010902302],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.46156764,0.30503738,0.15896235,0.014724022,0.05723077,0.002477792],"domain_scores_gemma":[0.2919052,0.3872869,0.0759158,0.034280926,0.20799394,0.002617242],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.4358364,0.0014457309,0.0049073845,0.019609878,0.0025090396,0.0037997316,0.002722132,0.001870401,0.0022733049],"category_scores_gemma":[0.5637624,0.0013027056,0.0067657377,0.010496032,0.0029579941,0.0033464835,0.0063720364,0.0016664863,0.0006816107],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00883135,0.00074159255,0.41607475,0.081384026,0.019585747,0.0009746623,0.076981224,0.004196166,0.014369226,0.00642896,0.024009114,0.34642318],"study_design_scores_gemma":[0.0056217923,0.005573693,0.730319,0.06042423,0.02111987,0.002687831,0.029449403,0.028869884,0.023522645,0.014359289,0.07632324,0.0017291297],"about_ca_topic_score_codex":0.0019776612,"about_ca_topic_score_gemma":0.0034994557,"teacher_disagreement_score":0.56416357,"about_ca_system_score_codex":0.003326969,"about_ca_system_score_gemma":0.007912249,"threshold_uncertainty_score":0.6957142},"labels":[],"label_agreement":null},{"id":"W2040932637","doi":"10.1002/bimj.200310154","title":"A Non-iterative Confidence Interval Estimating Procedure for the Intraclass Kappa Statistic with Multinomial Outcomes","year":2005,"lang":"en","type":"article","venue":"Biometrical Journal","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Cancer Care Ontario; Western University; Robarts Clinical Trials","funders":"","keywords":"Multinomial distribution; Confidence interval; Statistics; Mathematics; Statistic; Intraclass correlation; Interval estimation; Sample size determination; Kappa; Interval (graph theory); Combinatorics; Reproducibility","score_opus":0.140185236435446,"score_gpt":0.4138179222094404,"score_spread":0.2736326857739944,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2040932637","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0013778091,0.000041867723,0.9980709,0.000021069343,0.000009839375,0.000051821367,0.00001848317,0.00017118681,0.00023714],"genre_scores_gemma":[0.03542619,0.000088183064,0.9634065,0.00002817648,0.000023461105,0.00039580237,0.00010177054,0.00011723709,0.00041275602],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.97663385,0.0140264295,0.0014069165,0.0021617275,0.0054454203,0.00032576566],"domain_scores_gemma":[0.92223126,0.0550121,0.0058286358,0.008267126,0.008281621,0.00037925554],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.024032058,0.0012780458,0.0018245433,0.0038660949,0.00071404094,0.0017655569,0.003381568,0.0014639986,0.0036941008],"category_scores_gemma":[0.16031936,0.00072731636,0.002374146,0.002791342,0.0017211968,0.002037916,0.0031789383,0.0029338303,0.0018906279],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00033077653,0.000289433,0.010264609,0.0011300071,0.0007712632,0.0004700877,0.0016460639,0.06884271,0.0134741925,0.09962608,0.0029803137,0.8001745],"study_design_scores_gemma":[0.00018648917,0.00066064595,0.014009008,0.00044740026,0.00045666914,0.0024395194,0.00024757927,0.79892564,0.02042461,0.15427507,0.0075114835,0.00041593245],"about_ca_topic_score_codex":0.0015774552,"about_ca_topic_score_gemma":0.001656022,"teacher_disagreement_score":0.024032058,"about_ca_system_score_codex":0.00066933676,"about_ca_system_score_gemma":0.002315125,"threshold_uncertainty_score":0.12709516},"labels":[],"label_agreement":null},{"id":"W2042490722","doi":"10.1179/2042618611y.0000000001","title":"Clinician’s ability to identify neck and low back interventions: an inter-rater chance-corrected agreement pilot study","year":2011,"lang":"en","type":"article","venue":"Journal of Manual & Manipulative Therapy","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":17,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"U.S. Air Force; McGill University","keywords":"Medicine; Psychological intervention; Physical therapy; Physical medicine and rehabilitation; Agreement; Nursing","score_opus":0.5696956122938136,"score_gpt":0.500385077475087,"score_spread":0.06931053481872662,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2042490722","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.97134644,0.0004766486,0.022489598,0.00009500357,0.00011100552,0.0013479076,0.0003335704,0.00008621093,0.0037136443],"genre_scores_gemma":[0.99009526,0.00007086412,0.008544993,0.00003315897,0.000023043276,0.00070304936,0.0001589763,0.000042698335,0.00032787552],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.82231724,0.11270582,0.02363596,0.012762535,0.026279494,0.002298888],"domain_scores_gemma":[0.5218907,0.33064544,0.038090836,0.031290166,0.075885616,0.0021972372],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.15779665,0.00067396404,0.0014280275,0.0022479969,0.0014364696,0.0016193482,0.0013883025,0.0011103326,0.0015663137],"category_scores_gemma":[0.26975635,0.00090493157,0.001889232,0.0013261518,0.002692914,0.0023587942,0.003327815,0.0011131836,0.0008019361],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005311239,0.0011958372,0.8632927,0.0012050979,0.002410192,0.00027231118,0.045236636,0.001899886,0.007006094,0.0007289347,0.001275551,0.07016555],"study_design_scores_gemma":[0.0005257445,0.007986798,0.94330865,0.00049119315,0.0008346143,0.00121972,0.009559046,0.019146234,0.011529046,0.0009803736,0.0041195597,0.00029913793],"about_ca_topic_score_codex":0.0015784642,"about_ca_topic_score_gemma":0.0025634018,"teacher_disagreement_score":0.15779665,"about_ca_system_score_codex":0.0014061615,"about_ca_system_score_gemma":0.0014824471,"threshold_uncertainty_score":0.83451843},"labels":[],"label_agreement":null},{"id":"W2043640852","doi":"10.1177/0962280213476771","title":"Adjusted inference procedures for the interobserver agreement in twin studies","year":2013,"lang":"en","type":"article","venue":"Statistical Methods in Medical Research","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"London Health Sciences Centre; Western University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Inference; Statistics; Confidence interval; Statistic; Statistical inference; Computer science; Interval estimation; Statistical hypothesis testing; Multiple comparisons problem; Sample size determination; Cohen's kappa; Kappa; Test statistic; Mathematics; Econometrics; Artificial intelligence","score_opus":0.7237431735697322,"score_gpt":0.680536609079811,"score_spread":0.04320656448992122,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2043640852","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.002697601,0.00020090704,0.99619305,0.00013641558,0.000057238354,0.00023023652,0.0000721874,0.00011921969,0.00029313038],"genre_scores_gemma":[0.07640016,0.00023638892,0.9200612,0.00024106551,0.00011196901,0.0022378163,0.00020222153,0.00012033332,0.00038889513],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.6816028,0.27025083,0.012921299,0.014525209,0.019100292,0.0015995362],"domain_scores_gemma":[0.44314638,0.4775779,0.025562156,0.03273526,0.019927904,0.0010503861],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.22018185,0.0021112796,0.0026359414,0.007130882,0.0017806405,0.0035204599,0.00815326,0.0035016444,0.003808378],"category_scores_gemma":[0.59241533,0.0017728937,0.00402411,0.0053324937,0.0040300256,0.004574472,0.0048681614,0.0055999854,0.00082688534],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012375987,0.00027850296,0.025765657,0.0015074945,0.0039416,0.0007785505,0.00521817,0.07991679,0.0031586825,0.44608572,0.0056153093,0.4264959],"study_design_scores_gemma":[0.00037980042,0.0006783034,0.015387489,0.0006237803,0.0011495007,0.0008342451,0.0003608482,0.2733393,0.0047491356,0.6937298,0.008364179,0.00040357813],"about_ca_topic_score_codex":0.003511355,"about_ca_topic_score_gemma":0.0025556874,"teacher_disagreement_score":0.7798182,"about_ca_system_score_codex":0.0024465478,"about_ca_system_score_gemma":0.0034915444,"threshold_uncertainty_score":0.9616546},"labels":[],"label_agreement":null},{"id":"W2044059462","doi":"10.1097/acm.0b013e31822a6cf8","title":"Rater-Based Assessments as Social Judgments: Rethinking the Etiology of Rater Errors","year":2011,"lang":"en","type":"review","venue":"Academic Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":194,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Northern British Columbia","funders":"","keywords":"Categorical variable; Psychology; Categorization; Impression formation; Inter-rater reliability; Social psychology; Construct (python library); Cognitive psychology; Social perception; Rating scale; Computer science; Perception; Developmental psychology; Artificial intelligence; Machine learning","score_opus":0.6437870321086094,"score_gpt":0.5584685302281239,"score_spread":0.08531850188048551,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2044059462","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0067534423,0.8852514,0.076875485,0.020482052,0.0026513543,0.00051418826,0.00017086526,0.00015415456,0.0071470262],"genre_scores_gemma":[0.23063146,0.64926916,0.10260734,0.008568697,0.0045999824,0.0016911032,0.0002520228,0.00033495805,0.0020452703],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.50927347,0.32415104,0.03881156,0.015142603,0.111525565,0.0010956745],"domain_scores_gemma":[0.15632275,0.7026173,0.042905647,0.024607444,0.07292757,0.00061935885],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.45116726,0.0016386549,0.004595663,0.010046392,0.0013546887,0.009585964,0.007055001,0.002789495,0.0012698221],"category_scores_gemma":[0.65041345,0.0016431764,0.0021546101,0.01178842,0.012183265,0.013089511,0.0044052796,0.0062703094,0.000987304],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00016273587,0.000051040322,0.014415477,0.032526627,0.0017756703,0.0002440347,0.01555455,0.0010027359,0.0008672102,0.056994416,0.01273462,0.8636709],"study_design_scores_gemma":[0.0002632595,0.0008635504,0.10420983,0.18028101,0.0054615242,0.0045430353,0.015459385,0.013326012,0.008862281,0.23530386,0.43033403,0.0010921543],"about_ca_topic_score_codex":0.0042724092,"about_ca_topic_score_gemma":0.0058212155,"teacher_disagreement_score":0.5488328,"about_ca_system_score_codex":0.006037916,"about_ca_system_score_gemma":0.009083715,"threshold_uncertainty_score":0.6768085},"labels":[],"label_agreement":null},{"id":"W2044481915","doi":"10.1038/modpathol.3800496","title":"Interobserver agreement and reproducibility in classification of invasive breast carcinoma: an NCI breast cancer family registry study","year":2005,"lang":"en","type":"article","venue":"Modern Pathology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":116,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Mount Sinai Hospital; University of Toronto; Jewish General Hospital; Statistics Canada","funders":"National Cancer Institute; National Institutes of Health; National Institute of Informatics","keywords":"Medicine; Reproducibility; Breast cancer; Pathology; Breast carcinoma; Cancer registry; Cancer; Oncology; Radiology; Internal medicine; Epidemiology","score_opus":0.18480263545995282,"score_gpt":0.37383187807648444,"score_spread":0.18902924261653162,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2044481915","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99756336,0.0002084222,0.001180308,0.000024444167,0.000015739413,0.0000415732,0.00016552827,0.000016554775,0.0007840921],"genre_scores_gemma":[0.9990483,0.000034915243,0.0006162337,0.000011660405,0.000009251821,0.000034550554,0.00016403077,0.000009422761,0.00007152803],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9618706,0.023943609,0.0035274085,0.0030788176,0.0066064745,0.0009731456],"domain_scores_gemma":[0.90883946,0.05273433,0.009896713,0.013740672,0.013781927,0.0010069705],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.033752963,0.000408019,0.00081323995,0.0022340051,0.0011130632,0.0010675972,0.001532056,0.00095783314,0.00040547329],"category_scores_gemma":[0.08315826,0.00061029504,0.0009523365,0.0014927442,0.0012532173,0.0014495538,0.0015636896,0.00068658224,0.0002700154],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002803385,0.00005571851,0.99541605,0.000015857224,0.00018331823,0.000056932335,0.00095399475,0.00017214274,0.00025106073,0.000043099884,0.0001103156,0.002461069],"study_design_scores_gemma":[0.00002486232,0.00016402233,0.9962748,0.000009274984,0.0001941556,0.0003033985,0.00067040394,0.0015728868,0.00046330408,0.000064658474,0.00024173726,0.000016579655],"about_ca_topic_score_codex":0.010563574,"about_ca_topic_score_gemma":0.0114617115,"teacher_disagreement_score":0.033752963,"about_ca_system_score_codex":0.0012941967,"about_ca_system_score_gemma":0.0009842607,"threshold_uncertainty_score":0.17850488},"labels":[],"label_agreement":null},{"id":"W2050257625","doi":"10.1016/j.jclinepi.2007.10.023","title":"Reliability studies of diagnostic tests are not using enough observers for robust estimation of interobserver agreement: a simulation study","year":2008,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":14,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Centre for Advancing Health Outcomes; University of British Columbia","funders":"","keywords":"Kappa; Reliability (semiconductor); Statistics; Sample (material); Variance (accounting); Cohen's kappa; Sample size determination; Variation (astronomy); Inter-rater reliability; Computer science; Population; Variable (mathematics); Econometrics; Mathematics; Medicine","score_opus":0.8782298280510391,"score_gpt":0.620131203012851,"score_spread":0.25809862503818815,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2050257625","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.81857616,0.0022025625,0.17200167,0.0020438149,0.00010798652,0.0011583865,0.0007253797,0.00020056672,0.002983468],"genre_scores_gemma":[0.96078193,0.00017434997,0.03788208,0.00024144122,0.000025603147,0.00041936617,0.00024228566,0.000040265197,0.00019264672],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8176178,0.16591391,0.005223185,0.0053504743,0.00445891,0.0014356631],"domain_scores_gemma":[0.09345365,0.8675121,0.012439329,0.018133106,0.0076266252,0.00083514815],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.21973309,0.0018054303,0.0032474834,0.0018856236,0.0016938782,0.003012965,0.0035882147,0.005777923,0.0020722265],"category_scores_gemma":[0.4984232,0.002159695,0.006172688,0.001676774,0.0042833183,0.00503096,0.0027013833,0.0044462876,0.00045884863],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.015152468,0.0033972007,0.17332225,0.0018565606,0.008936201,0.0013361367,0.004718181,0.696141,0.0022505536,0.032952722,0.004493288,0.055443395],"study_design_scores_gemma":[0.0028554501,0.0049009253,0.031028664,0.0005103405,0.0038713631,0.001308214,0.0009082451,0.9119822,0.0022722234,0.03829945,0.0017417237,0.00032124764],"about_ca_topic_score_codex":0.011615063,"about_ca_topic_score_gemma":0.007295201,"teacher_disagreement_score":0.7802669,"about_ca_system_score_codex":0.003371228,"about_ca_system_score_gemma":0.0028474445,"threshold_uncertainty_score":0.96220803},"labels":[],"label_agreement":null},{"id":"W2053630609","doi":"10.1097/ede.0b013e318207fc5c","title":"Adjusting for Differential-verification Bias in Diagnostic-accuracy Studies","year":2011,"lang":"en","type":"article","venue":"Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":34,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Test (biology); Computer science; Statistics; Bayesian probability; Reference values; Population; Data mining; Medicine; Mathematics; Internal medicine","score_opus":0.8295205122545626,"score_gpt":0.5205216194963798,"score_spread":0.3089988927581828,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2053630609","genre_codex":"methods","genre_gemma":"methods","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.14875408,0.00832032,0.83116215,0.0030471974,0.0010208352,0.0022448148,0.0006696984,0.00057624956,0.004204643],"genre_scores_gemma":[0.81930363,0.00047562688,0.17640415,0.0009882394,0.00026761286,0.001616201,0.00029242027,0.00008944651,0.0005626417],"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.30872878,0.5972304,0.036294285,0.030487167,0.02430315,0.0029562984],"domain_scores_gemma":[0.19655474,0.6702916,0.04657761,0.07152587,0.01401719,0.0010330045],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.4705516,0.0018769965,0.0031345286,0.0041557285,0.0019989375,0.0037633732,0.0048817536,0.0045356983,0.0012392263],"category_scores_gemma":[0.745207,0.0017510185,0.005259086,0.005923419,0.00510626,0.005159873,0.0061670975,0.0045821522,0.00028617855],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.004439865,0.00026226437,0.6131091,0.0035306104,0.026686171,0.00081368693,0.007399426,0.017895898,0.002814966,0.07950967,0.0029526823,0.24058563],"study_design_scores_gemma":[0.002391186,0.0043865717,0.33985516,0.0029559436,0.019562107,0.0026639341,0.0014953316,0.171374,0.019128693,0.4114703,0.024001265,0.0007155199],"about_ca_topic_score_codex":0.005027822,"about_ca_topic_score_gemma":0.0034337721,"teacher_disagreement_score":0.5294484,"about_ca_system_score_codex":0.003318221,"about_ca_system_score_gemma":0.0038461466,"threshold_uncertainty_score":0.65290415},"labels":[],"label_agreement":null},{"id":"W2055948452","doi":"10.1016/j.jmpt.2006.06.009","title":"Applying Generalizability Theory to High-Stakes Objective Structured Clinical Examinations in a Naturalistic Environment","year":2006,"lang":"en","type":"article","venue":"Journal of Manipulative and Physiological Therapeutics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":23,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Calgary","funders":"","keywords":"Generalizability theory; Cronbach's alpha; Medicine; Variance (accounting); Chiropractic; Checklist; Objective structured clinical examination; Reliability (semiconductor); Conceptualization; Licensure; Statistics; Applied psychology; Medical education; Clinical psychology; Psychology; Psychometrics; Alternative medicine; Mathematics; Computer science; Cognitive psychology","score_opus":0.5803482065378721,"score_gpt":0.4441747944179522,"score_spread":0.1361734121199199,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2055948452","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.40305495,0.0010866661,0.55996275,0.004235566,0.0004213472,0.0061989375,0.00016779643,0.0004202771,0.02445168],"genre_scores_gemma":[0.9332202,0.00023986705,0.062257327,0.00063068303,0.00013786704,0.0030130385,0.00010883033,0.00006426142,0.00032792237],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.7574085,0.20088376,0.0059567997,0.012968287,0.02102618,0.0017564608],"domain_scores_gemma":[0.4395238,0.4790401,0.017764648,0.04549357,0.016788268,0.0013897007],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.21078116,0.0013407398,0.0019062319,0.0051716794,0.0027939088,0.0045070597,0.0025884607,0.0018298362,0.0022568924],"category_scores_gemma":[0.4254122,0.0010762116,0.0039050165,0.0029470215,0.011768933,0.0059680603,0.0062953825,0.0037151405,0.00028781727],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009249594,0.0015142593,0.552786,0.0025080151,0.0042795925,0.000765237,0.050269395,0.022581438,0.003152011,0.095849045,0.0025095989,0.26286045],"study_design_scores_gemma":[0.0007719585,0.006511267,0.4508426,0.0027836727,0.0020319058,0.0012441705,0.02332197,0.12756227,0.0041898014,0.3701667,0.010139546,0.00043419268],"about_ca_topic_score_codex":0.0075896434,"about_ca_topic_score_gemma":0.006051123,"teacher_disagreement_score":0.21078116,"about_ca_system_score_codex":0.00657574,"about_ca_system_score_gemma":0.0068231113,"threshold_uncertainty_score":0.97324735},"labels":[],"label_agreement":null},{"id":"W2056109249","doi":"10.1080/00016470412331294445","title":"How reliable are reliability studies of fracture classifications?A systematic review of their methodologies","year":2004,"lang":"en","type":"review","venue":"Acta Orthopaedica Scandinavica","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":184,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Health Sciences Centre; McMaster University Medical Centre","funders":"","keywords":"Checklist; Medicine; Reliability (semiconductor); Kappa; Cohen's kappa; MEDLINE; Statistics; Sample size determination; Medical physics; Data mining; Computer science; Mathematics; Psychology; Cognitive psychology","score_opus":0.37890643944898705,"score_gpt":0.46675751809186394,"score_spread":0.08785107864287689,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2056109249","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0019605805,0.9918207,0.0028244515,0.00093672023,0.0002908053,0.0012588293,0.00044911698,0.00002289672,0.00043592724],"genre_scores_gemma":[0.046897586,0.9183223,0.02430459,0.00088199833,0.0003143168,0.008404923,0.00064472156,0.000036205234,0.00019320077],"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","domain_scores_codex":[0.73967004,0.13090175,0.0949955,0.007031734,0.026326092,0.0010749266],"domain_scores_gemma":[0.3918552,0.49474055,0.059633683,0.011064198,0.04152505,0.0011812842],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2000522,0.002455302,0.013327474,0.042958032,0.0015323106,0.006696551,0.004301916,0.003177488,0.0023486586],"category_scores_gemma":[0.56756103,0.003434378,0.009043014,0.03072335,0.0040069977,0.0070645083,0.0031927377,0.0018512999,0.0004981706],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003178183,0.000025578145,0.003968664,0.8149716,0.0104904,0.00015237452,0.0012549273,0.00016785592,0.00022965447,0.0009109087,0.0020165995,0.16549356],"study_design_scores_gemma":[0.00039260197,0.00031692768,0.011461306,0.91199136,0.04849047,0.00065462774,0.0014886776,0.00026444613,0.00043302725,0.00225651,0.022142094,0.00010793456],"about_ca_topic_score_codex":0.0061854464,"about_ca_topic_score_gemma":0.014924923,"teacher_disagreement_score":0.7999478,"about_ca_system_score_codex":0.00899259,"about_ca_system_score_gemma":0.01943693,"threshold_uncertainty_score":0.98647803},"labels":[],"label_agreement":null},{"id":"W2060814138","doi":"10.1159/000054764","title":"Statistical versus Fuzzy Measures of Variable Interaction in Patients with Stroke","year":2001,"lang":"en","type":"article","venue":"Neuroepidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":29,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Spearman's rank correlation coefficient; Statistics; Variable (mathematics); Medicine; Correlation; Rank correlation; Variables; Fuzzy logic; Mathematics; Artificial intelligence; Computer science","score_opus":0.21595298442250044,"score_gpt":0.38740726112740365,"score_spread":0.1714542767049032,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2060814138","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99571675,0.00037939136,0.002444254,0.00017861079,0.000017003895,0.000023162398,0.00022626802,0.000015728912,0.0009988132],"genre_scores_gemma":[0.999006,0.000039833547,0.0007646779,0.000019738112,0.000017466815,0.000017102713,0.000105056366,0.000001243509,0.000028900615],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9948421,0.0018589062,0.00087224157,0.00056432415,0.0016818774,0.00018056692],"domain_scores_gemma":[0.9664414,0.021557255,0.0087570865,0.001318725,0.0014043351,0.000521214],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004699512,0.00032731396,0.00045007805,0.0023073326,0.000406816,0.0008876294,0.00045983598,0.00079896935,0.0019836673],"category_scores_gemma":[0.030604713,0.00011253233,0.0003529916,0.0015777488,0.0012326004,0.0007527629,0.0007696358,0.00044378667,0.00022382512],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0034616857,0.00019457468,0.9361527,0.00027447802,0.00041869425,0.00042040035,0.00112796,0.0040835394,0.0020560946,0.00062870595,0.0004906389,0.050690673],"study_design_scores_gemma":[0.000056104556,0.0016468619,0.982872,0.0000438991,0.00017268093,0.0014956116,0.0008161791,0.008131599,0.0023509264,0.0018180894,0.00054183864,0.000054270226],"about_ca_topic_score_codex":0.00039020064,"about_ca_topic_score_gemma":0.00046905407,"teacher_disagreement_score":0.004699512,"about_ca_system_score_codex":0.0005978392,"about_ca_system_score_gemma":0.0003046897,"threshold_uncertainty_score":0.024853706},"labels":[],"label_agreement":null},{"id":"W2060998495","doi":"10.1002/cjs.10103","title":"Planning and analysis of measurement reliability studies","year":2011,"lang":"en","type":"article","venue":"Canadian Journal of Statistics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":true,"ca_institutions":"University of Guelph; University of Waterloo","funders":"","keywords":"Reliability (semiconductor); Plan (archaeology); Measure (data warehouse); Mathematics; Statistics; Humanities; Computer science; Geography; Philosophy; Data mining; Physics","score_opus":0.4922490454234743,"score_gpt":0.3848306343614787,"score_spread":0.10741841106199562,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2060998495","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.004654511,0.0007704886,0.9338197,0.00097060157,0.0003132311,0.052763842,0.0014033834,0.0011071783,0.0041970257],"genre_scores_gemma":[0.02250169,0.00033699177,0.8897849,0.00020622794,0.00012753042,0.08548353,0.0007767293,0.00016623794,0.0006161898],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.6048892,0.31814563,0.023479078,0.0140415775,0.03612816,0.0033162863],"domain_scores_gemma":[0.31132415,0.5189097,0.0236549,0.06344192,0.08033998,0.0023293283],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.38316786,0.0043591815,0.0053991405,0.013664013,0.0023513886,0.006678092,0.0077652014,0.003094756,0.011303875],"category_scores_gemma":[0.5811241,0.0034068904,0.0076909475,0.010311501,0.0035490924,0.0057687894,0.0056877485,0.009379835,0.0035261484],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0036455628,0.00088232127,0.009514437,0.012433787,0.0024143474,0.0007838702,0.0071279043,0.06524113,0.0053051272,0.1413011,0.033690512,0.71765995],"study_design_scores_gemma":[0.0041914536,0.010270336,0.03160004,0.008015593,0.004380006,0.0007643271,0.008269992,0.29966062,0.029652832,0.3620344,0.23992771,0.0012326647],"about_ca_topic_score_codex":0.005903218,"about_ca_topic_score_gemma":0.0041352347,"teacher_disagreement_score":0.61683214,"about_ca_system_score_codex":0.008568103,"about_ca_system_score_gemma":0.026739744,"threshold_uncertainty_score":0.76066387},"labels":[],"label_agreement":null},{"id":"W2061141931","doi":"10.1007/s10459-010-9222-y","title":"Likert scales, levels of measurement and the “laws” of statistics","year":2010,"lang":"en","type":"article","venue":"Advances in Health Sciences Education","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":4546,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Likert scale; Statistics; Parametric statistics; Econometrics; Nonparametric statistics; Variance (accounting); Regression analysis; Sample size determination; Sample (material); Ordinal data; Statistical analysis; Computer science; Psychology; Mathematics","score_opus":0.1216247962799418,"score_gpt":0.4436029242752067,"score_spread":0.32197812799526493,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2061141931","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.104268156,0.0069663445,0.76008236,0.020957718,0.0023080588,0.001872503,0.0018302371,0.0007908837,0.10092376],"genre_scores_gemma":[0.7165388,0.0020549772,0.27113762,0.003053043,0.00058385916,0.0033940354,0.00063127215,0.00012077938,0.0024855626],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.78315264,0.17184281,0.013856587,0.0043559102,0.025615234,0.0011767566],"domain_scores_gemma":[0.51115996,0.43331558,0.0142828915,0.019392256,0.020244317,0.0016050662],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.09862829,0.00054577633,0.0010713408,0.0032562949,0.0012010547,0.0051282546,0.001863377,0.0021529992,0.0042641726],"category_scores_gemma":[0.3936297,0.0005765502,0.00084259297,0.004296727,0.007670559,0.008620849,0.0030457056,0.0039332076,0.000777861],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00042864407,0.00023789973,0.02506026,0.0019255513,0.00034705055,0.00008364552,0.013286289,0.00198155,0.0016475352,0.7046926,0.015079578,0.23522934],"study_design_scores_gemma":[0.00014635078,0.0005302309,0.04073496,0.0014026092,0.00017649334,0.0003353602,0.00882857,0.009856705,0.0017221583,0.8765599,0.059436947,0.0002698058],"about_ca_topic_score_codex":0.00070031086,"about_ca_topic_score_gemma":0.00081460684,"teacher_disagreement_score":0.9013717,"about_ca_system_score_codex":0.001994183,"about_ca_system_score_gemma":0.0022026938,"threshold_uncertainty_score":0.5216025},"labels":[],"label_agreement":null},{"id":"W2065426364","doi":"10.1159/000054768","title":"Reliability of Information Collected by Proxy in Family Studies of Alzheimer’s Disease","year":2001,"lang":"en","type":"article","venue":"Neuroepidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":32,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"National Institute on Aging; National Institutes of Health","keywords":"Proxy (statistics); Intraclass correlation; Medicine; Cohen's kappa; Kappa; Epidemiology; Reliability (semiconductor); Statistic; Gerontology; Demography; Clinical psychology; Statistics; Psychometrics; Internal medicine","score_opus":0.22839435769597524,"score_gpt":0.41856244089106565,"score_spread":0.1901680831950904,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2065426364","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9912788,0.0015696232,0.004357564,0.00024999437,0.00005743874,0.00010453926,0.00052417937,0.00002085814,0.0018369533],"genre_scores_gemma":[0.99749005,0.0003358095,0.0015643268,0.00004704611,0.000016436927,0.000071971444,0.00035708575,0.0000041119724,0.00011313264],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.8998145,0.08447391,0.0063462146,0.0027600161,0.0056266882,0.0009787397],"domain_scores_gemma":[0.8049985,0.13104577,0.02788855,0.014108826,0.020255007,0.0017032911],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.04597795,0.00038608382,0.00078017486,0.0029901012,0.0006011904,0.0011750686,0.0005325333,0.00048890687,0.00048320263],"category_scores_gemma":[0.20303333,0.00029003806,0.000559352,0.002590685,0.001016066,0.000838463,0.0016394273,0.00050031726,0.0001687002],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027320863,0.000038321454,0.97465456,0.00014423193,0.00021503205,0.0001399403,0.0066258386,0.00021693301,0.0001709673,0.0001576583,0.00028133925,0.017082008],"study_design_scores_gemma":[0.000056955385,0.00066582987,0.97847295,0.00048705068,0.00025473395,0.0013223405,0.009505791,0.0030976327,0.0016591419,0.0009639025,0.0034407524,0.00007297109],"about_ca_topic_score_codex":0.003550626,"about_ca_topic_score_gemma":0.0030188907,"teacher_disagreement_score":0.95402205,"about_ca_system_score_codex":0.0006420026,"about_ca_system_score_gemma":0.00078264595,"threshold_uncertainty_score":0.24315757},"labels":[],"label_agreement":null},{"id":"W2066581144","doi":"10.1002/sim.2546","title":"Bivariate models for co‐aggregation of dichotomous traits in twins","year":2006,"lang":"en","type":"article","venue":"Statistics in Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Bivariate analysis; Twin study; Correlation; Dizygotic twin; Trait; Statistics; Similarity (geometry); Econometrics; Dizygotic twins; Population; Genetic correlation; Monozygotic twin; Psychology; Heritability; Mathematics; Demography; Biology; Computer science; Medicine; Genetics; Genetic variation; Artificial intelligence","score_opus":0.13561655662648225,"score_gpt":0.4075748772475037,"score_spread":0.27195832062102143,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2066581144","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12290319,0.0017908494,0.86464787,0.0020375496,0.00039078947,0.000621673,0.0023455275,0.0004880384,0.0047745327],"genre_scores_gemma":[0.78744364,0.0031690889,0.17929514,0.00044675617,0.00056634273,0.0035041138,0.0035362644,0.0002093948,0.021829283],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.97543406,0.018199915,0.00096694764,0.0024245135,0.001609945,0.0013646679],"domain_scores_gemma":[0.91889894,0.06363723,0.006030258,0.0065647285,0.0034957682,0.0013730734],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04060368,0.0021568134,0.004255789,0.0038689903,0.0014687938,0.0036373413,0.0060120304,0.0033332186,0.009657776],"category_scores_gemma":[0.07732524,0.0016932946,0.0036856756,0.0046132538,0.0034864428,0.003299774,0.0049484274,0.0046066255,0.0020767644],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007396013,0.0003271084,0.0475716,0.00029931997,0.0016166078,0.0012621561,0.0023627193,0.27810195,0.00053020933,0.6239213,0.0048925406,0.038374793],"study_design_scores_gemma":[0.00010671445,0.00017484145,0.0056819767,0.000121968704,0.00028358572,0.00021805736,0.00022182311,0.8257619,0.00013159229,0.16417705,0.0030248913,0.00009554024],"about_ca_topic_score_codex":0.02010086,"about_ca_topic_score_gemma":0.009987945,"teacher_disagreement_score":0.04060368,"about_ca_system_score_codex":0.0020746961,"about_ca_system_score_gemma":0.0021329161,"threshold_uncertainty_score":0.21473539},"labels":[],"label_agreement":null},{"id":"W2069378996","doi":"10.1016/j.jclinepi.2010.03.002","title":"Guidelines for Reporting Reliability and Agreement Studies (GRRAS) were proposed","year":2010,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":2097,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto; Western University","funders":"","keywords":"Reliability (semiconductor); Psychology; Medicine; Statistics; Mathematics; Physics","score_opus":0.8672390330587612,"score_gpt":0.6777059197779776,"score_spread":0.1895331132807836,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2069378996","genre_codex":"methods","genre_gemma":"methods","domain_codex":"methods","domain_gemma":"reporting","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"reporting","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008679581,0.028317805,0.8864473,0.013024867,0.006034357,0.032827135,0.008899582,0.0024121043,0.013357301],"genre_scores_gemma":[0.038784634,0.005470316,0.90037864,0.002869799,0.0007234478,0.047223374,0.0030084858,0.00037969617,0.0011616137],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.23889215,0.41325545,0.28336248,0.011674399,0.04961578,0.0031997142],"domain_scores_gemma":[0.11153232,0.6467489,0.04612198,0.051069885,0.14312401,0.0014029358],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.5299764,0.0045304443,0.0069441963,0.027285682,0.0062225075,0.013965932,0.011395303,0.011201113,0.0042085736],"category_scores_gemma":[0.80961424,0.0043559996,0.012833043,0.022976873,0.008835133,0.011413711,0.010732621,0.013537216,0.0036469013],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001514506,0.00047692162,0.045731362,0.065512754,0.008106334,0.0012651195,0.019087858,0.006288912,0.002667463,0.2715313,0.12172468,0.45609272],"study_design_scores_gemma":[0.0021607562,0.0025261822,0.050690662,0.10725717,0.013304442,0.0052062254,0.015544157,0.02922835,0.016718453,0.38816524,0.3672489,0.0019494804],"about_ca_topic_score_codex":0.0072725345,"about_ca_topic_score_gemma":0.007582335,"teacher_disagreement_score":0.47002357,"about_ca_system_score_codex":0.009257143,"about_ca_system_score_gemma":0.020279601,"threshold_uncertainty_score":0.57962275},"labels":[],"label_agreement":null},{"id":"W2074163347","doi":"10.1016/j.jclinepi.2007.05.010","title":"A review of five cardiology journals found that observer variability of measured variables was infrequently reported","year":2007,"lang":"en","type":"review","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Children's Hospital of Eastern Ontario; University of Ottawa","funders":"","keywords":"Medicine; Categorical variable; Continuous variable; Cohen's kappa; Kappa; Statistic; Statistics; Internal medicine; Mathematics","score_opus":0.8734374309110979,"score_gpt":0.6395238285885412,"score_spread":0.23391360232255676,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2074163347","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":"reporting","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":"reporting","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.003251025,0.9943732,0.0004872247,0.00067087635,0.00028142362,0.000073379015,0.00031841182,0.00001109492,0.0005333814],"genre_scores_gemma":[0.048745632,0.9458374,0.002578352,0.001669076,0.00040001646,0.00017249724,0.00041163497,0.000015691385,0.00016977092],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.9752133,0.00718295,0.010172654,0.0015702762,0.0055343956,0.00032653013],"domain_scores_gemma":[0.77052814,0.17566323,0.028080305,0.0031632327,0.021788165,0.0007770132],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.024086002,0.000884909,0.0043621957,0.016399948,0.0006022508,0.0018656213,0.0013123708,0.0017522384,0.0015627332],"category_scores_gemma":[0.124558136,0.000669242,0.002636161,0.012566469,0.00082945125,0.0020673336,0.001303916,0.0009445637,0.00038051774],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00065903063,0.000067358415,0.019899068,0.30705884,0.0071172975,0.0005796332,0.0012666006,0.00015727863,0.00087734766,0.00042082113,0.010187181,0.6517095],"study_design_scores_gemma":[0.0006433434,0.00120765,0.13103262,0.490656,0.09340332,0.007235291,0.0031222836,0.00041809567,0.00400371,0.0012675253,0.26669297,0.00031713178],"about_ca_topic_score_codex":0.0025194676,"about_ca_topic_score_gemma":0.0065708915,"teacher_disagreement_score":0.975914,"about_ca_system_score_codex":0.0014692022,"about_ca_system_score_gemma":0.0065776305,"threshold_uncertainty_score":0.12738043},"labels":[],"label_agreement":null},{"id":"W2074840499","doi":"10.1207/s15324796abm2603_02","title":"Classification and regression tree analysis in public health: Methodological review and comparison with logistic regression","year":2003,"lang":"en","type":"review","venue":"Annals of Behavioral Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":898,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"St. Stephen's University","funders":"","keywords":"Logistic regression; Public health; Identification (biology); Population; Nonparametric statistics; Logistic model tree; Regression analysis; Health psychology; Decision tree; Statistics; Stepwise regression; Regression; Psychology; Medicine; Applied psychology; Computer science; Data mining; Mathematics; Environmental health; Pathology; Biology","score_opus":0.9360556982721563,"score_gpt":0.6560495613872027,"score_spread":0.28000613688495357,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2074840499","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0018387563,0.94514066,0.048392657,0.001653412,0.0005953663,0.0012909357,0.00023686844,0.000070217255,0.0007811521],"genre_scores_gemma":[0.042005327,0.8200037,0.1303138,0.0005345366,0.0005834056,0.0058195307,0.00038509676,0.000061649094,0.00029290776],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.7918258,0.1733718,0.015901452,0.0035909084,0.014753207,0.00055675296],"domain_scores_gemma":[0.47777972,0.47436947,0.015973922,0.0086423345,0.022662848,0.0005717881],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1854427,0.0018716005,0.009260892,0.017884634,0.00095985975,0.00368786,0.0048154094,0.0025800022,0.0028942504],"category_scores_gemma":[0.3334449,0.0014486263,0.009167101,0.0294064,0.0020121855,0.004330069,0.0022130916,0.0023819415,0.0005863361],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00057476957,0.00014929596,0.005226566,0.18092002,0.0135210175,0.00011435046,0.00064769096,0.005917724,0.00012043988,0.009915958,0.0050088307,0.7778833],"study_design_scores_gemma":[0.0027442041,0.0037583122,0.04105303,0.5277248,0.08964856,0.0018743085,0.0031305414,0.06532234,0.002424955,0.07613461,0.18535316,0.00083125307],"about_ca_topic_score_codex":0.009446583,"about_ca_topic_score_gemma":0.009189808,"teacher_disagreement_score":0.1854427,"about_ca_system_score_codex":0.00532145,"about_ca_system_score_gemma":0.012537521,"threshold_uncertainty_score":0.9807265},"labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"not_applicable","genre":"review","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":[],"domain":null,"study_design":"design_other","genre":"review","about_ca_system":false,"about_ca_topic":false,"confidence":"low"}],"label_agreement":"split"},{"id":"W2075431957","doi":"10.1007/s10877-008-9127-y","title":"A Measure of Confidence in Bland–Altman Analysis for the Interchangeability of Two Methods of Measurement","year":2008,"lang":"en","type":"article","venue":"Journal of Clinical Monitoring and Computing","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":40,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University Health Network","funders":"","keywords":"Interchangeability; Measure (data warehouse); Confidence interval; Limits of agreement; Medicine; Bland–Altman plot; Statistics; Medical physics; Computer science; Mathematics; Data mining; Internal medicine; Nuclear medicine","score_opus":0.6837745116735408,"score_gpt":0.587837256182952,"score_spread":0.09593725549058874,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2075431957","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05197372,0.001237995,0.93570733,0.00051259395,0.00053319335,0.0011026354,0.0011207982,0.0018317908,0.0059798914],"genre_scores_gemma":[0.44592553,0.00027523225,0.54741675,0.0003359447,0.00017560822,0.0031186698,0.0011485512,0.00084748166,0.0007562412],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.79714113,0.12682267,0.02664093,0.013033656,0.034688186,0.0016735184],"domain_scores_gemma":[0.3778082,0.45753133,0.034513287,0.06858841,0.060139574,0.0014192255],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1824326,0.0016690873,0.0021963636,0.0061233183,0.002880333,0.005095093,0.003252754,0.0026901416,0.0024539067],"category_scores_gemma":[0.5294111,0.0012187556,0.0040891026,0.006355456,0.0036540558,0.0064411503,0.0038960772,0.0058406866,0.0008741924],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00446014,0.0010936555,0.23404914,0.0034226985,0.009145772,0.00037933703,0.011897519,0.021542726,0.014518319,0.07617742,0.019143058,0.6041702],"study_design_scores_gemma":[0.0010113645,0.006382846,0.37060657,0.0034647249,0.0045787,0.0051750583,0.003795977,0.34091976,0.06675407,0.12089529,0.074616775,0.0017989178],"about_ca_topic_score_codex":0.002083073,"about_ca_topic_score_gemma":0.0024857537,"teacher_disagreement_score":0.8175674,"about_ca_system_score_codex":0.0018203008,"about_ca_system_score_gemma":0.003953225,"threshold_uncertainty_score":0.9648074},"labels":[],"label_agreement":null},{"id":"W2077240755","doi":"10.1016/j.annemergmed.2011.06.423","title":"391 Between-Rater Reliability of Historical Variables Used in a Routine Emergency Department Patient Evaluation","year":2011,"lang":"en","type":"article","venue":"Annals of Emergency Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Medicine; Emergency department; Inter-rater reliability; Reliability (semiconductor); Medical emergency; Emergency medicine; Statistics; Nursing","score_opus":0.5818926185803324,"score_gpt":0.4632303106880315,"score_spread":0.11866230789230087,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2077240755","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9859244,0.00067139976,0.009982307,0.000059804686,0.0001603356,0.00016066928,0.0003424282,0.00004911168,0.0026494965],"genre_scores_gemma":[0.996467,0.000082916005,0.002824179,0.000022574497,0.00003549036,0.00008426295,0.00025900788,0.000022062603,0.00020250176],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.939168,0.038278226,0.008201624,0.0040514325,0.00947338,0.0008272456],"domain_scores_gemma":[0.7881362,0.15458877,0.0117542185,0.018576188,0.026219478,0.0007251287],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.053986527,0.00043373133,0.00096856593,0.0014567683,0.00083637045,0.0012819476,0.00067252363,0.0007382304,0.0007061189],"category_scores_gemma":[0.13798271,0.00045977114,0.0012579473,0.001037519,0.000835041,0.00125201,0.0011040458,0.0007713436,0.0006078566],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019747913,0.000196711,0.9506557,0.00023181249,0.0015477729,0.00013376278,0.0044659832,0.0015941329,0.003982752,0.0005410799,0.00060451403,0.034070984],"study_design_scores_gemma":[0.00009846632,0.0016159575,0.97212404,0.00013314211,0.00080143876,0.00058649224,0.0011990072,0.01176164,0.008524269,0.00061148277,0.0024609058,0.00008314286],"about_ca_topic_score_codex":0.0012451148,"about_ca_topic_score_gemma":0.0018069055,"teacher_disagreement_score":0.053986527,"about_ca_system_score_codex":0.00070490694,"about_ca_system_score_gemma":0.000630235,"threshold_uncertainty_score":0.2855115},"labels":[],"label_agreement":null},{"id":"W2079234813","doi":"10.1111/j.0006-341x.2002.00209.x","title":"Interval Estimation for a Difference Between Intraclass Kappa Statistics","year":2002,"lang":"en","type":"article","venue":"Biometrics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":48,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Statistics; Confidence interval; Cohen's kappa; Mathematics; Interval estimation; Kappa; Statistic; Sample size determination; Intraclass correlation; Reproducibility","score_opus":0.42560737613053634,"score_gpt":0.418085093842297,"score_spread":0.007522282288239368,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2079234813","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0056243623,0.0010341466,0.9903058,0.00014129494,0.00016643644,0.00018605757,0.00017561915,0.0006372098,0.0017290311],"genre_scores_gemma":[0.13739689,0.00072631397,0.85860914,0.00018771351,0.00021087371,0.001428156,0.000518573,0.00038912543,0.0005332498],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.90288043,0.05897373,0.0063200765,0.009172386,0.021532027,0.0011214077],"domain_scores_gemma":[0.6689631,0.2766858,0.013466389,0.019364776,0.02043458,0.0010853293],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07155238,0.0016844237,0.0026405312,0.010157761,0.0012272332,0.0035905219,0.0043223156,0.0028963636,0.0046258215],"category_scores_gemma":[0.3717094,0.00082601793,0.0026316077,0.004594629,0.0024329918,0.004701082,0.0045425133,0.0050262073,0.0016816917],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019419501,0.00034977603,0.02036106,0.0030446742,0.0019882843,0.0004114165,0.0027553912,0.032659598,0.007779424,0.168248,0.01080405,0.74965626],"study_design_scores_gemma":[0.000782556,0.003058058,0.05143866,0.0025933993,0.0015101088,0.0038525003,0.0015608706,0.3658221,0.02132258,0.50559676,0.041394267,0.0010681176],"about_ca_topic_score_codex":0.000826223,"about_ca_topic_score_gemma":0.0005720568,"teacher_disagreement_score":0.07155238,"about_ca_system_score_codex":0.0010901785,"about_ca_system_score_gemma":0.0016256603,"threshold_uncertainty_score":0.37840968},"labels":[],"label_agreement":null},{"id":"W2086743973","doi":"10.1016/j.cmpb.2011.09.011","title":"Improving the medical scale predictability by the pairwise comparisons method: Evidence from a clinical data study","year":2011,"lang":"en","type":"article","venue":"Computer Methods and Programs in Biomedicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":22,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University; Laurentian University; University of Sudbury","funders":"","keywords":"Predictability; Pairwise comparison; Reliability (semiconductor); Scale (ratio); Computer science; Clinical Practice; Medical diagnosis; Psychology; Machine learning; Clinical psychology; Artificial intelligence; Data mining; Medicine; Statistics; Family medicine; Mathematics","score_opus":0.7015660725220738,"score_gpt":0.562736366494007,"score_spread":0.13882970602806677,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2086743973","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7716161,0.045444477,0.16427185,0.0050142803,0.0017253471,0.0020278767,0.0014606491,0.00043000848,0.008009496],"genre_scores_gemma":[0.96814764,0.0026277793,0.027523607,0.00037086383,0.00032135283,0.0003661789,0.00033987357,0.000104238585,0.00019845535],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.71584475,0.2527682,0.007728907,0.0056346343,0.017430836,0.00059273234],"domain_scores_gemma":[0.15651348,0.8042235,0.011672842,0.019795697,0.0071271136,0.0006673826],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.18428615,0.0019728548,0.0042355172,0.0018623964,0.0012339195,0.0018556082,0.0029765717,0.001971357,0.0027609724],"category_scores_gemma":[0.48400545,0.0010109373,0.0052057123,0.0025563352,0.0051360307,0.0041451333,0.002419752,0.0040059835,0.00044215313],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.12256386,0.0029634845,0.17742221,0.011853328,0.046347164,0.0003258153,0.0033897094,0.024726572,0.0014718127,0.008627991,0.0064990814,0.593809],"study_design_scores_gemma":[0.03819236,0.11254331,0.37344626,0.0058957916,0.067940615,0.0034652052,0.0026259702,0.27302033,0.01083172,0.095871516,0.014698659,0.0014684198],"about_ca_topic_score_codex":0.0010213869,"about_ca_topic_score_gemma":0.0011163215,"teacher_disagreement_score":0.18428615,"about_ca_system_score_codex":0.00075086794,"about_ca_system_score_gemma":0.0021684656,"threshold_uncertainty_score":0.97461},"labels":[],"label_agreement":null},{"id":"W2088910496","doi":"10.3109/0142159x.2012.703791","title":"Generalizability theory for the perplexed: A practical introduction and guide: AMEE Guide No. 68","year":2012,"lang":"en","type":"article","venue":"Medical Teacher","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":250,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Generalizability theory; Generalization; Reliability (semiconductor); Computer science; Variance (accounting); Psychology; Management science; Cognitive psychology; Statistics; Mathematics","score_opus":0.16901637720693752,"score_gpt":0.45187119296090483,"score_spread":0.2828548157539673,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2088910496","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0010915932,0.035893742,0.8012942,0.058461558,0.008637086,0.019054223,0.008841429,0.007849426,0.05887676],"genre_scores_gemma":[0.0067728492,0.026070077,0.8706964,0.015132424,0.0029938468,0.033688262,0.006157403,0.0032460853,0.035242587],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.97519433,0.014718746,0.004166177,0.0011719295,0.004386545,0.00036230194],"domain_scores_gemma":[0.91129273,0.06674625,0.0021105753,0.0034241378,0.015583734,0.00084262097],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.031198334,0.003989263,0.0034769105,0.011976621,0.0023085668,0.005912669,0.0057733534,0.0066152457,0.060873248],"category_scores_gemma":[0.10777925,0.0039766226,0.004618803,0.0068861116,0.0069566634,0.010302013,0.0048917383,0.012988023,0.039788663],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006164039,0.00022462386,0.00050317415,0.0041378867,0.000060173574,0.00031239248,0.0022762818,0.001215181,0.0008373705,0.05995014,0.73083866,0.19958244],"study_design_scores_gemma":[0.00008325909,0.00010702695,0.0016144761,0.004931353,0.000039193044,0.0011447236,0.00092214666,0.0022469785,0.00043517686,0.19229981,0.7960126,0.00016333534],"about_ca_topic_score_codex":0.004800941,"about_ca_topic_score_gemma":0.005515566,"teacher_disagreement_score":0.9688017,"about_ca_system_score_codex":0.0047987476,"about_ca_system_score_gemma":0.007861515,"threshold_uncertainty_score":0.2036413},"labels":[],"label_agreement":null},{"id":"W2091019309","doi":"10.1002/sim.5466","title":"Sample size formulas for estimating intraclass correlation coefficients with precision and assurance","year":2012,"lang":"en","type":"article","venue":"Statistics in Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":467,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Robarts Clinical Trials; Western University","funders":"","keywords":"Intraclass correlation; Confidence interval; Reliability (semiconductor); Sample size determination; Statistics; Interval (graph theory); Mathematics; Coverage probability; Limit (mathematics); Interval estimation; Sample (material); Correlation coefficient; Correlation; Computer science; Reproducibility; Power (physics); Mathematical analysis; Combinatorics; Physics","score_opus":0.0854428886232476,"score_gpt":0.3958068923931848,"score_spread":0.31036400376993717,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2091019309","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0008068777,0.0004975127,0.99730325,0.00014509096,0.00006766779,0.00020569534,0.00004702564,0.00017677087,0.00075002055],"genre_scores_gemma":[0.030111043,0.0009770368,0.9642659,0.00034582763,0.00024811778,0.0029390205,0.0001731038,0.00020343851,0.0007365174],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.94550496,0.036181286,0.0031412449,0.0024060952,0.012356334,0.00041001724],"domain_scores_gemma":[0.69354427,0.2722119,0.008609248,0.011498303,0.0137368115,0.00039952886],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07010303,0.0019456067,0.0020435213,0.0065801954,0.0006737425,0.0018395318,0.0038502063,0.0028834587,0.0053610657],"category_scores_gemma":[0.43800405,0.0010259735,0.0014521312,0.0035972155,0.0021462587,0.004309688,0.0029592952,0.0047382195,0.0020703352],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00029597152,0.00021597376,0.0047391746,0.0010860753,0.00043763578,0.0003353592,0.0012418716,0.055469878,0.002294069,0.29321906,0.016821232,0.6238437],"study_design_scores_gemma":[0.00055290014,0.0007522691,0.0062887687,0.0016255159,0.00045909264,0.0011454031,0.00024713058,0.43748534,0.006104487,0.51413274,0.030988911,0.00021738854],"about_ca_topic_score_codex":0.0013412487,"about_ca_topic_score_gemma":0.0015935632,"teacher_disagreement_score":0.07010303,"about_ca_system_score_codex":0.0014701582,"about_ca_system_score_gemma":0.0018922131,"threshold_uncertainty_score":0.37074465},"labels":[],"label_agreement":null},{"id":"W2091307601","doi":"10.1111/j.1743-498x.2012.00607.x","title":"A method for identifying extreme OSCE examiners","year":2013,"lang":"en","type":"article","venue":"The Clinical Teacher","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":35,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Medical Council of Canada","funders":"","keywords":"Psychology; Cohort; Applied psychology; Standard deviation; Quality assurance; Inter-rater reliability; Objective structured clinical examination; Statistics; Computer science; Medicine; Rating scale; Mathematics; Developmental psychology","score_opus":0.753723718068258,"score_gpt":0.5667969616218294,"score_spread":0.18692675644642864,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2091307601","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"evaluation","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"evaluation","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01575686,0.00017567203,0.9646878,0.000424616,0.00046257206,0.005779516,0.0012936362,0.0035801036,0.007839248],"genre_scores_gemma":[0.026059655,0.000071372844,0.9624862,0.00017601583,0.000080717145,0.0065498343,0.0005485751,0.0003038898,0.0037238454],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.95684487,0.01503063,0.0065461,0.0070416983,0.013654138,0.0008826332],"domain_scores_gemma":[0.881077,0.04892347,0.011368274,0.015346701,0.041727453,0.0015570793],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.030086195,0.0017013112,0.00097369455,0.008257353,0.0018588027,0.0027591584,0.0025696652,0.0021529458,0.019623986],"category_scores_gemma":[0.10319089,0.0011786749,0.0011544522,0.0042039123,0.0015357309,0.0016350999,0.0037918773,0.0020117757,0.009810215],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013916577,0.00043901388,0.03469344,0.0011909214,0.00017705384,0.00049415237,0.003197141,0.0018148372,0.02645583,0.013396621,0.034060925,0.8826884],"study_design_scores_gemma":[0.002269547,0.0033264477,0.18107079,0.00264129,0.0010291351,0.011576546,0.006284677,0.16287895,0.11211424,0.052994635,0.4621607,0.0016530086],"about_ca_topic_score_codex":0.0015342109,"about_ca_topic_score_gemma":0.0035025363,"teacher_disagreement_score":0.9699138,"about_ca_system_score_codex":0.0010630545,"about_ca_system_score_gemma":0.0035271302,"threshold_uncertainty_score":0.15911287},"labels":[],"label_agreement":null},{"id":"W2095752327","doi":"10.1002/(sici)1097-0258(20000315)19:5<723::aid-sim379>3.0.co;2-a","title":"Interval estimation for Cohen's kappa as a measure of agreement","year":2000,"lang":"en","type":"article","venue":"Statistics in Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":217,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Confidence interval; Statistics; Mathematics; Measure (data warehouse); Kappa; Statistic; Variance (accounting); Delta method; Coverage probability; Asymptotic analysis; Computation; Asymptotic distribution; Cohen's kappa; Applied mathematics; Computer science; Algorithm","score_opus":0.11948518704376823,"score_gpt":0.4260948892710158,"score_spread":0.3066097022272476,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2095752327","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01449865,0.004029885,0.9684323,0.00034121433,0.00042138563,0.0004896483,0.0006398733,0.00079025637,0.010356778],"genre_scores_gemma":[0.23013839,0.002170677,0.7607723,0.00027090928,0.0004029033,0.0034911733,0.0010694223,0.00043467685,0.0012495762],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.88243437,0.073471084,0.0093514845,0.008111298,0.025526503,0.0011053241],"domain_scores_gemma":[0.72677356,0.22011895,0.014268459,0.011604728,0.026369905,0.0008644462],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0671707,0.00091949623,0.002020541,0.010514451,0.0012728136,0.0031269183,0.0040423907,0.001764458,0.0056109834],"category_scores_gemma":[0.35187203,0.00045548257,0.0021520834,0.0076470324,0.0021750913,0.0037535569,0.0038512198,0.0030729293,0.0018018271],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013625259,0.00025201068,0.020504374,0.004183941,0.0017819274,0.00032242743,0.0044105654,0.02588647,0.0031588431,0.19698578,0.026440132,0.714711],"study_design_scores_gemma":[0.00033591362,0.0025551491,0.058203224,0.004742139,0.0016647425,0.0034833292,0.0034158004,0.26082444,0.01144719,0.5630474,0.089386486,0.0008941182],"about_ca_topic_score_codex":0.0015303632,"about_ca_topic_score_gemma":0.0008842369,"teacher_disagreement_score":0.0671707,"about_ca_system_score_codex":0.0015670634,"about_ca_system_score_gemma":0.002102059,"threshold_uncertainty_score":0.3552369},"labels":[],"label_agreement":null},{"id":"W2096649070","doi":"10.1002/sim.3387","title":"Bivariate modeling of interobserver agreement coefficients","year":2008,"lang":"en","type":"article","venue":"Statistics in Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Bivariate analysis; Anxiety; Outcome (game theory); Trait; Psychology; Statistics; Depression (economics); Clinical psychology; Medicine; Psychiatry; Mathematics; Computer science","score_opus":0.2636804934739743,"score_gpt":0.41067999707973896,"score_spread":0.14699950360576464,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2096649070","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10067422,0.00081602903,0.89156836,0.0010570196,0.00018451977,0.0006945487,0.0011183533,0.00073228014,0.0031546606],"genre_scores_gemma":[0.8322732,0.00087629375,0.1542054,0.00020179027,0.00018912021,0.0024012488,0.0016690813,0.00033194796,0.007852002],"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9545941,0.032668274,0.0017663501,0.0057805334,0.003502819,0.0016879949],"domain_scores_gemma":[0.8081056,0.1537402,0.010938187,0.014369826,0.011858133,0.0009881046],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.057258803,0.0019209599,0.0021890556,0.0053053764,0.0014437409,0.0038049493,0.0037541864,0.0025094538,0.0074192197],"category_scores_gemma":[0.18984991,0.001381787,0.0033089437,0.0057984046,0.002711539,0.003005923,0.003140839,0.0037974687,0.00300504],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00079279294,0.00046229135,0.23564301,0.000577741,0.002740091,0.0016233231,0.01159733,0.29718032,0.0019522439,0.29398975,0.00870193,0.14473921],"study_design_scores_gemma":[0.00004292633,0.00028351895,0.028593685,0.0002030999,0.00032881842,0.0005960018,0.0008423489,0.85890394,0.0009327226,0.1032761,0.0058724647,0.00012433282],"about_ca_topic_score_codex":0.012089817,"about_ca_topic_score_gemma":0.0054071,"teacher_disagreement_score":0.057258803,"about_ca_system_score_codex":0.0021847507,"about_ca_system_score_gemma":0.0021600195,"threshold_uncertainty_score":0.3028171},"labels":[],"label_agreement":null},{"id":"W2097681968","doi":"10.1093/biostatistics/2.3.323","title":"Efficiency considerations in the analysis of inter-observer agreement","year":2001,"lang":"en","type":"article","venue":"Biostatistics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":18,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Cohen's kappa; Replicate; Statistics; Inter-rater reliability; Reliability (semiconductor); Statistic; Kappa; Mathematics; Binary number; Computer science; Binomial distribution; Econometrics; Arithmetic; Physics","score_opus":0.23113506979270315,"score_gpt":0.40521817031104557,"score_spread":0.17408310051834242,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2097681968","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0049557583,0.00068680185,0.9924064,0.0003754382,0.00007683824,0.00030403532,0.0000650285,0.00011769133,0.0010118803],"genre_scores_gemma":[0.31867346,0.0008259462,0.67255867,0.0010571405,0.0003105336,0.0029624768,0.0004508146,0.0007040234,0.0024568776],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.47599486,0.4531517,0.01780426,0.020285651,0.030619312,0.0021441593],"domain_scores_gemma":[0.13474303,0.80217546,0.014272391,0.035514615,0.012876503,0.00041796148],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3907782,0.002745539,0.0045596203,0.0041220183,0.0017419736,0.005607869,0.005316505,0.004008732,0.002050049],"category_scores_gemma":[0.68337536,0.0019559928,0.0048409947,0.0050296546,0.0079199895,0.008073524,0.007114369,0.0057766573,0.0013342503],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0018385944,0.00041432044,0.04883049,0.002479892,0.0064648762,0.0011131536,0.0064405384,0.15859601,0.0049408004,0.46095097,0.006433282,0.30149707],"study_design_scores_gemma":[0.00022142704,0.0010678046,0.027752012,0.0009114322,0.0008723466,0.0013040707,0.0009919952,0.45852253,0.007953979,0.48084658,0.01923726,0.00031858563],"about_ca_topic_score_codex":0.0025977904,"about_ca_topic_score_gemma":0.0015171148,"teacher_disagreement_score":0.6092218,"about_ca_system_score_codex":0.0040751314,"about_ca_system_score_gemma":0.0033665453,"threshold_uncertainty_score":0.75127894},"labels":[],"label_agreement":null},{"id":"W2099077995","doi":"10.1177/0962280215601133","title":"Assessing agreement between two measurement systems: An alternative to the limits of agreement approach","year":2015,"lang":"en","type":"article","venue":"Statistical Methods in Medical Research","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":55,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Interchangeability; Agreement; Metric (unit); Limits of agreement; Computer science; Units of measurement; Physics; Engineering","score_opus":0.8455312682296875,"score_gpt":0.6788734831139276,"score_spread":0.1666577851157599,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2099077995","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006730264,0.0037189005,0.98210734,0.0011021707,0.00037840338,0.00057099917,0.00020521056,0.0002533529,0.0049333815],"genre_scores_gemma":[0.3283771,0.0024342712,0.66291064,0.0011616453,0.00063716044,0.0028842944,0.00032646934,0.00033405333,0.0009343741],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.5175982,0.37628898,0.020864164,0.024659116,0.05854621,0.0020433299],"domain_scores_gemma":[0.342473,0.56304914,0.03204897,0.037961166,0.022797614,0.0016700428],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2813988,0.0032443423,0.0072313286,0.01592052,0.0031340506,0.012527926,0.008230767,0.0062035755,0.0034543986],"category_scores_gemma":[0.53023046,0.002015884,0.0059985127,0.015823232,0.01398283,0.017658718,0.012772853,0.010153457,0.00097140117],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014759168,0.0005524866,0.031155836,0.0062207086,0.008652559,0.00048213836,0.013185237,0.030765267,0.002958579,0.5688689,0.00609168,0.32959068],"study_design_scores_gemma":[0.00025337233,0.001710406,0.014703774,0.0018956886,0.001520682,0.00101864,0.00259763,0.10198804,0.0032401315,0.8492968,0.021186816,0.0005881195],"about_ca_topic_score_codex":0.0034063337,"about_ca_topic_score_gemma":0.002579288,"teacher_disagreement_score":0.2813988,"about_ca_system_score_codex":0.0051076077,"about_ca_system_score_gemma":0.0072756573,"threshold_uncertainty_score":0.88616323},"labels":[],"label_agreement":null},{"id":"W2099954138","doi":"10.1016/j.ygyno.2005.07.040","title":"Kappa statistics to measure interrater and intrarater agreement for 1790 cervical biopsy specimens among twelve pathologists: Qualitative histopathologic analysis and methodologic issues","year":2005,"lang":"en","type":"article","venue":"Gynecologic Oncology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":90,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"National Cancer Institute","keywords":"Medicine; Biopsy; Inter-rater reliability; Cohen's kappa; Cervical cancer; Radiology; Kappa; Family medicine; Cancer; Statistics; Internal medicine","score_opus":0.26558037577816274,"score_gpt":0.4873603395796752,"score_spread":0.22177996380151244,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2099954138","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.72569096,0.0034140912,0.24002428,0.0010615726,0.0009635572,0.0022860686,0.0018553038,0.00074668165,0.023957562],"genre_scores_gemma":[0.90007955,0.00035032118,0.095888324,0.00011643106,0.00009695974,0.0014115615,0.0004019506,0.00026579882,0.0013890252],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.8283029,0.10181412,0.029001143,0.006852168,0.03211521,0.0019143976],"domain_scores_gemma":[0.37165412,0.50930995,0.015080725,0.021905405,0.08031054,0.0017393081],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.14950375,0.0008187036,0.0018335162,0.008298258,0.005271873,0.0029040843,0.0026779124,0.0010763756,0.0017865637],"category_scores_gemma":[0.3544491,0.0012128841,0.0025856502,0.0052991244,0.0031797301,0.0040349606,0.0036028223,0.0022387784,0.0005891897],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0027691445,0.00042619565,0.60193604,0.0036298733,0.005316655,0.0004953324,0.112466946,0.006046343,0.008468976,0.024413737,0.010413165,0.22361769],"study_design_scores_gemma":[0.0005420201,0.0031154803,0.70532316,0.0026257776,0.003877252,0.0036568705,0.104165286,0.074943796,0.024669116,0.04622641,0.02983876,0.001016136],"about_ca_topic_score_codex":0.0061740284,"about_ca_topic_score_gemma":0.017576488,"teacher_disagreement_score":0.85049623,"about_ca_system_score_codex":0.0029965565,"about_ca_system_score_gemma":0.0042900043,"threshold_uncertainty_score":0.79066086},"labels":[],"label_agreement":null},{"id":"W2102888726","doi":"10.1002/cjs.5550360306","title":"On population‐based measures of agreement for binary classifications","year":2008,"lang":"en","type":"article","venue":"Canadian Journal of Statistics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":26,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Cohen's kappa; Kappa; Statistic; Statistics; Population; Binary number; Inference; Binary data; Contrast (vision); Mathematics; Agreement; Econometrics; Computer science; Medicine; Artificial intelligence; Linguistics","score_opus":0.3749121106352241,"score_gpt":0.3604218302652674,"score_spread":0.014490280369956698,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2102888726","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07538948,0.0010885634,0.91364574,0.0006566884,0.00034496412,0.00045915844,0.00048362094,0.0005248439,0.0074069058],"genre_scores_gemma":[0.7579608,0.00035159694,0.23890586,0.00027543496,0.00013889301,0.0010838017,0.00053881714,0.00015079584,0.00059408986],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.80596,0.15321593,0.006234399,0.008731492,0.024894172,0.0009640315],"domain_scores_gemma":[0.47654942,0.45264748,0.02021622,0.027024468,0.022506932,0.0010555652],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.16205177,0.0008680741,0.0020507132,0.0072951796,0.0012203052,0.003424222,0.0025287913,0.0021577391,0.0020611766],"category_scores_gemma":[0.47333065,0.0006728368,0.002352249,0.004317383,0.005293442,0.0046957415,0.0047729136,0.0031646835,0.00054966955],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017367887,0.00039182886,0.1419921,0.0014590413,0.0042558606,0.00035343954,0.006339433,0.13810706,0.0014592791,0.28765738,0.010760517,0.40548724],"study_design_scores_gemma":[0.00025668595,0.0013831456,0.062242776,0.0008861799,0.0006140889,0.0010313086,0.001973241,0.39265117,0.0029046081,0.5264645,0.0090227695,0.0005695123],"about_ca_topic_score_codex":0.0021294137,"about_ca_topic_score_gemma":0.0015052926,"teacher_disagreement_score":0.16205177,"about_ca_system_score_codex":0.0022181843,"about_ca_system_score_gemma":0.0023067368,"threshold_uncertainty_score":0.8570219},"labels":[],"label_agreement":null},{"id":"W2105852486","doi":"10.1186/1472-6963-8-277","title":"Reliability of the interRAI suite of assessment instruments: a 12-country study of an integrated health information system","year":2008,"lang":"en","type":"article","venue":"BMC Health Services Research","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":677,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Homewood Research Institute; University of Waterloo","funders":"University of Waterloo; Curtin University of Technology","keywords":"Health informatics; Reliability (semiconductor); Medicine; Nursing research; Cohen's kappa; Kappa; Suite; Health care; Health administration; Nursing; Family medicine; Public health; Statistics","score_opus":0.19404930026780062,"score_gpt":0.47833794597111684,"score_spread":0.28428864570331625,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2105852486","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9978538,0.00009797692,0.0011251689,0.000046127014,0.000008774252,0.00008323746,0.00010803909,0.0000069844573,0.00066979404],"genre_scores_gemma":[0.998899,0.000043723052,0.00080055493,0.000012458835,0.0000034301816,0.00006971562,0.000120181256,0.000005006898,0.000045937577],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9597447,0.027739882,0.003036275,0.0028419115,0.005396231,0.001241061],"domain_scores_gemma":[0.9157763,0.048192788,0.013976829,0.0077170455,0.01265943,0.0016775625],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.051385496,0.0004891213,0.0009765867,0.0034738504,0.0011275562,0.0021365567,0.00093100144,0.0007060549,0.00091986783],"category_scores_gemma":[0.07628954,0.0007373724,0.0011947738,0.004893403,0.002539806,0.0026380096,0.003352891,0.0014036748,0.0002117012],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000119664954,0.00014389501,0.98716974,0.00004566317,0.00022033401,0.000037421232,0.0047118724,0.0002756958,0.00016253973,0.0001846278,0.000118308155,0.006810271],"study_design_scores_gemma":[0.000026477133,0.000506316,0.98897797,0.00009557114,0.000078691184,0.0001576363,0.007160877,0.001909811,0.00028276825,0.00016818137,0.0006077481,0.000027973187],"about_ca_topic_score_codex":0.0050389767,"about_ca_topic_score_gemma":0.0032956365,"teacher_disagreement_score":0.9486145,"about_ca_system_score_codex":0.001462575,"about_ca_system_score_gemma":0.0016439259,"threshold_uncertainty_score":0.2717557},"labels":[],"label_agreement":null},{"id":"W2106963718","doi":"10.1093/annhyg/mel021","title":"Attenuation in Risk Estimates in Logistic and Cox Proportional-Hazards Models due to Group-Based Exposure Assessment Strategy","year":2006,"lang":"en","type":"article","venue":"The Annals of Occupational Hygiene","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":32,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Provincial Laboratory of Public Health; University of Alberta","funders":"","keywords":"Statistics; Proportional hazards model; Logistic regression; Mathematics; Attenuation; Variance (accounting); Regression analysis; Econometrics; Medicine; Physics","score_opus":0.2942759238130756,"score_gpt":0.44869054056029417,"score_spread":0.15441461674721857,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2106963718","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.034093227,0.0013557611,0.96169746,0.0009307224,0.000080077116,0.00025316046,0.000120906596,0.00032741064,0.0011412936],"genre_scores_gemma":[0.72818065,0.001367308,0.2647399,0.0009675724,0.0002100235,0.0012050185,0.0005472506,0.0002127261,0.002569651],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.892188,0.08176123,0.004846048,0.007924794,0.0120327175,0.0012471927],"domain_scores_gemma":[0.520249,0.4281258,0.014417364,0.028836105,0.00785703,0.00051472284],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.12111402,0.0012510248,0.0025754562,0.0019538566,0.00045242516,0.0021022651,0.0031521553,0.0024126389,0.0014671652],"category_scores_gemma":[0.42535716,0.0013685921,0.0018507632,0.0020798717,0.0033397516,0.003997323,0.0036572898,0.0038243511,0.00053941045],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015590326,0.0003243653,0.107135765,0.0012245581,0.002594467,0.0011521373,0.0038697962,0.38864753,0.0019351593,0.16520998,0.0049639246,0.32138324],"study_design_scores_gemma":[0.0001806855,0.000460665,0.02380898,0.00029033818,0.0005254316,0.00085806457,0.0003635766,0.7428046,0.0020631314,0.22332647,0.0051595843,0.00015843908],"about_ca_topic_score_codex":0.0037588405,"about_ca_topic_score_gemma":0.0012703199,"teacher_disagreement_score":0.878886,"about_ca_system_score_codex":0.0019991067,"about_ca_system_score_gemma":0.0014826024,"threshold_uncertainty_score":0.64051986},"labels":[],"label_agreement":null},{"id":"W2107006322","doi":"10.1370/afm.1195","title":"Methods to Achieve High Interrater Reliability in Data Collection From Primary Care Medical Records","year":2011,"lang":"en","type":"article","venue":"The Annals of Family Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":83,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Élisabeth Bruyère Hospital; Bruyère; University of Ottawa","funders":"","keywords":"Medicine; Inter-rater reliability; Reliability (semiconductor); Quality assurance; Chart; Confidence interval; Audit; Statistics; Sample size determination; Data collection; Control chart; Quality (philosophy); Sample (material); Quality management; Statistic; Medical physics; Operations management; Computer science; Mathematics","score_opus":0.7358387871238369,"score_gpt":0.5387267113294011,"score_spread":0.1971120757944358,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2107006322","genre_codex":"methods","genre_gemma":"empirical","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10197304,0.001032896,0.81767243,0.0010446038,0.000638798,0.06527662,0.0006690422,0.0016397297,0.01005278],"genre_scores_gemma":[0.2864311,0.00023617431,0.59251845,0.00060574926,0.00037191255,0.118298225,0.0003944308,0.00027278138,0.0008712043],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.31782,0.53508383,0.068976074,0.019972054,0.055633325,0.0025146524],"domain_scores_gemma":[0.23005934,0.41019326,0.105724335,0.09298165,0.1584456,0.002595827],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.44943756,0.0019637342,0.002092944,0.00680213,0.0036205153,0.0027184025,0.0033775496,0.0016608933,0.00311711],"category_scores_gemma":[0.54537106,0.002009993,0.002553984,0.0046145413,0.003923964,0.0030409386,0.0057246825,0.0020763266,0.0016999455],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.006953705,0.0033684107,0.25744665,0.012681204,0.0026212963,0.00056007237,0.04318593,0.010619046,0.023307614,0.016555315,0.017939255,0.6047615],"study_design_scores_gemma":[0.009335961,0.022017138,0.59898496,0.010450483,0.002349256,0.0028098791,0.010554694,0.09721164,0.095941424,0.042784043,0.10580243,0.001758084],"about_ca_topic_score_codex":0.0016515095,"about_ca_topic_score_gemma":0.00309549,"teacher_disagreement_score":0.55056244,"about_ca_system_score_codex":0.0032773847,"about_ca_system_score_gemma":0.009155004,"threshold_uncertainty_score":0.67894155},"labels":[],"label_agreement":null},{"id":"W2111817119","doi":"10.1016/j.jpainsymman.2009.06.013","title":"Evaluating Correlation and Interrater Reliability for Four Performance Scales in the Palliative Care Setting","year":2010,"lang":"en","type":"article","venue":"Journal of Pain and Symptom Management","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":56,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Health Sciences Centre; Sunnybrook Health Science Centre","funders":"","keywords":"Inter-rater reliability; Correlation; Medicine; Scale (ratio); Reliability (semiconductor); Kappa; Palliative care; Population; Statistics; Spearman's rank correlation coefficient; Intraclass correlation; Psychometrics; Clinical psychology; Rating scale; Nursing; Mathematics","score_opus":0.11947524826273714,"score_gpt":0.3982255808639538,"score_spread":0.2787503326012167,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2111817119","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.97341543,0.00078622013,0.020144489,0.00015303181,0.0002249345,0.00078188925,0.00021931356,0.000101178055,0.004173585],"genre_scores_gemma":[0.9868334,0.00020368135,0.011663655,0.000039931176,0.000048085098,0.00060692785,0.00022807291,0.00003786858,0.0003383761],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.8845154,0.075722665,0.012691357,0.005715979,0.019515518,0.001839084],"domain_scores_gemma":[0.556608,0.35796514,0.014432965,0.013865226,0.055175446,0.0019532368],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.108710304,0.0007852516,0.0014519106,0.0035887943,0.0021787798,0.0026258554,0.0013908686,0.0014523587,0.0007089553],"category_scores_gemma":[0.2678504,0.0009638503,0.0021031178,0.002468468,0.0029747116,0.0024827584,0.0028007366,0.0018077261,0.0004890064],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002686576,0.00062512135,0.8890794,0.0007673268,0.0019633772,0.00022880842,0.025985288,0.0032691306,0.0041659935,0.001925455,0.0011647893,0.06813881],"study_design_scores_gemma":[0.0004918892,0.003406892,0.92886543,0.00048656482,0.0015064791,0.0007150505,0.015137569,0.032666925,0.009254677,0.0038420858,0.003299476,0.00032678444],"about_ca_topic_score_codex":0.0028629084,"about_ca_topic_score_gemma":0.0063072266,"teacher_disagreement_score":0.108710304,"about_ca_system_score_codex":0.0018461302,"about_ca_system_score_gemma":0.002598538,"threshold_uncertainty_score":0.5749219},"labels":[],"label_agreement":null},{"id":"W2113321769","doi":"10.1136/eb-2013-101243","title":"The two-step Fagan's nomogram: ad hoc interpretation of a diagnostic test result without calculation","year":2013,"lang":"en","type":"article","venue":"Evidence-Based Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":136,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Prince Edward Island","funders":"","keywords":"Nomogram; Fagan inspection; Computer science; Test (biology); Medicine; Software engineering; Geology","score_opus":0.11527103256885256,"score_gpt":0.3861066713332384,"score_spread":0.2708356387643858,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2113321769","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013179299,0.016610079,0.9359894,0.0064059063,0.003434965,0.0034044117,0.0013628677,0.0013633345,0.018249787],"genre_scores_gemma":[0.17314273,0.009080163,0.80477524,0.0017238499,0.0019501615,0.0031139844,0.0011811982,0.00063792494,0.0043947655],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9612862,0.02344061,0.0046563246,0.0028202066,0.0072159395,0.0005808303],"domain_scores_gemma":[0.9309035,0.048613265,0.004177265,0.004789312,0.010336803,0.0011798842],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05881313,0.0025078766,0.0040078997,0.009951892,0.0021526047,0.0070855413,0.0031030064,0.0023228365,0.00537121],"category_scores_gemma":[0.15822032,0.0010696608,0.004688522,0.004286156,0.003245012,0.0044582943,0.004553264,0.004601576,0.002177442],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013313573,0.00013842901,0.03856027,0.004304432,0.002528051,0.0008319115,0.0017778124,0.021645168,0.0011598542,0.057803348,0.07973793,0.79018146],"study_design_scores_gemma":[0.0008666254,0.0023143422,0.03958431,0.007947457,0.0038044488,0.010021925,0.0025155009,0.2629789,0.006293549,0.2753058,0.38700882,0.001358276],"about_ca_topic_score_codex":0.0040840474,"about_ca_topic_score_gemma":0.0057201223,"teacher_disagreement_score":0.05881313,"about_ca_system_score_codex":0.0026423817,"about_ca_system_score_gemma":0.0066197217,"threshold_uncertainty_score":0.31103724},"labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"not_applicable","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"high"},{"model":"gpt","categories":[],"domain":null,"study_design":"design_other","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"medium"}],"label_agreement":"split"},{"id":"W2116873208","doi":"10.1071/nb12116","title":"Are pregnancy outcomes associated with risk factor reporting in routinely collected perinatal data?","year":2013,"lang":"en","type":"article","venue":"New South Wales Public Health Bulletin","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute of Aging","funders":"","keywords":"Medicine; Pregnancy; Medical record; Risk factor; Obstetrics; Kappa; Internal medicine","score_opus":0.37495525527933143,"score_gpt":0.39076785888721083,"score_spread":0.015812603607879394,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2116873208","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reporting","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"reporting","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9832281,0.0030445156,0.008368675,0.0007813771,0.00011414315,0.00018696005,0.0012515789,0.000036109617,0.0029885266],"genre_scores_gemma":[0.997027,0.0002619541,0.0019407291,0.00009751975,0.000027065436,0.000062160834,0.00050179265,0.000009004873,0.000072805175],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.80844593,0.12615842,0.03240155,0.008418122,0.021923969,0.0026520016],"domain_scores_gemma":[0.43646792,0.36880517,0.12854187,0.03726295,0.027517589,0.0014045176],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.10333541,0.00033469312,0.00077527977,0.0031265675,0.00055441546,0.0020900627,0.0012440882,0.0011187951,0.0005807464],"category_scores_gemma":[0.37187967,0.0006839787,0.001022299,0.004354066,0.0023142288,0.0018863669,0.0021007564,0.0009220655,0.00021221573],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00009850334,0.000016023667,0.99238455,0.00016397017,0.00017841859,0.000025789326,0.0009719165,0.00010880288,0.00012206397,0.00008251546,0.00007422422,0.0057731513],"study_design_scores_gemma":[0.000008102627,0.00013790745,0.9962703,0.00025967075,0.00013226634,0.00026031665,0.0010854469,0.00064164517,0.0004895879,0.00020770787,0.0004877966,0.00001940641],"about_ca_topic_score_codex":0.008111509,"about_ca_topic_score_gemma":0.0062206467,"teacher_disagreement_score":0.8966646,"about_ca_system_score_codex":0.0010858605,"about_ca_system_score_gemma":0.0015174681,"threshold_uncertainty_score":0.5464964},"labels":[],"label_agreement":null},{"id":"W2122573908","doi":"10.1177/0013164415574086","title":"A Ratio Test of Interrater Agreement With High Specificity","year":2015,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Trois-Rivières; University of Ottawa","funders":"","keywords":"Inter-rater reliability; Agreement; Psychology; Validation test; Test validity; Test (biology); Psychometrics; Statistics; Clinical psychology; Developmental psychology; Rating scale; Mathematics; Geology","score_opus":0.4746679401283067,"score_gpt":0.40888115156470517,"score_spread":0.06578678856360154,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2122573908","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07318521,0.0014357545,0.87282765,0.0010666294,0.00083103176,0.0022651763,0.0019615295,0.0020112093,0.04441579],"genre_scores_gemma":[0.74206364,0.0004019749,0.24749644,0.00073772675,0.0004470583,0.0029778343,0.0011457447,0.0004992673,0.004230266],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.83689827,0.09302918,0.012295284,0.02226278,0.033769947,0.0017446056],"domain_scores_gemma":[0.41974065,0.50057584,0.020496406,0.027792366,0.0298749,0.0015199357],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08930669,0.0016366763,0.0021464732,0.0070171696,0.0013427205,0.0041065933,0.0028101944,0.0028332018,0.012198562],"category_scores_gemma":[0.48236296,0.00078605977,0.0022458343,0.005844935,0.0044036172,0.0064115385,0.00395574,0.0026773135,0.0043639294],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0025028407,0.00062157074,0.16045557,0.003281934,0.0051320856,0.0011363216,0.0044287248,0.020909907,0.007461214,0.14112453,0.029794278,0.62315106],"study_design_scores_gemma":[0.0010884246,0.00583754,0.15959969,0.0024098095,0.0032180245,0.0139087085,0.0049932944,0.35051557,0.023434428,0.35547158,0.078384876,0.0011381132],"about_ca_topic_score_codex":0.00080281345,"about_ca_topic_score_gemma":0.0007070383,"teacher_disagreement_score":0.08930669,"about_ca_system_score_codex":0.0011032337,"about_ca_system_score_gemma":0.0021438368,"threshold_uncertainty_score":0.47230458},"labels":[],"label_agreement":null},{"id":"W2123033778","doi":"10.1177/0962280210383082","title":"Closed-form confidence intervals for functions of the normal mean and standard deviation","year":2010,"lang":"en","type":"article","venue":"Statistical Methods in Medical Research","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":172,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Robarts Clinical Trials; Western University","funders":"Ontario Ministry of Research and Innovation; Natural Sciences and Engineering Research Council of Canada","keywords":"Standard deviation; Confidence interval; Percentile; Mathematics; Statistics; Coefficient of variation; Robust confidence intervals; Normal distribution; Geometric standard deviation; Standard error; CDF-based nonparametric confidence interval; Variance (accounting); Mean difference; Range (aeronautics); Limits of agreement; Relative standard deviation; Medicine; Detection limit; Nuclear medicine","score_opus":0.35473691480919106,"score_gpt":0.6128973161725231,"score_spread":0.258160401363332,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2123033778","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0019833522,0.0011383679,0.99438196,0.00019923998,0.00007018195,0.00009502167,0.00015740706,0.00049353344,0.0014810177],"genre_scores_gemma":[0.16152579,0.0029087674,0.8287747,0.00044093208,0.00041249153,0.002185085,0.0012133726,0.000886674,0.0016522871],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.94887924,0.027877541,0.003729221,0.005805722,0.012593025,0.0011152558],"domain_scores_gemma":[0.52996665,0.40478343,0.018469922,0.01858508,0.027311541,0.0008834078],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06944848,0.0023016243,0.0036537936,0.008764308,0.0011370146,0.0063459473,0.0055090548,0.004454349,0.008516584],"category_scores_gemma":[0.4761174,0.0012189848,0.002813069,0.006026366,0.0043042284,0.008771112,0.0043184482,0.0071628224,0.0033343819],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00046360103,0.00020243562,0.005101642,0.0022813322,0.00077269005,0.00046725065,0.0017091238,0.14095221,0.0023287372,0.4686802,0.010985341,0.36605543],"study_design_scores_gemma":[0.00020171505,0.00030244535,0.004592849,0.0021242474,0.00030004734,0.0011680966,0.00048521295,0.41886684,0.0059215394,0.54655176,0.01911555,0.00036965826],"about_ca_topic_score_codex":0.001689323,"about_ca_topic_score_gemma":0.0008197676,"teacher_disagreement_score":0.06944848,"about_ca_system_score_codex":0.0020999429,"about_ca_system_score_gemma":0.002185207,"threshold_uncertainty_score":0.36728305},"labels":[],"label_agreement":null},{"id":"W2124853083","doi":"10.1080/19338240903348220","title":"Bayesian Method for Improving Logistic Regression Estimates under Group-Based Exposure Assessment with Additive Measurement Errors","year":2009,"lang":"en","type":"article","venue":"Archives of Environmental & Occupational Health","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta; University of Calgary","funders":"Canadian Institutes of Health Research","keywords":"Statistics; Bayesian probability; Logistic regression; Variance (accounting); Mathematics; Econometrics; Observational error; Odds ratio","score_opus":0.11740485703262345,"score_gpt":0.4164750196733869,"score_spread":0.29907016264076347,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2124853083","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0040368666,0.00011189471,0.9953434,0.000097651326,0.000019415738,0.00003796251,0.000020330779,0.00013574726,0.00019674614],"genre_scores_gemma":[0.12524849,0.00029040783,0.87241673,0.00017456494,0.00011756161,0.0003725935,0.00019927275,0.000108553904,0.001071889],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9777845,0.016442006,0.0006725246,0.0014709692,0.0032861365,0.0003438056],"domain_scores_gemma":[0.9462716,0.0429,0.0028179074,0.0034134616,0.004175685,0.00042139876],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.028530357,0.001080554,0.0022920652,0.0022168106,0.000871308,0.0012350908,0.0030264147,0.001913928,0.0018006705],"category_scores_gemma":[0.11019937,0.0008583267,0.0014046411,0.0018136926,0.0014464083,0.0021652614,0.0030352396,0.003104591,0.00074158434],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006704834,0.000319117,0.008594679,0.0005357311,0.00077232067,0.00025944423,0.0008989185,0.46740207,0.005071806,0.09696152,0.003845545,0.41466835],"study_design_scores_gemma":[0.00010953105,0.00013239084,0.0018132747,0.00006538446,0.000121998586,0.00010259144,0.00003050983,0.9475337,0.0015919327,0.046039507,0.0023909959,0.00006811836],"about_ca_topic_score_codex":0.0061465944,"about_ca_topic_score_gemma":0.0049024113,"teacher_disagreement_score":0.028530357,"about_ca_system_score_codex":0.0011152831,"about_ca_system_score_gemma":0.002440245,"threshold_uncertainty_score":0.15088475},"labels":[],"label_agreement":null},{"id":"W2129937394","doi":"10.1093/annhyg/46.suppl_1.247","title":"A Latent Variable Model for the Analysis of Variability in the Classification of Radiographs of Pneumoconioses","year":2002,"lang":"en","type":"article","venue":"The Annals of Occupational Hygiene","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Radiography; Pneumoconiosis; Context (archaeology); Statistic; Chest radiograph; Scan statistic; Medicine; Orthodontics; Radiology; Statistics; Mathematics; Pathology; Geography","score_opus":0.4967850990249517,"score_gpt":0.44147257714594407,"score_spread":0.05531252187900765,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2129937394","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.044973254,0.0005775737,0.9495436,0.0015667496,0.00022133875,0.000577408,0.0011205917,0.00033439105,0.0010850845],"genre_scores_gemma":[0.57836396,0.0010069088,0.40341216,0.00036113267,0.0004678258,0.0058463425,0.003380323,0.00014226482,0.0070190807],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9721487,0.020194609,0.0010490767,0.003412006,0.0020842003,0.0011115121],"domain_scores_gemma":[0.94453436,0.046665654,0.0035389343,0.0022881043,0.002312953,0.0006599259],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03860092,0.0017049155,0.0025456124,0.004163944,0.0014661094,0.0035988942,0.005114353,0.00333594,0.0051759817],"category_scores_gemma":[0.063181,0.00088268955,0.003217105,0.0041951225,0.0030996366,0.0030983137,0.002626651,0.005070721,0.0017711864],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017496657,0.0014868752,0.08090238,0.00071626366,0.0024073843,0.0008438907,0.004752949,0.36143503,0.0015918053,0.34458265,0.007818235,0.19171283],"study_design_scores_gemma":[0.00022801402,0.0006377667,0.012353995,0.0002027488,0.00021455281,0.00022515349,0.00038343956,0.8196311,0.00026405224,0.1616931,0.0039942367,0.00017186339],"about_ca_topic_score_codex":0.00911154,"about_ca_topic_score_gemma":0.006149366,"teacher_disagreement_score":0.03860092,"about_ca_system_score_codex":0.003080898,"about_ca_system_score_gemma":0.0036270425,"threshold_uncertainty_score":0.20414364},"labels":[],"label_agreement":null},{"id":"W2134076777","doi":"10.1016/j.jclinepi.2009.08.005","title":"A valid and reliable belief elicitation method for Bayesian priors","year":2009,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":80,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Women's College Hospital; University of Toronto; Toronto General Hospital; University Health Network; Toronto Western Hospital; Hospital for Sick Children; Public Health Ontario","funders":"Canadian Institutes of Health Research","keywords":"Prior probability; Bayesian probability; Expert elicitation; Statistics; Computer science; Econometrics; Mathematics","score_opus":0.5853364478923457,"score_gpt":0.6222949697557054,"score_spread":0.036958521863359683,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2134076777","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.002270498,0.000074790616,0.9955052,0.00039577388,0.000032554166,0.00023866852,0.00020325933,0.00022353858,0.0010556879],"genre_scores_gemma":[0.0842551,0.000117939104,0.91263366,0.00023944944,0.00008397829,0.0014024348,0.00038428252,0.00009471568,0.0007885777],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.92155415,0.059767507,0.0034961738,0.0040471633,0.010439379,0.00069561054],"domain_scores_gemma":[0.70103556,0.25081143,0.0071674488,0.021818278,0.018028816,0.0011385239],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.04757501,0.0014593329,0.0020228415,0.003057045,0.0015787513,0.003387183,0.0028203884,0.0033486185,0.006423545],"category_scores_gemma":[0.32118967,0.0011607015,0.0017386368,0.002982897,0.0019412356,0.0046321973,0.0050046374,0.005516848,0.0021270611],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014736512,0.00049562735,0.0041940473,0.0010393304,0.0006134632,0.00019662587,0.0032156263,0.04214112,0.0066272165,0.28998837,0.013905233,0.6361097],"study_design_scores_gemma":[0.00044098048,0.00033933995,0.0031612893,0.00051411614,0.00024600714,0.0003941264,0.00041823025,0.3852188,0.0074658073,0.5874419,0.014037027,0.00032232804],"about_ca_topic_score_codex":0.0021059008,"about_ca_topic_score_gemma":0.0024644062,"teacher_disagreement_score":0.952425,"about_ca_system_score_codex":0.0017878796,"about_ca_system_score_gemma":0.004448973,"threshold_uncertainty_score":0.25160372},"labels":[],"label_agreement":null},{"id":"W2134578783","doi":"10.1007/bf02294802","title":"A Two-Stage Logistic Regression Model for Analyzing Inter-Rater Agreement","year":2003,"lang":"en","type":"article","venue":"Psychometrika","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":27,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Cancer Care Ontario","funders":"","keywords":"Logistic regression; Covariate; Spurious relationship; Psychology; Statistics; Psychopathology; Inter-rater reliability; Population; Odds ratio; Odds; Regression analysis; Econometrics; Clinical psychology; Mathematics; Rating scale; Medicine","score_opus":0.39673202417244113,"score_gpt":0.4638417272771476,"score_spread":0.06710970310470649,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2134578783","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.022753838,0.0007437008,0.96664953,0.0014507506,0.00044840784,0.0025120748,0.0024440854,0.0016432897,0.0013542823],"genre_scores_gemma":[0.28969145,0.0012297399,0.66955364,0.0008775933,0.00064658595,0.01744238,0.005669033,0.0006277843,0.014261846],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.91368324,0.06715044,0.004348846,0.009364849,0.0036819847,0.0017706213],"domain_scores_gemma":[0.8862766,0.09134935,0.007164648,0.006754857,0.007684917,0.00076967885],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.09881462,0.0041448893,0.004241986,0.006661471,0.0016495145,0.003936643,0.011400569,0.0055049155,0.01054298],"category_scores_gemma":[0.13214225,0.002711957,0.008381107,0.00716443,0.0023332448,0.0068398155,0.004603098,0.008659735,0.0054661576],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005215137,0.001967552,0.12517893,0.0024720747,0.00742347,0.0023344296,0.0049405172,0.33080536,0.002232705,0.11040086,0.029490095,0.37753895],"study_design_scores_gemma":[0.00039317395,0.00093159097,0.008844115,0.00023126602,0.0005198758,0.00050785183,0.0002881258,0.9413409,0.0004622571,0.037167657,0.009015825,0.00029741877],"about_ca_topic_score_codex":0.010855671,"about_ca_topic_score_gemma":0.0077355313,"teacher_disagreement_score":0.09881462,"about_ca_system_score_codex":0.0030688446,"about_ca_system_score_gemma":0.0043444624,"threshold_uncertainty_score":0.5225879},"labels":[],"label_agreement":null},{"id":"W2134799834","doi":"10.1093/ije/29.6.1070","title":"The effect of collapsing multinomial data when assessing agreement","year":2000,"lang":"en","type":"article","venue":"International Journal of Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":23,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Multinomial distribution; Agreement; Medicine; Statistics; Econometrics; Mathematics","score_opus":0.2977449565525722,"score_gpt":0.4964184161530347,"score_spread":0.1986734596004625,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2134799834","genre_codex":"methods","genre_gemma":"methods","domain_codex":"methods","domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.15047736,0.0024699809,0.83758247,0.0027431934,0.00037138525,0.0014047935,0.00036872097,0.000547717,0.0040343544],"genre_scores_gemma":[0.6009499,0.00046064885,0.39440647,0.001380988,0.00017255181,0.0017692407,0.00029883254,0.00022361406,0.00033777274],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.27630815,0.6520633,0.0293916,0.017136473,0.023255026,0.001845348],"domain_scores_gemma":[0.026168833,0.9217335,0.01643393,0.030334061,0.0048094704,0.00052032236],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.51364994,0.0017382297,0.0030206966,0.004276391,0.0032697655,0.0055601425,0.0038427773,0.004474631,0.002813509],"category_scores_gemma":[0.8400962,0.0018158297,0.0049738446,0.0055926903,0.013746716,0.011168258,0.009659805,0.006381457,0.0005042285],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.010650378,0.00066206214,0.35712528,0.004037136,0.008805807,0.0013233257,0.02082199,0.061943557,0.0067600184,0.078771956,0.0040857396,0.44501287],"study_design_scores_gemma":[0.0017446278,0.0075325067,0.22944278,0.006003053,0.0063278596,0.0055327243,0.0075109904,0.26851967,0.030171243,0.41870996,0.017352188,0.001152331],"about_ca_topic_score_codex":0.0018074722,"about_ca_topic_score_gemma":0.0015905246,"teacher_disagreement_score":0.51364994,"about_ca_system_score_codex":0.002496805,"about_ca_system_score_gemma":0.003004663,"threshold_uncertainty_score":0.59975624},"labels":[],"label_agreement":null},{"id":"W2136733697","doi":"","title":"Estimating agreement coefficients from sample survey data","year":2012,"lang":"en","type":"article","venue":"Survey methodology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Jackknife resampling; Statistics; Concordance; Mathematics; Cohen's kappa; Standard error; Correlation coefficient; Variance (accounting); Sampling (signal processing); Sample (material); Concordance correlation coefficient; Linearization; Computer science; Medicine; Nonlinear system; Accounting","score_opus":0.8726461020763974,"score_gpt":0.5551506380714631,"score_spread":0.3174954640049342,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2136733697","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.051995743,0.0007304085,0.9406683,0.00024148464,0.000083840794,0.00076315383,0.0016015861,0.0003373589,0.0035781658],"genre_scores_gemma":[0.3765196,0.0007609955,0.6133072,0.00021418835,0.00009485959,0.004431139,0.0033310778,0.00020231733,0.0011386712],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.85182,0.112226576,0.008060731,0.010300496,0.016236601,0.0013555909],"domain_scores_gemma":[0.5704598,0.35742676,0.01932994,0.026162423,0.026129832,0.000491197],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.10538466,0.0010628287,0.0021589026,0.0070083435,0.00084665447,0.0023807327,0.0022412422,0.0011281832,0.0022805235],"category_scores_gemma":[0.41500014,0.0010284211,0.0024302134,0.00827742,0.0013380712,0.0030408027,0.003251896,0.0021084072,0.0010317861],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00034113097,0.00027088198,0.2819562,0.00237243,0.004059787,0.00040778535,0.006677616,0.06827175,0.0015583605,0.11232708,0.012038996,0.50971794],"study_design_scores_gemma":[0.0002404248,0.0009459916,0.22392887,0.0015411866,0.0017621696,0.0012043404,0.0035275777,0.3681023,0.0062329816,0.34106496,0.05101616,0.00043299395],"about_ca_topic_score_codex":0.004720649,"about_ca_topic_score_gemma":0.004209563,"teacher_disagreement_score":0.89461535,"about_ca_system_score_codex":0.0013295187,"about_ca_system_score_gemma":0.00263155,"threshold_uncertainty_score":0.55733407},"labels":[],"label_agreement":null},{"id":"W2138454932","doi":"10.1111/1467-9884.00331","title":"An exact bootstrap confidence interval for kappa in small samples","year":2002,"lang":"en","type":"article","venue":"Journal of the Royal Statistical Society Series D (The Statistician)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":23,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Cancer Care Ontario","funders":"","keywords":"Confidence interval; Statistics; Mathematics; Sample size determination; Coverage probability; CDF-based nonparametric confidence interval; Robust confidence intervals; Monte Carlo method; Exact statistics; Binary number; Sample (material); Distribution (mathematics); Mathematical analysis; Arithmetic; Physics","score_opus":0.20950103259085956,"score_gpt":0.3675185352347408,"score_spread":0.15801750264388126,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2138454932","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.019998021,0.0017871492,0.9665893,0.00055338594,0.00027809278,0.00025079065,0.00054506894,0.0011892113,0.008809014],"genre_scores_gemma":[0.49820665,0.00062301004,0.49668556,0.0004965213,0.00036091995,0.0011936211,0.00087393,0.00033418275,0.00122572],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.92696965,0.047153465,0.0034083012,0.0058092196,0.015603658,0.0010557645],"domain_scores_gemma":[0.6136707,0.3111087,0.013986479,0.02887172,0.030542709,0.0018197073],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05655868,0.0007967751,0.0022473768,0.007093227,0.0011640099,0.0026219247,0.0034493052,0.0028165248,0.0060360646],"category_scores_gemma":[0.41308802,0.0006145223,0.0016567869,0.003805595,0.0030318361,0.003826568,0.0038943659,0.0032115239,0.001722131],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0022344864,0.00023832667,0.027955452,0.0022590174,0.0011560721,0.0009603993,0.0029554323,0.065708846,0.0034869132,0.24529804,0.022920888,0.62482613],"study_design_scores_gemma":[0.0005688314,0.0013694809,0.03579877,0.0020902173,0.0005718397,0.003933115,0.001252411,0.48393068,0.009620993,0.41547698,0.044835463,0.0005512761],"about_ca_topic_score_codex":0.0014628022,"about_ca_topic_score_gemma":0.00078414235,"teacher_disagreement_score":0.05655868,"about_ca_system_score_codex":0.0012140162,"about_ca_system_score_gemma":0.0012721017,"threshold_uncertainty_score":0.29911447},"labels":[],"label_agreement":null},{"id":"W2138928670","doi":"10.1177/0163278711425041","title":"A Comparison of Empirical Ranking Methods of Frequency and Severity Ratings of Clinical Presentations","year":2011,"lang":"en","type":"article","venue":"Evaluation & the Health Professions","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Health Sciences Centre; University of Calgary","funders":"","keywords":"Ranking (information retrieval); Statistics; Psychology; Medicine; MEDLINE; Econometrics; Clinical psychology; Computer science; Mathematics; Artificial intelligence; Biology","score_opus":0.893414992052289,"score_gpt":0.7377671514789872,"score_spread":0.15564784057330183,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2138928670","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6435356,0.004562436,0.33068556,0.0010849145,0.0005143899,0.0017884658,0.0010912062,0.00059336517,0.016144069],"genre_scores_gemma":[0.9085012,0.0006964726,0.08849127,0.000097625525,0.00012313173,0.00080712646,0.0004901586,0.00007305875,0.0007199694],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.7082744,0.24139306,0.010089016,0.0051638274,0.034149844,0.0009298501],"domain_scores_gemma":[0.26345524,0.6761554,0.017676327,0.014593705,0.027519075,0.00060034206],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1339853,0.0009208838,0.0010043886,0.008798724,0.0007608257,0.0025371416,0.0014870132,0.00092150347,0.0019250914],"category_scores_gemma":[0.4594454,0.0005082301,0.0014420885,0.005370594,0.0019616634,0.003054311,0.0018910113,0.0010475348,0.0005414248],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0025153693,0.0009047591,0.47032908,0.0022239122,0.0031968553,0.00012943747,0.011964267,0.012817279,0.0012897016,0.015299257,0.004441934,0.47488824],"study_design_scores_gemma":[0.0012201304,0.006131861,0.6722809,0.0020821919,0.0009824446,0.0011375778,0.019977037,0.24547864,0.004559177,0.032644086,0.012627786,0.0008782769],"about_ca_topic_score_codex":0.0025381178,"about_ca_topic_score_gemma":0.0032409765,"teacher_disagreement_score":0.8660147,"about_ca_system_score_codex":0.0017981157,"about_ca_system_score_gemma":0.0015313625,"threshold_uncertainty_score":0.70859045},"labels":[],"label_agreement":null},{"id":"W2140519023","doi":"10.1002/9781118445112.stat05255","title":"Receiver Operating Characteristic (<scp>ROC</scp>) Curves","year":2014,"lang":"en","type":"other","venue":"Wiley StatsRef: Statistics Reference Online","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":39,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Receiver operating characteristic; Fraction (chemistry); Boundary (topology); Mathematics; Statistics; Arbitrariness; Mathematical analysis; Chromatography","score_opus":0.14698234004203004,"score_gpt":0.38344374048368907,"score_spread":0.23646140044165903,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2140519023","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.021099022,0.044475906,0.50127006,0.008885007,0.0035015084,0.0026494304,0.15491395,0.031757038,0.23144802],"genre_scores_gemma":[0.26024795,0.032455362,0.47683942,0.0053120977,0.0048289425,0.007338484,0.11575182,0.016424432,0.08080152],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9739127,0.011002247,0.0038199248,0.0019396113,0.008836294,0.0004892241],"domain_scores_gemma":[0.864269,0.09007046,0.012367347,0.008719168,0.023701144,0.0008727949],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0207505,0.0017905146,0.0016332313,0.013993782,0.00044831005,0.0033758439,0.0021211244,0.0016208652,0.065124325],"category_scores_gemma":[0.17577505,0.00047293783,0.0020316213,0.015379011,0.00091366045,0.003332625,0.0016836479,0.0020509327,0.036786485],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00078424526,0.00014815167,0.013652549,0.006273397,0.00053921004,0.00043445782,0.0003739937,0.0055977535,0.00091457483,0.036213737,0.44435546,0.49071252],"study_design_scores_gemma":[0.00028483677,0.00091010705,0.04921104,0.0065149786,0.00079083984,0.00506511,0.0005029502,0.0213976,0.008054194,0.06561205,0.84117025,0.00048606066],"about_ca_topic_score_codex":0.0018156369,"about_ca_topic_score_gemma":0.0014010192,"teacher_disagreement_score":0.065124325,"about_ca_system_score_codex":0.0014912417,"about_ca_system_score_gemma":0.0017457446,"threshold_uncertainty_score":0.2178626},"labels":[],"label_agreement":null},{"id":"W2142200036","doi":"10.1002/sim.3110","title":"Reliability analysis for continuous measurements: Equivalence test for agreement","year":2007,"lang":"en","type":"article","venue":"Statistics in Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":34,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Western Hospital; University Health Network; Memorial University of Newfoundland; Canadian Blood Services; University of Toronto","funders":"","keywords":"Repeatability; Equivalence (formal languages); Reliability (semiconductor); Inter-rater reliability; Computer science; Reliability engineering; Intra-rater reliability; Statistics; Test (biology); Consistency (knowledge bases); Mathematics; Rating scale; Artificial intelligence; Engineering","score_opus":0.20769671851629035,"score_gpt":0.4449493606354994,"score_spread":0.23725264211920905,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2142200036","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.022663984,0.0016050318,0.9627304,0.00045544494,0.00047481697,0.0034517588,0.00073841243,0.00050280354,0.0073773637],"genre_scores_gemma":[0.40047607,0.0010605893,0.5779858,0.000394271,0.00036695955,0.016708303,0.0011974993,0.0005557671,0.0012546061],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.6621769,0.24161531,0.021819903,0.020460978,0.052121587,0.0018052773],"domain_scores_gemma":[0.386167,0.5346315,0.016359791,0.02859927,0.03315164,0.0010907608],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.21806082,0.0017636183,0.0047329627,0.00894103,0.0017093739,0.0032660798,0.003075668,0.0023308308,0.0052670618],"category_scores_gemma":[0.5577832,0.00095688493,0.0049238116,0.008624847,0.0053862967,0.0059233936,0.0055586873,0.00462281,0.0015519756],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.004907642,0.0008974779,0.08637467,0.0101601165,0.00964405,0.0007209774,0.015450145,0.02454078,0.0047514043,0.18813539,0.016967436,0.6374499],"study_design_scores_gemma":[0.0018002593,0.010333047,0.14354296,0.004874429,0.00464783,0.0031456558,0.007238552,0.24099806,0.008948206,0.49896193,0.07434412,0.0011648976],"about_ca_topic_score_codex":0.001116363,"about_ca_topic_score_gemma":0.0007126562,"teacher_disagreement_score":0.21806082,"about_ca_system_score_codex":0.002057025,"about_ca_system_score_gemma":0.0044190898,"threshold_uncertainty_score":0.96427023},"labels":[],"label_agreement":null},{"id":"W2142892303","doi":"10.2466/pr0.2000.87.3f.1171","title":"Creating Comparability among Reliability Coefficients: The Case of Cronbach Alpha and Cohen Kappa","year":2000,"lang":"en","type":"article","venue":"Psychological Reports","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":44,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Winnipeg","funders":"","keywords":"Cronbach's alpha; Comparability; Kappa; Psychology; Reliability (semiconductor); Alpha (finance); Estimator; Statistics; Metric (unit); Cohen's kappa; Contrast (vision); Complement (music); Psychometrics; Social psychology; Clinical psychology; Mathematics; Computer science; Artificial intelligence; Combinatorics; Chemistry; Engineering","score_opus":0.12349732271461297,"score_gpt":0.4136398494609489,"score_spread":0.2901425267463359,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2142892303","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.06320585,0.004951853,0.8967443,0.0023089673,0.0018978382,0.0015836189,0.0006063784,0.0010303793,0.027670858],"genre_scores_gemma":[0.47780666,0.0011704172,0.5149935,0.00064088387,0.00076660025,0.0022260097,0.00042421874,0.0005149256,0.001456862],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.59011394,0.28146675,0.030611143,0.031041998,0.064352855,0.002413269],"domain_scores_gemma":[0.30955252,0.5167066,0.03425601,0.07215506,0.065520555,0.0018093073],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2893915,0.0019401162,0.0026170996,0.013439877,0.0024207698,0.0087590935,0.0039552986,0.0026501755,0.002251213],"category_scores_gemma":[0.6922681,0.0014967126,0.0018644318,0.010257293,0.010297118,0.012493616,0.007947391,0.005799122,0.0010238313],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00085620227,0.00016747936,0.07863238,0.0036842402,0.0040346263,0.0005735213,0.024295988,0.005090767,0.0046013733,0.2869406,0.014680661,0.5764422],"study_design_scores_gemma":[0.0002512812,0.0012678986,0.08909812,0.004478869,0.0018179356,0.0019095549,0.014036388,0.036019534,0.01323705,0.7534858,0.08356907,0.0008284727],"about_ca_topic_score_codex":0.0022604063,"about_ca_topic_score_gemma":0.0020356723,"teacher_disagreement_score":0.7106085,"about_ca_system_score_codex":0.0029956545,"about_ca_system_score_gemma":0.0049850526,"threshold_uncertainty_score":0.87630683},"labels":[],"label_agreement":null},{"id":"W2143965974","doi":"10.1093/ije/dyp370","title":"Forest plots in reports of systematic reviews: a cross-sectional study reviewing current practice","year":2010,"lang":"en","type":"article","venue":"International Journal of Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":87,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"Cancer Research UK; University of Ottawa","keywords":"Cross-sectional study; Current (fluid); Medicine; MEDLINE; Systematic review; Environmental health; Geography; Political science; Engineering; Pathology","score_opus":0.5444736336084718,"score_gpt":0.5819775103364283,"score_spread":0.03750387672795652,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2143965974","genre_codex":"review","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reporting","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"reporting","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.3573643,0.5232458,0.052304097,0.010505658,0.0022515047,0.024222689,0.0209407,0.0006203551,0.008544819],"genre_scores_gemma":[0.8726303,0.04452614,0.04371454,0.004376017,0.0009314964,0.028197465,0.004550014,0.00029388882,0.00078017515],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.3680687,0.27621844,0.25226045,0.03190148,0.06823771,0.0033132543],"domain_scores_gemma":[0.07207054,0.59957725,0.2606144,0.025798008,0.04032029,0.0016194737],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.34715736,0.0015002191,0.0052326326,0.04341212,0.0030497136,0.008866622,0.0031527877,0.0037264766,0.008365551],"category_scores_gemma":[0.79555887,0.0034851758,0.0067053363,0.054125216,0.0061758715,0.019414637,0.008046193,0.0029238681,0.0015142462],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0025305988,0.0002908027,0.6813094,0.12809698,0.009606525,0.00077392306,0.023797058,0.0005913458,0.000679402,0.004578889,0.015702605,0.13204245],"study_design_scores_gemma":[0.002024978,0.0026771459,0.65289724,0.20173258,0.018169774,0.010086456,0.030256072,0.0031032981,0.002012328,0.0132266125,0.06315677,0.0006566588],"about_ca_topic_score_codex":0.0032256073,"about_ca_topic_score_gemma":0.00509193,"teacher_disagreement_score":0.65284264,"about_ca_system_score_codex":0.007858462,"about_ca_system_score_gemma":0.011244111,"threshold_uncertainty_score":0.80507123},"labels":[],"label_agreement":null},{"id":"W2146976162","doi":"10.1002/(sici)1097-0258(20000215)19:3<373::aid-sim337>3.0.co;2-y","title":"Testing the equality of two dependent kappa statistics","year":2000,"lang":"en","type":"article","venue":"Statistics in Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":89,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph; Western University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Statistics; Kappa; Correlation; Monte Carlo method; Mathematics; Cohen's kappa; Goodness of fit; Dependency (UML); Sample size determination; Variable (mathematics); Computer science; Artificial intelligence","score_opus":0.2670104097609483,"score_gpt":0.4556427207423286,"score_spread":0.18863231098138028,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2146976162","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.058271896,0.000765665,0.927771,0.00034207373,0.00032273767,0.0017461998,0.0008243784,0.0009541623,0.009001925],"genre_scores_gemma":[0.48032713,0.00044449553,0.5114686,0.00025269846,0.00014132175,0.0047022756,0.00094646093,0.0004831482,0.0012338781],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.6833567,0.20184842,0.024418235,0.026637187,0.06068893,0.0030505066],"domain_scores_gemma":[0.29304883,0.58917,0.031476486,0.04178861,0.041994408,0.0025216897],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.20248723,0.0017242522,0.0034663195,0.010813658,0.0026796486,0.0046273475,0.0045209727,0.0030467499,0.006440107],"category_scores_gemma":[0.64147663,0.001136942,0.0034698679,0.0055543347,0.008107116,0.0061326753,0.008412695,0.0036412317,0.0020405254],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0048524304,0.0004249489,0.08294743,0.0039980374,0.0050793365,0.0012062038,0.011640886,0.023954839,0.009584379,0.21625814,0.012147631,0.6279057],"study_design_scores_gemma":[0.0012101297,0.0053887633,0.15781859,0.0028396081,0.002276931,0.0061951396,0.008677211,0.1980949,0.031480923,0.54214966,0.042150002,0.0017180804],"about_ca_topic_score_codex":0.0014448762,"about_ca_topic_score_gemma":0.0010685647,"teacher_disagreement_score":0.20248723,"about_ca_system_score_codex":0.0020563537,"about_ca_system_score_gemma":0.0042512994,"threshold_uncertainty_score":0.9834752},"labels":[],"label_agreement":null},{"id":"W2149750314","doi":"10.1136/jech.2003.010546","title":"A simple model for potential use with a misclassified binary outcome in epidemiology","year":2004,"lang":"en","type":"article","venue":"Journal of Epidemiology & Community Health","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":37,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Medicine; Epidemiology; Spurious relationship; Context (archaeology); Statistics; Outcome (game theory); Logistic regression; Odds ratio; Disease; Econometrics; Pathology; Internal medicine; Mathematics","score_opus":0.6286775932544271,"score_gpt":0.5194982981963062,"score_spread":0.10917929505812085,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2149750314","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00887225,0.00052457716,0.98522204,0.0018401584,0.00028334814,0.0005707388,0.00074127305,0.00027379987,0.00167177],"genre_scores_gemma":[0.34088278,0.0017839669,0.6296986,0.0012645515,0.00071892014,0.007607404,0.0017190865,0.00012360164,0.016201155],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9766758,0.017834358,0.00072540547,0.0028609373,0.0014452793,0.00045828917],"domain_scores_gemma":[0.92877287,0.060466025,0.003834408,0.0036725104,0.0027634567,0.0004908079],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.037232753,0.0018437428,0.0030213315,0.0025082403,0.0009927744,0.0035028527,0.005734198,0.0050358386,0.008641531],"category_scores_gemma":[0.11221849,0.0009977795,0.002658679,0.0029757977,0.0022336745,0.0037503522,0.0024720423,0.0037427344,0.002181486],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00069345196,0.00041772987,0.02269953,0.0010884978,0.0013195976,0.001015209,0.0011729979,0.28659302,0.0006210046,0.5269617,0.011853264,0.14556406],"study_design_scores_gemma":[0.00038094437,0.0005032282,0.004553815,0.00040901202,0.0004583632,0.0009426846,0.0001244031,0.6428751,0.00033805883,0.33819312,0.011078284,0.00014300614],"about_ca_topic_score_codex":0.0056013768,"about_ca_topic_score_gemma":0.0038051864,"teacher_disagreement_score":0.96276724,"about_ca_system_score_codex":0.002082832,"about_ca_system_score_gemma":0.0032306674,"threshold_uncertainty_score":0.196908},"labels":[],"label_agreement":null},{"id":"W2151442672","doi":"10.1002/nur.20095","title":"A hybrid qualitative method for pretesting questionnaires: The example of a questionnaire to caregivers of Alzheimer disease patients","year":2005,"lang":"en","type":"article","venue":"Research in Nursing & Health","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":32,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"St. Joseph’s Healthcare Hamilton; McGill University; McMaster University; Jewish General Hospital","funders":"","keywords":"Interview; Disease; Psychology; Clinical psychology; Cognition; Family medicine; Medicine; Gerontology; Psychiatry","score_opus":0.4164801381706226,"score_gpt":0.5917608903707678,"score_spread":0.17528075220014522,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2151442672","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.26882175,0.00034873857,0.6867851,0.0020382844,0.00022307607,0.030176632,0.0007016031,0.0006492791,0.010255493],"genre_scores_gemma":[0.2582456,0.0001833272,0.704586,0.00089513103,0.000048081725,0.03395534,0.00014680854,0.00008644547,0.0018532039],"study_design_codex":"design_other","study_design_gemma":"qualitative","domain_scores_codex":[0.8947541,0.0977271,0.0016524818,0.0015983536,0.0033234458,0.0009444863],"domain_scores_gemma":[0.88197863,0.10286856,0.0020946858,0.0056660688,0.00651959,0.00087241083],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.05712531,0.0010655847,0.000635421,0.0022663635,0.002567614,0.0013450172,0.0016311542,0.0014502475,0.0038210752],"category_scores_gemma":[0.060223788,0.00066890346,0.00063692714,0.0014597559,0.0033569501,0.0019689351,0.003040651,0.0012330096,0.0012456551],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011594035,0.0016516221,0.011547524,0.0043188455,0.00010368783,0.0015226211,0.45478928,0.0022441568,0.035961725,0.013374979,0.0076386114,0.46568757],"study_design_scores_gemma":[0.002977878,0.014528557,0.0362643,0.006954261,0.00038970582,0.0067339437,0.4993533,0.04163739,0.08432719,0.062232103,0.24371262,0.0008887135],"about_ca_topic_score_codex":0.00120187,"about_ca_topic_score_gemma":0.0031483772,"teacher_disagreement_score":0.94287467,"about_ca_system_score_codex":0.0019501388,"about_ca_system_score_gemma":0.0026865199,"threshold_uncertainty_score":0.30211115},"labels":[],"label_agreement":null},{"id":"W2152177373","doi":"10.2106/jbjs.h.01624","title":"Evaluating Agreement: Conducting a Reliability Study","year":2009,"lang":"en","type":"article","venue":"Journal of Bone and Joint Surgery","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":162,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Sunnybrook Health Science Centre; University of Toronto; McMaster University","funders":"","keywords":"Reliability (semiconductor); Sample size determination; Computer science; Reliability engineering; Context (archaeology); Test (biology); Psychology; Statistics; Engineering; Mathematics; Power (physics)","score_opus":0.5353733677564685,"score_gpt":0.4567027472231148,"score_spread":0.07867062053335366,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2152177373","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.21939208,0.0046281964,0.7206406,0.0027109212,0.001274124,0.021918114,0.0010788026,0.0009971549,0.027359948],"genre_scores_gemma":[0.4933471,0.001227017,0.49010575,0.0004936762,0.00023514092,0.012984136,0.00040603202,0.00027841004,0.0009227138],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.5381239,0.33336452,0.055853672,0.012242255,0.05785561,0.0025600023],"domain_scores_gemma":[0.23550802,0.5752224,0.03693643,0.036228333,0.113873005,0.0022317981],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.4181999,0.0011639822,0.0032353494,0.009726854,0.0023295372,0.0052496702,0.0022004356,0.0018245582,0.0023113207],"category_scores_gemma":[0.6037973,0.0013282165,0.003497946,0.0079826685,0.004677529,0.0065166648,0.0047644884,0.0028149355,0.0010439204],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0032200848,0.0013212996,0.27081603,0.012767033,0.0054133204,0.0006365091,0.06580012,0.005184701,0.008110365,0.03327017,0.013662627,0.5797978],"study_design_scores_gemma":[0.0013801147,0.015239354,0.4840362,0.015131191,0.0073649967,0.0041748355,0.09179558,0.06823237,0.038922016,0.16251843,0.10923865,0.001966278],"about_ca_topic_score_codex":0.001443193,"about_ca_topic_score_gemma":0.0016380013,"teacher_disagreement_score":0.5818001,"about_ca_system_score_codex":0.0024592516,"about_ca_system_score_gemma":0.0071482453,"threshold_uncertainty_score":0.71746314},"labels":[],"label_agreement":null},{"id":"W2155243985","doi":"10.20982/tqmp.08.1.p023","title":"Computing Inter-Rater Reliability for Observational Data: An Overview and Tutorial","year":2012,"lang":"en","type":"article","venue":"Tutorials in Quantitative Methods for Psychology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":3862,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"National Institute on Alcohol Abuse and Alcoholism","keywords":"Observational study; Reliability (semiconductor); Computer science; Syntax; Consistency (knowledge bases); Class (philosophy); Statistics; Multiple comparisons problem; Inter-rater reliability; Econometrics; Mathematics; Artificial intelligence; Power (physics); Rating scale","score_opus":0.8909602875101015,"score_gpt":0.7046596688682544,"score_spread":0.1863006186418471,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2155243985","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00043525238,0.00898443,0.98431385,0.00067937333,0.000236491,0.0006642518,0.0004387389,0.001761443,0.0024861963],"genre_scores_gemma":[0.0031879563,0.012083517,0.9792595,0.00022451731,0.00045595478,0.0022164793,0.0007712265,0.0007829313,0.0010178345],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.93201876,0.04221538,0.008408046,0.0037934247,0.0131046,0.00045977393],"domain_scores_gemma":[0.83942944,0.123764,0.0069268476,0.0067720655,0.022340655,0.0007670119],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.06979387,0.0036537186,0.003127687,0.016182635,0.0012091611,0.0038072944,0.003599142,0.0027873102,0.013224931],"category_scores_gemma":[0.14076422,0.0028588658,0.0033965737,0.015002665,0.0019474392,0.008113082,0.0033348822,0.004965792,0.01857237],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00009429502,0.00017787915,0.0020266073,0.006763141,0.00033098884,0.00027021064,0.0020593205,0.0032739926,0.0052896533,0.044944905,0.066193245,0.86857563],"study_design_scores_gemma":[0.00016495728,0.000791866,0.013655644,0.010973508,0.00046599237,0.005431902,0.0017216293,0.05035447,0.019970953,0.22960426,0.66579854,0.0010663208],"about_ca_topic_score_codex":0.0016949889,"about_ca_topic_score_gemma":0.0020949037,"teacher_disagreement_score":0.9302061,"about_ca_system_score_codex":0.0015060847,"about_ca_system_score_gemma":0.0032998258,"threshold_uncertainty_score":0.3691097},"labels":[],"label_agreement":null},{"id":"W2155433306","doi":"10.1590/s1413-35552006000200002","title":"Importance and clarification of measurement properties in rehabilitation","year":2006,"lang":"en","type":"article","venue":"Brazilian Journal of Physical Therapy","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":109,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Canadian Institutes of Health Research; Coordenação de Aperfeiçoamento de Pessoal de Nível Superior; University of Alberta","keywords":"Reliability (semiconductor); Rehabilitation; Quality (philosophy); Clinical Practice; Validity; Field (mathematics); Psychology; Applied psychology; Computer science; Management science; Psychometrics; Medicine; Power (physics); Physical therapy; Clinical psychology; Engineering; Mathematics; Epistemology","score_opus":0.1405243827265361,"score_gpt":0.32899155337758973,"score_spread":0.18846717065105362,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2155433306","genre_codex":"methods","genre_gemma":"methods","domain_codex":"methods","domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.037795555,0.05266853,0.7981293,0.072607316,0.007349647,0.0027470356,0.00042341152,0.00050686236,0.027772307],"genre_scores_gemma":[0.58517843,0.009730586,0.38458815,0.009261401,0.0027686812,0.0068391124,0.0002681579,0.0003439474,0.0010215892],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.2757599,0.59464335,0.06579299,0.01034944,0.051466063,0.0019882992],"domain_scores_gemma":[0.078285,0.81233484,0.03484827,0.034918725,0.039032377,0.00058085454],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.5265373,0.0018790514,0.005026582,0.008848739,0.004210239,0.012727854,0.004794448,0.0050839474,0.002679521],"category_scores_gemma":[0.7908763,0.0017974465,0.0038863535,0.008381511,0.02299368,0.02787443,0.0111335255,0.011215043,0.0006656747],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004245309,0.00021033532,0.020328369,0.021607174,0.001282085,0.00058767106,0.043884996,0.0037919744,0.0017423355,0.5092048,0.009624623,0.3873112],"study_design_scores_gemma":[0.00027882322,0.0008374367,0.028128916,0.044360317,0.0015817139,0.0021145989,0.022042839,0.017377669,0.0066255983,0.7739904,0.10198138,0.0006803665],"about_ca_topic_score_codex":0.002000458,"about_ca_topic_score_gemma":0.0013747254,"teacher_disagreement_score":0.5265373,"about_ca_system_score_codex":0.008790876,"about_ca_system_score_gemma":0.016108269,"threshold_uncertainty_score":0.58386385},"labels":[],"label_agreement":null},{"id":"W2162264344","doi":"10.1002/9781118445112.stat05301","title":"Agreement, Measurement of","year":2014,"lang":"en","type":"other","venue":"Wiley StatsRef: Statistics Reference Online","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Categorical variable; Agreement; Unanimity; Measure (data warehouse); Interpretation (philosophy); Kappa; Statistics; Mathematics; Interval (graph theory); Monotonic function; Computer science; Data mining; Combinatorics; Mathematical analysis; Geometry","score_opus":0.2273606341632211,"score_gpt":0.39418978133845184,"score_spread":0.16682914717523073,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2162264344","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07507597,0.0508103,0.35154676,0.01779015,0.0084059285,0.003922579,0.0134355435,0.0014971159,0.47751558],"genre_scores_gemma":[0.78785723,0.01578055,0.14785491,0.00605852,0.0024993112,0.005790477,0.005460789,0.0009787648,0.027719546],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9015519,0.04194791,0.010064075,0.01257345,0.032538895,0.0013237874],"domain_scores_gemma":[0.83047277,0.098663874,0.016050871,0.016495364,0.03579589,0.0025212897],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05566647,0.0008871348,0.0011929952,0.007539837,0.0016019753,0.0055808015,0.0024469437,0.0013147878,0.026872337],"category_scores_gemma":[0.2766476,0.00043700685,0.0010467601,0.0073487447,0.005055487,0.008486732,0.0070249056,0.0026601674,0.0064253015],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000585106,0.00020480572,0.03809307,0.0063783685,0.0007519095,0.0002215965,0.017791076,0.0014552411,0.0011141185,0.2418638,0.08018415,0.61135685],"study_design_scores_gemma":[0.000094142066,0.00046955782,0.057218067,0.008544522,0.0005091165,0.0013620786,0.010326557,0.0032148135,0.0028226208,0.45241082,0.46273416,0.00029345154],"about_ca_topic_score_codex":0.0018113711,"about_ca_topic_score_gemma":0.0016395218,"teacher_disagreement_score":0.05566647,"about_ca_system_score_codex":0.0038451366,"about_ca_system_score_gemma":0.0052785114,"threshold_uncertainty_score":0.29439592},"labels":[],"label_agreement":null},{"id":"W2163148621","doi":"10.3138/jvme.37.4.377","title":"North American Veterinary Licensing Examination Pacing Study","year":2010,"lang":"en","type":"article","venue":"Journal of Veterinary Medical Education","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Medicine; Test (biology); Psychology; Word (group theory); Presentation (obstetrics); Mathematics; Surgery","score_opus":0.2172615267746426,"score_gpt":0.46451331547140057,"score_spread":0.24725178869675796,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2163148621","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99770844,0.000058596273,0.00008826654,0.00011259356,0.000009047746,0.00006285402,0.00006634036,0.0000019881877,0.0018918312],"genre_scores_gemma":[0.9983633,0.0000985231,0.00022884425,0.00013128304,0.000023383664,0.00014479694,0.00013813867,0.000002704652,0.00086900045],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9937272,0.0031719515,0.00054706616,0.00048256989,0.0017448845,0.0003262867],"domain_scores_gemma":[0.9714947,0.011711735,0.0056389733,0.0014785993,0.007031955,0.0026440127],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0052799787,0.00018964346,0.0003654172,0.0011804102,0.0009371623,0.00059254444,0.0005102847,0.0004869579,0.002631729],"category_scores_gemma":[0.021399697,0.00034726586,0.0003539781,0.0011200171,0.0007649667,0.0008666116,0.0011113045,0.0008913233,0.0005193502],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009172333,0.0018877774,0.97891474,0.000060657807,0.000069997775,0.00024001289,0.0038748572,0.00008990207,0.0007960914,0.0001717652,0.00069937453,0.0122775845],"study_design_scores_gemma":[0.00005454683,0.0014400082,0.9956599,0.000014984864,0.000019009221,0.00019933173,0.0011028481,0.00014844428,0.00017597053,0.000039297298,0.0011356242,0.000010061436],"about_ca_topic_score_codex":0.0073804096,"about_ca_topic_score_gemma":0.015137259,"teacher_disagreement_score":0.0073804096,"about_ca_system_score_codex":0.0012887967,"about_ca_system_score_gemma":0.0019313956,"threshold_uncertainty_score":0.027923524},"labels":[],"label_agreement":null},{"id":"W2165514584","doi":"10.7202/900116ar","title":"Étude de fiabilité d’un instrument d’observation des comportements de l’élève en classe","year":2009,"lang":"fr","type":"article","venue":"Revue des sciences de l éducation","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Humanities; Philosophy","score_opus":0.5535813751294997,"score_gpt":0.45142720773716905,"score_spread":0.10215416739233063,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2165514584","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8317964,0.00065462914,0.152472,0.0003718471,0.00020266937,0.00085270946,0.0017562981,0.0006730765,0.011220413],"genre_scores_gemma":[0.9365219,0.0002310588,0.05684223,0.00008189743,0.00004880093,0.0013656043,0.0012035342,0.00016658501,0.0035384549],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.929604,0.03695945,0.0043221316,0.008555447,0.017908039,0.0026509832],"domain_scores_gemma":[0.7154001,0.2147063,0.014823185,0.023502642,0.030320209,0.0012475584],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.058592718,0.001215205,0.0014616756,0.0027277868,0.0010182181,0.0034893882,0.0018292721,0.0014691589,0.0029864232],"category_scores_gemma":[0.1852882,0.0008390596,0.002419539,0.0039901854,0.0018629177,0.0017779237,0.0022445899,0.0017552495,0.0011202968],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0028436347,0.00026881965,0.6933163,0.0010587029,0.0022522616,0.0001727451,0.01467772,0.012097623,0.01866785,0.0039056465,0.0019554005,0.24878325],"study_design_scores_gemma":[0.00009104929,0.001517455,0.9288779,0.00025869397,0.0005569977,0.00017659947,0.003598673,0.02872774,0.020270772,0.0020504908,0.013670068,0.00020361591],"about_ca_topic_score_codex":0.009474734,"about_ca_topic_score_gemma":0.006683281,"teacher_disagreement_score":0.058592718,"about_ca_system_score_codex":0.0015643314,"about_ca_system_score_gemma":0.002172726,"threshold_uncertainty_score":0.3098716},"labels":[],"label_agreement":null},{"id":"W2166290337","doi":"10.1186/1471-2288-3-18","title":"How does correlation structure differ between real and fabricated data-sets?","year":2003,"lang":"en","type":"article","venue":"BMC Medical Research Methodology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Population Health Research Institute; McMaster University","funders":"Shiraz University; Shiraz University of Medical Sciences; McMaster University","keywords":"Correlation; Data set; Set (abstract data type); Correlation coefficient; Statistics; Data mining; Pearson product-moment correlation coefficient; Misconduct; Computer science; Mathematics","score_opus":0.8378742148671262,"score_gpt":0.607124913089742,"score_spread":0.23074930177738417,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2166290337","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.73298234,0.004799262,0.23375365,0.010346954,0.00080790033,0.0007388484,0.0025447968,0.00049630477,0.013530001],"genre_scores_gemma":[0.9718365,0.0003534833,0.025305357,0.0005957072,0.00014465826,0.00035872523,0.0009956193,0.0000822887,0.00032763835],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.81868315,0.11678722,0.012823118,0.022250175,0.026954906,0.0025014277],"domain_scores_gemma":[0.25742498,0.6507077,0.039093018,0.034341067,0.017203068,0.0012301515],"candidate_categories":["metaresearch","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.123645045,0.00073541235,0.0013238953,0.0048285504,0.0020136693,0.0055189203,0.0020054355,0.0024032095,0.0028914968],"category_scores_gemma":[0.45872182,0.00066750596,0.0024504706,0.0045628333,0.008628958,0.0057061724,0.0028892418,0.0026391165,0.00072376657],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007686592,0.0003165381,0.80199486,0.0017772806,0.0028982626,0.0016387982,0.009939405,0.011601379,0.0028369895,0.0518089,0.0066785105,0.10774046],"study_design_scores_gemma":[0.00016943565,0.0012242722,0.662786,0.0015313579,0.0012542867,0.0053459094,0.008688691,0.07098308,0.007932391,0.22558132,0.014136112,0.00036719866],"about_ca_topic_score_codex":0.0015582199,"about_ca_topic_score_gemma":0.0016922969,"teacher_disagreement_score":0.9975968,"about_ca_system_score_codex":0.003102772,"about_ca_system_score_gemma":0.0024529533,"threshold_uncertainty_score":0.6539053},"labels":[],"label_agreement":null},{"id":"W2167816954","doi":"10.2466/pr0.101.3.1001-1010","title":"Four Multi-Item Interrater Agreement Options: Comparisons and Outcomes","year":2007,"lang":"en","type":"article","venue":"Psychological Reports","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Inter-rater reliability; Intraclass correlation; Psychology; Agreement; Statistics; Psychometrics; Clinical psychology; Rating scale; Developmental psychology; Mathematics","score_opus":0.4302605755541647,"score_gpt":0.49161844742747823,"score_spread":0.06135787187331354,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2167816954","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8104301,0.002734973,0.1569432,0.0005633305,0.00048086382,0.004825365,0.0015008213,0.0005998544,0.021921432],"genre_scores_gemma":[0.9424715,0.00035686768,0.051791593,0.000060839262,0.000086907945,0.0037651372,0.00048718852,0.00014389705,0.0008360594],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.6979256,0.22134542,0.03682291,0.007940652,0.03393222,0.0020331894],"domain_scores_gemma":[0.40284768,0.4815357,0.043166384,0.021604251,0.04850914,0.0023368755],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.22949757,0.001435554,0.0014934764,0.006479306,0.0018637539,0.0031646534,0.0022322352,0.0016087183,0.002717945],"category_scores_gemma":[0.40327278,0.00080411305,0.002495352,0.006227625,0.0037586887,0.0061138067,0.0060562934,0.0021467581,0.0011454364],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.014979092,0.0013065884,0.4669267,0.0051748976,0.0049727764,0.00038080174,0.032029383,0.0088593755,0.0049667405,0.016564742,0.003544218,0.44029477],"study_design_scores_gemma":[0.0023313907,0.022679253,0.68359303,0.0044612833,0.0052034575,0.0035249358,0.058553923,0.0798591,0.046877444,0.06901369,0.022149472,0.0017529853],"about_ca_topic_score_codex":0.0005681187,"about_ca_topic_score_gemma":0.0014641234,"teacher_disagreement_score":0.77050245,"about_ca_system_score_codex":0.001346363,"about_ca_system_score_gemma":0.0018286445,"threshold_uncertainty_score":0.9501667},"labels":[],"label_agreement":null},{"id":"W2171762906","doi":"10.1016/j.jclinepi.2010.02.006","title":"The COSMIN study reached international consensus on taxonomy, terminology, and definitions of measurement properties for health-related patient-reported outcomes","year":2010,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":4442,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Terminology; Taxonomy (biology); Delphi method; Confusion; Delphi; Consistency (knowledge bases); Management science; Medicine; Psychology; Applied psychology; Computer science; Artificial intelligence; Engineering; Linguistics; Ecology","score_opus":0.8170932433584581,"score_gpt":0.5349041107663476,"score_spread":0.28218913259211054,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2171762906","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.3998616,0.05336991,0.42502028,0.026035354,0.0038498538,0.011062001,0.017482447,0.000911582,0.06240701],"genre_scores_gemma":[0.73775464,0.008070105,0.21564327,0.0076470184,0.00071718666,0.017664712,0.009429741,0.0007581672,0.0023152106],"study_design_codex":"observational","study_design_gemma":"qualitative","domain_scores_codex":[0.8946426,0.0623839,0.016887935,0.003991054,0.020399023,0.0016955025],"domain_scores_gemma":[0.56679565,0.32840654,0.024803108,0.026380384,0.05180538,0.0018089357],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.28130335,0.0014938868,0.0034984832,0.008357699,0.0021916295,0.005102483,0.0031005428,0.00281847,0.0015601729],"category_scores_gemma":[0.31316176,0.000711666,0.0051777675,0.0060078735,0.003761618,0.004468815,0.006231625,0.004497453,0.00048587198],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0033115544,0.00077199546,0.54085076,0.005940793,0.0036583731,0.00018825136,0.007703631,0.0025181833,0.001409793,0.060893886,0.034483626,0.33826914],"study_design_scores_gemma":[0.0011439457,0.003004629,0.7562182,0.016798172,0.007136582,0.00083866116,0.005830916,0.009937531,0.0077307373,0.05284488,0.13786447,0.00065134297],"about_ca_topic_score_codex":0.0058550597,"about_ca_topic_score_gemma":0.011490885,"teacher_disagreement_score":0.71869665,"about_ca_system_score_codex":0.004561922,"about_ca_system_score_gemma":0.008228051,"threshold_uncertainty_score":0.88628095},"labels":[{"model":"gemma","categories":["metaresearch"],"domain":"methods","study_design":"qualitative","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":[],"domain":null,"study_design":"qualitative","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"high"}],"label_agreement":"split"},{"id":"W2177903965","doi":"10.24095/hpcdp.32.1.05","title":"2008 Niday Perinatal Database quality audit: report of a quality assurance project","year":2011,"lang":"en","type":"article","venue":"Chronic diseases and injuries in Canada","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":71,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":true,"ca_institutions":"Ottawa Hospital; Ottawa Public Health; University of Ottawa; Champlain Regional College; Children's Hospital of Eastern Ontario; Ontario Stroke Network","funders":"","keywords":"Intraclass correlation; Quality assurance; Cohen's kappa; Data quality; Kappa; Audit; Database; Statistic; Statistics; Quality (philosophy); Medicine; Sample (material); Reliability (semiconductor); Mathematics; Computer science; Reproducibility; Accounting; Operations management; Physics; Business; Engineering","score_opus":0.12208470535853659,"score_gpt":0.3818689116768931,"score_spread":0.25978420631835647,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2177903965","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6880793,0.0074973754,0.051975325,0.04170817,0.0005958084,0.07118054,0.074048504,0.00315677,0.061758157],"genre_scores_gemma":[0.7247719,0.0062270206,0.17086202,0.0045458903,0.00021754613,0.019893821,0.05407827,0.00064778404,0.01875577],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.89339125,0.023934301,0.018099273,0.003065914,0.058095332,0.0034140334],"domain_scores_gemma":[0.63271207,0.022365805,0.0325035,0.014607123,0.2891142,0.008697294],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.095230065,0.00074949034,0.0009032841,0.007015973,0.003907014,0.0037845531,0.0026145903,0.00080615893,0.0018414714],"category_scores_gemma":[0.12571912,0.0009797688,0.0006492006,0.010357237,0.0013159428,0.0012959309,0.0038663612,0.0015259882,0.000695195],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00053802045,0.0007223605,0.71437496,0.0029780339,0.00023475912,0.00024536115,0.006143426,0.0013751201,0.002116555,0.0012200773,0.05756796,0.21248336],"study_design_scores_gemma":[0.00014127074,0.0004744709,0.93397254,0.00088514853,0.00016087868,0.0001613804,0.0027541716,0.0022287462,0.0037445072,0.00017129777,0.055228576,0.00007704658],"about_ca_topic_score_codex":0.717592,"about_ca_topic_score_gemma":0.63442194,"teacher_disagreement_score":0.90476996,"about_ca_system_score_codex":0.06072624,"about_ca_system_score_gemma":0.20080358,"threshold_uncertainty_score":0.5681423},"labels":[],"label_agreement":null},{"id":"W2185742531","doi":"10.1002/j.0022-0337.2002.66.9.tb03570.x","title":"A Measure of Agreement Between Clinicians and a Computer‐Based Decision Support System for Planning Dental Treatment","year":2002,"lang":"en","type":"article","venue":"Journal of Dental Education","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia; TRIUMF","funders":"","keywords":"Measure (data warehouse); Decision support system; Medical physics; Medicine; Psychology; Computer science; Artificial intelligence; Data mining","score_opus":0.19541446516598343,"score_gpt":0.41677564037561216,"score_spread":0.22136117520962872,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2185742531","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.94715434,0.00037384816,0.04383335,0.00020753492,0.00010452055,0.0006297603,0.00038229348,0.00021528601,0.0070990347],"genre_scores_gemma":[0.984953,0.00007189388,0.013855689,0.00004916545,0.000027819728,0.0003133429,0.00027869985,0.000021763024,0.00042873522],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9196112,0.05245929,0.008929521,0.003558692,0.014336688,0.0011045703],"domain_scores_gemma":[0.63429457,0.2906199,0.023461321,0.011455867,0.037805688,0.002362632],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06064048,0.00051842304,0.0008028353,0.003772647,0.0008146491,0.0015803297,0.0008489956,0.0008405826,0.0010255836],"category_scores_gemma":[0.22832641,0.0004557873,0.001279369,0.0019037955,0.0011413851,0.002092448,0.0016335555,0.0010276557,0.00061365374],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0030511275,0.00095039885,0.8516572,0.00039136526,0.0013909127,0.00009696009,0.0076890737,0.0054716617,0.0024163052,0.0020749436,0.0016769819,0.123133086],"study_design_scores_gemma":[0.0005167889,0.0066347774,0.8463667,0.00034319976,0.0005078911,0.00084190303,0.008789559,0.11569692,0.0071036587,0.006399162,0.006452901,0.00034643587],"about_ca_topic_score_codex":0.0014647376,"about_ca_topic_score_gemma":0.0015745725,"teacher_disagreement_score":0.06064048,"about_ca_system_score_codex":0.0012056213,"about_ca_system_score_gemma":0.0011779789,"threshold_uncertainty_score":0.32070136},"labels":[],"label_agreement":null},{"id":"W2271963175","doi":"10.1302/2046-3758.412.2000433","title":"Spectrum bias, a common unrecognised issue in orthopaedic agreement studies","year":2015,"lang":"en","type":"article","venue":"Bone and Joint Research","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"ZonMw; NuVasive; Achmea; Amgen; Stryker; Sanofi; Eli Lilly and Company","keywords":"Medicine; Radiography; Radiology; Kappa; Population; Nuclear medicine; Orthodontics; Surgery; Mathematics; Geometry","score_opus":0.7498127583013002,"score_gpt":0.527483675786595,"score_spread":0.22232908251470518,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2271963175","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.53305006,0.05045602,0.372314,0.006772993,0.002548017,0.002606621,0.0011454124,0.00050362264,0.03060332],"genre_scores_gemma":[0.9568873,0.0013625794,0.038507946,0.0011087987,0.0005418974,0.00073178025,0.0002454811,0.000120522905,0.0004936992],"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.41097993,0.40889198,0.07654426,0.022138491,0.079639316,0.0018060848],"domain_scores_gemma":[0.08789655,0.77491117,0.072728865,0.03468448,0.028920034,0.00085887755],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3661121,0.0007006243,0.0014743761,0.0065432996,0.0021171838,0.003938927,0.002265709,0.0014500424,0.002155221],"category_scores_gemma":[0.65403795,0.0009199173,0.001818015,0.005110351,0.00835521,0.0047864662,0.006282414,0.0014326056,0.00034892693],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0020919153,0.00017422446,0.6541761,0.015691955,0.009136683,0.000684804,0.038153775,0.0032673043,0.0039483085,0.026053699,0.004416451,0.24220479],"study_design_scores_gemma":[0.00036871436,0.0024346628,0.7739672,0.01805804,0.0042519625,0.0078090755,0.026753986,0.014718077,0.014501324,0.0945742,0.0417594,0.00080338627],"about_ca_topic_score_codex":0.0013388366,"about_ca_topic_score_gemma":0.0021614083,"teacher_disagreement_score":0.6338879,"about_ca_system_score_codex":0.002663973,"about_ca_system_score_gemma":0.0028797279,"threshold_uncertainty_score":0.7816966},"labels":[],"label_agreement":null},{"id":"W2314842795","doi":"10.1002/j.1538-9235.2001.tb03567.x","title":"INTER-RATER RELIABILITY AMONG OPTOMETRY CLINICAL INSTRUCTORS.","year":2001,"lang":"en","type":"article","venue":"Optometry and Vision Science","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Optometry; Cornea; Reliability (semiconductor); Medicine; Inter-rater reliability; Ophthalmology; Psychology; Rating scale","score_opus":0.10253704012357771,"score_gpt":0.5337989571076218,"score_spread":0.4312619169840441,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2314842795","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8549143,0.006719975,0.08124243,0.0011278009,0.002132678,0.004808491,0.0068788063,0.0011552451,0.04102029],"genre_scores_gemma":[0.96234363,0.00065878296,0.024435993,0.000117102834,0.00014438442,0.002993834,0.002802507,0.00023955251,0.006264143],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.93597,0.041129395,0.0066826604,0.005203201,0.01003259,0.0009821123],"domain_scores_gemma":[0.837099,0.09185677,0.0067805466,0.01348551,0.049547892,0.0012301946],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08640813,0.00058101356,0.0010089335,0.0019327061,0.0011238283,0.0013446535,0.0009500174,0.0008351766,0.0032072056],"category_scores_gemma":[0.15729383,0.0005363265,0.0012436623,0.0017101826,0.00095580844,0.0016614215,0.0019068315,0.0011151667,0.0023360958],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0069545303,0.0009048709,0.50630045,0.0019127548,0.0023220764,0.0001908452,0.025016071,0.0021276367,0.007480858,0.0026370178,0.047178753,0.39697418],"study_design_scores_gemma":[0.0009685303,0.0024631193,0.93060184,0.0008143598,0.0012067604,0.0006187045,0.004340078,0.010027004,0.009603244,0.0027791683,0.036306392,0.0002708134],"about_ca_topic_score_codex":0.0017473083,"about_ca_topic_score_gemma":0.00361239,"teacher_disagreement_score":0.08640813,"about_ca_system_score_codex":0.0009061197,"about_ca_system_score_gemma":0.0010746624,"threshold_uncertainty_score":0.45697534},"labels":[],"label_agreement":null},{"id":"W2317471821","doi":"10.1021/es301320n","title":"Negative Consequences of Using α = 0.05 for Environmental Monitoring Decisions: A Case Study from a Decade of Canada’s Environmental Effects Monitoring Program","year":2012,"lang":"en","type":"article","venue":"Environmental Science & Technology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Canadian Water Network; University of New Brunswick","funders":"Natural Resources Canada; Canadian Forest Service; Natural Sciences and Engineering Research Council of Canada; Canadian Rivers Institute, University of New Brunswick","keywords":"Type I and type II errors; Statistics; Null hypothesis; Set (abstract data type); Econometrics; Approximation error; Mathematics; Computer science","score_opus":0.08694077720667744,"score_gpt":0.35924353480984633,"score_spread":0.2723027576031689,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2317471821","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.92911947,0.001375056,0.017324608,0.016971953,0.00015382121,0.00058701093,0.0002800439,0.00011553299,0.03407247],"genre_scores_gemma":[0.98096347,0.00026104093,0.015683137,0.0020120824,0.000016293741,0.00014350058,0.000053787222,0.000029671848,0.00083710696],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9025332,0.05368305,0.0041875103,0.0035069725,0.029546913,0.006542353],"domain_scores_gemma":[0.5428464,0.35773614,0.01989029,0.011649111,0.06277198,0.0051060263],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.11805712,0.0005247759,0.0006900616,0.001968005,0.010030972,0.0034154449,0.002770951,0.0025180122,0.0006284884],"category_scores_gemma":[0.2394375,0.00045763626,0.00089220155,0.0049691554,0.0048330068,0.0018262784,0.0016325457,0.004071545,0.00008020387],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001891491,0.0010821754,0.557637,0.00095923815,0.00068696984,0.008528025,0.0611599,0.031597275,0.004277553,0.0401315,0.023910161,0.26813865],"study_design_scores_gemma":[0.0004047205,0.0019855266,0.73294204,0.0019361647,0.00084666733,0.0028358584,0.080944456,0.053765934,0.012952248,0.03530727,0.075437054,0.00064205937],"about_ca_topic_score_codex":0.7753841,"about_ca_topic_score_gemma":0.90051967,"teacher_disagreement_score":0.966652,"about_ca_system_score_codex":0.033348028,"about_ca_system_score_gemma":0.058173366,"threshold_uncertainty_score":0.6243532},"labels":[],"label_agreement":null},{"id":"W2319535879","doi":"10.1097/jsm.0000000000000047","title":"Interrater Agreement of an Observational Tool to Code Knockouts and Technical Knockouts in Mixed Martial Arts","year":2013,"lang":"en","type":"article","venue":"Clinical Journal of Sport Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"St. Michael's Hospital; University of Toronto","funders":"Canadian Institutes of Health Research","keywords":"Inter-rater reliability; Martial arts; Situational ethics; Context (archaeology); Gene knockout; Applied psychology; Medicine; Psychology; Statistics; Social psychology; Mathematics; Developmental psychology; Genetics; History","score_opus":0.38690116381851114,"score_gpt":0.48134862574224013,"score_spread":0.09444746192372899,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2319535879","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.87551403,0.001787217,0.10219666,0.00060968334,0.0008140453,0.0057510273,0.0020973892,0.0005570372,0.0106729325],"genre_scores_gemma":[0.9248187,0.00048829254,0.06543901,0.000158962,0.000114297036,0.006649768,0.0011340632,0.00018145615,0.0010154248],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.8426868,0.09169722,0.030142419,0.009857268,0.022865249,0.0027510982],"domain_scores_gemma":[0.6529287,0.15941498,0.03719275,0.02189159,0.12456741,0.0040045637],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.13389933,0.0012135404,0.0014710467,0.006535936,0.002280056,0.0021802408,0.0022065486,0.001186957,0.0017411048],"category_scores_gemma":[0.3021809,0.0009216457,0.002235682,0.0029787717,0.0026802374,0.0026577408,0.006460578,0.0014846743,0.00087158405],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.004577932,0.00057078403,0.6409428,0.0040136967,0.0013901463,0.00092234375,0.12660377,0.0038506822,0.010965388,0.0034925537,0.011732729,0.19093716],"study_design_scores_gemma":[0.0009163468,0.004212515,0.7425253,0.004671958,0.0016577411,0.00429351,0.09885288,0.054827888,0.03333068,0.010322602,0.042901274,0.0014872585],"about_ca_topic_score_codex":0.003454868,"about_ca_topic_score_gemma":0.007288846,"teacher_disagreement_score":0.13389933,"about_ca_system_score_codex":0.0024909559,"about_ca_system_score_gemma":0.004719102,"threshold_uncertainty_score":0.70813584},"labels":[],"label_agreement":null},{"id":"W2353892345","doi":"10.1111/hir.12140","title":"Inter‐rater reliability of h‐index scores calculated by Web of Science and Scopus for clinical epidemiology scientists","year":2016,"lang":"en","type":"article","venue":"Health Information & Libraries Journal","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":42,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Ottawa Hospital","funders":"Ottawa Hospital Research Institute","keywords":"Scopus; Rank correlation; Bibliometrics; Reliability (semiconductor); Web of science; Statistics; Spearman's rank correlation coefficient; Index (typography); Inter-rater reliability; Psychology; Medicine; Meta-analysis; MEDLINE; Mathematics; Library science; Computer science; World Wide Web; Physics; Political science; Internal medicine","score_opus":0.25026763577986333,"score_gpt":0.4679676814020811,"score_spread":0.21770004562221779,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2353892345","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"evaluation","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"evaluation","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.90569955,0.005089752,0.060944665,0.0009490548,0.0008226528,0.0044995355,0.0062191617,0.00058915623,0.015186528],"genre_scores_gemma":[0.97506815,0.0005178616,0.018880809,0.00009285513,0.00017593404,0.0024016667,0.0020871693,0.000120762685,0.00065460405],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.7711523,0.11137417,0.05570934,0.012325621,0.046720896,0.0027176132],"domain_scores_gemma":[0.404357,0.33016193,0.078261964,0.04104887,0.14292803,0.0032421935],"candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.213295,0.000696766,0.002371781,0.014163768,0.0013509047,0.0033086247,0.0013490404,0.0009085533,0.0015612779],"category_scores_gemma":[0.41921526,0.00047152664,0.0028053937,0.01186874,0.0018185871,0.0027379976,0.004782323,0.0008656609,0.0005778433],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0031600343,0.0003591587,0.8646543,0.0033231878,0.004153618,0.0001495692,0.011283327,0.0021146745,0.0021472408,0.0019909437,0.004249251,0.10241466],"study_design_scores_gemma":[0.00043243804,0.0014994834,0.95228434,0.0012388501,0.0018476625,0.00040526822,0.0049057063,0.01601311,0.0063609728,0.00407562,0.010641947,0.00029463315],"about_ca_topic_score_codex":0.0022030638,"about_ca_topic_score_gemma":0.002364291,"teacher_disagreement_score":0.9858362,"about_ca_system_score_codex":0.0017102803,"about_ca_system_score_gemma":0.003075143,"threshold_uncertainty_score":0.9701473},"labels":[],"label_agreement":null},{"id":"W2414698452","doi":"","title":"Comparability of self-reported medication use and pharmacy claims data.","year":2013,"lang":"en","type":"article","venue":"PubMed","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":27,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Medicine; Pharmacy; Kappa; Family medicine; Logistic regression; Comparability; Pharmacoepidemiology; Cohen's kappa; Medicare Part D; Medical prescription; Prescription drug; Statistics; Internal medicine; Nursing","score_opus":0.4920086509050939,"score_gpt":0.39880317338084575,"score_spread":0.09320547752424813,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2414698452","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.94081694,0.005198747,0.022475947,0.0009969339,0.0002531026,0.00092488783,0.016534341,0.0001363364,0.012662609],"genre_scores_gemma":[0.99170226,0.0003275938,0.003100077,0.00012229476,0.000050920567,0.00027034286,0.0041622473,0.000012116608,0.0002520221],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.90222853,0.055366922,0.011060539,0.0058841207,0.024599718,0.0008601573],"domain_scores_gemma":[0.7061021,0.1790018,0.060351737,0.02317059,0.030123835,0.001250021],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.07076494,0.0002270358,0.00062598387,0.0037333728,0.00046775205,0.0015963711,0.001226726,0.00043600574,0.0010029275],"category_scores_gemma":[0.2422561,0.00026255904,0.0007944048,0.0045814756,0.0010597813,0.0011927345,0.001869575,0.00045191526,0.0002083981],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003659561,0.000049503065,0.9703451,0.0007750734,0.0016416006,0.000035225436,0.0016589637,0.00030238795,0.00020173697,0.0005528221,0.0011193099,0.022952376],"study_design_scores_gemma":[0.00003493045,0.00013778314,0.9939266,0.00028036066,0.00028247442,0.00010393734,0.00057181186,0.0009676903,0.0004034145,0.0006638367,0.0026054548,0.000021714099],"about_ca_topic_score_codex":0.01757979,"about_ca_topic_score_gemma":0.016120274,"teacher_disagreement_score":0.92923504,"about_ca_system_score_codex":0.0013446215,"about_ca_system_score_gemma":0.0018562751,"threshold_uncertainty_score":0.37424523},"labels":[],"label_agreement":null},{"id":"W2463810109","doi":"","title":"Use of the limits of agreement approach in periodontology.","year":2007,"lang":"en","type":"article","venue":"PubMed","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Centre for Addiction and Mental Health","funders":"","keywords":"Medicine; Periodontology; Cohen's kappa; Statistics; Correlation coefficient; Kappa; Standard deviation; Linear regression; Correlation; Limits of agreement; Standard error; Pearson product-moment correlation coefficient; Sample size determination; Medical physics; Dentistry; Orthodontics; Mathematics; Nuclear medicine","score_opus":0.3531444023639929,"score_gpt":0.3407668189419939,"score_spread":0.012377583421999017,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2463810109","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005421799,0.022161819,0.95711637,0.00213181,0.0010546739,0.0015185617,0.00025508742,0.00044080697,0.009899056],"genre_scores_gemma":[0.110152215,0.0045793834,0.8780003,0.0007557611,0.0003418962,0.004659941,0.0001994008,0.00022848927,0.0010826428],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.5607913,0.35436356,0.022214556,0.012639553,0.04899225,0.0009986678],"domain_scores_gemma":[0.49788114,0.42046615,0.029463923,0.021680152,0.028738441,0.0017702192],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.29251784,0.001976469,0.0034259032,0.01363502,0.0028728517,0.008333442,0.005401343,0.0033345462,0.0037470863],"category_scores_gemma":[0.41296905,0.0015816739,0.004058432,0.009142749,0.010708437,0.0069174096,0.008890108,0.0061156675,0.0011274209],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006575816,0.00022138175,0.01599389,0.01159142,0.0033725232,0.0005385385,0.0116935065,0.009834391,0.0024382216,0.23575796,0.011421417,0.6964792],"study_design_scores_gemma":[0.0002206215,0.0017621296,0.038337138,0.014507869,0.0018119529,0.0036492331,0.00729192,0.06045514,0.008455791,0.71713364,0.14550877,0.0008657465],"about_ca_topic_score_codex":0.0026552721,"about_ca_topic_score_gemma":0.0038729084,"teacher_disagreement_score":0.70748216,"about_ca_system_score_codex":0.0060659423,"about_ca_system_score_gemma":0.0097550955,"threshold_uncertainty_score":0.8724515},"labels":[],"label_agreement":null},{"id":"W2467932880","doi":"10.1177/0013164416654740","title":"An Unbiased Estimate of Global Interrater Agreement","year":2016,"lang":"en","type":"article","venue":"Educational and Psychological Measurement","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Trois-Rivières; University of Ottawa","funders":"","keywords":"Inter-rater reliability; Statistics; Agreement; Econometrics; Psychology; Mathematics; Rating scale; Linguistics","score_opus":0.40228873007278076,"score_gpt":0.47602807594491,"score_spread":0.07373934587212921,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2467932880","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.046910383,0.0028422817,0.921293,0.0007432716,0.00049534335,0.0015753513,0.001454757,0.0012105639,0.023474952],"genre_scores_gemma":[0.48611504,0.0010169434,0.50237346,0.00073732034,0.00030944555,0.003585681,0.0015015523,0.0005038658,0.0038566713],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8571511,0.08960382,0.014246089,0.013913982,0.023240449,0.0018445507],"domain_scores_gemma":[0.7436058,0.14335428,0.022531113,0.037334055,0.051830333,0.0013444525],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.11173745,0.0012763311,0.0022708618,0.006856731,0.0014789425,0.0035644225,0.0022730702,0.0019164279,0.0047904793],"category_scores_gemma":[0.31011483,0.0007442116,0.0016912936,0.0045722644,0.0025624388,0.0040072966,0.004541899,0.0021334856,0.002434815],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008912151,0.0002817409,0.143088,0.005251277,0.0034862347,0.00040551176,0.01290353,0.0071291807,0.013923464,0.10208275,0.021628708,0.6889284],"study_design_scores_gemma":[0.00029033687,0.0025124743,0.3621488,0.007763541,0.0040243757,0.0044889757,0.012039755,0.079113066,0.044707816,0.29542714,0.18643004,0.0010537049],"about_ca_topic_score_codex":0.0011345586,"about_ca_topic_score_gemma":0.002481141,"teacher_disagreement_score":0.88826257,"about_ca_system_score_codex":0.001036482,"about_ca_system_score_gemma":0.0023877965,"threshold_uncertainty_score":0.5909312},"labels":[],"label_agreement":null},{"id":"W2470750097","doi":"","title":"Enhancing retrieval of best evidence for health care from bibliographic databases: calibration of the hand search of the literature.","year":2001,"lang":"en","type":"article","venue":"PubMed","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":102,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"McMaster University; Hamilton Health Sciences","funders":"","keywords":"Cohen's kappa; Statistic; Information retrieval; Reliability (semiconductor); Computer science; MEDLINE; Health care; Test (biology); Medical education; Database; Medicine; Statistics; Machine learning; Mathematics","score_opus":0.267435042832476,"score_gpt":0.40163266319868807,"score_spread":0.13419762036621208,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2470750097","genre_codex":"methods","genre_gemma":"empirical","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.28139356,0.07282669,0.50613767,0.01620227,0.002380591,0.09847105,0.0022203836,0.0033913618,0.016976368],"genre_scores_gemma":[0.36198172,0.007154993,0.5925779,0.0018360119,0.0005219351,0.034119055,0.00088933937,0.00024574646,0.0006733999],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.21923974,0.56817156,0.14229839,0.012171437,0.056552358,0.0015664843],"domain_scores_gemma":[0.036953226,0.8111023,0.06555261,0.036648806,0.048465244,0.0012779115],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.6883293,0.002464194,0.006557555,0.037742313,0.0036088512,0.007785964,0.004683338,0.0030189694,0.0021942034],"category_scores_gemma":[0.90747803,0.0027332988,0.0044693053,0.020374972,0.0052498393,0.013593374,0.012575158,0.0028800936,0.00089855044],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005946592,0.0007221386,0.048417035,0.07319462,0.005231753,0.0002361015,0.025552556,0.0032132654,0.0067864046,0.00396708,0.008000621,0.8187318],"study_design_scores_gemma":[0.0136879105,0.0160264,0.37857893,0.18694226,0.029979916,0.0035291214,0.027218668,0.08422091,0.051284943,0.10659444,0.09846916,0.0034674564],"about_ca_topic_score_codex":0.003382695,"about_ca_topic_score_gemma":0.0065230676,"teacher_disagreement_score":0.31167072,"about_ca_system_score_codex":0.009159689,"about_ca_system_score_gemma":0.021480497,"threshold_uncertainty_score":0.38434553},"labels":[],"label_agreement":null},{"id":"W2500917129","doi":"10.1016/j.diii.2016.05.014","title":"Agreement studies in radiology research","year":2016,"lang":"en","type":"article","venue":"Diagnostic and Interventional Imaging","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":48,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta Hospital; Université de Montréal; Hôpital Notre-Dame; Health Sciences Centre; Centre Hospitalier de l’Université de Montréal","funders":"","keywords":"Medicine; Confidence interval; Medical physics; Reliability (semiconductor); Sample size determination; Nuclear medicine; Statistics; Internal medicine","score_opus":0.512024444147994,"score_gpt":0.5438569514778593,"score_spread":0.03183250732986531,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2500917129","genre_codex":"methods","genre_gemma":"review","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.2635214,0.13883382,0.50979036,0.010815747,0.0030992052,0.002358455,0.0010029563,0.00025583958,0.0703222],"genre_scores_gemma":[0.9146019,0.006400105,0.07265326,0.0017473927,0.0013188472,0.0015470481,0.0002860646,0.00014504115,0.0013003749],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"observational","domain_scores_codex":[0.22518738,0.66461045,0.034263805,0.019127402,0.054631587,0.0021794322],"domain_scores_gemma":[0.023858042,0.9109249,0.018686587,0.025721228,0.020065138,0.0007440507],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.5016562,0.00145614,0.004164213,0.026108963,0.0053938944,0.008767208,0.0063826814,0.0051056887,0.0042885356],"category_scores_gemma":[0.83336574,0.0026712257,0.004200634,0.018912109,0.022402706,0.01703166,0.011696399,0.0072382884,0.0006775729],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013671378,0.0008068302,0.35144114,0.009839845,0.010183929,0.0006937623,0.037078824,0.007982107,0.00084133784,0.39137778,0.0038906562,0.1844967],"study_design_scores_gemma":[0.0004094513,0.0029581406,0.27179953,0.014694188,0.0050175255,0.004349203,0.022062777,0.0317482,0.0064378367,0.5989473,0.04086218,0.0007137567],"about_ca_topic_score_codex":0.0050921137,"about_ca_topic_score_gemma":0.0034428223,"teacher_disagreement_score":0.49834383,"about_ca_system_score_codex":0.006228419,"about_ca_system_score_gemma":0.009391206,"threshold_uncertainty_score":0.61454666},"labels":[],"label_agreement":null},{"id":"W2525241236","doi":"10.5210/ojphi.v8i2.6720","title":"Development and Validation of a Standardized Tool for Prioritization of Information Sources","year":2016,"lang":"en","type":"article","venue":"Online Journal of Public Health Informatics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Public Health Agency of Canada; Canadian Food Inspection Agency","funders":"Canadian Food Inspection Agency","keywords":"Concordance; Cohen's kappa; Kappa; Prioritization; Reliability (semiconductor); Macro; Medicine; Data mining; Medical physics; Computer science; Statistics; Management science; Mathematics; Machine learning; Engineering","score_opus":0.18496991497549503,"score_gpt":0.40245150118308376,"score_spread":0.21748158620758873,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2525241236","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.31796357,0.0012474824,0.6047999,0.0029603713,0.00082918647,0.045586053,0.0059888065,0.0040399972,0.016584614],"genre_scores_gemma":[0.2544155,0.0003671865,0.7180489,0.00029886843,0.00008612346,0.022520142,0.0032988044,0.00019906025,0.0007654943],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.79868305,0.112449385,0.03760071,0.005137484,0.044004075,0.0021252763],"domain_scores_gemma":[0.6131598,0.22556901,0.026742825,0.0259703,0.10492026,0.0036377984],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.19456732,0.0014740812,0.0018335886,0.017127907,0.0015111795,0.004664299,0.002747792,0.0012179886,0.0026238232],"category_scores_gemma":[0.3005519,0.0007392319,0.0030612901,0.008915634,0.0017333752,0.004291414,0.0052047097,0.0019945872,0.00079013885],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001042818,0.0024998803,0.15168361,0.0044413777,0.0008376425,0.0002703764,0.01014877,0.008019022,0.003951739,0.0077726096,0.015379178,0.79395294],"study_design_scores_gemma":[0.0031691142,0.012577111,0.58285326,0.017507572,0.0020018513,0.0018822779,0.028623408,0.17537408,0.039024092,0.031322975,0.104082994,0.0015813212],"about_ca_topic_score_codex":0.0039656814,"about_ca_topic_score_gemma":0.0053030895,"teacher_disagreement_score":0.19456732,"about_ca_system_score_codex":0.005719292,"about_ca_system_score_gemma":0.019051144,"threshold_uncertainty_score":0.9932419},"labels":[],"label_agreement":null},{"id":"W2556459859","doi":"","title":"A comparison of antibiotic disks from different sources on Quicolor and Mueller-Hinton agar media in evaluation of antibacterial susceptibility testing.","year":2016,"lang":"en","type":"article","venue":"PubMed","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute of Health Economics","funders":"","keywords":"Agar; Agar diffusion test; Antibiotics; Microbiology; Enterobacter; Shigella; Biology; Antibacterial activity; Escherichia coli; Bacteria; Salmonella","score_opus":0.36786156895707584,"score_gpt":0.3919600067517543,"score_spread":0.024098437794678462,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2556459859","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9713589,0.006688682,0.017833529,0.0001566067,0.00019705735,0.00025038424,0.00042573683,0.00011496533,0.002974076],"genre_scores_gemma":[0.96816885,0.0010994789,0.02966069,0.000053767093,0.000029442162,0.00011384046,0.00032663465,0.000016970698,0.0005302942],"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9758596,0.011410645,0.002590944,0.0016166905,0.008189357,0.00033271027],"domain_scores_gemma":[0.93870753,0.039913997,0.006469577,0.0027927575,0.011294775,0.0008213316],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01675243,0.0004803872,0.0005910142,0.0031337647,0.0003756072,0.0009253721,0.00082058867,0.00075429963,0.0006312955],"category_scores_gemma":[0.041807372,0.00040835113,0.0005618939,0.0017751955,0.0006400729,0.00089455047,0.0011232343,0.0002938165,0.00032796396],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.01052272,0.0007364153,0.635527,0.0030926487,0.00087016844,0.0005452796,0.0050108605,0.0011014635,0.11790736,0.0008437389,0.0012430695,0.22259912],"study_design_scores_gemma":[0.00031187735,0.011099314,0.83816636,0.0007588083,0.001335053,0.0046397676,0.0048463955,0.012855712,0.116545774,0.001014173,0.008210678,0.00021610191],"about_ca_topic_score_codex":0.00097280386,"about_ca_topic_score_gemma":0.0017951842,"teacher_disagreement_score":0.01675243,"about_ca_system_score_codex":0.0004885929,"about_ca_system_score_gemma":0.0006151364,"threshold_uncertainty_score":0.0885964},"labels":[],"label_agreement":null},{"id":"W2580371235","doi":"10.1177/0146621616684584","title":"An Evaluation of Interrater Reliability Measures on Binary Tasks Using <i>d-Prime</i>","year":2016,"lang":"en","type":"article","venue":"Applied Psychological Measurement","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":35,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Inter-rater reliability; Kappa; Prime (order theory); Psychology; Statistics; Reliability (semiconductor); Cohen's kappa; Binary number; Agreement; Psychometrics; Social psychology; Mathematics; Combinatorics; Arithmetic; Rating scale; Linguistics","score_opus":0.5204254440661797,"score_gpt":0.4693431790011876,"score_spread":0.05108226506499214,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2580371235","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.40826514,0.0013781099,0.5665505,0.00050033315,0.00046525072,0.003672213,0.0006822516,0.00074933504,0.017736835],"genre_scores_gemma":[0.7268816,0.00027136088,0.2677065,0.00015569974,0.000058229372,0.0037083947,0.00029848857,0.00015271301,0.00076698646],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.71934634,0.21449116,0.027536687,0.009409014,0.027879296,0.001337506],"domain_scores_gemma":[0.42313984,0.45292208,0.023963835,0.030817023,0.067894824,0.0012624176],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2886595,0.0011340556,0.0011822506,0.0049196575,0.002584416,0.0024020392,0.0016675456,0.0011057467,0.001202315],"category_scores_gemma":[0.4241366,0.0009815239,0.0018132799,0.0047852555,0.0035757346,0.0026756998,0.0034936073,0.0017200361,0.00071887055],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005113521,0.00093513716,0.44907635,0.0053842845,0.003329968,0.00037026824,0.052743904,0.011538175,0.025835559,0.044901535,0.01013549,0.39063582],"study_design_scores_gemma":[0.0009052373,0.011752636,0.5599464,0.0030183482,0.002156993,0.0035598602,0.026714208,0.19321002,0.087705314,0.07292041,0.036598586,0.0015119048],"about_ca_topic_score_codex":0.0008587345,"about_ca_topic_score_gemma":0.002157314,"teacher_disagreement_score":0.7113405,"about_ca_system_score_codex":0.001606336,"about_ca_system_score_gemma":0.0019927174,"threshold_uncertainty_score":0.8772095},"labels":[],"label_agreement":null},{"id":"W2592866053","doi":"10.1186/s13643-017-0441-7","title":"Effect of standardized training on the reliability of the Cochrane risk of bias assessment tool: a prospective study","year":2017,"lang":"en","type":"article","venue":"Systematic Reviews","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":65,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta; St. Michael's Hospital; University of Toronto","funders":"","keywords":"Medicine; Kappa; Reliability (semiconductor); Physical therapy; Randomized controlled trial; Cohen's kappa; Risk assessment; MEDLINE; Clinical psychology; Statistics; Surgery","score_opus":0.23073563764269314,"score_gpt":0.4609718262253066,"score_spread":0.23023618858261344,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2592866053","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7669736,0.11128629,0.052334245,0.0021786836,0.00092061434,0.058029406,0.002247431,0.0004128271,0.005616973],"genre_scores_gemma":[0.93636703,0.0045580203,0.027642706,0.0005727383,0.000235505,0.029751152,0.0006008619,0.00007608551,0.00019584657],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.33867478,0.48397332,0.11693424,0.01670979,0.041225955,0.0024819267],"domain_scores_gemma":[0.117671266,0.6045773,0.18915913,0.047517337,0.038885318,0.0021896681],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.43307397,0.0017555077,0.0052310596,0.005035989,0.001305317,0.0033163747,0.0029282586,0.0029390752,0.0030247534],"category_scores_gemma":[0.72642505,0.0026528235,0.009298286,0.0068877107,0.0049457583,0.005723073,0.0038628646,0.0023519301,0.00058824115],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.065637395,0.004280526,0.55183536,0.07209261,0.035247948,0.0003687745,0.010050328,0.004105384,0.0015413905,0.002330682,0.00366244,0.24884722],"study_design_scores_gemma":[0.025636693,0.067105785,0.79948694,0.035494022,0.03722257,0.0017234848,0.002551067,0.012419249,0.0032221517,0.0037410331,0.010517558,0.00087946316],"about_ca_topic_score_codex":0.0015571134,"about_ca_topic_score_gemma":0.0017317637,"teacher_disagreement_score":0.566926,"about_ca_system_score_codex":0.004363573,"about_ca_system_score_gemma":0.008418731,"threshold_uncertainty_score":0.69912076},"labels":[],"label_agreement":null},{"id":"W2593472913","doi":"10.1002/cyto.b.21522","title":"Choosing a new CD4 technology: Can statistical method comparison tools influence the decision?","year":2017,"lang":"en","type":"article","venue":"Cytometry Part B Clinical Cytometry","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Grand Challenges Canada; Thailand Research Fund","keywords":"Concordance; Concordance correlation coefficient; Similarity (geometry); Bland–Altman plot; Sensitivity (control systems); Standard deviation; Statistics; Accuracy and precision; Computer science; Data mining; Mathematics; Sample (material); Correlation coefficient; Artificial intelligence; Limits of agreement; Nuclear medicine; Medicine; Chemistry; Image (mathematics); Engineering","score_opus":0.4041854619677802,"score_gpt":0.568325344249743,"score_spread":0.1641398822819628,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2593472913","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.083388366,0.062397543,0.7955557,0.03053517,0.0054240306,0.0029363993,0.0022514777,0.0023545662,0.015156876],"genre_scores_gemma":[0.38055584,0.009356172,0.587817,0.011148418,0.002197163,0.0039253496,0.0016552198,0.0020737608,0.0012710408],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.6671115,0.24796042,0.027904082,0.017912269,0.03720069,0.0019110227],"domain_scores_gemma":[0.34885046,0.5410881,0.03711416,0.025304588,0.0448613,0.0027813911],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.34208024,0.0013637202,0.0028352747,0.005443471,0.0017741076,0.008699316,0.0038096951,0.002845896,0.0039442074],"category_scores_gemma":[0.5269423,0.00075611495,0.0030593812,0.0046874587,0.0043613384,0.004691616,0.0035972875,0.0039267456,0.0020841574],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0024452435,0.00029170758,0.12413319,0.007023213,0.004169064,0.00026025486,0.0025425795,0.0038730316,0.003758044,0.012418777,0.047520332,0.79156464],"study_design_scores_gemma":[0.0015805048,0.0029757463,0.1833731,0.030213842,0.009596642,0.0030430704,0.0038642965,0.11477195,0.04158991,0.24068695,0.36681214,0.001491909],"about_ca_topic_score_codex":0.0016514906,"about_ca_topic_score_gemma":0.0023033659,"teacher_disagreement_score":0.34208024,"about_ca_system_score_codex":0.0033127626,"about_ca_system_score_gemma":0.006155121,"threshold_uncertainty_score":0.8113322},"labels":[],"label_agreement":null},{"id":"W2606094999","doi":"10.1186/s12889-017-4259-y","title":"The development and validation of an instrument to measure the quality of health research reports in the lay media","year":2017,"lang":"en","type":"article","venue":"BMC Public Health","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":31,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University; Impact; McMaster University","funders":"QIMR Berghofer Medical Research Institute","keywords":"Construct validity; Face validity; Public health; Reliability (semiconductor); Content validity; Biostatistics; Quality (philosophy); Validity; Medicine; Scale (ratio); Applied psychology; Psychology; Psychometrics; Nursing; Clinical psychology","score_opus":0.7828744978122634,"score_gpt":0.5599816879127737,"score_spread":0.22289280989948967,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2606094999","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reporting","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"reporting","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7599261,0.0014614838,0.17564327,0.0031857905,0.0005546457,0.031578317,0.003300151,0.0010517311,0.023298508],"genre_scores_gemma":[0.6864773,0.0009926559,0.27205014,0.00059062085,0.0001979908,0.035879526,0.002230798,0.00014533872,0.0014356284],"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.8869388,0.060480703,0.02246245,0.0030178453,0.025501443,0.0015987278],"domain_scores_gemma":[0.49118772,0.31134525,0.068602785,0.024679549,0.100397214,0.0037875494],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.17987098,0.0007919438,0.0009493306,0.010328746,0.0013528541,0.0037589422,0.0020580785,0.0011049559,0.0020591335],"category_scores_gemma":[0.30731916,0.0009299354,0.0023173818,0.006435245,0.002477827,0.003890274,0.0040960624,0.0023767394,0.0005908884],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008740205,0.002130971,0.51725423,0.0032953685,0.00055395317,0.00020313117,0.022631554,0.0018203397,0.0057976474,0.0046673566,0.0052062413,0.43556508],"study_design_scores_gemma":[0.000462781,0.0045793173,0.929518,0.0028822513,0.0005841607,0.000707273,0.015046368,0.013162902,0.009621542,0.0037505091,0.019323613,0.00036113366],"about_ca_topic_score_codex":0.0015872068,"about_ca_topic_score_gemma":0.0023334923,"teacher_disagreement_score":0.82012904,"about_ca_system_score_codex":0.0032086705,"about_ca_system_score_gemma":0.007907445,"threshold_uncertainty_score":0.95126003},"labels":[],"label_agreement":null},{"id":"W2606619291","doi":"10.1177/1536867x1701700111","title":"Biasplot: A Package to Effective Plots to Assess Bias and Precision in Method Comparison Studies","year":2017,"lang":"en","type":"article","venue":"The Stata Journal Promoting communications on statistics and Stata","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":17,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Plot (graphics); Statistics; Computer science; Accuracy and precision; Data mining; Scatter plot; Mathematics","score_opus":0.6425845793989605,"score_gpt":0.5792506941073572,"score_spread":0.06333388529160333,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2606619291","genre_codex":"methods","genre_gemma":"software","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.001849143,0.0013414496,0.8626112,0.0009241708,0.00083935715,0.002200574,0.023518374,0.101942986,0.0047727833],"genre_scores_gemma":[0.013237536,0.000843008,0.933315,0.0005493688,0.00028517193,0.008859264,0.006425024,0.033035174,0.0034504274],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9542394,0.03212104,0.0052968166,0.0021166573,0.005597478,0.0006285358],"domain_scores_gemma":[0.653373,0.303296,0.01325121,0.011835902,0.017252928,0.0009910433],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.056766633,0.0036803165,0.0032166939,0.010650511,0.0009849877,0.004577489,0.0042958087,0.002279353,0.15197615],"category_scores_gemma":[0.23609218,0.0033461319,0.004138034,0.0070545007,0.0012260409,0.005771673,0.0058627953,0.0046588895,0.024003746],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015079498,0.0002949923,0.0048656836,0.008197088,0.0014823711,0.0003616002,0.0018900736,0.006803571,0.001563291,0.027616836,0.499499,0.44591752],"study_design_scores_gemma":[0.0018958567,0.0005778803,0.011833633,0.005975252,0.001181306,0.0012031104,0.0007578456,0.06771425,0.0077328524,0.1199224,0.78050655,0.0006990562],"about_ca_topic_score_codex":0.0018683197,"about_ca_topic_score_gemma":0.002700498,"teacher_disagreement_score":0.9432334,"about_ca_system_score_codex":0.0013259035,"about_ca_system_score_gemma":0.0041139675,"threshold_uncertainty_score":0.5084109},"labels":[],"label_agreement":null},{"id":"W2613103431","doi":"10.1177/0962280217702540","title":"Comparing heteroscedastic measurement systems with the probability of agreement","year":2017,"lang":"en","type":"article","venue":"Statistical Methods in Medical Research","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":26,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Actua; University of Waterloo","funders":"","keywords":"Homoscedasticity; Heteroscedasticity; Metric (unit); Observational error; Computer science; Statistics; Mathematics; Engineering","score_opus":0.7493861067260326,"score_gpt":0.6289003428450651,"score_spread":0.12048576388096743,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2613103431","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.04436892,0.002590047,0.9457011,0.00085488916,0.0003645409,0.0004630456,0.00050327665,0.00033774736,0.00481646],"genre_scores_gemma":[0.70002747,0.0011409866,0.29465657,0.00035698857,0.00047432556,0.0017703447,0.0006891425,0.00019869728,0.00068554253],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.7349167,0.18729144,0.017261695,0.023984129,0.034971386,0.0015747128],"domain_scores_gemma":[0.23740816,0.6774237,0.037464082,0.02909127,0.01749667,0.001116174],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.20664951,0.0018939124,0.0030322096,0.010623503,0.0019121907,0.008773235,0.0032972877,0.0034623689,0.0028259647],"category_scores_gemma":[0.53952867,0.0010620645,0.003942202,0.011522853,0.012232958,0.011203205,0.008238774,0.0044821994,0.0007274204],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019245186,0.00029159803,0.17420562,0.0033978552,0.009898282,0.0005258374,0.009593252,0.08821746,0.0026816274,0.32022578,0.0042730165,0.38476506],"study_design_scores_gemma":[0.00018394644,0.0014068192,0.083419256,0.00091695157,0.0013874987,0.0008235366,0.002519551,0.25046724,0.0041305185,0.6438896,0.010267451,0.0005876338],"about_ca_topic_score_codex":0.001507272,"about_ca_topic_score_gemma":0.0007778525,"teacher_disagreement_score":0.20664951,"about_ca_system_score_codex":0.002316521,"about_ca_system_score_gemma":0.0025809593,"threshold_uncertainty_score":0.9783424},"labels":[],"label_agreement":null},{"id":"W2620680567","doi":"10.3899/jrheum.170315","title":"Dr. Christiansen, <i>et al,</i> reply","year":2017,"lang":"he","type":"letter","venue":"The Journal of Rheumatology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Medicine; Minor (academic); Statistics; Demography; Humanities; Mathematics","score_opus":0.09729109516209565,"score_gpt":0.3599983043807382,"score_spread":0.26270720921864255,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2620680567","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0003046661,0.001584276,0.000085249674,0.9731774,0.024132881,0.000009380277,0.000047974947,0.000038714377,0.0006194725],"genre_scores_gemma":[0.0049195266,0.0018838726,0.00022488441,0.945767,0.045044288,0.000037229085,0.000038387352,0.000028687065,0.0020562129],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9975159,0.000920482,0.00040582966,0.00034179955,0.00054074277,0.0002753184],"domain_scores_gemma":[0.9851516,0.008155416,0.0009796738,0.00046665696,0.0038936993,0.0013529287],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004158226,0.00082753605,0.0014017799,0.0009621063,0.002003015,0.0024278355,0.002505703,0.023442052,0.0060027535],"category_scores_gemma":[0.048501723,0.0006737207,0.0007543852,0.0009159305,0.0023436372,0.004054184,0.0010575736,0.031321578,0.0061429697],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000028081184,0.000011275172,0.00070362224,0.00006740978,0.000011904265,0.0011910467,0.0000942594,0.000026072497,0.000053078846,0.00064465404,0.9932535,0.003914974],"study_design_scores_gemma":[0.00016079895,0.00009220373,0.0027216566,0.0008900124,0.00006796823,0.0152759515,0.0013966633,0.0008005793,0.00048854586,0.007335202,0.970602,0.00016843456],"about_ca_topic_score_codex":0.0035559102,"about_ca_topic_score_gemma":0.0034036557,"teacher_disagreement_score":0.023442052,"about_ca_system_score_codex":0.0022126178,"about_ca_system_score_gemma":0.0023191352,"threshold_uncertainty_score":0.021991074},"labels":[],"label_agreement":null},{"id":"W2626903902","doi":"10.17705/1jais.00458","title":"Heuristic Principles and Differential Judgments in the Assessment of Information Quality","year":2017,"lang":"en","type":"article","venue":"Journal of the Association for Information Systems","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":27,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Completeness (order theory); Heuristic; Objectivity (philosophy); Psychology; Cognitive psychology; Computer science; Quality (philosophy); Set (abstract data type); Artificial intelligence; Social psychology; Epistemology; Mathematics","score_opus":0.1708040051470891,"score_gpt":0.4194472045691902,"score_spread":0.2486431994221011,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2626903902","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8151353,0.0016973142,0.1489552,0.0016186482,0.00012282493,0.0005659589,0.00008897642,0.00015067193,0.03166507],"genre_scores_gemma":[0.97255975,0.00018505285,0.026620427,0.0001769784,0.000028082306,0.00019367645,0.000041429164,0.000019152221,0.00017553399],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.8537531,0.099918835,0.008386515,0.0075758407,0.028496588,0.0018692388],"domain_scores_gemma":[0.6010486,0.3101683,0.038869668,0.02255461,0.024956666,0.0024021897],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.10101395,0.0006350565,0.0007536034,0.006370361,0.0017219712,0.0053341887,0.0011248668,0.0013702087,0.0010311085],"category_scores_gemma":[0.3510389,0.0007136889,0.0009988752,0.0031868536,0.0103277,0.0053897006,0.0047385814,0.0021481416,0.00018029066],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008224371,0.00053951534,0.35374373,0.0021559128,0.001247289,0.0004491277,0.16982636,0.013185645,0.010105188,0.1537086,0.0016786015,0.29253763],"study_design_scores_gemma":[0.00024400963,0.0010703775,0.49494022,0.0012069974,0.0003344925,0.0011234477,0.03428409,0.04920885,0.00941946,0.39914688,0.008406134,0.0006150759],"about_ca_topic_score_codex":0.0031892601,"about_ca_topic_score_gemma":0.002429595,"teacher_disagreement_score":0.10101395,"about_ca_system_score_codex":0.0024312702,"about_ca_system_score_gemma":0.0024633503,"threshold_uncertainty_score":0.5342192},"labels":[],"label_agreement":null},{"id":"W2768731979","doi":"10.4103/jpi.jpi_50_17","title":"Next Generation Quality: Assessing the Physician in Clinical History Completeness and Diagnostic Interpretations Using Funnel Plots and Normalized Deviations Plots in 3,854 Prostate Biopsies","year":2017,"lang":"en","type":"article","venue":"Journal of Pathology Informatics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Juravinski Cancer Centre; McMaster University; St. Joseph’s Healthcare Hamilton","funders":"","keywords":"Funnel plot; Medicine; Audit; Categorization; Medical physics; Statistics; Pathology; Artificial intelligence; Computer science; Publication bias; Meta-analysis; Mathematics","score_opus":0.5222789496249143,"score_gpt":0.49371059623875124,"score_spread":0.028568353386163037,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2768731979","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"evaluation","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"evaluation","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.91150385,0.0053396258,0.07386775,0.00057832815,0.00011041003,0.0011264685,0.004430375,0.0005916796,0.0024516159],"genre_scores_gemma":[0.9820978,0.00018198478,0.015995124,0.00006516482,0.000029072946,0.00033916524,0.0010230135,0.000044923585,0.00022376508],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.88031936,0.06850935,0.021637334,0.008676738,0.019396223,0.0014610222],"domain_scores_gemma":[0.3697092,0.44274145,0.12151454,0.027488597,0.037085045,0.0014611916],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.16728571,0.00079031923,0.0011692747,0.013440953,0.00063120615,0.002546741,0.001653392,0.0012020144,0.0023914012],"category_scores_gemma":[0.37978673,0.0005208433,0.0028322602,0.007919035,0.0017868911,0.0024307892,0.0026848337,0.0006674248,0.0002920673],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0029928181,0.000083607236,0.93527335,0.0009437361,0.0018139996,0.00026932821,0.003270084,0.002927721,0.000985003,0.0014141955,0.0012367713,0.048789255],"study_design_scores_gemma":[0.00023978286,0.0013372446,0.9451108,0.0005500527,0.0011369631,0.0017018092,0.002238055,0.035197616,0.004774779,0.003505481,0.004022683,0.00018453543],"about_ca_topic_score_codex":0.0039874217,"about_ca_topic_score_gemma":0.002798033,"teacher_disagreement_score":0.8327143,"about_ca_system_score_codex":0.0021421614,"about_ca_system_score_gemma":0.0012948274,"threshold_uncertainty_score":0.88470197},"labels":[],"label_agreement":null},{"id":"W2774785678","doi":"10.1177/0194599817739260","title":"To <i>P</i> or Not to <i>P</i>: Backing Bayesian Statistics","year":2017,"lang":"en","type":"review","venue":"Otolaryngology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":27,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"BC Children's Hospital; University of British Columbia","funders":"","keywords":"Null hypothesis; Bayesian probability; Null (SQL); Statistics; Statistical hypothesis testing; Bayesian statistics; Null model; Econometrics; Posterior probability; Alternative hypothesis; Population; Mathematics; Computer science; Bayesian inference; Data mining; Sociology; Demography","score_opus":0.42737667020850845,"score_gpt":0.5076963095392637,"score_spread":0.08031963933075525,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2774785678","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00040405634,0.92598873,0.03579913,0.029282464,0.0034198365,0.00006246817,0.00013891273,0.000086482265,0.0048179063],"genre_scores_gemma":[0.016294306,0.92810744,0.028399928,0.019131273,0.0058034095,0.0003059658,0.00017771196,0.00012292586,0.0016571055],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.96678925,0.019786943,0.0037490397,0.0025229019,0.0068109906,0.00034086272],"domain_scores_gemma":[0.8948644,0.093680896,0.0036371378,0.002019713,0.0052361796,0.00056166557],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.03623439,0.0013999242,0.0040895436,0.006486425,0.00096391374,0.0039312597,0.003446602,0.0055604987,0.003990407],"category_scores_gemma":[0.10939243,0.0009126411,0.001953043,0.0063815354,0.013425077,0.007569586,0.0027173997,0.010857564,0.00247508],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00011291585,0.00005347605,0.00081782014,0.017245013,0.0006870768,0.00029820006,0.0012343345,0.0013950462,0.00030963513,0.18632299,0.04230255,0.7492208],"study_design_scores_gemma":[0.000064237676,0.00011217287,0.0015695103,0.024138104,0.00038977934,0.001675935,0.00064612593,0.0013395639,0.0006986936,0.45125106,0.51789606,0.00021872419],"about_ca_topic_score_codex":0.0044937143,"about_ca_topic_score_gemma":0.003598573,"teacher_disagreement_score":0.9637656,"about_ca_system_score_codex":0.0032970824,"about_ca_system_score_gemma":0.005721736,"threshold_uncertainty_score":0.1916281},"labels":[],"label_agreement":null},{"id":"W2782320564","doi":"10.1007/s40037-017-0391-8","title":"Detecting rater bias using a&amp;nbsp;person-fit statistic: a&amp;nbsp;Monte Carlo simulation study","year":2018,"lang":"en","type":"article","venue":"Perspectives on Medical Education","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval; Université de Sherbrooke","funders":"Fonds de Recherche du Québec-Société et Culture","keywords":"Monte Carlo method; Statistic; Medical physics; Computer science; Psychology; Medicine; Statistics; Mathematics","score_opus":0.4676450050714238,"score_gpt":0.5170803826767165,"score_spread":0.04943537760529271,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2782320564","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.2065622,0.0009102115,0.77468175,0.0031599894,0.00023788026,0.002958302,0.00045234963,0.00063127204,0.010406021],"genre_scores_gemma":[0.8000673,0.0001970581,0.19509706,0.00081668235,0.00010012186,0.0029919872,0.00012994821,0.00009942762,0.0005004747],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.5676581,0.40479773,0.007938519,0.0055871317,0.012959817,0.0010585872],"domain_scores_gemma":[0.15757127,0.7989922,0.018428829,0.017199378,0.0072657224,0.0005426266],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.28069508,0.0010336402,0.0012913247,0.001736263,0.00086442864,0.0031386258,0.0023230829,0.002259816,0.0055410946],"category_scores_gemma":[0.6722556,0.0006966166,0.0027191562,0.0018579899,0.0044330833,0.003061492,0.0019201135,0.0020347452,0.0008956212],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0026896885,0.0012668439,0.55643994,0.002524085,0.0063396883,0.0007234232,0.012961096,0.063477784,0.001941688,0.110005364,0.008393941,0.23323645],"study_design_scores_gemma":[0.0011209712,0.006674409,0.21807066,0.0037307309,0.0019014219,0.0021159425,0.0045884904,0.5677719,0.0111878095,0.16091928,0.021377029,0.00054135406],"about_ca_topic_score_codex":0.0037116692,"about_ca_topic_score_gemma":0.0025379395,"teacher_disagreement_score":0.7193049,"about_ca_system_score_codex":0.0015810137,"about_ca_system_score_gemma":0.0038271968,"threshold_uncertainty_score":0.887031},"labels":[],"label_agreement":null},{"id":"W2784251105","doi":"10.1016/j.jneb.2017.08.006","title":"Response to “A Comment on Mann G ‘ Smart Snacks in School Legislation Does Not Change Self-Reported Snack Food and Beverage Intake of Middle School Students in Rural Appalachian Region’: Methodological Issues”","year":2018,"lang":"en","type":"letter","venue":"Journal of Nutrition Education and Behavior","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Legislation; Scopus; Psychology; Snack food; Rural area; Environmental health; Political science; Medicine; Food science; MEDLINE; Law","score_opus":0.2797568639614261,"score_gpt":0.43798714022337815,"score_spread":0.15823027626195202,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2784251105","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00095583947,0.00024325524,0.000084825864,0.9834093,0.013298009,0.000028735394,0.00022156858,0.00004187492,0.0017166111],"genre_scores_gemma":[0.0019928361,0.00011474915,0.00009561909,0.9875945,0.004490917,0.00005755183,0.000037295576,0.000019135496,0.0055972296],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9924158,0.0015292988,0.001133886,0.0011254023,0.0019573213,0.0018382983],"domain_scores_gemma":[0.97864187,0.011292998,0.0020125697,0.00045206468,0.0043738564,0.0032266702],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.008129171,0.00094738475,0.0017300039,0.0010360556,0.008707136,0.0042088097,0.0028474214,0.06699918,0.009597089],"category_scores_gemma":[0.04518145,0.001266808,0.0018368922,0.0011155397,0.0036221931,0.0028630053,0.0031658811,0.055420358,0.0082391165],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000068416884,0.000036975325,0.0014472898,0.000046889465,0.00001747267,0.00056790665,0.00058239483,0.00003953432,0.00013908996,0.0008301691,0.9926454,0.003578442],"study_design_scores_gemma":[0.00021266694,0.00022332539,0.014746218,0.001050077,0.00012536657,0.0007244242,0.0050142515,0.0005864636,0.0006818498,0.0030905362,0.9733383,0.00020641227],"about_ca_topic_score_codex":0.07500808,"about_ca_topic_score_gemma":0.09753288,"teacher_disagreement_score":0.9918708,"about_ca_system_score_codex":0.008062205,"about_ca_system_score_gemma":0.013515222,"threshold_uncertainty_score":0.14914298},"labels":[],"label_agreement":null},{"id":"W2790302041","doi":"10.1016/j.jclinepi.2018.03.001","title":"Response to Dr. Livia Puljak's letter about our published article","year":2018,"lang":"en","type":"letter","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Scopus; Publication bias; Systematic review; MEDLINE; Attrition; Reporting bias; Psychology; Medicine; Medical education; Meta-analysis; Political science; Law","score_opus":0.5651543854416219,"score_gpt":0.5667698303157579,"score_spread":0.0016154448741360072,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2790302041","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00015029375,0.00057338673,0.000054738415,0.978962,0.019157719,0.0000060436655,0.000049124043,0.000031486372,0.0010151464],"genre_scores_gemma":[0.0023539474,0.0005947882,0.00016186871,0.96757686,0.025343217,0.00002664711,0.000032201246,0.00003345227,0.0038769508],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99578685,0.0013594594,0.00058190594,0.0005228729,0.0012810387,0.0004677721],"domain_scores_gemma":[0.97628933,0.013648065,0.0015344097,0.0005453029,0.005400746,0.0025821514],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.004577839,0.0006491347,0.0011586606,0.0008162534,0.0031064423,0.0032787966,0.0015447233,0.029798185,0.011390373],"category_scores_gemma":[0.062400352,0.0005394483,0.00070266513,0.0007761558,0.0020432228,0.0033254926,0.0012342904,0.030838178,0.010344245],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000022884955,0.000010600061,0.00028950392,0.000024326222,0.0000042889674,0.00047245124,0.000066678556,0.000011702021,0.000035535886,0.0005211667,0.9959363,0.002604624],"study_design_scores_gemma":[0.000086293025,0.000060433165,0.0013819315,0.00044691388,0.000022669354,0.00441452,0.0006941442,0.0003535245,0.00037038006,0.0044456315,0.98764837,0.00007527481],"about_ca_topic_score_codex":0.003812065,"about_ca_topic_score_gemma":0.0048283627,"teacher_disagreement_score":0.9954222,"about_ca_system_score_codex":0.0030931013,"about_ca_system_score_gemma":0.0031701338,"threshold_uncertainty_score":0.038104534},"labels":[],"label_agreement":null},{"id":"W2808430903","doi":"10.1007/s40037-018-0435-8","title":"Examining the effects of gaming and guessing on script concordance test scores","year":2018,"lang":"en","type":"article","venue":"Perspectives on Medical Education","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal; McGill University","funders":"","keywords":"Concordance; Likert scale; Test (biology); Statistics; Psychology; Scale (ratio); Social psychology; Mathematics; Medicine","score_opus":0.07302416389855387,"score_gpt":0.39259414271459697,"score_spread":0.3195699788160431,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2808430903","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9963272,0.000043017648,0.0024107746,0.00005149535,0.000009321522,0.00010137865,0.000119174925,0.000026021224,0.0009117321],"genre_scores_gemma":[0.9972325,0.000014649721,0.0022874423,0.000029713183,0.000006437937,0.000104810075,0.0001660692,0.000011229803,0.00014711708],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9393947,0.04328737,0.0041604345,0.004956233,0.007364334,0.0008368684],"domain_scores_gemma":[0.4160828,0.5009346,0.049547493,0.02140422,0.009514351,0.0025165582],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05332988,0.0006263404,0.0004221804,0.0012240205,0.0005626013,0.0018701642,0.0012125116,0.0009964663,0.002440058],"category_scores_gemma":[0.2732798,0.00043019874,0.0011544648,0.0007147027,0.0019419288,0.0013048856,0.0018707899,0.00091745984,0.00043316322],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010887441,0.0001745372,0.9824117,0.000051279745,0.0003375853,0.00006707929,0.0011426955,0.00091143604,0.0009704813,0.00016558009,0.0001720001,0.012506821],"study_design_scores_gemma":[0.000031196854,0.001574511,0.9887516,0.000039004917,0.00012394875,0.00021565321,0.00039932446,0.0052696234,0.0029499724,0.0002846636,0.0003265708,0.000033909717],"about_ca_topic_score_codex":0.0015396945,"about_ca_topic_score_gemma":0.0023038448,"teacher_disagreement_score":0.05332988,"about_ca_system_score_codex":0.000959319,"about_ca_system_score_gemma":0.0007443066,"threshold_uncertainty_score":0.28203875},"labels":[],"label_agreement":null},{"id":"W2809585708","doi":"10.7939/r3tm7251q","title":"Impact of raters' levels of respiratory training and experience on the quality of spirometric interpretations in epidemiological studies","year":2000,"lang":"en","type":"article","venue":"Library and Archives Canada (Government of Canada)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Epidemiology; Quality (philosophy); Medicine; Psychology; Spirometry; Applied psychology; Environmental health; Internal medicine; Epistemology; Asthma","score_opus":0.21748750175156903,"score_gpt":0.3594278734719293,"score_spread":0.14194037172036025,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2809585708","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99158317,0.0016234346,0.0025294337,0.0009460781,0.00007929328,0.00009391611,0.00020534558,0.00004489775,0.0028944039],"genre_scores_gemma":[0.9980034,0.00014174898,0.0014530731,0.000103073544,0.000028658573,0.000043392334,0.000067874214,0.000010418928,0.00014835614],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.6310734,0.30248895,0.0276705,0.007966225,0.028044127,0.0027568187],"domain_scores_gemma":[0.16949408,0.7277454,0.04671317,0.024969352,0.028131995,0.0029459521],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.21817848,0.00034609158,0.0010641043,0.0015149444,0.0011537881,0.0032553214,0.001286355,0.001161955,0.00066800293],"category_scores_gemma":[0.5187152,0.00089076086,0.0014607259,0.001928495,0.002115632,0.0016116527,0.002086414,0.0018218367,0.00017300024],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0016341635,0.00023158058,0.9549431,0.0002244222,0.0010904693,0.00006186967,0.0060986453,0.0011362415,0.00042006472,0.00014952465,0.00045730485,0.03355262],"study_design_scores_gemma":[0.00006991204,0.0007950101,0.9936544,0.00013711749,0.00036813255,0.000154371,0.0010434277,0.0025456185,0.0005709034,0.00013400055,0.00047102117,0.000056100573],"about_ca_topic_score_codex":0.021437326,"about_ca_topic_score_gemma":0.028033823,"teacher_disagreement_score":0.7818215,"about_ca_system_score_codex":0.0024304746,"about_ca_system_score_gemma":0.0036718932,"threshold_uncertainty_score":0.9641251},"labels":[],"label_agreement":null},{"id":"W2886074557","doi":"10.1177/0956797617698528","title":"Increasing the Similarity of Lineup Fillers to the Suspect Improves the Applied Value of Lineups Without Improving Memory Performance: Commentary on Colloff, Wade, and Strange (2016)","year":2018,"lang":"en","type":"letter","venue":"Psychological Science","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":30,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"","keywords":"Suspect; Psychology; Similarity (geometry); Value (mathematics); Cognitive psychology; Psychoanalysis; Social psychology; Artificial intelligence; Criminology","score_opus":0.09294168632646475,"score_gpt":0.3678399947924385,"score_spread":0.27489830846597374,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2886074557","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00015889425,0.0010420679,0.000072184615,0.99100363,0.006950121,0.000004244945,0.00005442792,0.000014549459,0.00069984683],"genre_scores_gemma":[0.0022031176,0.00054588093,0.00021529054,0.9856543,0.010164143,0.000024177676,0.000016687842,0.000015277783,0.0011611258],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9851098,0.0041117324,0.0019105976,0.0029677986,0.0048143696,0.0010856957],"domain_scores_gemma":[0.8888957,0.08056227,0.0044942484,0.0029021518,0.019303294,0.0038423475],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.018613037,0.0009766174,0.0023465124,0.0011256277,0.007047523,0.0050140913,0.0062717358,0.08844365,0.0082631335],"category_scores_gemma":[0.13066047,0.0010337584,0.0021161041,0.0016627825,0.009690746,0.0057891756,0.0034970685,0.078134805,0.009171316],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000098785575,0.00003611102,0.0003247123,0.00010934649,0.000026849051,0.00018792693,0.00036440697,0.000035030756,0.000095402356,0.004638822,0.98289883,0.011183917],"study_design_scores_gemma":[0.00047824995,0.00013024255,0.0035543775,0.001508402,0.00017516526,0.00066544325,0.001407318,0.0003801999,0.0009540648,0.049177047,0.94138855,0.00018096759],"about_ca_topic_score_codex":0.0385115,"about_ca_topic_score_gemma":0.05841541,"teacher_disagreement_score":0.08844365,"about_ca_system_score_codex":0.009179241,"about_ca_system_score_gemma":0.011136743,"threshold_uncertainty_score":0.098436356},"labels":[],"label_agreement":null},{"id":"W2886409188","doi":"","title":"Survey of Canadian human anatomy courses in Kinesiology and Physical Education","year":2014,"lang":"en","type":"article","venue":"European Journal of Anatomy","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Kinesiology; Accreditation; Syllabus; Intraclass correlation; Medical education; Human anatomy; Gross anatomy; Physical education; Medicine; Psychology; Reliability (semiconductor); Anatomy; Mathematics education","score_opus":0.10231163467910354,"score_gpt":0.378678326262698,"score_spread":0.27636669158359445,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2886409188","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9865702,0.00034298562,0.0004287071,0.0008204146,0.000024584288,0.00021978164,0.0021774876,0.00003992887,0.009376004],"genre_scores_gemma":[0.986471,0.000922125,0.0017164116,0.00044809785,0.000015066855,0.00013077915,0.0018216369,0.000018808963,0.00845614],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9975452,0.00017804882,0.000093905524,0.00020939462,0.0015057733,0.00046770027],"domain_scores_gemma":[0.9921961,0.0007306466,0.00084988994,0.00015511017,0.0042178584,0.0018505334],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002442242,0.0002448509,0.00024857564,0.0028027976,0.0025308742,0.0006714733,0.00082558044,0.00035277376,0.0057329554],"category_scores_gemma":[0.006980286,0.00037702764,0.00021644248,0.0049369307,0.0007477154,0.00033957523,0.00080047175,0.00049894734,0.00080195745],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014165885,0.0002665965,0.90683115,0.0002978916,0.000022900655,0.00020339817,0.012078184,0.00021450414,0.0020717767,0.0009870249,0.016189354,0.060695514],"study_design_scores_gemma":[0.0000062780427,0.00006225769,0.9841346,0.000025281122,0.0000050757617,0.00006831725,0.0033349658,0.0002098844,0.00026963136,0.000025643169,0.0118448045,0.000013298313],"about_ca_topic_score_codex":0.94997597,"about_ca_topic_score_gemma":0.9822923,"teacher_disagreement_score":0.9808267,"about_ca_system_score_codex":0.019173345,"about_ca_system_score_gemma":0.030125307,"threshold_uncertainty_score":0.13911301},"labels":[],"label_agreement":null},{"id":"W2908490955","doi":"10.3138/ptc.2017-49.f","title":"La version franco-canadienne du « STrengthening the Reporting of OBservational studies in Epidemiology » (STROBE) Statement : L’outil STROBE","year":2019,"lang":"fr","type":"article","venue":"Physiotherapy Canada","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":true,"ca_institutions":"Children's Hospital of Eastern Ontario; University of Ottawa; Université du Québec en Outaouais; Université de Montréal","funders":"","keywords":"Strengthening the reporting of observational studies in epidemiology; Observational study; Inter-rater reliability; CLARITY; Reliability (semiconductor); Psychology; Ambiguity; Meaning (existential); Cohen's kappa; Kappa; Medical education; Guideline; Applied psychology; Medical physics; Medicine; Computer science; Statistics; Linguistics; Mathematics; Rating scale","score_opus":0.251915228834975,"score_gpt":0.421755229837808,"score_spread":0.16984000100283297,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2908490955","genre_codex":"commentary","genre_gemma":"methods","domain_codex":"methods","domain_gemma":"reporting","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"reporting","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0044002584,0.036348503,0.1976428,0.29296157,0.24015662,0.11635042,0.06074514,0.005125053,0.046269644],"genre_scores_gemma":[0.039441437,0.029002925,0.3154082,0.14837837,0.019554947,0.37701026,0.034254692,0.004695607,0.032253545],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.35738134,0.41740778,0.14957419,0.017358758,0.05232467,0.005953343],"domain_scores_gemma":[0.17830539,0.5151199,0.072299935,0.06268059,0.16624658,0.005347653],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.44141912,0.0033256048,0.010244192,0.016357122,0.0065166713,0.03278679,0.0074465224,0.022484954,0.041306287],"category_scores_gemma":[0.7317411,0.006536078,0.012554498,0.0187772,0.013451249,0.012541897,0.014281619,0.036431704,0.036535412],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0027027966,0.0002870095,0.0022802108,0.03564047,0.0020192023,0.00030167235,0.0055112685,0.00087043596,0.001594026,0.0414668,0.81734866,0.08997748],"study_design_scores_gemma":[0.0033963274,0.00039771307,0.007537694,0.06863921,0.0013353041,0.00071624684,0.0020052316,0.0017219268,0.0016270654,0.040041126,0.8720225,0.000559638],"about_ca_topic_score_codex":0.006184555,"about_ca_topic_score_gemma":0.0045718523,"teacher_disagreement_score":0.5585809,"about_ca_system_score_codex":0.01626911,"about_ca_system_score_gemma":0.05164199,"threshold_uncertainty_score":0.68882966},"labels":[],"label_agreement":null},{"id":"W2912251989","doi":"10.1002/0470011815.b2a04002","title":"Agreement, Measurement of","year":2005,"lang":"en","type":"other","venue":"Encyclopedia of Biostatistics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Categorical variable; Agreement; Unanimity; Measure (data warehouse); Kappa; Interpretation (philosophy); Statistics; Mathematics; Monotonic function; Interval (graph theory); Computer science; Data mining; Combinatorics; Mathematical analysis; Geometry; Linguistics","score_opus":0.07732314664788557,"score_gpt":0.3405152790255392,"score_spread":0.2631921323776536,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2912251989","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.06761881,0.050526965,0.3494992,0.017790895,0.0083350325,0.0039024493,0.013500357,0.0014760043,0.4873503],"genre_scores_gemma":[0.748652,0.018166976,0.17668673,0.006578305,0.002564338,0.006071927,0.006113507,0.000982791,0.034183424],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.90426356,0.041243363,0.010235264,0.011391304,0.031655855,0.0012106528],"domain_scores_gemma":[0.84062445,0.09310912,0.014874561,0.0149939405,0.033916857,0.0024810731],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05191459,0.0008940796,0.001211096,0.007431351,0.0014545483,0.00562805,0.0024391646,0.0013360083,0.029271526],"category_scores_gemma":[0.25563315,0.00041144842,0.0009578793,0.0075848,0.00451027,0.008441395,0.0064589716,0.0025440329,0.0069147563],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005635528,0.00020845412,0.033327952,0.005995002,0.0006292152,0.00023684037,0.013354791,0.0013960376,0.0011506447,0.23499875,0.08065383,0.62748504],"study_design_scores_gemma":[0.00009115299,0.00047831176,0.052063823,0.0076178,0.0004625437,0.0014916799,0.009303912,0.003176277,0.0029922568,0.42046288,0.5016039,0.0002554688],"about_ca_topic_score_codex":0.0015939024,"about_ca_topic_score_gemma":0.0014947306,"teacher_disagreement_score":0.05191459,"about_ca_system_score_codex":0.0038388583,"about_ca_system_score_gemma":0.005402468,"threshold_uncertainty_score":0.27455384},"labels":[],"label_agreement":null},{"id":"W2913588687","doi":"10.1002/pds.4701","title":"Conditional validation sampling for consistent risk estimation with binary outcome data subject to misclassification","year":2019,"lang":"en","type":"article","venue":"Pharmacoepidemiology and Drug Safety","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University; Carleton University; Institute of Population and Public Health; University of Ottawa","funders":"Natural Sciences and Engineering Research Council of Canada; Mitacs","keywords":"Statistics; Contingency table; Categorical variable; Sampling (signal processing); Sample size determination; Simple random sample; Stratified sampling; Sampling design; Estimator; Odds ratio; Econometrics; Computer science; Medicine; Mathematics; Population","score_opus":0.3722356889622388,"score_gpt":0.482635052189559,"score_spread":0.11039936322732019,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2913588687","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.016010828,0.00019312162,0.9826041,0.00013928999,0.000034501852,0.00040725662,0.000094368566,0.00015863421,0.00035784385],"genre_scores_gemma":[0.45655206,0.00026387503,0.53974164,0.0003517198,0.00007455689,0.0018800413,0.00063561986,0.000094553034,0.00040598784],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.87665975,0.110917754,0.002290448,0.004185098,0.0053737666,0.00057319493],"domain_scores_gemma":[0.5626011,0.38562086,0.0173744,0.02625851,0.0072003137,0.0009448031],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.13923055,0.0011100317,0.002071087,0.001946293,0.0010260395,0.0014988448,0.0031279959,0.0015030954,0.002060096],"category_scores_gemma":[0.38317552,0.00094564294,0.002231459,0.0016748722,0.003317502,0.001705293,0.0026948792,0.0022764716,0.0003318226],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0022325825,0.00033927723,0.095353134,0.0011780292,0.0022432185,0.00067564513,0.0012964378,0.47483236,0.0022513068,0.24516892,0.0039053832,0.17052372],"study_design_scores_gemma":[0.00029180644,0.00042141485,0.008778677,0.00044462612,0.0002826527,0.00027082098,0.000075970616,0.88532573,0.003013515,0.09888516,0.002135436,0.00007430473],"about_ca_topic_score_codex":0.004845653,"about_ca_topic_score_gemma":0.0030356452,"teacher_disagreement_score":0.13923055,"about_ca_system_score_codex":0.0016811049,"about_ca_system_score_gemma":0.0030202058,"threshold_uncertainty_score":0.73633033},"labels":[],"label_agreement":null},{"id":"W2965392335","doi":"10.1111/jth.14540","title":"Reply: Method agreement analysis and interobserver reliability of the ISTH proposed definitions for effective hemostasis in the management of major bleeding: Methodological issues","year":2019,"lang":"en","type":"letter","venue":"Journal of Thrombosis and Haemostasis","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Kappa; Cohen's kappa; Medicine; Statistics; Scopus; MEDLINE; Mathematics; Family medicine","score_opus":0.3948113073500375,"score_gpt":0.4581062183798813,"score_spread":0.0632949110298438,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2965392335","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00037277045,0.00031406232,0.00022650267,0.98493576,0.013410871,0.000020564607,0.0000932159,0.000018436596,0.0006078559],"genre_scores_gemma":[0.0032072437,0.0002414702,0.00074999995,0.97944754,0.014431695,0.00010160203,0.000035326582,0.000018956296,0.0017662406],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9782793,0.009228655,0.0047265585,0.0018850252,0.0044919653,0.0013885022],"domain_scores_gemma":[0.8789188,0.08819614,0.004610159,0.0027518072,0.022335153,0.0031878988],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.024784746,0.00090614735,0.002201597,0.0014372666,0.0052467473,0.005211676,0.002416145,0.06572437,0.004216665],"category_scores_gemma":[0.14688054,0.001181601,0.0014661276,0.0016398084,0.005086683,0.004200345,0.0022906065,0.05248076,0.005396338],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00016527231,0.000048127913,0.0022150085,0.00014690011,0.000059553437,0.0009941541,0.0006726453,0.00007627592,0.00021272062,0.003902881,0.98233217,0.009174382],"study_design_scores_gemma":[0.0005132081,0.0001775983,0.008618922,0.0013753744,0.00021874753,0.0030523879,0.0032366659,0.0018946907,0.0008232685,0.028794173,0.95093906,0.00035595888],"about_ca_topic_score_codex":0.012232191,"about_ca_topic_score_gemma":0.016202135,"teacher_disagreement_score":0.06572437,"about_ca_system_score_codex":0.0057594324,"about_ca_system_score_gemma":0.0075755017,"threshold_uncertainty_score":0.1310758},"labels":[],"label_agreement":null},{"id":"W2979614843","doi":"10.1016/j.jbiomech.2019.109410","title":"A machine-learning method for classifying and analyzing foot placement: Application to manual material handling","year":2019,"lang":"en","type":"article","venue":"Journal of Biomechanics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval; Institut de Recherche Robert-Sauvé en Santé et en Sécurité du Travail; Centre intégré universitaire de santé et de services sociaux de la Capitale-Nationale; Centre for Interdisciplinary Research in Rehabilitation; Centre Intégré Universitaire de Santé et de Services Sociaux du Centre-Sud-de-l'Île-de-Montréal; Centre Intégré Universitaire de Santé et de Services Sociaux du Saguenay–Lac-Saint-Jean","funders":"Mitacs; Institut de Recherche Robert-Sauvé en Santé et en Sécurité du Travail","keywords":"Foot (prosody); Computer science; Task (project management); Set (abstract data type); Artificial intelligence; Displacement (psychology); Machine learning; Class (philosophy); Engineering; Psychology","score_opus":0.06836018796622308,"score_gpt":0.3844547014322206,"score_spread":0.31609451346599754,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2979614843","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.048551444,0.00021399255,0.94858086,0.00013782669,0.000079517995,0.00014290708,0.00020439673,0.0014835242,0.0006054625],"genre_scores_gemma":[0.29163,0.00017658249,0.70524544,0.00008976005,0.00007380314,0.0002968016,0.00033476346,0.00011381338,0.0020391056],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9984896,0.00041345131,0.0001517693,0.0003183037,0.0005465506,0.00008028959],"domain_scores_gemma":[0.9933136,0.0040742494,0.0003766552,0.00048870314,0.0016205912,0.00012613753],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0030559113,0.0008969158,0.0014727524,0.0021968859,0.001036971,0.0011956084,0.0015717698,0.0018092772,0.0022694524],"category_scores_gemma":[0.0083922865,0.00048738558,0.0010116121,0.0022223662,0.0005504188,0.0007937885,0.0009340459,0.0012728416,0.0009777024],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003259587,0.0005314286,0.008827011,0.00016525167,0.00018047304,0.00013666673,0.00017587359,0.0909024,0.01310755,0.001181099,0.0022998617,0.88216645],"study_design_scores_gemma":[0.000029546582,0.00014999928,0.0038722511,0.000014585151,0.000029321542,0.00016928748,0.000044586443,0.98945224,0.003843185,0.0015280583,0.0008334756,0.000033422886],"about_ca_topic_score_codex":0.0077219494,"about_ca_topic_score_gemma":0.008129021,"teacher_disagreement_score":0.0077219494,"about_ca_system_score_codex":0.0006204563,"about_ca_system_score_gemma":0.0016733921,"threshold_uncertainty_score":0.016161442},"labels":[],"label_agreement":null},{"id":"W2983818347","doi":"10.3138/ptc-2018-0110","title":"How to Optimize Measurement Protocols: An Example of Assessing Measurement Reliability Using Generalizability Theory","year":2019,"lang":"en","type":"article","venue":"Physiotherapy Canada","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"University of Waterloo; McMaster University","funders":"","keywords":"Generalizability theory; Reliability (semiconductor); Computer science; Observational error; Terminology; Reliability engineering; Measurement uncertainty; Standard error; Data mining; Statistics; Power (physics); Mathematics","score_opus":0.29425411750762454,"score_gpt":0.3971427089229444,"score_spread":0.10288859141531986,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2983818347","genre_codex":"methods","genre_gemma":"methods","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0062275943,0.0019223628,0.97611225,0.0074579553,0.0003288245,0.0031315146,0.000108565706,0.00042480958,0.004286106],"genre_scores_gemma":[0.057056226,0.0006958988,0.9363919,0.0010209372,0.000114362825,0.004292158,0.00005775361,0.00016224546,0.00020847238],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.31370768,0.6172226,0.028897997,0.010811306,0.028087333,0.0012731241],"domain_scores_gemma":[0.23488745,0.6088208,0.027832434,0.076115236,0.050804883,0.0015393185],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.56267995,0.0032028398,0.0037019113,0.008494563,0.0036721148,0.00794685,0.004571581,0.004892358,0.0032204324],"category_scores_gemma":[0.70674783,0.001845496,0.004270578,0.008181102,0.0142275,0.013375646,0.009075482,0.009487773,0.0011138248],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003538071,0.00044434777,0.017158939,0.0062921294,0.0022504847,0.00025182188,0.022512276,0.016696785,0.002203461,0.23079424,0.0084917545,0.69255],"study_design_scores_gemma":[0.00057231035,0.0015964723,0.016087152,0.01092399,0.0011897484,0.0005783148,0.0063278275,0.0616543,0.007542802,0.84232885,0.05052711,0.0006712304],"about_ca_topic_score_codex":0.005099233,"about_ca_topic_score_gemma":0.004127836,"teacher_disagreement_score":0.43732005,"about_ca_system_score_codex":0.009221544,"about_ca_system_score_gemma":0.021592475,"threshold_uncertainty_score":0.5392935},"labels":[],"label_agreement":null},{"id":"W2990689782","doi":"10.5753/cbie.sbie.2019.199","title":"Avaliação de Juízes: Um Modelo Estatístico para Perfilação de Avaliadores","year":2019,"lang":"pt","type":"article","venue":"Anais do XXX Simpósio Brasileiro de Informática na Educação (SBIE 2019)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Canadian Bureau for International Education","keywords":"Concordance; Competence (human resources); Statistics; Psychology; Mathematics; Computer science; Social psychology; Medicine","score_opus":0.0738775683116693,"score_gpt":0.35990389654441995,"score_spread":0.28602632823275065,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2990689782","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.32218412,0.0014192984,0.6478744,0.0036644544,0.00023969854,0.0018271502,0.002207239,0.0017567528,0.018826911],"genre_scores_gemma":[0.85533637,0.00053568033,0.13738966,0.00016886549,0.00004862695,0.0013191226,0.0005782711,0.0001319329,0.0044913883],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9890315,0.006353465,0.0005722745,0.0016820322,0.0018509645,0.00050981005],"domain_scores_gemma":[0.9328867,0.0529807,0.004777761,0.0032169796,0.005355135,0.00078270887],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.016268317,0.0013115285,0.001205871,0.0039185723,0.0010366599,0.0052799135,0.0022298936,0.0018674684,0.008080332],"category_scores_gemma":[0.076089695,0.0009937666,0.002526972,0.004045921,0.0014515346,0.004937514,0.0021842674,0.0023922648,0.0013103781],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013559442,0.0012673794,0.30998665,0.0028256746,0.0013322388,0.0004551568,0.016470505,0.23248562,0.004457063,0.077853106,0.007682885,0.34382775],"study_design_scores_gemma":[0.00020060834,0.0017419574,0.11280089,0.0007950452,0.00083690585,0.00045808495,0.0049251853,0.7945675,0.0025131789,0.06258772,0.018313136,0.0002596592],"about_ca_topic_score_codex":0.013604605,"about_ca_topic_score_gemma":0.014250478,"teacher_disagreement_score":0.016268317,"about_ca_system_score_codex":0.002829684,"about_ca_system_score_gemma":0.0048124967,"threshold_uncertainty_score":0.086036086},"labels":[],"label_agreement":null},{"id":"W2996204535","doi":"10.1364/josaa.381305","title":"Predicting the Farnsworth–Munsell D15 and Holmes–Wright-A lantern outcomes with computer-based color vision tests","year":2019,"lang":"en","type":"article","venue":"Journal of the Optical Society of America A","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Defence Research and Development Canada; University of Waterloo","funders":"Canadian Institute for Military and Veteran Health Research; Defence Research and Development Canada","keywords":"Contrast (vision); Wright; Mathematics; Artificial intelligence; Computer science; Art; Art history","score_opus":0.03117396616887044,"score_gpt":0.31091650768609497,"score_spread":0.27974254151722455,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2996204535","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99746597,0.00009023641,0.0013449534,0.000018798213,0.000007664756,0.00002394146,0.00009801471,0.000015632599,0.0009348835],"genre_scores_gemma":[0.99908364,0.00001984257,0.0006245784,0.0000063658376,0.000002875485,0.000008373532,0.000087678025,0.0000024269173,0.0001642703],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9973832,0.0010543525,0.00029695366,0.0003276208,0.0007600251,0.00017778443],"domain_scores_gemma":[0.98759425,0.005930401,0.0023644867,0.0007932617,0.0028529805,0.00046459748],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004518619,0.00034864695,0.00026125458,0.0019031967,0.0002569104,0.0006173662,0.00047934224,0.00037882457,0.0009994431],"category_scores_gemma":[0.017265286,0.00014662117,0.0004211092,0.0006866346,0.00033621604,0.0005170467,0.0006942787,0.00032536013,0.00033071282],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00019115022,0.00007448406,0.9892582,0.000009516437,0.000034264613,0.000020833537,0.00014596908,0.0002564338,0.00019122023,0.000050731654,0.00013573181,0.0096314475],"study_design_scores_gemma":[0.000016110522,0.00033235576,0.99332327,0.000012883132,0.000032596516,0.00021325426,0.0002660591,0.0044095726,0.000933332,0.00014878689,0.00030063404,0.000011149049],"about_ca_topic_score_codex":0.007995313,"about_ca_topic_score_gemma":0.008598569,"teacher_disagreement_score":0.007995313,"about_ca_system_score_codex":0.00048446958,"about_ca_system_score_gemma":0.00037698363,"threshold_uncertainty_score":0.023896992},"labels":[],"label_agreement":null},{"id":"W3006084164","doi":"10.1186/s13643-020-01291-z","title":"Inter-rater reliability and validity of risk of bias instrument for non-randomized studies of exposures: a study protocol","year":2020,"lang":"en","type":"article","venue":"Systematic Reviews","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Public Health Ontario; Queen's University; George & Fay Yee Centre for Healthcare Innovation; University of Toronto; University of Ottawa; St. Michael's Hospital; University of Manitoba","funders":"","keywords":"Medicine; Protocol (science); Concordance; Reliability (semiconductor); Concurrent validity; Inter-rater reliability; Medical physics; Statistic; Applied psychology; Medical education; Clinical psychology; Psychology; Statistics; Internal consistency; Psychometrics; Rating scale; Alternative medicine; Pathology","score_opus":0.5050424449137488,"score_gpt":0.47030656839311014,"score_spread":0.0347358765206387,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3006084164","genre_codex":"protocol","genre_gemma":"protocol","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"protocol","genre_consensus":"protocol","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0011633713,0.00046531146,0.013279538,0.00026209364,0.00025597584,0.9830951,0.0006887546,0.00010409647,0.0006857109],"genre_scores_gemma":[0.0012696801,0.00016183041,0.011106325,0.00009159704,0.000035586938,0.98710096,0.00012003527,0.0000126153955,0.00010139554],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.5760104,0.27261916,0.104251176,0.0138197,0.028787747,0.004511868],"domain_scores_gemma":[0.53391975,0.21828428,0.06351654,0.044115923,0.1338624,0.0063011027],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3926304,0.0047415327,0.0086845895,0.009839644,0.0038592077,0.0053345477,0.0048583187,0.00730645,0.027945338],"category_scores_gemma":[0.45724112,0.004564649,0.009008442,0.008799967,0.0051920544,0.005938741,0.0031134451,0.0074583595,0.011222057],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.08092365,0.007693774,0.016192762,0.33688152,0.0068509704,0.0020992418,0.017577976,0.0072388314,0.011604082,0.042747546,0.10006879,0.37012097],"study_design_scores_gemma":[0.15787837,0.027220916,0.073903024,0.24129535,0.008242528,0.0027062832,0.005988686,0.03335004,0.019472199,0.05203188,0.37583026,0.0020805127],"about_ca_topic_score_codex":0.001399637,"about_ca_topic_score_gemma":0.002682252,"teacher_disagreement_score":0.6073696,"about_ca_system_score_codex":0.008097962,"about_ca_system_score_gemma":0.040126864,"threshold_uncertainty_score":0.7489948},"labels":[],"label_agreement":null},{"id":"W3007618168","doi":"10.48550/arxiv.2003.00316","title":"Model-based ROC (mROC) curve: examining the effect of case-mix and model calibration on the ROC plot","year":2020,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Receiver operating characteristic; Calibration; Smoothing; Plot (graphics); Computer science; Sample (material); Statistics; Calibration curve; Context (archaeology); Sensitivity (control systems); Artificial intelligence; Mathematics; Engineering","score_opus":0.358866620347382,"score_gpt":0.2718861623654973,"score_spread":0.0869804579818847,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3007618168","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1628128,0.009243466,0.7860016,0.003099243,0.0006965371,0.0020737778,0.013072738,0.010848103,0.012151663],"genre_scores_gemma":[0.76113135,0.0014854061,0.22283229,0.001079632,0.0002723312,0.002249254,0.0067997933,0.0026284757,0.0015216484],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9328339,0.044357695,0.004040967,0.008374025,0.009357874,0.0010354071],"domain_scores_gemma":[0.53915787,0.3732585,0.03225481,0.03198643,0.021416396,0.0019259845],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.104162276,0.002344486,0.0025938225,0.007509181,0.0008071916,0.0055630514,0.0029506804,0.0030187068,0.0077315094],"category_scores_gemma":[0.37876347,0.00078737404,0.0045793406,0.0056106034,0.0025279124,0.0040627955,0.0037865385,0.0030461706,0.002703078],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0045734374,0.00060823536,0.32042187,0.0053438065,0.0082934275,0.0012361342,0.0028544527,0.16538009,0.0045052436,0.037633136,0.053102583,0.3960475],"study_design_scores_gemma":[0.00048367784,0.003028523,0.1754084,0.0023258354,0.0031567835,0.0044864626,0.0017468579,0.66595495,0.011444942,0.080237575,0.050882082,0.0008439193],"about_ca_topic_score_codex":0.0035993184,"about_ca_topic_score_gemma":0.001959881,"teacher_disagreement_score":0.8958377,"about_ca_system_score_codex":0.0020969193,"about_ca_system_score_gemma":0.0024851628,"threshold_uncertainty_score":0.55086935},"labels":[],"label_agreement":null},{"id":"W3010669063","doi":"","title":"Blinding in Rehabilitation Research Empirical Evidence on the Association Between Blinding and Treatment Effect Estimates","year":2020,"lang":"en","type":"article","venue":"STM:n Hallinnonalan avoin julkaisuarkisto (Julkari)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Blinding; Meta-analysis; Rehabilitation; Association (psychology); Sample size determination; Clinical study design; Randomized controlled trial; Medicine; Systematic review; Psychology; Clinical trial; MEDLINE; Clinical psychology; Physical therapy; Statistics; Biology; Internal medicine; Mathematics; Psychotherapist","score_opus":0.5791521620950734,"score_gpt":0.5027552196974594,"score_spread":0.07639694239761396,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3010669063","genre_codex":"review","genre_gemma":"empirical","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.03562455,0.7477988,0.16437438,0.016719613,0.00789944,0.011736533,0.0025590106,0.00045200338,0.012835674],"genre_scores_gemma":[0.6272922,0.17635882,0.14851981,0.014710428,0.004743026,0.023920225,0.0016887042,0.0006161059,0.0021507603],"study_design_codex":"systematic_review","study_design_gemma":"observational","domain_scores_codex":[0.23928137,0.53121245,0.14599688,0.022005683,0.05877081,0.0027329582],"domain_scores_gemma":[0.07053311,0.78156555,0.08637401,0.037052985,0.023609843,0.0008645198],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.5601321,0.0024228492,0.010915221,0.009711204,0.0034164398,0.012197441,0.004794013,0.008426246,0.011278914],"category_scores_gemma":[0.8238437,0.0030660057,0.014789054,0.010207118,0.0139926085,0.013906119,0.008447819,0.0068744966,0.0012582258],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.012550547,0.00042904017,0.03767407,0.44365072,0.06064132,0.00029402724,0.0058201905,0.0032992514,0.0010328087,0.041346796,0.007568432,0.38569283],"study_design_scores_gemma":[0.013396145,0.0047322917,0.05020561,0.5835832,0.10200788,0.0017534344,0.0026601288,0.0061996095,0.0081065,0.1654475,0.06088049,0.0010273424],"about_ca_topic_score_codex":0.0033842754,"about_ca_topic_score_gemma":0.0025835298,"teacher_disagreement_score":0.4398679,"about_ca_system_score_codex":0.007817675,"about_ca_system_score_gemma":0.020228462,"threshold_uncertainty_score":0.5424355},"labels":[],"label_agreement":null},{"id":"W3018802573","doi":"10.1007/s42979-020-00129-8","title":"Detection of Opinion Communities with the Help of Chance-Corrected Measures of Agreement","year":2020,"lang":"en","type":"article","venue":"SN Computer Science","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Jaccard index; Similarity (geometry); Scale (ratio); Cosine similarity; Computer science; Index (typography); Information retrieval; Artificial intelligence; Statistics; Psychology; Econometrics; Mathematics; Pattern recognition (psychology); World Wide Web; Image (mathematics)","score_opus":0.2141702298403869,"score_gpt":0.32400120330889387,"score_spread":0.10983097346850698,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3018802573","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.17498949,0.0003195618,0.8191943,0.00014164129,0.000118602315,0.00034472824,0.00051781203,0.0016112931,0.0027625482],"genre_scores_gemma":[0.8155903,0.000042074247,0.18274139,0.00003998998,0.000052994288,0.0003488229,0.00059015973,0.00021879301,0.00037546086],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.93668896,0.03679762,0.0050528934,0.010152706,0.009694244,0.0016134462],"domain_scores_gemma":[0.7355078,0.18216754,0.021930244,0.032256998,0.02581674,0.002320692],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.059663244,0.0010273609,0.0019895365,0.0074961786,0.00190534,0.004460532,0.0024674842,0.0024389522,0.0020894303],"category_scores_gemma":[0.26232308,0.00070506247,0.001690334,0.004046388,0.00203769,0.0054091187,0.0043749134,0.0022951716,0.0010591394],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0029114159,0.0007016558,0.3450546,0.0017045271,0.003561597,0.0006370786,0.010925132,0.031550866,0.04374363,0.06267475,0.009506069,0.4870286],"study_design_scores_gemma":[0.00013964828,0.0006402491,0.10179079,0.00021011366,0.0005195424,0.001396369,0.001502568,0.7640028,0.03192862,0.09252402,0.004916574,0.00042865536],"about_ca_topic_score_codex":0.0011911098,"about_ca_topic_score_gemma":0.0013902012,"teacher_disagreement_score":0.059663244,"about_ca_system_score_codex":0.0008273748,"about_ca_system_score_gemma":0.0013917085,"threshold_uncertainty_score":0.31553322},"labels":[],"label_agreement":null},{"id":"W3022460225","doi":"10.1002/0470011815.b2a04024","title":"Kappa and Its Dependence on Marginal Rates","year":2005,"lang":"en","type":"other","venue":"Encyclopedia of Biostatistics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":18,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Kappa; Cohen's kappa; Statistic; Statistics; Mathematics; Measure (data warehouse); Agreement; Econometrics; Computer science; Data mining; Geometry","score_opus":0.060338978963988564,"score_gpt":0.35817373683181414,"score_spread":0.2978347578678256,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3022460225","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.060217213,0.012385638,0.8718742,0.0058041518,0.0009972538,0.00031578707,0.0011203083,0.00075584836,0.04652954],"genre_scores_gemma":[0.81957006,0.0045570065,0.16455345,0.0009570866,0.0010713798,0.00072276976,0.00063346373,0.0006079973,0.0073267207],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8241579,0.119671695,0.0076815556,0.015257286,0.031340685,0.0018908909],"domain_scores_gemma":[0.24277335,0.67737204,0.017196259,0.036237042,0.024786457,0.0016348157],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.12138195,0.0010102474,0.0024292055,0.0077210725,0.0017512203,0.007379512,0.003561037,0.0020036956,0.010593924],"category_scores_gemma":[0.5817587,0.0011316221,0.0019780141,0.008495572,0.011047163,0.009604207,0.005593759,0.0045076543,0.0020950243],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004856254,0.00004762187,0.029902926,0.0008920458,0.0007204625,0.00022869378,0.003287732,0.018975906,0.00037719798,0.7578335,0.010803472,0.17644493],"study_design_scores_gemma":[0.000030449939,0.00009530169,0.01644013,0.0005942175,0.00015752247,0.00067350524,0.00047991384,0.047830302,0.00070896774,0.92018074,0.012643135,0.00016581567],"about_ca_topic_score_codex":0.00431154,"about_ca_topic_score_gemma":0.002383588,"teacher_disagreement_score":0.12138195,"about_ca_system_score_codex":0.0034909805,"about_ca_system_score_gemma":0.0024631277,"threshold_uncertainty_score":0.6419368},"labels":[],"label_agreement":null},{"id":"W3022717317","doi":"10.1002/0470011815.b2a04043","title":"Receiver Operating Characteristic (<scp>ROC</scp>) Curves","year":2005,"lang":"en","type":"other","venue":"Encyclopedia of Biostatistics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":18,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Receiver operating characteristic; Fraction (chemistry); Mathematics; Boundary (topology); Statistics; Mathematical analysis; Chromatography; Chemistry","score_opus":0.04874646265946651,"score_gpt":0.3331996619537859,"score_spread":0.2844531992943194,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3022717317","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.016338203,0.046796322,0.44700277,0.00758577,0.0028242886,0.0019503328,0.093844265,0.023565218,0.3600928],"genre_scores_gemma":[0.22173506,0.04343954,0.48962322,0.004409852,0.0041511455,0.005201792,0.075898,0.011164916,0.14437644],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9866763,0.005691292,0.0017334135,0.00085470517,0.004791843,0.00025251464],"domain_scores_gemma":[0.93008584,0.045219198,0.0057538357,0.0051326016,0.013191967,0.0006165292],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01121102,0.0015032386,0.0012645887,0.010493587,0.0003324147,0.0028091404,0.0017671149,0.0011769705,0.07211109],"category_scores_gemma":[0.10442373,0.00033240393,0.0011880883,0.013243569,0.0005797844,0.002390564,0.0010937492,0.0014717802,0.03757822],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00041840874,0.000115628915,0.006808899,0.0033257774,0.00023235919,0.00034793653,0.00019041417,0.003587598,0.0007093621,0.029701762,0.3986325,0.55592924],"study_design_scores_gemma":[0.00018801732,0.0005690242,0.036184236,0.0033898081,0.000439841,0.0048908824,0.0003092535,0.015808657,0.006580903,0.04565214,0.8857238,0.00026324866],"about_ca_topic_score_codex":0.0014737662,"about_ca_topic_score_gemma":0.0011704218,"teacher_disagreement_score":0.07211109,"about_ca_system_score_codex":0.0011187061,"about_ca_system_score_gemma":0.0011888524,"threshold_uncertainty_score":0.24123567},"labels":[],"label_agreement":null},{"id":"W3024254388","doi":"10.1017/cem.2020.114","title":"LO59: Reliability of patient reported exposure and outcome data in a prospective cohort study of older adults presenting to the emergency department","year":2020,"lang":"en","type":"article","venue":"Canadian Journal of Emergency Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Medicine; Emergency department; Medical record; Prospective cohort study; Confidence interval; Observational study; Kappa; Emergency medicine; Cohort study; Cohort; Cohen's kappa; Medical emergency; Pediatrics; Internal medicine; Psychiatry","score_opus":0.20366690364353798,"score_gpt":0.398192247962641,"score_spread":0.19452534431910304,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3024254388","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9980562,0.00011775651,0.00038582715,0.0000732048,0.000025424288,0.00003362256,0.00077609794,0.000009066795,0.00052283343],"genre_scores_gemma":[0.9976901,0.0000559649,0.00037267315,0.00007918258,0.000027568085,0.00005791884,0.0014154152,0.000012833401,0.00028840717],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9918515,0.0036733972,0.0013032001,0.0013043727,0.0013646082,0.00050297024],"domain_scores_gemma":[0.9768167,0.008864738,0.007201199,0.0029540262,0.0030670078,0.0010961699],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.010909759,0.0005171529,0.0007656829,0.0013784728,0.00066493667,0.0015497686,0.00096571725,0.001334411,0.0013706577],"category_scores_gemma":[0.029705295,0.0005581059,0.0012533721,0.0012207737,0.0005745452,0.001051945,0.001989561,0.0011124044,0.0005196916],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025675946,0.000060218394,0.9982377,0.000010262879,0.00013528712,0.00002039478,0.00015456021,0.000033152777,0.00011834574,0.000023551926,0.00013691057,0.00081276236],"study_design_scores_gemma":[0.000031910236,0.00013568184,0.99893373,0.000009644769,0.000053338168,0.000070791975,0.0001884187,0.00023796513,0.000058212456,0.000025291414,0.0002463955,0.000008619384],"about_ca_topic_score_codex":0.009078922,"about_ca_topic_score_gemma":0.0069684135,"teacher_disagreement_score":0.98909026,"about_ca_system_score_codex":0.0005971427,"about_ca_system_score_gemma":0.00071869005,"threshold_uncertainty_score":0.057697058},"labels":[],"label_agreement":null},{"id":"W3035592618","doi":"10.1186/s12874-020-01022-x","title":"Using multiple agreement methods for continuous repeated measures data: a tutorial for practitioners","year":2020,"lang":"en","type":"article","venue":"BMC Medical Research Methodology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":88,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada; Emory University","keywords":"Concordance; Cohen's kappa; Computer science; Concordance correlation coefficient; Data mining; Statistics; Strengths and weaknesses; Correlation coefficient; Pulmonary disease; Limits of agreement; Medical physics; Medicine; Mathematics; Machine learning; Psychology","score_opus":0.9644013985579888,"score_gpt":0.7181859517571121,"score_spread":0.2462154468008767,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3035592618","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00030649846,0.020226352,0.94987935,0.013271169,0.00375168,0.0016834651,0.00089703064,0.004437332,0.0055469912],"genre_scores_gemma":[0.0027786843,0.015867308,0.9657905,0.003992304,0.0023787064,0.004652568,0.0004630288,0.0017153926,0.0023615032],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9147992,0.060495,0.009523525,0.002798112,0.011822731,0.0005614527],"domain_scores_gemma":[0.54271424,0.4043837,0.009474179,0.011236601,0.030301519,0.0018897385],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.11275549,0.005298162,0.0034118271,0.011170613,0.0015168489,0.0053774095,0.007489451,0.0074494095,0.027403688],"category_scores_gemma":[0.30816746,0.0038980243,0.0051182946,0.00689824,0.0053493744,0.011252357,0.004451348,0.0151299955,0.022678407],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00019098278,0.0003208034,0.001267667,0.012919667,0.0004461607,0.0008374805,0.005272673,0.0034833779,0.0025045886,0.051316924,0.38537976,0.5360599],"study_design_scores_gemma":[0.00021164495,0.00038699192,0.0019663812,0.014597695,0.00016511149,0.003003834,0.0019092268,0.012348949,0.002034667,0.1909147,0.771984,0.00047689647],"about_ca_topic_score_codex":0.0023190668,"about_ca_topic_score_gemma":0.0030403417,"teacher_disagreement_score":0.11275549,"about_ca_system_score_codex":0.0026905008,"about_ca_system_score_gemma":0.0054100472,"threshold_uncertainty_score":0.59631515},"labels":[],"label_agreement":null},{"id":"W3040882905","doi":"10.1164/ajrccm-conference.2020.201.1_meetingabstracts.a2632","title":"Intra- and Inter-Rater Reliability of Pathologic Classification of Type of Progressive Massive Fibrosis Among Deceased U.S. Coal Miners","year":2020,"lang":"en","type":"article","venue":"","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Reliability (semiconductor); Coal; Coal field; Fibrosis; Field (mathematics); Pathology; Computer science; Medicine; Engineering; Coal mining; Mathematics; Physics; Power (physics)","score_opus":0.1467529835156056,"score_gpt":0.35203900615208683,"score_spread":0.20528602263648124,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3040882905","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9980788,0.00018941595,0.0009176576,0.00003247526,0.000019046302,0.000022203598,0.00025291793,0.000010071117,0.00047749336],"genre_scores_gemma":[0.99882394,0.000062231724,0.0006358511,0.000011175604,0.000008614304,0.000018927167,0.0002648032,0.0000034596512,0.00017102264],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99108034,0.004902711,0.0012328824,0.00093596877,0.0015121402,0.00033602264],"domain_scores_gemma":[0.9616849,0.01809862,0.004625025,0.0039966675,0.011004665,0.0005901495],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0137677565,0.00026169757,0.00038088212,0.0013089074,0.00040995868,0.0006302657,0.00045426178,0.0004433577,0.00040067697],"category_scores_gemma":[0.042323973,0.00021503141,0.00061081524,0.0005322006,0.0006068763,0.0005565977,0.0009299412,0.00044634173,0.00023634237],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00048102942,0.000046157842,0.98772836,0.000032448883,0.0002094,0.000044304386,0.0017260391,0.0003998882,0.000711798,0.00008648828,0.00029742814,0.008236694],"study_design_scores_gemma":[0.000025146292,0.0002489065,0.99335337,0.000038248923,0.00012304375,0.0002431784,0.0010296478,0.0032951415,0.0009907348,0.00017117114,0.0004636485,0.00001780804],"about_ca_topic_score_codex":0.0060586245,"about_ca_topic_score_gemma":0.008338683,"teacher_disagreement_score":0.9862322,"about_ca_system_score_codex":0.00040278232,"about_ca_system_score_gemma":0.00046693708,"threshold_uncertainty_score":0.07281178},"labels":[],"label_agreement":null},{"id":"W3041465882","doi":"10.1161/strokeaha.120.030252","title":"Probabilistic Reasoning in Stroke","year":2020,"lang":"en","type":"review","venue":"Stroke","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Population Health Research Institute","funders":"","keywords":"Medicine; Stroke (engine); Probabilistic logic; Artificial intelligence","score_opus":0.24299888323263313,"score_gpt":0.4225504724540668,"score_spread":0.17955158922143366,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3041465882","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00004763766,0.9992986,0.00014089786,0.00028279924,0.00007674347,0.0000060464763,0.000009752048,0.000002101972,0.00013533948],"genre_scores_gemma":[0.0019355133,0.9969344,0.0003768885,0.00039572758,0.00024630604,0.000019028019,0.000018675046,0.0000015236772,0.000071831404],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9935789,0.003458005,0.00092873385,0.0005659651,0.0013236413,0.00014481958],"domain_scores_gemma":[0.96385205,0.031777136,0.0018452081,0.00046868986,0.0018409097,0.00021599894],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013889507,0.0012800687,0.006558695,0.0038320504,0.00057019474,0.0037030582,0.0024069543,0.003337697,0.0055058687],"category_scores_gemma":[0.043371197,0.0010194494,0.0026701372,0.0045056376,0.0029518886,0.0036009452,0.0018127623,0.0050930534,0.00077229127],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00031217324,0.00007487366,0.0006552003,0.10627778,0.0019277176,0.000059099646,0.00013671945,0.0008668411,0.000058834496,0.009052372,0.012490611,0.86808765],"study_design_scores_gemma":[0.001020985,0.00072122813,0.016535247,0.4005493,0.013730017,0.0016622952,0.0006358858,0.0030462875,0.000663684,0.10872373,0.45224202,0.00046926306],"about_ca_topic_score_codex":0.011301963,"about_ca_topic_score_gemma":0.016650895,"teacher_disagreement_score":0.013889507,"about_ca_system_score_codex":0.003483489,"about_ca_system_score_gemma":0.007690562,"threshold_uncertainty_score":0.07345563},"labels":[],"label_agreement":null},{"id":"W3044355609","doi":"10.1177/1055665620944053","title":"Response to “Nasalance-Based Preclassification of Oral–Nasal Balance Disorders Results in Higher Agreement of Expert Listeners: Methodological Issue”","year":2020,"lang":"en","type":"letter","venue":"The Cleft Palate-Craniofacial Journal","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto; University of British Columbia","funders":"","keywords":"Audiology; Psychology; Balance (ability); Nasal passages; Medicine; Nose; Neuroscience; Anatomy","score_opus":0.33152537935838916,"score_gpt":0.4083021269548875,"score_spread":0.07677674759649833,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3044355609","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0011025794,0.0001880059,0.00021301057,0.9891017,0.008056272,0.000031756208,0.00007922756,0.000038061033,0.0011893018],"genre_scores_gemma":[0.004508286,0.00011717079,0.00038663577,0.986251,0.0059978343,0.00007054597,0.000022331767,0.00002102496,0.0026250982],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.98956025,0.0028307254,0.0020460123,0.0016686807,0.0021577165,0.0017366814],"domain_scores_gemma":[0.9596452,0.023983803,0.002580843,0.00093428936,0.009112351,0.0037436227],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013050477,0.00097005727,0.0015980622,0.0010856795,0.009131577,0.0049883816,0.0030097123,0.08367602,0.00672332],"category_scores_gemma":[0.076346226,0.001428543,0.0015126358,0.0011447285,0.0036597368,0.0025721008,0.002135341,0.054201346,0.0064820265],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001821336,0.00006706867,0.0024881077,0.00006794299,0.000049801292,0.0038513085,0.0010946186,0.00013642554,0.00070833974,0.0026298105,0.97990215,0.008822344],"study_design_scores_gemma":[0.0004501956,0.00037217353,0.013484904,0.0010523875,0.00021331769,0.00814904,0.0063754995,0.0034921698,0.001977569,0.0128335245,0.9512069,0.00039239542],"about_ca_topic_score_codex":0.025998132,"about_ca_topic_score_gemma":0.03686332,"teacher_disagreement_score":0.08367602,"about_ca_system_score_codex":0.008450999,"about_ca_system_score_gemma":0.008910234,"threshold_uncertainty_score":0.069018364},"labels":[],"label_agreement":null},{"id":"W3047914353","doi":"10.1093/cid/ciaa1131","title":"Latent Class Analysis and the Need for Clear Reporting of Methods","year":2020,"lang":"en","type":"letter","venue":"Clinical Infectious Diseases","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":22,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"McGill University; McGill University Health Centre","funders":"","keywords":"Medicine; Biostatistics; Library science; Epidemiology; Gerontology; Media studies; Pathology; Sociology","score_opus":0.38443529084602557,"score_gpt":0.5288713261281581,"score_spread":0.14443603528213256,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3047914353","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":"methods","domain_gemma":"reporting","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"reporting","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000813409,0.009667383,0.044485424,0.9171293,0.024160817,0.00026354627,0.00029359496,0.00024003485,0.0029464948],"genre_scores_gemma":[0.06315568,0.021341711,0.2392611,0.61597276,0.04928204,0.0030459403,0.00101979,0.0009392336,0.005981704],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.23294003,0.5307241,0.10029854,0.011596352,0.12012494,0.0043160357],"domain_scores_gemma":[0.042860743,0.76820993,0.028705884,0.055421025,0.098685525,0.0061169094],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.5816404,0.0013219033,0.004431186,0.0074659344,0.0070748106,0.020797098,0.010228679,0.02278216,0.006121757],"category_scores_gemma":[0.86856043,0.0031223763,0.003946556,0.005563157,0.03312699,0.021333827,0.013073917,0.06895781,0.00419569],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00040501423,0.00011102841,0.0046255244,0.0032227405,0.0002806586,0.00052000734,0.0069642803,0.000923967,0.00028010778,0.14263245,0.63755345,0.2024809],"study_design_scores_gemma":[0.00037971538,0.00023116212,0.005881935,0.018407945,0.00019527497,0.0018614379,0.004583679,0.008893721,0.0014509797,0.47113183,0.4862991,0.00068315206],"about_ca_topic_score_codex":0.011790214,"about_ca_topic_score_gemma":0.009045736,"teacher_disagreement_score":0.41835958,"about_ca_system_score_codex":0.017989378,"about_ca_system_score_gemma":0.054774348,"threshold_uncertainty_score":0.5159119},"labels":[],"label_agreement":null},{"id":"W3088642850","doi":"10.1016/j.jclinepi.2020.09.033","title":"Methodologically rigorous risk of bias tools for nonrandomized studies had low reliability and high evaluator burden","year":2020,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":30,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University; Université de Montréal; University of Ottawa; Institute of Health Economics; St. Michael's Hospital; University of Manitoba; Centre Hospitalier de l’Université de Montréal; University of Toronto; George & Fay Yee Centre for Healthcare Innovation","funders":"","keywords":"Inter-rater reliability; Reliability (semiconductor); Medicine; Psychological intervention; Psychology; Physical therapy; Statistics; Mathematics; Psychiatry; Rating scale","score_opus":0.8644908462866121,"score_gpt":0.6267974750429381,"score_spread":0.23769337124367396,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3088642850","genre_codex":"methods","genre_gemma":"empirical","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.038077287,0.04404817,0.83506525,0.0048193163,0.0029659916,0.059971206,0.004088289,0.0015916778,0.009372814],"genre_scores_gemma":[0.4920018,0.0029138422,0.43135527,0.0036308824,0.00090658636,0.06581557,0.0012001153,0.000540159,0.0016357166],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.19592543,0.58043575,0.17235716,0.016336862,0.032932565,0.0020122915],"domain_scores_gemma":[0.05340837,0.8210357,0.052931767,0.048135847,0.023654304,0.00083397806],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.6145861,0.0041780653,0.011806749,0.012491528,0.0030242156,0.007753123,0.00398528,0.0062152725,0.007030313],"category_scores_gemma":[0.8479232,0.0039458903,0.015416097,0.010043831,0.0075575635,0.008062926,0.008874269,0.007026286,0.0011016211],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.012807864,0.0010292473,0.17691816,0.14803104,0.16827327,0.0013244192,0.01403036,0.011234977,0.0027434165,0.09189067,0.018289296,0.35342732],"study_design_scores_gemma":[0.01800698,0.010269679,0.17579165,0.060808204,0.16746156,0.0038448104,0.0038840114,0.09149179,0.017828366,0.35113394,0.096892424,0.0025866409],"about_ca_topic_score_codex":0.0011276336,"about_ca_topic_score_gemma":0.0024045005,"teacher_disagreement_score":0.3854139,"about_ca_system_score_codex":0.005247444,"about_ca_system_score_gemma":0.0073578665,"threshold_uncertainty_score":0.47528398},"labels":[],"label_agreement":null},{"id":"W3090901332","doi":"10.24095/hpcdp.34.4.09f","title":"Concordance entre les résultats d'une enquête et les données de la Régie de l’assurance maladie du Québec (RAMQ) pour le diagnostic d’asthme et pour l’utilisation des services médicaux pour asthme chez les enfants","year":2014,"lang":"fr","type":"article","venue":"Maladies chroniques et blessures au Canada","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":true,"ca_institutions":"McGill University; Université de Montréal; Hôpital Notre-Dame","funders":"","keywords":"Medicine; Concordance; Humanities; Gynecology; Political science; Philosophy","score_opus":0.029104492410963013,"score_gpt":0.28897892303195083,"score_spread":0.2598744306209878,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3090901332","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9399924,0.006389403,0.012506993,0.0019770137,0.00046715874,0.0010798479,0.015709814,0.00027636974,0.02160102],"genre_scores_gemma":[0.9727806,0.0013940504,0.010161988,0.0004344558,0.0000789275,0.0007736733,0.005866273,0.000075425276,0.008434564],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9731407,0.010994659,0.0041946,0.0021034584,0.00814941,0.0014172033],"domain_scores_gemma":[0.879433,0.05063785,0.010273075,0.0037448213,0.054261725,0.0016495697],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03339833,0.0005783243,0.0008881815,0.0047867754,0.0014017218,0.0025004225,0.0015130824,0.00078590296,0.0040409053],"category_scores_gemma":[0.08284414,0.00045898947,0.00135757,0.0035617456,0.0008457945,0.0008671275,0.0020837847,0.00069318124,0.00083816703],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005584881,0.000056007295,0.9448895,0.0012722899,0.00060154684,0.00019379734,0.012233375,0.0004493989,0.0017815301,0.00029963555,0.0045375344,0.033126842],"study_design_scores_gemma":[0.000012047585,0.00009607578,0.98758334,0.00034603794,0.00020074467,0.00009015849,0.0038473255,0.00064366485,0.0009914319,0.000053786778,0.0061009615,0.000034469624],"about_ca_topic_score_codex":0.5300989,"about_ca_topic_score_gemma":0.59263766,"teacher_disagreement_score":0.9926974,"about_ca_system_score_codex":0.0073026014,"about_ca_system_score_gemma":0.0066256975,"threshold_uncertainty_score":0.9453369},"labels":[],"label_agreement":null},{"id":"W3140874822","doi":"10.1177/1971400920937403","title":"Reply: “Computed tomography assessment of anterior ethmoidal canal dehiscence: Methodological issue on interobserver agreement”","year":2020,"lang":"en","type":"letter","venue":"The Neuroradiology Journal","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ottawa Hospital; University of Ottawa","funders":"","keywords":"Computed tomography; Dehiscence; Medicine; Nuclear medicine; Radiology; Anatomy; Surgery","score_opus":0.31662526684177866,"score_gpt":0.4314452370462024,"score_spread":0.11481997020442375,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3140874822","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000477872,0.0002612222,0.00013605849,0.9889703,0.009290342,0.000012181935,0.000050382667,0.000016240576,0.0007853823],"genre_scores_gemma":[0.0031083443,0.00015340546,0.00028951492,0.98441285,0.010508235,0.000040575007,0.000021984539,0.000014419598,0.0014506205],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.98802906,0.0038872273,0.0023000012,0.0014860961,0.0027102008,0.0015873915],"domain_scores_gemma":[0.9422396,0.0347777,0.003231497,0.0013963196,0.0149555635,0.0033993954],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013655198,0.0007509649,0.0016973579,0.0014069563,0.0060067633,0.0049257395,0.0028940178,0.08145252,0.0050218166],"category_scores_gemma":[0.09184253,0.0014099341,0.0012871168,0.0013857037,0.0044435128,0.0034966646,0.0025270237,0.049241953,0.0060494],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000082248844,0.000026281843,0.002384435,0.0000642673,0.000037102203,0.0013504429,0.00045741588,0.000059241618,0.00023794294,0.002066682,0.9869261,0.006307907],"study_design_scores_gemma":[0.0003175706,0.00012980292,0.009156114,0.0010930634,0.00019177848,0.0039643063,0.0030956734,0.0016116204,0.0009899099,0.017667774,0.9614497,0.0003325935],"about_ca_topic_score_codex":0.015367145,"about_ca_topic_score_gemma":0.026250431,"teacher_disagreement_score":0.08145252,"about_ca_system_score_codex":0.0061053205,"about_ca_system_score_gemma":0.0068177013,"threshold_uncertainty_score":0.07221645},"labels":[],"label_agreement":null},{"id":"W3151387929","doi":"10.1093/aje/kwab068","title":"Invited Commentary: Toward Better Bias Analysis","year":2021,"lang":"en","type":"letter","venue":"American Journal of Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Publication bias; Econometrics; Psychology; Computer science; Statistics; MEDLINE; Mathematics; Political science; Law","score_opus":0.3509040920935143,"score_gpt":0.4276153762947408,"score_spread":0.07671128420122647,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3151387929","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000054298856,0.00082451064,0.00010639426,0.9574358,0.04103632,0.000010003221,0.000049698207,0.0000254133,0.0004575631],"genre_scores_gemma":[0.0005917762,0.00039416246,0.0002479152,0.9440713,0.053681742,0.00003316246,0.000018095387,0.000026904074,0.000934963],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9604946,0.017107388,0.00434675,0.0042582112,0.012250701,0.0015424277],"domain_scores_gemma":[0.82201153,0.12129536,0.0062644747,0.0041912887,0.038409617,0.007827726],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.042953316,0.0018506355,0.0032392517,0.0018603933,0.0061830143,0.006915254,0.005738522,0.07740861,0.009950323],"category_scores_gemma":[0.25610605,0.0016532275,0.003252434,0.0021162762,0.0077154487,0.009477495,0.0028277994,0.07909672,0.011730591],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000029529185,0.000008381663,0.000106441956,0.00006612441,0.0000146950915,0.00016492799,0.00006625438,0.000024555211,0.000034904886,0.0008098338,0.99610656,0.0025678065],"study_design_scores_gemma":[0.0003387437,0.00007622075,0.00093526876,0.0012679524,0.00011761025,0.0014828481,0.0004536645,0.00069824466,0.00036720256,0.018865038,0.97523177,0.0001654703],"about_ca_topic_score_codex":0.006423743,"about_ca_topic_score_gemma":0.006636764,"teacher_disagreement_score":0.9570467,"about_ca_system_score_codex":0.006956614,"about_ca_system_score_gemma":0.0100212265,"threshold_uncertainty_score":0.22716153},"labels":[],"label_agreement":null},{"id":"W3160029048","doi":"10.1016/j.jclinepi.2021.04.017","title":"Customized guidance/training improved the psychometric properties of methodologically rigorous risk of bias instruments for non-randomized studies","year":2021,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University; Université de Montréal; University of Ottawa; Institute of Health Economics; St. Michael's Hospital; University of Manitoba; Centre Hospitalier de l’Université de Montréal; University of Toronto; George & Fay Yee Centre for Healthcare Innovation","funders":"","keywords":"Medicine; Randomized controlled trial; Reliability (semiconductor); Physical therapy; Statistic; Medical physics; Psychology; Statistics; Surgery","score_opus":0.8685239314559975,"score_gpt":0.6052991067119616,"score_spread":0.26322482474403586,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3160029048","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.101120815,0.0070744795,0.8367747,0.016411418,0.0016410131,0.01779267,0.00194089,0.004755127,0.012488842],"genre_scores_gemma":[0.3523268,0.0012465344,0.6288587,0.004052684,0.00048511752,0.01090802,0.00049153337,0.0007137262,0.00091692957],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.6038845,0.3280135,0.040300325,0.010056661,0.015619446,0.0021254928],"domain_scores_gemma":[0.11915172,0.77877706,0.031852406,0.048479896,0.020367578,0.0013713365],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.40179893,0.0017053684,0.002716327,0.0032917808,0.001147342,0.0047370074,0.0028263705,0.0041564847,0.009648978],"category_scores_gemma":[0.7898725,0.0018533337,0.004252751,0.0029082599,0.002342262,0.006799721,0.005099262,0.0048984415,0.0016037326],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0051938375,0.0018378762,0.045588966,0.011694888,0.0036564057,0.000241498,0.008889893,0.015520596,0.002981485,0.0202644,0.019097237,0.8650328],"study_design_scores_gemma":[0.020628856,0.01724463,0.29555014,0.034719225,0.012591625,0.0024467823,0.0030331088,0.2079853,0.027618317,0.2194921,0.15661137,0.0020785416],"about_ca_topic_score_codex":0.0017544307,"about_ca_topic_score_gemma":0.0031482875,"teacher_disagreement_score":0.59820104,"about_ca_system_score_codex":0.0025422764,"about_ca_system_score_gemma":0.00850584,"threshold_uncertainty_score":0.7376884},"labels":[],"label_agreement":null},{"id":"W3161848643","doi":"10.1016/j.jval.2021.02.011","title":"Bias Assessment in Outcomes Research: The Role of Relative Versus Absolute Approaches","year":2021,"lang":"en","type":"article","venue":"Value in Health","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":29,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"Qatar National Research Fund; Fonds National de la Recherche Luxembourg; Australian National University; Qatar Foundation","keywords":"Consistency (knowledge bases); Independence (probability theory); Statistics; Scale (ratio); Relative value; Intraclass correlation; Econometrics; Quality (philosophy); Psychology; Mathematics; Computer science; Artificial intelligence; Psychometrics; Geography","score_opus":0.8214349676296412,"score_gpt":0.5378024960010247,"score_spread":0.2836324716286165,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3161848643","genre_codex":"methods","genre_gemma":"methods","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010369431,0.17927851,0.7775844,0.021053677,0.004128065,0.00094475184,0.0003997227,0.00024415806,0.0059973244],"genre_scores_gemma":[0.35707602,0.039852098,0.5815216,0.010147042,0.0060278634,0.00381284,0.00023894446,0.00039975636,0.00092381105],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.13928504,0.75818837,0.046314035,0.016814373,0.038573798,0.0008243876],"domain_scores_gemma":[0.048093446,0.90348834,0.018072212,0.021693805,0.008091247,0.00056103006],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.66885173,0.0039428985,0.01614906,0.016022531,0.0034078392,0.018814405,0.009624821,0.011178943,0.0031520594],"category_scores_gemma":[0.83763033,0.0033516546,0.008714165,0.013255407,0.030323748,0.02613908,0.013858942,0.014832018,0.0005952757],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015518876,0.00022262041,0.01988079,0.024007972,0.02226312,0.0002106042,0.005923738,0.008720265,0.00056243874,0.54664755,0.004893037,0.365116],"study_design_scores_gemma":[0.00044496206,0.00082985056,0.00496237,0.012539756,0.0040651807,0.0009781187,0.0010934131,0.022174865,0.0010992619,0.9414173,0.009939711,0.00045523283],"about_ca_topic_score_codex":0.002427519,"about_ca_topic_score_gemma":0.0026513063,"teacher_disagreement_score":0.33114827,"about_ca_system_score_codex":0.0075134216,"about_ca_system_score_gemma":0.009563852,"threshold_uncertainty_score":0.40836483},"labels":[],"label_agreement":null},{"id":"W3172444956","doi":"10.1109/access.2021.3084050","title":"The Matthews Correlation Coefficient (MCC) is More Informative Than Cohen’s Kappa and Brier Score in Binary Classification Assessment","year":2021,"lang":"en","type":"article","venue":"IEEE Access","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":429,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Brier score; Kappa; Cohen's kappa; Correlation; Computer science; Statistics; Artificial intelligence; Binary classification; Metric (unit); Binary number; Odds; Machine learning; Mathematics; Natural language processing; Logistic regression; Support vector machine; Arithmetic","score_opus":0.18775632908039266,"score_gpt":0.4289589341158113,"score_spread":0.24120260503541865,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3172444956","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.30188394,0.023651306,0.58250976,0.0069858637,0.0042904327,0.0014829712,0.009727638,0.003979805,0.06548828],"genre_scores_gemma":[0.8530046,0.0022221329,0.13208619,0.001302013,0.0013666005,0.0010537745,0.0031453206,0.0008045346,0.0050149416],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9303644,0.02466812,0.010363598,0.0104670515,0.022816312,0.0013205806],"domain_scores_gemma":[0.692037,0.21032207,0.039303783,0.020411279,0.034494262,0.0034316562],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.04748533,0.0020296886,0.0027283267,0.01878001,0.0023663535,0.004328595,0.0020527323,0.0032958447,0.00371662],"category_scores_gemma":[0.23096049,0.00055004016,0.0015973975,0.015149698,0.004038429,0.005089923,0.0032631722,0.002487127,0.002142449],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011865983,0.0003482088,0.43501437,0.003715152,0.0040615792,0.000978463,0.00497271,0.02609793,0.0053087017,0.065401316,0.07289478,0.38002017],"study_design_scores_gemma":[0.00021866089,0.00237166,0.46563902,0.002114486,0.0019828305,0.0039270045,0.0060800426,0.109368,0.01744583,0.22831924,0.16090333,0.0016298705],"about_ca_topic_score_codex":0.0038569756,"about_ca_topic_score_gemma":0.0051558064,"teacher_disagreement_score":0.95251465,"about_ca_system_score_codex":0.001600248,"about_ca_system_score_gemma":0.002380316,"threshold_uncertainty_score":0.25112945},"labels":[],"label_agreement":null},{"id":"W3175630060","doi":"","title":"Inter-rater reliability of clinicians' ratings of preschool children using the FOCUS©: Focus on the Outcomes of Communication Under Six.","year":2013,"lang":"en","type":"article","venue":"Canadian journal of speech-language pathology and audiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"Holland Bloorview Kids Rehabilitation Hospital; Laurentian University","funders":"","keywords":"Inter-rater reliability; Focus (optics); Psychology; Reliability (semiconductor); Developmental psychology; Clinical psychology; Rating scale","score_opus":0.06294481726840102,"score_gpt":0.3340803302059863,"score_spread":0.2711355129375853,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3175630060","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.96484405,0.0013843591,0.023376048,0.00016177211,0.00022093838,0.001098798,0.0012169227,0.0001492535,0.0075478023],"genre_scores_gemma":[0.98394495,0.00029415084,0.013047545,0.00004622576,0.000031730684,0.0010303763,0.00080300873,0.00006179641,0.00074010046],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.96358824,0.018528797,0.0059133833,0.0028941694,0.00829492,0.0007804822],"domain_scores_gemma":[0.86590266,0.07126025,0.011070394,0.008771115,0.04158704,0.0014084431],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.043041516,0.00043054085,0.00073766895,0.0015781756,0.00065382925,0.00084732554,0.00066451065,0.00062917033,0.0010310649],"category_scores_gemma":[0.11022116,0.0003648578,0.0009781804,0.0010745877,0.00093911804,0.0012697551,0.0017577902,0.0008724877,0.0006636635],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0047927746,0.00043716037,0.80632985,0.0010062022,0.00128854,0.00020588111,0.032546293,0.0014331174,0.016771363,0.0011505028,0.004307879,0.12973033],"study_design_scores_gemma":[0.00021509663,0.0014058301,0.969402,0.00028038936,0.0003767234,0.0005367343,0.0058374973,0.004133707,0.011645803,0.00079344807,0.005236422,0.00013624722],"about_ca_topic_score_codex":0.00252085,"about_ca_topic_score_gemma":0.0047150673,"teacher_disagreement_score":0.043041516,"about_ca_system_score_codex":0.0007665228,"about_ca_system_score_gemma":0.0009859697,"threshold_uncertainty_score":0.227628},"labels":[],"label_agreement":null},{"id":"W3190138084","doi":"10.1093/jssam/smab022","title":"A Model-Assisted Approach for Finding Coding Errors in Manual Coding of Open-Ended Questions","year":2021,"lang":"en","type":"article","venue":"Journal of Survey Statistics and Methodology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Actua; University of Waterloo; Roche (Canada)","funders":"","keywords":"Coding (social sciences); Computer science; Statistics; Natural language processing; Artificial intelligence; Mathematics","score_opus":0.7870611956524755,"score_gpt":0.5441244124235828,"score_spread":0.24293678322889267,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3190138084","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017919995,0.0000631522,0.97781473,0.00032393046,0.00004360281,0.00039988518,0.00013746093,0.0028527325,0.00044448616],"genre_scores_gemma":[0.22544034,0.000041468746,0.77140886,0.0002798273,0.00003612025,0.0012336562,0.00052815274,0.00020907499,0.0008225068],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9337932,0.0496453,0.0027495623,0.0066561974,0.0062668645,0.0008888423],"domain_scores_gemma":[0.765063,0.1815021,0.014771248,0.018925797,0.018238237,0.0014996376],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.056063138,0.0025578921,0.002239944,0.0063928114,0.0019061529,0.0033269878,0.004967253,0.0031894722,0.0028086905],"category_scores_gemma":[0.1579796,0.001601642,0.002124382,0.0032263862,0.0017897647,0.0032414477,0.0043911147,0.0041755764,0.001588715],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001521416,0.001233367,0.029882614,0.00070201716,0.0009402582,0.00036128372,0.004892926,0.16117808,0.00865052,0.011804199,0.010961448,0.7678719],"study_design_scores_gemma":[0.00007303025,0.00014277657,0.0021780236,0.00007859848,0.000046066452,0.000118861964,0.00035011754,0.9820195,0.0029865985,0.010770242,0.001165308,0.00007074501],"about_ca_topic_score_codex":0.0091786515,"about_ca_topic_score_gemma":0.014512525,"teacher_disagreement_score":0.9439369,"about_ca_system_score_codex":0.0032818771,"about_ca_system_score_gemma":0.005248129,"threshold_uncertainty_score":0.2964937},"labels":[],"label_agreement":null},{"id":"W3210268695","doi":"10.1136/oem-2021-epi.361","title":"RF-4 Inter-rater reliability of occupational exposure assessment in a case-control study","year":2021,"lang":"en","type":"article","venue":"","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Centre Hospitalier de l’Université de Montréal","funders":"","keywords":"Concordance; Checklist; Cohen's kappa; Coding (social sciences); Statistic; Inter-rater reliability; Population; Reliability (semiconductor); Statistics; Applied psychology; Medicine; Computer science; Psychology; Environmental health; Mathematics","score_opus":0.14601194912680432,"score_gpt":0.4238998104811826,"score_spread":0.27788786135437826,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3210268695","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9553115,0.0017167666,0.034723725,0.00009594747,0.00017214291,0.0021914088,0.0012476916,0.00014998259,0.004390882],"genre_scores_gemma":[0.9885539,0.00013376916,0.008982319,0.000035224206,0.000053968208,0.00091768306,0.00073541194,0.000037455837,0.0005503833],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.84302515,0.103246234,0.017138481,0.009630366,0.024754342,0.0022054042],"domain_scores_gemma":[0.79195476,0.11029551,0.0247483,0.02782995,0.04403213,0.001139321],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.13377963,0.0006897486,0.0012800699,0.0041598,0.0010810529,0.0015081478,0.0018038318,0.000960201,0.0014859395],"category_scores_gemma":[0.16330647,0.0006887531,0.0024594774,0.0023657773,0.0016764195,0.0010142559,0.0017727164,0.0007238698,0.00051378895],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012486927,0.00023525246,0.97234356,0.00036931696,0.0017390796,0.0002274941,0.0036625897,0.00076517573,0.0018450515,0.00034210656,0.0007664465,0.016455308],"study_design_scores_gemma":[0.00013336234,0.0011176944,0.9861604,0.00012716788,0.0007856632,0.0005665926,0.00096571614,0.00473788,0.0028715846,0.00027776416,0.002190407,0.0000657896],"about_ca_topic_score_codex":0.006822934,"about_ca_topic_score_gemma":0.0057121245,"teacher_disagreement_score":0.13377963,"about_ca_system_score_codex":0.0013559859,"about_ca_system_score_gemma":0.0009824876,"threshold_uncertainty_score":0.7075027},"labels":[],"label_agreement":null},{"id":"W3217637789","doi":"10.1016/j.cpet.2021.09.005","title":"Evidence-Based Artificial Intelligence in Medical Imaging","year":2021,"lang":"en","type":"review","venue":"PET Clinics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"St. Joseph’s Healthcare Hamilton; McMaster University; University of Toronto","funders":"","keywords":"Artificial intelligence; Medicine; Software; Medical imaging; Machine learning; Data science; Sample (material); Computer science","score_opus":0.6320804372227717,"score_gpt":0.5604265466069183,"score_spread":0.07165389061585348,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3217637789","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00003249565,0.99932194,0.00016898755,0.00024562888,0.00006517686,0.000009401255,0.000011570703,0.0000018581807,0.00014301483],"genre_scores_gemma":[0.0012318443,0.9976428,0.0006282202,0.0002846704,0.00012257014,0.000018257004,0.000019245907,0.0000013066749,0.000050939827],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99388546,0.0031232322,0.0011806851,0.0004111725,0.0012794886,0.00011995006],"domain_scores_gemma":[0.94693357,0.04850618,0.0019917844,0.00045940123,0.0019041063,0.00020488238],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013625442,0.001354412,0.006225448,0.005230826,0.0003985773,0.0030800677,0.0022338608,0.0033032151,0.0047510536],"category_scores_gemma":[0.038054604,0.0007505682,0.0029075753,0.0057440503,0.0016095166,0.0028462883,0.0015469319,0.003607555,0.00060929975],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021986265,0.00006324687,0.00036886916,0.23248424,0.0031426006,0.00011080034,0.000081172264,0.00096268265,0.00012618091,0.0075205895,0.0070970715,0.74782264],"study_design_scores_gemma":[0.0005680425,0.00046417135,0.0056834514,0.5871318,0.016879538,0.0011047386,0.00027297038,0.0017280978,0.00058560976,0.038505077,0.34688833,0.0001881701],"about_ca_topic_score_codex":0.004976581,"about_ca_topic_score_gemma":0.008177619,"teacher_disagreement_score":0.013625442,"about_ca_system_score_codex":0.002645724,"about_ca_system_score_gemma":0.0056621493,"threshold_uncertainty_score":0.072059095},"labels":[],"label_agreement":null},{"id":"W32320309","doi":"10.1007/978-0-8176-4542-7_9","title":"Agreement Between Two Ratings with Different Ordinal Scales","year":2007,"lang":"en","type":"book-chapter","venue":"Birkhäuser Boston eBooks","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Cancer Care Ontario","funders":"","keywords":"Ordinal Scale; Agreement; Kappa; Cohen's kappa; Ordinal data; Mathematics; Statistics; Rating scale; Scale (ratio); Level of measurement; Psychology; Linguistics; Geography","score_opus":0.22055782727867868,"score_gpt":0.367782393741022,"score_spread":0.14722456646234333,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W32320309","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0507205,0.008102796,0.67785877,0.0029064447,0.002522763,0.001797437,0.0020465527,0.0018140766,0.25223073],"genre_scores_gemma":[0.3351209,0.0073736394,0.6013342,0.0012500794,0.0009258345,0.0030041067,0.002436466,0.0010092752,0.047545534],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.93450516,0.033264242,0.005858483,0.0040898877,0.021676859,0.00060534244],"domain_scores_gemma":[0.8589142,0.115240745,0.004462562,0.0054792124,0.015404792,0.00049848395],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.03606678,0.000640018,0.0010894254,0.0059233624,0.0005508048,0.0036685662,0.0018201674,0.0010338672,0.017357152],"category_scores_gemma":[0.11916706,0.0005855971,0.0009797852,0.0049091056,0.0021243556,0.0041279555,0.0026631358,0.0018374929,0.005861803],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007447314,0.00017713095,0.012394394,0.0030542372,0.00037702225,0.0003753143,0.009741567,0.0030500896,0.0066193584,0.11026558,0.043059833,0.8101407],"study_design_scores_gemma":[0.00026671635,0.0012841993,0.06501732,0.005407026,0.0005374292,0.004668179,0.010065637,0.02891205,0.018298578,0.3467268,0.5180311,0.00078492693],"about_ca_topic_score_codex":0.0003630776,"about_ca_topic_score_gemma":0.0006174913,"teacher_disagreement_score":0.9639332,"about_ca_system_score_codex":0.0011487309,"about_ca_system_score_gemma":0.00078893395,"threshold_uncertainty_score":0.19074166},"labels":[],"label_agreement":null},{"id":"W4207058677","doi":"10.1016/j.jclinepi.2022.01.017","title":"Minimal important changes in standard deviation units are highly variable and no universally applicable value can be determined","year":2022,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":20,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University; Impact","funders":"Canadian Institutes of Health Research; Shionogi","keywords":"Interquartile range; Statistics; Standard deviation; Mathematics; Medicine","score_opus":0.36576805802673124,"score_gpt":0.46650879546282675,"score_spread":0.10074073743609552,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4207058677","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6208462,0.029092869,0.29995042,0.0036218956,0.0032231687,0.0008015862,0.0070300247,0.001472188,0.033961724],"genre_scores_gemma":[0.9454761,0.00079660007,0.05085918,0.00050247955,0.00023250621,0.00032336786,0.0008851049,0.00011782246,0.0008069096],"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8659565,0.07332305,0.019445436,0.0081860535,0.031755786,0.0013330932],"domain_scores_gemma":[0.5363492,0.38607445,0.031073494,0.025503704,0.019870376,0.0011287755],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.06706911,0.0010850173,0.0031443571,0.004415512,0.0010281638,0.003184287,0.002032622,0.001829345,0.0008661642],"category_scores_gemma":[0.2697837,0.00078179064,0.0015965459,0.0059262975,0.0026424306,0.0022002072,0.0021337892,0.0022039844,0.0006222815],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019129367,0.0004784002,0.58886373,0.0029272172,0.0054450985,0.0004178467,0.003299183,0.0065935794,0.004333038,0.01760206,0.012857234,0.35526964],"study_design_scores_gemma":[0.0002075416,0.0018328438,0.8495167,0.0015308771,0.0018530416,0.0027391403,0.0029113987,0.027636968,0.014095296,0.07811478,0.019111317,0.000450074],"about_ca_topic_score_codex":0.0020206575,"about_ca_topic_score_gemma":0.00261033,"teacher_disagreement_score":0.9329309,"about_ca_system_score_codex":0.0013956771,"about_ca_system_score_gemma":0.001153108,"threshold_uncertainty_score":0.3546996},"labels":[],"label_agreement":null},{"id":"W4213160529","doi":"10.1016/j.envint.2022.107136","title":"Assessing the quality of evidence in studies estimating prevalence of exposure to occupational risk factors: The QoE-SPEO approach applied in the systematic reviews from the WHO/ILO Joint Estimates of the Work-related Burden of Disease and Injury","year":2022,"lang":"en","type":"article","venue":"Environment International","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University; Toronto Metropolitan University; Impact","funders":"Agencia Española de Cooperación Internacional para el Desarrollo; Universiteit van Amsterdam; University of Sydney; National Institute for Occupational Safety and Health; Aarhus Universitet; Bundesministerium für Gesundheit; World Health Organization","keywords":"Systematic review; Environmental health; Exposure assessment; Spurious relationship; Quality (philosophy); Medicine; Computer science; MEDLINE","score_opus":0.43892465778140927,"score_gpt":0.4402757951463774,"score_spread":0.0013511373649681135,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4213160529","genre_codex":"review","genre_gemma":"methods","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.024771374,0.6292528,0.15306276,0.059358884,0.00562793,0.10330831,0.014396346,0.0006922549,0.009529254],"genre_scores_gemma":[0.15708344,0.133674,0.5123098,0.011353911,0.0011662729,0.17830361,0.005010156,0.00024784703,0.00085088983],"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","domain_scores_codex":[0.23239528,0.3503053,0.33218575,0.018239941,0.064479575,0.0023942317],"domain_scores_gemma":[0.08139792,0.7845125,0.058489624,0.022404294,0.051219434,0.0019762414],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.648695,0.0044649853,0.02124128,0.087043904,0.0050100274,0.016996348,0.008364958,0.008007053,0.0047932174],"category_scores_gemma":[0.84189177,0.0056760837,0.031337194,0.047038198,0.011061087,0.018283242,0.022517264,0.008502551,0.0007672445],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008561428,0.000093598865,0.010437736,0.8106344,0.030556394,0.00042863208,0.010726181,0.0010462077,0.0008286088,0.010948808,0.0057124873,0.1177309],"study_design_scores_gemma":[0.0018756071,0.0008266933,0.013137971,0.8090482,0.06831887,0.00086689316,0.006287343,0.002823979,0.0017606714,0.047029346,0.047337502,0.0006870333],"about_ca_topic_score_codex":0.012330698,"about_ca_topic_score_gemma":0.022776848,"teacher_disagreement_score":0.351305,"about_ca_system_score_codex":0.024824165,"about_ca_system_score_gemma":0.07487075,"threshold_uncertainty_score":0.43322164},"labels":[],"label_agreement":null},{"id":"W4224306105","doi":"10.1016/j.ajodo.2021.12.007","title":"Assessing the performance of diagnostic test accuracy measures","year":2022,"lang":"en","type":"editorial","venue":"American Journal of Orthodontics and Dentofacial Orthopedics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"St. Michael's Hospital","funders":"","keywords":"Test (biology); Statistics; Computer science; Medicine; Mathematics; Geology","score_opus":0.06976136545771053,"score_gpt":0.3884011828602047,"score_spread":0.31863981740249414,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4224306105","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00041128768,0.024792176,0.0018725666,0.055854365,0.915365,0.00009908125,0.0001502647,0.00011558192,0.0013396676],"genre_scores_gemma":[0.0047642346,0.01044521,0.0025254455,0.020033335,0.9599143,0.00013816831,0.00008320827,0.00008581062,0.002010159],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.95141417,0.01763093,0.008425372,0.0026540738,0.019346105,0.00052950555],"domain_scores_gemma":[0.43285164,0.44581622,0.009978031,0.005364418,0.102454506,0.0035352306],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.08024682,0.0027735678,0.005926598,0.009348676,0.0018886196,0.00995888,0.004947692,0.012808897,0.0034140556],"category_scores_gemma":[0.38906953,0.00181909,0.0020864161,0.0034974208,0.0044670124,0.00417147,0.0013015455,0.013450282,0.0021079627],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025922526,0.00005536996,0.0010063522,0.002228581,0.00065397244,0.00022338323,0.000096882955,0.00015362178,0.00016921651,0.0014842784,0.9323429,0.061326195],"study_design_scores_gemma":[0.0013012987,0.00062620477,0.016167123,0.009242566,0.004066041,0.0016828601,0.00052450766,0.009792511,0.0018810292,0.019418515,0.9348271,0.00047016476],"about_ca_topic_score_codex":0.001851321,"about_ca_topic_score_gemma":0.004036116,"teacher_disagreement_score":0.9197532,"about_ca_system_score_codex":0.0032455097,"about_ca_system_score_gemma":0.00443567,"threshold_uncertainty_score":0.42439085},"labels":[],"label_agreement":null},{"id":"W4224989672","doi":"10.3390/sym14020262","title":"An Empirical Comparative Assessment of Inter-Rater Agreement of Binary Outcomes and Multiple Raters","year":2022,"lang":"en","type":"article","venue":"Symmetry","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":25,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Princess Margaret Cancer Centre; University Health Network; York University; Public Health Ontario; University of Toronto","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Statistics; Cohen's kappa; Kappa; Inter-rater reliability; Context (archaeology); Statistic; Mathematics; Summary statistics; Population; Medicine","score_opus":0.2176509483273682,"score_gpt":0.4693801055011164,"score_spread":0.2517291571737482,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4224989672","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.66552705,0.0035690335,0.31706083,0.0007714967,0.00030352423,0.0015950118,0.0007596186,0.00022583395,0.010187608],"genre_scores_gemma":[0.9725398,0.00017152983,0.026009066,0.000057395984,0.000049370305,0.00074765296,0.00024535318,0.00003231053,0.00014748276],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.40211704,0.5212848,0.020668877,0.01838351,0.035779186,0.001766434],"domain_scores_gemma":[0.09471259,0.81381214,0.04765073,0.025251808,0.017782392,0.00079033565],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.47419253,0.0010233115,0.0016619033,0.0050866352,0.001088821,0.003651182,0.0028856709,0.0018916936,0.0017447651],"category_scores_gemma":[0.6635643,0.00065702247,0.0034299984,0.0036399572,0.0059161987,0.0048611807,0.0040267576,0.0021505482,0.00037006015],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005161262,0.0006770984,0.6928131,0.0044728406,0.019243382,0.00031571876,0.012922539,0.062226333,0.001897866,0.03379316,0.0029073854,0.16356926],"study_design_scores_gemma":[0.00089381787,0.010649325,0.55471516,0.0033042466,0.0051169973,0.0021767314,0.008420764,0.30986074,0.009924133,0.08408513,0.010170311,0.00068266096],"about_ca_topic_score_codex":0.0008729018,"about_ca_topic_score_gemma":0.00070103374,"teacher_disagreement_score":0.5258075,"about_ca_system_score_codex":0.0028248176,"about_ca_system_score_gemma":0.0020205642,"threshold_uncertainty_score":0.64841425},"labels":[],"label_agreement":null},{"id":"W4229629218","doi":"10.1111/acem.13515","title":"In Reply:","year":2018,"lang":"en","type":"letter","venue":"Academic Emergency Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"BC Children's Hospital; University of British Columbia","funders":"","keywords":"Kappa; Medicine; Cohen's kappa; Agreement; Documentation; Psychosocial; Value (mathematics); Statistic; Statistics; Psychiatry; Mathematics; Computer science","score_opus":0.3009726596357991,"score_gpt":0.46423642493452916,"score_spread":0.16326376529873005,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4229629218","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00040524636,0.0008249663,0.00015576842,0.9723461,0.02511238,0.00002146096,0.0000641362,0.000065331464,0.0010045436],"genre_scores_gemma":[0.0031345584,0.0007870841,0.0002992333,0.97065544,0.021738464,0.00005910341,0.00003287305,0.000034357672,0.0032588902],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.996797,0.0009661429,0.000521354,0.00047101674,0.000915698,0.0003288882],"domain_scores_gemma":[0.97932565,0.008366176,0.0014298413,0.0006485369,0.008031238,0.0021985443],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004327194,0.00089775026,0.0014762101,0.0010389715,0.0027077212,0.0032689776,0.0027704267,0.03211095,0.012140111],"category_scores_gemma":[0.063048474,0.0007477258,0.0009774133,0.00081871846,0.002702132,0.0059429565,0.0020983776,0.04181952,0.011389997],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000025108393,0.000013414009,0.00082468934,0.000069373724,0.000009811559,0.001387186,0.0002195586,0.000028419292,0.00006782688,0.00065897615,0.9920786,0.004617101],"study_design_scores_gemma":[0.00005932194,0.000053670603,0.0016847089,0.0005599722,0.000031540338,0.008985251,0.0018683068,0.00042067785,0.0003448295,0.0040779132,0.9817693,0.00014434899],"about_ca_topic_score_codex":0.004177742,"about_ca_topic_score_gemma":0.0045734583,"teacher_disagreement_score":0.03211095,"about_ca_system_score_codex":0.0029759014,"about_ca_system_score_gemma":0.00381827,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W4229874894","doi":"10.1007/978-94-007-0753-5_2025","title":"Ordinal Alpha","year":2014,"lang":"en","type":"book-chapter","venue":"","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Learning Partnership; University of British Columbia","funders":"","keywords":"Alpha (finance); Psychology; Clinical psychology","score_opus":0.23728906902065514,"score_gpt":0.3670903399179083,"score_spread":0.12980127089725316,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4229874894","genre_codex":"other","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015494263,0.0037287402,0.22710544,0.0033526146,0.0054033967,0.0010293482,0.008583507,0.0029710706,0.7323315],"genre_scores_gemma":[0.4224978,0.0052055162,0.30421835,0.0027052623,0.003694807,0.008300126,0.011212051,0.0031627023,0.2390034],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.96997607,0.013595838,0.0025878667,0.0022268293,0.01090476,0.000708577],"domain_scores_gemma":[0.9029747,0.059949405,0.004522882,0.009452341,0.022076966,0.0010238215],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.018040668,0.0012507089,0.0011995438,0.007618603,0.0015326266,0.0052698255,0.0012442311,0.0010938081,0.067541964],"category_scores_gemma":[0.17875862,0.000596399,0.0012313143,0.00830551,0.0020935684,0.004552335,0.0029073597,0.0029718634,0.025952715],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00037194145,0.00010071241,0.010493512,0.0014322223,0.00018366429,0.00008528859,0.0036286388,0.0011608704,0.000691031,0.21398464,0.22353734,0.5443302],"study_design_scores_gemma":[0.000076386714,0.00033263696,0.028996557,0.001780952,0.000249643,0.00074741244,0.0037144786,0.0036388389,0.0014923515,0.35164845,0.60715353,0.00016882624],"about_ca_topic_score_codex":0.0005545388,"about_ca_topic_score_gemma":0.00083134085,"teacher_disagreement_score":0.067541964,"about_ca_system_score_codex":0.0014214937,"about_ca_system_score_gemma":0.002201867,"threshold_uncertainty_score":0.22595036},"labels":[],"label_agreement":null},{"id":"W4230740620","doi":"10.1503/cmaj.050708","title":"Correction","year":2005,"lang":"en","type":"article","venue":"Canadian Medical Association Journal","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Computer science; Information retrieval; World Wide Web; Data science","score_opus":0.04622657456481362,"score_gpt":0.31910396413610276,"score_spread":0.27287738957128915,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4230740620","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00015966764,0.0006387571,0.0016523317,0.07938483,0.9107035,0.000042909913,0.0018014164,0.000767436,0.0048491117],"genre_scores_gemma":[0.019178705,0.004603982,0.0093604475,0.18015546,0.49816492,0.000537699,0.006204807,0.004179889,0.27761406],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9818804,0.0032531691,0.0023196973,0.002103229,0.0090248,0.0014186125],"domain_scores_gemma":[0.8961405,0.0246101,0.0059850328,0.007823674,0.06250369,0.002936982],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009063638,0.0022722897,0.0017605921,0.0051790862,0.004092955,0.005991182,0.00442582,0.006779977,0.14750515],"category_scores_gemma":[0.18805666,0.0009816941,0.0018527729,0.0035478754,0.003079447,0.0035019375,0.0036481894,0.011721146,0.07799223],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00001519241,0.0000024894218,0.00005130887,0.000057886566,0.000005935124,0.00011713967,0.000035091067,0.0000169287,0.000024638277,0.0007985234,0.99394506,0.00492983],"study_design_scores_gemma":[0.00001885601,0.000011449757,0.00037168694,0.00030075392,0.00001655387,0.0005118934,0.000064189255,0.00013770108,0.00017487581,0.0013459754,0.99701995,0.000026111033],"about_ca_topic_score_codex":0.011968258,"about_ca_topic_score_gemma":0.011837581,"teacher_disagreement_score":0.14750515,"about_ca_system_score_codex":0.005392544,"about_ca_system_score_gemma":0.0070333187,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W4233521617","doi":"10.1111/j.1541-0420.2008.01004_2.x","title":"Discussions","year":2008,"lang":"en","type":"article","venue":"Biometrics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Biostatistics; Epidemiology; Library science; Public health; Citation; Medicine; Gerontology; Sociology; Computer science; Pathology","score_opus":0.5836070243354328,"score_gpt":0.43811985529992914,"score_spread":0.14548716903550363,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4233521617","genre_codex":"commentary","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0014626675,0.012449818,0.037897125,0.74135596,0.047545344,0.00050434674,0.0009556905,0.00045274285,0.15737632],"genre_scores_gemma":[0.033512503,0.0075913686,0.027665034,0.7398376,0.025245003,0.0016873345,0.00064074417,0.0009199185,0.16290052],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.96798074,0.014261113,0.002079754,0.0042406353,0.009164896,0.0022728506],"domain_scores_gemma":[0.9449033,0.031051764,0.001798757,0.004552247,0.014162549,0.003531414],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.044605117,0.0011793537,0.0011175978,0.0020701715,0.0063584107,0.00966247,0.005355287,0.017522918,0.094185404],"category_scores_gemma":[0.1398096,0.0006335241,0.0021722647,0.0015576814,0.0065225638,0.011768401,0.006922734,0.016202431,0.024064671],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006386968,0.0000459587,0.0004927539,0.0002885108,0.000024592999,0.00025755956,0.0016616225,0.00043203362,0.00027230577,0.47233766,0.46885163,0.055271544],"study_design_scores_gemma":[0.0000104155315,0.000016983107,0.00016206208,0.0004975898,0.0000064286505,0.00017679026,0.00046152005,0.00015128321,0.00018727577,0.060585026,0.9377262,0.000018313956],"about_ca_topic_score_codex":0.003658894,"about_ca_topic_score_gemma":0.002773002,"teacher_disagreement_score":0.9058146,"about_ca_system_score_codex":0.00894617,"about_ca_system_score_gemma":0.008786319,"threshold_uncertainty_score":0.3150816},"labels":[],"label_agreement":null},{"id":"W4240930308","doi":"10.1093/med/9780199685219.003.0008","title":"Reliability","year":2014,"lang":"en","type":"book","venue":"","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Reliability (semiconductor); Intraclass correlation; Statistics; Standard error; Variance (accounting); Reliability engineering; Mathematics; Engineering; Psychometrics; Power (physics)","score_opus":0.1625810120239491,"score_gpt":0.3687530867046284,"score_spread":0.20617207468067933,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4240930308","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0062077786,0.026881875,0.17193086,0.025711266,0.0069611673,0.0024624944,0.012768483,0.0037150693,0.74336094],"genre_scores_gemma":[0.16890611,0.05786077,0.25477356,0.015115689,0.0051377206,0.00670538,0.029574592,0.0067471783,0.45517907],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.96518964,0.011487247,0.0026685328,0.0034413117,0.016374297,0.0008389675],"domain_scores_gemma":[0.9373785,0.01905477,0.002482742,0.006381365,0.033839907,0.0008626718],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.025131255,0.0015404351,0.0016822016,0.006725872,0.0021602795,0.007859335,0.0033706177,0.0017368408,0.09031993],"category_scores_gemma":[0.11394382,0.00088602566,0.001751773,0.005597954,0.0022024738,0.006466433,0.0049478547,0.0030110292,0.060290348],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000097024735,0.000052721356,0.002687851,0.0031462663,0.00011099525,0.00017543293,0.003668902,0.0010148013,0.00067171734,0.1384164,0.3285504,0.5214075],"study_design_scores_gemma":[0.000012051656,0.000048631857,0.0018104847,0.002788577,0.000057547015,0.00030924685,0.0009505383,0.00050702266,0.00051268697,0.03356178,0.9593957,0.000045783097],"about_ca_topic_score_codex":0.0048116907,"about_ca_topic_score_gemma":0.00420656,"teacher_disagreement_score":0.09031993,"about_ca_system_score_codex":0.0053315074,"about_ca_system_score_gemma":0.009456319,"threshold_uncertainty_score":0.30215025},"labels":[],"label_agreement":null},{"id":"W4243378373","doi":"10.31234/osf.io/v6crg","title":"Validation as Evaluating Desired and Undesired Effects: Insights from Cross-Classified Mixed Effects Model","year":2021,"lang":"en","type":"preprint","venue":"","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Reliability (semiconductor); Variance (accounting); Computer science; Reliability engineering; Variance components; Validity; Data mining; Statistics; Psychometrics; Mathematics; Engineering","score_opus":0.28922857418109643,"score_gpt":0.4363073635794985,"score_spread":0.14707878939840208,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4243378373","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01876337,0.00084555114,0.9765692,0.00084287574,0.000095535426,0.00042599798,0.00014372263,0.00016974943,0.002143942],"genre_scores_gemma":[0.35440072,0.0005725275,0.6403654,0.00080525153,0.00015790385,0.0022460723,0.0004021841,0.00021783957,0.00083211076],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.5732358,0.39017397,0.008768504,0.013191291,0.013525294,0.001105122],"domain_scores_gemma":[0.19007039,0.74858916,0.016135922,0.029315267,0.015073112,0.0008161287],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.37414762,0.002537559,0.004435786,0.0052869082,0.0023706001,0.007557484,0.005083943,0.0042314627,0.0039640605],"category_scores_gemma":[0.5604944,0.0017737716,0.0077302,0.004624204,0.007826993,0.00819957,0.0066581746,0.006691441,0.0005060597],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009931482,0.00049740076,0.06821283,0.002147456,0.00600106,0.00079496385,0.015523483,0.07615325,0.0013224239,0.6607532,0.0031306727,0.16447018],"study_design_scores_gemma":[0.00021906197,0.00075148453,0.013166724,0.0012894092,0.0016181633,0.0003705373,0.0012902324,0.42545685,0.0017801401,0.54758763,0.0062540728,0.00021569204],"about_ca_topic_score_codex":0.006483129,"about_ca_topic_score_gemma":0.004597059,"teacher_disagreement_score":0.62585235,"about_ca_system_score_codex":0.003532187,"about_ca_system_score_gemma":0.005491566,"threshold_uncertainty_score":0.7717874},"labels":[],"label_agreement":null},{"id":"W4246401766","doi":"10.1002/9781118445112.stat05095","title":"Bias, Overview","year":2014,"lang":"en","type":"other","venue":"Wiley StatsRef: Statistics Reference Online","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa; Chronic Disease Prevention Alliance of Canada","funders":"","keywords":"Interpretation (philosophy); Computer science; Data science; Data collection; Statistics; Information retrieval; Data mining; Econometrics; Mathematics; Programming language","score_opus":0.40002221701344864,"score_gpt":0.44192226801467055,"score_spread":0.041900051001221905,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4246401766","genre_codex":"review","genre_gemma":"other","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0029771195,0.6141719,0.13811332,0.08632717,0.023619771,0.0035668057,0.018280348,0.0014809235,0.111462526],"genre_scores_gemma":[0.23803619,0.44897407,0.14239794,0.0755854,0.04360117,0.014618354,0.011986386,0.0020265523,0.022773888],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.7528527,0.15503116,0.031097146,0.014806833,0.043644108,0.0025681672],"domain_scores_gemma":[0.5756704,0.33047342,0.025368635,0.026413335,0.040227454,0.0018467192],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.16885504,0.002057489,0.0038416437,0.020257974,0.002206618,0.013204624,0.003519931,0.0036354705,0.03623341],"category_scores_gemma":[0.48033303,0.0014529397,0.004168043,0.012412884,0.005270748,0.0120979,0.0066526425,0.0044032075,0.005602612],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00037387558,0.0000309979,0.00512945,0.044256054,0.002528804,0.00009382254,0.0013791266,0.001486941,0.00014615424,0.240607,0.18526086,0.518707],"study_design_scores_gemma":[0.00015262469,0.00008943706,0.0038919665,0.061442886,0.0022271227,0.00039340096,0.000656816,0.0011332534,0.0005124219,0.29302287,0.63636374,0.00011349256],"about_ca_topic_score_codex":0.005011456,"about_ca_topic_score_gemma":0.003500921,"teacher_disagreement_score":0.8311449,"about_ca_system_score_codex":0.009054062,"about_ca_system_score_gemma":0.0150806075,"threshold_uncertainty_score":0.8930015},"labels":[],"label_agreement":null},{"id":"W4249975290","doi":"10.1503/cmaj.1041744","title":"Kappa statistic","year":2005,"lang":"en","type":"letter","venue":"Canadian Medical Association Journal","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Kappa; Cohen's kappa; Statistic; Statistics; Computer science; Mathematics","score_opus":0.0616572979115928,"score_gpt":0.325775439806404,"score_spread":0.2641181418948112,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4249975290","genre_codex":"methods","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.022677727,0.056497257,0.5937909,0.023038924,0.013659558,0.0052485378,0.02689033,0.0070767268,0.25112006],"genre_scores_gemma":[0.49322054,0.035813272,0.38186952,0.013499614,0.009030233,0.0075176377,0.013917217,0.003356401,0.04177559],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.890158,0.044454582,0.014732159,0.010771153,0.03842091,0.0014632304],"domain_scores_gemma":[0.80883664,0.11802411,0.018999023,0.01439563,0.0370207,0.0027238745],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.04287718,0.0014545108,0.0031739243,0.018201813,0.0021053576,0.00689201,0.0040340354,0.0026800793,0.039068535],"category_scores_gemma":[0.2600152,0.00066941296,0.0020601794,0.012683304,0.0028808468,0.005614161,0.0049625253,0.003969507,0.015200822],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007897192,0.00011890399,0.029564528,0.004197879,0.0016377241,0.00033726098,0.0024796745,0.0019153456,0.00057533674,0.08595166,0.3077335,0.56469846],"study_design_scores_gemma":[0.00017035399,0.00053941825,0.027129363,0.0063537066,0.001134529,0.005243718,0.0031404586,0.006182842,0.0019791746,0.19414365,0.7535043,0.000478425],"about_ca_topic_score_codex":0.0028709292,"about_ca_topic_score_gemma":0.00286872,"teacher_disagreement_score":0.9571228,"about_ca_system_score_codex":0.0042007635,"about_ca_system_score_gemma":0.0060165,"threshold_uncertainty_score":0.2267589},"labels":[],"label_agreement":null},{"id":"W4253148760","doi":"10.1002/0470011815.b2a00001","title":"Bias, Overview","year":2005,"lang":"en","type":"other","venue":"Encyclopedia of Biostatistics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa; Chronic Disease Prevention Alliance of Canada","funders":"","keywords":"Interpretation (philosophy); Computer science; Statistics; Data science; Information retrieval; Mathematics; Programming language","score_opus":0.15507713619805066,"score_gpt":0.3854803442423336,"score_spread":0.2304032080442829,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4253148760","genre_codex":"review","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0031240976,0.6070438,0.14489114,0.09389133,0.026250817,0.004583203,0.015658801,0.0012699876,0.103286825],"genre_scores_gemma":[0.2522785,0.42426687,0.1512805,0.077956885,0.0439259,0.017302675,0.009049376,0.001418763,0.022520477],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.71580833,0.18386467,0.03586406,0.0148084005,0.04727258,0.002381926],"domain_scores_gemma":[0.55193406,0.34480727,0.02975715,0.027756002,0.043961145,0.001784409],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.18146905,0.0020538268,0.003991971,0.018580297,0.0020618516,0.0123775285,0.0032777758,0.0036191794,0.030640403],"category_scores_gemma":[0.5066982,0.00141562,0.004002051,0.012305132,0.00455251,0.0109729925,0.0059963576,0.0043029618,0.0044326414],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00040626957,0.000033352266,0.0058286,0.04690287,0.0031236024,0.00011682166,0.0012618448,0.0014972959,0.00015371376,0.21550879,0.18662639,0.5385405],"study_design_scores_gemma":[0.00021610549,0.00010659523,0.005067111,0.06525491,0.0030510265,0.00056896865,0.0007606062,0.0015582227,0.00063153746,0.31264806,0.6100096,0.00012717958],"about_ca_topic_score_codex":0.004386541,"about_ca_topic_score_gemma":0.003049793,"teacher_disagreement_score":0.8185309,"about_ca_system_score_codex":0.00928839,"about_ca_system_score_gemma":0.014100708,"threshold_uncertainty_score":0.95971155},"labels":[],"label_agreement":null},{"id":"W4253597500","doi":"10.1007/0-387-30677-3_5","title":"Measurement Fundamentals","year":2006,"lang":"en","type":"book-chapter","venue":"Health Informatics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Computer science","score_opus":0.3308280014206468,"score_gpt":0.39249727942235774,"score_spread":0.06166927800171096,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4253597500","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0010066491,0.01404631,0.5150253,0.0076094167,0.0022777745,0.00033864245,0.00065649184,0.001517345,0.457522],"genre_scores_gemma":[0.04460632,0.023261093,0.37661353,0.0044437232,0.0021398717,0.0013030205,0.0013438208,0.0010148723,0.54527384],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9969228,0.00083964877,0.00020928754,0.00041978614,0.001488254,0.00012017959],"domain_scores_gemma":[0.9975362,0.0012350397,0.00009317897,0.0003686938,0.0006929359,0.00007391259],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0034979095,0.0012854945,0.0008893463,0.002143286,0.0010207089,0.0041232207,0.0018897059,0.0017188159,0.039461404],"category_scores_gemma":[0.008432544,0.0007269671,0.0005386388,0.0022632547,0.0022432704,0.004722267,0.0019158398,0.0031263817,0.02915377],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000009325461,0.000033788514,0.00015912805,0.00030358115,0.000008085536,0.000037402082,0.00043425465,0.00064194505,0.0004994772,0.65849185,0.08579534,0.2535859],"study_design_scores_gemma":[0.0000037776738,0.00002323697,0.0003911207,0.00033786238,0.0000073419105,0.00020816606,0.00014787773,0.0018072911,0.0008939349,0.35335794,0.64280117,0.000020241876],"about_ca_topic_score_codex":0.0014655237,"about_ca_topic_score_gemma":0.0016358334,"teacher_disagreement_score":0.039461404,"about_ca_system_score_codex":0.0016248394,"about_ca_system_score_gemma":0.002157503,"threshold_uncertainty_score":0.13201153},"labels":[],"label_agreement":null},{"id":"W4283735617","doi":"10.1002/hed.27130","title":"Augmenting inter‐rater concordance of radiologic extranodal extension in <scp>HPV</scp> ‐positive oropharyngeal carcinoma: A multicenter study","year":2022,"lang":"en","type":"article","venue":"Head & Neck","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":25,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Princess Margaret Cancer Centre; University of Toronto","funders":"","keywords":"Certainty; Concordance; Kappa; Inter-rater reliability; Medicine; Internal medicine; Radiology; Nuclear medicine; Psychology; Mathematics; Rating scale","score_opus":0.10176807180291711,"score_gpt":0.3508374837631717,"score_spread":0.2490694119602546,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4283735617","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9914356,0.00063235994,0.0065747937,0.00005827014,0.000024310864,0.00025020135,0.00008039018,0.000042052983,0.00090199796],"genre_scores_gemma":[0.99631625,0.000052085892,0.0033926377,0.000015502628,0.0000182183,0.00007249784,0.00006250456,0.000009648621,0.000060745508],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.92453974,0.056266908,0.005664245,0.00536216,0.007290326,0.00087665056],"domain_scores_gemma":[0.8259676,0.092522606,0.03468535,0.022168508,0.0230661,0.0015897893],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.09455464,0.00044637622,0.0006270865,0.0014533638,0.00047240165,0.0011165199,0.0009586684,0.00070975936,0.00056633615],"category_scores_gemma":[0.13084492,0.0005381261,0.00073163933,0.0008365354,0.0009820309,0.0013086655,0.0018735327,0.00056420104,0.00024796114],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019508216,0.00029423216,0.9419198,0.00023851656,0.00073700125,0.00006552221,0.0025881864,0.00081560435,0.0028877382,0.00014867906,0.00025753735,0.04809636],"study_design_scores_gemma":[0.00023450462,0.0033944135,0.97829115,0.00011502113,0.0005741204,0.0007427084,0.00071647804,0.0058933236,0.008099387,0.00026452553,0.0016178829,0.000056403136],"about_ca_topic_score_codex":0.0006984094,"about_ca_topic_score_gemma":0.001036069,"teacher_disagreement_score":0.09455464,"about_ca_system_score_codex":0.00061345525,"about_ca_system_score_gemma":0.00074164366,"threshold_uncertainty_score":0.5000587},"labels":[],"label_agreement":null},{"id":"W4294012667","doi":"10.1097/jte.0000000000000248","title":"Vertical Versus Horizontal Assessment Methods for Scoring Physiotherapy Entrance Interviews","year":2022,"lang":"en","type":"article","venue":"Journal of Physical Therapy Education","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Intraclass correlation; Inter-rater reliability; Reliability (semiconductor); Descriptive statistics; Correlation; Statistics; Psychology; Cohort; Mathematics; Psychometrics; Rating scale","score_opus":0.23418066243392052,"score_gpt":0.5653326466877174,"score_spread":0.3311519842537969,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4294012667","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.37306902,0.0024290378,0.5701834,0.0010506912,0.0011630991,0.022150796,0.0041820505,0.0010287013,0.02474315],"genre_scores_gemma":[0.4682891,0.00085563905,0.47444323,0.00041784716,0.00030273263,0.050416224,0.0024087157,0.00030190128,0.0025645487],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.7356939,0.19066529,0.028521132,0.011192642,0.0318353,0.002091758],"domain_scores_gemma":[0.62961257,0.20930387,0.061040577,0.030865088,0.067548156,0.001629764],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.13479744,0.0010620893,0.00077231706,0.0049773315,0.0011931059,0.00271335,0.0017332614,0.0006287154,0.0061640036],"category_scores_gemma":[0.21253106,0.0007528992,0.0014978218,0.004394433,0.0017666187,0.0021154115,0.0051559824,0.0010114021,0.0013369769],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0032016654,0.00051184645,0.29388556,0.00614357,0.001002836,0.00016774808,0.026131352,0.0027064234,0.013450307,0.0133106895,0.014262118,0.62522584],"study_design_scores_gemma":[0.0015185184,0.0066125253,0.7384366,0.009364203,0.00097445125,0.0015093394,0.03844199,0.047135554,0.02913929,0.018372208,0.10769757,0.00079780386],"about_ca_topic_score_codex":0.0017532988,"about_ca_topic_score_gemma":0.0050559356,"teacher_disagreement_score":0.13479744,"about_ca_system_score_codex":0.0023578205,"about_ca_system_score_gemma":0.0030584477,"threshold_uncertainty_score":0.7128855},"labels":[],"label_agreement":null},{"id":"W4308945921","doi":"10.2147/clep.s368303","title":"Implementing Multiple Imputation for Missing Data in Longitudinal Studies When Models are Not Feasible: An Example Using the Random Hot Deck Approach","year":2022,"lang":"en","type":"article","venue":"Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University; Jewish General Hospital","funders":"","keywords":"Imputation (statistics); Missing data; Longitudinal data; Statistics; Data mining; Medicine; Computer science; Mathematics","score_opus":0.9359089854971832,"score_gpt":0.6142285258336672,"score_spread":0.321680459663516,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4308945921","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0119508095,0.0021800778,0.97616404,0.0064885016,0.00023949395,0.00034759572,0.00033620963,0.000660417,0.001632879],"genre_scores_gemma":[0.106535144,0.0012592364,0.8885309,0.001787641,0.00012764019,0.00074359134,0.00032913065,0.00022184507,0.0004649126],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.7964257,0.18819003,0.0044384487,0.004097453,0.006050127,0.0007982677],"domain_scores_gemma":[0.63673484,0.31761906,0.00894699,0.025901096,0.0097856615,0.0010124015],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.18813367,0.0012021998,0.0022154872,0.0024882758,0.0019681558,0.003904807,0.0042708227,0.0042377524,0.0037845836],"category_scores_gemma":[0.31447735,0.0014410109,0.004500022,0.0064686695,0.0028916209,0.0032521326,0.0048283353,0.0060608615,0.00087803823],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017748027,0.0004668984,0.06049815,0.003294696,0.003991734,0.0026079454,0.006714721,0.17336923,0.001199375,0.12139544,0.02881725,0.5958698],"study_design_scores_gemma":[0.0010301387,0.0008623103,0.011843192,0.0038144481,0.0009479065,0.0019976932,0.0015083844,0.46997494,0.0031511784,0.45837134,0.04608365,0.0004148451],"about_ca_topic_score_codex":0.0061819823,"about_ca_topic_score_gemma":0.009942781,"teacher_disagreement_score":0.18813367,"about_ca_system_score_codex":0.0022439247,"about_ca_system_score_gemma":0.0042299,"threshold_uncertainty_score":0.99495786},"labels":[],"label_agreement":null},{"id":"W4319057825","doi":"10.1093/annweh/wxad002","title":"Automated Coding of Job Descriptions From a General Population Study: Overview of Existing Tools, Their Application and Comparison","year":2023,"lang":"en","type":"article","venue":"Annals of Work Exposures and Health","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":13,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Saint John Regional Hospital; University of Toronto; University of New Brunswick","funders":"National Cancer Institute; National Institutes of Health; European Commission; University of Warwick","keywords":"Coding (social sciences); Computer science; Population; Statistics; Medicine; Mathematics; Environmental health","score_opus":0.7392532214113784,"score_gpt":0.5341445500158267,"score_spread":0.20510867139555167,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4319057825","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.86534405,0.00531373,0.107889935,0.00055301125,0.00021019085,0.008118547,0.004931331,0.0009911819,0.0066479486],"genre_scores_gemma":[0.75373954,0.00397768,0.22228223,0.00024656675,0.00015146531,0.010627813,0.0073096324,0.00020852736,0.0014565507],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9241318,0.050186485,0.008335961,0.0039776987,0.012554785,0.00081325637],"domain_scores_gemma":[0.82150584,0.09447197,0.021410933,0.015835216,0.04550131,0.0012746435],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05967029,0.0008281415,0.00074826577,0.015728477,0.0011070864,0.001450604,0.0023603723,0.0005814717,0.0014884796],"category_scores_gemma":[0.1188542,0.0006031027,0.0010965519,0.008036927,0.0014115786,0.0017270499,0.0027625232,0.00069218274,0.0004832047],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00077248015,0.0007123145,0.48217276,0.0029346375,0.0002688102,0.00036440918,0.020012392,0.0016247007,0.0028255302,0.0010974682,0.0033391549,0.48387533],"study_design_scores_gemma":[0.000190235,0.001868339,0.9496466,0.0021952116,0.00023365275,0.001437741,0.014357433,0.012254818,0.0042981864,0.0014309856,0.0118642375,0.00022252224],"about_ca_topic_score_codex":0.012994277,"about_ca_topic_score_gemma":0.015799295,"teacher_disagreement_score":0.05967029,"about_ca_system_score_codex":0.0021340176,"about_ca_system_score_gemma":0.004528118,"threshold_uncertainty_score":0.3155704},"labels":[],"label_agreement":null},{"id":"W4322767903","doi":"10.21203/rs.3.rs-2206790/v1","title":"WITHDRAWN: Inter-rater Reliability of Risk of Bias Tools for Non-Randomized Studies","year":2023,"lang":"en","type":"preprint","venue":"Research Square","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Inter-rater reliability; Reliability (semiconductor); Reliability engineering; Psychology; Computer science; Engineering; Physics; Developmental psychology; Rating scale","score_opus":0.6070368058631517,"score_gpt":0.5470055814174135,"score_spread":0.06003122444573816,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4322767903","genre_codex":"editorial","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02319432,0.023096774,0.25299576,0.20621186,0.28888267,0.021608992,0.08432089,0.010216186,0.08947252],"genre_scores_gemma":[0.29367355,0.0075343205,0.36884993,0.08062082,0.03991716,0.050549146,0.037429318,0.010844833,0.110580884],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.7649002,0.11499541,0.06173002,0.0081320945,0.047453288,0.0027889716],"domain_scores_gemma":[0.207967,0.50185466,0.022859657,0.0677027,0.19585653,0.0037595201],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.16980499,0.0015712671,0.0029815643,0.0057324204,0.0028664456,0.0053883744,0.00482476,0.008670943,0.061216846],"category_scores_gemma":[0.79527986,0.0016789545,0.004481378,0.006834676,0.0033019562,0.004674411,0.0023406278,0.009760062,0.024907406],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0037046343,0.00013717066,0.004223208,0.0067176204,0.0012521087,0.00032611584,0.0014631111,0.0004638826,0.00112842,0.020908397,0.74153876,0.2181366],"study_design_scores_gemma":[0.005523214,0.0011279649,0.05647212,0.01347459,0.002252385,0.002075126,0.0009323184,0.0077474792,0.008714651,0.079836756,0.8210278,0.00081560854],"about_ca_topic_score_codex":0.003376189,"about_ca_topic_score_gemma":0.004063934,"teacher_disagreement_score":0.830195,"about_ca_system_score_codex":0.0032662738,"about_ca_system_score_gemma":0.009535361,"threshold_uncertainty_score":0.89802533},"labels":[],"label_agreement":null},{"id":"W4362636314","doi":"10.1177/1536867x231161978","title":"Extended biasplot command to assess bias, precision, and agreement in method comparison studies","year":2023,"lang":"en","type":"article","venue":"The Stata Journal Promoting communications on statistics and Stata","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Statistics; Computer science; Limits of agreement; Accuracy and precision; Data mining; Mathematics; Nuclear medicine; Medicine","score_opus":0.6821565065636919,"score_gpt":0.5640156980598392,"score_spread":0.11814080850385267,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4362636314","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005399358,0.00233323,0.9245481,0.0009749196,0.0006880758,0.0035191434,0.020353086,0.037532225,0.0046517598],"genre_scores_gemma":[0.023606958,0.0007186509,0.936501,0.00066107867,0.00017659228,0.019637559,0.0052246526,0.010483412,0.0029900467],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.8908244,0.082784116,0.0112272315,0.004064175,0.010256214,0.0008439323],"domain_scores_gemma":[0.5866109,0.35404986,0.01927731,0.016182614,0.022906097,0.0009731507],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.10683397,0.0025992056,0.002922288,0.0072085764,0.0010083839,0.0036088564,0.0027586876,0.0017269448,0.06780747],"category_scores_gemma":[0.29239506,0.0024484235,0.0049567176,0.0065238895,0.0010696225,0.004144673,0.0067854156,0.0043527293,0.012101873],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0034330352,0.00036349558,0.021265743,0.01301393,0.004759164,0.00040511746,0.004274911,0.009346025,0.0030219601,0.042408016,0.27644542,0.62126315],"study_design_scores_gemma":[0.0029369516,0.0015596789,0.042222675,0.00898265,0.0032647252,0.0019779496,0.0010276249,0.10153735,0.018166771,0.1486171,0.66858965,0.0011168815],"about_ca_topic_score_codex":0.0015448461,"about_ca_topic_score_gemma":0.002337809,"teacher_disagreement_score":0.10683397,"about_ca_system_score_codex":0.0016641787,"about_ca_system_score_gemma":0.004909772,"threshold_uncertainty_score":0.5649988},"labels":[],"label_agreement":null},{"id":"W4377140177","doi":"10.3390/ani13101664","title":"Inter-Rater Reliability of Scoring Systems for Abomasal Lesions in Quebec Veal Calves","year":2023,"lang":"en","type":"article","venue":"Animals","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Université de Montréal","funders":"Ministère de l'Agriculture, des Pêcheries et de l'Alimentation","keywords":"Inter-rater reliability; Lesion; Medicine; Kappa; Concordance; Internal medicine; Surgery; Statistics; Mathematics; Rating scale","score_opus":0.22359830233783815,"score_gpt":0.4084871304609386,"score_spread":0.18488882812310045,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4377140177","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9866601,0.0009954051,0.007089644,0.00011837141,0.00008455316,0.0003284688,0.00061782036,0.00006872852,0.004036906],"genre_scores_gemma":[0.99290484,0.00032013535,0.0044246586,0.00004086228,0.000016579894,0.00023745015,0.00057074864,0.000027531554,0.0014572062],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.98045164,0.00840663,0.0014653006,0.0024058064,0.006416745,0.00085388916],"domain_scores_gemma":[0.946018,0.018971914,0.0049775294,0.0033166192,0.025583474,0.0011325553],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02465947,0.0004846587,0.00056609605,0.0019002662,0.00086853735,0.0013762219,0.0010416177,0.00048478623,0.0010561968],"category_scores_gemma":[0.043976784,0.0002743542,0.00043901478,0.0010592872,0.0010541696,0.0005833841,0.001021857,0.0004666256,0.0002416073],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013577894,0.00016451588,0.8637508,0.00054474286,0.0010487502,0.0003714242,0.011801434,0.0021793004,0.016395742,0.0004372173,0.00227577,0.09967239],"study_design_scores_gemma":[0.00002857685,0.00033855828,0.9837006,0.00021252387,0.00014966018,0.00017279798,0.0020542666,0.0059833853,0.0034238696,0.00015394612,0.0037114588,0.00007035984],"about_ca_topic_score_codex":0.19586574,"about_ca_topic_score_gemma":0.34192154,"teacher_disagreement_score":0.19586574,"about_ca_system_score_codex":0.003804429,"about_ca_system_score_gemma":0.0019876577,"threshold_uncertainty_score":0.38945138},"labels":[],"label_agreement":null},{"id":"W4380758257","doi":"10.1016/j.jclinepi.2023.06.009","title":"A scoping review establishes need for consensus guidance on reporting health equity in observational studies","year":2023,"lang":"en","type":"review","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":13,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Hospital for Sick Children; Canadian Agency for Drugs and Technologies in Health; St. Joseph’s Healthcare Hamilton; London Health Sciences Centre; Ottawa Hospital; Carleton University; Queen's University; International Development Research Centre; Impact; Canadian Association of Emergency Physicians; Public Health Ontario; Dalhousie University; Royal College of Physicians and Surgeons of Canada; University of Toronto; Centre for Global Health Research; Cochrane; Ottawa Public Health; University of Ottawa; Canadian Council on Animal Care; Bruyère; McMaster University","funders":"Canadian Institutes of Health Research; World Health Organization","keywords":"Observational study; Equity (law); MEDLINE; Medicine; Actuarial science; Business; Political science; Pathology","score_opus":0.9823343326318191,"score_gpt":0.7855852011404475,"score_spread":0.19674913149137163,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4380758257","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":"reporting","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":"reporting","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0019252877,0.8633777,0.03170586,0.07873939,0.01037322,0.0053175376,0.002833195,0.00022727341,0.0055005397],"genre_scores_gemma":[0.05588981,0.70482737,0.16080126,0.051213484,0.004718751,0.017289648,0.0036823833,0.0002443196,0.0013329766],"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","domain_scores_codex":[0.45556366,0.2339285,0.23182972,0.013447743,0.06224628,0.0029841254],"domain_scores_gemma":[0.0858286,0.8057948,0.032806262,0.022226488,0.05150575,0.0018380826],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.5382359,0.0024067722,0.01383444,0.027146725,0.004341244,0.017705547,0.008756208,0.01379515,0.0063916477],"category_scores_gemma":[0.8254738,0.0043287287,0.015608245,0.019091703,0.009465489,0.017249938,0.012163052,0.01428748,0.0014692156],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00035508425,0.00010115153,0.006045145,0.595151,0.018963005,0.00026840586,0.0032386414,0.0005254563,0.0003648207,0.034458525,0.03226163,0.30826724],"study_design_scores_gemma":[0.00021407347,0.00008528607,0.0032329094,0.8911376,0.015955875,0.00022257697,0.0009070067,0.00040692984,0.0002867071,0.025408426,0.062034976,0.00010757055],"about_ca_topic_score_codex":0.012607634,"about_ca_topic_score_gemma":0.023253756,"teacher_disagreement_score":0.4617641,"about_ca_system_score_codex":0.013678776,"about_ca_system_score_gemma":0.081639744,"threshold_uncertainty_score":0.5694374},"labels":[],"label_agreement":null},{"id":"W4385694112","doi":"10.1159/000531054","title":"Clinical Validation of Novel Digital Measures: Statistical Methods for Reliability Evaluation","year":2023,"lang":"en","type":"review","venue":"Digital Biomarkers","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Bayer (Canada)","funders":"","keywords":"Reliability (semiconductor); Categorical variable; Computer science; Reliability engineering; Measure (data warehouse); Data mining; Machine learning; Engineering","score_opus":0.6501770228660378,"score_gpt":0.6044108355425473,"score_spread":0.04576618732349058,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4385694112","genre_codex":"review","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0015836722,0.72172636,0.26246974,0.007999169,0.0014109241,0.00062995515,0.00055993284,0.00023100238,0.003389218],"genre_scores_gemma":[0.056060262,0.5706941,0.35871854,0.004861071,0.0043544676,0.0032748422,0.0007847323,0.00021244153,0.0010395629],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9007214,0.0630367,0.009480616,0.0045614694,0.02177402,0.0004258351],"domain_scores_gemma":[0.58728206,0.35852453,0.018411586,0.010885076,0.0241258,0.0007709349],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.119369,0.0017127149,0.004555145,0.008493403,0.000523366,0.004513093,0.0033945777,0.0031161755,0.002431801],"category_scores_gemma":[0.23220369,0.0008978162,0.0027109822,0.006707411,0.005308757,0.0039902003,0.0026808672,0.0057665203,0.00139578],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00012799997,0.00010445151,0.004525516,0.034189045,0.0014373251,0.00009282927,0.0005333035,0.0034946722,0.00094674743,0.052932926,0.011715252,0.88989997],"study_design_scores_gemma":[0.00026721184,0.0016206753,0.025678128,0.11056825,0.0045998422,0.0031234673,0.0011796326,0.03533474,0.007965479,0.3173973,0.49145794,0.0008073913],"about_ca_topic_score_codex":0.0016469549,"about_ca_topic_score_gemma":0.0015350605,"teacher_disagreement_score":0.119369,"about_ca_system_score_codex":0.0028187823,"about_ca_system_score_gemma":0.0066452003,"threshold_uncertainty_score":0.63129115},"labels":[],"label_agreement":null},{"id":"W4386504557","doi":"10.1111/apa.16957","title":"High inter‐rater reliability between physicians and nurses utilising modified Downes' scores in preterm respiratory distress","year":2023,"lang":"en","type":"article","venue":"Acta Paediatrica","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto; Vancouver Coastal Health; Royal Columbian Hospital; St. Michael's Hospital","funders":"Bill and Melinda Gates Foundation","keywords":"Concordance; Medicine; Cohen's kappa; Respiratory distress; Inter-rater reliability; Kappa; Statistic; Intensive care; Pediatrics; Concordance correlation coefficient; Respiratory therapist; Emergency medicine; Intensive care medicine; Internal medicine; Surgery; Statistics; Rating scale","score_opus":0.09805814331907288,"score_gpt":0.34845895603568405,"score_spread":0.2504008127166112,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4386504557","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9886113,0.00068923796,0.0072777495,0.00012321747,0.000110803274,0.00018300717,0.00020294193,0.000024456494,0.002777446],"genre_scores_gemma":[0.99676967,0.00013390133,0.0026264358,0.000023755503,0.000018440807,0.00007937668,0.000110216424,0.0000072744156,0.0002309862],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.95978606,0.025335,0.004796104,0.0028011482,0.006377512,0.00090423337],"domain_scores_gemma":[0.9334764,0.039272074,0.008795145,0.0036158354,0.014077666,0.00076289754],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.031685207,0.00036270672,0.00059816113,0.0012744112,0.00054683647,0.0009954543,0.00051026716,0.00039359566,0.00056854094],"category_scores_gemma":[0.07296519,0.00028899743,0.0005127491,0.0008663235,0.0008528738,0.0007547785,0.0018401359,0.00045045168,0.00022381442],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006000551,0.000080319944,0.95863813,0.00026951308,0.00029750296,0.00012530117,0.006789261,0.0005672875,0.00145186,0.00024126648,0.0005764079,0.030363023],"study_design_scores_gemma":[0.00003482258,0.00038161673,0.98663193,0.00018617467,0.00011487917,0.00035200932,0.0037936843,0.0037529243,0.002583075,0.00052398694,0.0016067859,0.000038103648],"about_ca_topic_score_codex":0.0028122277,"about_ca_topic_score_gemma":0.0033235508,"teacher_disagreement_score":0.031685207,"about_ca_system_score_codex":0.0006036602,"about_ca_system_score_gemma":0.00081472826,"threshold_uncertainty_score":0.1675694},"labels":[],"label_agreement":null},{"id":"W4389166029","doi":"10.1016/j.drugalcdep.2023.111043","title":"Evaluating the agreement between different substance use recall periods in multiple HIV cohorts","year":2023,"lang":"en","type":"article","venue":"Drug and Alcohol Dependence","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University; University of British Columbia; British Columbia Centre on Substance Use","funders":"National Institute on Drug Abuse; National Institute of Mental Health","keywords":"Cohen's kappa; Kappa; Recall; Medicine; Agreement; Concordance; Statistics; Recall bias; Psychology; Clinical psychology; Demography; Mathematics; Internal medicine; Pathology","score_opus":0.4071326534392604,"score_gpt":0.42793529633616845,"score_spread":0.02080264289690803,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4389166029","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.98727846,0.00080293947,0.010059717,0.000072098206,0.000091461,0.000111992624,0.00032812313,0.000049264276,0.0012059631],"genre_scores_gemma":[0.9952389,0.00014193084,0.0034658702,0.000062130115,0.000035079524,0.000084049454,0.00051579543,0.000019960698,0.00043620693],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.95135146,0.033169203,0.00398501,0.0047044447,0.0054860055,0.0013039586],"domain_scores_gemma":[0.8152244,0.1362306,0.014445594,0.014892914,0.018367475,0.0008389916],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.076649,0.0006133161,0.0010249878,0.0018603869,0.00096428714,0.0020606706,0.0012148845,0.0016763854,0.00053092913],"category_scores_gemma":[0.12517281,0.00083106477,0.001909246,0.0011529729,0.0010067659,0.0012896586,0.0017850847,0.0011082729,0.00035741707],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012190245,0.00013098387,0.97806096,0.000081515165,0.0016942889,0.000043055297,0.0019742595,0.0012753392,0.0010496919,0.00020650368,0.0002649543,0.013999463],"study_design_scores_gemma":[0.00007299306,0.001046174,0.9806138,0.00007863575,0.0010131736,0.00025582506,0.001476379,0.009204869,0.004388592,0.00053095765,0.001249037,0.00006936199],"about_ca_topic_score_codex":0.008150164,"about_ca_topic_score_gemma":0.009600771,"teacher_disagreement_score":0.923351,"about_ca_system_score_codex":0.0007764024,"about_ca_system_score_gemma":0.0009456479,"threshold_uncertainty_score":0.4053635},"labels":[],"label_agreement":null},{"id":"W4389410166","doi":"10.1186/s13643-023-02389-w","title":"Inter-rater reliability of risk of bias tools for non-randomized studies","year":2023,"lang":"en","type":"article","venue":"Systematic Reviews","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Centre Hospitalier de l’Université de Montréal; Université de Montréal","funders":"","keywords":"Intraclass correlation; Checklist; Medicine; Reliability (semiconductor); Inter-rater reliability; Scale (ratio); Statistics; Rating scale; Mathematics; Clinical psychology; Psychometrics; Psychology; Cartography","score_opus":0.4923679694819516,"score_gpt":0.46932421469341784,"score_spread":0.023043754788533766,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4389410166","genre_codex":"methods","genre_gemma":"empirical","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.083322726,0.10753071,0.61175334,0.0042625307,0.0048243254,0.15240593,0.015239677,0.0030938333,0.01756691],"genre_scores_gemma":[0.36778733,0.006511388,0.39151114,0.001038641,0.0008639879,0.22715195,0.0038636501,0.00054390857,0.0007280161],"study_design_codex":"systematic_review","study_design_gemma":"observational","domain_scores_codex":[0.1223985,0.5712667,0.22982623,0.01904124,0.056153078,0.0013142527],"domain_scores_gemma":[0.04710284,0.72609276,0.12214765,0.042419508,0.061278824,0.0009584281],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.6735605,0.0032278786,0.012075553,0.025975943,0.0027612534,0.008378555,0.0056570214,0.0037298894,0.005607627],"category_scores_gemma":[0.85811263,0.002848127,0.026073143,0.019803334,0.006489536,0.0076050307,0.009361778,0.003900145,0.0014497312],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.010688897,0.0005281552,0.20868693,0.31319585,0.1018606,0.00041671202,0.019252094,0.007876366,0.002275933,0.01987769,0.015460664,0.29988015],"study_design_scores_gemma":[0.012960422,0.010051961,0.3509947,0.24154681,0.11185771,0.0029223193,0.009173881,0.061049856,0.014661757,0.08287259,0.0990818,0.0028262313],"about_ca_topic_score_codex":0.0015660938,"about_ca_topic_score_gemma":0.0022074694,"teacher_disagreement_score":0.3264395,"about_ca_system_score_codex":0.0072019654,"about_ca_system_score_gemma":0.010131343,"threshold_uncertainty_score":0.4025581},"labels":[],"label_agreement":null},{"id":"W4389615068","doi":"10.1148/radiol.230492","title":"Measuring Interrater Reliability","year":2023,"lang":"en","type":"editorial","venue":"Radiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":30,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Centre Hospitalier de l’Université de Montréal","funders":"","keywords":"Medicine; Inter-rater reliability; Neuroradiology; Radiology; Scholarship; Medical physics; Nuclear medicine; Psychiatry; Psychology; Rating scale; Neurology","score_opus":0.21623695076910274,"score_gpt":0.3877990363725101,"score_spread":0.17156208560340738,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4389615068","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00003494815,0.010579295,0.0008027032,0.053625893,0.9337773,0.000048859532,0.00006422085,0.00007817841,0.0009885388],"genre_scores_gemma":[0.0011283776,0.0063488893,0.0011602736,0.03587321,0.9514648,0.0001876829,0.00006007878,0.000104726205,0.0036720259],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.91429985,0.03698154,0.011186818,0.004474892,0.031604018,0.0014528662],"domain_scores_gemma":[0.58998615,0.25222525,0.012120058,0.008540412,0.12938258,0.007745508],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.080673985,0.0047423183,0.007161469,0.012557301,0.0059305998,0.01526783,0.0062081106,0.026750473,0.00785357],"category_scores_gemma":[0.32514417,0.0030032392,0.002957665,0.0055808863,0.0104072485,0.007273261,0.0041656466,0.029606124,0.008586651],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00003344781,0.000008199741,0.00006856968,0.0006311594,0.00005901843,0.000049833103,0.000045694596,0.000017463428,0.000036931207,0.00057640334,0.9846681,0.013805247],"study_design_scores_gemma":[0.00026225933,0.000078926554,0.0015901139,0.0038283367,0.0004831565,0.00062519434,0.00024793157,0.00061946735,0.00027472593,0.008707726,0.9831539,0.00012838074],"about_ca_topic_score_codex":0.004009149,"about_ca_topic_score_gemma":0.012308981,"teacher_disagreement_score":0.919326,"about_ca_system_score_codex":0.0065366975,"about_ca_system_score_gemma":0.010301541,"threshold_uncertainty_score":0.42664993},"labels":[],"label_agreement":null},{"id":"W4390586053","doi":"10.1016/j.jpi.2023.100358","title":"Use of n-grams and K-means clustering to classify data from free text bone marrow reports","year":2024,"lang":"en","type":"article","venue":"Journal of Pathology Informatics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Computer science; Cluster analysis; Artificial intelligence; Security token; Centroid; Bone marrow; Text mining; Natural language processing; Data mining; Pattern recognition (psychology); Pathology; Medicine","score_opus":0.2526589685442207,"score_gpt":0.37809989781726455,"score_spread":0.12544092927304384,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4390586053","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.3631058,0.00034369022,0.6308201,0.00031094466,0.00007772275,0.0004255995,0.00041548998,0.0019613074,0.002539322],"genre_scores_gemma":[0.5439874,0.00010731259,0.4543852,0.00006338941,0.000022547249,0.00015503171,0.00055567164,0.000089581146,0.00063385203],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99404955,0.002702877,0.00064157427,0.0011018744,0.001281222,0.00022296066],"domain_scores_gemma":[0.982165,0.011809651,0.0012298282,0.0013595177,0.0032270243,0.00020895817],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007657753,0.00079354533,0.0008328378,0.0033690438,0.0012119493,0.0017243614,0.0008464738,0.00083489495,0.00047068103],"category_scores_gemma":[0.028635368,0.00029962292,0.0009471533,0.0018940223,0.0006555014,0.001877832,0.0009237697,0.00095244084,0.00049504894],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009623923,0.00052500755,0.08691532,0.00029626244,0.0004949079,0.0002615376,0.0026680168,0.16855697,0.01686437,0.006978521,0.0031458156,0.71233076],"study_design_scores_gemma":[0.000019103261,0.00017253791,0.018630015,0.000047416765,0.00006845997,0.00013734504,0.0006555969,0.9574269,0.014103109,0.006981645,0.0016815073,0.00007625457],"about_ca_topic_score_codex":0.013677314,"about_ca_topic_score_gemma":0.01623303,"teacher_disagreement_score":0.013677314,"about_ca_system_score_codex":0.0016302987,"about_ca_system_score_gemma":0.0023407247,"threshold_uncertainty_score":0.040498555},"labels":[],"label_agreement":null},{"id":"W4391036726","doi":"10.4236/ojepi.2024.141005","title":"Cautionary Remarks When Testing Agreement between Two Raters for Continuous Scale Measurements: A Tutorial in Clinical Epidemiology with Implementation Using R","year":2024,"lang":"en","type":"article","venue":"Open Journal of Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Statistic; Scale (ratio); Sample size determination; Statistics; Sample (material); Linear regression; Degrees of freedom (physics and chemistry); Data mining; Computer science; Medicine; Econometrics; Mathematics","score_opus":0.7023443814366066,"score_gpt":0.5922363059400028,"score_spread":0.11010807549660384,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4391036726","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0018272025,0.013290417,0.67613053,0.22836499,0.048173238,0.0012867186,0.0019042547,0.019818917,0.009203664],"genre_scores_gemma":[0.017779773,0.0056747263,0.8270408,0.10689147,0.013995177,0.00614312,0.0005630176,0.0101203425,0.011791524],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.5720521,0.33918506,0.037746612,0.01193051,0.03746323,0.0016224362],"domain_scores_gemma":[0.16437668,0.7314397,0.018775595,0.0320491,0.051172808,0.0021860942],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2590153,0.0046840254,0.0039119036,0.007139266,0.002613325,0.0068312427,0.0103302775,0.013147458,0.017632144],"category_scores_gemma":[0.7338336,0.003457085,0.0054543135,0.0071562296,0.0134086795,0.010176519,0.006337423,0.028681092,0.024177803],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00036961166,0.000124304,0.0017827161,0.0047385017,0.00044382003,0.0010058979,0.0039681103,0.002092232,0.0012439551,0.029450897,0.8156708,0.13910915],"study_design_scores_gemma":[0.00038937054,0.00035089516,0.0032381658,0.015781322,0.00044674982,0.0042151753,0.0014832728,0.016701225,0.00543749,0.14035018,0.8109173,0.00068878446],"about_ca_topic_score_codex":0.003798869,"about_ca_topic_score_gemma":0.0045085317,"teacher_disagreement_score":0.7409847,"about_ca_system_score_codex":0.0036730464,"about_ca_system_score_gemma":0.007006316,"threshold_uncertainty_score":0.9137661},"labels":[],"label_agreement":null},{"id":"W4391432388","doi":"10.1097/ede.0000000000001726","title":"Application of a Web-based Tool for Quantitative Bias Analysis: The Example of Misclassification Due to Self-reported Body Mass Index","year":2024,"lang":"en","type":"article","venue":"Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Public Health Ontario; University of Toronto","funders":"National Cancer Institute; National Institutes of Health","keywords":"Body mass index; Index (typography); Statistics; Computer science; Mathematics; Medicine; World Wide Web; Internal medicine","score_opus":0.3506473340767288,"score_gpt":0.45331573356540744,"score_spread":0.10266839948867862,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4391432388","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008807806,0.0005093789,0.8919582,0.0038291602,0.0005049548,0.0026704236,0.008594941,0.07871756,0.0044075567],"genre_scores_gemma":[0.051344212,0.0003985029,0.9271398,0.0022304724,0.0003000817,0.0065432987,0.0032688018,0.006118781,0.0026560426],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.896217,0.07696222,0.009395596,0.0038359698,0.012905665,0.0006836246],"domain_scores_gemma":[0.396904,0.5424129,0.016317239,0.02687331,0.016436959,0.001055678],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1315974,0.0029206977,0.001964322,0.0072673038,0.0010865559,0.004122324,0.0027828298,0.0033936035,0.022710623],"category_scores_gemma":[0.25951213,0.0020186326,0.0040491945,0.0041975253,0.001013795,0.0033511815,0.0058299643,0.0036474075,0.0061005536],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0023332848,0.0009848203,0.051300045,0.008407552,0.0038863984,0.0016026088,0.004633311,0.015830468,0.005372162,0.02045236,0.17896073,0.7062363],"study_design_scores_gemma":[0.0032350607,0.0013120839,0.06218322,0.0089844335,0.0018410999,0.0047556353,0.0011312489,0.42526957,0.030420087,0.10672286,0.3527697,0.0013749853],"about_ca_topic_score_codex":0.0020241048,"about_ca_topic_score_gemma":0.0023120411,"teacher_disagreement_score":0.8684026,"about_ca_system_score_codex":0.0012816405,"about_ca_system_score_gemma":0.0032589082,"threshold_uncertainty_score":0.6959619},"labels":[],"label_agreement":null},{"id":"W4392815531","doi":"10.1016/j.hrthm.2024.03.018","title":"Reply to the Editor— Clinical potential of conduction system pacing versus biventricular pacing in heart failure: A trial sequential analysis and methodological comment","year":2024,"lang":"en","type":"letter","venue":"Heart Rhythm","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University; Population Health Research Institute","funders":"","keywords":"Medicine; Cardiac pacing; Heart failure; Cardiology; Internal medicine","score_opus":0.2859121744866028,"score_gpt":0.44055001089441,"score_spread":0.1546378364078072,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4392815531","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00020796327,0.00065035827,0.00014428388,0.96326613,0.035124283,0.000024020155,0.00013229354,0.000019021487,0.0004315912],"genre_scores_gemma":[0.0014308435,0.00026917283,0.00026996003,0.9580015,0.03892731,0.00007800419,0.000022748884,0.000021522934,0.0009790171],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9735832,0.012199618,0.0048482064,0.0029284067,0.005056979,0.0013836237],"domain_scores_gemma":[0.8143576,0.15370698,0.0072710607,0.0033519987,0.016472891,0.004839526],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.039315213,0.0010883558,0.0036287126,0.0014256149,0.00417342,0.0053118295,0.004519992,0.064220734,0.006548996],"category_scores_gemma":[0.189324,0.0015697761,0.0027776037,0.0017259471,0.0053522675,0.0039551854,0.0019044218,0.059857212,0.005458379],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00024037431,0.000031517382,0.0006623006,0.00016242701,0.00010280098,0.00032992233,0.00013240479,0.00007607284,0.00007689605,0.0018525851,0.99200493,0.0043277387],"study_design_scores_gemma":[0.0017561545,0.000298127,0.0047088633,0.0019794393,0.0007417017,0.0011929254,0.0007607051,0.0023835858,0.0008323135,0.023312537,0.9617141,0.00031953445],"about_ca_topic_score_codex":0.008055306,"about_ca_topic_score_gemma":0.010505227,"teacher_disagreement_score":0.9606848,"about_ca_system_score_codex":0.0066207564,"about_ca_system_score_gemma":0.008934521,"threshold_uncertainty_score":0.2079212},"labels":[],"label_agreement":null},{"id":"W4392858836","doi":"10.1145/3626253.3635599","title":"A Generalized Framework for Describing Question Randomization","year":2024,"lang":"en","type":"article","venue":"","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Generalizability theory; Randomization; Computer science; Randomized controlled trial; Randomized experiment; Machine learning; Artificial intelligence; Mathematics; Statistics; Medicine","score_opus":0.2836176893562416,"score_gpt":0.4298999124077332,"score_spread":0.14628222305149158,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4392858836","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0007406258,0.00037600513,0.9918182,0.001388492,0.0001224295,0.00063354906,0.00029828993,0.00033755385,0.004284821],"genre_scores_gemma":[0.036322746,0.00052070577,0.953622,0.0010988059,0.00024874375,0.005533087,0.0005186008,0.00019593508,0.0019394042],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.7967479,0.16462436,0.013110458,0.010747868,0.012538596,0.0022309048],"domain_scores_gemma":[0.8128914,0.13210315,0.011363541,0.022208683,0.019835673,0.0015974708],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.12214884,0.002962943,0.0020941005,0.009155124,0.004072388,0.0096570505,0.0064454265,0.0070414296,0.011588914],"category_scores_gemma":[0.18226895,0.0016438931,0.0039682006,0.009136285,0.015898967,0.013681496,0.006955188,0.0076925345,0.004716276],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00003419796,0.000027442644,0.00048857066,0.00021448197,0.000028196873,0.00006821832,0.0017502162,0.0031973955,0.00028635326,0.9650826,0.0024910853,0.02633113],"study_design_scores_gemma":[0.000042273394,0.00008677106,0.00033001252,0.00039325465,0.000039219434,0.00023341815,0.00047971174,0.023033412,0.0006047273,0.9112639,0.06341748,0.00007578426],"about_ca_topic_score_codex":0.0067365644,"about_ca_topic_score_gemma":0.0046009663,"teacher_disagreement_score":0.8778511,"about_ca_system_score_codex":0.007133718,"about_ca_system_score_gemma":0.011045392,"threshold_uncertainty_score":0.6459925},"labels":[],"label_agreement":null},{"id":"W4393385387","doi":"10.31219/osf.io/wzqxg","title":"Bayesian estimation in multiple comparisons","year":2024,"lang":"en","type":"preprint","venue":"","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval","funders":"","keywords":"Bayesian probability; Estimation; Computer science; Bayes estimator; Artificial intelligence; Econometrics; Statistics; Machine learning; Mathematics; Economics","score_opus":0.2554361265663144,"score_gpt":0.41617030139968475,"score_spread":0.16073417483337032,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393385387","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0012520499,0.00069815386,0.9949705,0.0005934433,0.00026197705,0.0003182372,0.00017074328,0.0002735687,0.001461321],"genre_scores_gemma":[0.046205517,0.001065876,0.94677174,0.00050968,0.00040394868,0.003004726,0.00050172367,0.0003006499,0.0012361361],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8001291,0.16526489,0.0054038744,0.015754666,0.01210821,0.0013392516],"domain_scores_gemma":[0.63375646,0.31813508,0.011109371,0.023384081,0.012644867,0.0009701526],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.14811157,0.004191787,0.006932822,0.005321859,0.0023375144,0.008051828,0.007907505,0.0051463176,0.013154694],"category_scores_gemma":[0.43893933,0.003546837,0.005742384,0.0070819925,0.006513057,0.007150456,0.006459418,0.010564008,0.0033716739],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00061549584,0.00026238547,0.0061195185,0.0023362143,0.0032918497,0.00043334663,0.0020285218,0.08638995,0.00087038125,0.5279616,0.01642976,0.353261],"study_design_scores_gemma":[0.00018101081,0.00019147526,0.0016802349,0.0005203415,0.00032639853,0.00014451561,0.00026187245,0.17601413,0.00084315514,0.8042809,0.01544729,0.000108680404],"about_ca_topic_score_codex":0.006894981,"about_ca_topic_score_gemma":0.005654847,"teacher_disagreement_score":0.14811157,"about_ca_system_score_codex":0.0045974148,"about_ca_system_score_gemma":0.008141681,"threshold_uncertainty_score":0.7832982},"labels":[],"label_agreement":null},{"id":"W4396912353","doi":"10.1016/j.neuchi.2024.101566","title":"Reliability of study endpoint adjudication in a pragmatic trial on brain arteriovenous malformations","year":2024,"lang":"en","type":"article","venue":"Neurochirurgie","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta Hospital; Centre Hospitalier de l’Université de Montréal; Health Sciences Centre","funders":"","keywords":"Medicine; Clinical endpoint; Adjudication; Inter-rater reliability; Adverse effect; Clinical trial; Reliability (semiconductor); Pediatrics; Surgery; Internal medicine; Psychology; Rating scale; Developmental psychology","score_opus":0.09841165656943207,"score_gpt":0.3866456987383119,"score_spread":0.2882340421688798,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4396912353","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8899367,0.015122025,0.06820606,0.0052071847,0.0031485267,0.012109198,0.00071540195,0.00032124037,0.0052336883],"genre_scores_gemma":[0.98111206,0.0003031167,0.013572983,0.0006212597,0.00031469562,0.0036766215,0.00022207348,0.000040376413,0.00013682137],"study_design_codex":"randomized_trial","study_design_gemma":"observational","domain_scores_codex":[0.14073496,0.82027525,0.021046111,0.006569521,0.0102602765,0.0011138236],"domain_scores_gemma":[0.09819961,0.81361103,0.03835615,0.034692015,0.013442855,0.0016982751],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.5165368,0.001816139,0.00891775,0.00166803,0.0020785588,0.004470903,0.0024740915,0.005899836,0.0012545515],"category_scores_gemma":[0.73846394,0.0028023617,0.0064649996,0.0018495717,0.00590747,0.004741868,0.0050652847,0.0066052037,0.00033379742],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.6814874,0.0036296453,0.09965466,0.010637379,0.05487527,0.00040322318,0.009142526,0.014100936,0.0017087691,0.009888196,0.0063545294,0.108117454],"study_design_scores_gemma":[0.38805366,0.16150467,0.1908096,0.005222992,0.045643453,0.0012494191,0.002310976,0.1426491,0.0044836556,0.044447575,0.011854141,0.0017707794],"about_ca_topic_score_codex":0.0014025524,"about_ca_topic_score_gemma":0.0011487122,"teacher_disagreement_score":0.48346323,"about_ca_system_score_codex":0.0032743595,"about_ca_system_score_gemma":0.005577867,"threshold_uncertainty_score":0.5961963},"labels":[],"label_agreement":null},{"id":"W4398301064","doi":"10.7910/dvn/fmk6sq/bhbbmy","title":"agreement_results1.rtf","year":2020,"lang":"en","type":"dataset","venue":"Harvard Dataverse","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Methylene blue; Lymph; Staining; Degree (music); Methylene; Pathology; Medicine; Chemistry; Medicinal chemistry; Organic chemistry; Physics","score_opus":0.12691836379604451,"score_gpt":0.3431787049445279,"score_spread":0.2162603411484834,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4398301064","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000037873953,0.000027213013,0.00005535615,0.00006423791,0.000017982997,0.000008568027,0.99891233,0.00028577217,0.000590656],"genre_scores_gemma":[0.00048349285,0.000052218573,0.00033736075,0.00010895248,0.000015943377,0.00019175994,0.9975101,0.00030498224,0.0009952008],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99625385,0.0010048571,0.0005102178,0.0009646744,0.0007403437,0.00052605907],"domain_scores_gemma":[0.9838014,0.008253552,0.0012316277,0.0033712874,0.002592118,0.00075001165],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0038564168,0.0027003235,0.002035988,0.0053980807,0.0012789823,0.0044597383,0.004331646,0.003530581,0.31640387],"category_scores_gemma":[0.034381747,0.0012768266,0.0024180203,0.009373904,0.0007925255,0.002775324,0.0033393218,0.0026351467,0.21938242],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000046920417,0.00001258484,0.00045021073,0.0007893649,0.000035083638,0.000007910364,0.00001895731,0.00014635897,0.00001957858,0.00052338716,0.9967405,0.0012091065],"study_design_scores_gemma":[0.00066627713,0.000026269583,0.0034370045,0.0008538947,0.000069508795,0.00004645366,0.000083896244,0.0003761801,0.00020420538,0.0041115433,0.99007356,0.000051197563],"about_ca_topic_score_codex":0.02180568,"about_ca_topic_score_gemma":0.036365468,"teacher_disagreement_score":0.68359613,"about_ca_system_score_codex":0.002181311,"about_ca_system_score_gemma":0.0038871474,"threshold_uncertainty_score":0.9750669},"labels":[],"label_agreement":null},{"id":"W4398457448","doi":"10.7910/dvn/hgihgc/5afaas","title":"study 1 analyses.R","year":2020,"lang":"en","type":"dataset","venue":"Harvard Dataverse","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Biology","score_opus":0.3457737450820914,"score_gpt":0.4375629867893381,"score_spread":0.09178924170724667,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4398457448","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0013663467,0.00008249415,0.0066993753,0.0003694352,0.00011344991,0.0022219424,0.9831822,0.0026217948,0.0033429733],"genre_scores_gemma":[0.013988577,0.00024372301,0.088771135,0.0015904077,0.00010872072,0.0766827,0.79261464,0.008341314,0.017658748],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99606246,0.0011771978,0.0005668244,0.0012003839,0.00063191867,0.000361155],"domain_scores_gemma":[0.973873,0.014403969,0.0015309989,0.0058967965,0.0037750113,0.0005202597],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0068347254,0.002740509,0.0018807864,0.003213651,0.0015218764,0.0025719113,0.0023250177,0.0013752229,0.22361502],"category_scores_gemma":[0.053807218,0.0013667978,0.0020787378,0.0029989262,0.00095813384,0.0012451718,0.0018674139,0.0028641908,0.07105697],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00023366215,0.00007841009,0.0022223946,0.0013980502,0.000149747,0.000055159704,0.00017488825,0.0008200596,0.0002869996,0.003163975,0.9814433,0.009973403],"study_design_scores_gemma":[0.0022110504,0.00022414132,0.014618646,0.0019251268,0.0005609792,0.0002352191,0.00037380515,0.0026228118,0.0012806826,0.034208976,0.94151884,0.00021986516],"about_ca_topic_score_codex":0.01211728,"about_ca_topic_score_gemma":0.036911726,"teacher_disagreement_score":0.77638495,"about_ca_system_score_codex":0.0016370931,"about_ca_system_score_gemma":0.0070171067,"threshold_uncertainty_score":0.7480668},"labels":[],"label_agreement":null},{"id":"W4398768486","doi":"10.1590/1980-265x-tce-2023-0171en","title":"CREATION AND CONTENT VALIDITY OF 5R-MEDSAFE: ASSESSING ADHERENCE TO THE SAFE DRUG ADMINISTRATION “FIVE RIGHTS”","year":2024,"lang":"en","type":"article","venue":"Texto & Contexto - Enfermagem","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval","funders":"","keywords":"Administration (probate law); Drug administration; Content validity; Drug; Content analysis; Content (measure theory); Political science; Medicine; Psychology; Nursing; Pharmacology; Sociology; Law; Social science; Health care; Mathematics","score_opus":0.770527616821497,"score_gpt":0.5405024020312108,"score_spread":0.23002521479028615,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4398768486","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9719875,0.00012313746,0.015266976,0.0004676277,0.00005457635,0.004435448,0.00074127305,0.000102280996,0.006821192],"genre_scores_gemma":[0.9505496,0.00013221183,0.04295668,0.00014194705,0.000022205586,0.0045228736,0.0006997911,0.000023961471,0.0009507403],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9783745,0.012149085,0.0029760366,0.00093820086,0.005026585,0.00053558085],"domain_scores_gemma":[0.9446219,0.03415934,0.0068791513,0.0038834806,0.009860599,0.0005955243],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.026542349,0.00029543386,0.00057484757,0.0022202272,0.0005999809,0.0010186228,0.0008572131,0.00052592286,0.001859238],"category_scores_gemma":[0.05274465,0.00033893404,0.0013395183,0.0010271834,0.0011778253,0.00124359,0.0018266226,0.00074625545,0.0002454963],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007351534,0.0019460075,0.664065,0.0013211855,0.00034268308,0.00011310363,0.0145693775,0.0018101009,0.004884575,0.00477065,0.0022920684,0.30315015],"study_design_scores_gemma":[0.0002300929,0.0025307543,0.9523595,0.0010508548,0.00031176044,0.00020472168,0.008946811,0.010733126,0.00943554,0.002225798,0.01186346,0.00010760731],"about_ca_topic_score_codex":0.0016385395,"about_ca_topic_score_gemma":0.0020450496,"teacher_disagreement_score":0.026542349,"about_ca_system_score_codex":0.0014916436,"about_ca_system_score_gemma":0.0042277295,"threshold_uncertainty_score":0.14037102},"labels":[],"label_agreement":null},{"id":"W4398837123","doi":"10.7910/dvn/udgofr/uwf7cn","title":"Replication_code_PSLE_Riambau_Ostwald.do","year":2020,"lang":"en","type":"dataset","venue":"Harvard Dataverse","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Replication (statistics); Face (sociological concept); Code (set theory); Placebo; Computer science; Sociology; Biology; Programming language; Virology; Medicine; Social science; Alternative medicine","score_opus":0.13666328025013277,"score_gpt":0.35713924839825406,"score_spread":0.2204759681481213,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4398837123","genre_codex":"dataset","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000075339696,0.000032867618,0.00026455714,0.0001733642,0.000048943188,0.000032409687,0.9968809,0.0007579241,0.0017336966],"genre_scores_gemma":[0.0015171102,0.00009183188,0.0015242466,0.00024008277,0.000044348417,0.0008913681,0.9910739,0.0011065957,0.0035106621],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9964031,0.0012162502,0.0004276402,0.0008790835,0.0006365838,0.00043737786],"domain_scores_gemma":[0.9769159,0.009277991,0.0014116486,0.0071491054,0.0040685595,0.0011767317],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.006390355,0.0017932788,0.0014580931,0.0048660315,0.00139656,0.0047994377,0.004881846,0.0021854036,0.40188438],"category_scores_gemma":[0.054028068,0.0014300075,0.0015672275,0.008246133,0.0008615831,0.002830447,0.003911508,0.0021334307,0.25371403],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000049448103,0.000012304802,0.00086752424,0.00037423614,0.00003359126,0.000005976978,0.000034130462,0.000090236725,0.000019746923,0.0010192622,0.995059,0.0024345254],"study_design_scores_gemma":[0.00052170746,0.000021524324,0.0040767337,0.0006742118,0.00005604937,0.000031942793,0.000093514784,0.00032420843,0.00022698418,0.0051199086,0.9887989,0.0000542648],"about_ca_topic_score_codex":0.026493488,"about_ca_topic_score_gemma":0.033946544,"teacher_disagreement_score":0.40188438,"about_ca_system_score_codex":0.0017509384,"about_ca_system_score_gemma":0.0045154244,"threshold_uncertainty_score":0.85313934},"labels":[],"label_agreement":null},{"id":"W4398951211","doi":"10.7910/dvn/s6b7se/z6le0q","title":"Replication_code_PSLE_Riambau_Ostwald.do","year":2020,"lang":"en","type":"dataset","venue":"Harvard Dataverse","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Replication (statistics); Code (set theory); Face (sociological concept); Placebo; Computer science; Psychology; Programming language; Medicine; Sociology; Virology; Alternative medicine; Social science; Pathology","score_opus":0.13666328025013277,"score_gpt":0.35713924839825406,"score_spread":0.2204759681481213,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4398951211","genre_codex":"dataset","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000075339696,0.000032867618,0.00026455714,0.0001733642,0.000048943188,0.000032409687,0.9968809,0.0007579241,0.0017336966],"genre_scores_gemma":[0.0015171102,0.00009183188,0.0015242466,0.00024008277,0.000044348417,0.0008913681,0.9910739,0.0011065957,0.0035106621],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9964031,0.0012162502,0.0004276402,0.0008790835,0.0006365838,0.00043737786],"domain_scores_gemma":[0.9769159,0.009277991,0.0014116486,0.0071491054,0.0040685595,0.0011767317],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.006390355,0.0017932788,0.0014580931,0.0048660315,0.00139656,0.0047994377,0.004881846,0.0021854036,0.40188438],"category_scores_gemma":[0.054028068,0.0014300075,0.0015672275,0.008246133,0.0008615831,0.002830447,0.003911508,0.0021334307,0.25371403],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000049448103,0.000012304802,0.00086752424,0.00037423614,0.00003359126,0.000005976978,0.000034130462,0.000090236725,0.000019746923,0.0010192622,0.995059,0.0024345254],"study_design_scores_gemma":[0.00052170746,0.000021524324,0.0040767337,0.0006742118,0.00005604937,0.000031942793,0.000093514784,0.00032420843,0.00022698418,0.0051199086,0.9887989,0.0000542648],"about_ca_topic_score_codex":0.026493488,"about_ca_topic_score_gemma":0.033946544,"teacher_disagreement_score":0.40188438,"about_ca_system_score_codex":0.0017509384,"about_ca_system_score_gemma":0.0045154244,"threshold_uncertainty_score":0.85313934},"labels":[],"label_agreement":null},{"id":"W4399602664","doi":"10.2967/jnumed.123.267306","title":"Interreader and Intrareader Reproducibility of<sup>18</sup>F-Flotufolastat Image Interpretation in Patients with Newly Diagnosed or Recurrent Prostate Cancer: Data from Two Phase 3 Prospective Multicenter Studies","year":2024,"lang":"en","type":"article","venue":"Journal of Nuclear Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Medicine; Concordance; Nuclear medicine; Prostate cancer; Reproducibility; Prostate; Cancer; Radiology; Internal medicine; Mathematics","score_opus":0.14959149427134702,"score_gpt":0.43813232220661236,"score_spread":0.28854082793526536,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4399602664","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.98330647,0.004914483,0.0090843225,0.00004463272,0.00006670651,0.00030328604,0.0009889,0.00015740862,0.0011337134],"genre_scores_gemma":[0.994156,0.0002084324,0.0041858037,0.00006221547,0.000034071178,0.000196414,0.00091137603,0.000056439625,0.00018923839],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.97796476,0.010025771,0.003129649,0.004697264,0.003846914,0.00033567767],"domain_scores_gemma":[0.93700904,0.030008886,0.012138256,0.009561761,0.010621944,0.0006601649],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.039442375,0.0007405744,0.00091301557,0.0015766916,0.0005167437,0.0010937502,0.0009322038,0.001114287,0.0006902158],"category_scores_gemma":[0.03977818,0.00060672767,0.0016658407,0.00075795606,0.0007555435,0.0010226341,0.0007629443,0.0005239137,0.00028545698],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.015152217,0.00033180116,0.90327543,0.0008662916,0.0062115877,0.00024840247,0.0025324686,0.0014107398,0.032867305,0.00012856287,0.000866178,0.03610895],"study_design_scores_gemma":[0.00038075616,0.0022024007,0.98132974,0.000050133887,0.0014268439,0.0007117275,0.00018749939,0.0017897272,0.010663575,0.00008615077,0.0011108554,0.000060584192],"about_ca_topic_score_codex":0.0013537529,"about_ca_topic_score_gemma":0.002353431,"teacher_disagreement_score":0.039442375,"about_ca_system_score_codex":0.00042693104,"about_ca_system_score_gemma":0.00032341335,"threshold_uncertainty_score":0.20859373},"labels":[],"label_agreement":null},{"id":"W4402268166","doi":"10.1016/j.ajpe.2024.101095","title":"Generalizing AACP Poster Quality: Rater Experience Matters","year":2024,"lang":"en","type":"article","venue":"American Journal of Pharmaceutical Education","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Quality (philosophy); Psychology; Epistemology; Philosophy","score_opus":0.2456494393843736,"score_gpt":0.5436051578080804,"score_spread":0.2979557184237068,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402268166","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.27811012,0.008810091,0.21528703,0.2231636,0.01582704,0.004176217,0.0031370309,0.0030746497,0.24841417],"genre_scores_gemma":[0.8907814,0.0015466007,0.04133125,0.037254322,0.004795973,0.0022155058,0.001164304,0.0014722084,0.019438516],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.79114115,0.14371264,0.017172595,0.008238841,0.03660614,0.0031286667],"domain_scores_gemma":[0.28580827,0.5606091,0.031217072,0.047324173,0.0692047,0.0058366293],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2288839,0.0005421002,0.0010274457,0.0018960156,0.0025993427,0.0055064117,0.001672798,0.0029514947,0.023609381],"category_scores_gemma":[0.66073585,0.00077892246,0.0015434647,0.0021915701,0.0022019374,0.005146843,0.0028293543,0.0035946118,0.0076399567],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002136097,0.0006739555,0.1549021,0.0021693984,0.00092189363,0.0003308726,0.013474765,0.0012899413,0.0041693184,0.016227743,0.24671036,0.5569936],"study_design_scores_gemma":[0.0009256643,0.002110261,0.6592008,0.0046796203,0.0010198178,0.0027953617,0.012721267,0.015464442,0.011267925,0.044219464,0.24512877,0.0004667383],"about_ca_topic_score_codex":0.0036336933,"about_ca_topic_score_gemma":0.0058472212,"teacher_disagreement_score":0.7711161,"about_ca_system_score_codex":0.0023123787,"about_ca_system_score_gemma":0.003285985,"threshold_uncertainty_score":0.95092344},"labels":[],"label_agreement":null},{"id":"W4402813432","doi":"10.1016/j.arthro.2024.09.030","title":"<i>Editorial Commentary</i> : Machine Learning and Artificial Intelligence Are Valuable Tools yet Dependent on the Data Input","year":2024,"lang":"en","type":"editorial","venue":"Arthroscopy The Journal of Arthroscopic and Related Surgery","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Banff Centre; University of Calgary","funders":"","keywords":"Artificial intelligence; Computer science; Machine learning","score_opus":0.12254543520251504,"score_gpt":0.36209277246887484,"score_spread":0.2395473372663598,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402813432","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000043199845,0.0012078411,0.00013048072,0.09949406,0.89773864,0.000028408122,0.00007960746,0.00010054519,0.0011772903],"genre_scores_gemma":[0.00048353802,0.0010113864,0.00012594256,0.07749695,0.91689956,0.000032867058,0.000033380304,0.000042718337,0.0038736165],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9922132,0.0012653309,0.0008144697,0.0008812444,0.0043001724,0.0005255408],"domain_scores_gemma":[0.9561546,0.016906304,0.0019592305,0.0014466154,0.01857236,0.004960904],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009852024,0.0039669005,0.004268315,0.003627899,0.0051367544,0.008023929,0.006023122,0.026672587,0.013666595],"category_scores_gemma":[0.050118253,0.001260933,0.0030163513,0.0021792029,0.0047809565,0.005245284,0.001500675,0.031896293,0.013813288],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000020213449,0.000006872802,0.000021867396,0.000072964634,0.000008543989,0.000075114105,0.00000778172,0.00001197694,0.000021273523,0.000133586,0.9983095,0.0013103251],"study_design_scores_gemma":[0.00014869784,0.00005252884,0.00053962116,0.0007746922,0.00007050532,0.0005381757,0.00009398526,0.00046186888,0.00018415572,0.0021215314,0.99496186,0.000052403648],"about_ca_topic_score_codex":0.004702738,"about_ca_topic_score_gemma":0.0101499725,"teacher_disagreement_score":0.026672587,"about_ca_system_score_codex":0.0053445236,"about_ca_system_score_gemma":0.005603156,"threshold_uncertainty_score":0.052103102},"labels":[],"label_agreement":null},{"id":"W4404100073","doi":"10.1183/13993003.congress-2024.pa2604","title":"A response bias exists away from Borg Category-Ratio 0-10 scale values without associated verbal descriptors for symptom intensity ratings during cardiopulmonary exercise testing","year":2024,"lang":"en","type":"article","venue":"","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"McGill University Health Centre; University of British Columbia; McGill University","funders":"","keywords":"Intensity (physics); Psychology; Scale (ratio); Audiology; Statistics; Medicine; Mathematics; Physics","score_opus":0.16932530804045484,"score_gpt":0.34809937684267045,"score_spread":0.1787740688022156,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4404100073","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.914865,0.0030106702,0.051331263,0.0024674616,0.00094462663,0.0054708035,0.005331311,0.00021177891,0.016367098],"genre_scores_gemma":[0.9733238,0.0003728303,0.013337778,0.0030867686,0.0003849856,0.004452494,0.002104306,0.00011308187,0.00282387],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.911498,0.04989752,0.011156892,0.010038938,0.014852729,0.002555959],"domain_scores_gemma":[0.86292565,0.07339429,0.027708888,0.017036524,0.01755672,0.0013779498],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06777298,0.0006132208,0.0012513787,0.0015400434,0.0014125078,0.0011631936,0.0016241133,0.0013091273,0.00519913],"category_scores_gemma":[0.118366055,0.0005236169,0.0014563237,0.0018402159,0.002073643,0.0010098174,0.0015989435,0.0011076967,0.0014995956],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019188926,0.0006354293,0.9388804,0.0012810123,0.0009536213,0.00038656947,0.0041905413,0.00044742797,0.0032039103,0.0020323393,0.009205587,0.0368643],"study_design_scores_gemma":[0.0002951701,0.0018478435,0.96637905,0.0006172,0.00036001613,0.0012983064,0.0021301932,0.0019121695,0.0027425801,0.004254675,0.018037684,0.00012519749],"about_ca_topic_score_codex":0.0030519643,"about_ca_topic_score_gemma":0.006622287,"teacher_disagreement_score":0.06777298,"about_ca_system_score_codex":0.0009846921,"about_ca_system_score_gemma":0.0011853345,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W4405750238","doi":"10.1016/j.jval.2024.10.2378","title":"MSR144 Group-Based Multivariate Trajectory Methods to Assess Patient-Reported Outcomes in Acute Myeloid Leukaemia: An Evaluation of Published Methods and Results","year":2024,"lang":"en","type":"article","venue":"Value in Health","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Geomechanica (Canada); Luminex (Canada)","funders":"","keywords":"Myeloid leukaemia; Multivariate statistics; Multivariate analysis; Medicine; Trajectory; Oncology; Internal medicine; Computer science; Machine learning; Physics","score_opus":0.40039424581550326,"score_gpt":0.5382868660662405,"score_spread":0.13789262025073729,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4405750238","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.62641466,0.010339154,0.34082347,0.0012105108,0.0009031581,0.006253849,0.0076399823,0.0016854928,0.004729697],"genre_scores_gemma":[0.69061625,0.0019741964,0.29334748,0.00032833935,0.00020930555,0.0074356752,0.0034091962,0.0004538552,0.0022258575],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.8644991,0.11878377,0.004073934,0.0033745058,0.008839806,0.00042902026],"domain_scores_gemma":[0.7698099,0.18390068,0.009625243,0.021060161,0.014682042,0.0009219855],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.14424542,0.0014861037,0.0025793002,0.0025038954,0.00066580955,0.0019668872,0.0026111421,0.0013796206,0.003930444],"category_scores_gemma":[0.22994624,0.00072109984,0.0046916474,0.0027442756,0.0007145212,0.002015557,0.0029318389,0.0018804488,0.0007020135],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.023903707,0.0014605024,0.22002411,0.0032957452,0.034070544,0.00008837405,0.0019371259,0.03375493,0.0010015615,0.0079894755,0.006395227,0.6660787],"study_design_scores_gemma":[0.009750185,0.031549897,0.3562827,0.0031541816,0.02081387,0.00084679533,0.0023415089,0.5193567,0.004738597,0.03030183,0.019844556,0.0010192719],"about_ca_topic_score_codex":0.004499315,"about_ca_topic_score_gemma":0.004509947,"teacher_disagreement_score":0.8557546,"about_ca_system_score_codex":0.0012618202,"about_ca_system_score_gemma":0.00255684,"threshold_uncertainty_score":0.7628518},"labels":[],"label_agreement":null},{"id":"W4408051986","doi":"10.1016/j.bjpt.2025.101193","title":"Considerations when designing, analyzing, and reporting reliability studies","year":2025,"lang":"en","type":"review","venue":"Brazilian Journal of Physical Therapy","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Reliability (semiconductor); Reliability engineering; Computer science; Engineering; Physics; Thermodynamics","score_opus":0.3977318700523943,"score_gpt":0.5038276533868976,"score_spread":0.10609578333450331,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4408051986","genre_codex":"methods","genre_gemma":"review","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011926609,0.22064482,0.5247541,0.14440498,0.032180026,0.043655094,0.0027398388,0.0019306757,0.017763844],"genre_scores_gemma":[0.07268586,0.0633381,0.7594403,0.020040533,0.008857641,0.07153667,0.0009159719,0.000944175,0.002240775],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.17472593,0.62978435,0.14170067,0.0066141146,0.04554753,0.0016273458],"domain_scores_gemma":[0.06075591,0.76677716,0.045599483,0.034862228,0.09021649,0.001788746],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.6041187,0.0018889048,0.0049996767,0.014085337,0.0034474093,0.009873169,0.006251598,0.006632502,0.0047812425],"category_scores_gemma":[0.8431935,0.0030540961,0.0031712097,0.013752737,0.0140022505,0.008692607,0.0051476634,0.008827311,0.0033024615],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013400725,0.00021354228,0.008731677,0.0969701,0.0017718927,0.00092330493,0.05144461,0.0020777711,0.0029362503,0.07253116,0.14743559,0.613624],"study_design_scores_gemma":[0.0009323575,0.00075587607,0.015725223,0.2213572,0.0024452822,0.0022245056,0.017567394,0.005237306,0.0056544007,0.12604143,0.6013978,0.00066120096],"about_ca_topic_score_codex":0.003905749,"about_ca_topic_score_gemma":0.006030109,"teacher_disagreement_score":0.3958813,"about_ca_system_score_codex":0.006046522,"about_ca_system_score_gemma":0.026617764,"threshold_uncertainty_score":0.48819214},"labels":[],"label_agreement":null},{"id":"W4409833882","doi":"10.5271/sjweh.4232","title":"Response to Drs. Igor Burstyn and George Luta’s letter: Advice on better utilization of validation data to adjust odds ratios for differential exposure misclassification (recall bias)","year":2025,"lang":"en","type":"letter","venue":"Scandinavian Journal of Work Environment & Health","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"George (robot); Odds ratio; Odds; Medicine; Recall bias; Recall; Psychology; Logistic regression; Computer science; Internal medicine; Artificial intelligence; Cognitive psychology","score_opus":0.26826089703379796,"score_gpt":0.3820638494250824,"score_spread":0.11380295239128446,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4409833882","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00018508422,0.001366962,0.00029647257,0.96559304,0.031900525,0.000028967923,0.00012831541,0.00009242865,0.00040816114],"genre_scores_gemma":[0.001495087,0.0009920802,0.00090013177,0.97151685,0.022306256,0.00009555648,0.000049855393,0.00007107313,0.0025730836],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99283916,0.0024797989,0.0013549556,0.00094087777,0.0019171349,0.00046808601],"domain_scores_gemma":[0.9450172,0.026628563,0.0038156041,0.0015986945,0.018856691,0.004083118],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.014567984,0.0013589348,0.0024417033,0.0016062235,0.002300815,0.003258721,0.0029246828,0.02268772,0.009846373],"category_scores_gemma":[0.09744545,0.0011118498,0.0017495448,0.0011590106,0.0029712713,0.004578934,0.002187683,0.03910195,0.009980153],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00003459374,0.000010720618,0.00030504525,0.00005874624,0.000009689095,0.00017237474,0.00006653978,0.000022059905,0.00005912709,0.0002521249,0.99553585,0.0034731857],"study_design_scores_gemma":[0.00010712025,0.00009528199,0.0026766213,0.0011453714,0.000041538773,0.0027361654,0.00096414716,0.00051311514,0.00044465662,0.0032836944,0.98780614,0.00018607796],"about_ca_topic_score_codex":0.0072083035,"about_ca_topic_score_gemma":0.007425989,"teacher_disagreement_score":0.985432,"about_ca_system_score_codex":0.0034003686,"about_ca_system_score_gemma":0.0036418422,"threshold_uncertainty_score":0.07704377},"labels":[],"label_agreement":null},{"id":"W4411404656","doi":"10.1017/9781009403092.013","title":"Interpreting and Reporting Your Results","year":2025,"lang":"en","type":"book-chapter","venue":"Cambridge University Press eBooks","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science","score_opus":0.1805581086359696,"score_gpt":0.32449987844030603,"score_spread":0.14394176980433643,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4411404656","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00435291,0.014857457,0.40214327,0.34383804,0.07017197,0.005396784,0.0057125096,0.01356133,0.13996577],"genre_scores_gemma":[0.020718606,0.020723734,0.7537832,0.06454779,0.024759093,0.008407871,0.0040416922,0.015906988,0.08711098],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.8553488,0.07947597,0.013855928,0.0049004,0.044302545,0.0021163349],"domain_scores_gemma":[0.56918,0.1924211,0.026431892,0.042671196,0.16158548,0.0077103367],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1362737,0.0021126592,0.0033892794,0.0062008365,0.0029836514,0.02056577,0.003956681,0.005692726,0.04691384],"category_scores_gemma":[0.510221,0.0017669946,0.0023027817,0.0041040806,0.0046052397,0.011342465,0.005624043,0.011190356,0.11466644],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00007748588,0.000067411034,0.0009097098,0.0019499585,0.00010319815,0.0002518151,0.0050025973,0.00038092321,0.0017093339,0.01809866,0.7944478,0.17700109],"study_design_scores_gemma":[0.0000419383,0.00009459544,0.0011684995,0.00649298,0.00008260224,0.00054745376,0.0044305692,0.0010417782,0.0023284405,0.04039883,0.9431945,0.0001778816],"about_ca_topic_score_codex":0.0015946621,"about_ca_topic_score_gemma":0.0014759023,"teacher_disagreement_score":0.1362737,"about_ca_system_score_codex":0.0024857505,"about_ca_system_score_gemma":0.011015732,"threshold_uncertainty_score":0.7206928},"labels":[],"label_agreement":null},{"id":"W4413408707","doi":"10.1093/annweh/wxaf046","title":"Comments on systematic review and meta-analysis of the epidemiology of man-made vitreous fibers and respiratory health outcomes","year":2025,"lang":"en","type":"article","venue":"Annals of Work Exposures and Health","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Stantec (Canada)","funders":"","keywords":"Epidemiology; Meta-analysis; Medicine; Environmental health; MEDLINE; Pathology; Biology","score_opus":0.6186994924523128,"score_gpt":0.5419520592477997,"score_spread":0.07674743320451316,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4413408707","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0006073295,0.0720056,0.0018730208,0.66667634,0.25457898,0.00046452484,0.0014589278,0.000147389,0.0021878118],"genre_scores_gemma":[0.0066446536,0.017250862,0.0039520888,0.8460393,0.12329639,0.00063697697,0.00022083145,0.00016740667,0.0017915039],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.8113657,0.076084144,0.06063381,0.0122754,0.036223084,0.0034178926],"domain_scores_gemma":[0.45955724,0.40714258,0.035830647,0.013202854,0.07955578,0.004710901],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.17225479,0.003309721,0.006598243,0.0066479016,0.00305085,0.0057804543,0.011880171,0.037191454,0.0083284145],"category_scores_gemma":[0.5323767,0.0040216628,0.016504167,0.0060670264,0.007957021,0.008067587,0.0053002257,0.03220544,0.003817313],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013865175,0.00003409686,0.0014297917,0.02978101,0.0091097085,0.00083420373,0.0008658238,0.00031982717,0.00045265642,0.0038386108,0.9234231,0.028524658],"study_design_scores_gemma":[0.005992244,0.00051398476,0.0069638966,0.09169956,0.02656173,0.0017285143,0.0013280561,0.0012189032,0.0014754568,0.021291919,0.84058064,0.000645222],"about_ca_topic_score_codex":0.022923347,"about_ca_topic_score_gemma":0.0243572,"teacher_disagreement_score":0.8277452,"about_ca_system_score_codex":0.009499679,"about_ca_system_score_gemma":0.014167497,"threshold_uncertainty_score":0.9109813},"labels":[],"label_agreement":null},{"id":"W4414740488","doi":"10.1093/clinchem/hvaf086.543","title":"B-149 Establishing Pediatric Reference Intervals in a US Population using Refine R","year":2025,"lang":"en","type":"article","venue":"Clinical Chemistry","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Guideline; Calipers; Reference values; Outlier; Population; Confidence interval; Retrospective cohort study","score_opus":0.3851078962279259,"score_gpt":0.5191318721576088,"score_spread":0.1340239759296829,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4414740488","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7147512,0.010925397,0.17428,0.0013726662,0.00061231793,0.0017312507,0.05629215,0.0039770436,0.036057964],"genre_scores_gemma":[0.82237273,0.0016216333,0.14361082,0.0007273144,0.00020585496,0.0013037798,0.026410187,0.00048626275,0.0032613694],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9913167,0.0040721977,0.0013792269,0.001287218,0.0017190771,0.00022560611],"domain_scores_gemma":[0.9784176,0.0069925506,0.0049336054,0.0027329414,0.0065798187,0.00034354394],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009487411,0.00073308265,0.0007245451,0.0032414924,0.00046077342,0.0017093769,0.0012083321,0.0005817278,0.0053864573],"category_scores_gemma":[0.027133461,0.00032574654,0.0007835985,0.0030232626,0.00055889745,0.0005699731,0.0013151823,0.00085038337,0.0025889508],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011143993,0.00018682043,0.8041111,0.00069231953,0.00036987851,0.00034886194,0.00059380237,0.0033630482,0.0058028405,0.0023606822,0.021166904,0.15988934],"study_design_scores_gemma":[0.00026344307,0.0016523252,0.8836661,0.00071907544,0.00044477137,0.003379608,0.0008258046,0.021383664,0.015321026,0.0022276787,0.070004016,0.00011258657],"about_ca_topic_score_codex":0.012526079,"about_ca_topic_score_gemma":0.00800324,"teacher_disagreement_score":0.012526079,"about_ca_system_score_codex":0.0010767427,"about_ca_system_score_gemma":0.0015604048,"threshold_uncertainty_score":0.050174773},"labels":[],"label_agreement":null},{"id":"W4415900298","doi":"10.1136/jitc-2025-sitc2025.0097","title":"97 Statistical and systematic uncertainties affect biomarker reliability: a case study in multiplex immunofluorescence","year":2025,"lang":"","type":"article","venue":"Regular and Young Investigator Award Abstracts","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University","funders":"","keywords":"Multiplex; Biomarker; Immunofluorescence; Affect (linguistics)","score_opus":0.06942844363114892,"score_gpt":0.3442540651931056,"score_spread":0.27482562156195667,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4415900298","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8545428,0.0014111073,0.13434702,0.0036661457,0.00008733787,0.00020151441,0.0002238051,0.00032271762,0.005197569],"genre_scores_gemma":[0.9847878,0.00012937743,0.0144543415,0.00017504847,0.000025063191,0.000029369936,0.000046754503,0.00005953203,0.00029278782],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.96168435,0.02369821,0.0019281793,0.002891989,0.0086306,0.0011667899],"domain_scores_gemma":[0.39443314,0.5604943,0.0154414065,0.012168824,0.016446892,0.00101539],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0695259,0.0005897869,0.0010473003,0.001678359,0.0018112693,0.0030892233,0.001995228,0.003145894,0.001317838],"category_scores_gemma":[0.25462022,0.00067639345,0.0015363591,0.002093664,0.002837423,0.0019390464,0.0014597825,0.0023452265,0.0002976884],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0025687376,0.0007804587,0.6043283,0.00077455613,0.001518563,0.023544421,0.009267254,0.14717335,0.012116229,0.018979447,0.0044218716,0.17452686],"study_design_scores_gemma":[0.0003366755,0.0031603237,0.25903326,0.00061531324,0.0020149157,0.030422173,0.010304481,0.54597175,0.04559229,0.088812165,0.012975884,0.00076084957],"about_ca_topic_score_codex":0.0076374887,"about_ca_topic_score_gemma":0.005959797,"teacher_disagreement_score":0.9304741,"about_ca_system_score_codex":0.0026653998,"about_ca_system_score_gemma":0.002424189,"threshold_uncertainty_score":0.36769247},"labels":[],"label_agreement":null},{"id":"W4416459542","doi":"10.1038/s44400-025-00033-z","title":"Author Correction: High inter-rater reliability in consensus diagnoses and overall assessment in the Asian Cohort for Alzheimer’s Disease Study","year":2025,"lang":"en","type":"article","venue":"npj Dementia","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Canada Research Chairs; University of British Columbia; University of British Columbia Hospital","funders":"","keywords":"Medical diagnosis; Reliability (semiconductor); Disease; Cohort; Cohort study","score_opus":0.09375029666554337,"score_gpt":0.4100491476965076,"score_spread":0.3162988510309642,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4416459542","genre_codex":"editorial","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0012698219,0.0022775002,0.006305206,0.059490673,0.9206486,0.0001535722,0.005787014,0.0009702323,0.0030974622],"genre_scores_gemma":[0.21443409,0.010166381,0.056588437,0.12651095,0.39476374,0.004632099,0.017699063,0.009973378,0.16523191],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9560296,0.015385533,0.010529983,0.0058892975,0.010454517,0.0017110498],"domain_scores_gemma":[0.7414866,0.12676954,0.014340809,0.017714424,0.09621698,0.003471607],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.032715984,0.003450448,0.0033764169,0.006493967,0.0037191743,0.0045832763,0.006334046,0.004722803,0.08762613],"category_scores_gemma":[0.4101468,0.0019326452,0.0027910261,0.008199966,0.0030383393,0.0036267927,0.0031673608,0.00915541,0.02306223],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017933593,0.0000074108784,0.0010656756,0.00065914285,0.00011121986,0.0002718565,0.00021962074,0.00007927306,0.00006504284,0.001252351,0.98569566,0.01039348],"study_design_scores_gemma":[0.0014927525,0.0001689705,0.033699274,0.008918827,0.0014275705,0.0056407037,0.0016139363,0.0071051475,0.0022066575,0.025608022,0.91154075,0.0005773434],"about_ca_topic_score_codex":0.01560903,"about_ca_topic_score_gemma":0.021835329,"teacher_disagreement_score":0.08762613,"about_ca_system_score_codex":0.006046694,"about_ca_system_score_gemma":0.007547184,"threshold_uncertainty_score":0.29313862},"labels":[],"label_agreement":null},{"id":"W6045406","doi":"10.3138/cjpe.24.004","title":"Interrater Reliability in Content Analysis of Healthcare Service Quality Using Montreal’s Conceptual Framework","year":2009,"lang":"en","type":"article","venue":"Canadian Journal of Program Evaluation","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":true,"ca_institutions":"Université de Montréal","funders":"Universitetet i Bergen; Thomas Jefferson University","keywords":"Inter-rater reliability; Generalizability theory; Kappa; Reliability (semiconductor); Psychology; Cohen's kappa; Statistics; Content analysis; Service (business); Service quality; Health care; Applied psychology; Mathematics; Business; Sociology; Power (physics); Rating scale; Marketing; Political science","score_opus":0.6590834155962562,"score_gpt":0.5276751899838836,"score_spread":0.13140822561237253,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6045406","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.67563134,0.00080713123,0.29730222,0.000518628,0.00018770953,0.0042506773,0.00052053394,0.00033379783,0.020448003],"genre_scores_gemma":[0.9299256,0.00008774073,0.06729871,0.000031837768,0.000022387982,0.0022022799,0.00015068622,0.000031557272,0.00024907297],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.725482,0.20635486,0.01678991,0.00764047,0.04138356,0.0023492961],"domain_scores_gemma":[0.58672535,0.3049687,0.018253576,0.018208098,0.070567995,0.0012763013],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.18311888,0.00083472783,0.0010368351,0.012833145,0.0024151178,0.0031103804,0.0019238024,0.000720951,0.0011236977],"category_scores_gemma":[0.37690362,0.0006913517,0.0015748289,0.008886381,0.0057435874,0.0033359162,0.005726599,0.0012290066,0.00019431874],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013926327,0.0003597905,0.49420774,0.0022753451,0.0016368992,0.00026529594,0.14092636,0.013194446,0.0066573946,0.056221362,0.0035010665,0.27936167],"study_design_scores_gemma":[0.00042709275,0.0018722194,0.6256357,0.002235966,0.0009629348,0.00065453624,0.06804198,0.18889344,0.019407667,0.07249421,0.018590834,0.0007835984],"about_ca_topic_score_codex":0.014968796,"about_ca_topic_score_gemma":0.016480908,"teacher_disagreement_score":0.8168811,"about_ca_system_score_codex":0.007209409,"about_ca_system_score_gemma":0.0075561716,"threshold_uncertainty_score":0.9684368},"labels":[],"label_agreement":null},{"id":"W6885476515","doi":"10.1371/journal.pmed.1003703.s003","title":"Quality assessment tool used in review for observational studies (adapted from Newcastle–Ottawa Scale).","year":2021,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Observational study; Quality assessment; Quality (philosophy); Risk assessment; Quality assurance","score_opus":0.8039214516836924,"score_gpt":0.5491709356804731,"score_spread":0.2547505160032193,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6885476515","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.043178763,0.16100787,0.19375253,0.0069441386,0.003689964,0.14430645,0.42351428,0.004615425,0.018990671],"genre_scores_gemma":[0.23814632,0.02472878,0.3685716,0.0022222272,0.000496613,0.29208106,0.069671065,0.000954066,0.003128217],"study_design_codex":"systematic_review","study_design_gemma":"not_applicable","domain_scores_codex":[0.79864746,0.06567477,0.11007752,0.0065530865,0.01794233,0.0011048606],"domain_scores_gemma":[0.6071998,0.25926256,0.061009992,0.016279427,0.054475002,0.0017732844],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.11484532,0.0015026955,0.0065070367,0.019337777,0.0017108431,0.0036972573,0.0030499988,0.0013572864,0.013765282],"category_scores_gemma":[0.31516075,0.0013385421,0.014694711,0.021778215,0.0019505881,0.0043756133,0.0039234255,0.002703321,0.0012526427],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0041511483,0.00025051174,0.061912306,0.44417405,0.038669158,0.0004218001,0.005488254,0.0028040872,0.0015512054,0.010377564,0.152262,0.27793792],"study_design_scores_gemma":[0.0072621657,0.0017630073,0.29657242,0.19181333,0.045352433,0.0026953246,0.004971091,0.0062472215,0.00390354,0.033588417,0.4042525,0.0015784773],"about_ca_topic_score_codex":0.007557159,"about_ca_topic_score_gemma":0.013694823,"teacher_disagreement_score":0.88515466,"about_ca_system_score_codex":0.004927647,"about_ca_system_score_gemma":0.011326002,"threshold_uncertainty_score":0.6073674},"labels":[],"label_agreement":null},{"id":"W6885830477","doi":"10.1371/journal.pone.0233732.s001","title":"Agreement test for Newcastle–Ottawa scale scores evaluated by reviewers.","year":2020,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Scale (ratio); Measure (data warehouse); Test (biology); Level of measurement; Reliability (semiconductor)","score_opus":0.3904297146738943,"score_gpt":0.41125903525499835,"score_spread":0.02082932058110404,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6885830477","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.34574524,0.023239627,0.43184277,0.002752042,0.005447585,0.029791012,0.06692288,0.0052034217,0.0890554],"genre_scores_gemma":[0.7883096,0.0016305973,0.15981379,0.00055446586,0.00040123286,0.02592141,0.0142508,0.0013183958,0.007799625],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.84760314,0.07188307,0.037578292,0.0111851655,0.030267889,0.0014824537],"domain_scores_gemma":[0.60080993,0.26322722,0.033322696,0.025066761,0.07575756,0.0018158023],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.11068995,0.0009452438,0.0027917323,0.008157984,0.0020843926,0.0019304289,0.0027970115,0.0016000643,0.01085415],"category_scores_gemma":[0.37384412,0.00108878,0.004388799,0.0045566717,0.0015201421,0.003426628,0.0042626285,0.0019492111,0.0028518059],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.01388974,0.0007111936,0.43958157,0.020781765,0.023531066,0.00050100795,0.018045349,0.0058347047,0.0058274087,0.015962768,0.11344368,0.34188983],"study_design_scores_gemma":[0.0033163317,0.0038029181,0.67786014,0.008358249,0.012266292,0.0034683566,0.009063467,0.039686013,0.0142518645,0.04491487,0.18114531,0.0018661323],"about_ca_topic_score_codex":0.004518913,"about_ca_topic_score_gemma":0.010069661,"teacher_disagreement_score":0.88931006,"about_ca_system_score_codex":0.0018947871,"about_ca_system_score_gemma":0.0048169545,"threshold_uncertainty_score":0.5853914},"labels":[],"label_agreement":null},{"id":"W6885846436","doi":"10.1371/journal.pone.0262885.s003","title":"Newcastle-Ottawa quality assessment form for cohort studies.","year":2022,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Cohort; Quality assessment; Quality (philosophy); Risk assessment; Cohort study; Population","score_opus":0.6777878290963861,"score_gpt":0.5391566899403626,"score_spread":0.13863113915602354,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6885846436","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.025853988,0.07006409,0.16646662,0.0064623854,0.0023297204,0.06962836,0.6220782,0.0032445714,0.03387209],"genre_scores_gemma":[0.20394368,0.023388188,0.26656142,0.0022372336,0.0004722194,0.20395093,0.28556344,0.0011216452,0.0127611775],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9085293,0.035924293,0.03684141,0.004450653,0.0133413505,0.0009130262],"domain_scores_gemma":[0.596886,0.22414798,0.068317056,0.028328052,0.07849607,0.0038248522],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.085782886,0.0009465291,0.0049892315,0.008683428,0.0015858014,0.0024056209,0.0043441015,0.0015070811,0.020539872],"category_scores_gemma":[0.2725606,0.0013825374,0.008339717,0.009978477,0.00127479,0.0022573778,0.0028554706,0.004160197,0.003386732],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0055133007,0.0004711058,0.113837086,0.08761635,0.018642617,0.00018272793,0.0023423203,0.004092974,0.0007696274,0.014011583,0.5304528,0.2220675],"study_design_scores_gemma":[0.008190659,0.0013500626,0.57377553,0.031686507,0.011910442,0.00067271193,0.0013256689,0.0059572067,0.0015046657,0.017192429,0.34539458,0.0010395474],"about_ca_topic_score_codex":0.037143707,"about_ca_topic_score_gemma":0.055737313,"teacher_disagreement_score":0.9142171,"about_ca_system_score_codex":0.00654698,"about_ca_system_score_gemma":0.014476628,"threshold_uncertainty_score":0.45366865},"labels":[],"label_agreement":null},{"id":"W6885849940","doi":"10.1371/journal.pone.0299125.s009","title":"Author’s judgements about study quality using the adapted Ottawa-Newcastle risk of bias assessment tool.","year":2024,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Quality (philosophy); Risk assessment; Quality assessment; Response bias; Data collection; Risk perception","score_opus":0.6038026136552229,"score_gpt":0.5165250097033885,"score_spread":0.08727760395183437,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6885849940","genre_codex":"protocol","genre_gemma":"dataset","domain_codex":null,"domain_gemma":"evaluation","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":null,"domain_candidate":"evaluation","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.019714626,0.0915332,0.19119862,0.08526934,0.12621887,0.28101972,0.16350557,0.0073126536,0.03422737],"genre_scores_gemma":[0.18759881,0.02100904,0.31275165,0.019097704,0.012696244,0.38305944,0.024610918,0.005073568,0.03410263],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.70410186,0.08664309,0.13495421,0.019749165,0.051571816,0.0029799158],"domain_scores_gemma":[0.40666103,0.2191031,0.10286941,0.048214763,0.21512805,0.008023633],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.17668894,0.0032064815,0.016726632,0.017983465,0.003916077,0.009004757,0.009038203,0.007811589,0.040407702],"category_scores_gemma":[0.61765844,0.0035209316,0.013892388,0.012061117,0.009743279,0.0075494302,0.0048981765,0.017663259,0.009498974],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005180374,0.00024529806,0.0043172953,0.13791431,0.0109021,0.0007675337,0.013678307,0.0018259105,0.0026562647,0.014863083,0.7404547,0.06719482],"study_design_scores_gemma":[0.023995116,0.00079811364,0.016081592,0.21099913,0.014945925,0.0013684651,0.009391575,0.023235781,0.0067444607,0.14069222,0.54849553,0.0032522066],"about_ca_topic_score_codex":0.012942261,"about_ca_topic_score_gemma":0.02393481,"teacher_disagreement_score":0.8233111,"about_ca_system_score_codex":0.012780805,"about_ca_system_score_gemma":0.030208843,"threshold_uncertainty_score":0.9344316},"labels":[],"label_agreement":null},{"id":"W6885928307","doi":"10.1371/journal.pone.0304473.s004","title":"Methodological quality score of the included studies based on the Newcastle—Ottawa Scale (NOS) tool.","year":2024,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Scale (ratio); Quality (philosophy); Quality Score; Data quality; Measure (data warehouse)","score_opus":0.8708561416807558,"score_gpt":0.550798302728561,"score_spread":0.32005783895219475,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6885928307","genre_codex":"review","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.024609342,0.47049865,0.12471896,0.016138239,0.010127267,0.1662213,0.16546966,0.0015047535,0.020711862],"genre_scores_gemma":[0.3408556,0.06445739,0.14163823,0.0061085992,0.002332217,0.3929959,0.0439067,0.0009600071,0.0067453696],"study_design_codex":"systematic_review","study_design_gemma":"not_applicable","domain_scores_codex":[0.7250739,0.06353557,0.16507398,0.012376775,0.03242127,0.0015185318],"domain_scores_gemma":[0.5716558,0.25560486,0.08880314,0.023367468,0.057665642,0.002903056],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.16872495,0.002011997,0.010421735,0.023475848,0.00243911,0.0051688296,0.0041216034,0.0033621453,0.009880004],"category_scores_gemma":[0.47325897,0.0013413427,0.021850763,0.014266603,0.0033591397,0.0048211575,0.0040325737,0.0047815125,0.0009426829],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.004251772,0.0001445133,0.0342255,0.7011559,0.11708564,0.0002892393,0.0030271376,0.0018086563,0.0014467526,0.0061813854,0.051543146,0.07884036],"study_design_scores_gemma":[0.008897621,0.00090801815,0.10563437,0.34833172,0.3343263,0.0010771657,0.0020192938,0.005425596,0.004045171,0.027497398,0.1608985,0.00093879155],"about_ca_topic_score_codex":0.013403414,"about_ca_topic_score_gemma":0.020396696,"teacher_disagreement_score":0.83127505,"about_ca_system_score_codex":0.009196839,"about_ca_system_score_gemma":0.014693379,"threshold_uncertainty_score":0.8923135},"labels":[],"label_agreement":null},{"id":"W6885947014","doi":"10.1371/journal.pone.0300564.s002","title":"Correlation matrix: Test of multicollinearity.","year":2024,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Medical diagnosis; Retrospective cohort study; Neurocognitive; Bacteriuria; Antibiotics; Incidence (geometry); Urinary system; Presentation (obstetrics); Clinical diagnosis","score_opus":0.2097736899081875,"score_gpt":0.4081235560669805,"score_spread":0.19834986615879296,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6885947014","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.26701215,0.005839833,0.6416575,0.0040443586,0.0044092517,0.0121379495,0.036037948,0.0065086046,0.022352476],"genre_scores_gemma":[0.6996427,0.0009133749,0.27239746,0.00045589329,0.00039644632,0.0149377985,0.006945539,0.0009914879,0.0033192828],"study_design_codex":"observational","study_design_gemma":"not_applicable","domain_scores_codex":[0.8653453,0.08260222,0.009042322,0.023267683,0.01758852,0.0021539303],"domain_scores_gemma":[0.61793435,0.32492682,0.012864334,0.025107773,0.016768256,0.0023985151],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05989938,0.0029043343,0.004358304,0.0074574524,0.0024693555,0.0030586978,0.0052428166,0.0017380012,0.01874803],"category_scores_gemma":[0.28842816,0.0017130327,0.005874507,0.011261745,0.0033929439,0.003850404,0.0039159544,0.0053498414,0.0029617825],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005001658,0.001423386,0.5230593,0.005557756,0.034774173,0.0031178861,0.007860174,0.017925417,0.001938112,0.032855093,0.10117701,0.26530996],"study_design_scores_gemma":[0.0022030016,0.0063555846,0.41480774,0.0028211803,0.00706328,0.0046038143,0.008566922,0.3432013,0.0027485336,0.10171907,0.10501628,0.0008932872],"about_ca_topic_score_codex":0.007612419,"about_ca_topic_score_gemma":0.004535019,"teacher_disagreement_score":0.05989938,"about_ca_system_score_codex":0.001993699,"about_ca_system_score_gemma":0.0076399567,"threshold_uncertainty_score":0.31678194},"labels":[],"label_agreement":null},{"id":"W6885993894","doi":"10.1371/journal.pone.0305355.s004","title":"Quality assessment of included studies by Newcastle-Ottawa scale.","year":2024,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Quality assessment; Quality (philosophy); Risk assessment; Quality assurance; Work (physics)","score_opus":0.5664514499662818,"score_gpt":0.5443827685831959,"score_spread":0.02206868138308593,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6885993894","genre_codex":"review","genre_gemma":"dataset","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.052446615,0.5736299,0.07173468,0.0062154736,0.0036160478,0.11201615,0.16458946,0.001379901,0.014371764],"genre_scores_gemma":[0.46439216,0.08078648,0.104222156,0.003017379,0.0010277772,0.2962812,0.045608494,0.0007322996,0.0039321645],"study_design_codex":"systematic_review","study_design_gemma":"not_applicable","domain_scores_codex":[0.6711479,0.072457686,0.2158969,0.011585654,0.027231848,0.0016800839],"domain_scores_gemma":[0.44259998,0.3844053,0.09028661,0.028825058,0.05165774,0.0022253413],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.19526564,0.0017530691,0.011574973,0.025972914,0.0023993237,0.0050235614,0.004091206,0.0021692312,0.0090441285],"category_scores_gemma":[0.4804423,0.0012530426,0.021733675,0.01940952,0.0030623698,0.004702711,0.004176586,0.0031275174,0.00067764777],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00544783,0.00010383924,0.043364182,0.7725426,0.073107794,0.00032465626,0.003991671,0.0014059903,0.0011414046,0.0032248772,0.021440985,0.0739042],"study_design_scores_gemma":[0.009094937,0.001885908,0.19554397,0.3732927,0.23004505,0.001367512,0.0040490595,0.004733607,0.0035623845,0.019385122,0.15592276,0.0011170503],"about_ca_topic_score_codex":0.009780536,"about_ca_topic_score_gemma":0.017027933,"teacher_disagreement_score":0.80473435,"about_ca_system_score_codex":0.0066154245,"about_ca_system_score_gemma":0.011924788,"threshold_uncertainty_score":0.99238074},"labels":[],"label_agreement":null},{"id":"W6887749040","doi":"10.17605/osf.io/qrf2w","title":"Assessing the validity and reliability of a baseball pitch discrimination online task","year":2023,"lang":"en","type":"article","venue":"OSF Preprints (OSF Preprints)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Reliability (semiconductor); Task (project management); Action (physics); Validity; Task analysis","score_opus":0.1459806906473429,"score_gpt":0.3918010649520061,"score_spread":0.24582037430466322,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6887749040","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.975267,0.00020387206,0.018777555,0.00010793727,0.00011730892,0.00027537078,0.0003126964,0.00010556418,0.0048326105],"genre_scores_gemma":[0.99340457,0.000044741453,0.0051653315,0.00006475929,0.00004045779,0.0002182633,0.00033068605,0.00006064017,0.00067055755],"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.97598505,0.009503819,0.0028183428,0.0036851943,0.007087141,0.0009204927],"domain_scores_gemma":[0.7154153,0.19049257,0.016248275,0.027562872,0.047748137,0.0025328137],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.030821096,0.0005764804,0.0006769639,0.001864635,0.0008203498,0.001662223,0.00097153493,0.0017214221,0.0015054919],"category_scores_gemma":[0.12785669,0.00067436724,0.001312837,0.00090671645,0.0015498638,0.0017869446,0.0019967572,0.0012444289,0.0012723076],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0036640908,0.0011332156,0.89164335,0.00018970034,0.0010167969,0.00013169316,0.006204398,0.0029624845,0.014484763,0.0018518855,0.0014822808,0.075235486],"study_design_scores_gemma":[0.00030598318,0.0019834226,0.9541172,0.00010560417,0.000342987,0.00045378355,0.0013856766,0.024927668,0.010396615,0.0023850766,0.0034600708,0.00013582427],"about_ca_topic_score_codex":0.003329142,"about_ca_topic_score_gemma":0.00339855,"teacher_disagreement_score":0.030821096,"about_ca_system_score_codex":0.00055263535,"about_ca_system_score_gemma":0.0011223401,"threshold_uncertainty_score":0.16299951},"labels":[],"label_agreement":null},{"id":"W6901989955","doi":"10.6084/m9.figshare.12233456","title":"NOS","year":2020,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Scale (ratio); Field (mathematics); Process (computing)","score_opus":0.5584769089976009,"score_gpt":0.40391553303996286,"score_spread":0.15456137595763808,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6901989955","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02470184,0.007851046,0.030773357,0.015772833,0.015190698,0.022572422,0.24084549,0.0024368025,0.63985556],"genre_scores_gemma":[0.15255743,0.007895074,0.057745356,0.01612207,0.0035012232,0.05372135,0.24640822,0.0020709804,0.45997837],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9838336,0.00494383,0.0050069364,0.0017910925,0.0038246685,0.0005998479],"domain_scores_gemma":[0.9642999,0.0069104806,0.0035797958,0.0068139536,0.016869629,0.0015261986],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.012691714,0.0005752271,0.0012770086,0.0028230571,0.0016660928,0.0023543236,0.0022620147,0.0012578556,0.26102996],"category_scores_gemma":[0.06366574,0.00044961664,0.001103292,0.0020047764,0.00079366326,0.003121523,0.0023892894,0.0018308357,0.1015731],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000828433,0.00017402416,0.014536106,0.0035803718,0.00013501517,0.0005456443,0.0010708151,0.00018046946,0.00067723857,0.018787649,0.79849344,0.1609909],"study_design_scores_gemma":[0.00025539094,0.00012453503,0.014769424,0.0020804321,0.00006019744,0.0007301594,0.0005405301,0.00026563898,0.000351602,0.007868291,0.9728852,0.00006858209],"about_ca_topic_score_codex":0.004776872,"about_ca_topic_score_gemma":0.00817984,"teacher_disagreement_score":0.73897004,"about_ca_system_score_codex":0.0016647531,"about_ca_system_score_gemma":0.00635617,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W6902034213","doi":"10.6084/m9.figshare.26579069.v1","title":"Additional file 1 of Improving social justice in observational studies: protocol for the development of a global and Indigenous STROBE-equity reporting guideline","year":2024,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Canadian Agency for Drugs and Technologies in Health; Ottawa Hospital; Carleton University; Hospital for Sick Children; Western University; Royal College of Physicians and Surgeons of Canada; University of Toronto; Dalhousie University; SickKids Foundation; Bruyère; Canadian Council on Animal Care; McMaster University; Queen's University; University of Ottawa","funders":"","keywords":"Guideline; Indigenous; Observational study; Protocol (science); Coding (social sciences); Social justice; Context (archaeology)","score_opus":0.6703220811909395,"score_gpt":0.5374888847959403,"score_spread":0.13283319639499924,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6902034213","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":"reporting","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":"reporting","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0006760915,0.0002308025,0.009507764,0.0018252941,0.00040361605,0.08329371,0.8959976,0.0011618795,0.0069032237],"genre_scores_gemma":[0.005932141,0.00056142797,0.04335274,0.0028418184,0.00034647554,0.79027134,0.14081442,0.0009474454,0.014932271],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9821409,0.009348055,0.0048948233,0.0012110106,0.0017428279,0.0006623649],"domain_scores_gemma":[0.68725723,0.2525225,0.015094617,0.014597265,0.02821301,0.00231539],"candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.043192133,0.0015281825,0.0023628136,0.005225157,0.002190191,0.0030470586,0.0024800438,0.0026834921,0.7659842],"category_scores_gemma":[0.27161548,0.0020476943,0.0023141825,0.0060423305,0.0012170086,0.002805795,0.0022122914,0.0032001962,0.09533802],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011741035,0.0001673418,0.00075258804,0.017656196,0.00010012973,0.000054259217,0.00044825205,0.00035097208,0.00012927361,0.0038015079,0.9500785,0.025286788],"study_design_scores_gemma":[0.025144646,0.00073417684,0.016087623,0.048458263,0.0006492708,0.00049562706,0.0012339144,0.002377413,0.0012795116,0.039694186,0.863428,0.00041735088],"about_ca_topic_score_codex":0.0043133115,"about_ca_topic_score_gemma":0.008958997,"teacher_disagreement_score":0.95680785,"about_ca_system_score_codex":0.0040318533,"about_ca_system_score_gemma":0.013059737,"threshold_uncertainty_score":0.33379513},"labels":[],"label_agreement":null},{"id":"W6902157991","doi":"10.6084/m9.figshare.13290662","title":"Additional file 1 of Developing a coding taxonomy to analyze dental regulatory complaints","year":2020,"lang":"en","type":"article","venue":"Open MIND","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University; University of Toronto","funders":"","keywords":"Coding (social sciences); Reliability (semiconductor); Taxonomy (biology); Table (database); Data collection","score_opus":0.32342565138858714,"score_gpt":0.3722898595968911,"score_spread":0.04886420820830395,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6902157991","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0010459066,0.000016823544,0.0015092241,0.0003030265,0.000057930494,0.0016491158,0.99052656,0.00031656455,0.0045748064],"genre_scores_gemma":[0.024027552,0.00022796988,0.021390138,0.0009914258,0.00023622699,0.035020273,0.88613194,0.001050197,0.03092427],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99794155,0.00060456584,0.0004893122,0.0002319595,0.000557085,0.00017552306],"domain_scores_gemma":[0.9251592,0.05635151,0.004565435,0.0024495707,0.010795585,0.0006786389],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0040876507,0.0008227093,0.0007877046,0.0035624753,0.0010997809,0.0010860328,0.0012751167,0.00092116103,0.81386703],"category_scores_gemma":[0.061463557,0.0004557588,0.0005767178,0.004525705,0.0002914423,0.0015122397,0.001110111,0.0010290704,0.11406405],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015877114,0.00014761886,0.0023554282,0.0009133369,0.000010281088,0.000031946503,0.00021003632,0.00018963208,0.00006651451,0.00083036686,0.9816429,0.013443133],"study_design_scores_gemma":[0.0027835562,0.0004560495,0.05916394,0.004226315,0.00010405819,0.00047077253,0.003222809,0.003123518,0.0015292247,0.014860308,0.9098504,0.0002089675],"about_ca_topic_score_codex":0.0069395127,"about_ca_topic_score_gemma":0.014514215,"teacher_disagreement_score":0.81386703,"about_ca_system_score_codex":0.0017424562,"about_ca_system_score_gemma":0.0031181506,"threshold_uncertainty_score":0.26549608},"labels":[],"label_agreement":null},{"id":"W6902295241","doi":"10.6084/m9.figshare.26579069","title":"Additional file 1 of Improving social justice in observational studies: protocol for the development of a global and Indigenous STROBE-equity reporting guideline","year":2024,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Canadian Agency for Drugs and Technologies in Health; Ottawa Hospital; Carleton University; Hospital for Sick Children; Western University; Royal College of Physicians and Surgeons of Canada; University of Toronto; Dalhousie University; SickKids Foundation; Bruyère; Canadian Council on Animal Care; McMaster University; Queen's University; University of Ottawa","funders":"","keywords":"Guideline; Indigenous; Observational study; Protocol (science); Coding (social sciences); Social justice; Context (archaeology)","score_opus":0.6703220811909395,"score_gpt":0.5374888847959403,"score_spread":0.13283319639499924,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6902295241","genre_codex":"dataset","genre_gemma":"protocol","domain_codex":null,"domain_gemma":"reporting","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"protocol","genre_consensus":null,"domain_candidate":"reporting","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0006760915,0.0002308025,0.009507764,0.0018252941,0.00040361605,0.08329371,0.8959976,0.0011618795,0.0069032237],"genre_scores_gemma":[0.005932141,0.00056142797,0.04335274,0.0028418184,0.00034647554,0.79027134,0.14081442,0.0009474454,0.014932271],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9821409,0.009348055,0.0048948233,0.0012110106,0.0017428279,0.0006623649],"domain_scores_gemma":[0.68725723,0.2525225,0.015094617,0.014597265,0.02821301,0.00231539],"candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.043192133,0.0015281825,0.0023628136,0.005225157,0.002190191,0.0030470586,0.0024800438,0.0026834921,0.7659842],"category_scores_gemma":[0.27161548,0.0020476943,0.0023141825,0.0060423305,0.0012170086,0.002805795,0.0022122914,0.0032001962,0.09533802],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011741035,0.0001673418,0.00075258804,0.017656196,0.00010012973,0.000054259217,0.00044825205,0.00035097208,0.00012927361,0.0038015079,0.9500785,0.025286788],"study_design_scores_gemma":[0.025144646,0.00073417684,0.016087623,0.048458263,0.0006492708,0.00049562706,0.0012339144,0.002377413,0.0012795116,0.039694186,0.863428,0.00041735088],"about_ca_topic_score_codex":0.0043133115,"about_ca_topic_score_gemma":0.008958997,"teacher_disagreement_score":0.95680785,"about_ca_system_score_codex":0.0040318533,"about_ca_system_score_gemma":0.013059737,"threshold_uncertainty_score":0.33379513},"labels":[],"label_agreement":null},{"id":"W6904071898","doi":"10.1371/journal.pntd.0012689.s002","title":"Quality assessment of epidemiological studies from the year 2000, based on the modified Newcastle-Ottawa Quality Assessment Scale","year":2024,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Quality assessment; Epidemiology; Quality (philosophy); Risk assessment; Scale (ratio); Exposure assessment","score_opus":0.7233629315348483,"score_gpt":0.5464145026599271,"score_spread":0.17694842887492124,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6904071898","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.11036392,0.19775826,0.17419685,0.013099968,0.005623692,0.06603216,0.40694797,0.0016875318,0.02428966],"genre_scores_gemma":[0.52071565,0.040262405,0.18137021,0.0031115355,0.00084975094,0.06775213,0.18211018,0.00056439673,0.0032637317],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.63798743,0.11435745,0.16991189,0.01379261,0.06142184,0.002528815],"domain_scores_gemma":[0.5264685,0.1447445,0.12145228,0.038234133,0.1615549,0.007545711],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.23350975,0.0010607612,0.0066101654,0.01714433,0.001670294,0.005217806,0.0032830362,0.0015483268,0.0034959237],"category_scores_gemma":[0.40872464,0.0011467864,0.012980262,0.021504404,0.0017557982,0.0033155303,0.0033683826,0.0033366026,0.000441336],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.008805047,0.00043548882,0.38099873,0.15682204,0.05899631,0.00019885926,0.0050097597,0.006295481,0.0022195105,0.010771623,0.1380166,0.23143053],"study_design_scores_gemma":[0.0031528983,0.0010443574,0.8364184,0.028217774,0.01768,0.00030507467,0.0010009068,0.004253538,0.001383822,0.0042069345,0.10178795,0.0005483573],"about_ca_topic_score_codex":0.04280817,"about_ca_topic_score_gemma":0.05564488,"teacher_disagreement_score":0.7664902,"about_ca_system_score_codex":0.012446793,"about_ca_system_score_gemma":0.023667065,"threshold_uncertainty_score":0.9452189},"labels":[],"label_agreement":null},{"id":"W6904357030","doi":"10.1371/journal.pntd.0009890.s003","title":"QA assessment of STH studies based on modified Newcastle-Ottawa Quality Assessment Scale.","year":2021,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Quality assessment; Quality (philosophy); Quality assurance; Risk assessment; Evaluation methods","score_opus":0.6275608607273189,"score_gpt":0.538625661623456,"score_spread":0.08893519910386283,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6904357030","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.32746816,0.17579482,0.21211718,0.005705908,0.0025655525,0.043735188,0.15063499,0.001969122,0.08000909],"genre_scores_gemma":[0.89096594,0.0064109727,0.068364404,0.00083958986,0.00019229192,0.014011701,0.016045721,0.00020587891,0.0029636004],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.91769123,0.046761658,0.020326769,0.0028911289,0.01166086,0.0006683849],"domain_scores_gemma":[0.76988184,0.12696739,0.03664616,0.01729841,0.047612593,0.0015936635],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.09469755,0.0005346783,0.0026773456,0.006396716,0.0008181678,0.0024442924,0.0017621916,0.00066859595,0.010926201],"category_scores_gemma":[0.20938374,0.00044941483,0.006339195,0.0062621413,0.000881865,0.0020568636,0.0017453807,0.0011918497,0.00075361563],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.013977964,0.00033361872,0.35889375,0.06821359,0.03277046,0.00016081595,0.004866061,0.0070450325,0.0034764295,0.00824199,0.055912316,0.44610798],"study_design_scores_gemma":[0.0037162697,0.0049823695,0.8209035,0.018591955,0.0200426,0.0010306952,0.0019684017,0.013318498,0.0045741815,0.01037716,0.09998986,0.0005046541],"about_ca_topic_score_codex":0.0069690538,"about_ca_topic_score_gemma":0.012705996,"teacher_disagreement_score":0.90530246,"about_ca_system_score_codex":0.0025422378,"about_ca_system_score_gemma":0.0059105167,"threshold_uncertainty_score":0.5008145},"labels":[],"label_agreement":null},{"id":"W6904401493","doi":"10.1371/journal.pone.0276701.s004","title":"Newcastle-Ottawa quality assessment scale for cross-sectional studies.","year":2022,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Scale (ratio); Quality (philosophy); Quality assessment; Measure (data warehouse); Data quality","score_opus":0.706144065715121,"score_gpt":0.5664891265198829,"score_spread":0.13965493919523808,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6904401493","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.16728465,0.12764099,0.28131354,0.010562953,0.005379241,0.045931295,0.27649194,0.003185592,0.08220984],"genre_scores_gemma":[0.5647461,0.01963241,0.26112998,0.002056474,0.00033704148,0.06774716,0.07462185,0.00052960694,0.009199406],"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.94486046,0.020558717,0.019564914,0.0021867135,0.0120673105,0.0007619304],"domain_scores_gemma":[0.8148565,0.0933813,0.029809255,0.010539913,0.048494868,0.0029181782],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.049544424,0.0005855343,0.0025623732,0.005432637,0.0014118818,0.0014609277,0.0030967705,0.0009604728,0.006127888],"category_scores_gemma":[0.14543764,0.00085050653,0.0041916976,0.0051364084,0.0010311326,0.0021289324,0.0026344953,0.002658694,0.0011867457],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0024245582,0.0005477192,0.4169494,0.030105688,0.0075678187,0.0002381656,0.0041377405,0.0028069979,0.0012218885,0.011130639,0.25365058,0.2692188],"study_design_scores_gemma":[0.00094341766,0.0008632888,0.8089742,0.007832244,0.0025233473,0.0006692526,0.002201824,0.0029352447,0.0011912754,0.008461482,0.16295838,0.0004460472],"about_ca_topic_score_codex":0.021650726,"about_ca_topic_score_gemma":0.049305853,"teacher_disagreement_score":0.95045555,"about_ca_system_score_codex":0.0046311514,"about_ca_system_score_gemma":0.008951062,"threshold_uncertainty_score":0.2620191},"labels":[],"label_agreement":null},{"id":"W6904516503","doi":"10.1371/journal.pone.0240631.s007","title":"Results from OLS and QR models for the number of physician consultations for children under 1 year old in the 1&lt;sup&gt;st&lt;/sup&gt; Cycle of PMAQ (missing values imputed), Brazil.","year":2020,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"MEDLINE; Health care; Quarter (Canadian coin); Health services","score_opus":0.1482042693624554,"score_gpt":0.36095136140218476,"score_spread":0.21274709203972936,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6904516503","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8184039,0.0038866855,0.051708315,0.0064045084,0.0008301528,0.0005342931,0.103763655,0.0020171858,0.0124513265],"genre_scores_gemma":[0.96068335,0.00069241587,0.010962581,0.00024563132,0.00009972505,0.0004130407,0.019051928,0.00033184767,0.007519596],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9923625,0.0055930824,0.0003233273,0.0010222588,0.00034024505,0.0003586391],"domain_scores_gemma":[0.9356666,0.05439254,0.0031677904,0.002619452,0.0033471845,0.00080641644],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010451973,0.0011344737,0.0014155303,0.0011046155,0.0005894113,0.0015067426,0.0019915807,0.00093083695,0.016022967],"category_scores_gemma":[0.051814348,0.0007762105,0.0033311064,0.0018534344,0.00087410404,0.0013280419,0.0014513383,0.00269643,0.0028175628],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0024420242,0.0007488191,0.705887,0.0015472892,0.006617687,0.0006068316,0.0040320726,0.061060023,0.00041865974,0.034030523,0.11964082,0.06296825],"study_design_scores_gemma":[0.0007853295,0.0014375618,0.60421807,0.0015046451,0.005860265,0.00071548653,0.011988566,0.28849143,0.0010686227,0.030822868,0.052740473,0.00036667386],"about_ca_topic_score_codex":0.20818913,"about_ca_topic_score_gemma":0.11340942,"teacher_disagreement_score":0.20818913,"about_ca_system_score_codex":0.0011828487,"about_ca_system_score_gemma":0.004582113,"threshold_uncertainty_score":0.41395468},"labels":[],"label_agreement":null},{"id":"W6904555035","doi":"10.1371/journal.pone.0292021.s003","title":"Newcastle-Ottawa Scale quality assessment of the studies.","year":2023,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Scale (ratio); Quality (philosophy); Quality assessment; Measure (data warehouse); Data quality","score_opus":0.7077092964839,"score_gpt":0.5473400207967551,"score_spread":0.16036927568714487,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6904555035","genre_codex":"review","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1266742,0.2703881,0.21073386,0.015424139,0.006420415,0.10447302,0.17975771,0.0023435466,0.08378499],"genre_scores_gemma":[0.5774022,0.029171163,0.24639766,0.0022529853,0.0005821516,0.0967335,0.040289763,0.0005409117,0.0066296863],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.80815744,0.0651911,0.08865889,0.005873075,0.030681932,0.0014375937],"domain_scores_gemma":[0.5145244,0.28366736,0.06932854,0.022137647,0.10581908,0.0045229974],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.12589705,0.000730947,0.004549667,0.010385285,0.0017599612,0.0030769915,0.0035616579,0.0012247569,0.0072711264],"category_scores_gemma":[0.35257316,0.00103727,0.007894247,0.0077913254,0.0019299248,0.003049361,0.003939911,0.0029450885,0.0009275604],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005281456,0.00041819597,0.2517336,0.16666538,0.028587708,0.0002985917,0.007147573,0.0028612977,0.0016579247,0.0141894,0.1606185,0.36054036],"study_design_scores_gemma":[0.0032117628,0.0022071754,0.61806864,0.055670895,0.019979658,0.0011160695,0.004763436,0.00574876,0.0025137956,0.019186772,0.2663617,0.0011713146],"about_ca_topic_score_codex":0.014455154,"about_ca_topic_score_gemma":0.030289406,"teacher_disagreement_score":0.87410295,"about_ca_system_score_codex":0.0066806166,"about_ca_system_score_gemma":0.013361383,"threshold_uncertainty_score":0.66581523},"labels":[],"label_agreement":null},{"id":"W6904677782","doi":"10.1371/journal.pone.0296026.s003","title":"Quality assessment for cross-sectional studies (Modified Newcastle-Ottawa Quality Assessment Scale criteria)*.","year":2023,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Quality assessment; Quality (philosophy); Scale (ratio); Risk assessment; Impact assessment","score_opus":0.7619917823556953,"score_gpt":0.6080136156474778,"score_spread":0.1539781667082175,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6904677782","genre_codex":"protocol","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.028487178,0.09050226,0.29360804,0.014564223,0.003486428,0.29656354,0.23600881,0.0030502107,0.033729278],"genre_scores_gemma":[0.15101479,0.01611252,0.4287808,0.002809071,0.00053210295,0.33129504,0.063261196,0.00087199366,0.005322534],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.67892146,0.12866673,0.13153513,0.010538993,0.048413783,0.0019239755],"domain_scores_gemma":[0.48739442,0.19016744,0.11621251,0.04339967,0.15885489,0.0039710132],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2687511,0.0012682026,0.006734654,0.009963108,0.0021972354,0.0036626,0.0045867236,0.001859894,0.013101386],"category_scores_gemma":[0.4181184,0.0010891665,0.011009941,0.01615426,0.0021515407,0.0037638794,0.0034689233,0.0030718397,0.0019908727],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005109778,0.00054250396,0.07727662,0.20601648,0.021809407,0.00018911813,0.0053449245,0.0033522027,0.0019547117,0.01582309,0.3017481,0.36083305],"study_design_scores_gemma":[0.0076421453,0.0022531592,0.394211,0.09672226,0.015753035,0.0006531909,0.002151715,0.015151092,0.004677492,0.020036956,0.43941984,0.0013281525],"about_ca_topic_score_codex":0.019703561,"about_ca_topic_score_gemma":0.02796892,"teacher_disagreement_score":0.73124886,"about_ca_system_score_codex":0.009914208,"about_ca_system_score_gemma":0.025325065,"threshold_uncertainty_score":0.90176004},"labels":[],"label_agreement":null},{"id":"W6920517678","doi":"10.6084/m9.figshare.12072534.v1","title":"Additional file 4 of Sedentary behavior patterns and adiposity in children: a study based on compositional data analysis","year":2020,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Children's Hospital of Eastern Ontario","funders":"","keywords":"Table (database); Compositional data; Physical activity; Sedentary behavior; Sedentary lifestyle; Data file","score_opus":0.21652186579229066,"score_gpt":0.3554182507638054,"score_spread":0.13889638497151474,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6920517678","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0006155898,0.000014704687,0.00025381398,0.000051521543,0.00000987113,0.00011637985,0.9984162,0.000072948766,0.0004489362],"genre_scores_gemma":[0.03399264,0.000201493,0.007510093,0.00039925225,0.000085198466,0.008125125,0.9380078,0.00059944665,0.011079009],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.99872917,0.0003065311,0.0002780986,0.00030476466,0.00023318433,0.00014819596],"domain_scores_gemma":[0.9737551,0.019603975,0.0019268924,0.0015724453,0.0026727454,0.00046882915],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0022961253,0.0010450414,0.001326374,0.0026935146,0.001002703,0.0013551384,0.0022549683,0.0010274143,0.7563156],"category_scores_gemma":[0.042150185,0.000594105,0.0012567496,0.0057002776,0.0002623959,0.001449268,0.0010010011,0.00085943966,0.053025883],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008482477,0.00019835214,0.024341708,0.0054295184,0.00024412136,0.00015915472,0.00030118786,0.0007148165,0.00011389829,0.0009903273,0.95111805,0.015540685],"study_design_scores_gemma":[0.011535333,0.00081912155,0.2954928,0.01115675,0.0015050973,0.0013594193,0.0027558305,0.0052743726,0.0013265404,0.012066232,0.65630805,0.00040040349],"about_ca_topic_score_codex":0.019945074,"about_ca_topic_score_gemma":0.020633098,"teacher_disagreement_score":0.7563156,"about_ca_system_score_codex":0.0010574874,"about_ca_system_score_gemma":0.0018706856,"threshold_uncertainty_score":0.3475862},"labels":[],"label_agreement":null},{"id":"W6920518269","doi":"10.6084/m9.figshare.12233456.v1","title":"NOS","year":2020,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Scale (ratio); Field (mathematics); Process (computing)","score_opus":0.5584769089976009,"score_gpt":0.40391553303996286,"score_spread":0.15456137595763808,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6920518269","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02470184,0.007851046,0.030773357,0.015772833,0.015190698,0.022572422,0.24084549,0.0024368025,0.63985556],"genre_scores_gemma":[0.15255743,0.007895074,0.057745356,0.01612207,0.0035012232,0.05372135,0.24640822,0.0020709804,0.45997837],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9838336,0.00494383,0.0050069364,0.0017910925,0.0038246685,0.0005998479],"domain_scores_gemma":[0.9642999,0.0069104806,0.0035797958,0.0068139536,0.016869629,0.0015261986],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.012691714,0.0005752271,0.0012770086,0.0028230571,0.0016660928,0.0023543236,0.0022620147,0.0012578556,0.26102996],"category_scores_gemma":[0.06366574,0.00044961664,0.001103292,0.0020047764,0.00079366326,0.003121523,0.0023892894,0.0018308357,0.1015731],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000828433,0.00017402416,0.014536106,0.0035803718,0.00013501517,0.0005456443,0.0010708151,0.00018046946,0.00067723857,0.018787649,0.79849344,0.1609909],"study_design_scores_gemma":[0.00025539094,0.00012453503,0.014769424,0.0020804321,0.00006019744,0.0007301594,0.0005405301,0.00026563898,0.000351602,0.007868291,0.9728852,0.00006858209],"about_ca_topic_score_codex":0.004776872,"about_ca_topic_score_gemma":0.00817984,"teacher_disagreement_score":0.73897004,"about_ca_system_score_codex":0.0016647531,"about_ca_system_score_gemma":0.00635617,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W6920646253","doi":"10.6084/m9.figshare.12476702.v1","title":"Additional file 1 of Using multiple agreement methods for continuous repeated measures data: a tutorial for practitioners","year":2020,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Measure (data warehouse); Data file; Data collection; Term (time)","score_opus":0.6110904157845687,"score_gpt":0.4802538677778531,"score_spread":0.13083654800671557,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6920646253","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0004222505,0.00012504512,0.0108967,0.0007587791,0.00016489593,0.0011373664,0.9780147,0.0041413563,0.004338937],"genre_scores_gemma":[0.026185423,0.0012557862,0.12809443,0.0042545586,0.00088730355,0.044302,0.7212293,0.018021679,0.05576945],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99475986,0.002315789,0.0009497192,0.000669119,0.0010060004,0.00029958377],"domain_scores_gemma":[0.6957983,0.27495635,0.0055827117,0.008589265,0.013582236,0.0014911349],"candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.013512793,0.0015118876,0.0017818189,0.004131364,0.0010151279,0.00243589,0.00286636,0.0020786468,0.9042086],"category_scores_gemma":[0.20834972,0.0014995534,0.0015808104,0.0056883637,0.00055959437,0.003731392,0.0017923042,0.0019243024,0.23373078],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00036637724,0.00010886122,0.0009229232,0.0040309858,0.000053879987,0.00005694916,0.000103486025,0.00042709,0.00006527884,0.0016554093,0.96318686,0.029021854],"study_design_scores_gemma":[0.005009028,0.0004283997,0.012556653,0.008734429,0.00032919896,0.0008104053,0.0006038809,0.0038538938,0.0010459897,0.051152993,0.91516805,0.00030704244],"about_ca_topic_score_codex":0.003037194,"about_ca_topic_score_gemma":0.005692918,"teacher_disagreement_score":0.9864872,"about_ca_system_score_codex":0.0013616314,"about_ca_system_score_gemma":0.0039670756,"threshold_uncertainty_score":0.13663483},"labels":[],"label_agreement":null},{"id":"W6920799232","doi":"10.6084/m9.figshare.13719529","title":"Additional file 1 of The Matthews correlation coefficient (MCC) is more reliable than balanced accuracy, bookmaker informedness, and markedness in two-class confusion matrix evaluation","year":2021,"lang":"en","type":"article","venue":"Open MIND","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University Health Network","funders":"","keywords":"Randomness; Confusion; Matrix (chemical analysis); Markedness; Confusion matrix; Correlation coefficient","score_opus":0.09709000465052663,"score_gpt":0.39545205506978853,"score_spread":0.2983620504192619,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6920799232","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00076089986,0.000025959935,0.002300718,0.00024540373,0.000063186,0.00012173868,0.99221236,0.0020579281,0.0022118164],"genre_scores_gemma":[0.033355553,0.00014082847,0.019369857,0.0008521111,0.00027471068,0.004395014,0.91458744,0.007170451,0.019853959],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99818015,0.00042610438,0.00025613254,0.00040282798,0.0005848315,0.0001498963],"domain_scores_gemma":[0.9095997,0.07231409,0.0028688472,0.0045842673,0.010011127,0.00062195776],"candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0033348554,0.0013922938,0.0010643901,0.0022480257,0.0008159668,0.0019248328,0.0021765397,0.0013501709,0.81632435],"category_scores_gemma":[0.093018256,0.00060070615,0.00094003795,0.0031267933,0.0003224697,0.0024605293,0.0010722982,0.0011672265,0.18415026],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025124295,0.00008610423,0.0021787146,0.00088725536,0.00003324575,0.000036668705,0.000045231554,0.00044197214,0.00007660314,0.0009934264,0.9806966,0.014272908],"study_design_scores_gemma":[0.005746525,0.0005050823,0.047423486,0.003303409,0.0003076989,0.00070527045,0.0006138442,0.013221565,0.004243251,0.04202597,0.8815277,0.0003762178],"about_ca_topic_score_codex":0.0047420054,"about_ca_topic_score_gemma":0.0094212415,"teacher_disagreement_score":0.9966651,"about_ca_system_score_codex":0.0011009979,"about_ca_system_score_gemma":0.0017734558,"threshold_uncertainty_score":0.26199096},"labels":[],"label_agreement":null},{"id":"W6920920990","doi":"10.6084/m9.figshare.13719529.v1","title":"Additional file 1 of The Matthews correlation coefficient (MCC) is more reliable than balanced accuracy, bookmaker informedness, and markedness in two-class confusion matrix evaluation","year":2021,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University Health Network","funders":"","keywords":"Randomness; Confusion; Matrix (chemical analysis); Markedness; Confusion matrix; Correlation coefficient","score_opus":0.08969401580553116,"score_gpt":0.3639828464937436,"score_spread":0.2742888306882124,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6920920990","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0007448096,0.000027791026,0.0029297397,0.0002723203,0.000068081434,0.00012947115,0.99048096,0.002741839,0.002605019],"genre_scores_gemma":[0.036600653,0.00015349528,0.023332281,0.0009313102,0.0002706872,0.004360863,0.90321845,0.009845236,0.021286987],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.997995,0.00047725136,0.00027757234,0.00043101332,0.00065209856,0.00016704855],"domain_scores_gemma":[0.8989061,0.08164756,0.0028669573,0.0053458554,0.010565274,0.0006683696],"candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0037981183,0.0014149845,0.0011178167,0.002329032,0.0008832638,0.0021591133,0.0023502905,0.0014151892,0.82656276],"category_scores_gemma":[0.09930911,0.0006685376,0.0010324725,0.003325968,0.00035650132,0.0027064777,0.0011176191,0.0012507192,0.20885599],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00024136978,0.00007604771,0.002033534,0.0008282141,0.000034775727,0.000036128706,0.00004384663,0.00056058983,0.000073258685,0.0010860277,0.9806529,0.014333319],"study_design_scores_gemma":[0.0051088994,0.00048504354,0.039634384,0.0031260294,0.00031883278,0.0006652076,0.0005478763,0.014866008,0.00420301,0.04636388,0.88429344,0.00038749268],"about_ca_topic_score_codex":0.004440194,"about_ca_topic_score_gemma":0.0095455265,"teacher_disagreement_score":0.9962019,"about_ca_system_score_codex":0.0011456568,"about_ca_system_score_gemma":0.00200032,"threshold_uncertainty_score":0.24738711},"labels":[],"label_agreement":null},{"id":"W6920949177","doi":"10.6084/m9.figshare.14913279.v1","title":"Additional file 6 of Validity of observational evidence on putative risk and protective factors: appraisal of 3744 meta-analyses on 57 topics","year":2021,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Observational study; Kappa; Measure (data warehouse); Sample (material); Risk assessment","score_opus":0.8339611891746483,"score_gpt":0.5000389208144426,"score_spread":0.3339222683602058,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6920949177","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0002758861,0.00013858038,0.000534466,0.00022714277,0.00004717438,0.00035603216,0.99736077,0.00026170866,0.00079827127],"genre_scores_gemma":[0.03454683,0.0013065197,0.020930666,0.0021583557,0.0004721166,0.025433164,0.88979656,0.0022180048,0.023137761],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.9952377,0.0015213025,0.0014684697,0.00067193364,0.0007685969,0.0003320912],"domain_scores_gemma":[0.8006215,0.17628014,0.00862216,0.0049089,0.008692412,0.00087481557],"candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.008250627,0.001794318,0.0028288162,0.005714305,0.0009556113,0.0027321242,0.0025989632,0.0020101403,0.9032947],"category_scores_gemma":[0.14988577,0.0013384689,0.0038652522,0.008180041,0.000466822,0.0039606146,0.0018719328,0.0014812272,0.08627281],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017737773,0.00015302667,0.0042858636,0.070143506,0.0011269945,0.0001493164,0.00021430176,0.0012174646,0.0001818719,0.0021549577,0.89799213,0.020606726],"study_design_scores_gemma":[0.060947713,0.001085533,0.053356584,0.05314584,0.006549537,0.0012872744,0.0012045172,0.006636945,0.0015697083,0.04160546,0.77203333,0.00057749735],"about_ca_topic_score_codex":0.00580111,"about_ca_topic_score_gemma":0.012690757,"teacher_disagreement_score":0.99174935,"about_ca_system_score_codex":0.0020196384,"about_ca_system_score_gemma":0.0036744794,"threshold_uncertainty_score":0.13793832},"labels":[],"label_agreement":null},{"id":"W6923051379","doi":"10.1371/journal.pntd.0010702.s003","title":"Risk of Bias and quality assessments.","year":2022,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Table (database); Quality (philosophy); Data quality; Data collection; Risk assessment","score_opus":0.5954873802289661,"score_gpt":0.4769345406090012,"score_spread":0.11855283961996488,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6923051379","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0019152401,0.016632723,0.12141591,0.011185476,0.008983204,0.20444697,0.6089257,0.007517962,0.018976828],"genre_scores_gemma":[0.027057491,0.0035272862,0.18868366,0.0035991205,0.0011219698,0.7233486,0.044139065,0.002305549,0.006217187],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.561014,0.22906502,0.13699992,0.019970266,0.050314438,0.0026363884],"domain_scores_gemma":[0.24138471,0.59485084,0.050406586,0.05272173,0.058497958,0.0021381313],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.304056,0.0034121433,0.010292375,0.01752355,0.0016442883,0.008264712,0.005716966,0.0060176803,0.24597295],"category_scores_gemma":[0.7484604,0.0029790099,0.022039076,0.016522504,0.0037793252,0.006151989,0.0045467997,0.008162006,0.020451028],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0049042595,0.00017502342,0.0042474596,0.3753501,0.020304816,0.00012148009,0.0011150994,0.002087915,0.00035974997,0.026297254,0.4239306,0.14110638],"study_design_scores_gemma":[0.021944027,0.00080053136,0.018422157,0.29539314,0.02875923,0.00047324324,0.000938892,0.016184336,0.003321856,0.11868901,0.49413687,0.00093669014],"about_ca_topic_score_codex":0.0044387523,"about_ca_topic_score_gemma":0.00510798,"teacher_disagreement_score":0.304056,"about_ca_system_score_codex":0.009062759,"about_ca_system_score_gemma":0.017806834,"threshold_uncertainty_score":0.85822284},"labels":[],"label_agreement":null},{"id":"W6923380391","doi":"10.1371/journal.pone.0299125.s008","title":"Author’s judgements about study quality using the adapted Ottawa-Newcastle risk of bias assessment tool.","year":2024,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Quality (philosophy); Risk assessment; Quality assessment; Response bias; Data collection; Risk perception","score_opus":0.6038026136552229,"score_gpt":0.5165250097033885,"score_spread":0.08727760395183437,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6923380391","genre_codex":"protocol","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.019714622,0.09153332,0.1911985,0.08526933,0.1262188,0.28102002,0.16350545,0.007312653,0.034227397],"genre_scores_gemma":[0.18759869,0.021009041,0.31275177,0.019097717,0.012696238,0.3830595,0.02461089,0.005073566,0.034102585],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.7041016,0.086643144,0.13495435,0.01974916,0.051571857,0.002979915],"domain_scores_gemma":[0.4066609,0.21910328,0.10286944,0.048214793,0.21512789,0.008023636],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.17668907,0.00320648,0.01672661,0.017983446,0.003916077,0.0090047475,0.009038212,0.007811589,0.040407702],"category_scores_gemma":[0.6176586,0.00352093,0.013892394,0.012061112,0.009743288,0.0075494302,0.0048981817,0.017663259,0.009498971],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005180382,0.00024529823,0.004317294,0.13791455,0.010902123,0.0007675335,0.013678316,0.0018259108,0.002656264,0.014863083,0.74045444,0.06719487],"study_design_scores_gemma":[0.023995128,0.0007981138,0.016081596,0.21099913,0.014945926,0.0013684628,0.009391571,0.023235736,0.0067444523,0.14069211,0.54849565,0.0032522057],"about_ca_topic_score_codex":0.012942261,"about_ca_topic_score_gemma":0.023934804,"teacher_disagreement_score":0.17668907,"about_ca_system_score_codex":0.012780805,"about_ca_system_score_gemma":0.030208843,"threshold_uncertainty_score":0.93443227},"labels":[],"label_agreement":null},{"id":"W6923411768","doi":"10.1371/journal.pone.0293382.s003","title":"Quality appraisal of longitudinal studies using Newcastle Ottawa Scale.","year":2024,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Quality (philosophy); Longitudinal study; Government (linguistics); Critical appraisal; Data collection","score_opus":0.6543883855328971,"score_gpt":0.5442819466279222,"score_spread":0.11010643890497496,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6923411768","genre_codex":"review","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.18190707,0.4538615,0.2043723,0.01087621,0.004340226,0.0567948,0.057655048,0.0014685938,0.028724188],"genre_scores_gemma":[0.73530245,0.031971816,0.17635211,0.0011469235,0.00047449133,0.036994796,0.015634028,0.000198002,0.0019255535],"study_design_codex":"observational","study_design_gemma":"not_applicable","domain_scores_codex":[0.69066364,0.10733098,0.14876236,0.0071649523,0.044591814,0.0014862637],"domain_scores_gemma":[0.38150766,0.37295485,0.09585827,0.029363234,0.11623889,0.004077112],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.25946134,0.0008201333,0.005182038,0.013300426,0.0020945899,0.0032638113,0.0032213663,0.0011201409,0.0028272213],"category_scores_gemma":[0.4532123,0.00087102246,0.010342873,0.009911105,0.0021765344,0.0030452658,0.003122434,0.002163136,0.00027959107],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005425086,0.00024792555,0.40733847,0.18901613,0.046348132,0.00040011076,0.01006047,0.0035733695,0.0020942423,0.0074525354,0.043132987,0.2849104],"study_design_scores_gemma":[0.0023379137,0.0032721579,0.7529112,0.07152447,0.03474617,0.0012805001,0.007786898,0.009913427,0.0037626263,0.014273877,0.09715916,0.0010315496],"about_ca_topic_score_codex":0.013251336,"about_ca_topic_score_gemma":0.02333411,"teacher_disagreement_score":0.74053866,"about_ca_system_score_codex":0.00621007,"about_ca_system_score_gemma":0.011863301,"threshold_uncertainty_score":0.913216},"labels":[],"label_agreement":null},{"id":"W6929742458","doi":"10.5061/dryad.qbzkh18p5","title":"Social interactions generate complex selection patterns in virtual worlds","year":2024,"lang":"en","type":"dataset","venue":"DRYAD","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Montréal","funders":"Mitacs; European Commission","keywords":"Selection (genetic algorithm); Natural selection; Natural (archaeology); Social relation; Variation (astronomy); Inclusive fitness; Mechanism (biology)","score_opus":0.23797326387077092,"score_gpt":0.4434277590926073,"score_spread":0.20545449522183637,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6929742458","genre_codex":"empirical","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9916152,0.000073250405,0.0062788473,0.000050448612,0.000005251128,0.000012685423,0.00007494216,0.000037854523,0.0018515836],"genre_scores_gemma":[0.9985958,0.000015776106,0.0010986788,0.000010548432,0.0000029542578,0.000011038827,0.000064942185,0.000009314607,0.000190966],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9991572,0.0004485382,0.000024622334,0.00013183754,0.00013883726,0.00009891367],"domain_scores_gemma":[0.9966446,0.0019987673,0.00053113705,0.00030267227,0.00020748787,0.00031536995],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007073669,0.00028322023,0.00042216506,0.001075965,0.0005265918,0.0012696341,0.00038127738,0.00032425343,0.002402909],"category_scores_gemma":[0.0068010027,0.0002556352,0.00032655033,0.00046653266,0.00082830916,0.0006960469,0.001313251,0.0003321578,0.00023969692],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011785164,0.0004968025,0.656567,0.00037615525,0.00094507396,0.0014952658,0.007766572,0.10259856,0.05557721,0.03540897,0.0047058617,0.1328841],"study_design_scores_gemma":[0.00004080826,0.000255464,0.73003596,0.000039862098,0.00011568852,0.0007781358,0.0025313583,0.23306721,0.0018761203,0.02829299,0.0028707734,0.00009563014],"about_ca_topic_score_codex":0.0015318649,"about_ca_topic_score_gemma":0.002385889,"teacher_disagreement_score":0.002402909,"about_ca_system_score_codex":0.00028528747,"about_ca_system_score_gemma":0.00014375921,"threshold_uncertainty_score":0.008038521},"labels":[],"label_agreement":null},{"id":"W6929826709","doi":"10.5281/zenodo.12031831","title":"youth and crime pdf","year":2024,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Commit; Law enforcement; Psychological intervention; Suicide prevention; Poison control; Injury prevention; Enforcement; Human factors and ergonomics","score_opus":0.15798201310407178,"score_gpt":0.32661207697116956,"score_spread":0.16863006386709778,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6929826709","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0006105727,0.0008691956,0.00014792214,0.0015095283,0.0016769299,0.00011901542,0.010132667,0.001190047,0.9837441],"genre_scores_gemma":[0.0029501696,0.0014688065,0.00024645112,0.00052879506,0.0005172362,0.000075474796,0.0060224943,0.0008423617,0.9873482],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9991233,0.00007553581,0.000034461333,0.000070121125,0.00047812573,0.00021853468],"domain_scores_gemma":[0.9979442,0.000117375006,0.000094148476,0.00015667615,0.000920706,0.00076700194],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.00057125255,0.0011696501,0.0008615009,0.0031686602,0.0031185804,0.005677779,0.0011627886,0.0012256778,0.8522431],"category_scores_gemma":[0.0033220062,0.0005642177,0.0008850946,0.0032917776,0.00054224493,0.0028984437,0.0041550975,0.0017577049,0.64398205],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000071781405,0.000010421955,0.00009732111,0.000038572216,6.875643e-7,0.00001891917,0.000041415464,0.0000058408314,0.000020225618,0.000717975,0.97781825,0.021223184],"study_design_scores_gemma":[0.0000046243845,0.000008576229,0.0014292318,0.00010972748,0.0000018655501,0.00005980904,0.00018997923,0.000011753816,0.00007086146,0.0002397983,0.99786806,0.000005663856],"about_ca_topic_score_codex":0.014765625,"about_ca_topic_score_gemma":0.028561592,"teacher_disagreement_score":0.14775687,"about_ca_system_score_codex":0.0015524449,"about_ca_system_score_gemma":0.0025551987,"threshold_uncertainty_score":0.21075726},"labels":[],"label_agreement":null},{"id":"W6930161627","doi":"10.5203/0096509","title":"Environment Canada - Water Quality Monitoring Stations - East Side Rivers and Lake Outlet Water Quality","year":2017,"lang":"en","type":"dataset","venue":"UMANCEOS","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Hydrology (agriculture); Water quality; River delta; Drainage basin; Shelf ice; Bank","score_opus":0.21747342379488832,"score_gpt":0.39985270430275854,"score_spread":0.18237928050787022,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6930161627","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00031460755,0.000027684899,0.00006541099,0.000032695716,0.0000070071587,0.000010852776,0.998917,0.00006623754,0.0005586575],"genre_scores_gemma":[0.001450817,0.00005657002,0.00033732585,0.000022425542,0.0000023181765,0.0000690351,0.99686253,0.000030840973,0.001168147],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.9985065,0.00012590911,0.00013525182,0.00028814367,0.0006547028,0.00028952616],"domain_scores_gemma":[0.9935772,0.0006735177,0.00046658498,0.000671811,0.0041625313,0.0004483725],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0013421758,0.0015576778,0.001286815,0.003572944,0.0012609366,0.0017640901,0.002962775,0.0009390151,0.018452486],"category_scores_gemma":[0.005958399,0.00085371576,0.0009976008,0.015625296,0.00058864075,0.00061395974,0.0013201282,0.0014343413,0.009664706],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006726174,0.000027869579,0.009456217,0.00044791284,0.00008603999,0.000028551009,0.000069806665,0.0009208455,0.00007335237,0.0009949126,0.9847607,0.0030664639],"study_design_scores_gemma":[0.00023530737,0.000013134933,0.07720052,0.00053331704,0.0000684519,0.00004157123,0.00037673637,0.0016049116,0.00055068807,0.001082786,0.9182304,0.00006209135],"about_ca_topic_score_codex":0.9371851,"about_ca_topic_score_gemma":0.96523696,"teacher_disagreement_score":0.06281489,"about_ca_system_score_codex":0.012767719,"about_ca_system_score_gemma":0.03356887,"threshold_uncertainty_score":0.1263696},"labels":[],"label_agreement":null},{"id":"W6930190331","doi":"10.5281/zenodo.10910123","title":"Capture of the noise from a 120 m long roll-on/roll-off cargo ship","year":2024,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Université du Québec à Montréal; Université du Québec à Rimouski","funders":"","keywords":"Noise (video); Hydrophone; Sound (geography); Underwater; Sensitivity (control systems); Software; Ambient noise level; Background noise","score_opus":0.10569522803381616,"score_gpt":0.3096380628105987,"score_spread":0.20394283477678254,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6930190331","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8871623,0.00011949645,0.08475515,0.000084324056,0.00017438273,0.000742,0.008353756,0.0020675517,0.016541006],"genre_scores_gemma":[0.8036941,0.00028560378,0.13299291,0.0003098757,0.00007546471,0.001273828,0.018471237,0.0009868033,0.041910082],"study_design_codex":"bench_or_experimental","study_design_gemma":"observational","domain_scores_codex":[0.99974483,0.000010269506,0.0000075752055,0.00008008375,0.00011356824,0.000043619788],"domain_scores_gemma":[0.99976593,0.000027948152,0.000010756481,0.00003504063,0.00009713146,0.00006327877],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002638225,0.00045254853,0.000516414,0.0008876849,0.0005013922,0.00031969819,0.0005084663,0.00053923595,0.0054282127],"category_scores_gemma":[0.0002956156,0.00019719837,0.00032195792,0.0006578627,0.00024980347,0.00016939573,0.0007042788,0.00037710404,0.002215715],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00073732063,0.00028495648,0.010603615,0.00022939188,0.000042222837,0.00072671793,0.0007592399,0.0029728364,0.9081625,0.0003406788,0.0035971699,0.071543336],"study_design_scores_gemma":[0.000251479,0.0033884442,0.5326196,0.00020376989,0.00025429708,0.002046484,0.0011670934,0.05827345,0.34286767,0.00057242333,0.058145367,0.00020984784],"about_ca_topic_score_codex":0.0053333486,"about_ca_topic_score_gemma":0.011495951,"teacher_disagreement_score":0.0054282127,"about_ca_system_score_codex":0.00027526257,"about_ca_system_score_gemma":0.00066731795,"threshold_uncertainty_score":0.01815921},"labels":[],"label_agreement":null},{"id":"W6930262978","doi":"10.5281/zenodo.12253199","title":"Prowirl","year":2024,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Nucleofection; Limiting; Field (mathematics); Noise (video); Work (physics); Subpoena","score_opus":0.1706779805591923,"score_gpt":0.3463615684099742,"score_spread":0.17568358785078186,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6930262978","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0007730194,0.0009963821,0.0035481828,0.0017519533,0.0023816398,0.0002454687,0.006559508,0.008312074,0.9754318],"genre_scores_gemma":[0.0026132131,0.000876467,0.0011997182,0.0007911758,0.00046603492,0.00012147651,0.004399743,0.0030249665,0.9865072],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9988655,0.00008986312,0.00005921163,0.0002061221,0.0006156869,0.00016369045],"domain_scores_gemma":[0.9976266,0.00020095607,0.000115692696,0.00045664408,0.000913841,0.00068629807],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0009146629,0.0019592543,0.0010620236,0.0024702766,0.0016311123,0.0072406363,0.0021924076,0.0021090333,0.87477434],"category_scores_gemma":[0.0035830967,0.0008904168,0.0011430858,0.0019149318,0.000780414,0.005857986,0.004501669,0.002512852,0.8617839],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014992144,0.00007652996,0.00014190217,0.00045127302,0.0000068115564,0.00012131507,0.00011327202,0.00008054949,0.0029222101,0.0043177702,0.8705127,0.1211057],"study_design_scores_gemma":[0.0000101553305,0.000020117914,0.00014659569,0.000034739132,0.0000023814057,0.00006284855,0.000034578887,0.0000307776,0.0006368266,0.0007954024,0.9982193,0.0000061909027],"about_ca_topic_score_codex":0.0012682894,"about_ca_topic_score_gemma":0.0034614343,"teacher_disagreement_score":0.12522566,"about_ca_system_score_codex":0.0013245001,"about_ca_system_score_gemma":0.0019681558,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W6930279845","doi":"10.5281/zenodo.10892753","title":"Application of Market Timing Theory: Evidence from Canadian Firms","year":2024,"lang":"en","type":"article","venue":"DOAJ (DOAJ: Directory of Open Access Journals)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Market timing; Capital structure; Corporate finance; Leverage (statistics); Equity (law); Valuation (finance); Capital market; Stock market; Volatility (finance); External financing","score_opus":0.5118674764462113,"score_gpt":0.5977812231907639,"score_spread":0.08591374674455254,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6930279845","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.96105844,0.0048001865,0.00020648938,0.0026419705,0.000019898089,0.00007520217,0.003822259,0.000013133471,0.027362432],"genre_scores_gemma":[0.99412376,0.0026696944,0.0001900343,0.00024358457,0.00001533475,0.000009346824,0.0013160185,0.000004580301,0.0014277374],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9964496,0.00027963257,0.0001958828,0.0003634234,0.0019336499,0.00077785423],"domain_scores_gemma":[0.9636253,0.008006947,0.0083933575,0.0014753619,0.015937496,0.0025615268],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0033386345,0.00034365366,0.00046793337,0.00450914,0.0039127064,0.0027226782,0.0016267706,0.0008253299,0.0033009646],"category_scores_gemma":[0.022844777,0.0002967997,0.00043046474,0.014301495,0.0018097613,0.0009916504,0.0011028643,0.0008463342,0.00032962876],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00039286297,0.00020662403,0.93631124,0.0004046654,0.00014182506,0.0005352978,0.0075251176,0.0006081828,0.0003234467,0.0062047923,0.00788043,0.039465573],"study_design_scores_gemma":[0.000025565163,0.000040601328,0.98586625,0.000111667876,0.000070847665,0.000069511945,0.004709289,0.0005155008,0.00019227342,0.0003117571,0.008051068,0.000035695415],"about_ca_topic_score_codex":0.99278414,"about_ca_topic_score_gemma":0.99367493,"teacher_disagreement_score":0.04057038,"about_ca_system_score_codex":0.04057038,"about_ca_system_score_gemma":0.040413767,"threshold_uncertainty_score":0.2943601},"labels":[],"label_agreement":null},{"id":"W6930359942","doi":"10.5281/zenodo.12042164","title":"5th grade social studies textbook pdf","year":2024,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Download; Vocabulary; Reading (process); Social studies; Class (philosophy); State (computer science)","score_opus":0.28511173278310015,"score_gpt":0.3982049053351869,"score_spread":0.11309317255208673,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6930359942","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0005758794,0.00046300536,0.0004436094,0.0010402759,0.0016007205,0.00018173843,0.005402635,0.0017881168,0.988504],"genre_scores_gemma":[0.0010090779,0.00029540763,0.00035219084,0.0002897257,0.00020254316,0.00006037426,0.0021726112,0.0005505187,0.9950675],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99926585,0.000053353255,0.00003608781,0.00008389516,0.0004583114,0.00010250865],"domain_scores_gemma":[0.99775213,0.00015610614,0.00006765075,0.0002269906,0.0010584799,0.00073868653],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.00052091706,0.001093055,0.0009992426,0.0022787494,0.0017439282,0.0064510973,0.0017101486,0.0017472834,0.91721547],"category_scores_gemma":[0.0026476674,0.00054379925,0.00090818806,0.00226429,0.00050401635,0.0032889068,0.0035376912,0.0021378805,0.88220733],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000015324726,0.00004999503,0.000065691966,0.000104876504,0.0000013738678,0.000026702464,0.00003703934,0.000021492937,0.00022263592,0.0011420698,0.95709157,0.04122111],"study_design_scores_gemma":[0.0000067685774,0.00001808969,0.00055873685,0.00008011104,0.0000013656619,0.000025467454,0.000082054314,0.000017942772,0.00013301073,0.0005528872,0.99851876,0.0000048061993],"about_ca_topic_score_codex":0.0039151176,"about_ca_topic_score_gemma":0.011769914,"teacher_disagreement_score":0.08278453,"about_ca_system_score_codex":0.0018016136,"about_ca_system_score_gemma":0.0021801933,"threshold_uncertainty_score":0.11808199},"labels":[],"label_agreement":null},{"id":"W6930369453","doi":"10.5281/zenodo.13969103","title":"Escherichia and Shigella GTDB species identification MASH sketch for ECTYPER","year":2023,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Public Health Agency of Canada","funders":"","keywords":"Sketch; Identification (biology); RefSeq; Shigella; Shigella dysenteriae; Escherichia coli; Taxonomy (biology)","score_opus":0.16846007993272166,"score_gpt":0.32975934050073546,"score_spread":0.1612992605680138,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6930369453","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011630165,0.00075999927,0.14075509,0.0005814308,0.00088470435,0.0007397193,0.53803086,0.29228854,0.01432942],"genre_scores_gemma":[0.028355207,0.00069139426,0.21474062,0.0006471087,0.00022568947,0.0015956683,0.6801342,0.057734273,0.015875854],"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9986816,0.00013198043,0.00020416512,0.0004294907,0.00043206548,0.000120750025],"domain_scores_gemma":[0.9962715,0.00097245094,0.0003863954,0.0011327307,0.0009912081,0.00024573767],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0023225371,0.002034728,0.0012300998,0.003971023,0.00089023565,0.0024239488,0.001524213,0.0009190921,0.115909666],"category_scores_gemma":[0.008997785,0.0011641524,0.0013429418,0.0022087072,0.00039967935,0.0019753098,0.0025472813,0.0014556617,0.08366136],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002271502,0.00012476319,0.006317327,0.003200933,0.00025555035,0.0007801293,0.0005119043,0.0018642808,0.048658792,0.0048178867,0.8064581,0.12473876],"study_design_scores_gemma":[0.00031644866,0.00018731403,0.006981674,0.00040170414,0.000105950676,0.00086618244,0.000237018,0.00844569,0.046557523,0.006891588,0.9288012,0.00020775614],"about_ca_topic_score_codex":0.001344432,"about_ca_topic_score_gemma":0.001691419,"teacher_disagreement_score":0.115909666,"about_ca_system_score_codex":0.00061558536,"about_ca_system_score_gemma":0.0011163444,"threshold_uncertainty_score":0.38775647},"labels":[],"label_agreement":null},{"id":"W6930399018","doi":"10.5281/zenodo.12234255","title":"+91-8094774404 «««₪₪»» DEATH SPELL / REVENGE SPELLS CASTER IN U.K, SWEDEN SWITZERLAND,AMERICA, CANADA.","year":2024,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Spell; Wife; Caster; Miracle; MAGIC (telescope); Happening; Mistake","score_opus":0.1377311826636261,"score_gpt":0.3242768853356639,"score_spread":0.1865457026720378,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6930399018","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0005307523,0.00021736544,0.00014986898,0.00066684326,0.00084392325,0.0000636009,0.0020843684,0.0010447222,0.99439853],"genre_scores_gemma":[0.0008947511,0.00008494017,0.000075017575,0.000103789585,0.000026661215,0.000010055541,0.00040974657,0.00025058785,0.9981444],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99947685,0.000050010996,0.000021887352,0.00011657684,0.00017638724,0.00015832842],"domain_scores_gemma":[0.9980294,0.000107091895,0.0000745609,0.00014058492,0.0006607189,0.0009876618],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.00040900466,0.0010833875,0.0007601764,0.0008385989,0.0040722955,0.004575934,0.0009954632,0.0014197931,0.9661533],"category_scores_gemma":[0.0014987784,0.0005056565,0.0005157578,0.0012922672,0.00068692846,0.0022403938,0.0031712097,0.0015733863,0.9528202],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000047382964,0.000022813718,0.00019185382,0.0000695804,0.0000015881185,0.00004220317,0.00007274328,0.000027136928,0.00021203113,0.0005421447,0.9636903,0.03508025],"study_design_scores_gemma":[0.00000495133,0.000016336096,0.00058823096,0.000042379317,0.000001280571,0.00004026695,0.00023014279,0.00001577236,0.00008170907,0.000058477766,0.9989158,0.0000045810316],"about_ca_topic_score_codex":0.019758478,"about_ca_topic_score_gemma":0.06381909,"teacher_disagreement_score":0.033846676,"about_ca_system_score_codex":0.001997858,"about_ca_system_score_gemma":0.0018583526,"threshold_uncertainty_score":0.048278153},"labels":[],"label_agreement":null},{"id":"W6930469099","doi":"10.5281/zenodo.12645768","title":"Download Pdf Shuni","year":2024,"lang":"fr","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Passion; Period (music)","score_opus":0.10406544078213886,"score_gpt":0.3131305898442519,"score_spread":0.20906514906211304,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6930469099","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0005454474,0.0012385808,0.0015136036,0.00074228534,0.0011635006,0.00011491966,0.0030887157,0.0042809676,0.98731196],"genre_scores_gemma":[0.0015135243,0.0011027275,0.00079725566,0.00029419994,0.00016685031,0.00004504995,0.0026091258,0.0013919185,0.9920793],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99976486,0.000010999231,0.000010761939,0.00005141952,0.00012997177,0.00003201583],"domain_scores_gemma":[0.99947506,0.000036280766,0.000015146432,0.00009052592,0.0002362953,0.00014672245],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.00022641062,0.0009860176,0.0008987769,0.0014719218,0.0012435149,0.0044032726,0.0009152963,0.0010120792,0.8945008],"category_scores_gemma":[0.0009879876,0.0005678204,0.00064835564,0.0014566539,0.0003742531,0.0032294497,0.0023612338,0.0018226391,0.87270665],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00005567769,0.000041415664,0.00011897032,0.00029084645,0.000005220132,0.00008965393,0.0000705961,0.000052356252,0.002428745,0.0019571353,0.819598,0.17529117],"study_design_scores_gemma":[0.0000054152324,0.000012826371,0.0002674621,0.00003912817,0.0000027302515,0.00006828318,0.000038824488,0.000029921886,0.00051421527,0.00035780182,0.99865854,0.000004818227],"about_ca_topic_score_codex":0.0014426077,"about_ca_topic_score_gemma":0.0036864849,"teacher_disagreement_score":0.8945008,"about_ca_system_score_codex":0.000706452,"about_ca_system_score_gemma":0.0008923647,"threshold_uncertainty_score":0.15048182},"labels":[],"label_agreement":null},{"id":"W6930685898","doi":"10.5281/zenodo.15753378","title":"Fig. 50 in A revision of Parapterogramma Papp and Pseudopterogramma Papp, with a review of the Parapterogramma genus group of the Pacific and Indomalayan regions (Diptera, Sphaeroceridae, Limosininae)","year":2025,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Dorsum; Genus; Group (periodic table); Scale (ratio); Morphology (biology)","score_opus":0.05291101311911732,"score_gpt":0.282416591565892,"score_spread":0.22950557844677466,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6930685898","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.029688215,0.053180445,0.05906109,0.0077564013,0.014067924,0.0011635218,0.027351214,0.0042376854,0.80349344],"genre_scores_gemma":[0.28947523,0.05577916,0.13349323,0.0055702133,0.006438367,0.0023750076,0.042030025,0.0024698912,0.46236885],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99979275,0.000054726355,0.00002571142,0.000055027074,0.0000543156,0.000017420245],"domain_scores_gemma":[0.99979657,0.000060627415,0.000031797943,0.000030881638,0.000059332655,0.000020753112],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0003351213,0.0010166668,0.0002852135,0.0025308921,0.0009251328,0.0009100135,0.00082125876,0.00064242765,0.04422005],"category_scores_gemma":[0.0012016967,0.0002700692,0.000273188,0.0020697885,0.0013832591,0.0013503027,0.00076075905,0.001217578,0.016410911],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00012315402,0.000028662294,0.0025596444,0.0015492718,0.000032042593,0.00070832943,0.0011523976,0.00032056606,0.0013914016,0.01949286,0.40818384,0.56445795],"study_design_scores_gemma":[0.0000060609823,0.000016163622,0.007037407,0.00019628061,0.00001584192,0.0011604304,0.00018465481,0.00013409117,0.00016234601,0.0018438664,0.98923594,0.000006971805],"about_ca_topic_score_codex":0.0045430893,"about_ca_topic_score_gemma":0.0076188156,"teacher_disagreement_score":0.04422005,"about_ca_system_score_codex":0.0005569538,"about_ca_system_score_gemma":0.0005159036,"threshold_uncertainty_score":0.14793086},"labels":[],"label_agreement":null},{"id":"W6930711784","doi":"10.5281/zenodo.12180681","title":"cathay pacific pdf","year":2024,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"China; Aviation; Subsidiary; Asia pacific; Air travel","score_opus":0.12806388315481362,"score_gpt":0.32441335470004007,"score_spread":0.19634947154522644,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6930711784","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00034490626,0.00027936156,0.0002702021,0.00097092765,0.0010412645,0.00018074269,0.0071254694,0.0026952408,0.9870919],"genre_scores_gemma":[0.0016007923,0.0003027305,0.00021699746,0.00070755696,0.00042200866,0.00011379872,0.004016355,0.0016498248,0.99096996],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9990571,0.00007962047,0.000042167558,0.00012709563,0.00054701715,0.00014699268],"domain_scores_gemma":[0.9962949,0.0002853982,0.00012536228,0.00054247194,0.0018866718,0.0008651243],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0009143972,0.001218744,0.000992816,0.0027468344,0.003105028,0.011393504,0.0017099458,0.0026692017,0.9264138],"category_scores_gemma":[0.0045938636,0.00074865983,0.0009614822,0.0030470614,0.0006730093,0.005562136,0.0036527368,0.0024137353,0.8638983],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000024731888,0.000016066173,0.00004380821,0.000056630815,0.0000014718572,0.00002092317,0.000012405343,0.0000125951365,0.0000686399,0.00064337975,0.98749334,0.011606067],"study_design_scores_gemma":[0.0000107653905,0.000009020274,0.00043503332,0.000035024965,0.000001271065,0.000034262463,0.000034643665,0.000028199851,0.00007887874,0.00018963376,0.99913603,0.000007355368],"about_ca_topic_score_codex":0.010211874,"about_ca_topic_score_gemma":0.015157981,"teacher_disagreement_score":0.073586226,"about_ca_system_score_codex":0.001500252,"about_ca_system_score_gemma":0.0018552277,"threshold_uncertainty_score":0.10496175},"labels":[],"label_agreement":null},{"id":"W6930828234","doi":"10.5281/zenodo.1421111","title":"A Transcultural Approach To The Subaltern Identity Of The Metis/ Halfbreeds In Beatrice Culleton Mosionier'S In Search Of April Raintree","year":2018,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Subaltern; Transculturation; Ethnic group; Identity (music); Hegemony; Cultural hegemony; Cultural identity; Cultural studies","score_opus":0.13341797200804287,"score_gpt":0.3248457347361717,"score_spread":0.1914277627281288,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6930828234","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.049556494,0.14348486,0.043432705,0.35225964,0.0069631324,0.0002162235,0.0001042163,0.000056239347,0.40392658],"genre_scores_gemma":[0.83398664,0.03913997,0.015640305,0.02717406,0.0017006203,0.00024828006,0.00005159893,0.00007193376,0.08198655],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"qualitative","domain_scores_codex":[0.99641633,0.002595652,0.000107185275,0.00022214917,0.00045161363,0.00020706125],"domain_scores_gemma":[0.99772733,0.0015222586,0.000121849276,0.0001195869,0.00032169852,0.00018731842],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0060742334,0.00037368017,0.0003555198,0.0019175009,0.0049698655,0.006732922,0.001227405,0.0013438386,0.0020891917],"category_scores_gemma":[0.004615071,0.00024439796,0.0002399512,0.0011696172,0.021429725,0.0043443595,0.0038118132,0.003813052,0.0002924928],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000018424955,0.000027826529,0.00052425254,0.000052598,0.000005334084,0.00022315735,0.063038744,0.00008679068,0.00009017902,0.8807165,0.021402342,0.03381387],"study_design_scores_gemma":[0.000008599268,0.000029478246,0.0020895198,0.0006895671,0.000007234055,0.00037610688,0.060494326,0.00029395332,0.00025518294,0.4206365,0.5150904,0.000029142206],"about_ca_topic_score_codex":0.018938009,"about_ca_topic_score_gemma":0.03693048,"teacher_disagreement_score":0.981062,"about_ca_system_score_codex":0.0056587597,"about_ca_system_score_gemma":0.004330484,"threshold_uncertainty_score":0.04105735},"labels":[],"label_agreement":null},{"id":"W6930901674","doi":"10.5281/zenodo.15596103","title":"RovHer: heritability-optimized scores for the functional prioritization of rare missense variants","year":2025,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University; Population Health Research Institute","funders":"","keywords":"Prioritization; Missense mutation; Mutation; Disease; Identification (biology)","score_opus":0.12105340158777163,"score_gpt":0.32464463375748503,"score_spread":0.20359123216971342,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6930901674","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.002828464,0.00034152798,0.0027004208,0.00015234738,0.00005894732,0.000048967573,0.99082464,0.0019603216,0.0010842718],"genre_scores_gemma":[0.0038332143,0.000074246425,0.0032864888,0.0000930183,0.00001026845,0.00014846885,0.9914505,0.00020198482,0.00090184377],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99844354,0.00037830826,0.00013611514,0.0005677076,0.00031124576,0.00016305085],"domain_scores_gemma":[0.99797195,0.00094087055,0.00019359605,0.0004670332,0.0003020954,0.0001244869],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0025711039,0.002721125,0.0018432435,0.0026046517,0.0008021027,0.0016086249,0.0036577082,0.002777683,0.021586929],"category_scores_gemma":[0.008479909,0.0007195556,0.0019056948,0.0025610805,0.0005014538,0.0006140171,0.0017224605,0.0018075866,0.02922379],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00047652854,0.00011996635,0.0091123665,0.0010292919,0.00030338016,0.00020567371,0.000044946817,0.004313609,0.0010264629,0.0015178778,0.9667299,0.015120055],"study_design_scores_gemma":[0.004035419,0.0002639108,0.044819955,0.00094468356,0.0006216115,0.0016984857,0.00020867804,0.0310786,0.005562342,0.022688001,0.8878305,0.00024782645],"about_ca_topic_score_codex":0.019705566,"about_ca_topic_score_gemma":0.053119622,"teacher_disagreement_score":0.021586929,"about_ca_system_score_codex":0.0013583293,"about_ca_system_score_gemma":0.0017895697,"threshold_uncertainty_score":0.07221544},"labels":[],"label_agreement":null},{"id":"W6931042798","doi":"10.5281/zenodo.15425140","title":"Additive manufacturing: a tool for engineering microstructures and mechanical behavior","year":2025,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Geomechanica (Canada)","funders":"","keywords":"Austenite; Microstructure; European union; Plasticity; Crystal twinning; Crystal plasticity; Austenitic stainless steel","score_opus":0.06290811341146287,"score_gpt":0.3089826469860265,"score_spread":0.24607453357456366,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931042798","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00281594,0.0020906234,0.9856199,0.00029844226,0.00013745001,0.000056019468,0.0003513846,0.0034000524,0.005230136],"genre_scores_gemma":[0.051732693,0.0044508353,0.93583536,0.00016605684,0.00016284935,0.00036036863,0.00066888874,0.00067438727,0.005948556],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99891293,0.00013144065,0.00006070835,0.00016504317,0.00068959827,0.000040222163],"domain_scores_gemma":[0.9990196,0.0004446966,0.0001269007,0.00022869767,0.00013076326,0.000049232276],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012722167,0.00092398183,0.0008122583,0.0018651071,0.00049116043,0.0019783832,0.0012791954,0.001177344,0.005513882],"category_scores_gemma":[0.0018195092,0.0008337744,0.0009462143,0.0012661989,0.0011754659,0.0014969171,0.0013001349,0.0017746558,0.002820449],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00009183125,0.000121282945,0.0013048295,0.0018711454,0.0001622784,0.00032548004,0.00032582914,0.03473261,0.2089254,0.17098962,0.014857602,0.5662921],"study_design_scores_gemma":[0.00009359464,0.00032831365,0.002890406,0.0005248755,0.00015459694,0.0010443253,0.000127192,0.2666673,0.18007912,0.1413989,0.4064987,0.00019267607],"about_ca_topic_score_codex":0.00057201285,"about_ca_topic_score_gemma":0.0007245499,"teacher_disagreement_score":0.005513882,"about_ca_system_score_codex":0.00065783324,"about_ca_system_score_gemma":0.0007660683,"threshold_uncertainty_score":0.01844573},"labels":[],"label_agreement":null},{"id":"W6931197449","doi":"10.5281/zenodo.4312906","title":"The Role of Data in AI","year":2020,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Data governance; Data quality; General partnership; Summit; Transparency (behavior); Corporate governance; Data curation; Information governance; Work (physics)","score_opus":0.23507285848324538,"score_gpt":0.3541728027813011,"score_spread":0.1190999442980557,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931197449","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010194236,0.025242073,0.24004044,0.39733672,0.005468256,0.00071308686,0.0029156925,0.0011575845,0.31693187],"genre_scores_gemma":[0.5161355,0.04581178,0.26756647,0.060736112,0.006926804,0.001902364,0.0080376435,0.0029853883,0.08989791],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.7985324,0.13477318,0.014192976,0.011161085,0.035983004,0.0053572846],"domain_scores_gemma":[0.69994575,0.18553185,0.009276266,0.05487238,0.040930595,0.009443171],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.14961003,0.00067546585,0.0013361921,0.0065087574,0.0072921,0.049817536,0.004835785,0.006003459,0.009529585],"category_scores_gemma":[0.16690366,0.0011651369,0.0014612081,0.0131928595,0.031736746,0.05613334,0.026665606,0.009870195,0.0034052718],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00002920998,0.000018924635,0.0011742373,0.00031280896,0.000024066594,0.00006340546,0.0035006541,0.0006548274,0.00017432122,0.92796916,0.02396257,0.042115826],"study_design_scores_gemma":[0.000014013575,0.00002152051,0.0005194502,0.0011662476,0.000020982528,0.000099936275,0.0026853129,0.0009757485,0.0006509154,0.28128734,0.71251845,0.000040060586],"about_ca_topic_score_codex":0.014553281,"about_ca_topic_score_gemma":0.0053295307,"teacher_disagreement_score":0.14961003,"about_ca_system_score_codex":0.012609825,"about_ca_system_score_gemma":0.031508796,"threshold_uncertainty_score":0.79122293},"labels":[],"label_agreement":null},{"id":"W6931277097","doi":"10.5281/zenodo.4306644","title":"tanjapm/DIB_flatflame: DIB complementary cantera calculations","year":2020,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Polytechnique Montréal","funders":"","keywords":"Field (mathematics); Perspective (graphical); Visualization; Feature (linguistics)","score_opus":0.18276707337552794,"score_gpt":0.34344563022740227,"score_spread":0.16067855685187432,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931277097","genre_codex":"other","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.003801255,0.00041181443,0.089651965,0.0009914327,0.0008565582,0.00025937293,0.18776028,0.20033361,0.5159337],"genre_scores_gemma":[0.07409476,0.0004477823,0.10713867,0.0013736286,0.0002899025,0.0014573004,0.23494056,0.3149802,0.26527727],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9988211,0.00017517351,0.00003006897,0.00016230531,0.00061391,0.00019738781],"domain_scores_gemma":[0.9981154,0.00030501894,0.00007105933,0.00051143666,0.00076300895,0.00023402566],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0015827918,0.0024621636,0.0017764219,0.0021051944,0.0014069759,0.0025011934,0.0064713033,0.0018757677,0.50539684],"category_scores_gemma":[0.0033422492,0.0018144397,0.0015463495,0.0020914585,0.000561721,0.003506918,0.0023195082,0.0029543499,0.27171957],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00026715297,0.000050652383,0.00030088393,0.0003281963,0.000045405108,0.000042353142,0.000056288824,0.0039870925,0.0017686789,0.014969755,0.95269334,0.02549014],"study_design_scores_gemma":[0.00046852682,0.000050182178,0.0010990297,0.00013625277,0.00003802293,0.000118448246,0.000049140424,0.035531055,0.014975996,0.024653807,0.9227303,0.00014919536],"about_ca_topic_score_codex":0.009492203,"about_ca_topic_score_gemma":0.013673726,"teacher_disagreement_score":0.50539684,"about_ca_system_score_codex":0.0031237584,"about_ca_system_score_gemma":0.0019834654,"threshold_uncertainty_score":0.70549136},"labels":[],"label_agreement":null},{"id":"W6931288864","doi":"10.5281/zenodo.5428565","title":"Figure 3 in Elasmobranchs from the Lower Triassic Sulphur Mountain Formation near Wapiti Lake (BC, Canada)","year":2007,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Holotype; Single specimen; Table (database); Assemblage (archaeology); Sulfur","score_opus":0.07940355660982276,"score_gpt":0.28752318615575584,"score_spread":0.20811962954593308,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931288864","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.205945,0.00091137824,0.0040233033,0.0009135207,0.00059809507,0.00056496804,0.057335675,0.0015193891,0.72818863],"genre_scores_gemma":[0.57588917,0.00091345183,0.010751347,0.00027226107,0.000055236014,0.00016051214,0.030811999,0.0006084309,0.3805376],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99989164,0.000004289328,0.000003043748,0.000026222851,0.00004498679,0.000029844454],"domain_scores_gemma":[0.9999169,0.0000045756974,0.000006971226,0.0000064103606,0.000047492347,0.000017703422],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00006584298,0.00031963296,0.0001550999,0.0021473547,0.0029231454,0.00091834407,0.000524942,0.00038766436,0.0909379],"category_scores_gemma":[0.0002455307,0.00017549288,0.00026405073,0.0027335484,0.0006575089,0.00022229106,0.0005548915,0.00040831568,0.017053837],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00041531678,0.000096509815,0.113592856,0.0007682962,0.000061399856,0.00465227,0.012012886,0.001581332,0.016326325,0.0067076148,0.5284678,0.3153174],"study_design_scores_gemma":[0.000027863056,0.000025413141,0.4008998,0.00024359567,0.000048417507,0.001460467,0.0068857665,0.00052145397,0.0021818154,0.0005240149,0.58715415,0.000027257744],"about_ca_topic_score_codex":0.75208116,"about_ca_topic_score_gemma":0.9322768,"teacher_disagreement_score":0.24791884,"about_ca_system_score_codex":0.0029575035,"about_ca_system_score_gemma":0.002403779,"threshold_uncertainty_score":0.49875772},"labels":[],"label_agreement":null},{"id":"W6931377715","doi":"10.5281/zenodo.3460765","title":"drkupi/APWS: APWS Web Portal","year":2019,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Web application; Process (computing); Software; The Internet; Web service","score_opus":0.12533603815264985,"score_gpt":0.3213343729286678,"score_spread":0.19599833477601794,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931377715","genre_codex":"dataset","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00065828033,0.00016288059,0.010350265,0.0005402766,0.00026701702,0.00008157932,0.85300905,0.10293588,0.0319947],"genre_scores_gemma":[0.0040321304,0.0002335861,0.0064938306,0.00028716106,0.0001355722,0.00022401438,0.93724376,0.032583836,0.018766023],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9989957,0.00013433406,0.000112290305,0.0001719562,0.00043852386,0.00014724277],"domain_scores_gemma":[0.996932,0.0006693502,0.0001639672,0.0010147624,0.000834019,0.00038574595],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0015771263,0.0020038986,0.001038127,0.0045366935,0.00048489275,0.004127875,0.002306683,0.0014561886,0.32123798],"category_scores_gemma":[0.0076822005,0.0008304976,0.0010341706,0.0060255458,0.00027132142,0.0039954954,0.0032978097,0.0018856783,0.41449746],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000048063615,0.00001892324,0.00027474467,0.00018139053,0.000015568266,0.00003084496,0.000029538141,0.00024377964,0.00019103177,0.0011383657,0.98756814,0.010259661],"study_design_scores_gemma":[0.00005590855,0.000007373945,0.0010310767,0.000069802365,0.000010214041,0.000054239146,0.000044687957,0.0015474713,0.00064027467,0.0047469274,0.991757,0.000035034154],"about_ca_topic_score_codex":0.0062017827,"about_ca_topic_score_gemma":0.0043907687,"teacher_disagreement_score":0.32123798,"about_ca_system_score_codex":0.0006412254,"about_ca_system_score_gemma":0.00128708,"threshold_uncertainty_score":0.96817166},"labels":[],"label_agreement":null},{"id":"W6931405649","doi":"10.5281/zenodo.4096981","title":"cb01-(ITA) Falling (2020) - Streaming ALTADEFINIZIONE rjb","year":2020,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Falling (accident); Daughter; The Internet; Falling in love; Link (geometry); Streaming current; Window (computing)","score_opus":0.20107666931437554,"score_gpt":0.3219271611802912,"score_spread":0.12085049186591565,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931405649","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00042172635,0.00028049608,0.0005430697,0.0006597114,0.0016572314,0.00016327757,0.012791377,0.0040758494,0.9794073],"genre_scores_gemma":[0.0017188534,0.00023545248,0.00056575326,0.00029911497,0.00020813852,0.00007894323,0.0076972456,0.0023015412,0.9868951],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9996611,0.00002055376,0.000009021348,0.00005373381,0.00016826691,0.00008726176],"domain_scores_gemma":[0.9988745,0.000058889647,0.000020678344,0.000118889926,0.0004544041,0.0004726502],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.00057125685,0.0008110204,0.00043451082,0.0012782564,0.0015774799,0.0051524346,0.0010793138,0.0013534867,0.92062944],"category_scores_gemma":[0.0016370238,0.0004309864,0.0005450893,0.0011780373,0.00028498107,0.0025627278,0.0027108688,0.0014386325,0.85505056],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000026684025,0.000014294539,0.00004226673,0.000047684196,9.378929e-7,0.000016859218,0.00002428165,0.000011238804,0.00022780315,0.00068000477,0.982554,0.016353851],"study_design_scores_gemma":[0.00001018823,0.0000094163015,0.00044239848,0.000037141355,0.0000011910037,0.000023006476,0.000033832297,0.000026396936,0.00011249183,0.00016872003,0.99913114,0.000004124059],"about_ca_topic_score_codex":0.01083758,"about_ca_topic_score_gemma":0.02589098,"teacher_disagreement_score":0.07937056,"about_ca_system_score_codex":0.0010746814,"about_ca_system_score_gemma":0.0010648917,"threshold_uncertainty_score":0.113212466},"labels":[],"label_agreement":null},{"id":"W6931450987","doi":"10.5281/zenodo.5706364","title":"E3DMT version 1 manual","year":2021,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Magnetotellurics; Inversion (geology); Software; Data collection","score_opus":0.14903162127798597,"score_gpt":0.33910508978367876,"score_spread":0.1900734685056928,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931450987","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0015702085,0.0013328334,0.12459013,0.00091273454,0.0008055496,0.00048476653,0.55234516,0.2693299,0.048628762],"genre_scores_gemma":[0.0055027963,0.0011792377,0.10557921,0.0012833135,0.00022007509,0.0019361384,0.6383883,0.19577178,0.050139215],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99749655,0.0003819377,0.00028458278,0.0005554644,0.0010592891,0.00022218734],"domain_scores_gemma":[0.99504143,0.0015840513,0.000233177,0.0011916292,0.0017344453,0.00021531316],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.004683905,0.0028966968,0.002379572,0.0045050965,0.0016607913,0.0059634517,0.0065037087,0.002632673,0.4276722],"category_scores_gemma":[0.01543726,0.0034833865,0.0029072242,0.0042840955,0.000686683,0.004796726,0.004062664,0.003858876,0.42433932],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017120683,0.00003180407,0.0004899316,0.00093407626,0.00005575393,0.00010785396,0.00010576847,0.0009245958,0.0014235894,0.0035259253,0.95583403,0.036395404],"study_design_scores_gemma":[0.00008499688,0.000018173929,0.0007305977,0.00025556653,0.00004725297,0.00024297443,0.000049466784,0.001973791,0.0032421981,0.0075477343,0.9857312,0.000075998614],"about_ca_topic_score_codex":0.0067129224,"about_ca_topic_score_gemma":0.007866384,"teacher_disagreement_score":0.4276722,"about_ca_system_score_codex":0.0014057718,"about_ca_system_score_gemma":0.0028754657,"threshold_uncertainty_score":0.8163561},"labels":[],"label_agreement":null},{"id":"W6931508920","doi":"10.5281/zenodo.3791116","title":"Gyrophaena gilvicollis Casey 1906","year":2009,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Canadian Forest Service; Natural Resources Canada","funders":"","keywords":"Maple; Ridge; Section (typography); Hardwood","score_opus":0.15759798700454228,"score_gpt":0.33777645769193776,"score_spread":0.18017847068739548,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931508920","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.15691051,0.013334998,0.0017763369,0.0013046922,0.0010490437,0.0005581247,0.004863458,0.0010286107,0.8191742],"genre_scores_gemma":[0.7868271,0.0073868264,0.0041161096,0.0015141665,0.00035165844,0.00016722895,0.0042933817,0.00017756988,0.19516607],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9998503,0.000008428222,0.0000062651507,0.000048028447,0.000052924785,0.000033981996],"domain_scores_gemma":[0.9998721,0.000010781616,0.000033173787,0.000009791734,0.000049008282,0.00002521994],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.000095875956,0.0008239081,0.0003923089,0.0010641519,0.002504392,0.00057138485,0.00060381176,0.00047031353,0.031030905],"category_scores_gemma":[0.00029641937,0.0002172215,0.00014581696,0.0006964742,0.00084983493,0.000540345,0.0007851099,0.0005264402,0.011417543],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00038282142,0.00011575154,0.050389506,0.00067086256,0.00004286101,0.0032060754,0.0028053783,0.0004667787,0.01638488,0.007608404,0.19896351,0.71896327],"study_design_scores_gemma":[0.000056442448,0.00011646231,0.15475312,0.00047335363,0.000049270042,0.0021627792,0.0016098205,0.00018951243,0.001355912,0.00087254314,0.83833486,0.000026020101],"about_ca_topic_score_codex":0.32061675,"about_ca_topic_score_gemma":0.62944174,"teacher_disagreement_score":0.32061675,"about_ca_system_score_codex":0.0024240909,"about_ca_system_score_gemma":0.0012885138,"threshold_uncertainty_score":0.6375011},"labels":[],"label_agreement":null},{"id":"W6931537636","doi":"10.5281/zenodo.4458985","title":"Hemp Max Lab Oil { CA } # No.1 Pain Killer Hemp Oil ? Read-Pros &amp; Cons","year":2021,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Point (geometry); Limiting; Filter (signal processing); Work (physics); Product (mathematics); Paraphernalia","score_opus":0.14053998126506084,"score_gpt":0.32287187951133245,"score_spread":0.1823318982462716,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931537636","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0009948969,0.0017970015,0.0009423757,0.012266224,0.0049405927,0.0001496995,0.00145249,0.0027765667,0.97468024],"genre_scores_gemma":[0.0031388488,0.00090864976,0.00038560038,0.0043133376,0.0006872474,0.00006957882,0.0003671198,0.00059424,0.9895354],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9996106,0.00005137105,0.000019220524,0.000054886135,0.00018035386,0.00008353873],"domain_scores_gemma":[0.9990386,0.0002116966,0.000058996862,0.000081959275,0.0002924019,0.00031642488],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0005454411,0.0007824144,0.00055502745,0.00068476726,0.001433743,0.002989666,0.0011211861,0.002953506,0.8680307],"category_scores_gemma":[0.0025724154,0.00041886236,0.00057290605,0.00029037558,0.0006038607,0.0021324747,0.0013970474,0.0025413458,0.67736375],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001474719,0.00006320425,0.000088532746,0.00011769647,0.0000025550894,0.0001521388,0.000032130953,0.000019375586,0.00049650954,0.0015383656,0.93338966,0.06395232],"study_design_scores_gemma":[0.00003439213,0.000044012417,0.00026145735,0.00008532672,0.0000027511353,0.00021536552,0.00006695366,0.000052021223,0.00035487392,0.00059172563,0.9982816,0.000009553857],"about_ca_topic_score_codex":0.0024649114,"about_ca_topic_score_gemma":0.0054314206,"teacher_disagreement_score":0.13196927,"about_ca_system_score_codex":0.0007317973,"about_ca_system_score_gemma":0.000927377,"threshold_uncertainty_score":0.18823814},"labels":[],"label_agreement":null},{"id":"W6931538020","doi":"10.5281/zenodo.7963601","title":"reds2401/Hydrotel-Telemac_results: V1","year":2023,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Sherbrooke","funders":"","keywords":"Nucleofection; Gestational period; TSG101; Dysgeusia; Diafiltration; Liquation; Emperipolesis; Triacetin; Demotion","score_opus":0.1593613973510762,"score_gpt":0.3395902359502935,"score_spread":0.18022883859921726,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931538020","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.004114935,0.00024216711,0.05022813,0.0012586605,0.0005134646,0.00057164574,0.41184455,0.34429133,0.18693516],"genre_scores_gemma":[0.056859218,0.00024878734,0.08353912,0.0010568266,0.00041903628,0.0016068757,0.46851075,0.22876233,0.15899709],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9958792,0.00069876754,0.00019048537,0.00044452387,0.0023801147,0.000406914],"domain_scores_gemma":[0.9917263,0.0023621607,0.00041505374,0.002531597,0.0025085933,0.00045632495],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0050000325,0.0029781274,0.0015539335,0.0041067475,0.0012273549,0.0039418237,0.0037665337,0.0028480606,0.37678748],"category_scores_gemma":[0.012609277,0.0016629803,0.0013009402,0.0026996469,0.0009942828,0.0023973684,0.0025904952,0.0012818567,0.32136902],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00035579948,0.00006112018,0.0005367971,0.00035556493,0.000044014774,0.000060144146,0.000078772755,0.0021288318,0.0013735809,0.0032465684,0.9597673,0.031991545],"study_design_scores_gemma":[0.0005179726,0.00010127565,0.0033860845,0.0001786789,0.000048161684,0.00014409803,0.000071404684,0.021182232,0.020494187,0.013349608,0.94032896,0.00019728858],"about_ca_topic_score_codex":0.015249759,"about_ca_topic_score_gemma":0.010138873,"teacher_disagreement_score":0.37678748,"about_ca_system_score_codex":0.0021303522,"about_ca_system_score_gemma":0.0024336583,"threshold_uncertainty_score":0.888937},"labels":[],"label_agreement":null},{"id":"W6931554602","doi":"10.5281/zenodo.8412257","title":"ComputeCanada/magic_castle: Magic Castle 12.6.7","year":2023,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University; Toronto Dementia Research Alliance; Compute Canada","funders":"","keywords":"MAGIC (telescope); History of computing; Key (lock)","score_opus":0.19707770640107322,"score_gpt":0.3325461461616843,"score_spread":0.1354684397606111,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931554602","genre_codex":"software","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":"software","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0006149446,0.00025988978,0.04961493,0.0006809729,0.0005447214,0.00021360359,0.03738342,0.74121517,0.16947225],"genre_scores_gemma":[0.013760248,0.00042583517,0.027685734,0.001136063,0.00022384684,0.00052552496,0.081224106,0.68953806,0.18548048],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.998355,0.00020096208,0.00007632462,0.00025832703,0.00072343415,0.00038589738],"domain_scores_gemma":[0.9966798,0.0005042795,0.00011971863,0.0014077657,0.0008448278,0.00044353408],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0019272546,0.0026711444,0.0014621567,0.002114045,0.001281643,0.0042818906,0.005776628,0.002256213,0.56501836],"category_scores_gemma":[0.007944411,0.002487618,0.001626295,0.0023870207,0.0011498113,0.0064057754,0.0046232427,0.00505845,0.54598373],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021229858,0.00003247722,0.00014803016,0.00019548781,0.00001686555,0.00003059778,0.000048363603,0.0003593555,0.00083422207,0.0088383155,0.96143645,0.027847549],"study_design_scores_gemma":[0.000104504514,0.000017013312,0.00022244024,0.00007151698,0.000009661756,0.000047208297,0.000013974535,0.0018988746,0.0030256417,0.0067183827,0.98781395,0.000056733486],"about_ca_topic_score_codex":0.013392068,"about_ca_topic_score_gemma":0.0141497925,"teacher_disagreement_score":0.56501836,"about_ca_system_score_codex":0.0020504526,"about_ca_system_score_gemma":0.0020095138,"threshold_uncertainty_score":0.62044847},"labels":[],"label_agreement":null},{"id":"W6931637154","doi":"10.5683/sp3/gm65t8","title":"Survey of Household Spending, 1999 [Canada] [Excel]","year":2015,"lang":"en","type":"dataset","venue":"Borealis","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Household income; Principal (computer security); Spouse; Survey data collection; Payment; Pension; Family income","score_opus":0.284473020106409,"score_gpt":0.3688724870377677,"score_spread":0.08439946693135869,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931637154","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0030460577,0.00026182478,0.00010848729,0.00014337036,0.000034983957,0.00021378831,0.98671585,0.00007331403,0.009402314],"genre_scores_gemma":[0.016918588,0.0014133063,0.0012116119,0.00023036898,0.000023378385,0.0006953615,0.9493339,0.00008020322,0.030093256],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.9988248,0.000084273735,0.00015035301,0.00013734454,0.0006245095,0.00017866257],"domain_scores_gemma":[0.9946753,0.00012604966,0.0003276334,0.000113984504,0.004482142,0.00027498245],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008969658,0.001287834,0.0007963041,0.004507368,0.0014758362,0.0015127735,0.002041315,0.00044580558,0.02345157],"category_scores_gemma":[0.0038185406,0.0008323277,0.0006743187,0.020929657,0.00022472511,0.0010077015,0.0008168848,0.0010353728,0.008831517],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00023837753,0.00013834836,0.06967045,0.0010102254,0.00011156601,0.00007902211,0.00023643674,0.0007941747,0.00013665846,0.0010129242,0.9031464,0.02342545],"study_design_scores_gemma":[0.00010954458,0.000045079534,0.7681434,0.00029965548,0.00005195976,0.000045805595,0.0005115969,0.0006409966,0.00020435723,0.00013869698,0.22977513,0.000033803895],"about_ca_topic_score_codex":0.9694159,"about_ca_topic_score_gemma":0.9796973,"teacher_disagreement_score":0.030584097,"about_ca_system_score_codex":0.018242706,"about_ca_system_score_gemma":0.025280045,"threshold_uncertainty_score":0.1323607},"labels":[],"label_agreement":null},{"id":"W6931648760","doi":"10.5683/sp3/sz1lis","title":"Replication Data and Code for: The Canadian Income Taxation: Statistical Analysis and Parametric Estimates","year":2021,"lang":"en","type":"dataset","venue":"Borealis","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"McMaster University","funders":"","keywords":"Replicate; Replication (statistics); Parametric statistics; Statistical analysis; Code (set theory); Nonparametric statistics; Data file","score_opus":0.20212963802193457,"score_gpt":0.42286689708361697,"score_spread":0.2207372590616824,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931648760","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0001948583,0.000033846703,0.0009730254,0.00017615434,0.00009817433,0.0010091334,0.9946621,0.00062737626,0.0022253282],"genre_scores_gemma":[0.0028237435,0.00010590669,0.009583101,0.00030131536,0.000046801473,0.01599511,0.95970446,0.0014425255,0.009997054],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.98933053,0.0020357913,0.0014801178,0.001853822,0.004013042,0.0012866332],"domain_scores_gemma":[0.9129108,0.016695734,0.002625129,0.02108502,0.044063058,0.0026202977],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0142603535,0.002656572,0.0020956395,0.006042431,0.005395959,0.004258374,0.005443871,0.002473437,0.27738008],"category_scores_gemma":[0.12094834,0.0023062606,0.0027699512,0.01452998,0.0016222207,0.0018963215,0.0028474065,0.003928917,0.08756974],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00008177555,0.000019903779,0.0006835656,0.00030879697,0.000025643334,0.000010228726,0.00007017913,0.00014399148,0.000031278207,0.00079517375,0.9947384,0.0030910447],"study_design_scores_gemma":[0.0015463046,0.00002863913,0.015396136,0.0010129899,0.00013319125,0.000052912663,0.0002345028,0.00043719733,0.00040009787,0.0054345396,0.9751659,0.00015771633],"about_ca_topic_score_codex":0.7353658,"about_ca_topic_score_gemma":0.83709854,"teacher_disagreement_score":0.27738008,"about_ca_system_score_codex":0.015132006,"about_ca_system_score_gemma":0.072174825,"threshold_uncertainty_score":0.9279288},"labels":[],"label_agreement":null},{"id":"W6931672917","doi":"10.5281/zenodo.8194413","title":"Fig. 8 in Metabolites isolated from the human intestinal fungus Penicillium oxalicum SL2 and their agonistic effects on PXR and FXR","year":2022,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"CAE (Canada)","funders":"","keywords":"Agonistic behaviour; Pregnane X receptor; Mutant; Metabolite; Fungus; Strain (injury); Structure–activity relationship","score_opus":0.075895808489994,"score_gpt":0.2957144855974231,"score_spread":0.21981867710742908,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931672917","genre_codex":"empirical","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9713354,0.006424939,0.006050353,0.00030089542,0.00014125809,0.0001385431,0.007879789,0.00018032483,0.0075484724],"genre_scores_gemma":[0.97288483,0.002033411,0.005206694,0.00012937195,0.000023681669,0.00007084308,0.006142285,0.000034397985,0.013474462],"study_design_codex":"bench_or_experimental","study_design_gemma":"not_applicable","domain_scores_codex":[0.999941,0.0000133631065,0.0000041666144,0.000011969019,0.000015385873,0.000014158],"domain_scores_gemma":[0.99996436,0.000006685071,0.000007834827,0.000005443556,0.0000061254873,0.000009579796],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0000851825,0.00036262223,0.00015896039,0.00024058622,0.000104666375,0.00017191772,0.00008968276,0.000181653,0.0054001706],"category_scores_gemma":[0.00010053236,0.000102215214,0.00019821481,0.00018601333,0.00008710871,0.000108289896,0.00013131573,0.0002189223,0.0008509406],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000977107,0.0000552666,0.00042667944,0.000121221296,0.000016448928,0.0002080009,0.000014974593,0.00012871578,0.9928201,0.000069364745,0.00022364497,0.004938523],"study_design_scores_gemma":[0.000078656136,0.0008917827,0.008184332,0.000018019007,0.000031688553,0.0005056817,0.000053562864,0.00036169385,0.97844553,0.00005681464,0.011365784,0.000006506979],"about_ca_topic_score_codex":0.0005562331,"about_ca_topic_score_gemma":0.0007947804,"teacher_disagreement_score":0.0054001706,"about_ca_system_score_codex":0.00011370234,"about_ca_system_score_gemma":0.00014225107,"threshold_uncertainty_score":0.018065393},"labels":[],"label_agreement":null},{"id":"W6931675262","doi":"10.5683/sp3/m2iv1y","title":"Federated Identity Management: Spring 2006","year":2006,"lang":"en","type":"dataset","venue":"Borealis","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Identity (music); Presentation (obstetrics); General partnership; Identity management; Spring (device)","score_opus":0.08751611499267774,"score_gpt":0.35519868742695326,"score_spread":0.2676825724342755,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931675262","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0033373924,0.00028235003,0.0019746374,0.00077563734,0.00024676375,0.00017371887,0.9792427,0.0036383274,0.010328432],"genre_scores_gemma":[0.0027860047,0.0001496216,0.0029311352,0.000094726725,0.000018265331,0.00021927232,0.9891131,0.00012744953,0.0045604086],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9955877,0.00096220843,0.00053704,0.00061657466,0.0018063376,0.0004900916],"domain_scores_gemma":[0.99023575,0.0011631658,0.0005665704,0.004396873,0.0029960156,0.000641539],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00738447,0.0011810248,0.0008970927,0.0035570187,0.0015194105,0.0040897685,0.0020489253,0.00095755706,0.013271365],"category_scores_gemma":[0.014105395,0.00062131375,0.0006603666,0.0066027856,0.0004669927,0.0025412394,0.0021694524,0.0024975461,0.021905912],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00011764003,0.000068931164,0.0019896012,0.00014938098,0.000010687487,0.000017762106,0.0000914549,0.00051705126,0.00010416079,0.002777053,0.97928727,0.014869017],"study_design_scores_gemma":[0.00007676969,0.000032540203,0.008961397,0.00014237952,0.0000071564764,0.000044751443,0.00017626098,0.0013711546,0.0010153126,0.0018234219,0.9863294,0.000019398243],"about_ca_topic_score_codex":0.039061375,"about_ca_topic_score_gemma":0.050930046,"teacher_disagreement_score":0.039061375,"about_ca_system_score_codex":0.0037002235,"about_ca_system_score_gemma":0.0051096748,"threshold_uncertainty_score":0.07766801},"labels":[],"label_agreement":null},{"id":"W6931747030","doi":"10.5683/sp2/lutyat","title":"Data from: Rates of hypoxia induction alter mechanisms of O2 uptake and the critical O2 tension of goldfish","year":2021,"lang":"en","type":"dataset","venue":"Borealis","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Hypoxia (environmental); Confounding; Fish <Actinopterygii>; Peripheral","score_opus":0.22109727069254453,"score_gpt":0.39117526646829454,"score_spread":0.17007799577575,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931747030","genre_codex":"empirical","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99699235,0.00016154409,0.0008071829,0.000056279045,0.000026756557,0.00005294551,0.0008757861,0.000024373883,0.0010029194],"genre_scores_gemma":[0.99110633,0.00016855923,0.0017322426,0.0001785048,0.000010640112,0.00031103566,0.0015713201,0.000036850597,0.004884578],"study_design_codex":"bench_or_experimental","study_design_gemma":"not_applicable","domain_scores_codex":[0.9996916,0.000022924783,0.000043279062,0.000092089744,0.00010226354,0.000047952955],"domain_scores_gemma":[0.99951994,0.00006811714,0.0001418124,0.00008480079,0.0001071588,0.00007827765],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00032282315,0.00030778532,0.00036207418,0.0001632384,0.00025350685,0.00031358743,0.0003810105,0.00038077592,0.005203431],"category_scores_gemma":[0.0005280617,0.00022256527,0.00040353538,0.00015117666,0.00041615078,0.00037239178,0.00057643396,0.0007110464,0.0004920545],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0026098334,0.00017293081,0.025678946,0.00029374642,0.000062276646,0.00006709776,0.0002254841,0.0001934579,0.9617858,0.00006509803,0.00039441706,0.008450906],"study_design_scores_gemma":[0.000107042986,0.0046925675,0.55946213,0.00005157782,0.00014218442,0.0001853676,0.00039884748,0.0010861979,0.42928162,0.00012876581,0.0044205096,0.00004315505],"about_ca_topic_score_codex":0.0028354146,"about_ca_topic_score_gemma":0.0046556825,"teacher_disagreement_score":0.005203431,"about_ca_system_score_codex":0.00047842765,"about_ca_system_score_gemma":0.00028359712,"threshold_uncertainty_score":0.017407179},"labels":[],"label_agreement":null},{"id":"W6931767154","doi":"10.5281/zenodo.7065821","title":"YichengDWu/Sophon.jl: v0.5.0","year":2023,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"CUDA; Code (set theory); Work (physics); Macro","score_opus":0.19229175428168743,"score_gpt":0.34275185059852215,"score_spread":0.1504600963168347,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931767154","genre_codex":"software","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0007168978,0.0003425091,0.033538904,0.00020259694,0.00031300046,0.00014997173,0.026337488,0.90727425,0.031124411],"genre_scores_gemma":[0.008900192,0.0004319001,0.027511133,0.0006885709,0.000090344016,0.0005212582,0.06970306,0.8337683,0.05838517],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99883825,0.000105714964,0.000097431825,0.0002832097,0.0003970238,0.00027849525],"domain_scores_gemma":[0.9981123,0.00023388838,0.00010038608,0.0005625894,0.00076098705,0.00022970693],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0019494828,0.0042551444,0.001823538,0.0017880219,0.000909127,0.0040706326,0.00748119,0.0025146047,0.4478517],"category_scores_gemma":[0.0057221428,0.004171855,0.002557307,0.0011555876,0.000863053,0.0043203537,0.004588015,0.004460848,0.54939866],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027483614,0.00004876458,0.00059641956,0.000611253,0.00005683178,0.000093124996,0.00014995388,0.00070588104,0.0032458173,0.0030890994,0.9573958,0.033732127],"study_design_scores_gemma":[0.00028127155,0.000074672826,0.0012407715,0.0003054368,0.000057509973,0.00026655258,0.00007127139,0.0045214887,0.018281009,0.004503786,0.9702168,0.00017944028],"about_ca_topic_score_codex":0.007856439,"about_ca_topic_score_gemma":0.00537025,"teacher_disagreement_score":0.4478517,"about_ca_system_score_codex":0.001963439,"about_ca_system_score_gemma":0.0023064404,"threshold_uncertainty_score":0.78757256},"labels":[],"label_agreement":null},{"id":"W6931916823","doi":"10.5281/zenodo.7343269","title":"Adventures with SPIRou: The APERO pipeline and LBL RV analysis tool","year":2022,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Université de Montréal","funders":"","keywords":"Pipeline (software); Outlier; Data reduction; Line (geometry); Component (thermodynamics); Reduction (mathematics)","score_opus":0.08621879554823171,"score_gpt":0.29663387015278164,"score_spread":0.21041507460454995,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931916823","genre_codex":"software","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0028417788,0.00022962781,0.38127184,0.00039084762,0.00014185341,0.00025423436,0.017769223,0.59045064,0.0066499757],"genre_scores_gemma":[0.051718235,0.0004273916,0.6825122,0.0008067787,0.00026861238,0.0011623156,0.0879316,0.15999907,0.0151738515],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9983064,0.00027337356,0.00015782796,0.00041125325,0.00066045864,0.00019070687],"domain_scores_gemma":[0.99739385,0.0007538986,0.00027431585,0.00079289894,0.0005979313,0.00018715976],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0030131068,0.0018497348,0.0011786383,0.0026386923,0.00071021845,0.0033504728,0.002507057,0.0009524835,0.037721828],"category_scores_gemma":[0.010279851,0.0012364326,0.0018689921,0.0015204803,0.0005919374,0.0026461317,0.0032625736,0.0023982727,0.03750459],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00083504297,0.00022410881,0.009084174,0.000923226,0.00031850598,0.00056425604,0.00076829223,0.0073061925,0.014423229,0.019993931,0.6321844,0.31337452],"study_design_scores_gemma":[0.00041274444,0.00014604982,0.009863489,0.00027076225,0.000106928564,0.00049462257,0.00028310902,0.17892769,0.029798537,0.050430764,0.72891366,0.0003516489],"about_ca_topic_score_codex":0.0033615238,"about_ca_topic_score_gemma":0.003594371,"teacher_disagreement_score":0.037721828,"about_ca_system_score_codex":0.0006354095,"about_ca_system_score_gemma":0.0018456717,"threshold_uncertainty_score":0.12619215},"labels":[],"label_agreement":null},{"id":"W6931924740","doi":"10.5281/zenodo.7629383","title":"Fig. 16 in Revision of the Nearctic species of the Lasioglossum (Dialictus) gemmatum species complex (Hymenoptera: Halictidae)","year":2023,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Nearctic ecozone; Species complex; Scale (ratio); Taxonomy (biology); Ecological succession","score_opus":0.15850588085818568,"score_gpt":0.31084743807642784,"score_spread":0.15234155721824216,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931924740","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.055984642,0.025093818,0.03100629,0.009174506,0.03493946,0.001810738,0.07698336,0.006045523,0.7589616],"genre_scores_gemma":[0.20977704,0.018055458,0.10191166,0.0033554384,0.0045330375,0.0017118742,0.10819009,0.0028414407,0.54962397],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9995016,0.000097608354,0.00007253056,0.000109334214,0.0001553982,0.00006351006],"domain_scores_gemma":[0.99910104,0.00008187917,0.00011324698,0.00011902388,0.00048740764,0.00009740951],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00103095,0.0008872371,0.00036319447,0.004113606,0.0012759228,0.0009969363,0.0010374853,0.00061991106,0.047619693],"category_scores_gemma":[0.0015171213,0.00029112957,0.00044830018,0.0024086093,0.001180177,0.0010707919,0.00085591007,0.0014222547,0.0247515],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00037106225,0.000052853247,0.010443056,0.0013272964,0.000043748616,0.00037370375,0.001180783,0.0004149692,0.006221177,0.008513751,0.554122,0.41693562],"study_design_scores_gemma":[0.000010782745,0.000031249332,0.011826684,0.00020504535,0.00002673807,0.00031164257,0.00024521435,0.000113152375,0.00047383856,0.00047066927,0.9862751,0.000009906163],"about_ca_topic_score_codex":0.016094634,"about_ca_topic_score_gemma":0.03357428,"teacher_disagreement_score":0.047619693,"about_ca_system_score_codex":0.0014210511,"about_ca_system_score_gemma":0.0015474594,"threshold_uncertainty_score":0.15930378},"labels":[],"label_agreement":null},{"id":"W6931969718","doi":"10.5683/sp/p8yxp5","title":"Canadian Business Patterns, December 2012 [B2020]","year":2023,"lang":"en","type":"dataset","venue":"Borealis","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Census; Metropolitan area; Subdivision; Sampling frame; Line of business; Classification scheme; Small business","score_opus":0.1196570038811735,"score_gpt":0.35295985099336336,"score_spread":0.23330284711218985,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931969718","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00009074549,0.000034356235,0.00001858378,0.00003900042,0.000009665368,0.00000632016,0.9991111,0.00007083075,0.0006193849],"genre_scores_gemma":[0.00028280224,0.000051676187,0.00012883986,0.000019790801,0.0000034521415,0.000024567556,0.9985586,0.00002432985,0.00090597017],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9980919,0.00010339094,0.00017138317,0.0003487505,0.0008621851,0.00042247857],"domain_scores_gemma":[0.9938585,0.00035750435,0.0003702911,0.0007335153,0.003974687,0.00070554356],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011139362,0.0021119267,0.0013073519,0.008911573,0.0024804873,0.004577895,0.0031836138,0.0013300439,0.0394571],"category_scores_gemma":[0.009767978,0.0010200022,0.0012727063,0.024682818,0.00055643957,0.0015035012,0.0016840134,0.0019982946,0.044184674],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000022946007,0.000008884562,0.0012649066,0.00015842819,0.00001342088,0.000013986593,0.00002386271,0.00012981734,0.000020279038,0.00051200733,0.9962161,0.0016153803],"study_design_scores_gemma":[0.00007290438,0.0000071831587,0.029129742,0.00027482698,0.000024109113,0.000035692377,0.00015653165,0.00045890195,0.00015177402,0.00050835306,0.96913034,0.000049659222],"about_ca_topic_score_codex":0.9574949,"about_ca_topic_score_gemma":0.9770707,"teacher_disagreement_score":0.042505085,"about_ca_system_score_codex":0.017053165,"about_ca_system_score_gemma":0.03219232,"threshold_uncertainty_score":0.13199717},"labels":[],"label_agreement":null},{"id":"W6939986338","doi":"10.6084/m9.figshare.c.3911695_d7","title":"Additional file 7: of Barriers and facilitators to the implementation of a school-based physical activity policy in Canada: application of the theoretical domains framework","year":2017,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Coding (social sciences); Data collection; Measure (data warehouse); Context (archaeology); Work (physics); Key (lock)","score_opus":0.04988355207348834,"score_gpt":0.3659384260501186,"score_spread":0.3160548739766303,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6939986338","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0014067139,0.000018234323,0.00024196361,0.0002424436,0.000023703155,0.0003879902,0.9945399,0.000106785774,0.0030322652],"genre_scores_gemma":[0.07533817,0.0003840846,0.010574502,0.00069393544,0.000062260675,0.012460208,0.8674678,0.0004785091,0.03254055],"study_design_codex":"not_applicable","study_design_gemma":"qualitative","domain_scores_codex":[0.9982158,0.00025184877,0.00024261742,0.00019634307,0.00064327754,0.00045016987],"domain_scores_gemma":[0.95037174,0.024350936,0.0018709518,0.0014123037,0.020546956,0.0014471128],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0035218885,0.0008693231,0.0010481742,0.004858902,0.0034530247,0.002246858,0.0026674797,0.00083477685,0.6103193],"category_scores_gemma":[0.04740556,0.0006294853,0.001370174,0.00912873,0.0005647126,0.0017655477,0.0015346688,0.001313478,0.032619674],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001427608,0.00009371637,0.013309181,0.0013652608,0.000037588845,0.000056112698,0.0006784669,0.00062395266,0.000024234605,0.00071789394,0.97052866,0.012422231],"study_design_scores_gemma":[0.003331742,0.00020961293,0.44241193,0.008447531,0.00035043943,0.0002212657,0.017675128,0.0074250135,0.0008862245,0.0047700433,0.5138877,0.000383372],"about_ca_topic_score_codex":0.9121439,"about_ca_topic_score_gemma":0.94925207,"teacher_disagreement_score":0.6103193,"about_ca_system_score_codex":0.01982648,"about_ca_system_score_gemma":0.056025654,"threshold_uncertainty_score":0.55583215},"labels":[],"label_agreement":null},{"id":"W6958274219","doi":"10.6084/m9.figshare.11960187","title":"Additional file 2 of Development, validation and application of a 3D printed model depicting adenoid hypertrophy in comparison to a Nasoendoscopy","year":2020,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Flowchart; 3d printed; Adenoid hypertrophy; Sampling (signal processing); Muscle hypertrophy","score_opus":0.1782430192798449,"score_gpt":0.3467289463942152,"score_spread":0.1684859271143703,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6958274219","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0009945916,0.000072510324,0.0024760435,0.00040751384,0.0001495728,0.0019414534,0.9878056,0.0011711494,0.0049815895],"genre_scores_gemma":[0.0547,0.0005538409,0.04032151,0.0025171766,0.0006006207,0.051963147,0.7690487,0.005108588,0.075186364],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99830675,0.00046121137,0.00041369817,0.00025543806,0.00044171404,0.00012121908],"domain_scores_gemma":[0.92977947,0.05622772,0.0025083043,0.003111414,0.0076809316,0.0006922843],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0045721973,0.0010813078,0.0011637172,0.0023226785,0.0008688101,0.0017075926,0.0017326073,0.0013294771,0.90121466],"category_scores_gemma":[0.07703999,0.0006063892,0.0011332952,0.001969792,0.0003715117,0.0014508214,0.0010826787,0.0009556035,0.14807218],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011773462,0.00021468691,0.00246337,0.0044958056,0.000049684033,0.00011313572,0.0001224554,0.0005068324,0.00011957322,0.0010640048,0.95802295,0.031650115],"study_design_scores_gemma":[0.010017504,0.0007869479,0.031114692,0.010948125,0.00040032965,0.00096018804,0.00092935475,0.003930234,0.0021192713,0.016402429,0.9221459,0.00024510876],"about_ca_topic_score_codex":0.0046099946,"about_ca_topic_score_gemma":0.009040458,"teacher_disagreement_score":0.90121466,"about_ca_system_score_codex":0.0012186285,"about_ca_system_score_gemma":0.0023592666,"threshold_uncertainty_score":0.14090532},"labels":[],"label_agreement":null},{"id":"W6958379795","doi":"10.6084/m9.figshare.13290662.v1","title":"Additional file 1 of Developing a coding taxonomy to analyze dental regulatory complaints","year":2020,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University; University of Toronto","funders":"","keywords":"Coding (social sciences); Reliability (semiconductor); Taxonomy (biology); Table (database); Data collection","score_opus":0.3230252684778103,"score_gpt":0.33593518630117825,"score_spread":0.012909917823367922,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6958379795","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0008312776,0.000016055163,0.0013968691,0.0002934576,0.000054993576,0.0015146113,0.99103606,0.00034513677,0.0045114714],"genre_scores_gemma":[0.022309897,0.000219799,0.02078743,0.0010083811,0.0002431506,0.034130223,0.8884115,0.0012749125,0.031614706],"study_design_codex":"not_applicable","study_design_gemma":"qualitative","domain_scores_codex":[0.9974988,0.00073855504,0.00058824307,0.00028134842,0.0006825438,0.00021051716],"domain_scores_gemma":[0.91024476,0.06827919,0.0053606187,0.003031459,0.012250929,0.0008330822],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.004656473,0.00086075097,0.00083532947,0.0040701493,0.0011441573,0.0012404113,0.0013925662,0.00097633275,0.8410768],"category_scores_gemma":[0.07112961,0.00051733165,0.0006736086,0.0050281775,0.00032592082,0.0017600498,0.0012365639,0.0010992808,0.13860302],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015123094,0.00012275492,0.0020090751,0.00082728144,0.00001016559,0.000026217487,0.00016593699,0.00016408041,0.000047987418,0.00073975534,0.98311436,0.012621136],"study_design_scores_gemma":[0.0028675254,0.0004406107,0.05547198,0.0043735844,0.00010742135,0.0004538179,0.0026973025,0.002807471,0.0012518704,0.015199938,0.91411453,0.00021401828],"about_ca_topic_score_codex":0.0067929174,"about_ca_topic_score_gemma":0.014254745,"teacher_disagreement_score":0.8410768,"about_ca_system_score_codex":0.0018369606,"about_ca_system_score_gemma":0.0034448842,"threshold_uncertainty_score":0.22668469},"labels":[],"label_agreement":null},{"id":"W6958384052","doi":"10.6084/m9.figshare.24309955","title":"Additional file 1 of New approaches and technical considerations in detecting outlier measurements and trajectories in longitudinal children growth data","year":2023,"lang":"en","type":"article","venue":"Open MIND","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"SickKids Foundation; University of Toronto","funders":"","keywords":"Outlier; Table (database); Anomaly detection; Cluster analysis; Measure (data warehouse); Lookup table; Section (typography); Type I and type II errors","score_opus":0.554596492596195,"score_gpt":0.40107526726793846,"score_spread":0.15352122532825657,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6958384052","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00021633178,0.000026042795,0.001852712,0.00022346043,0.00006703973,0.00030727687,0.99551696,0.0011004002,0.00068979635],"genre_scores_gemma":[0.010015576,0.00021246511,0.037091453,0.0015068109,0.00030472936,0.015215073,0.9213065,0.0045975014,0.009749917],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9957385,0.0011607743,0.0008898522,0.0009599188,0.0009281421,0.00032273983],"domain_scores_gemma":[0.8757366,0.1005735,0.0039812787,0.0077820118,0.010403025,0.0015236387],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.010399983,0.001764999,0.0015429431,0.003537602,0.0014441003,0.003083452,0.0034547383,0.002143029,0.8126724],"category_scores_gemma":[0.13840057,0.0012533887,0.001703762,0.0054600206,0.00049935794,0.0029530062,0.0023731026,0.0019067534,0.14392713],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004106566,0.00008236216,0.0030237974,0.0025055998,0.00006069062,0.00006889128,0.000111696456,0.0004434036,0.00009558288,0.00087309687,0.9786759,0.013648373],"study_design_scores_gemma":[0.007200625,0.0004032116,0.03206664,0.005801788,0.00030606284,0.00054836407,0.0007574659,0.0049710637,0.001570169,0.013159408,0.93294346,0.00027171944],"about_ca_topic_score_codex":0.008697251,"about_ca_topic_score_gemma":0.019025283,"teacher_disagreement_score":0.8126724,"about_ca_system_score_codex":0.001958203,"about_ca_system_score_gemma":0.005708456,"threshold_uncertainty_score":0.26720005},"labels":[],"label_agreement":null},{"id":"W6958470861","doi":"10.6084/m9.figshare.19335927.v1","title":"Additional file 1 of An observational cohort study of health outcomes and costs associated with early pregnancy assessment units in the UK","year":2022,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute of Health Economics; University of Alberta","funders":"","keywords":"Observational study; Cohort study; Early pregnancy factor; Pregnancy; Cohort; Retrospective cohort study","score_opus":0.36383295418599004,"score_gpt":0.4007051523165506,"score_spread":0.03687219813056053,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6958470861","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0012091954,0.000033933113,0.00019466916,0.000090703616,0.000016320508,0.0001553984,0.99706274,0.000046022982,0.0011909999],"genre_scores_gemma":[0.06722468,0.00039877114,0.0037854782,0.0008662625,0.00015035257,0.0081294365,0.89720917,0.00036240186,0.021873359],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.99801993,0.0005004243,0.00056783,0.00033246042,0.00032951034,0.00024981148],"domain_scores_gemma":[0.9508739,0.035308655,0.006310098,0.0025138378,0.004175165,0.00081829925],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0019906454,0.0006793995,0.0013027132,0.00235005,0.00091826275,0.0011422052,0.0012776107,0.0011739497,0.71130925],"category_scores_gemma":[0.053262252,0.0006851292,0.0011957485,0.0051367837,0.00035066466,0.0017272045,0.001055471,0.001010335,0.039917573],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007983813,0.00011007453,0.015242003,0.0032137523,0.00013663116,0.00009410667,0.00023803984,0.00043708633,0.00005029957,0.0013745755,0.9708581,0.00744705],"study_design_scores_gemma":[0.016492536,0.0013591329,0.37370384,0.015564194,0.0009448212,0.0016305293,0.002403866,0.003462244,0.00065076724,0.011281278,0.572068,0.0004388573],"about_ca_topic_score_codex":0.02409436,"about_ca_topic_score_gemma":0.028021354,"teacher_disagreement_score":0.71130925,"about_ca_system_score_codex":0.0016857063,"about_ca_system_score_gemma":0.0022759896,"threshold_uncertainty_score":0.41178226},"labels":[],"label_agreement":null},{"id":"W6958483370","doi":"10.6084/m9.figshare.12134709","title":"Additional file 1 of Prevalence of diabetic peripheral neuropathy in Africa: a systematic review and meta-analysis","year":2020,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Peripheral neuropathy; Diabetes mellitus; Diabetic neuropathy; Scale (ratio); MEDLINE; Quality (philosophy)","score_opus":0.2885511541966848,"score_gpt":0.32672869211839756,"score_spread":0.038177537921712745,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6958483370","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00033559758,0.000217688,0.00034875417,0.00020089828,0.000034854696,0.00064191694,0.9975109,0.00013419952,0.0005750943],"genre_scores_gemma":[0.03192395,0.0024933133,0.02324696,0.002766941,0.00042983415,0.065277904,0.85242015,0.0010318287,0.0204091],"study_design_codex":"not_applicable","study_design_gemma":"meta_analysis","domain_scores_codex":[0.9976489,0.00060534384,0.000803256,0.00041091678,0.00033393933,0.00019766824],"domain_scores_gemma":[0.92820805,0.060300134,0.005457936,0.0015610137,0.003940375,0.0005324125],"candidate_categories":["metaepi_broad","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.005174406,0.0014654093,0.002433956,0.0052016983,0.00072776945,0.0020256417,0.0021079127,0.001505016,0.8560243],"category_scores_gemma":[0.07802143,0.0010844815,0.0031366544,0.008156666,0.00039186692,0.0028136107,0.0015008549,0.0011571479,0.044164225],"study_design_candidate":"meta_analysis","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0020381277,0.00018660766,0.0048096953,0.23473962,0.001758582,0.00018779418,0.00026955616,0.0011935739,0.00022773059,0.0028801602,0.72765356,0.024054911],"study_design_scores_gemma":[0.06408486,0.0015403043,0.070813775,0.13473716,0.011027892,0.0017410711,0.0011759478,0.0050848857,0.0014414515,0.028944086,0.67882884,0.0005797751],"about_ca_topic_score_codex":0.005754411,"about_ca_topic_score_gemma":0.0125140585,"teacher_disagreement_score":0.99756604,"about_ca_system_score_codex":0.001756065,"about_ca_system_score_gemma":0.0040984284,"threshold_uncertainty_score":0.20536381},"labels":[],"label_agreement":null},{"id":"W6958634776","doi":"10.6084/m9.figshare.12072534","title":"Additional file 4 of Sedentary behavior patterns and adiposity in children: a study based on compositional data analysis","year":2020,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Children's Hospital of Eastern Ontario","funders":"","keywords":"Table (database); Compositional data; Physical activity; Sedentary behavior; Sedentary lifestyle; Data file","score_opus":0.21652186579229066,"score_gpt":0.3554182507638054,"score_spread":0.13889638497151474,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6958634776","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00061559095,0.000014704714,0.00025381424,0.000051521594,0.000009871159,0.00011637996,0.9984162,0.00007294883,0.00044893683],"genre_scores_gemma":[0.033992704,0.00020149336,0.0075101093,0.0003992526,0.00008519861,0.008125133,0.93800765,0.0005994469,0.011079024],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.99872917,0.0003065311,0.0002780986,0.00030476495,0.00023318433,0.0001481961],"domain_scores_gemma":[0.9737551,0.01960396,0.0019268896,0.0015724453,0.0026727412,0.00046882915],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0022961274,0.0010450403,0.0013263754,0.0026935132,0.001002703,0.0013551384,0.0022549683,0.0010274143,0.7563154],"category_scores_gemma":[0.042150177,0.0005941047,0.0012567483,0.0057002697,0.0002623959,0.0014492659,0.0010010016,0.00085943966,0.0530258],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008482477,0.00019835214,0.024341704,0.0054295156,0.00024412136,0.00015915486,0.00030118786,0.0007148165,0.00011389829,0.0009903279,0.95111805,0.015540685],"study_design_scores_gemma":[0.011535325,0.00081912184,0.29549286,0.011156742,0.001505097,0.0013594185,0.00275583,0.0052743787,0.001326539,0.012066233,0.65630794,0.00040040305],"about_ca_topic_score_codex":0.019945089,"about_ca_topic_score_gemma":0.020633092,"teacher_disagreement_score":0.7563154,"about_ca_system_score_codex":0.0010574869,"about_ca_system_score_gemma":0.0018706876,"threshold_uncertainty_score":0.34758645},"labels":[],"label_agreement":null},{"id":"W6958772513","doi":"10.6084/m9.figshare.14833317.v1","title":"Additional file 1 of How to analyze work productivity loss due to health problems in randomized controlled trials? A simulation study","year":2021,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Centre for Advancing Health Outcomes; University of British Columbia","funders":"","keywords":"Work (physics); Standard deviation; Binomial distribution; Productivity; Calibration; Distribution (mathematics)","score_opus":0.21223548743212642,"score_gpt":0.39869921775178757,"score_spread":0.18646373031966115,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6958772513","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00095238717,0.0001767878,0.008509492,0.0010213415,0.00016029815,0.005730529,0.973047,0.0030529874,0.0073492103],"genre_scores_gemma":[0.08769107,0.0013224394,0.14565554,0.0064045787,0.0007242739,0.18306786,0.512086,0.00853858,0.054509636],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9940826,0.0036148315,0.0009267542,0.0005379424,0.00055206136,0.00028577266],"domain_scores_gemma":[0.72385776,0.2587345,0.0057896017,0.004656039,0.005718327,0.0012437543],"candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.015523223,0.0013609864,0.0019835588,0.002201091,0.0006596665,0.0021762217,0.0021681716,0.0021710198,0.86590284],"category_scores_gemma":[0.17389804,0.0012229257,0.0024817963,0.0030184072,0.00046948664,0.0019469786,0.0012049284,0.0016308018,0.09382496],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002546375,0.00029581232,0.0024810887,0.016392915,0.0006038796,0.00015420129,0.0001380236,0.005874372,0.00010082577,0.006929863,0.93385047,0.030632112],"study_design_scores_gemma":[0.09956017,0.0022831028,0.016805248,0.018658062,0.0023859367,0.001106877,0.0003442904,0.04682653,0.0015110585,0.08671232,0.7233988,0.00040763518],"about_ca_topic_score_codex":0.0036367176,"about_ca_topic_score_gemma":0.0067533166,"teacher_disagreement_score":0.9844768,"about_ca_system_score_codex":0.002007649,"about_ca_system_score_gemma":0.0047838213,"threshold_uncertainty_score":0.19127333},"labels":[],"label_agreement":null},{"id":"W6959055379","doi":"10.7939/r3-rsd0-2690","title":"Comparison of the concordance between clinical and histopathologic diagnosis of oral mucosal lesions in an Oral Medicine graduate program and the Oral Pathology biopsy service.","year":2024,"lang":"en","type":"dissertation","venue":"University of Alberta Library","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Concordance; Medical diagnosis; Oral medicine; Gold standard (test); Biopsy; Histopathology; Oral and maxillofacial pathology; Disease; Incidence (geometry)","score_opus":0.20804367192973114,"score_gpt":0.4069750722572452,"score_spread":0.19893140032751408,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6959055379","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99504495,0.00069163425,0.00025894924,0.00009853203,0.00001528374,0.000068124726,0.0020776424,0.00001916016,0.0017258114],"genre_scores_gemma":[0.9973163,0.00014010527,0.00048545707,0.000021436124,0.0000088378,0.000025436882,0.0018159194,0.000004990567,0.00018159141],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9911198,0.0021958614,0.0011526375,0.000855742,0.0041082315,0.0005676541],"domain_scores_gemma":[0.9646476,0.011731426,0.013099426,0.0014191446,0.0074972007,0.0016052546],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008487229,0.00021687818,0.00033238047,0.005371618,0.000463941,0.0012010947,0.0014603045,0.000446757,0.0010304762],"category_scores_gemma":[0.033906966,0.0003348952,0.00024467355,0.004554194,0.0005893795,0.00057254167,0.0016248742,0.0003358803,0.00027298465],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001398374,0.000016413238,0.9961389,0.000055995195,0.00004025002,0.00009598189,0.00040358183,0.000047233287,0.000114404516,0.000030238414,0.00023812815,0.0026790237],"study_design_scores_gemma":[0.0000058137416,0.00004028738,0.9978492,0.000033553544,0.000022378485,0.00027141138,0.00096714665,0.00025442673,0.00015606209,0.00001616412,0.00037910993,0.0000044070052],"about_ca_topic_score_codex":0.046002198,"about_ca_topic_score_gemma":0.08236034,"teacher_disagreement_score":0.046002198,"about_ca_system_score_codex":0.0024906218,"about_ca_system_score_gemma":0.0027634206,"threshold_uncertainty_score":0.09146887},"labels":[],"label_agreement":null},{"id":"W6961256053","doi":"10.1371/journal.pone.0315590.s009","title":"Study quality evaluation via the Newcastle-Ottawa scale.","year":2024,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Quality (philosophy); Data collection; Quality assurance; Data quality; Quality assessment","score_opus":0.605830071897582,"score_gpt":0.5189129255716202,"score_spread":0.08691714632596181,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6961256053","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.35319296,0.0625799,0.3407364,0.0060389764,0.001858085,0.087337196,0.07734896,0.002045048,0.0688625],"genre_scores_gemma":[0.78460425,0.0067692474,0.13524735,0.00078668783,0.00018653594,0.0517526,0.016206454,0.00027122977,0.0041756216],"study_design_codex":"observational","study_design_gemma":"not_applicable","domain_scores_codex":[0.7971914,0.10055325,0.060528602,0.005640084,0.034779247,0.0013074421],"domain_scores_gemma":[0.56668246,0.26106852,0.053339977,0.03070313,0.08380148,0.0044044824],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.17289029,0.00051600486,0.0029453184,0.008649112,0.001280068,0.0023297977,0.0021029378,0.0007385939,0.0053582797],"category_scores_gemma":[0.32523182,0.00050914363,0.005778427,0.0068503735,0.0017348083,0.0025727812,0.0032071827,0.0017621742,0.00060741097],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.006235226,0.0006424909,0.48563564,0.044195022,0.016685849,0.00023388452,0.0122083295,0.0044045774,0.0018201333,0.011662247,0.06878232,0.3474943],"study_design_scores_gemma":[0.0018072197,0.0036999737,0.83824015,0.0144191,0.007874037,0.0007364731,0.005309891,0.009917633,0.0033297795,0.012107104,0.101879686,0.0006789339],"about_ca_topic_score_codex":0.008130259,"about_ca_topic_score_gemma":0.020689245,"teacher_disagreement_score":0.8271097,"about_ca_system_score_codex":0.0040991856,"about_ca_system_score_gemma":0.010876755,"threshold_uncertainty_score":0.91434216},"labels":[],"label_agreement":null},{"id":"W6976708570","doi":"10.6084/m9.figshare.12233396","title":"NOS","year":2020,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Scale (ratio); Field (mathematics); Process (computing)","score_opus":0.5584769089976009,"score_gpt":0.40391553303996286,"score_spread":0.15456137595763808,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6976708570","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0136326,0.0045702634,0.01608244,0.019091936,0.02064925,0.0116570275,0.17339452,0.0023877406,0.73853415],"genre_scores_gemma":[0.11467763,0.0055333944,0.035893794,0.02095924,0.00417932,0.02928538,0.19052084,0.0023062683,0.59664404],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9816929,0.006620205,0.0042526596,0.0015861405,0.0049945195,0.0008536349],"domain_scores_gemma":[0.95411766,0.010468452,0.0041526775,0.008812531,0.019897388,0.002551334],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.013266016,0.0005617536,0.00108533,0.002819533,0.0021313173,0.0032305585,0.0023890724,0.0019004134,0.40909198],"category_scores_gemma":[0.08595187,0.00046908,0.0011074329,0.0017518947,0.0009724684,0.0031263358,0.003103321,0.0018549972,0.1923153],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00038647762,0.00011694037,0.008349542,0.0016781883,0.00005709424,0.00027030244,0.0006539158,0.00009806422,0.0002093839,0.013591791,0.86306083,0.1115275],"study_design_scores_gemma":[0.00013778028,0.0000747011,0.008182971,0.0014979977,0.000034222285,0.0005479518,0.00046421756,0.00014840512,0.00012526568,0.006555423,0.98218334,0.00004771801],"about_ca_topic_score_codex":0.00436331,"about_ca_topic_score_gemma":0.008007012,"teacher_disagreement_score":0.59090805,"about_ca_system_score_codex":0.0017530316,"about_ca_system_score_gemma":0.0066200295,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W6976956266","doi":"10.6084/m9.figshare.11960187.v1","title":"Additional file 2 of Development, validation and application of a 3D printed model depicting adenoid hypertrophy in comparison to a Nasoendoscopy","year":2020,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Flowchart; 3d printed; Adenoid hypertrophy; Sampling (signal processing); Muscle hypertrophy","score_opus":0.1782430192798449,"score_gpt":0.3467289463942152,"score_spread":0.1684859271143703,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6976956266","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0009945916,0.000072510324,0.0024760435,0.00040751384,0.0001495728,0.0019414534,0.9878056,0.0011711494,0.0049815895],"genre_scores_gemma":[0.0547,0.0005538409,0.04032151,0.0025171766,0.0006006207,0.051963147,0.7690487,0.005108588,0.075186364],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99830675,0.00046121137,0.00041369817,0.00025543806,0.00044171404,0.00012121908],"domain_scores_gemma":[0.92977947,0.05622772,0.0025083043,0.003111414,0.0076809316,0.0006922843],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0045721973,0.0010813078,0.0011637172,0.0023226785,0.0008688101,0.0017075926,0.0017326073,0.0013294771,0.90121466],"category_scores_gemma":[0.07703999,0.0006063892,0.0011332952,0.001969792,0.0003715117,0.0014508214,0.0010826787,0.0009556035,0.14807218],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011773462,0.00021468691,0.00246337,0.0044958056,0.000049684033,0.00011313572,0.0001224554,0.0005068324,0.00011957322,0.0010640048,0.95802295,0.031650115],"study_design_scores_gemma":[0.010017504,0.0007869479,0.031114692,0.010948125,0.00040032965,0.00096018804,0.00092935475,0.003930234,0.0021192713,0.016402429,0.9221459,0.00024510876],"about_ca_topic_score_codex":0.0046099946,"about_ca_topic_score_gemma":0.009040458,"teacher_disagreement_score":0.90121466,"about_ca_system_score_codex":0.0012186285,"about_ca_system_score_gemma":0.0023592666,"threshold_uncertainty_score":0.14090532},"labels":[],"label_agreement":null},{"id":"W6977002126","doi":"10.6084/m9.figshare.26600314","title":"Additional file 9 of MetaPro: a scalable and reproducible data processing and analysis pipeline for metatranscriptomic investigation of microbial communities","year":2024,"lang":"en","type":"dataset","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto; SickKids Foundation; Hospital for Sick Children","funders":"","keywords":"Pipeline (software); Table (database); Scalability; Set (abstract data type); Data set; Data processing","score_opus":0.29670691952791073,"score_gpt":0.3689802987462378,"score_spread":0.07227337921832705,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6977002126","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00008264188,0.000010813391,0.0002323111,0.00003062869,0.000013833333,0.000022493987,0.9983291,0.0010593941,0.00021882691],"genre_scores_gemma":[0.0009107551,0.000025237181,0.001990033,0.00008021033,0.000012802126,0.00028711552,0.9954333,0.0006267063,0.000633925],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9982351,0.00022739652,0.00024478682,0.00064484763,0.0004164317,0.0002314178],"domain_scores_gemma":[0.9931874,0.0037990806,0.00046446605,0.0011356706,0.0009988038,0.00041450205],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0034293286,0.0028583289,0.001747893,0.0033132208,0.001379584,0.0032526397,0.0037630124,0.0022493384,0.4152962],"category_scores_gemma":[0.016742999,0.0011329212,0.0021149365,0.0042746677,0.0006757118,0.002670696,0.0024667343,0.002198488,0.15974724],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002368792,0.00005600966,0.0023685289,0.0017764586,0.00008344786,0.000056758752,0.000053893098,0.0005938294,0.00056901155,0.0005987454,0.98928356,0.0043229414],"study_design_scores_gemma":[0.0018883529,0.00014090477,0.01305232,0.0011208646,0.00018177794,0.00026217542,0.00023806986,0.0032154883,0.0036980617,0.007786623,0.96822315,0.00019224567],"about_ca_topic_score_codex":0.00968441,"about_ca_topic_score_gemma":0.020415429,"teacher_disagreement_score":0.4152962,"about_ca_system_score_codex":0.0016612309,"about_ca_system_score_gemma":0.0032083842,"threshold_uncertainty_score":0.834009},"labels":[],"label_agreement":null},{"id":"W6977218444","doi":"10.6084/m9.figshare.24309955.v1","title":"Additional file 1 of New approaches and technical considerations in detecting outlier measurements and trajectories in longitudinal children growth data","year":2023,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"SickKids Foundation; University of Toronto","funders":"","keywords":"Outlier; Table (database); Anomaly detection; Cluster analysis; Measure (data warehouse); Lookup table; Section (typography); Type I and type II errors","score_opus":0.5566174924804334,"score_gpt":0.3690764838847402,"score_spread":0.18754100859569317,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6977218444","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00021633178,0.000026042795,0.001852712,0.00022346043,0.00006703973,0.00030727687,0.99551696,0.0011004002,0.00068979635],"genre_scores_gemma":[0.010015576,0.00021246511,0.037091453,0.0015068109,0.00030472936,0.015215073,0.9213065,0.0045975014,0.009749917],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9957385,0.0011607743,0.0008898522,0.0009599188,0.0009281421,0.00032273983],"domain_scores_gemma":[0.8757366,0.1005735,0.0039812787,0.0077820118,0.010403025,0.0015236387],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.010399983,0.001764999,0.0015429431,0.003537602,0.0014441003,0.003083452,0.0034547383,0.002143029,0.8126724],"category_scores_gemma":[0.13840057,0.0012533887,0.001703762,0.0054600206,0.00049935794,0.0029530062,0.0023731026,0.0019067534,0.14392713],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004106566,0.00008236216,0.0030237974,0.0025055998,0.00006069062,0.00006889128,0.000111696456,0.0004434036,0.00009558288,0.00087309687,0.9786759,0.013648373],"study_design_scores_gemma":[0.007200625,0.0004032116,0.03206664,0.005801788,0.00030606284,0.00054836407,0.0007574659,0.0049710637,0.001570169,0.013159408,0.93294346,0.00027171944],"about_ca_topic_score_codex":0.008697251,"about_ca_topic_score_gemma":0.019025283,"teacher_disagreement_score":0.8126724,"about_ca_system_score_codex":0.001958203,"about_ca_system_score_gemma":0.005708456,"threshold_uncertainty_score":0.26720005},"labels":[],"label_agreement":null},{"id":"W6977232621","doi":"10.6084/m9.figshare.c.3911695_d7.v1","title":"Additional file 7: of Barriers and facilitators to the implementation of a school-based physical activity policy in Canada: application of the theoretical domains framework","year":2017,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Coding (social sciences); Data collection; Measure (data warehouse); Context (archaeology); Work (physics); Key (lock)","score_opus":0.04988355207348834,"score_gpt":0.3659384260501186,"score_spread":0.3160548739766303,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6977232621","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0014067139,0.000018234323,0.00024196361,0.0002424436,0.000023703155,0.0003879902,0.9945399,0.000106785774,0.0030322652],"genre_scores_gemma":[0.07533817,0.0003840846,0.010574502,0.00069393544,0.000062260675,0.012460208,0.8674678,0.0004785091,0.03254055],"study_design_codex":"not_applicable","study_design_gemma":"qualitative","domain_scores_codex":[0.9982158,0.00025184877,0.00024261742,0.00019634307,0.00064327754,0.00045016987],"domain_scores_gemma":[0.95037174,0.024350936,0.0018709518,0.0014123037,0.020546956,0.0014471128],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0035218885,0.0008693231,0.0010481742,0.004858902,0.0034530247,0.002246858,0.0026674797,0.00083477685,0.6103193],"category_scores_gemma":[0.04740556,0.0006294853,0.001370174,0.00912873,0.0005647126,0.0017655477,0.0015346688,0.001313478,0.032619674],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001427608,0.00009371637,0.013309181,0.0013652608,0.000037588845,0.000056112698,0.0006784669,0.00062395266,0.000024234605,0.00071789394,0.97052866,0.012422231],"study_design_scores_gemma":[0.003331742,0.00020961293,0.44241193,0.008447531,0.00035043943,0.0002212657,0.017675128,0.0074250135,0.0008862245,0.0047700433,0.5138877,0.000383372],"about_ca_topic_score_codex":0.9121439,"about_ca_topic_score_gemma":0.94925207,"teacher_disagreement_score":0.6103193,"about_ca_system_score_codex":0.01982648,"about_ca_system_score_gemma":0.056025654,"threshold_uncertainty_score":0.55583215},"labels":[],"label_agreement":null},{"id":"W6977304791","doi":"10.6084/m9.figshare.19335927","title":"Additional file 1 of An observational cohort study of health outcomes and costs associated with early pregnancy assessment units in the UK","year":2022,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute of Health Economics; University of Alberta","funders":"","keywords":"Observational study; Cohort study; Early pregnancy factor; Pregnancy; Cohort; Retrospective cohort study","score_opus":0.36383295418599004,"score_gpt":0.4007051523165506,"score_spread":0.03687219813056053,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6977304791","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0012091954,0.000033933113,0.00019466916,0.000090703616,0.000016320508,0.0001553984,0.99706274,0.000046022982,0.0011909999],"genre_scores_gemma":[0.06722468,0.00039877114,0.0037854782,0.0008662625,0.00015035257,0.0081294365,0.89720917,0.00036240186,0.021873359],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.99801993,0.0005004243,0.00056783,0.00033246042,0.00032951034,0.00024981148],"domain_scores_gemma":[0.9508739,0.035308655,0.006310098,0.0025138378,0.004175165,0.00081829925],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0019906454,0.0006793995,0.0013027132,0.00235005,0.00091826275,0.0011422052,0.0012776107,0.0011739497,0.71130925],"category_scores_gemma":[0.053262252,0.0006851292,0.0011957485,0.0051367837,0.00035066466,0.0017272045,0.001055471,0.001010335,0.039917573],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007983813,0.00011007453,0.015242003,0.0032137523,0.00013663116,0.00009410667,0.00023803984,0.00043708633,0.00005029957,0.0013745755,0.9708581,0.00744705],"study_design_scores_gemma":[0.016492536,0.0013591329,0.37370384,0.015564194,0.0009448212,0.0016305293,0.002403866,0.003462244,0.00065076724,0.011281278,0.572068,0.0004388573],"about_ca_topic_score_codex":0.02409436,"about_ca_topic_score_gemma":0.028021354,"teacher_disagreement_score":0.71130925,"about_ca_system_score_codex":0.0016857063,"about_ca_system_score_gemma":0.0022759896,"threshold_uncertainty_score":0.41178226},"labels":[],"label_agreement":null},{"id":"W6977890608","doi":"10.6084/m9.figshare.12476702","title":"Additional file 1 of Using multiple agreement methods for continuous repeated measures data: a tutorial for practitioners","year":2020,"lang":"en","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Measure (data warehouse); Data file; Data collection; Term (time)","score_opus":0.6110904157845687,"score_gpt":0.4802538677778531,"score_spread":0.13083654800671557,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6977890608","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0004222505,0.00012504512,0.0108967,0.0007587791,0.00016489593,0.0011373664,0.9780147,0.0041413563,0.004338937],"genre_scores_gemma":[0.026185423,0.0012557862,0.12809443,0.0042545586,0.00088730355,0.044302,0.7212293,0.018021679,0.05576945],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99475986,0.002315789,0.0009497192,0.000669119,0.0010060004,0.00029958377],"domain_scores_gemma":[0.6957983,0.27495635,0.0055827117,0.008589265,0.013582236,0.0014911349],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.013512793,0.0015118876,0.0017818189,0.004131364,0.0010151279,0.00243589,0.00286636,0.0020786468,0.9042086],"category_scores_gemma":[0.20834972,0.0014995534,0.0015808104,0.0056883637,0.00055959437,0.003731392,0.0017923042,0.0019243024,0.23373078],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00036637724,0.00010886122,0.0009229232,0.0040309858,0.000053879987,0.00005694916,0.000103486025,0.00042709,0.00006527884,0.0016554093,0.96318686,0.029021854],"study_design_scores_gemma":[0.005009028,0.0004283997,0.012556653,0.008734429,0.00032919896,0.0008104053,0.0006038809,0.0038538938,0.0010459897,0.051152993,0.91516805,0.00030704244],"about_ca_topic_score_codex":0.003037194,"about_ca_topic_score_gemma":0.005692918,"teacher_disagreement_score":0.9042086,"about_ca_system_score_codex":0.0013616314,"about_ca_system_score_gemma":0.0039670756,"threshold_uncertainty_score":0.13663483},"labels":[],"label_agreement":null},{"id":"W7000381172","doi":"","title":"On estimation of the four-parameter kappa distribution","year":2000,"lang":"en","type":"other","venue":"Library and Archives Canada (Government of Canada)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Distribution (mathematics); Estimation; Kappa; Measure (data warehouse); Cohen's kappa","score_opus":0.016595010817677364,"score_gpt":0.19865254961267975,"score_spread":0.1820575387950024,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7000381172","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015457595,0.0008878442,0.9769041,0.00062806427,0.000055563654,0.00015279389,0.00023770107,0.00044400658,0.0052323397],"genre_scores_gemma":[0.37811288,0.0019267782,0.61222446,0.00034333096,0.00016467276,0.00061171106,0.0014217284,0.0004992721,0.004695242],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.96066254,0.03142984,0.0010106389,0.0019540405,0.004195843,0.00074705627],"domain_scores_gemma":[0.7455047,0.23290065,0.002937073,0.008666102,0.009247738,0.0007437083],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.056516953,0.0013909234,0.0023228917,0.0062231263,0.0020824405,0.0039700973,0.0045403927,0.0022586423,0.0046817027],"category_scores_gemma":[0.27600592,0.0013104747,0.0016929851,0.007256987,0.005998678,0.0046153255,0.0048923884,0.0042158403,0.001389606],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00029161965,0.0000899605,0.023832882,0.0004919489,0.00043394594,0.00020209789,0.0022558745,0.13976441,0.00067930075,0.3156946,0.011843324,0.5044201],"study_design_scores_gemma":[0.000067766465,0.000049995884,0.017502846,0.00047284554,0.00012644514,0.00026159096,0.0010754436,0.40648448,0.0010824027,0.56600064,0.006714933,0.00016067702],"about_ca_topic_score_codex":0.12183267,"about_ca_topic_score_gemma":0.07941079,"teacher_disagreement_score":0.12183267,"about_ca_system_score_codex":0.005182876,"about_ca_system_score_gemma":0.00848873,"threshold_uncertainty_score":0.2988938},"labels":[],"label_agreement":null},{"id":"W7001214307","doi":"","title":"Interobserver agreement in grading of colorectal cancer - findings from a nation-wide web-based survey of histopathologists","year":2009,"lang":"en","type":"article","venue":"","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute of Population and Public Health","funders":"","keywords":"Colorectal cancer; Grading (engineering); Neoplasm staging; MEDLINE","score_opus":0.19801129263271033,"score_gpt":0.3727435666499713,"score_spread":0.174732274017261,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7001214307","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99386555,0.00031158226,0.0034469485,0.00006201114,0.00004284242,0.000077344834,0.00032546098,0.000052992706,0.0018152486],"genre_scores_gemma":[0.9973991,0.000075976655,0.0018327077,0.000029982895,0.0000133902295,0.00004527994,0.00043374396,0.000015442056,0.00015437706],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.96283925,0.021792926,0.005708557,0.0023522815,0.006480108,0.0008269094],"domain_scores_gemma":[0.88965505,0.06874871,0.010950647,0.008826549,0.020500453,0.0013186435],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.032112427,0.00029944643,0.0006358733,0.0031571533,0.00073825265,0.0013691866,0.0008596964,0.00084938284,0.00076696154],"category_scores_gemma":[0.07950219,0.00038213521,0.0009877679,0.0015328155,0.0007758796,0.0013054189,0.0022585348,0.00054764916,0.00039557822],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004923854,0.00007602831,0.9844418,0.000103858234,0.0004136908,0.000045825513,0.002096643,0.00032393253,0.0011245073,0.00007437917,0.00031561792,0.010491297],"study_design_scores_gemma":[0.000028952218,0.00023941319,0.99164635,0.000053779862,0.00021842457,0.00028616947,0.0018754463,0.0035551623,0.0012564954,0.00016850959,0.00064162776,0.000029581195],"about_ca_topic_score_codex":0.0027491644,"about_ca_topic_score_gemma":0.005698632,"teacher_disagreement_score":0.032112427,"about_ca_system_score_codex":0.0006285935,"about_ca_system_score_gemma":0.00062848924,"threshold_uncertainty_score":0.16982883},"labels":[],"label_agreement":null},{"id":"W7017358622","doi":"","title":"Arrhythmia risk associated with the use of bronchodilators in patients with chronic obstructive pulmonary disease : cohort studies and methodological issues","year":2008,"lang":"en","type":"dissertation","venue":"eScholarship@McGill (McGill)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"McGill University","keywords":"COPD; Ipratropium bromide; Cohort; Pulmonary disease; Cohort study; Disease; Tiotropium bromide; Cardiac arrhythmia","score_opus":0.1250337899961993,"score_gpt":0.33541205763739645,"score_spread":0.21037826764119716,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7017358622","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.96410495,0.005994341,0.019488541,0.0032874765,0.00031155118,0.0009469448,0.0023670776,0.000031751897,0.0034673265],"genre_scores_gemma":[0.98638153,0.00088165625,0.009284179,0.000694634,0.000107008615,0.0009791538,0.0009449203,0.000026083664,0.00070076843],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.89317304,0.082334496,0.0105082225,0.0056638215,0.0068479204,0.0014725439],"domain_scores_gemma":[0.78374285,0.14108716,0.027867403,0.03543228,0.010388709,0.001481681],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.097092286,0.00064148917,0.0010104943,0.0016189897,0.0015932695,0.002443546,0.00283399,0.0013713163,0.0008549311],"category_scores_gemma":[0.22442606,0.0008501621,0.002875779,0.0040509216,0.0019063432,0.0012867361,0.0018280864,0.0017376067,0.00017852987],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00040121085,0.00004435975,0.988461,0.00013223951,0.0021076717,0.00006557422,0.0014784794,0.00038896463,0.00012546196,0.0008445313,0.00050234434,0.0054482776],"study_design_scores_gemma":[0.0001961074,0.00048006812,0.98390424,0.0004430654,0.002672704,0.0003204101,0.0023080506,0.0033653963,0.0008651509,0.0019856216,0.0033790513,0.00008015868],"about_ca_topic_score_codex":0.09066118,"about_ca_topic_score_gemma":0.07415273,"teacher_disagreement_score":0.9029077,"about_ca_system_score_codex":0.0021746887,"about_ca_system_score_gemma":0.003043859,"threshold_uncertainty_score":0.51347923},"labels":[],"label_agreement":null},{"id":"W7017895069","doi":"","title":"Comparison of Two Dependent within Subject Coefficients of Variation to Evaluate the Reproducibility of Measurement Devices","year":2008,"lang":"en","type":"article","venue":"Scholarship@Western (Western University)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Reproducibility; Reliability (semiconductor); Coefficient of variation; Statistical power; Statistical hypothesis testing; Sample size determination; Monte Carlo method; Sample (material); Regression analysis","score_opus":0.45195550238889165,"score_gpt":0.4384273986723294,"score_spread":0.013528103716562268,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7017895069","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.15540345,0.00206717,0.8357941,0.00022255788,0.00038366343,0.0009839206,0.0009939962,0.00058514514,0.0035660102],"genre_scores_gemma":[0.7390404,0.00046687803,0.25581688,0.00020299519,0.00014783011,0.0018030438,0.0012031266,0.00036938483,0.00094949635],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.94374514,0.035969354,0.0031047442,0.0059713167,0.010603749,0.00060562504],"domain_scores_gemma":[0.7017459,0.25734892,0.011751897,0.017482735,0.010822782,0.0008476485],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.07002945,0.001225722,0.0011067573,0.0038265805,0.0006431748,0.0015445292,0.0018330887,0.0020156328,0.0026685225],"category_scores_gemma":[0.18056132,0.0003479565,0.002117359,0.002859305,0.0021732831,0.0013074696,0.0015096723,0.0017963124,0.00063203264],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.003762578,0.001779776,0.35639155,0.0026840302,0.007937679,0.00091150607,0.0025830646,0.097547755,0.039673794,0.0364994,0.0077624894,0.44246635],"study_design_scores_gemma":[0.00051128713,0.009845482,0.4389716,0.00060871016,0.0019814083,0.0033221692,0.0009462548,0.3997692,0.07446418,0.050215013,0.018621832,0.0007429262],"about_ca_topic_score_codex":0.0007834264,"about_ca_topic_score_gemma":0.0006386504,"teacher_disagreement_score":0.92997056,"about_ca_system_score_codex":0.00085016666,"about_ca_system_score_gemma":0.0011856451,"threshold_uncertainty_score":0.37035555},"labels":[],"label_agreement":null},{"id":"W7034376527","doi":"","title":"Validation of water vapour profiles (version 13) retrieved by the IMK/IAA scientific retrieval processor based on full resolution spectra measrued by MIPAS on board ENVISAT","year":2009,"lang":"en","type":"article","venue":"JuSER (Forschungszentrum Jülich)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Canadian Space Agency; Ministry of Education, India; Bundesministerium für Bildung und Forschung","keywords":"Water vapor; Resolution (logic); Calibration; Spectral line; On board; High resolution","score_opus":0.045279761892022624,"score_gpt":0.29059089321575293,"score_spread":0.2453111313237303,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7034376527","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9629372,0.00032088472,0.02454893,0.00011949148,0.00011553206,0.00013079552,0.006484099,0.0024260997,0.0029169782],"genre_scores_gemma":[0.94992024,0.00015924318,0.03836405,0.000081987935,0.00002325609,0.00009588277,0.010299752,0.0003947342,0.00066090946],"study_design_codex":"bench_or_experimental","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99895513,0.00017714626,0.00009401117,0.00029602853,0.00036181512,0.000115916606],"domain_scores_gemma":[0.9985347,0.00018763938,0.00018925667,0.00035821527,0.00061830424,0.000111978356],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0027441606,0.00081078743,0.0005987547,0.0015484019,0.0006180509,0.0011567395,0.00094459794,0.000958853,0.0011957432],"category_scores_gemma":[0.0034478568,0.00037494538,0.0008400405,0.0015287998,0.00042555243,0.0014979708,0.0008006914,0.00070859893,0.0016360709],"study_design_candidate":"bench_or_experimental","study_design_consensus":"bench_or_experimental","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0041921274,0.001246081,0.26511103,0.00051828596,0.0011438815,0.0005328952,0.0005768236,0.08127575,0.41703817,0.0011402178,0.008224223,0.21900049],"study_design_scores_gemma":[0.000424482,0.00058147265,0.38898957,0.000090223104,0.00043245347,0.00020900012,0.00027435226,0.4393096,0.16248956,0.0005752606,0.006479488,0.00014450082],"about_ca_topic_score_codex":0.013716796,"about_ca_topic_score_gemma":0.013682944,"teacher_disagreement_score":0.013716796,"about_ca_system_score_codex":0.0005263411,"about_ca_system_score_gemma":0.0011142843,"threshold_uncertainty_score":0.027273893},"labels":[],"label_agreement":null},{"id":"W7036192077","doi":"","title":"Bibliometric Analysis on GABA-A Receptors Research Based on CiteSpace and VOSviewer","year":2023,"lang":"en","type":"article","venue":"DOAJ (DOAJ: Directory of Open Access Journals)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Bibliometrics; Web of science; Scientometrics; Chinese academy of sciences; DECIPHER; Anxiety","score_opus":0.7385120060079285,"score_gpt":0.674947508126148,"score_spread":0.06356449788178054,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7036192077","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6422435,0.13635482,0.019789528,0.0040159454,0.0009886788,0.0031112474,0.13124745,0.0021587738,0.060090087],"genre_scores_gemma":[0.9229047,0.030879155,0.010228164,0.0001336332,0.00064543413,0.0019535567,0.03136007,0.00012382293,0.0017715576],"study_design_codex":"observational","study_design_gemma":"not_applicable","domain_scores_codex":[0.9754022,0.004140042,0.005936263,0.0017643545,0.011942906,0.000814242],"domain_scores_gemma":[0.92652977,0.047912974,0.013130511,0.0018958512,0.009507866,0.0010230042],"candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.012945102,0.0014218898,0.0034054692,0.2184693,0.0011885122,0.0060357703,0.0013809386,0.00085127965,0.006338741],"category_scores_gemma":[0.06715856,0.000328197,0.0038215746,0.26386943,0.0011939291,0.005016688,0.0029538458,0.0006847757,0.00095526397],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00050004333,0.0002985354,0.55951464,0.049020812,0.008331541,0.0011335834,0.004557831,0.0059926165,0.0016607681,0.011303836,0.028679721,0.32900608],"study_design_scores_gemma":[0.00024345827,0.00045298287,0.84490985,0.010461528,0.01004371,0.0018979581,0.008830039,0.02444664,0.0032034647,0.015731946,0.079302445,0.0004760608],"about_ca_topic_score_codex":0.0039765225,"about_ca_topic_score_gemma":0.00457763,"teacher_disagreement_score":0.7815307,"about_ca_system_score_codex":0.002745851,"about_ca_system_score_gemma":0.0042852834,"threshold_uncertainty_score":0.06846106},"labels":[],"label_agreement":null},{"id":"W7095506909","doi":"","title":"Selective and Automatic editing with CADI-applications","year":2011,"lang":"en","type":"article","venue":"","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Benchmark (surveying); Selection (genetic algorithm); Inclusion (mineral); Baseline (sea); Image editing","score_opus":0.16645321318107173,"score_gpt":0.3371844289019,"score_spread":0.17073121572082825,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7095506909","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008464024,0.0006720774,0.80963993,0.0023866808,0.0012554287,0.0010282176,0.0022600668,0.1493598,0.024933835],"genre_scores_gemma":[0.11557099,0.00065726734,0.811304,0.001442939,0.001046682,0.0015520271,0.00380769,0.028675482,0.03594291],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9698916,0.012348668,0.003387306,0.0045022233,0.008578548,0.001291617],"domain_scores_gemma":[0.8150565,0.10590357,0.006735566,0.043861423,0.026298845,0.0021440694],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.032039408,0.0018063181,0.0014223503,0.007091337,0.0018658707,0.008343149,0.004339538,0.0019928254,0.04602106],"category_scores_gemma":[0.2101895,0.0015934927,0.0013744491,0.004923573,0.0021241747,0.005100958,0.0059551103,0.0030768556,0.030563807],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009547452,0.00017461764,0.0052316748,0.00088482304,0.00013178431,0.0007796536,0.0032101667,0.0030727796,0.008915846,0.036340155,0.2004378,0.7398659],"study_design_scores_gemma":[0.00029675473,0.0003210782,0.008478142,0.00070789584,0.00011078169,0.0023129054,0.0013623341,0.084044375,0.04643485,0.07874733,0.776702,0.00048165777],"about_ca_topic_score_codex":0.0018369787,"about_ca_topic_score_gemma":0.0025918114,"teacher_disagreement_score":0.04602106,"about_ca_system_score_codex":0.0014380458,"about_ca_system_score_gemma":0.0026556863,"threshold_uncertainty_score":0.1694426},"labels":[],"label_agreement":null},{"id":"W7099412294","doi":"","title":"Contributors","year":2003,"lang":"en","type":"article","venue":"","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Christian ministry; Work (physics); Government (linguistics); Agriculture; Local government","score_opus":0.23506219794522168,"score_gpt":0.40688131997094334,"score_spread":0.17181912202572167,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7099412294","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.003973419,0.0061099115,0.003000195,0.08495329,0.056408796,0.0016119856,0.03330191,0.0016978534,0.8089427],"genre_scores_gemma":[0.00725342,0.0021589675,0.0013370529,0.0067437724,0.002168269,0.00031653655,0.00716272,0.00041773022,0.9724416],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9956052,0.000337045,0.00015850477,0.00046919272,0.0028020344,0.0006279253],"domain_scores_gemma":[0.9713316,0.0009743258,0.00040211566,0.0010295521,0.02234008,0.003922384],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0030953474,0.00082109706,0.00065173424,0.0038929102,0.006300682,0.0062870565,0.002063477,0.0018277072,0.3361461],"category_scores_gemma":[0.022461304,0.00037974678,0.00042449596,0.0035703087,0.001130268,0.0020574734,0.0026486737,0.0016500831,0.14075021],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000010617665,0.000003797199,0.0003066175,0.000051151725,8.573584e-7,0.00004665397,0.0003631418,0.000014034471,0.00004372277,0.0013129085,0.98208284,0.015763717],"study_design_scores_gemma":[0.0000019170038,0.0000013011883,0.00049423776,0.000055845798,0.0000011279267,0.000029868224,0.00035696977,0.000009825891,0.000018378883,0.00014417683,0.99888307,0.0000032353341],"about_ca_topic_score_codex":0.40922475,"about_ca_topic_score_gemma":0.6047301,"teacher_disagreement_score":0.6638539,"about_ca_system_score_codex":0.022976097,"about_ca_system_score_gemma":0.031992946,"threshold_uncertainty_score":0.94690704},"labels":[],"label_agreement":null},{"id":"W7110938138","doi":"10.1371/journal.pntd.0013073.s002","title":"NEWCASTLE—OTTAWA QUALITY ASSESSMENT SCALE for cohort studies.","year":2025,"lang":"","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Cohort; Scale (ratio); Quality (philosophy); Quality assessment; Cohort study","score_opus":0.5112718175797546,"score_gpt":0.5431478145066313,"score_spread":0.031875996926876704,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7110938138","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":"evaluation","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"evaluation","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.041131727,0.21453789,0.15773432,0.015216455,0.006160671,0.055075236,0.4604099,0.003002978,0.046730816],"genre_scores_gemma":[0.33231032,0.04527889,0.26465237,0.0041153585,0.0011108385,0.12262179,0.21656153,0.0009887596,0.012360072],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.89127254,0.0431442,0.037485037,0.004651581,0.022196302,0.0012504149],"domain_scores_gemma":[0.6455098,0.16989072,0.053709712,0.018889757,0.10756138,0.004438669],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.09505193,0.0010164556,0.0053851116,0.0081381425,0.001989544,0.0027680763,0.004846012,0.0016045031,0.0092953],"category_scores_gemma":[0.27212176,0.0013700873,0.008154362,0.009102129,0.0020161,0.0028042987,0.0033360047,0.0046796277,0.001805742],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.003936855,0.00040624093,0.14746438,0.05321515,0.01860138,0.0002078381,0.0022261948,0.002666047,0.0006021975,0.00980386,0.49682346,0.26404637],"study_design_scores_gemma":[0.0037330552,0.0010271978,0.59412223,0.021713687,0.011923104,0.0008482343,0.0014059785,0.0037058308,0.00097592524,0.01363209,0.34593192,0.0009807374],"about_ca_topic_score_codex":0.044276744,"about_ca_topic_score_gemma":0.06886606,"teacher_disagreement_score":0.90494806,"about_ca_system_score_codex":0.0076846615,"about_ca_system_score_gemma":0.0150350155,"threshold_uncertainty_score":0.50268865},"labels":[],"label_agreement":null},{"id":"W7111126593","doi":"10.1371/journal.pone.0322293.s003","title":"Newcastle Ottawa scale (NOS) based quality assessment of included cohort studies.","year":2025,"lang":"","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Cohort; Scale (ratio); Quality assessment; Cohort study; Quality (philosophy)","score_opus":0.39541674345228983,"score_gpt":0.5128512836640952,"score_spread":0.11743454021180533,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7111126593","genre_codex":"review","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.117503315,0.30996227,0.20649762,0.011588787,0.005507781,0.07879077,0.22914262,0.0016183313,0.039388508],"genre_scores_gemma":[0.6273798,0.02495362,0.18875596,0.0029186818,0.0008019442,0.081276976,0.06858503,0.000595403,0.004732516],"study_design_codex":"observational","study_design_gemma":"not_applicable","domain_scores_codex":[0.66083467,0.14986235,0.1362687,0.010457727,0.04067727,0.001899307],"domain_scores_gemma":[0.3667771,0.37946308,0.109690376,0.042893864,0.097258866,0.0039167316],"candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.28246552,0.0009210242,0.004877102,0.009779581,0.0017211755,0.0041070594,0.0038133129,0.0012641299,0.006623564],"category_scores_gemma":[0.46058702,0.001046814,0.009609062,0.008301791,0.002072616,0.0032454005,0.004378271,0.0021779642,0.0005901907],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.009332309,0.00025583393,0.31399572,0.21273622,0.058161784,0.00035971828,0.006513794,0.003087973,0.001990808,0.013211768,0.09559951,0.2847546],"study_design_scores_gemma":[0.0042158053,0.0021850732,0.6533561,0.06988604,0.050880555,0.0012171476,0.003284785,0.0061564767,0.003177335,0.015036724,0.18968295,0.0009210734],"about_ca_topic_score_codex":0.016292585,"about_ca_topic_score_gemma":0.02994237,"teacher_disagreement_score":0.99337643,"about_ca_system_score_codex":0.0057396865,"about_ca_system_score_gemma":0.013903555,"threshold_uncertainty_score":0.88484776},"labels":[],"label_agreement":null},{"id":"W7111223050","doi":"10.1371/journal.pone.0325723.s002","title":"Methodological quality assessment of 14 included studies using the Newcastle-Ottawa quality assessment scale.","year":2025,"lang":"","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Quality assessment; Quality (philosophy); Risk assessment; Quality assurance; Conformity assessment; Quantitative assessment","score_opus":0.8977663646866403,"score_gpt":0.6523932223448586,"score_spread":0.24537314234178165,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7111223050","genre_codex":"review","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.070381545,0.5188545,0.05724648,0.01071901,0.004170912,0.23731212,0.08473098,0.0006174622,0.015967034],"genre_scores_gemma":[0.38935146,0.0700849,0.0920248,0.004693327,0.00069195224,0.40995142,0.02926317,0.00044395856,0.003495052],"study_design_codex":"systematic_review","study_design_gemma":"observational","domain_scores_codex":[0.5850058,0.10641732,0.25654057,0.013517137,0.036272965,0.0022461498],"domain_scores_gemma":[0.4154556,0.33484867,0.110278666,0.034945276,0.10191749,0.0025543119],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.26547354,0.0021981187,0.009417913,0.019190392,0.0032848653,0.0071007805,0.0047817077,0.004450883,0.008322828],"category_scores_gemma":[0.56484866,0.0019223044,0.020647628,0.01692966,0.003942084,0.0040408173,0.0058060405,0.0038524712,0.0007386013],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.007565197,0.00025975212,0.072002545,0.64554846,0.10538428,0.00051411823,0.00869122,0.0011669599,0.0015815785,0.0029256677,0.025053648,0.1293066],"study_design_scores_gemma":[0.012922288,0.001866774,0.14253065,0.44448185,0.28054988,0.0009908064,0.0037154069,0.0021709942,0.0045663384,0.008795393,0.09662906,0.0007806572],"about_ca_topic_score_codex":0.014244651,"about_ca_topic_score_gemma":0.022704508,"teacher_disagreement_score":0.73452646,"about_ca_system_score_codex":0.011193939,"about_ca_system_score_gemma":0.021726089,"threshold_uncertainty_score":0.9058019},"labels":[],"label_agreement":null},{"id":"W7126640062","doi":"","title":"Polytomous regression did not outperform dichotomous logistic regression in diagnosing serious bacterial infections in febrile children","year":2008,"lang":"","type":"article","venue":"EUR Research Repository (Erasmus University Rotterdam)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Pediatric Oncology Group","funders":"","keywords":"Logistic regression; Polytomous Rasch model; Regression analysis; Regression; Cross-sectional regression; Linear regression","score_opus":0.1637317756781169,"score_gpt":0.3677283708463741,"score_spread":0.20399659516825722,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7126640062","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9598906,0.0019413894,0.03085645,0.0014939852,0.0004994311,0.00028140275,0.0010069576,0.00054671214,0.0034830968],"genre_scores_gemma":[0.9860021,0.00024401571,0.012651318,0.00016747044,0.00003875479,0.00005163608,0.00030510983,0.00006109603,0.00047853656],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.96801436,0.023868646,0.0023809196,0.002434344,0.0023400087,0.0009616602],"domain_scores_gemma":[0.7823047,0.19503188,0.0066413307,0.0063307565,0.0074801315,0.0022111826],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.040832717,0.0010691962,0.00151494,0.0010409852,0.00053935905,0.0016911865,0.0014613493,0.00171328,0.0022556495],"category_scores_gemma":[0.19812839,0.00067825185,0.0012305066,0.0010344465,0.0006834102,0.0033646629,0.0015752998,0.0019052069,0.0012102241],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.006733041,0.00039815818,0.82798326,0.0011353509,0.0011468191,0.00034472067,0.00149982,0.013434515,0.0022672722,0.0014011379,0.0044851443,0.13917077],"study_design_scores_gemma":[0.0006554175,0.009017007,0.67300117,0.0013393412,0.0022066128,0.0015551007,0.002944656,0.29041174,0.0045658858,0.008189618,0.0058559794,0.00025741797],"about_ca_topic_score_codex":0.007400204,"about_ca_topic_score_gemma":0.016792053,"teacher_disagreement_score":0.040832717,"about_ca_system_score_codex":0.00073443993,"about_ca_system_score_gemma":0.0025589094,"threshold_uncertainty_score":0.21594661},"labels":[],"label_agreement":null},{"id":"W7135411397","doi":"10.6084/m9.figshare.5531614","title":"Additional file 7: of Barriers and facilitators to the implementation of a school-based physical activity policy in Canada: application of the theoretical domains framework","year":2017,"lang":"","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Coding (social sciences); Data collection; Measure (data warehouse); Context (archaeology); Work (physics); Key (lock)","score_opus":0.04273739852549995,"score_gpt":0.3551625362591402,"score_spread":0.3124251377336402,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7135411397","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0013059219,0.00001778914,0.00023990161,0.00023205519,0.00002377539,0.00038518728,0.9947797,0.00010786578,0.0029077984],"genre_scores_gemma":[0.07221927,0.0003783631,0.010546162,0.0006827997,0.00006326321,0.012488085,0.87130237,0.00049119006,0.031828515],"study_design_codex":"not_applicable","study_design_gemma":"qualitative","domain_scores_codex":[0.9982358,0.00025157392,0.00024102407,0.00019532318,0.00063171954,0.00044457958],"domain_scores_gemma":[0.9490579,0.025486773,0.0019007438,0.0014647258,0.020628847,0.0014610344],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0035573926,0.0008908564,0.0010629826,0.0048622373,0.0034488232,0.0022751172,0.0026982992,0.0008363935,0.6246162],"category_scores_gemma":[0.04880566,0.00063590024,0.0013808728,0.00907842,0.00056783936,0.0018025083,0.0015335046,0.001326213,0.034118265],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014547813,0.00009329531,0.012480377,0.0013855274,0.0000373488,0.000055637607,0.00064196804,0.0006191704,0.000023565817,0.0007094441,0.97151047,0.012297765],"study_design_scores_gemma":[0.003564995,0.00021904154,0.42893022,0.008852933,0.000360497,0.00022946403,0.017126996,0.0076120785,0.0008877991,0.0051072994,0.52671295,0.00039569562],"about_ca_topic_score_codex":0.90273565,"about_ca_topic_score_gemma":0.9440316,"teacher_disagreement_score":0.6246162,"about_ca_system_score_codex":0.018950557,"about_ca_system_score_gemma":0.054191325,"threshold_uncertainty_score":0.5354394},"labels":[],"label_agreement":null},{"id":"W7135411763","doi":"10.6084/m9.figshare.5531614.v1","title":"Additional file 7: of Barriers and facilitators to the implementation of a school-based physical activity policy in Canada: application of the theoretical domains framework","year":2017,"lang":"","type":"article","venue":"Figshare","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Coding (social sciences); Data collection; Measure (data warehouse); Context (archaeology); Work (physics); Key (lock)","score_opus":0.04273739852549995,"score_gpt":0.3551625362591402,"score_spread":0.3124251377336402,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7135411763","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0013059219,0.00001778914,0.00023990161,0.00023205519,0.00002377539,0.00038518728,0.9947797,0.00010786578,0.0029077984],"genre_scores_gemma":[0.07221927,0.0003783631,0.010546162,0.0006827997,0.00006326321,0.012488085,0.87130237,0.00049119006,0.031828515],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9982358,0.00025157392,0.00024102407,0.00019532318,0.00063171954,0.00044457958],"domain_scores_gemma":[0.9490579,0.025486773,0.0019007438,0.0014647258,0.020628847,0.0014610344],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0035573926,0.0008908564,0.0010629826,0.0048622373,0.0034488232,0.0022751172,0.0026982992,0.0008363935,0.6246162],"category_scores_gemma":[0.04880566,0.00063590024,0.0013808728,0.00907842,0.00056783936,0.0018025083,0.0015335046,0.001326213,0.034118265],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014547813,0.00009329531,0.012480377,0.0013855274,0.0000373488,0.000055637607,0.00064196804,0.0006191704,0.000023565817,0.0007094441,0.97151047,0.012297765],"study_design_scores_gemma":[0.003564995,0.00021904154,0.42893022,0.008852933,0.000360497,0.00022946403,0.017126996,0.0076120785,0.0008877991,0.0051072994,0.52671295,0.00039569562],"about_ca_topic_score_codex":0.90273565,"about_ca_topic_score_gemma":0.9440316,"teacher_disagreement_score":0.6246162,"about_ca_system_score_codex":0.018950557,"about_ca_system_score_gemma":0.054191325,"threshold_uncertainty_score":0.5354394},"labels":[],"label_agreement":null},{"id":"W7155592100","doi":"","title":"RAPID-TEST (Rapid respiratory microbiological point-of-care-testing in primary care): Statistical Analysis Plan","year":2024,"lang":"en","type":"book","venue":"Bristol Research (University of Bristol)","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute of Infection and Immunity","funders":"","keywords":"Statistical analysis; Primary care; Plan (archaeology); MEDLINE","score_opus":0.2515944795773787,"score_gpt":0.36885111426384026,"score_spread":0.11725663468646158,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7155592100","genre_codex":"methods","genre_gemma":"protocol","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"protocol","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0021555054,0.004264646,0.8085957,0.004311714,0.0019874498,0.0069344672,0.043960966,0.02522893,0.1025606],"genre_scores_gemma":[0.006384819,0.0023863083,0.78776616,0.0024964318,0.0009151838,0.008893067,0.028779307,0.0069531943,0.15542558],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9951597,0.0023349526,0.00034671364,0.00026298896,0.0017822738,0.00011330944],"domain_scores_gemma":[0.9871903,0.009030299,0.00040963356,0.00058526656,0.0025356405,0.00024888397],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007942873,0.0016634642,0.0012200762,0.0028661226,0.00031869367,0.001388136,0.0014149238,0.0008242163,0.08424139],"category_scores_gemma":[0.015592405,0.001168158,0.0010343726,0.0018846144,0.00064643583,0.0012290336,0.0009774254,0.0018649297,0.06786877],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00037605857,0.00011745656,0.0008950452,0.0008337457,0.000035376095,0.00008190114,0.000047667978,0.0019126583,0.0013875713,0.014256884,0.59028447,0.38977113],"study_design_scores_gemma":[0.00032487029,0.0007974119,0.005852751,0.0006935306,0.000106223575,0.0013286428,0.00008657388,0.024061546,0.006390002,0.04410313,0.9161519,0.00010340787],"about_ca_topic_score_codex":0.0017544391,"about_ca_topic_score_gemma":0.0031213702,"teacher_disagreement_score":0.08424139,"about_ca_system_score_codex":0.0011067642,"about_ca_system_score_gemma":0.001831056,"threshold_uncertainty_score":0.28181553},"labels":[],"label_agreement":null}]}