{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":867,"total_is_capped":false,"direct_labels_cover":10,"predictions_cover":867,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"98f632c1f71b","filters":{"topic":"Data Quality and Management"}},"results":[{"id":"W2471940872","doi":"10.3163/1536-5050.104.3.014","title":"De-duplication of database search results for systematic reviews in EndNote","year":2016,"lang":"en","type":"article","venue":"Journal of the Medical Library Association JMLA","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1874,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia Hospital","funders":"","keywords":"Computer science; World Wide Web; Information retrieval; Data science; Library science; Database","authors":[{"name":"Wichor M. Bramer","is_ca":false},{"name":"Dean Giustini","is_ca":true},{"name":"Gerdien B. de Jonge","is_ca":false},{"name":"Leslie Holland","is_ca":false},{"name":"Tanja Bekhuis","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1603570094009618,"gpt":0.4287371023629208,"spread":0.268380092961959,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2760996,0.004118448,0.01483363,0.09141982,0.002766121,0.0123244,0.006268634,0.00509506,0.1041891],"category_scores_gemma":[0.5682161,0.003683385,0.01418467,0.07279209,0.004458722,0.01082615,0.01338337,0.003767099,0.01209819],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00817895,"about_ca_system_score_gemma":0.03716501,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002524059,"about_ca_topic_score_gemma":0.007998366,"domain_scores_codex":[0.5189989,0.1774022,0.2494578,0.0132575,0.03675607,0.004127471],"domain_scores_gemma":[0.3510341,0.4541476,0.07798082,0.05968684,0.05444201,0.002708644],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"systematic_review","study_design_gemma":"not_applicable","study_design_scores_codex":[0.002296076,0.0001282849,0.003844363,0.7681987,0.006435527,0.001038402,0.004932321,0.0005002052,0.002630072,0.01468016,0.08978277,0.1055331],"study_design_scores_gemma":[0.00350663,0.0006733182,0.01384584,0.4202851,0.01089209,0.002393704,0.002618424,0.001956475,0.004926056,0.02885687,0.5093296,0.0007159203],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"protocol","genre_gemma":"methods","genre_scores_codex":[0.01980806,0.1010772,0.202302,0.02015532,0.02032855,0.3188527,0.2388477,0.01474818,0.06388014],"genre_scores_gemma":[0.05261574,0.03471091,0.468321,0.008593539,0.00243175,0.378644,0.03650673,0.004172974,0.01400336],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.7239004,"threshold_uncertainty_score":0.8926981,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2132698877","doi":"10.5596/c13-009","title":"Systematic Approaches to a Successful Literature Review","year":2013,"lang":"fr","type":"article","venue":"Journal of the Canadian Health Libraries Association / Journal de l Association de bilbiothèques de la santé du Canada","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":871,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false},"ca_institutions":"","funders":"","keywords":"Systematic review; Epistemology; History; Psychology; Engineering ethics; Political science; Philosophy; MEDLINE; Engineering; Law","authors":[{"name":"Jackie MacDonald","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03310652073829008,"gpt":0.2956478694425366,"spread":0.2625413487042466,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2822124,0.004311827,0.01222293,0.06837038,0.008986559,0.01651514,0.007223655,0.01153583,0.0114245],"category_scores_gemma":[0.5691319,0.007196094,0.008084119,0.03738436,0.009461912,0.01563901,0.01838158,0.005737972,0.002618427],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01792622,"about_ca_system_score_gemma":0.1022358,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008419269,"about_ca_topic_score_gemma":0.02212971,"domain_scores_codex":[0.4809554,0.3557326,0.1065394,0.008959831,0.04473643,0.003076335],"domain_scores_gemma":[0.2833108,0.5929674,0.03320209,0.03434408,0.05292308,0.003252448],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"systematic_review","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0005753902,0.0002630753,0.002125567,0.4839751,0.01524148,0.002627822,0.01545089,0.002234642,0.001360537,0.0593118,0.03346023,0.3833735],"study_design_scores_gemma":[0.001591802,0.0005376387,0.00174696,0.6416797,0.02072123,0.001105551,0.0100141,0.003497576,0.00162746,0.1705206,0.1465457,0.0004117913],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"methods","genre_scores_codex":[0.005645055,0.6431903,0.2084008,0.05904642,0.006658081,0.05954241,0.003131438,0.0007687381,0.01361677],"genre_scores_gemma":[0.07014718,0.2077715,0.6207985,0.01270243,0.001618494,0.08341236,0.0009642364,0.0002458061,0.002339552],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.7177876,"threshold_uncertainty_score":0.8851599,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1977628174","doi":"10.1071/ah080766","title":"A decade of data linkage in Western Australia: strategic design, applications and benefits of the WA data linkage system","year":2008,"lang":"en","type":"article","venue":"Australian Health Review","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":514,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Centre for Global Health Research","funders":"","keywords":"Linkage (software); Population health; Health economics; Record linkage; Data quality; Public health; Population; Data science; Linked data; Medicine; Business; Computer science; Environmental health; Marketing; World Wide Web; Biology; Genetics","authors":[{"name":"C. D’Arcy J. Holman","is_ca":false},{"name":"John A Bass","is_ca":false},{"name":"D L Rosman","is_ca":false},{"name":"Merran B. Smith","is_ca":false},{"name":"James B. Semmens","is_ca":false},{"name":"Emma J. Glasson","is_ca":false},{"name":"Emma L. Brook","is_ca":false},{"name":"Brooke Trutwein","is_ca":false},{"name":"Ian Rouse","is_ca":false},{"name":"Charles R. Watson","is_ca":false},{"name":"Nicholas de Klerk","is_ca":true},{"name":"Fiona Stanley","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7754379927253564,"gpt":0.5261300498695192,"spread":0.2493079428558372,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2373451,0.0006752689,0.00116601,0.00628731,0.003717729,0.01056509,0.00370539,0.002633767,0.001704183],"category_scores_gemma":[0.2177375,0.001552417,0.0008852944,0.00998103,0.006001283,0.01085732,0.01120757,0.00459055,0.0007132214],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01995878,"about_ca_system_score_gemma":0.07356486,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.1130226,"about_ca_topic_score_gemma":0.07814931,"domain_scores_codex":[0.7907809,0.1501511,0.01797553,0.008344643,0.02952982,0.003217887],"domain_scores_gemma":[0.7989666,0.0642636,0.01633055,0.02515893,0.08710843,0.008171848],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.0002194667,0.0001573096,0.02217562,0.003261623,0.0002282751,0.0004718395,0.01657899,0.002335878,0.001362443,0.06184479,0.03467872,0.856685],"study_design_scores_gemma":[0.0001374022,0.001165749,0.0734209,0.009053444,0.0002023504,0.000931272,0.01244541,0.008734473,0.002618543,0.03973135,0.851248,0.0003111482],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1027494,0.1272232,0.3605227,0.3399419,0.004629754,0.007503865,0.00149253,0.002295743,0.05364082],"genre_scores_gemma":[0.3471405,0.06811145,0.5199633,0.03008271,0.002300505,0.006854592,0.001897152,0.0007070421,0.0229428],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.2373451,"threshold_uncertainty_score":0.9404892,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2171332293","doi":"10.1145/1366102.1366103","title":"Conditional functional dependencies for capturing data inconsistencies","year":2008,"lang":"en","type":"article","venue":"ACM Transactions on Database Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":458,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Bell (Canada)","funders":"Engineering and Physical Sciences Research Council","keywords":"Computer science; Functional dependency; Data integrity; Consistency (knowledge bases); Relational database; SQL; Data mining; Set (abstract data type); Schema (genetic algorithms); Database; Programming language; Theoretical computer science; Algorithm; Information retrieval; Artificial intelligence","authors":[{"name":"Wenfei Fan","is_ca":true},{"name":"Floris Geerts","is_ca":false},{"name":"Xibei Jia","is_ca":false},{"name":"Anastasios Kementsietsidis","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5917106512846138,"gpt":0.4156652633131301,"spread":0.1760453879714837,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00596049,0.001493781,0.001008972,0.003373366,0.001390214,0.002483564,0.003619769,0.001471629,0.004050264],"category_scores_gemma":[0.03202393,0.001027983,0.001926781,0.003194467,0.002039955,0.007278857,0.003140515,0.003481669,0.0005684242],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002176254,"about_ca_system_score_gemma":0.003973315,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009169787,"about_ca_topic_score_gemma":0.01112289,"domain_scores_codex":[0.9896253,0.002408356,0.0009249324,0.001820087,0.004562165,0.0006592409],"domain_scores_gemma":[0.9679843,0.01933556,0.002947006,0.005303276,0.004065137,0.0003646371],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0005351298,0.0003044803,0.02062658,0.001195576,0.0002601479,0.001353596,0.001027788,0.2548094,0.02310361,0.3538506,0.0165431,0.32639],"study_design_scores_gemma":[0.00006227894,0.0001581655,0.002392726,0.0001791995,0.0001457845,0.0009433918,0.0002501449,0.7545909,0.03303646,0.1809362,0.02716524,0.0001395025],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01428972,0.0002522221,0.9796801,0.0004469699,0.0000645448,0.0001877647,0.001089224,0.002497668,0.001491692],"genre_scores_gemma":[0.24742,0.0003318627,0.7472166,0.0005092593,0.00009172968,0.0003356464,0.002207848,0.0005435083,0.001343643],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009169787,"threshold_uncertainty_score":0.03152251,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2591700809","doi":"10.14778/3137628.3137631","title":"HoloClean","year":2017,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":454,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada; Defense Advanced Research Projects Agency","keywords":"Leverage (statistics); Computer science; Probabilistic logic; Inference; Tuple; Data mining; Statistical model; Machine learning; Artificial intelligence; Mathematics","authors":[{"name":"Theodoros Rekatsinas","is_ca":false},{"name":"Xu Chu","is_ca":true},{"name":"Ihab F. Ilyas","is_ca":true},{"name":"Christopher Ré","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2284211371904144,"gpt":0.4286142488382545,"spread":0.2001931116478401,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004578141,0.001504516,0.001491478,0.00361551,0.001016351,0.005033804,0.006821305,0.001534417,0.01789622],"category_scores_gemma":[0.02542172,0.001209874,0.003122862,0.00255591,0.001827585,0.006923518,0.007741638,0.003278982,0.00826311],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00213188,"about_ca_system_score_gemma":0.005024464,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008731898,"about_ca_topic_score_gemma":0.01582726,"domain_scores_codex":[0.9949383,0.0007989898,0.0003875704,0.001465794,0.002102678,0.0003067198],"domain_scores_gemma":[0.9922168,0.002418151,0.0004580509,0.003561347,0.001102045,0.0002435548],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005564808,0.0002067958,0.006176967,0.001574929,0.0003254147,0.0004643956,0.000695684,0.06786154,0.004960692,0.1164097,0.1236348,0.6771326],"study_design_scores_gemma":[0.0001088519,0.0001124345,0.001084319,0.0003362753,0.00009390851,0.0006494065,0.0001737318,0.4664161,0.01203458,0.2181794,0.3006937,0.0001172597],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.002447318,0.0008144128,0.9284461,0.0006306557,0.0001884736,0.0002584502,0.003887755,0.05710077,0.006226082],"genre_scores_gemma":[0.0565011,0.0006951344,0.9088446,0.001032132,0.0001207292,0.0004492227,0.01686006,0.007929657,0.007567351],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01789622,"threshold_uncertainty_score":0,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W85648037","doi":"","title":"Proceedings of the 2008 ACM SIGMOD international conference on Management of data","year":2008,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":423,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Computer science; Dynamism; Session (web analytics); Field (mathematics); Sentence; Data science; Operations research; World Wide Web; Artificial intelligence","authors":[{"name":"Laks V. S. Lakshmanan","is_ca":true},{"name":"Raymond T. Ng","is_ca":true},{"name":"Dennis Shasha","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5943424653324738,"gpt":0.4691355235260268,"spread":0.125206941806447,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01013321,0.002392226,0.002927673,0.00531982,0.002369681,0.01301999,0.003638377,0.003083332,0.08599043],"category_scores_gemma":[0.02079459,0.001480765,0.001540811,0.003586625,0.001572972,0.01531794,0.007937919,0.009386421,0.07962357],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003356969,"about_ca_system_score_gemma":0.004631874,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005577968,"about_ca_topic_score_gemma":0.006014949,"domain_scores_codex":[0.9934749,0.001622188,0.0005806941,0.0008526323,0.003034284,0.0004352669],"domain_scores_gemma":[0.990293,0.001866826,0.000659531,0.001874957,0.003221849,0.00208369],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00007068188,0.00006920301,0.0004251222,0.0001283124,0.00003409231,0.00004124894,0.0000955231,0.0001096166,0.0003473743,0.001041625,0.9446698,0.05296735],"study_design_scores_gemma":[0.00003108172,0.00004594716,0.001210153,0.0002929596,0.0000315009,0.000152367,0.0002069746,0.0009989552,0.0004841285,0.003222739,0.9932816,0.00004160222],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"other","genre_gemma":"other","genre_scores_codex":[0.02604738,0.1731377,0.1276523,0.1748897,0.1555923,0.004175291,0.0731464,0.05143563,0.2139234],"genre_scores_gemma":[0.03812291,0.1109549,0.143491,0.0365993,0.0359305,0.00242361,0.1711042,0.01001777,0.4513557],"genre_candidate":"other","genre_consensus":"other","teacher_disagreement_score":0.08599043,"threshold_uncertainty_score":0.2876666,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2775078427","doi":"10.1177/2053951717745678","title":"Challenges in administrative data linkage for research","year":2017,"lang":"en","type":"article","venue":"Big Data & Society","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":356,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Institute for Clinical Evaluative Sciences","funders":"Economic and Social Research Council; Wellcome Trust","keywords":"Linkage (software); Record linkage; Computer science; Data quality; Data science; Data collection; Confidentiality; Data mining; Sample (material); Population; Computer security; Engineering; Statistics; Sociology","authors":[{"name":"Katie Harron","is_ca":false},{"name":"Chris Dibben","is_ca":false},{"name":"James Boyd","is_ca":false},{"name":"Anders Hjern","is_ca":false},{"name":"Mahmoud Azimaee","is_ca":true},{"name":"Maurício L. Barreto","is_ca":false},{"name":"Harvey Goldstein","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.9805021151538041,"gpt":0.681924870153455,"spread":0.2985772450003491,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.6349509,0.00124112,0.00464532,0.01068699,0.01210446,0.03324808,0.01277345,0.01078548,0.004573033],"category_scores_gemma":[0.7454242,0.002750949,0.003863978,0.03018361,0.02860501,0.03997223,0.03054885,0.01804472,0.003126342],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01496643,"about_ca_system_score_gemma":0.05795113,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009693236,"about_ca_topic_score_gemma":0.004298186,"domain_scores_codex":[0.2297899,0.6375625,0.04088628,0.01878127,0.06976727,0.003212799],"domain_scores_gemma":[0.1619425,0.6753441,0.02664045,0.07039847,0.06152676,0.004147772],"domain_codex":"methods","domain_gemma":"methods","domain_candidate":"methods","domain_consensus":"methods","study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001622451,0.0000812295,0.005823257,0.004581266,0.0004971627,0.0003403199,0.01672407,0.005488006,0.0001545298,0.6513706,0.04124322,0.2735341],"study_design_scores_gemma":[0.00007716113,0.00009095342,0.00160105,0.007657688,0.0001525064,0.0005326266,0.008444296,0.004753542,0.0003444111,0.6970929,0.2790782,0.0001746981],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.005349892,0.04397675,0.5115274,0.4081247,0.00572695,0.001869902,0.001223555,0.0005696813,0.0216312],"genre_scores_gemma":[0.1181546,0.03760586,0.7707337,0.04823246,0.009510733,0.009100664,0.001759789,0.0008666036,0.004035654],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.3650491,"threshold_uncertainty_score":0.4501706,"prediction_status":"machine_predicted_unvalidated"},"labels":[{"model":"gemma","categories":["metaresearch"],"domain":"methods","study_design":"not_applicable","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":["metaresearch"],"domain":"methods","study_design":"design_other","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low"}],"label_agreement":"split"},{"id":"W2044469685","doi":"10.1109/icde.2013.6544847","title":"Holistic data cleaning: Putting violations into context","year":2013,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":319,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Rotation formalisms in three dimensions; Hypergraph; Context (archaeology); Pipeline (software); Exploit; Reachability; Quality (philosophy); Functional dependency; Theoretical computer science; Isolation (microbiology); Data mining; Machine learning; Programming language; Relational database; Computer security","authors":[{"name":"Xu Chu","is_ca":true},{"name":"Ihab F. Ilyas","is_ca":false},{"name":"Paolo Papotti","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5895766416565716,"gpt":0.5011305017614565,"spread":0.08844613989511518,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.006992122,0.001668055,0.002517763,0.003499607,0.001923424,0.004078868,0.00368711,0.002409547,0.001696217],"category_scores_gemma":[0.02807941,0.001245458,0.002118364,0.004322083,0.002369594,0.007502197,0.007562257,0.00319262,0.0003325418],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001042516,"about_ca_system_score_gemma":0.002741166,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003126073,"about_ca_topic_score_gemma":0.005211889,"domain_scores_codex":[0.9887955,0.00341729,0.001016295,0.002896592,0.003378685,0.0004956144],"domain_scores_gemma":[0.9780578,0.009552233,0.003059195,0.00701956,0.001844653,0.0004666693],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0006010964,0.0003340657,0.02491225,0.002080756,0.0007303224,0.002226294,0.004358881,0.1710988,0.0150146,0.1010663,0.01086256,0.666714],"study_design_scores_gemma":[0.00007194716,0.0003581979,0.008437688,0.0009594062,0.0008135459,0.002991155,0.003360111,0.5753628,0.03608993,0.3038822,0.0673245,0.0003485808],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.04193952,0.002458528,0.948595,0.001295664,0.0001691789,0.0002161288,0.0004692852,0.002642501,0.002214246],"genre_scores_gemma":[0.3067697,0.0009069095,0.6892831,0.0005319891,0.0001041113,0.0001204977,0.0008393391,0.0005062603,0.0009380996],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.9930079,"threshold_uncertainty_score":0.0369783,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2137775416","doi":"","title":"Improving data quality: consistency and accuracy","year":2007,"lang":"en","type":"article","venue":"Edinburgh Research Explorer (University of Edinburgh)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":312,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Bell (Canada)","funders":"Biotechnology and Biological Sciences Research Council; Engineering and Physical Sciences Research Council; Vlaamse regering; Fonds Wetenschappelijk Onderzoek","keywords":"Consistency (knowledge bases); Computer science; Data consistency; Data integrity; Consistency model; Sequential consistency; Set (abstract data type); Weak consistency; Heuristic; Data mining; Data quality; Quality (philosophy); Strong consistency; Database; Artificial intelligence; Mathematics; Programming language","authors":[{"name":"Gao Cong","is_ca":false},{"name":"Wenfei Fan","is_ca":true},{"name":"Floris Geerts","is_ca":false},{"name":"Xibei Jia","is_ca":false},{"name":"Shuai Ma","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5859534533824458,"gpt":0.5006272625830552,"spread":0.08532619079939052,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04891176,0.001532357,0.002691221,0.005492634,0.001606552,0.007751905,0.005287916,0.003562145,0.001972381],"category_scores_gemma":[0.2322024,0.001448355,0.002211625,0.006271655,0.004316272,0.0158673,0.008229802,0.00482338,0.0009836822],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003399534,"about_ca_system_score_gemma":0.005891264,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003624345,"about_ca_topic_score_gemma":0.002180394,"domain_scores_codex":[0.9162613,0.02680226,0.01061055,0.009167768,0.03502026,0.002137908],"domain_scores_gemma":[0.6989079,0.1566437,0.0247631,0.0810882,0.03687283,0.001724293],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0007255845,0.0004051362,0.03727433,0.001973718,0.0006025268,0.0002225886,0.001699684,0.1513306,0.01331611,0.1520782,0.009778841,0.6305927],"study_design_scores_gemma":[0.0003517264,0.0008725201,0.01576488,0.00117606,0.0005437243,0.001434186,0.001025337,0.5851222,0.05880725,0.2882375,0.04629621,0.0003685038],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01453555,0.001730567,0.9776284,0.002433601,0.0001110783,0.0001906823,0.0003622282,0.001208145,0.001799665],"genre_scores_gemma":[0.2591739,0.001104502,0.736182,0.0007396912,0.0003041215,0.0003606941,0.0007764734,0.0004795018,0.0008790679],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.04891176,"threshold_uncertainty_score":0.2586733,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W760598031","doi":"10.1007/s00778-015-0389-y","title":"Profiling relational data: a survey","year":2015,"lang":"en","type":"article","venue":"The VLDB Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":273,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Profiling (computer programming); Metadata; Computer science; Data mining; Data type; Information retrieval; Data science; World Wide Web","authors":[{"name":"Ziawasch Abedjan","is_ca":false},{"name":"Lukasz Golab","is_ca":true},{"name":"Felix Naumann","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.8844173631534311,"gpt":0.5434835487839118,"spread":0.3409338143695193,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01869769,0.0006774935,0.001507291,0.01501409,0.0009242385,0.007538349,0.002744373,0.001273704,0.001958959],"category_scores_gemma":[0.07480663,0.0007422493,0.001051805,0.0222602,0.001718179,0.01735284,0.003062729,0.001598523,0.001021985],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001464438,"about_ca_system_score_gemma":0.002510754,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002434847,"about_ca_topic_score_gemma":0.003064253,"domain_scores_codex":[0.98079,0.003948452,0.002594439,0.002924362,0.009087564,0.0006552319],"domain_scores_gemma":[0.8604422,0.09986163,0.007603403,0.01009019,0.01982508,0.00217755],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0001678369,0.0001770685,0.0908149,0.00369295,0.0001898058,0.00007622846,0.001507676,0.001936789,0.00225872,0.01415405,0.01142764,0.8735963],"study_design_scores_gemma":[0.000067401,0.0007884558,0.1373759,0.009211984,0.0006429999,0.003835496,0.01551866,0.03142736,0.01908045,0.06174427,0.7199531,0.0003539018],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.204822,0.4718415,0.2501662,0.02193191,0.0006169153,0.0005095127,0.0106903,0.001940897,0.03748073],"genre_scores_gemma":[0.4661339,0.3631345,0.1421929,0.004883834,0.0009596304,0.0004179132,0.01806351,0.0006093284,0.003604455],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.01869769,"threshold_uncertainty_score":0.09888405,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1967167578","doi":"10.14778/1453856.1453980","title":"Discovering data quality rules","year":2008,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":268,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Data quality; Consistency (knowledge bases); Context (archaeology); Quality (philosophy); Data mining; Data integrity; Set (abstract data type); Data consistency; Process (computing); Database; Artificial intelligence; Programming language; Engineering","authors":[{"name":"Fei Chiang","is_ca":true},{"name":"Renée J. Miller","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.4977714110126681,"gpt":0.451736219472416,"spread":0.04603519154025215,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01511977,0.001813347,0.002101456,0.01194249,0.001823355,0.007347757,0.004192876,0.002377663,0.00227075],"category_scores_gemma":[0.10615,0.001572119,0.003998329,0.005548572,0.001834089,0.008104751,0.00468046,0.003941247,0.001131723],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002808427,"about_ca_system_score_gemma":0.006522246,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008356454,"about_ca_topic_score_gemma":0.01122686,"domain_scores_codex":[0.9650422,0.004980867,0.005216945,0.005815096,0.01771588,0.001228974],"domain_scores_gemma":[0.8815446,0.07096115,0.009725274,0.01473743,0.02121326,0.001818291],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005732684,0.0009830564,0.1674478,0.003636991,0.001030492,0.003484358,0.002749587,0.05252321,0.01577806,0.06386509,0.03590264,0.6520255],"study_design_scores_gemma":[0.0001905392,0.0003615384,0.02417933,0.001836159,0.0007876817,0.002844309,0.002675211,0.6406669,0.0491715,0.1506765,0.1263214,0.0002889383],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.09791879,0.002485348,0.8449972,0.005924887,0.0002697595,0.002182289,0.02652693,0.0113244,0.008370271],"genre_scores_gemma":[0.213557,0.0008566868,0.7521936,0.0009519063,0.0001054793,0.0007087578,0.02934587,0.0007992009,0.0014815],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01511977,"threshold_uncertainty_score":0.0799619,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2170712852","doi":"10.14778/2536258.2536262","title":"Discovering denial constraints","year":2013,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":252,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Rotation formalisms in three dimensions; Scalability; Inference; Data integrity; Set (abstract data type); Functional dependency; Constraint (computer-aided design); Theoretical computer science; Rank (graph theory); Semantics (computer science); Function (biology); Data mining; Artificial intelligence; Programming language; Database; Relational database","authors":[{"name":"Xu Chu","is_ca":true},{"name":"Ihab F. Ilyas","is_ca":false},{"name":"Paolo Papotti","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.08220481571088507,"gpt":0.3393964871060694,"spread":0.2571916713951843,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01002849,0.001878893,0.002140607,0.005793695,0.00281759,0.005422847,0.004843651,0.002492945,0.006076572],"category_scores_gemma":[0.06524177,0.001217365,0.002575205,0.00521947,0.001869019,0.01194757,0.005861333,0.004345814,0.001468525],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002752434,"about_ca_system_score_gemma":0.006749071,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008869141,"about_ca_topic_score_gemma":0.01100694,"domain_scores_codex":[0.9747038,0.007525744,0.002251216,0.00443259,0.009265797,0.001820832],"domain_scores_gemma":[0.9453601,0.03358305,0.00326691,0.008111537,0.008476475,0.001201925],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000666251,0.0005313721,0.03876958,0.001719955,0.0005265963,0.001871795,0.001223383,0.1119818,0.0111726,0.2364928,0.05681894,0.5382251],"study_design_scores_gemma":[0.00007268655,0.00007926219,0.002910353,0.0002359403,0.0001420032,0.001165007,0.001145249,0.6139483,0.0162853,0.3189627,0.04493577,0.0001174735],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06368043,0.001013549,0.9088178,0.004080155,0.0002533149,0.0008495224,0.006414272,0.003734162,0.01115685],"genre_scores_gemma":[0.3549635,0.000549057,0.6268752,0.001354953,0.000182421,0.0004705918,0.01107964,0.0007399461,0.003784626],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01002849,"threshold_uncertainty_score":0.05303633,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2544486974","doi":"10.14778/2994509.2994518","title":"Detecting data errors","year":2016,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":237,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"University of California Berkeley","keywords":"Computer science; Raw data; Outlier; Data mining; Set (abstract data type); Variety (cybernetics); Data quality; Ground truth; Anomaly detection; Quality (philosophy); Big data; Data science; Machine learning; Artificial intelligence; Engineering","authors":[{"name":"Ziawasch Abedjan","is_ca":false},{"name":"Xu Chu","is_ca":true},{"name":"Dong Deng","is_ca":false},{"name":"Raul Castro Fernandez","is_ca":false},{"name":"Ihab F. Ilyas","is_ca":true},{"name":"Mourad Ouzzani","is_ca":false},{"name":"Paolo Papotti","is_ca":false},{"name":"Michael Stonebraker","is_ca":false},{"name":"Nan Tang","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3097609978046282,"gpt":0.4126229492891771,"spread":0.1028619514845489,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02098097,0.002211681,0.001998074,0.009275529,0.001645167,0.005104362,0.004321513,0.002830164,0.002670607],"category_scores_gemma":[0.1517903,0.000865113,0.002016069,0.007719268,0.001597924,0.005799147,0.006564772,0.002727047,0.002860892],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001315207,"about_ca_system_score_gemma":0.003249373,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002358616,"about_ca_topic_score_gemma":0.002255817,"domain_scores_codex":[0.9522556,0.009320097,0.007339614,0.01126091,0.01824003,0.00158373],"domain_scores_gemma":[0.7991547,0.07963275,0.01970252,0.06453487,0.03549375,0.001481378],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0009512166,0.0005889611,0.1189586,0.003738887,0.0007083282,0.002322092,0.008237539,0.01397714,0.03586598,0.02107788,0.04859595,0.7449773],"study_design_scores_gemma":[0.0002018019,0.0008980662,0.07099519,0.002114834,0.0008785389,0.004792019,0.008833255,0.21652,0.3119785,0.07103218,0.3110456,0.000709948],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.117291,0.002201726,0.810873,0.003246109,0.0008943844,0.001943357,0.01510004,0.03976662,0.008683854],"genre_scores_gemma":[0.2672631,0.0006566591,0.7069734,0.001401538,0.0001439539,0.0009840429,0.01583991,0.002757099,0.003980435],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02098097,"threshold_uncertainty_score":0.1109593,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2970992672","doi":"10.14778/3352063.3352116","title":"Data lake management","year":2019,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":236,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"TD Bank Group; University of Toronto","funders":"","keywords":"Metadata; Data management; Metadata management; Data science; Data management plan; Computer science; Data integration; Software versioning; Data mapping; Data extraction; Data element; Research data; Data virtualization; Data curation; Database; World Wide Web; Software","authors":[{"name":"Fatemeh Nargesian","is_ca":true},{"name":"Erkang Zhu","is_ca":true},{"name":"Renée J. Miller","is_ca":false},{"name":"Ken Q. Pu","is_ca":false},{"name":"Patricia C. Arocena","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.190965546163535,"gpt":0.3896089267691528,"spread":0.1986433806056178,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01351263,0.001064766,0.001422133,0.007892552,0.003122945,0.01269661,0.005567789,0.00149881,0.0280816],"category_scores_gemma":[0.0414289,0.001078477,0.001497977,0.009107835,0.001126833,0.01718519,0.01127162,0.00326425,0.01830473],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002542973,"about_ca_system_score_gemma":0.007144351,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006534911,"about_ca_topic_score_gemma":0.004540147,"domain_scores_codex":[0.9902188,0.001388216,0.001680583,0.001443264,0.004585288,0.0006839008],"domain_scores_gemma":[0.9779451,0.003213963,0.001534096,0.009015027,0.006640497,0.001651296],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002141557,0.00008546647,0.006912315,0.0009170364,0.0001310364,0.0002502174,0.00113894,0.002427701,0.003093446,0.07858947,0.5607018,0.3455383],"study_design_scores_gemma":[0.00003398857,0.00003280322,0.001850776,0.0002551512,0.00004663851,0.0002070739,0.0004127493,0.01122277,0.005973069,0.0329357,0.9469594,0.00006990021],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01169187,0.007111954,0.5594096,0.02324033,0.002832851,0.003080809,0.1010732,0.1775492,0.1140102],"genre_scores_gemma":[0.1118763,0.007822782,0.5482424,0.005196006,0.001630319,0.002458069,0.222079,0.02403266,0.07666242],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.0280816,"threshold_uncertainty_score":0.09394228,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2148524305","doi":"10.14778/1687627.1687771","title":"Framework for evaluating clustering algorithms in duplicate detection","year":2009,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":232,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Scalability; Cluster analysis; Data mining; Data deduplication; Process (computing); Algorithm; Machine learning; Database","authors":[{"name":"Oktie Hassanzadeh","is_ca":true},{"name":"Fei Chiang","is_ca":true},{"name":"Hyun‐Chul Lee","is_ca":false},{"name":"Renée J. Miller","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2418184006816228,"gpt":0.4629068859449667,"spread":0.2210884852633439,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05879213,0.002601526,0.002919211,0.01180054,0.002354739,0.005690672,0.005376305,0.00425544,0.001794421],"category_scores_gemma":[0.1066421,0.0008347164,0.002408877,0.009012589,0.002695965,0.00483065,0.005912534,0.002610947,0.0008506694],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004568572,"about_ca_system_score_gemma":0.004954954,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007920526,"about_ca_topic_score_gemma":0.005157467,"domain_scores_codex":[0.9419968,0.03202862,0.004135181,0.003337024,0.01725783,0.001244553],"domain_scores_gemma":[0.9364167,0.03646897,0.005568864,0.008679273,0.01173811,0.001128086],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0009888812,0.001387541,0.01325356,0.001273341,0.001211442,0.0002533754,0.0007350098,0.5713453,0.009797089,0.1509697,0.008617209,0.2401675],"study_design_scores_gemma":[0.0001858201,0.001166475,0.002772674,0.0001680039,0.0001923019,0.0002233082,0.0002883164,0.9321498,0.005740625,0.04993129,0.007071983,0.0001093278],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02810548,0.001398938,0.9589446,0.0006685856,0.0001231674,0.00202075,0.0008784202,0.001899018,0.005961181],"genre_scores_gemma":[0.1118798,0.000395148,0.8841136,0.0001743555,0.00007874138,0.001652139,0.0008694024,0.0001627496,0.000674109],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.05879213,"threshold_uncertainty_score":0.3109262,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2093594738","doi":"10.7152/acro.v24i1.14671","title":"Veracity Roadmap: Is Big Data Objective, Truthful and Credible?","year":2014,"lang":"en","type":"article","venue":"Advances in Classification Research Online","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":227,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Western University","funders":"","keywords":"Big data; Computer science; Data science; Operationalization; Objectivity (philosophy); Credibility; Data quality; Variety (cybernetics); Quality (philosophy); Data mining; Artificial intelligence","authors":[{"name":"Tatiana Lukoianova","is_ca":false},{"name":"Victoria L. Rubin","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.68969663109607,"gpt":0.5918893972658551,"spread":0.09780723383021495,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0463171,0.001208912,0.001667816,0.01260559,0.00441306,0.03011568,0.002599397,0.005206443,0.00531814],"category_scores_gemma":[0.2572122,0.000810996,0.001195673,0.01253789,0.03273231,0.04978429,0.01409111,0.008584317,0.0008499043],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.006314766,"about_ca_system_score_gemma":0.006239479,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002142097,"about_ca_topic_score_gemma":0.001102922,"domain_scores_codex":[0.949641,0.02392963,0.003674748,0.004482852,0.01646804,0.001803689],"domain_scores_gemma":[0.6923213,0.2213667,0.0318987,0.02245113,0.02681964,0.005142562],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001259715,0.00005630888,0.01722952,0.0007815668,0.0001217814,0.0002185836,0.006214675,0.004837689,0.0002818784,0.8702117,0.007019268,0.09290109],"study_design_scores_gemma":[0.00001222003,0.00003677015,0.003069595,0.0008015738,0.00003332164,0.0001648774,0.003022762,0.008136479,0.0003574408,0.9677425,0.01655472,0.00006776411],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1026556,0.01987519,0.493271,0.1954983,0.002108938,0.0007236524,0.002238169,0.0007784141,0.1828508],"genre_scores_gemma":[0.9462807,0.004690539,0.03987841,0.004340204,0.001590276,0.0004399747,0.0006831398,0.0002088918,0.001887836],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9536829,"threshold_uncertainty_score":0.2449512,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2047745978","doi":"10.1145/1514894.1514901","title":"On approximating optimum repairs for functional dependency violations","year":2009,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":209,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Functional dependency; Tuple; Computer science; Set (abstract data type); Dependency theory (database theory); Constant (computer programming); Approximation algorithm; Dependency (UML); Algorithm; Database; Mathematics; Relational database; Discrete mathematics; Artificial intelligence","authors":[{"name":"Solmaz Kolahi","is_ca":true},{"name":"Laks V. S. Lakshmanan","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2489855454233683,"gpt":0.4310638159039699,"spread":0.1820782704806016,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004359492,0.001667663,0.002500806,0.001796766,0.001028741,0.001671287,0.003034008,0.00194418,0.002683039],"category_scores_gemma":[0.03456107,0.001033947,0.00135045,0.003234187,0.001518143,0.004268224,0.002066548,0.002617009,0.0006026346],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002060506,"about_ca_system_score_gemma":0.002308066,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0068517,"about_ca_topic_score_gemma":0.006331456,"domain_scores_codex":[0.9969631,0.0009059246,0.0002173335,0.0006002442,0.0008918949,0.0004214662],"domain_scores_gemma":[0.9801451,0.01450943,0.001548411,0.002014122,0.001461735,0.0003212365],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003406127,0.0001074438,0.002141537,0.0002199455,0.00006216054,0.0001062401,0.0002133593,0.9087408,0.001844162,0.009920135,0.002467145,0.0738364],"study_design_scores_gemma":[0.00002668316,0.00007940757,0.0002996688,0.00002174286,0.00002036988,0.0001168903,0.0000794806,0.9768847,0.001311815,0.02041105,0.0007372614,0.00001105197],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0726124,0.001078323,0.923003,0.0005990876,0.00006411428,0.0001040378,0.0003611397,0.0008497118,0.001328274],"genre_scores_gemma":[0.4056799,0.0006584455,0.5898186,0.0002403573,0.00006874717,0.0001975353,0.001314371,0.0003616832,0.001660458],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0068517,"threshold_uncertainty_score":0.02305549,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2284343953","doi":"10.1111/cobi.12706","title":"Emerging problems of data quality in citizen science","year":2016,"lang":"en","type":"editorial","venue":"Conservation Biology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":209,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true},"ca_institutions":"Memorial University of Newfoundland; University of Saskatchewan","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Citizen science; Crowdsourcing; Citizen journalism; Open science; Data science; Open data; Resource (disambiguation); World Wide Web; Computer science; Political science; Public relations","authors":[{"name":"Roman Lukyanenko","is_ca":true},{"name":"Jeffrey Parsons","is_ca":true},{"name":"Yolanda F. Wiersma","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3374571762887902,"gpt":0.5204741367644338,"spread":0.1830169604756435,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2851528,0.001798845,0.005659852,0.0149013,0.007563975,0.02524224,0.01302528,0.01915011,0.008653533],"category_scores_gemma":[0.5562453,0.002881114,0.002468894,0.02601819,0.05595827,0.0456598,0.0196701,0.01780288,0.002440577],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01926195,"about_ca_system_score_gemma":0.01566631,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01492762,"about_ca_topic_score_gemma":0.00563269,"domain_scores_codex":[0.698956,0.181682,0.01749449,0.0311598,0.06697934,0.003728491],"domain_scores_gemma":[0.1753665,0.7092135,0.02119605,0.04210911,0.04847337,0.003641449],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002728668,0.0001233042,0.01252752,0.005622466,0.0003331814,0.0002889152,0.007921066,0.004994517,0.0003556001,0.7154412,0.04921416,0.2029051],"study_design_scores_gemma":[0.000084844,0.00004349908,0.002508661,0.002241469,0.0000440724,0.0002947378,0.002337382,0.004372551,0.0002798367,0.8962349,0.0914482,0.000109766],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"commentary","genre_gemma":"editorial","genre_scores_codex":[0.01338388,0.1538802,0.2220274,0.5537151,0.004728045,0.0007676878,0.003548825,0.0007690676,0.04717986],"genre_scores_gemma":[0.4917124,0.1126362,0.2317302,0.1154063,0.02839226,0.00421418,0.004810319,0.001626411,0.00947166],"genre_candidate":"editorial","genre_consensus":null,"teacher_disagreement_score":0.7148472,"threshold_uncertainty_score":0.8815339,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2533963320","doi":"10.1186/s12911-016-0375-3","title":"Describing the linkages of the immigration, refugees and citizenship Canada permanent resident data and vital statistics death registry to Ontario’s administrative health database","year":2016,"lang":"en","type":"article","venue":"BMC Medical Informatics and Decision Making","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":204,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true},"ca_institutions":"College of Physicians and Surgeons of Ontario; Ottawa Hospital; Canadian Institute for Health Information; Institute for Clinical Evaluative Sciences","funders":"Canadian Institutes of Health Research; Ontario Ministry of Health and Long-Term Care; Institute for Clinical Evaluative Sciences","keywords":"Health informatics; Refugee; Citizenship; Immigration; Health statistics; Database; Health services research; Official statistics; Nationality; Data science; Medicine; Public health; Political science; Computer science; Nursing; Environmental health; Law; Population","authors":[{"name":"Maria Chiu","is_ca":true},{"name":"Michael Lebenbaum","is_ca":true},{"name":"Kelvin Lam","is_ca":true},{"name":"Nelson W. Chong","is_ca":true},{"name":"Mahmoud Azimaee","is_ca":true},{"name":"Karey Iron","is_ca":true},{"name":"Douglas G. Manuel","is_ca":true},{"name":"Astrid Guttmann","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2748628273168988,"gpt":0.4274036063539242,"spread":0.1525407790370253,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0117056,0.0002834639,0.0003040043,0.005423367,0.001868864,0.002408399,0.001376287,0.0005589139,0.003959452],"category_scores_gemma":[0.05046941,0.0004285527,0.0006970373,0.01606398,0.0004507343,0.001178757,0.001588723,0.0005025273,0.0008547079],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.02651789,"about_ca_system_score_gemma":0.06810357,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.9178211,"about_ca_topic_score_gemma":0.9421678,"domain_scores_codex":[0.9905818,0.001906809,0.001711562,0.001123576,0.003783436,0.0008927665],"domain_scores_gemma":[0.9674709,0.007707139,0.006563998,0.002787158,0.0148011,0.000669758],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0002169066,0.00006961466,0.7081906,0.00164534,0.000345111,0.0005803438,0.004753777,0.01417238,0.0007568882,0.01624645,0.1186037,0.1344189],"study_design_scores_gemma":[0.00008143588,0.0000712072,0.6540838,0.001222448,0.0002401536,0.0003771663,0.003439537,0.01745227,0.001605644,0.002238808,0.3190435,0.000144038],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"dataset","genre_gemma":"empirical","genre_scores_codex":[0.2504072,0.002675253,0.05435567,0.00796928,0.0002682955,0.004228336,0.6370353,0.001186228,0.04187454],"genre_scores_gemma":[0.5882051,0.00399848,0.07202266,0.0009289588,0.0000891583,0.004545977,0.3158886,0.0003018302,0.0140192],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.08217889,"threshold_uncertainty_score":0.1924016,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2037754936","doi":"10.1353/cja.2005.0055","title":"Data Quality in an Information-Rich Environment: Canada as an Example","year":2005,"lang":"en","type":"review","venue":"Canadian Journal on Aging / La Revue canadienne du vieillissement","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":195,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"University of Toronto; University of Manitoba; Health Sciences Centre; Manitoba Health","funders":"","keywords":"Quality (philosophy); Information quality; Data quality; Computer science; Data science; Business; Information system; Political science; Marketing; Epistemology","authors":[{"name":"Leslíe L. Roos","is_ca":true},{"name":"Sumit Gupta","is_ca":true},{"name":"Ruth‐Ann Soodeen","is_ca":true},{"name":"Laurel Jebamani","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1882385821084955,"gpt":0.3704396366493099,"spread":0.1822010545408144,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.04525287,0.0006590447,0.00293398,0.007801506,0.002300402,0.005580738,0.002298351,0.001634514,0.0009138776],"category_scores_gemma":[0.0836855,0.000409643,0.001299172,0.0297919,0.00329403,0.002656062,0.001575651,0.001728658,0.000153254],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.05316317,"about_ca_system_score_gemma":0.1400952,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.8461114,"about_ca_topic_score_gemma":0.8808533,"domain_scores_codex":[0.9622637,0.01348943,0.003787564,0.001071762,0.01837357,0.001014055],"domain_scores_gemma":[0.8515121,0.08624004,0.007424505,0.003184058,0.04992665,0.001712548],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002721154,0.00007193213,0.006650652,0.05090789,0.0008056864,0.0006359603,0.003051684,0.002089903,0.0004392573,0.02648673,0.04039952,0.8681886],"study_design_scores_gemma":[0.0004027912,0.0002914085,0.0662088,0.1178003,0.003052452,0.001476752,0.00480163,0.00262961,0.001529181,0.01812619,0.7833194,0.0003615071],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.003300214,0.9695579,0.002094091,0.01958627,0.0004239565,0.0001848744,0.000421157,0.00003792348,0.004393576],"genre_scores_gemma":[0.05565414,0.9253697,0.01383945,0.003663583,0.0002361761,0.0002178871,0.0004058407,0.00002253945,0.0005906845],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.9547471,"threshold_uncertainty_score":0.3857276,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2798664493","doi":"10.14778/3192965.3192973","title":"Table union search on open data","year":2018,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":193,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Table (database); Computer science; Benchmark (surveying); Data mining; Set (abstract data type); Semantic search; Domain (mathematical analysis); Ontology; Decision table; Probabilistic logic; Information retrieval; Search engine; Artificial intelligence; Mathematics; Programming language","authors":[{"name":"Fatemeh Nargesian","is_ca":true},{"name":"Erkang Zhu","is_ca":true},{"name":"Ken Q. Pu","is_ca":false},{"name":"Renée J. Miller","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.4805425545209558,"gpt":0.4884253644300699,"spread":0.007882809909114052,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00439759,0.0009174236,0.002178551,0.005131835,0.001949731,0.004069827,0.003392497,0.001951023,0.005277407],"category_scores_gemma":[0.028504,0.0009309381,0.002537436,0.01051983,0.001648884,0.009212591,0.004871484,0.001543815,0.001107816],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00163729,"about_ca_system_score_gemma":0.002807291,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006355432,"about_ca_topic_score_gemma":0.006847159,"domain_scores_codex":[0.9944501,0.001424897,0.0005030108,0.001389422,0.001759829,0.000472753],"domain_scores_gemma":[0.982085,0.01225082,0.001197078,0.002703825,0.001291914,0.0004713486],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0008764245,0.0005574672,0.01557208,0.001270303,0.0004438231,0.001172553,0.00131813,0.4051214,0.004733785,0.1075455,0.0332072,0.4281812],"study_design_scores_gemma":[0.00009483257,0.0001152409,0.001094164,0.0001117102,0.00009716157,0.0004965825,0.0005219899,0.8407168,0.004185756,0.142105,0.01041955,0.00004125666],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08211512,0.002759091,0.8976465,0.001390047,0.0001406111,0.000336657,0.004987122,0.005803411,0.004821426],"genre_scores_gemma":[0.3087517,0.0007467618,0.6779891,0.0004006174,0.00009948557,0.0003581535,0.008297247,0.0005445703,0.002812491],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006355432,"threshold_uncertainty_score":0.02325696,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2135797260","doi":"10.1287/isre.2014.0537","title":"The IQ of the Crowd: Understanding and Improving Information Quality in Structured User-Generated Content","year":2014,"lang":"en","type":"article","venue":"Information Systems Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":152,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Computer science; Information quality; Quality (philosophy); Class (philosophy); Data science; Data mining; Knowledge management; Information retrieval; Information system; Artificial intelligence","authors":[{"name":"Roman Lukyanenko","is_ca":false},{"name":"Jeffrey Parsons","is_ca":true},{"name":"Yolanda F. Wiersma","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5163197398913468,"gpt":0.4719992757335768,"spread":0.04432046415777002,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02861869,0.0008632422,0.001099251,0.004066629,0.001537444,0.007313118,0.001995638,0.001670796,0.001642183],"category_scores_gemma":[0.1853135,0.0007806553,0.0008850953,0.003171285,0.004452829,0.01560512,0.00639422,0.002321658,0.0002292906],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004147756,"about_ca_system_score_gemma":0.002251313,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008597853,"about_ca_topic_score_gemma":0.003405976,"domain_scores_codex":[0.9822816,0.01108602,0.0009342558,0.001727559,0.0034878,0.0004827596],"domain_scores_gemma":[0.7818914,0.1764971,0.01339539,0.0178558,0.008455849,0.001904381],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.001594092,0.001409582,0.1479834,0.002141511,0.000532356,0.000501691,0.06842542,0.1006198,0.008162526,0.1531064,0.007099881,0.5084234],"study_design_scores_gemma":[0.000169881,0.0008628703,0.04346576,0.0008037567,0.0003593872,0.0003811759,0.01466002,0.6272606,0.01372274,0.2757908,0.02227961,0.0002434072],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3906159,0.001529632,0.5874307,0.005443627,0.00007322135,0.0008196309,0.0005182744,0.001435666,0.01213343],"genre_scores_gemma":[0.8901523,0.0003912046,0.1080774,0.0003483896,0.00004015545,0.0001926849,0.0002900649,0.0001080448,0.0003998351],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02861869,"threshold_uncertainty_score":0.1513519,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4210862833","doi":"10.1186/s40537-021-00468-0","title":"Big data quality framework: a holistic approach to continuous quality management","year":2021,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":141,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Concordia University","funders":"","keywords":"Big data; Computer science; Data quality; Profiling (computer programming); Data science; Data mining; Quality (philosophy); Data management; Exploratory data analysis; Engineering; Operations management","authors":[{"name":"Ikbal Taleb","is_ca":false},{"name":"Mohamed Adel Serhani","is_ca":false},{"name":"Chafik Bouhaddioui","is_ca":false},{"name":"Rachida Dssouli","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7948772270531455,"gpt":0.5341265486844159,"spread":0.2607506783687296,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02319967,0.001635723,0.001460026,0.008474006,0.001729945,0.01249012,0.005137668,0.002282169,0.001491374],"category_scores_gemma":[0.01704438,0.0009524018,0.002635168,0.006920575,0.004829486,0.009860926,0.007141108,0.004336807,0.0004441428],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004613797,"about_ca_system_score_gemma":0.008362233,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008350067,"about_ca_topic_score_gemma":0.004430864,"domain_scores_codex":[0.9801129,0.007178219,0.002191905,0.002336131,0.007177746,0.001003089],"domain_scores_gemma":[0.9840884,0.004016307,0.002351393,0.002461807,0.005660739,0.001421214],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001093133,0.0002621348,0.007876138,0.001075091,0.0002837821,0.0005295757,0.001807496,0.08542763,0.002813424,0.7666662,0.008924868,0.1242244],"study_design_scores_gemma":[0.00004817708,0.0002370221,0.003071013,0.001147669,0.000230517,0.0004890858,0.001600674,0.5202304,0.003794894,0.4036711,0.06530437,0.000175027],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.003223868,0.001045924,0.9877215,0.002229395,0.0001161466,0.0003257338,0.0002040851,0.0007506341,0.004382772],"genre_scores_gemma":[0.1608619,0.001365987,0.834285,0.0005096621,0.0002860672,0.000522727,0.0007481945,0.0001623917,0.001258121],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02319967,"threshold_uncertainty_score":0.1226931,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2156897283","doi":"10.1002/asi.22695","title":"Author name disambiguation: What difference does it make in author‐based citation analysis?","year":2012,"lang":"en","type":"article","venue":"Journal of the American Society for Information Science and Technology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":134,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Workaround; Citation; Computer science; Ambiguity; Ranking (information retrieval); Field (mathematics); Information retrieval; Citation analysis; Journal ranking; Publication; Data science; World Wide Web; Political science; Mathematics","authors":[{"name":"Andreas Strotmann","is_ca":false},{"name":"Dangzhi Zhao","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.09078199573774924,"gpt":0.4091928979380296,"spread":0.3184109022002803,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.1306864,0.001069136,0.00219136,0.009410322,0.003863664,0.01501328,0.003114354,0.002715708,0.002442696],"category_scores_gemma":[0.4431591,0.0007075847,0.001495781,0.0238717,0.008268805,0.0292227,0.004571635,0.003743254,0.001945273],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002586746,"about_ca_system_score_gemma":0.003522861,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006640106,"about_ca_topic_score_gemma":0.006927594,"domain_scores_codex":[0.8842233,0.0762334,0.006983647,0.01026086,0.0209876,0.001311103],"domain_scores_gemma":[0.507503,0.3837533,0.03343435,0.04008261,0.03296019,0.002266602],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006365787,0.0001718742,0.2649775,0.001798786,0.002129722,0.0002896631,0.01019201,0.01732052,0.002482876,0.1299457,0.02082375,0.549231],"study_design_scores_gemma":[0.0002379145,0.0007269311,0.2066669,0.002682653,0.001431547,0.001637423,0.01711156,0.09908291,0.01328796,0.5425382,0.1137699,0.0008260411],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3320605,0.06239841,0.436489,0.1085263,0.006820287,0.0004174666,0.001546134,0.001698334,0.05004354],"genre_scores_gemma":[0.881363,0.00627936,0.1017777,0.004190185,0.003137191,0.0001628338,0.0005941475,0.0005981516,0.001897251],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9905897,"threshold_uncertainty_score":0.6911438,"prediction_status":"machine_predicted_unvalidated"},"labels":[{"model":"gemma","categories":["metaresearch","bibliometrics"],"domain":"methods","study_design":"simulation_or_modeling","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":["metaresearch","bibliometrics"],"domain":"methods","study_design":"design_other","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"high"}],"label_agreement":"split"},{"id":"W4211029301","doi":"10.2200/s00439ed1v01y201207dtm030","title":"Foundations of Data Quality Management","year":2012,"lang":"en","type":"article","venue":"Synthesis lectures on data management","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":131,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"","funders":"National Key Research and Development Program of China; Engineering and Physical Sciences Research Council; Universiteit Antwerpen; University of Waterloo; National Natural Science Foundation of China","keywords":"Data quality; Data management; Computer science; Quality (philosophy); Data governance; Data science; Data administration; Database; Database design; Operations management; Engineering; Database model","authors":[{"name":"Wenfei Fan","is_ca":false},{"name":"Floris Geerts","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.6066300196494542,"gpt":0.5319929733621165,"spread":0.0746370462873377,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02355294,0.0009434705,0.00138359,0.005842323,0.002762041,0.01244452,0.002807948,0.004392578,0.01339667],"category_scores_gemma":[0.05046068,0.0008734489,0.001429817,0.006563084,0.01929618,0.0157696,0.004724659,0.007212761,0.002494189],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.009723727,"about_ca_system_score_gemma":0.009183184,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007413502,"about_ca_topic_score_gemma":0.002640057,"domain_scores_codex":[0.9851488,0.005541078,0.001152065,0.001733309,0.005690407,0.0007343169],"domain_scores_gemma":[0.9497948,0.03065873,0.002525893,0.008178499,0.007844917,0.0009970932],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.000003243734,0.000008911575,0.00007655019,0.00007013923,0.000006519611,0.000006432015,0.00007708491,0.0005975356,0.00002037854,0.9791061,0.005452945,0.01457427],"study_design_scores_gemma":[0.000005063985,0.000004365136,0.0000883085,0.000142795,0.000004903649,0.00001046233,0.00004746019,0.001487239,0.00007001458,0.9685354,0.02959706,0.000006827991],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.003627056,0.06882723,0.587062,0.1698934,0.005736002,0.0001810267,0.0005887544,0.0005597332,0.1635248],"genre_scores_gemma":[0.4903395,0.09489041,0.314238,0.02216477,0.02477989,0.001126125,0.001117326,0.0005817027,0.05076228],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.02355294,"threshold_uncertainty_score":0.1245613,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2112840274","doi":"10.14778/1920841.1920870","title":"Sampling the repairs of functional dependency violations under hard constraints","year":2010,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":127,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Dependency (UML); Class (philosophy); Functional dependency; Context (archaeology); Sampling (signal processing); Relation (database); Data integrity; Variety (cybernetics); Space (punctuation); Data mining; Metric (unit); Theoretical computer science; Relational database; Database; Artificial intelligence","authors":[{"name":"George Beskales","is_ca":true},{"name":"Ihab F. Ilyas","is_ca":true},{"name":"Lukasz Golab","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1812498346188758,"gpt":0.3696657815601582,"spread":0.1884159469412824,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006641858,0.0007913992,0.00146591,0.001428963,0.0007763588,0.001059771,0.00187476,0.00159415,0.001044564],"category_scores_gemma":[0.04814147,0.0006231864,0.001155796,0.001318159,0.001356201,0.002132396,0.001753863,0.001797797,0.0002708242],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000941277,"about_ca_system_score_gemma":0.001745098,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002166295,"about_ca_topic_score_gemma":0.003335025,"domain_scores_codex":[0.9940351,0.002546913,0.0005231496,0.001137419,0.001386441,0.0003710587],"domain_scores_gemma":[0.9459171,0.04035443,0.002856625,0.007591051,0.00261215,0.0006686944],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001354502,0.0005490964,0.02676857,0.000587062,0.0002555318,0.0006628524,0.001289465,0.6412677,0.0165975,0.01659114,0.006223891,0.2878526],"study_design_scores_gemma":[0.00008066854,0.0002045106,0.001781795,0.0000381374,0.00006413247,0.0003125748,0.0003469138,0.9594907,0.01157619,0.02432048,0.001757698,0.00002626009],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3402188,0.0006179192,0.6543396,0.0009551736,0.00005330814,0.0003085658,0.0006021249,0.001720676,0.001183741],"genre_scores_gemma":[0.7143211,0.000178144,0.2826576,0.000211905,0.00004555859,0.000273417,0.001250731,0.0002609746,0.000800503],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006641858,"threshold_uncertainty_score":0.03512597,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3146147323","doi":"","title":"Lakehouse: A New Generation of Open Platforms that Unify Data Warehousing and Advanced Analytics.","year":2021,"lang":"en","type":"article","venue":"Conference on Innovative Data Systems Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":123,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Analytics; Data warehouse; Data science; Database","authors":[{"name":"Matei Zaharia","is_ca":false},{"name":"Ali Ghodsi","is_ca":true},{"name":"Reynold Xin","is_ca":false},{"name":"Michael Armbrust","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.946872203848267,"gpt":0.6271471361658597,"spread":0.3197250676824073,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004961494,0.001172767,0.0008321572,0.003113824,0.001535476,0.005280169,0.003856873,0.001416581,0.02585185],"category_scores_gemma":[0.01085848,0.001353781,0.001070228,0.003616216,0.001378592,0.01531218,0.01057294,0.003468674,0.01116495],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007915081,"about_ca_system_score_gemma":0.004133927,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005541218,"about_ca_topic_score_gemma":0.007719381,"domain_scores_codex":[0.9959047,0.0004049517,0.0002769852,0.0004677093,0.0024827,0.0004628987],"domain_scores_gemma":[0.9918575,0.00181728,0.0007296607,0.002428088,0.001412067,0.001755406],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002503405,0.0008971508,0.00661137,0.0009564207,0.0003214015,0.0008151053,0.001727654,0.001705671,0.0407924,0.03384379,0.6478489,0.2619768],"study_design_scores_gemma":[0.0009105901,0.0006041232,0.01117215,0.0003720092,0.0002282819,0.0005993579,0.0007433756,0.02883803,0.03267048,0.04026911,0.8831127,0.0004798861],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"software","genre_gemma":"methods","genre_scores_codex":[0.06195461,0.003726544,0.3011427,0.01107496,0.001890227,0.001886712,0.04864962,0.4991799,0.07049476],"genre_scores_gemma":[0.1844584,0.003767609,0.3934363,0.005636442,0.00166515,0.002605648,0.1740969,0.0449231,0.1894105],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.02585185,"threshold_uncertainty_score":0.08648306,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2131060875","doi":"","title":"Extending dependencies with conditions","year":2007,"lang":"en","type":"article","venue":"Edinburgh Research Explorer (University of Edinburgh)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":108,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Bell (Canada)","funders":"Biotechnology and Biological Sciences Research Council; Engineering and Physical Sciences Research Council","keywords":"Undecidable problem; Computer science; Functional dependency; EXPTIME; Consistency (knowledge bases); Theoretical computer science; Data integrity; Inference; Decidability; Static analysis; Heuristic; Schema (genetic algorithms); Algorithm; Data mining; Computational complexity theory; Programming language; PSPACE; Artificial intelligence; Machine learning; Relational database; Database","authors":[{"name":"Loreto Bravo","is_ca":false},{"name":"Wenfei Fan","is_ca":true},{"name":"Shuai Ma","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3687199650519964,"gpt":0.4567409499993181,"spread":0.08802098494732163,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006102318,0.001562543,0.000886741,0.003418436,0.002548618,0.002891755,0.002980406,0.001625317,0.01328621],"category_scores_gemma":[0.01485674,0.001331253,0.003028038,0.002255543,0.006014883,0.01381895,0.007461876,0.004395965,0.002404986],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002554958,"about_ca_system_score_gemma":0.003170681,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005657558,"about_ca_topic_score_gemma":0.004902029,"domain_scores_codex":[0.9931346,0.001631878,0.0006590371,0.002022485,0.001710652,0.0008413087],"domain_scores_gemma":[0.984233,0.009027114,0.0007623433,0.00350189,0.001963831,0.0005117913],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001039814,0.00006921041,0.001250954,0.0003904112,0.00004047393,0.0005616484,0.0006373254,0.01165517,0.002798547,0.9135829,0.006495061,0.06241432],"study_design_scores_gemma":[0.00005257947,0.00006730824,0.0004224233,0.0001851728,0.00008107983,0.000384648,0.0001613851,0.02649428,0.004699838,0.8476852,0.1196942,0.00007203024],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01523673,0.001222172,0.9318676,0.001752638,0.0006470605,0.0004195782,0.001595249,0.00292253,0.04433648],"genre_scores_gemma":[0.3341627,0.002344624,0.6375757,0.001858098,0.001218438,0.0008110113,0.002741104,0.001385652,0.01790267],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01328621,"threshold_uncertainty_score":0.04444677,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2104345001","doi":"10.1109/icif.2010.5711858","title":"Measures of effectiveness for high-level fusion","year":2010,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":106,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Defence Research and Development Canada","funders":"","keywords":"Robustness (evolution); Sensor fusion; Computer science; Situation awareness; Workload; Data collection; Reliability engineering; Data mining; Engineering; Artificial intelligence","authors":[{"name":"Erik Blasch","is_ca":true},{"name":"Pierre Valin","is_ca":true},{"name":"Éloi Bossé","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3631391937097609,"gpt":0.4469914579324498,"spread":0.08385226422268888,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01631566,0.001178219,0.001193501,0.006873614,0.0007132275,0.002785434,0.0008377315,0.001599547,0.003142188],"category_scores_gemma":[0.05595988,0.0002206099,0.0009782047,0.003120305,0.001998136,0.003925653,0.00167189,0.001115108,0.0008328759],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001470755,"about_ca_system_score_gemma":0.0007197103,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0005607738,"about_ca_topic_score_gemma":0.0006106799,"domain_scores_codex":[0.9798068,0.006402612,0.001821531,0.00136702,0.009841561,0.0007605633],"domain_scores_gemma":[0.9325081,0.04171303,0.009865327,0.006749351,0.008056584,0.001107553],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00136268,0.000995246,0.1274984,0.002295159,0.001871909,0.0003263107,0.001296018,0.1325242,0.03277263,0.1942644,0.01064454,0.4941486],"study_design_scores_gemma":[0.0001617098,0.004295494,0.2521738,0.0008561002,0.001202243,0.002025498,0.003065131,0.3584449,0.0819417,0.2341586,0.06110887,0.0005659734],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.2607511,0.00659553,0.6505382,0.00202612,0.0003972145,0.0007013553,0.002433653,0.001442689,0.07511421],"genre_scores_gemma":[0.8913282,0.0006005052,0.104335,0.0002236343,0.0002211927,0.0003556049,0.0008616758,0.0001255121,0.001948613],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01631566,"threshold_uncertainty_score":0.08628649,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2295468252","doi":"10.14778/2856318.2856325","title":"Combining quantitative and logical data cleaning","year":2015,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":104,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Ontario Tech University; McMaster University; University of Toronto","funders":"","keywords":"Computer science; Metric (unit); Inference; Functional dependency; Set (abstract data type); Distortion (music); Statistical inference; Data mining; Algorithm; Theoretical computer science; Dependency (UML); Quality (philosophy); Data quality; Artificial intelligence; Relational database; Mathematics","authors":[{"name":"Nataliya Prokoshyna","is_ca":true},{"name":"Jaroslaw Szlichta","is_ca":true},{"name":"Fei Chiang","is_ca":true},{"name":"Renée J. Miller","is_ca":true},{"name":"Divesh Srivastava","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.6149975953066957,"gpt":0.4683191180089634,"spread":0.1466784772977324,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01963293,0.001763221,0.002002778,0.005336357,0.001624887,0.005092177,0.006389302,0.002015429,0.002566699],"category_scores_gemma":[0.05328358,0.001416168,0.003621856,0.005225926,0.004657819,0.009263154,0.01152399,0.004628743,0.0009114493],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002409616,"about_ca_system_score_gemma":0.004903195,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003013635,"about_ca_topic_score_gemma":0.004353407,"domain_scores_codex":[0.9740335,0.007640894,0.002531967,0.003468806,0.01144813,0.0008767135],"domain_scores_gemma":[0.9354174,0.03012721,0.003291831,0.0236405,0.006916509,0.0006065988],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004300622,0.0004835255,0.01062826,0.001454712,0.0005501051,0.0007005003,0.001254775,0.1696998,0.02619185,0.1658238,0.01186396,0.6109186],"study_design_scores_gemma":[0.00008481284,0.000249364,0.002097468,0.0002416865,0.0002177236,0.0009744816,0.0008237375,0.6208883,0.04097774,0.3036481,0.02963696,0.0001596626],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.003592829,0.0001494208,0.9926888,0.0006299151,0.0000323675,0.0001054785,0.0001743955,0.00170846,0.0009182467],"genre_scores_gemma":[0.08399864,0.0001624015,0.9131966,0.0004791341,0.00004791344,0.0001651064,0.0007536365,0.0004406451,0.0007557734],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01963293,"threshold_uncertainty_score":0.1038301,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2041442195","doi":"10.1109/icde.2013.6544854","title":"On the relative trust between inconsistent data and inaccurate constraints","year":2013,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":103,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Semantics (computer science); Consistency (knowledge bases); Data integrity; Data consistency; Data mining; Functional dependency; Data modeling; Theoretical computer science; Database; Programming language; Artificial intelligence; Relational database","authors":[{"name":"George Beskales","is_ca":false},{"name":"Ihab F. Ilyas","is_ca":false},{"name":"Lukasz Golab","is_ca":true},{"name":"Artur Galiullin","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.4110229824573968,"gpt":0.4287673793664585,"spread":0.01774439690906177,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04340752,0.001314604,0.002242007,0.004839991,0.00248953,0.006986757,0.003226981,0.003621099,0.001533784],"category_scores_gemma":[0.308507,0.001925888,0.001632511,0.004304893,0.009649187,0.01744714,0.007329548,0.004224465,0.0001941224],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004469126,"about_ca_system_score_gemma":0.003332807,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01017904,"about_ca_topic_score_gemma":0.006220823,"domain_scores_codex":[0.9497326,0.02625619,0.004751659,0.006440037,0.01081911,0.002000356],"domain_scores_gemma":[0.502024,0.4182022,0.03499069,0.02390143,0.01803592,0.002845804],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001398454,0.0002548487,0.03174945,0.001122487,0.0007649314,0.001634651,0.005187486,0.4701673,0.004275161,0.3403409,0.003488576,0.1396158],"study_design_scores_gemma":[0.00008013991,0.00020187,0.003567117,0.0002055012,0.0002055212,0.0007833901,0.0008695198,0.7236353,0.002834874,0.2651174,0.002368313,0.0001309839],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08132374,0.0009693021,0.9102201,0.00385177,0.00007991478,0.0001447953,0.0002091378,0.0002289015,0.002972335],"genre_scores_gemma":[0.7619786,0.0005052573,0.2358853,0.0003856874,0.000125196,0.0001073183,0.0001959899,0.0001314576,0.0006853706],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.04340752,"threshold_uncertainty_score":0.2295636,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3155972762","doi":"10.1136/bmjopen-2020-043497","title":"Can synthetic data be a proxy for real clinical trial data? A validation study","year":2021,"lang":"en","type":"article","venue":"BMJ Open","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":103,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Ottawa; McGill University Health Centre; Children's Hospital of Eastern Ontario; McGill University","funders":"Natural Sciences and Engineering Research Council of Canada; Canadian Institutes of Health Research","keywords":"Univariate; Medicine; Bivariate analysis; Multivariate statistics; Metric (unit); Synthetic data; Statistic; Multivariate analysis; Data mining; Proxy (statistics); Statistics; Internal medicine; Computer science; Mathematics","authors":[{"name":"Zahra Azizi","is_ca":true},{"name":"Chaoyi Zheng","is_ca":false},{"name":"Lucy Mosquera","is_ca":false},{"name":"Louise Pilote","is_ca":true},{"name":"Khaled El Emam","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.8969700184148548,"gpt":0.6912436001651321,"spread":0.2057264182497227,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.4236102,0.001466364,0.001434584,0.002357542,0.001281329,0.005941331,0.0048625,0.003685094,0.005029719],"category_scores_gemma":[0.7506392,0.00101512,0.003573605,0.003396764,0.007642843,0.005010446,0.00460442,0.004451626,0.001194132],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002017104,"about_ca_system_score_gemma":0.004548281,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001717948,"about_ca_topic_score_gemma":0.0008428556,"domain_scores_codex":[0.5724742,0.3858261,0.01319419,0.01124914,0.0159313,0.001325098],"domain_scores_gemma":[0.1157077,0.6707475,0.04122232,0.1527074,0.01827912,0.001335798],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.02159517,0.0035938,0.5904657,0.007187559,0.01613818,0.001133534,0.008186401,0.08355308,0.003412079,0.06980944,0.02527191,0.1696532],"study_design_scores_gemma":[0.01025026,0.01893471,0.2481439,0.008576185,0.00585616,0.004315289,0.004319897,0.4037983,0.01082797,0.172764,0.111351,0.0008623995],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.4945783,0.009431945,0.4540893,0.00970206,0.002203152,0.00779295,0.01135814,0.001034368,0.009809803],"genre_scores_gemma":[0.9244804,0.0005071929,0.06146732,0.003062682,0.0003094768,0.004434535,0.005078013,0.0002093222,0.0004510972],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5763898,"threshold_uncertainty_score":0.7107913,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2111589117","doi":"10.1186/1471-2288-14-36","title":"Evaluating bias due to data linkage error in electronic healthcare records","year":2014,"lang":"en","type":"article","venue":"BMC Medical Research Methodology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":102,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"","funders":"Hospital for Sick Children; Intensive Care Society; Medical Research Council; National Institute for Health and Care Research; NHS Health Scotland","keywords":"Identifier; Record linkage; Linkage (software); Gold standard (test); Word error rate; Computer science; Imputation (statistics); Statistics; Probabilistic logic; Data mining; Missing data; Data set; Standard error; Medicine; Artificial intelligence; Mathematics; Population","authors":[{"name":"Katie Harron","is_ca":false},{"name":"Angie Wade","is_ca":false},{"name":"Ruth Gilbert","is_ca":false},{"name":"Berit Müller‐Pebody","is_ca":false},{"name":"Harvey Goldstein","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.9728506852504919,"gpt":0.764426510343351,"spread":0.2084241749071409,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2920585,0.001251422,0.001355378,0.00356387,0.001461544,0.003109443,0.002622853,0.003353943,0.001347696],"category_scores_gemma":[0.6219704,0.0008683711,0.003603958,0.00530771,0.003180064,0.003286317,0.003829881,0.002096628,0.0002777989],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003273034,"about_ca_system_score_gemma":0.002624873,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00579774,"about_ca_topic_score_gemma":0.003832425,"domain_scores_codex":[0.6504805,0.296124,0.01964494,0.01332273,0.01866843,0.0017593],"domain_scores_gemma":[0.1323357,0.8055772,0.02718792,0.02108588,0.01326839,0.0005448596],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003490087,0.0003615389,0.6371357,0.002600863,0.008001065,0.0005835603,0.003657616,0.1787681,0.001127893,0.01652174,0.003997956,0.1437538],"study_design_scores_gemma":[0.001501184,0.003543039,0.263045,0.004257542,0.00660512,0.002989262,0.002182832,0.5890253,0.01670342,0.09093112,0.01855426,0.0006618709],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5200224,0.007986601,0.456643,0.003435411,0.0007748945,0.002537697,0.003476059,0.001010333,0.004113542],"genre_scores_gemma":[0.8706078,0.0006958083,0.1230414,0.0009345977,0.0002303898,0.001311058,0.002383546,0.0001809952,0.0006145058],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7079415,"threshold_uncertainty_score":0.873018,"prediction_status":"machine_predicted_unvalidated"},"labels":[{"model":"gemma","categories":["metaresearch"],"domain":"methods","study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":["metaresearch"],"domain":"methods","study_design":"design_other","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"high"}],"label_agreement":"split"},{"id":"W3106195149","doi":"10.1093/jamia/ocaa225","title":"Assessing the quality of clinical and administrative data extracted from hospitals: the General Medicine Inpatient Initiative (GEMINI) experience","year":2020,"lang":"en","type":"article","venue":"Journal of the American Medical Informatics Association","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":96,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true},"ca_institutions":"Sunnybrook Health Science Centre; Trillium Health Centre; Institute for Clinical Evaluative Sciences; Health Sciences Centre; Mount Sinai Hospital; University of Toronto; University Health Network; Queen's University; St. Michael's Hospital","funders":"University of Toronto","keywords":"Data quality; Data extraction; Computer science; Gold standard (test); Quality (philosophy); Quality management; Data collection; Data mining; Database; Medicine; MEDLINE; Statistics; Operations management; Mathematics","authors":[{"name":"Amol A. Verma","is_ca":true},{"name":"Sachin Vidur Pasricha","is_ca":true},{"name":"Hae Young Jung","is_ca":true},{"name":"Vladyslav Kushnir","is_ca":true},{"name":"Denise Mak","is_ca":true},{"name":"Radha Koppula","is_ca":true},{"name":"Yishan Guo","is_ca":true},{"name":"Janice L. Kwan","is_ca":true},{"name":"Lauren Lapointe‐Shaw","is_ca":true},{"name":"Shail Rawal","is_ca":true},{"name":"Terence Tang","is_ca":true},{"name":"Adina Weinerman","is_ca":true},{"name":"Fahad Razak","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.540661436719735,"gpt":0.5948575964308802,"spread":0.05419615971114522,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.08441567,0.0006869121,0.0007062837,0.003570054,0.00129702,0.004396054,0.002743778,0.0007317749,0.0007157022],"category_scores_gemma":[0.229331,0.0005387535,0.001086156,0.009297737,0.002052467,0.00217478,0.003791917,0.001181521,0.0001831384],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01594896,"about_ca_system_score_gemma":0.02054217,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.2271769,"about_ca_topic_score_gemma":0.2214451,"domain_scores_codex":[0.9433017,0.02632327,0.007050904,0.004033037,0.01799023,0.001300948],"domain_scores_gemma":[0.7605157,0.1266459,0.02672993,0.02601043,0.05619465,0.003903469],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0007047969,0.0001607664,0.8687367,0.0009049939,0.0006692078,0.0001614524,0.004858674,0.01252732,0.001221964,0.003288073,0.01715983,0.08960614],"study_design_scores_gemma":[0.0003277104,0.0006826301,0.8505705,0.001070365,0.0005249447,0.000631149,0.005413148,0.07881287,0.007263667,0.004621894,0.04983516,0.0002459465],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9123253,0.003021828,0.03961053,0.01317732,0.0002079769,0.001438264,0.02064169,0.001386679,0.008190529],"genre_scores_gemma":[0.8826638,0.0008779062,0.08732111,0.001633627,0.0001142742,0.0003089151,0.02614539,0.0002270659,0.0007078869],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9155843,"threshold_uncertainty_score":0.4517092,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2110848713","doi":"","title":"Linked Movie Data Base","year":2009,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":93,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"RDF; Linked data; Computer science; Metadata; World Wide Web; Database; Cloud computing; Information retrieval; Semantic Web","authors":[{"name":"Oktie Hassanzadeh","is_ca":true},{"name":"Mariano P. Consens","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5971839626278773,"gpt":0.5128323344859844,"spread":0.0843516281418929,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002279547,0.001135223,0.001316437,0.009172698,0.002382304,0.004542971,0.003260789,0.001734311,0.05562624],"category_scores_gemma":[0.01177542,0.0006135073,0.001234352,0.01216398,0.0004867681,0.004444783,0.003024695,0.002271866,0.0545899],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001688561,"about_ca_system_score_gemma":0.004182572,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02219722,"about_ca_topic_score_gemma":0.0193355,"domain_scores_codex":[0.9974771,0.0002437744,0.0003898303,0.0005379647,0.001176241,0.0001750658],"domain_scores_gemma":[0.9942124,0.0008623293,0.0003286765,0.001890593,0.002305038,0.0004009278],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.000391907,0.0002101716,0.002851417,0.001029533,0.0001487274,0.000363941,0.0002212132,0.00338327,0.002770453,0.02354164,0.8762167,0.08887093],"study_design_scores_gemma":[0.00009581556,0.0000347837,0.002718583,0.0001707599,0.00005976227,0.0002141263,0.0001414719,0.006007641,0.003036223,0.01133951,0.9761103,0.00007105207],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"software","genre_scores_codex":[0.002291016,0.0006623221,0.0221841,0.0006333678,0.0002919139,0.0005465515,0.9269494,0.01420679,0.03223465],"genre_scores_gemma":[0.005407311,0.000441893,0.01719744,0.0001661442,0.00005174465,0.000331784,0.9719924,0.0005859107,0.003825445],"genre_candidate":"software","genre_consensus":null,"teacher_disagreement_score":0.05562624,"threshold_uncertainty_score":0.1860883,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2142472956","doi":"10.1109/icde.2011.5767833","title":"A unified model for data and constraint repair","year":2011,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":92,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Data integrity; Scalability; Constraint (computer-aided design); Data quality; Data modeling; Set (abstract data type); Data mining; Semantics (computer science); Data model (GIS); Quality (philosophy); Database; Artificial intelligence; Programming language; Engineering","authors":[{"name":"Fei Chiang","is_ca":true},{"name":"Renée J. Miller","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7150539177874393,"gpt":0.4688035771737507,"spread":0.2462503406136887,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01308172,0.002390673,0.00244276,0.004994878,0.001725661,0.009336548,0.01171502,0.005117954,0.007535364],"category_scores_gemma":[0.04369455,0.002236137,0.004387802,0.006565975,0.003914019,0.01823133,0.007267796,0.006072501,0.002071046],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005452423,"about_ca_system_score_gemma":0.00564893,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0134382,"about_ca_topic_score_gemma":0.01033866,"domain_scores_codex":[0.9826741,0.00493931,0.001848039,0.003078356,0.006314751,0.001145442],"domain_scores_gemma":[0.9714351,0.01316885,0.002815148,0.006775633,0.004795854,0.001009297],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001254688,0.0001033239,0.001417064,0.000304826,0.0001363308,0.0003429592,0.0003955859,0.4265677,0.000999367,0.5071208,0.004821696,0.05766482],"study_design_scores_gemma":[0.00003481761,0.00007396519,0.0002142042,0.00007374649,0.00006176058,0.0002541374,0.00009794003,0.7615389,0.0008056622,0.2212603,0.01554053,0.00004410257],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.00239478,0.000315953,0.9931103,0.0007314035,0.00006460467,0.0001705782,0.0004049662,0.0005285983,0.002278788],"genre_scores_gemma":[0.1071028,0.0008861164,0.881694,0.0004163772,0.0002050735,0.0009505178,0.001643669,0.0005491223,0.006552404],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0134382,"threshold_uncertainty_score":0.06918353,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2770448539","doi":"10.1177/0961000617742465","title":"Data science in data librarianship: Core competencies of a data librarian","year":2017,"lang":"en","type":"article","venue":"Journal of Librarianship and Information Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":92,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Data curation; Computer science; Data management; Metadata; Data science; World Wide Web; Library science; Database","authors":[{"name":"Alexandre Ribas Semeler","is_ca":false},{"name":"Adílson Luiz Pinto","is_ca":false},{"name":"Helen Beatriz Frota Rozados","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.6056634588857582,"gpt":0.4724691396796581,"spread":0.1331943192061001,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.0480827,0.0005371724,0.00124927,0.00472703,0.01226091,0.0284711,0.002789859,0.008559946,0.007072372],"category_scores_gemma":[0.08070689,0.001047943,0.0007229521,0.009131702,0.0205679,0.02887227,0.0256584,0.01198635,0.007233685],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005100036,"about_ca_system_score_gemma":0.03375873,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004621544,"about_ca_topic_score_gemma":0.003770939,"domain_scores_codex":[0.9359095,0.03786366,0.005852577,0.003443873,0.01203462,0.004895818],"domain_scores_gemma":[0.8738648,0.06595158,0.004886014,0.008735085,0.01924898,0.02731357],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"qualitative","study_design_scores_codex":[0.00006441931,0.00070959,0.01414045,0.001569982,0.00005534058,0.001246309,0.1741463,0.000505342,0.001252518,0.2561321,0.294525,0.2556525],"study_design_scores_gemma":[0.00002594694,0.00007928037,0.003065265,0.001148772,0.0000138491,0.0011993,0.05170782,0.0005840274,0.0005136337,0.09641507,0.845145,0.00010199],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"commentary","genre_gemma":"empirical","genre_scores_codex":[0.0298327,0.02254229,0.05904778,0.7451993,0.005257958,0.0005316462,0.0004183811,0.000792033,0.136378],"genre_scores_gemma":[0.4395953,0.03912186,0.1766742,0.25802,0.006410224,0.001076718,0.001130732,0.0005585655,0.07741246],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9715289,"threshold_uncertainty_score":0.2542886,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2992507139","doi":"10.1177/1833358319887743","title":"Data quality in healthcare: A report of practical experience with the Canadian Primary Care Sentinel Surveillance Network data","year":2019,"lang":"en","type":"article","venue":"Health Information Management Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":91,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"Queen's University","funders":"","keywords":"Consistency (knowledge bases); Data quality; Computer science; Context (archaeology); Completeness (order theory); Quality (philosophy); Data consistency; Construct (python library); Health care; Data mining; Risk analysis (engineering); Medicine; Operations management; Database; Engineering; Artificial intelligence; Mathematics","authors":[{"name":"Behrouz Ehsani‐Moghaddam","is_ca":true},{"name":"Ken Martin","is_ca":true},{"name":"John Queenan","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2813307073526872,"gpt":0.4835402556383956,"spread":0.2022095482857085,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.231002,0.0009107079,0.001026189,0.003249344,0.0133468,0.01366998,0.006136955,0.002611107,0.001253188],"category_scores_gemma":[0.2656405,0.0008016565,0.0009769533,0.009768721,0.01024453,0.004648923,0.01209055,0.003941402,0.0002876247],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.08740982,"about_ca_system_score_gemma":0.1533935,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.7910503,"about_ca_topic_score_gemma":0.8258737,"domain_scores_codex":[0.7786027,0.1155919,0.009934451,0.006811778,0.07717329,0.01188589],"domain_scores_gemma":[0.6768309,0.148059,0.007518969,0.01503095,0.1250836,0.0274767],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.0003503108,0.001119904,0.09054665,0.002403778,0.0002487017,0.00177633,0.3966893,0.003082628,0.002202906,0.006862316,0.07993188,0.4147854],"study_design_scores_gemma":[0.0002100106,0.001925605,0.1129067,0.003372843,0.0002809368,0.00169664,0.4097763,0.007196122,0.004577212,0.004726077,0.4528248,0.0005066359],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7162097,0.016491,0.03536337,0.1711906,0.00125716,0.005045877,0.002711946,0.0009204592,0.05080988],"genre_scores_gemma":[0.8686921,0.01432517,0.09327561,0.009827323,0.000367499,0.0007712432,0.002109857,0.0004951369,0.01013593],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9125901,"threshold_uncertainty_score":0.9483114,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2795302121","doi":"10.1109/icde.2018.00093","title":"Seeping Semantics: Linking Datasets Using Word Embeddings for Data Discovery","year":2018,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":89,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Schema (genetic algorithms); Knowledge graph; Semantics (computer science); Linked data; Information retrieval; Semantic Web; Word (group theory); RDF; Distributional semantics; Natural language processing; Semantic similarity; Programming language","authors":[{"name":"Raul Castro Fernandez","is_ca":false},{"name":"Essam Mansour","is_ca":false},{"name":"Abdulhakim A. Qahtan","is_ca":false},{"name":"Ahmed K. Elmagarmid","is_ca":false},{"name":"Ihab F. Ilyas","is_ca":true},{"name":"Samuel Madden","is_ca":false},{"name":"Mourad Ouzzani","is_ca":false},{"name":"Michael Stonebraker","is_ca":false},{"name":"Nan Tang","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.4932316803399396,"gpt":0.519707133187662,"spread":0.0264754528477224,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004435755,0.001795644,0.001191804,0.01192542,0.001277448,0.003274195,0.001859354,0.001649603,0.002998935],"category_scores_gemma":[0.02616591,0.0008620199,0.002161444,0.01185927,0.001024685,0.01253505,0.006335652,0.001698093,0.001803649],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007318583,"about_ca_system_score_gemma":0.001849453,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003607118,"about_ca_topic_score_gemma":0.007783853,"domain_scores_codex":[0.9957366,0.001571976,0.0006330385,0.0009750287,0.0009039929,0.0001793107],"domain_scores_gemma":[0.9913467,0.004072045,0.00086973,0.00249244,0.0009294658,0.000289587],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005347961,0.0005686339,0.01548976,0.001469069,0.0006515134,0.0004100766,0.002524017,0.01720436,0.007378708,0.04172926,0.01615389,0.8958858],"study_design_scores_gemma":[0.0002011823,0.0005898735,0.006553609,0.0004940627,0.0005088464,0.001072826,0.003896886,0.4631914,0.01733811,0.4306353,0.0752804,0.0002374408],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02644702,0.0009132492,0.955642,0.0006655185,0.0001960143,0.000512068,0.00446223,0.009083256,0.002078697],"genre_scores_gemma":[0.07890739,0.0003946026,0.9115608,0.0002003725,0.00005021035,0.0004034221,0.007163353,0.0004346729,0.0008851273],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01192542,"threshold_uncertainty_score":0.02345878,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2238711864","doi":"10.1561/9781680830231","title":"Trends in Cleaning Relational Data: Consistency and Deduplication","year":2015,"lang":"en","type":"book","venue":"now publishers, Inc. eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":84,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Data quality; Computer science; Data deduplication; Data integrity; Relational database; Consistency (knowledge bases); Anomaly detection; Data consistency; Data mining; Data science; Automation; Process (computing); Data warehouse; Database; Quality (philosophy); Artificial intelligence; Engineering","authors":[{"name":"Ihab F. Ilyas","is_ca":true},{"name":"Xu Chu","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3277735594755778,"gpt":0.4006223382773515,"spread":0.07284877880177365,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01098459,0.0006821703,0.0009068547,0.005752338,0.001483241,0.009137965,0.003817372,0.002053112,0.008178614],"category_scores_gemma":[0.03156237,0.0008918704,0.000937893,0.01483554,0.002689613,0.01826668,0.004818475,0.00340649,0.004612912],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002779635,"about_ca_system_score_gemma":0.002466084,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003295495,"about_ca_topic_score_gemma":0.002718965,"domain_scores_codex":[0.9854219,0.002179791,0.001132245,0.001568705,0.009298247,0.0003991807],"domain_scores_gemma":[0.9565598,0.0169724,0.003476115,0.007733978,0.01421522,0.001042458],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001221323,0.00008134067,0.0054431,0.002153936,0.00006082347,0.0002263973,0.00119317,0.001954921,0.004160232,0.07652466,0.1081716,0.7999077],"study_design_scores_gemma":[0.00002497834,0.0001086706,0.005311004,0.001621764,0.00005749675,0.001804945,0.001825817,0.007627277,0.008124229,0.05804368,0.9153707,0.00007936966],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02758486,0.373941,0.3885497,0.1010334,0.006620106,0.0005447807,0.003810104,0.00509287,0.0928233],"genre_scores_gemma":[0.1338096,0.3315489,0.4535151,0.02265475,0.00760151,0.0004296119,0.009878591,0.002350946,0.03821102],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01098459,"threshold_uncertainty_score":0.05809271,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2492590231","doi":"10.14778/2983200.2983203","title":"Distributed data deduplication","year":2016,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":80,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Data deduplication; Tuple; Computer science; Blocking (statistics); Block (permutation group theory); Relation (database); Backup; Locality; Process (computing); Theoretical computer science; Data mining; Database; Mathematics","authors":[{"name":"Xu Chu","is_ca":true},{"name":"Ihab F. Ilyas","is_ca":true},{"name":"Paraschos Koutris","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2701566814294362,"gpt":0.4095847037039765,"spread":0.1394280222745403,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002900639,0.0009624009,0.001522964,0.0009954371,0.001569028,0.002168587,0.002882895,0.0007436742,0.00288138],"category_scores_gemma":[0.008180099,0.0004749566,0.000636077,0.002344567,0.0008355245,0.003063466,0.003867195,0.001069586,0.001192661],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005335631,"about_ca_system_score_gemma":0.001859531,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007185501,"about_ca_topic_score_gemma":0.001153588,"domain_scores_codex":[0.9977374,0.0004630889,0.0002614409,0.0006499902,0.0006765156,0.0002115748],"domain_scores_gemma":[0.9898888,0.001886859,0.0005392479,0.005753434,0.001631465,0.0003000933],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.001907728,0.0007390953,0.01053621,0.001538366,0.0003914431,0.001142978,0.001013716,0.1671132,0.06034495,0.0474415,0.07294006,0.6348907],"study_design_scores_gemma":[0.000382287,0.000619042,0.003919673,0.0001325178,0.0001595308,0.00259024,0.001079541,0.7292244,0.1134366,0.07963128,0.06867234,0.000152516],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.05992539,0.001859596,0.9254689,0.0007775997,0.0004755423,0.0007247435,0.00170175,0.003398426,0.00566808],"genre_scores_gemma":[0.6663778,0.001041001,0.3197482,0.0004116982,0.0002313806,0.0006985886,0.003307602,0.0003751323,0.007808567],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.002900639,"threshold_uncertainty_score":0.01534027,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2190899134","doi":"10.14778/2850578.2850579","title":"Messing up with BART","year":2015,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":80,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Scalability; Tuple; Computer science; Benchmarking; Completeness (order theory); Greedy algorithm; Process (computing); Benchmark (surveying); Property (philosophy); Scale (ratio); Control (management); Mathematical optimization; Algorithm; Database; Mathematics; Artificial intelligence; Programming language","authors":[{"name":"Patricia C. Arocena","is_ca":true},{"name":"Boris Glavic","is_ca":false},{"name":"Giansalvatore Mecca","is_ca":false},{"name":"Renée J. Miller","is_ca":true},{"name":"Paolo Papotti","is_ca":false},{"name":"Donatello Santoro","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2772987549438379,"gpt":0.3926154589624858,"spread":0.1153167040186479,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0121575,0.0007412063,0.001404297,0.002244162,0.001964065,0.005257948,0.003129474,0.00183309,0.009954876],"category_scores_gemma":[0.07621719,0.000671392,0.001158419,0.003311274,0.003776344,0.0110402,0.00581,0.002596701,0.00272328],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00101427,"about_ca_system_score_gemma":0.002029797,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002379738,"about_ca_topic_score_gemma":0.001490202,"domain_scores_codex":[0.9903781,0.002757651,0.0006147687,0.002215846,0.003154902,0.0008787841],"domain_scores_gemma":[0.938412,0.02727824,0.004422169,0.02296454,0.005469674,0.001453517],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008437378,0.0003204258,0.02071344,0.0005266815,0.0002466513,0.001099921,0.00178636,0.1454112,0.004094273,0.4531747,0.03846785,0.3333149],"study_design_scores_gemma":[0.00008081607,0.0002309555,0.002949694,0.0001774555,0.00009290198,0.0007936996,0.0008388057,0.3059918,0.006409154,0.6264041,0.0559412,0.000089498],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1008212,0.001963328,0.8649973,0.00765474,0.0006546254,0.0002355444,0.001520438,0.003574796,0.01857802],"genre_scores_gemma":[0.6928823,0.001513971,0.2852724,0.00194072,0.0004762761,0.0002945711,0.002625486,0.001064332,0.01393005],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0121575,"threshold_uncertainty_score":0.06429577,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2070702247","doi":"10.1145/1328964.1328967","title":"Meeting of the MINDS","year":2007,"lang":"en","type":"article","venue":"ACM SIGIR Forum","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":76,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Field (mathematics); Key (lock); Space (punctuation); Probabilistic logic; Vector space model; Work (physics); Development (topology); Data science; World Wide Web; Information retrieval; Artificial intelligence","authors":[{"name":"Jamie Callan","is_ca":false},{"name":"James Allan","is_ca":false},{"name":"Charles L. A. Clarke","is_ca":true},{"name":"Susan Dumais","is_ca":false},{"name":"David A. Evans","is_ca":false},{"name":"Mark Sanderson","is_ca":false},{"name":"ChengXiang Zhai","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1208935656852042,"gpt":0.4059370702158174,"spread":0.2850435045306132,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003296453,0.001007141,0.0008087241,0.001185774,0.006219329,0.009502744,0.00105901,0.004400322,0.0435963],"category_scores_gemma":[0.01198258,0.0002958959,0.000618914,0.0006426004,0.008467154,0.006948535,0.008048774,0.009997899,0.01901343],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003079772,"about_ca_system_score_gemma":0.003457939,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00242571,"about_ca_topic_score_gemma":0.002895963,"domain_scores_codex":[0.9960096,0.00138236,0.0001392014,0.0008190825,0.001091641,0.0005581459],"domain_scores_gemma":[0.995042,0.0008732871,0.0002363556,0.0004677897,0.0009855039,0.002395036],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0001210644,0.000061482,0.001392273,0.0001866511,0.0000465771,0.0003035326,0.01195756,0.0001275624,0.001594764,0.167542,0.7188264,0.09784015],"study_design_scores_gemma":[0.000006013919,0.00002236201,0.0003755221,0.0001395187,0.000004518277,0.00025217,0.002629358,0.00005688862,0.00008287815,0.02284447,0.9735715,0.00001469943],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"commentary","genre_gemma":"other","genre_scores_codex":[0.009630064,0.03766449,0.006613737,0.5631464,0.03224991,0.0000488949,0.000265015,0.0003463801,0.350035],"genre_scores_gemma":[0.1998112,0.02322045,0.00685278,0.2708757,0.01759923,0.0001592326,0.0004270778,0.000516844,0.4805376],"genre_candidate":"other","genre_consensus":null,"teacher_disagreement_score":0.0435963,"threshold_uncertainty_score":0.1458442,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1514828683","doi":"10.1186/1472-6963-6-48","title":"Assessing record linkage between health care and Vital Statistics databases using deterministic methods","year":2006,"lang":"en","type":"article","venue":"BMC Health Services Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":73,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true},"ca_institutions":"Institute of Health Economics; University of Calgary","funders":"Canadian Institutes of Health Research; Fondation pour la Recherche Médicale; University of Calgary","keywords":"Linkage (software); Record linkage; Medicine; Database; Population; Identifier; Demography; Statistics; Computer science; Genetics; Biology; Environmental health; Mathematics","authors":[{"name":"Bing Li","is_ca":true},{"name":"Hude Quan","is_ca":true},{"name":"Andrew Fong","is_ca":true},{"name":"Mingshan Lu","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5803401570006748,"gpt":0.6702429424110904,"spread":0.08990278541041563,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2599468,0.0007950186,0.001479649,0.008720662,0.001839017,0.003419084,0.002211255,0.00164683,0.001094121],"category_scores_gemma":[0.5074312,0.0007821323,0.002281569,0.01085879,0.001300166,0.003119366,0.004885396,0.001063418,0.0002514921],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004144838,"about_ca_system_score_gemma":0.008244878,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02409939,"about_ca_topic_score_gemma":0.01436423,"domain_scores_codex":[0.6728901,0.2465319,0.02467063,0.01304441,0.04023616,0.002626854],"domain_scores_gemma":[0.4072894,0.4693958,0.06092275,0.02847294,0.03297061,0.000948446],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0009631885,0.0001571848,0.8704702,0.001293986,0.003704725,0.0001436277,0.002362906,0.02249414,0.0005072216,0.004564198,0.001331799,0.09200691],"study_design_scores_gemma":[0.0005514208,0.001578568,0.6887988,0.001312371,0.004611955,0.001661853,0.003763892,0.246094,0.01341197,0.02252522,0.01510937,0.0005804574],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6382464,0.00334654,0.3463225,0.001280003,0.00008644204,0.001980055,0.00464889,0.0004737567,0.003615394],"genre_scores_gemma":[0.8628794,0.0006018571,0.1324305,0.0001692801,0.00003765946,0.001054447,0.002512147,0.00004212056,0.0002727278],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7400532,"threshold_uncertainty_score":0.9126174,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2146738361","doi":"10.1145/1242572.1242802","title":"BlogScope","year":2007,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":72,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Blogosphere; Computer science; Ranking (information retrieval); Information retrieval; Relevance (law); Set (abstract data type); World Wide Web; Data mining; The Internet","authors":[{"name":"Nilesh Bansal","is_ca":true},{"name":"Nick Koudas","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3627863579026169,"gpt":0.5270323869453386,"spread":0.1642460290427217,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001586522,0.0008087488,0.0008506578,0.003337012,0.001064183,0.004006914,0.001786748,0.0009287985,0.0616226],"category_scores_gemma":[0.00738077,0.0005300193,0.0006206051,0.003587258,0.0004048323,0.004937809,0.003167721,0.001439678,0.0404707],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006354816,"about_ca_system_score_gemma":0.001628029,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005299048,"about_ca_topic_score_gemma":0.007838556,"domain_scores_codex":[0.9987165,0.0001504671,0.0001234109,0.0002653207,0.0006338109,0.0001104005],"domain_scores_gemma":[0.9943348,0.001517524,0.0003131053,0.001644535,0.001224448,0.0009656812],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0005202105,0.0001542036,0.003436308,0.000780136,0.00005816418,0.0002403566,0.0003174302,0.0005317281,0.003369627,0.005759892,0.8414843,0.1433477],"study_design_scores_gemma":[0.0001446839,0.00008042793,0.003696583,0.00008417939,0.00003167242,0.0002982583,0.0001433589,0.005835576,0.003096256,0.00379785,0.9827229,0.00006829594],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"software","genre_gemma":"software","genre_scores_codex":[0.02114144,0.003005123,0.09413934,0.003228947,0.002157042,0.001704861,0.2759843,0.4129918,0.1856472],"genre_scores_gemma":[0.0850923,0.002728526,0.1693832,0.002851688,0.0008491451,0.001220745,0.5681431,0.0308464,0.1388849],"genre_candidate":"software","genre_consensus":"software","teacher_disagreement_score":0.0616226,"threshold_uncertainty_score":0,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1626378195","doi":"10.1145/1938551.1938585","title":"Data cleaning and query answering with matching dependencies and matching functions","year":2011,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":69,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia; Carleton University","funders":"Natural Sciences and Engineering Research Council of Canada; International Business Machines Corporation","keywords":"Tuple; Matching (statistics); Computer science; Monotone polygon; Conjunctive query; Dependency (UML); Functional dependency; Semantics (computer science); Dependency theory (database theory); Query optimization; Upper and lower bounds; Theoretical computer science; Mathematics; Information retrieval; Discrete mathematics; Relational database; Artificial intelligence; Programming language","authors":[{"name":"Leopoldo Bertossi","is_ca":true},{"name":"Solmaz Kolahi","is_ca":true},{"name":"Laks V. S. Lakshmanan","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3569999851508519,"gpt":0.3743921688869392,"spread":0.01739218373608725,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01475668,0.001067199,0.00211269,0.002814244,0.0015259,0.005284358,0.002940772,0.002600736,0.001985002],"category_scores_gemma":[0.04748325,0.001161838,0.003255594,0.004320249,0.004018411,0.01308179,0.005157213,0.004582676,0.0005119955],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002373951,"about_ca_system_score_gemma":0.002614689,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00266335,"about_ca_topic_score_gemma":0.001855685,"domain_scores_codex":[0.9808854,0.008164917,0.001608946,0.002631764,0.005406156,0.00130269],"domain_scores_gemma":[0.9612765,0.02759493,0.002495625,0.005575846,0.002454697,0.0006024205],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0006304579,0.0004224866,0.004745035,0.0006689017,0.0002044959,0.0003470792,0.001188239,0.1841217,0.009360426,0.6639196,0.004725653,0.1296659],"study_design_scores_gemma":[0.00006460142,0.0001109613,0.0005742453,0.00003884728,0.00006940087,0.000365464,0.0002164055,0.5610893,0.008078706,0.4243236,0.005025012,0.00004336224],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01924519,0.0002836008,0.9775968,0.000819988,0.00001643509,0.0001121883,0.0001778546,0.0004201394,0.001327738],"genre_scores_gemma":[0.26604,0.0004104662,0.7296931,0.0005222438,0.000133462,0.0003346649,0.0008203544,0.0001835046,0.001862261],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01475668,"threshold_uncertainty_score":0.07804173,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2115215982","doi":"10.14778/1453856.1453883","title":"Hashed samples","year":2008,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":68,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto; York University","funders":"","keywords":"Similarity (geometry); Estimator; A priori and a posteriori; Computer science; Overhead (engineering); Set (abstract data type); Sampling (signal processing); Cosine similarity; Algorithm; Data mining; Pattern recognition (psychology); Mathematics; Artificial intelligence; Statistics","authors":[{"name":"Marios Hadjieleftheriou","is_ca":false},{"name":"Xiaohui Yu","is_ca":true},{"name":"Nick Koudas","is_ca":true},{"name":"Divesh Srivastava","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2910039101624485,"gpt":0.3717421828373335,"spread":0.08073827267488504,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004565466,0.0006726794,0.001362233,0.002230134,0.000921086,0.002051435,0.002230327,0.001123271,0.004500926],"category_scores_gemma":[0.03776337,0.0005905165,0.000822903,0.002566817,0.001185464,0.005785041,0.002667209,0.001325861,0.001692427],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001066717,"about_ca_system_score_gemma":0.001060048,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0008847294,"about_ca_topic_score_gemma":0.0009028299,"domain_scores_codex":[0.9945505,0.001136465,0.000413102,0.001123357,0.002431354,0.0003453371],"domain_scores_gemma":[0.9784055,0.01173603,0.001616584,0.005762353,0.002085104,0.0003944561],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001852968,0.000370091,0.01649695,0.0005989676,0.0002148063,0.0003696934,0.0008046987,0.1180419,0.02576906,0.1614239,0.009754835,0.6643022],"study_design_scores_gemma":[0.0001393787,0.0004997972,0.001761964,0.00004850404,0.00005759515,0.0008079214,0.0002721543,0.8574864,0.02977708,0.09955601,0.009540191,0.00005301665],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02584472,0.000289877,0.970735,0.0002005079,0.00005993759,0.0001841746,0.0003463727,0.00119614,0.001143298],"genre_scores_gemma":[0.443255,0.0003471438,0.5510418,0.0002990266,0.0002459524,0.0004468014,0.001448263,0.0002319907,0.002684038],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004565466,"threshold_uncertainty_score":0.02414477,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2583699183","doi":"","title":"Data Ingestion for the Connected World.","year":2017,"lang":"en","type":"article","venue":"Conference on Innovative Data Systems Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":68,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Ingestion; Medicine","authors":[{"name":"John Meehan","is_ca":false},{"name":"Cansu Aslantas","is_ca":false},{"name":"Stan Zdonik","is_ca":false},{"name":"Nesime Tatbul","is_ca":false},{"name":"Jiang Du","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.9484017230905639,"gpt":0.6713623530691826,"spread":0.2770393700213813,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008336633,0.0009813579,0.001015283,0.003465313,0.002526005,0.009847531,0.002847907,0.002645242,0.02167739],"category_scores_gemma":[0.02964368,0.0008862456,0.001240175,0.005397003,0.001902352,0.01842966,0.008626588,0.002972838,0.01006711],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001470906,"about_ca_system_score_gemma":0.003430326,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003883541,"about_ca_topic_score_gemma":0.003923412,"domain_scores_codex":[0.9952683,0.001658594,0.0004135694,0.0006789845,0.001659924,0.0003205624],"domain_scores_gemma":[0.9777657,0.006688742,0.000601296,0.01075168,0.003140142,0.001052456],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.001537388,0.0003571335,0.01259934,0.0008803311,0.0003752091,0.000926865,0.001316612,0.008563974,0.005718277,0.1195946,0.3800803,0.4680501],"study_design_scores_gemma":[0.0002322377,0.0001991492,0.00607223,0.001023006,0.0002622201,0.001010575,0.002236554,0.1126787,0.02027926,0.270132,0.5857106,0.0001634312],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.05185302,0.0146488,0.6837714,0.0453192,0.0055824,0.001124915,0.02441284,0.09136271,0.08192468],"genre_scores_gemma":[0.4607695,0.01063785,0.4175049,0.004765498,0.002063966,0.0005849376,0.05253784,0.01098053,0.04015487],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.02167739,"threshold_uncertainty_score":0.07251805,"prediction_status":"machine_predicted_unvalidated"},"labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"bench_or_experimental","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":[],"domain":null,"study_design":"not_applicable","genre":"software","about_ca_system":false,"about_ca_topic":false,"confidence":"high"}],"label_agreement":"split"},{"id":"W2616147950","doi":"10.14778/3115404.3115409","title":"Auto-join","year":2017,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":66,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Joins; Join (topology); Computer science; Transformation (genetics); Domain (mathematical analysis); String (physics); Database; Data mining; Theoretical computer science; Programming language; Mathematics","authors":[{"name":"Erkang Zhu","is_ca":true},{"name":"Yeye He","is_ca":false},{"name":"Surajit Chaudhuri","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1996264917742379,"gpt":0.4134582450415684,"spread":0.2138317532673306,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005297637,0.001098948,0.00114686,0.001970623,0.001367452,0.003220745,0.003376425,0.000937036,0.01977639],"category_scores_gemma":[0.01372293,0.0007492726,0.001746283,0.002257868,0.001221177,0.004726538,0.006444715,0.001458352,0.005891527],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006244694,"about_ca_system_score_gemma":0.001737375,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001621153,"about_ca_topic_score_gemma":0.002143116,"domain_scores_codex":[0.9921705,0.001029798,0.000722334,0.001950142,0.003713248,0.0004139831],"domain_scores_gemma":[0.9898599,0.002834718,0.0004376196,0.004863498,0.001716795,0.0002874784],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001457819,0.0004875447,0.01458256,0.0008799261,0.0003329797,0.0005058463,0.001251333,0.0238037,0.02243548,0.09813234,0.0789342,0.7571962],"study_design_scores_gemma":[0.0002826265,0.0004530248,0.003982882,0.0001628235,0.0001795885,0.001742434,0.0008230765,0.4322891,0.0912307,0.1832447,0.2854356,0.000173437],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01376038,0.0003608255,0.9247355,0.000210331,0.0001704814,0.0003939779,0.002495207,0.04491507,0.01295812],"genre_scores_gemma":[0.2091268,0.0003621225,0.7531769,0.0005445711,0.0001805557,0.000528625,0.01361135,0.008758059,0.01371111],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01977639,"threshold_uncertainty_score":0,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2427822648","doi":"10.1109/icde.2016.7498319","title":"DataXFormer: A robust transformation discovery system","year":2016,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":66,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Transformation (genetics); Data transformation; Representation (politics); External Data Representation; Knowledge base; Information retrieval; Base (topology); World Wide Web; Data mining; Theoretical computer science; Artificial intelligence; Data warehouse; Mathematics","authors":[{"name":"Ziawasch Abedjan","is_ca":false},{"name":"John Morcos","is_ca":true},{"name":"Ihab F. Ilyas","is_ca":true},{"name":"Mourad Ouzzani","is_ca":false},{"name":"Paolo Papotti","is_ca":false},{"name":"Michael Stonebraker","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2087469238632512,"gpt":0.3724310305524388,"spread":0.1636841066891875,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004419406,0.001433894,0.001298502,0.004296596,0.00107384,0.002348126,0.003427978,0.00125299,0.01060783],"category_scores_gemma":[0.01137362,0.001084265,0.002085895,0.00334145,0.0009401382,0.004185558,0.003694034,0.001840619,0.007144825],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001320742,"about_ca_system_score_gemma":0.002906942,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007453701,"about_ca_topic_score_gemma":0.008262133,"domain_scores_codex":[0.995971,0.0005572186,0.0004930641,0.001338834,0.001483833,0.0001559293],"domain_scores_gemma":[0.9949687,0.001833674,0.0003868423,0.001796257,0.0008831067,0.0001315884],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0009608721,0.0004005326,0.006795187,0.001045627,0.0002998214,0.0008953918,0.000561409,0.01817228,0.02273544,0.01449943,0.2291798,0.7044542],"study_design_scores_gemma":[0.0006325949,0.000261297,0.006558431,0.0002639116,0.0002171503,0.001240673,0.0004210259,0.3913089,0.1136742,0.04058236,0.444465,0.0003743825],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.007755894,0.0004133036,0.5711513,0.0004504763,0.0001006642,0.0004511366,0.01545941,0.4003022,0.003915689],"genre_scores_gemma":[0.0757525,0.0004309657,0.8189064,0.0005492552,0.00006692667,0.000822456,0.08247311,0.01357044,0.007427955],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01060783,"threshold_uncertainty_score":0.03548676,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}