{"meta":{"query_hash":"98f632c1f71b","filters":{"topic":"Data Quality and Management"},"cohort_total":867,"direct_labels_cover":10,"predictions_cover":867,"exported":867,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/98f632c1f71b","api":"https://metacan.xera.ac/api/v1/cohort?topic=Data+Quality+and+Management"},"results":[{"id":"W10093320","doi":"","title":"Data warehousing model for integrating fragmented electronic health records from disparate and heterogeneous clinical data stores","year":2013,"lang":"en","type":"dissertation","venue":"School of Electrical Engineering & Computer Science; Science & Engineering Faculty","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Data warehouse; Health records; Logical data model; Data science; Conceptual model; Computer science; Data integration; Data modeling; Health care; Data mining; Database; Political science","score_opus":0.198103558537665,"score_gpt":0.45206952459394517,"score_spread":0.2539659660562802,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W10093320","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.040858116,0.00036978335,0.9332432,0.0020367822,0.00016525359,0.0012443679,0.006336289,0.012669955,0.0030762076],"genre_scores_gemma":[0.17260404,0.00043891836,0.81523716,0.00032687304,0.000085726744,0.0010696561,0.0073796697,0.000210219,0.0026477715],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99768186,0.00047437445,0.00037367936,0.00046574877,0.0007997747,0.0002044823],"domain_scores_gemma":[0.9945862,0.0023555574,0.00040787688,0.0011232699,0.0012806698,0.0002463853],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0054286397,0.0012254985,0.0014013916,0.0025987742,0.0016751887,0.004555606,0.0033945371,0.001159545,0.0030971738],"category_scores_gemma":[0.013004555,0.001242157,0.002320994,0.0058224294,0.00060937897,0.0051289625,0.0031801881,0.0017406043,0.0015634514],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013032211,0.001426826,0.028797507,0.0006750736,0.0010162828,0.00080777897,0.0009604568,0.43061945,0.004243695,0.052456126,0.03674339,0.44095019],"study_design_scores_gemma":[0.00008059256,0.00008582822,0.0015585923,0.00003439052,0.00007059929,0.00008150672,0.00014938803,0.97611374,0.0011558883,0.01566641,0.004971065,0.00003208026],"about_ca_topic_score_codex":0.04070251,"about_ca_topic_score_gemma":0.036651254,"teacher_disagreement_score":0.04070251,"about_ca_system_score_codex":0.0021714133,"about_ca_system_score_gemma":0.0053763054,"threshold_uncertainty_score":0.08093119},"labels":[],"label_agreement":null},{"id":"W103306089","doi":"","title":"Comparing the Predictive Ability of PLS and Covariance Models","year":2012,"lang":"en","type":"article","venue":"International Conference on Information Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":19,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Covariance; Computer science; Artificial intelligence; Statistics; Econometrics; Mathematics","score_opus":0.34153558244347226,"score_gpt":0.40697868604926923,"score_spread":0.06544310360579697,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W103306089","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6389152,0.0012746498,0.34504873,0.0021871075,0.0002576847,0.00014087406,0.0011467523,0.0025990384,0.008430077],"genre_scores_gemma":[0.96592563,0.00033941417,0.030716281,0.000133705,0.00008256594,0.000058811715,0.0012145798,0.00019649594,0.0013326256],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9907358,0.0064136367,0.00028993562,0.00083502335,0.001393068,0.000332523],"domain_scores_gemma":[0.91639715,0.07169881,0.0017260802,0.0050869985,0.0046461453,0.00044488543],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.021863272,0.0012443691,0.001083113,0.0030560351,0.00072549196,0.0033000298,0.0012371099,0.0014322447,0.0021316693],"category_scores_gemma":[0.092591934,0.0005914036,0.0020150822,0.002359709,0.0008333626,0.0042259996,0.0017039258,0.0016277543,0.0009674219],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002736183,0.00067397516,0.11254891,0.00039739438,0.0018740932,0.0001148422,0.00072052155,0.4825988,0.003222158,0.022719802,0.0058923485,0.3665009],"study_design_scores_gemma":[0.00007752111,0.00025817932,0.015091737,0.000040699568,0.00024661314,0.00005971618,0.0002075568,0.96707547,0.0019289486,0.0137793245,0.001169658,0.00006457882],"about_ca_topic_score_codex":0.0077422094,"about_ca_topic_score_gemma":0.0066241724,"teacher_disagreement_score":0.021863272,"about_ca_system_score_codex":0.00093861984,"about_ca_system_score_gemma":0.0018096975,"threshold_uncertainty_score":0.11562538},"labels":[],"label_agreement":null},{"id":"W10845949","doi":"","title":"An Effective and Efficient Data Cleaning Technique in Large Databases.","year":2004,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Database; Computer science","score_opus":0.17543865131859368,"score_gpt":0.4672611410951992,"score_spread":0.2918224897766055,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W10845949","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013206739,0.0026802002,0.9751483,0.0013628278,0.00032557742,0.00045962993,0.0018431299,0.0036300821,0.0013435776],"genre_scores_gemma":[0.04874561,0.00077934156,0.94577885,0.0002566459,0.00013394824,0.0003072446,0.0026908345,0.000118578355,0.0011889377],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98943126,0.003480963,0.0012573363,0.00096403324,0.004603196,0.00026321193],"domain_scores_gemma":[0.9810034,0.0077130836,0.0015899196,0.0051198257,0.0042315004,0.00034234955],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007850795,0.00068902323,0.0011479756,0.0037947262,0.0016624318,0.003281052,0.00198813,0.0012953226,0.0015997865],"category_scores_gemma":[0.029167397,0.00076956465,0.0012078724,0.0055916826,0.00064847304,0.0038664662,0.0028873328,0.0019420979,0.0015887279],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00065195287,0.00035755156,0.009388927,0.0010835867,0.0005703545,0.0005089326,0.00044812876,0.009931302,0.019988565,0.015186987,0.054501843,0.88738185],"study_design_scores_gemma":[0.0005988872,0.00092005514,0.03082248,0.0008887304,0.0011528175,0.00527934,0.0015603385,0.44741905,0.10690542,0.13699317,0.26713806,0.00032164663],"about_ca_topic_score_codex":0.0016217375,"about_ca_topic_score_gemma":0.0027233737,"teacher_disagreement_score":0.007850795,"about_ca_system_score_codex":0.0004018021,"about_ca_system_score_gemma":0.0028681743,"threshold_uncertainty_score":0.041519463},"labels":[],"label_agreement":null},{"id":"W1103151178","doi":"10.1007/978-3-319-21542-6_18","title":"Ontology-Based Multidimensional Contexts with Applications to Quality Data Specification and Extraction","year":2015,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"","keywords":"Computer science; Datalog; Dimension (graph theory); Context (archaeology); Ontology; Data quality; Quality (philosophy); Information retrieval; Data mining; Database; Data extraction; Online analytical processing; Data warehouse","score_opus":0.3076732723549056,"score_gpt":0.4521949623316024,"score_spread":0.1445216899766968,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1103151178","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0030101798,0.00081234524,0.9902113,0.000547879,0.0001232281,0.00014671123,0.00042995194,0.0007728665,0.003945653],"genre_scores_gemma":[0.043250613,0.0010155287,0.95296305,0.00013593429,0.0000664463,0.00018462412,0.00076376786,0.0002082326,0.0014118049],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99554634,0.0011977646,0.0009627109,0.0007034456,0.0013727365,0.00021694414],"domain_scores_gemma":[0.995488,0.0017482198,0.0004260963,0.0010380287,0.001077278,0.00022225441],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003966712,0.0009249741,0.0012485023,0.0043050745,0.0022306247,0.006310808,0.0022365863,0.0012878218,0.003058577],"category_scores_gemma":[0.010417145,0.0008432492,0.0029179452,0.008102942,0.0024569002,0.009191904,0.0064303987,0.0033771598,0.0008451878],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000052135303,0.00009852068,0.0011412038,0.00061766984,0.00007691898,0.00037711445,0.0018630486,0.012971219,0.003533338,0.81517315,0.0064864266,0.1576092],"study_design_scores_gemma":[0.000026850006,0.00004124383,0.00087864866,0.0006456739,0.00015366088,0.00059245585,0.0016932763,0.12800287,0.007167565,0.70217305,0.15849543,0.00012929835],"about_ca_topic_score_codex":0.007411253,"about_ca_topic_score_gemma":0.010892434,"teacher_disagreement_score":0.007411253,"about_ca_system_score_codex":0.002082711,"about_ca_system_score_gemma":0.0025203605,"threshold_uncertainty_score":0.020978272},"labels":[],"label_agreement":null},{"id":"W113155598","doi":"","title":"Using an information ecology approach to identify research areas: Findings from Lithuania","year":2009,"lang":"en","type":"article","venue":"ResearchWorks at the University of Washington (University of Washington)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"International Development Research Centre; University of Washington; Bill and Melinda Gates Foundation","keywords":"Ecology; Geography; Environmental resource management; Environmental planning; Environmental science; Biology","score_opus":0.2254375186368085,"score_gpt":0.403475608388509,"score_spread":0.1780380897517005,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W113155598","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99014145,0.0008544139,0.00025690734,0.00069802103,0.000008418705,0.00009230786,0.00004678287,0.00000634014,0.007895428],"genre_scores_gemma":[0.99769706,0.00073716935,0.00035935742,0.00017100525,0.0000048434363,0.00008313855,0.000045021385,0.000005028803,0.00089736644],"study_design_codex":"qualitative","study_design_gemma":"observational","domain_scores_codex":[0.99440503,0.0027082344,0.00045955868,0.00028992767,0.0005467157,0.0015904378],"domain_scores_gemma":[0.9943041,0.0034382106,0.00080811325,0.00023841922,0.0006871501,0.0005240086],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007127048,0.00043096812,0.00086151075,0.0075894278,0.0069643594,0.008262672,0.0010383866,0.0009821797,0.0014682931],"category_scores_gemma":[0.007544788,0.00053940405,0.0004812966,0.00922004,0.0067020287,0.0029350468,0.008473365,0.001052327,0.00023859767],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00004336709,0.00005619525,0.086300865,0.0004630448,0.000018960951,0.0021616989,0.8912024,0.00008092309,0.00090039225,0.0026850053,0.00029692746,0.015790198],"study_design_scores_gemma":[0.000003874478,0.000038467933,0.0757309,0.00037139998,0.000011572959,0.00029930257,0.9180106,0.00005924696,0.00022650727,0.000189082,0.0050515425,0.000007483331],"about_ca_topic_score_codex":0.04395985,"about_ca_topic_score_gemma":0.047287766,"teacher_disagreement_score":0.04395985,"about_ca_system_score_codex":0.007843236,"about_ca_system_score_gemma":0.012771224,"threshold_uncertainty_score":0.08740795},"labels":[],"label_agreement":null},{"id":"W125535106","doi":"10.1007/978-0-387-35503-0_28","title":"Environmental Decision Support Systems: Exactly What Are They?","year":2000,"lang":"en","type":"book-chapter","venue":"IFIP advances in information and communication technology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Decision support system; Geography; Environmental planning; Environmental resource management; Psychology; Operations research; Management science; Computer science; Engineering; Environmental science; Artificial intelligence","score_opus":0.032767156516840985,"score_gpt":0.3210601548778049,"score_spread":0.28829299836096395,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W125535106","genre_codex":"commentary","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0059951325,0.1828971,0.053030822,0.57450676,0.017641393,0.00011886925,0.00038458692,0.00058016536,0.16484514],"genre_scores_gemma":[0.31007585,0.31805298,0.12405778,0.13777986,0.032732792,0.0008497891,0.00068837684,0.0005460595,0.07521657],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.99281305,0.0034397617,0.00027373072,0.00042301253,0.0025148534,0.0005355075],"domain_scores_gemma":[0.9867352,0.0073648873,0.00074322487,0.0007636669,0.003007619,0.0013854859],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011584448,0.0011923391,0.0010297471,0.0016702684,0.0014961318,0.015389695,0.0021202657,0.0052265483,0.009104869],"category_scores_gemma":[0.023189278,0.00073043624,0.0006521036,0.0026204737,0.010394007,0.027810486,0.0026614696,0.005928494,0.0035735045],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00004360538,0.000145208,0.0009798349,0.001028645,0.00005879761,0.00006220247,0.0010248043,0.0013329732,0.0002343924,0.55818915,0.1269824,0.309918],"study_design_scores_gemma":[0.000021832302,0.00003154793,0.0005538574,0.0013217233,0.000029874906,0.00006208884,0.0012103977,0.0012585106,0.00021924516,0.55026037,0.4449948,0.000035702047],"about_ca_topic_score_codex":0.0029655683,"about_ca_topic_score_gemma":0.002920477,"teacher_disagreement_score":0.015389695,"about_ca_system_score_codex":0.0032374754,"about_ca_system_score_gemma":0.006182712,"threshold_uncertainty_score":0.06126511},"labels":[],"label_agreement":null},{"id":"W1416634528","doi":"","title":"Automating Data Capture from the Ontario Laboratories Information System (OLIS) for Secondary Data Uses","year":2011,"lang":"en","type":"article","venue":"ElectronicHealthcare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Automatic identification and data capture; Computer science; Information system; Data science; Engineering; Operating system","score_opus":0.4134392341345837,"score_gpt":0.4101554214904161,"score_spread":0.003283812644167605,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1416634528","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.24965988,0.0012593486,0.5254984,0.0034326075,0.00039205703,0.01496128,0.09038824,0.047156744,0.06725137],"genre_scores_gemma":[0.48041996,0.0009400681,0.41444644,0.0008553722,0.0001894593,0.003427313,0.062907085,0.002204449,0.034609884],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99202263,0.0012859086,0.0006601387,0.0008725507,0.004449535,0.0007092194],"domain_scores_gemma":[0.97356385,0.005723621,0.0015439193,0.0028864052,0.015601937,0.0006803411],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006753224,0.0009790661,0.00078130316,0.0062464303,0.0020337831,0.0038624257,0.0013198849,0.00044064867,0.00809316],"category_scores_gemma":[0.02057995,0.00066382985,0.0006599803,0.007123664,0.0006287645,0.0011323182,0.0016767307,0.00071846996,0.0044875345],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006003301,0.00034140452,0.16440956,0.001173596,0.00014465582,0.00024339005,0.003424346,0.0063938913,0.056584515,0.0033851552,0.13880648,0.62449265],"study_design_scores_gemma":[0.0002560429,0.00026860487,0.41844967,0.00053060736,0.0002930886,0.0002712328,0.003374414,0.11603821,0.14000635,0.0033242363,0.3168765,0.00031099244],"about_ca_topic_score_codex":0.6265579,"about_ca_topic_score_gemma":0.6950969,"teacher_disagreement_score":0.3734421,"about_ca_system_score_codex":0.009998569,"about_ca_system_score_gemma":0.025589706,"threshold_uncertainty_score":0.75128275},"labels":[],"label_agreement":null},{"id":"W145435252","doi":"10.1007/978-3-642-19041-4_15","title":"Rule Testing with JRules","year":2011,"lang":"en","type":"book-chapter","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Montréal","funders":"","keywords":"Computer science; Consistency (knowledge bases); Key (lock); Set (abstract data type); Suite; Business rule; Software engineering; Operator (biology); Isolation (microbiology); Software; Service (business); Data mining; Business process; Artificial intelligence; Programming language; Operating system; Engineering; Work in process","score_opus":0.46040201778689865,"score_gpt":0.3754587824837807,"score_spread":0.08494323530311798,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W145435252","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.003835695,0.00046265614,0.9338228,0.00072557555,0.00044012646,0.00014009837,0.00035550923,0.0077606374,0.052456867],"genre_scores_gemma":[0.10476948,0.0003920453,0.8355913,0.00092003436,0.00038420444,0.00021467195,0.0014241897,0.0030381973,0.05326584],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99149466,0.0024841176,0.0006730236,0.0019166907,0.003064511,0.00036692733],"domain_scores_gemma":[0.9801389,0.012906481,0.0004740281,0.004055857,0.0022392953,0.00018542842],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007131783,0.0014190712,0.0018204066,0.0023580615,0.0009389029,0.0046221367,0.0044914046,0.0015850706,0.030114122],"category_scores_gemma":[0.039347608,0.00093908136,0.002299571,0.0014813803,0.0027425808,0.0058021634,0.0032246874,0.0032324598,0.014860877],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00023166275,0.00010900301,0.0008148481,0.0003791196,0.00009649462,0.00047722337,0.00022739226,0.013904532,0.0033088014,0.22629309,0.02770518,0.72645265],"study_design_scores_gemma":[0.00006907554,0.00009452111,0.0003307598,0.0003003442,0.00010676777,0.0006556099,0.00011950092,0.20838436,0.018929385,0.69928133,0.071654506,0.00007381692],"about_ca_topic_score_codex":0.0016057472,"about_ca_topic_score_gemma":0.0018148713,"teacher_disagreement_score":0.030114122,"about_ca_system_score_codex":0.00090721855,"about_ca_system_score_gemma":0.0015549229,"threshold_uncertainty_score":0.100741744},"labels":[],"label_agreement":null},{"id":"W146486917","doi":"10.1007/978-3-642-31537-4_2","title":"Transductive Relational Classification in the Co-training Paradigm","year":2012,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"National Research Council Canada; University of Ottawa","funders":"","keywords":"Computer science; Schema (genetic algorithms); Relational database; Artificial intelligence; Machine learning; Construct (python library); Training set; Statistical relational learning; Independence (probability theory); Labeled data; Data mining","score_opus":0.28507347646492137,"score_gpt":0.3941394393181918,"score_spread":0.10906596285327042,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W146486917","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005532611,0.0015012727,0.9855598,0.0008838228,0.00009706928,0.000044629192,0.00013318809,0.0003665198,0.0058810683],"genre_scores_gemma":[0.3987727,0.002933049,0.5757971,0.00090335734,0.00081466086,0.0003298708,0.0013515225,0.00035546784,0.018742334],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9966934,0.0017763241,0.00016047621,0.00056348357,0.0006734429,0.00013280114],"domain_scores_gemma":[0.9929516,0.0051430315,0.00015930104,0.0011649618,0.00047352133,0.00010763573],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004874291,0.00077325746,0.0012821608,0.0010639947,0.0005220519,0.0027522945,0.0024405804,0.0016198063,0.0044501475],"category_scores_gemma":[0.009012274,0.0005138431,0.0010122957,0.002446863,0.0017043808,0.0056488225,0.0026784407,0.0043824594,0.001945277],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00016056934,0.00024517512,0.0011650778,0.0004181906,0.00016910452,0.00018303507,0.000383849,0.08750002,0.0031045103,0.36353597,0.015683223,0.52745134],"study_design_scores_gemma":[0.000009630446,0.00005943535,0.0003025474,0.00005734591,0.000037004123,0.00019491483,0.000060038652,0.6025422,0.0021839296,0.3863875,0.008140881,0.000024572182],"about_ca_topic_score_codex":0.0010637722,"about_ca_topic_score_gemma":0.0013781938,"teacher_disagreement_score":0.004874291,"about_ca_system_score_codex":0.0007149728,"about_ca_system_score_gemma":0.0007087867,"threshold_uncertainty_score":0.025777996},"labels":[],"label_agreement":null},{"id":"W1469477946","doi":"10.1007/978-3-642-39872-8_3","title":"The Vivification Problem in Real-Time Business Intelligence: A Vision","year":2013,"lang":"en","type":"book-chapter","venue":"Lecture notes in business information processing","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Correctness; Business intelligence; Business rule; Schema (genetic algorithms); Data warehouse; Business information; Artifact-centric business process model; Data science; Business process modeling; Knowledge management; Business process; Database; Information retrieval; Business; Algorithm; Work in process; Marketing","score_opus":0.05337242464430064,"score_gpt":0.3409791299198733,"score_spread":0.28760670527557264,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1469477946","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01738623,0.015819624,0.892269,0.015674794,0.0011969223,0.000058183705,0.00014970206,0.0005996789,0.056845963],"genre_scores_gemma":[0.56375444,0.015547991,0.36919382,0.002414538,0.0025793936,0.00019427454,0.00048291497,0.0005161648,0.04531647],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9989053,0.00038038188,0.000054904245,0.00026403193,0.0002835214,0.0001118198],"domain_scores_gemma":[0.9965659,0.0021931378,0.00020553268,0.0004959901,0.0003638489,0.00017559832],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0026284468,0.0009413298,0.0010113415,0.0009831594,0.00090197474,0.007517768,0.0024678374,0.0030752062,0.008389854],"category_scores_gemma":[0.010710858,0.00055415474,0.00096555904,0.0016976447,0.0054785884,0.020992706,0.0036502315,0.0041892957,0.0013001449],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00008928615,0.00002054635,0.00013844082,0.00014288841,0.000014945323,0.00008720743,0.0005847774,0.0052175024,0.0012381474,0.88948673,0.006387575,0.09659187],"study_design_scores_gemma":[0.000018171017,0.000021687341,0.00009206934,0.000049659677,0.000011490467,0.00011907035,0.00029398728,0.03859026,0.0007729631,0.93690187,0.023109887,0.000018926898],"about_ca_topic_score_codex":0.0024872276,"about_ca_topic_score_gemma":0.0008400597,"teacher_disagreement_score":0.008389854,"about_ca_system_score_codex":0.0010964746,"about_ca_system_score_gemma":0.00089825684,"threshold_uncertainty_score":0.028066874},"labels":[],"label_agreement":null},{"id":"W147952491","doi":"10.3233/978-1-61499-203-5-37","title":"Challenges in data quality assurance for electronic health records","year":2013,"lang":"en","type":"article","venue":"Studies in health technology and informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria","funders":"","keywords":"Quality assurance; Computer science; Dimension (graph theory); Data quality; Health records; Scale (ratio); Data science; Quality (philosophy); Electronic health record; Risk analysis (engineering); Data mining; Health care; Medicine; Engineering; Operations management","score_opus":0.5625995491724509,"score_gpt":0.5567803044172939,"score_spread":0.005819244755157049,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W147952491","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015273421,0.058851734,0.42625716,0.4835887,0.0019815308,0.0007392906,0.00032870978,0.000607892,0.012371583],"genre_scores_gemma":[0.2420308,0.036767233,0.6927591,0.01998469,0.0042086653,0.0009916989,0.0005890737,0.00028714444,0.0023816156],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.79279006,0.11371811,0.021944605,0.011218291,0.057057887,0.003271123],"domain_scores_gemma":[0.46481803,0.40432522,0.02481159,0.024038356,0.07694092,0.005065932],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.19432548,0.0012002124,0.002456129,0.008485572,0.005413597,0.023095036,0.0076569784,0.00867782,0.0022227967],"category_scores_gemma":[0.29366034,0.0013222484,0.0020880944,0.01054696,0.014039462,0.0270263,0.010227656,0.010682862,0.001079377],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00011448907,0.00036914938,0.012605656,0.0056678993,0.00022371559,0.000461582,0.005904396,0.013201952,0.0015004751,0.34900704,0.031275943,0.5796677],"study_design_scores_gemma":[0.000112303365,0.00037820387,0.008795403,0.006747812,0.00015730903,0.0013278883,0.017024832,0.05868844,0.0031646152,0.6707521,0.23244087,0.00041013336],"about_ca_topic_score_codex":0.011902195,"about_ca_topic_score_gemma":0.0061156647,"teacher_disagreement_score":0.19432548,"about_ca_system_score_codex":0.0104379915,"about_ca_system_score_gemma":0.020106453,"threshold_uncertainty_score":0.9935401},"labels":[],"label_agreement":null},{"id":"W1505573608","doi":"10.1007/978-3-642-13094-6_6","title":"Dependency Discovery in Data Quality","year":2010,"lang":"en","type":"book-chapter","venue":"Notes on numerical fluid mechanics and multidisciplinary design","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":18,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Dependency (UML); Computer science; Bayesian network; Data mining; Data quality; Consistency (knowledge bases); Completeness (order theory); Functional dependency; Dependency theory (database theory); Quality (philosophy); Knowledge extraction; Artificial intelligence; Relational database; Mathematics; Engineering","score_opus":0.3158537684515106,"score_gpt":0.42526183407947443,"score_spread":0.10940806562796385,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1505573608","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0034495997,0.005404041,0.95471597,0.014631495,0.0005051376,0.00006929046,0.00048449938,0.00057856616,0.020161366],"genre_scores_gemma":[0.3378377,0.010861637,0.6106724,0.0046289684,0.0037895637,0.00058368174,0.0022127593,0.0012923643,0.028120961],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98435473,0.006221185,0.0012693945,0.0022845287,0.0054141544,0.00045595533],"domain_scores_gemma":[0.8464031,0.12334338,0.0028677345,0.019419538,0.00691642,0.0010498078],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.019837763,0.0011468191,0.0024971126,0.0058082296,0.002115941,0.005373404,0.0030153205,0.0020968744,0.009878821],"category_scores_gemma":[0.09628286,0.0017370657,0.0025386673,0.008965804,0.010407906,0.018527348,0.005681264,0.00901054,0.0015388941],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000038312442,0.000022166223,0.0008578798,0.00018116191,0.000045707988,0.00007569005,0.00024995886,0.0036856825,0.000111018475,0.9142354,0.015127409,0.06536975],"study_design_scores_gemma":[0.0000053968956,0.0000053455183,0.00019227341,0.000038215767,0.000014908414,0.000052401552,0.000027007445,0.019985689,0.00029769947,0.97123724,0.008133663,0.000010187308],"about_ca_topic_score_codex":0.003496756,"about_ca_topic_score_gemma":0.0015559086,"teacher_disagreement_score":0.019837763,"about_ca_system_score_codex":0.0041230093,"about_ca_system_score_gemma":0.002069423,"threshold_uncertainty_score":0.10491341},"labels":[],"label_agreement":null},{"id":"W1512943107","doi":"10.1007/11546849_25","title":"A Machine Learning Approach to Identifying Database Sessions Using Unlabeled Data","year":2005,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Computer science; Session (web analytics); Database design; Data mining; Artificial intelligence; Machine learning; Database; World Wide Web","score_opus":0.31826524345177737,"score_gpt":0.4276292084454128,"score_spread":0.10936396499363543,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1512943107","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0052287434,0.00016359164,0.9928347,0.00015665425,0.000029645891,0.00007303513,0.0001639973,0.0006020671,0.0007474979],"genre_scores_gemma":[0.092129454,0.00024566575,0.901319,0.00015467178,0.00015038099,0.00023359222,0.00069980125,0.000116442265,0.004950899],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99796164,0.00083172147,0.00013357283,0.00051384885,0.00045046103,0.00010881745],"domain_scores_gemma":[0.99328196,0.0045967465,0.0002441592,0.00091626303,0.0007925585,0.00016837177],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0028704295,0.0007166014,0.0012293597,0.0024965864,0.0014434864,0.0015764807,0.0029466012,0.0017738929,0.002142507],"category_scores_gemma":[0.0077881236,0.00064432883,0.0013182434,0.002850831,0.0008938122,0.0032679355,0.0015188117,0.0021785165,0.0009750633],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002621279,0.00079618127,0.0045197774,0.00020203066,0.000169575,0.00015538179,0.00040017618,0.1093577,0.008869788,0.037710764,0.011577865,0.8259786],"study_design_scores_gemma":[0.0000123864465,0.000058642305,0.00062301144,0.000014966919,0.000027763552,0.00008263733,0.000053169977,0.95588493,0.002467654,0.03845987,0.0022904987,0.000024514246],"about_ca_topic_score_codex":0.005050659,"about_ca_topic_score_gemma":0.0094212415,"teacher_disagreement_score":0.005050659,"about_ca_system_score_codex":0.0007439176,"about_ca_system_score_gemma":0.0011947397,"threshold_uncertainty_score":0.015180469},"labels":[],"label_agreement":null},{"id":"W1514828683","doi":"10.1186/1472-6963-6-48","title":"Assessing record linkage between health care and Vital Statistics databases using deterministic methods","year":2006,"lang":"en","type":"article","venue":"BMC Health Services Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":73,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Institute of Health Economics; University of Calgary","funders":"Canadian Institutes of Health Research; Fondation pour la Recherche Médicale; University of Calgary","keywords":"Linkage (software); Record linkage; Medicine; Database; Population; Identifier; Demography; Statistics; Computer science; Genetics; Biology; Environmental health; Mathematics","score_opus":0.5803401570006748,"score_gpt":0.6702429424110904,"score_spread":0.08990278541041563,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1514828683","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.63824636,0.0033465403,0.3463225,0.0012800033,0.00008644204,0.0019800554,0.00464889,0.00047375666,0.003615394],"genre_scores_gemma":[0.8628794,0.0006018571,0.13243048,0.00016928013,0.00003765946,0.0010544467,0.002512147,0.000042120562,0.00027272778],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.67289007,0.24653189,0.024670627,0.013044406,0.040236156,0.002626854],"domain_scores_gemma":[0.4072894,0.46939585,0.06092275,0.02847294,0.032970615,0.00094844605],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2599468,0.0007950186,0.0014796491,0.008720662,0.001839017,0.0034190838,0.0022112548,0.0016468297,0.0010941207],"category_scores_gemma":[0.5074312,0.00078213227,0.0022815687,0.010858789,0.0013001659,0.0031193662,0.0048853965,0.0010634176,0.00025149208],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00096318853,0.00015718478,0.87047017,0.0012939862,0.0037047246,0.0001436277,0.002362906,0.022494143,0.0005072216,0.004564198,0.0013317987,0.09200691],"study_design_scores_gemma":[0.00055142085,0.0015785679,0.6887988,0.0013123712,0.0046119555,0.0016618534,0.003763892,0.24609405,0.013411967,0.022525225,0.015109368,0.0005804574],"about_ca_topic_score_codex":0.02409939,"about_ca_topic_score_gemma":0.014364232,"teacher_disagreement_score":0.7400532,"about_ca_system_score_codex":0.004144838,"about_ca_system_score_gemma":0.008244878,"threshold_uncertainty_score":0.9126174},"labels":[],"label_agreement":null},{"id":"W151902604","doi":"","title":"Proceedings of the second international workshop on MapReduce and its applications","year":2011,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Calgary","funders":"","keywords":"Computer science; Variety (cybernetics); Cover (algebra); Data science; Pleasure; Software engineering; Engineering; Artificial intelligence","score_opus":0.23526634734999,"score_gpt":0.3886907317663773,"score_spread":0.1534243844163873,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W151902604","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.016031729,0.07280772,0.35993922,0.06943825,0.2148354,0.0012509294,0.0051570213,0.0049565583,0.25558323],"genre_scores_gemma":[0.059219472,0.048760228,0.12840402,0.006632655,0.039774258,0.0007227251,0.013051408,0.0036383106,0.6997969],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.997124,0.00067976926,0.0001898745,0.00045654288,0.0012200954,0.0003297588],"domain_scores_gemma":[0.99532396,0.0009235322,0.000107209686,0.0005431949,0.0018908896,0.0012112211],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004800891,0.0012868176,0.001238421,0.0015045295,0.0012951776,0.0062763076,0.0021653387,0.0016335866,0.052596066],"category_scores_gemma":[0.0060246894,0.0005969757,0.0015451486,0.0018421366,0.00086432154,0.0041102516,0.0028232718,0.0045226533,0.025054507],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002367451,0.00016884769,0.00043738994,0.0003477267,0.000060240338,0.0002296243,0.00033997334,0.0015704616,0.0025574216,0.011072632,0.77936435,0.20361455],"study_design_scores_gemma":[0.000016365242,0.00006888396,0.00046718487,0.000116290736,0.000018355946,0.0001781582,0.00014755726,0.001931085,0.0011386299,0.0060733957,0.9898218,0.000022270615],"about_ca_topic_score_codex":0.0030507413,"about_ca_topic_score_gemma":0.00444082,"teacher_disagreement_score":0.052596066,"about_ca_system_score_codex":0.0012577047,"about_ca_system_score_gemma":0.0031121252,"threshold_uncertainty_score":0.17595136},"labels":[],"label_agreement":null},{"id":"W1530008852","doi":"10.71781/23019","title":"Schémas de classification et repérage des documents administratifs électroniques dans un contexte de gestion décentralisée des ressources informationnelles","year":2007,"lang":"fr","type":"dissertation","venue":"Papyrus : Institutional Repository (Université de Montréal)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Political science; Humanities; Art","score_opus":0.03626827190118999,"score_gpt":0.2923677993185969,"score_spread":0.25609952741740694,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1530008852","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.15367486,0.0021260597,0.76125044,0.0038005335,0.00034432329,0.0010895192,0.005853856,0.0127363615,0.05912402],"genre_scores_gemma":[0.31480598,0.0019864417,0.6220725,0.00065633084,0.00012143782,0.00073694374,0.010038983,0.0016334895,0.04794788],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9953242,0.0011464782,0.00047377637,0.0009642849,0.0018442292,0.00024710764],"domain_scores_gemma":[0.9836093,0.0047256327,0.0012932189,0.005052179,0.0049171997,0.0004024433],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0056117843,0.0006261014,0.0006176694,0.0026877068,0.0015685181,0.0074483654,0.0014920003,0.0014387826,0.006956638],"category_scores_gemma":[0.012947947,0.000596768,0.001056782,0.0037056208,0.0013504834,0.0051001715,0.0015106667,0.0017620046,0.003362871],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011004483,0.00048715487,0.038547914,0.001755343,0.00027322784,0.0010286499,0.023319587,0.020578232,0.045051895,0.20567134,0.043679822,0.6185064],"study_design_scores_gemma":[0.00017591765,0.0004416062,0.045320537,0.0011309864,0.00039255174,0.0017184867,0.010412339,0.08939921,0.082585104,0.057225365,0.71089643,0.00030148056],"about_ca_topic_score_codex":0.02262792,"about_ca_topic_score_gemma":0.016333086,"teacher_disagreement_score":0.02262792,"about_ca_system_score_codex":0.0026787275,"about_ca_system_score_gemma":0.0047353036,"threshold_uncertainty_score":0.044992447},"labels":[],"label_agreement":null},{"id":"W1534641784","doi":"10.1609/aimag.v36i1.2575","title":"Reports of the AAAI 2014 Conference Workshops","year":2015,"lang":"en","type":"article","venue":"AI Magazine","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Saskatchewan; Université du Québec à Chicoutimi; University of Toronto; University of British Columbia; McGill University","funders":"","keywords":"Computer science; Artificial intelligence; Analytics; Applications of artificial intelligence; Data science; Intelligence analysis; Robotics; Big data; Robot","score_opus":0.20037606968535615,"score_gpt":0.4032725950413384,"score_spread":0.20289652535598224,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1534641784","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00655829,0.039785225,0.016283417,0.16507879,0.21556398,0.0009957587,0.018904472,0.004234726,0.5325953],"genre_scores_gemma":[0.019971032,0.029715085,0.0159097,0.014046714,0.027795963,0.00075621984,0.038307454,0.0014166154,0.8520812],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99229187,0.0010602163,0.0004423709,0.00073409034,0.004680324,0.0007911303],"domain_scores_gemma":[0.982557,0.0012789653,0.00047078962,0.0015186198,0.010303703,0.003871013],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011886241,0.0016480797,0.0013253815,0.00485902,0.003433056,0.010844263,0.0032163786,0.0033176169,0.18691635],"category_scores_gemma":[0.013396102,0.00081739086,0.0014097516,0.003955477,0.00091025204,0.0071010566,0.0049429266,0.0044217627,0.10977127],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000063991545,0.0000863873,0.00022212187,0.000082150465,0.000009235135,0.000026756154,0.00004440802,0.00007945585,0.00017648286,0.0013162364,0.9579465,0.039946295],"study_design_scores_gemma":[0.000014844577,0.000020451493,0.0006730295,0.00009835242,0.000011372054,0.00003210774,0.00016468654,0.00023047108,0.00027040302,0.0010951825,0.99736965,0.000019418785],"about_ca_topic_score_codex":0.012191928,"about_ca_topic_score_gemma":0.026822155,"teacher_disagreement_score":0.18691635,"about_ca_system_score_codex":0.004826152,"about_ca_system_score_gemma":0.0077808457,"threshold_uncertainty_score":0.6252975},"labels":[],"label_agreement":null},{"id":"W1538933717","doi":"10.1007/978-3-540-74780-2_10","title":"Private Data Management in Collaborative Environments","year":2007,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"National Research Council Canada","funders":"","keywords":"Computer science; Workflow; Personally identifiable information; Personal information management; World Wide Web; Collaborative software; Personal information manager; Software; Knowledge management; Data science; Information system; Management information systems; Computer security; Database; Engineering","score_opus":0.143453871508199,"score_gpt":0.38611388243082495,"score_spread":0.24266001092262596,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1538933717","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017269911,0.0019932683,0.94550943,0.0019193136,0.00031582688,0.00011802399,0.00015633207,0.0017083635,0.031009529],"genre_scores_gemma":[0.42765975,0.0037944023,0.4621315,0.0005548079,0.00082907133,0.0002894073,0.0010837178,0.0009096996,0.10274766],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99676824,0.00082505395,0.0002643366,0.00043052557,0.0013475439,0.00036428837],"domain_scores_gemma":[0.9939166,0.0020568843,0.00029744714,0.002786193,0.0005104067,0.00043251316],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0041330354,0.00048510957,0.00077129545,0.0009382908,0.0018457965,0.0067501767,0.0023593013,0.0018101593,0.006186812],"category_scores_gemma":[0.0068473406,0.000669598,0.0006886694,0.002621315,0.0013624291,0.012661676,0.0053974153,0.002011906,0.0019752297],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001689486,0.00022049196,0.0016074417,0.00029908508,0.00006386663,0.00038733473,0.0026194535,0.014279391,0.004274856,0.50942975,0.03382933,0.43282008],"study_design_scores_gemma":[0.00004773872,0.00011185359,0.0011289037,0.00016227053,0.000076717,0.0009804574,0.001037443,0.14338861,0.011743397,0.54607695,0.2951822,0.000063486696],"about_ca_topic_score_codex":0.0011582937,"about_ca_topic_score_gemma":0.0010315862,"teacher_disagreement_score":0.0067501767,"about_ca_system_score_codex":0.0008810871,"about_ca_system_score_gemma":0.0012355602,"threshold_uncertainty_score":0.021857798},"labels":[],"label_agreement":null},{"id":"W1556370583","doi":"10.1109/bigdataservice.2015.13","title":"Towards a 'Big' Health Data Analytics Platform","year":2015,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Standardization; Computer science; Data science; Data integration; Big data; Terminology; Analytics; Pipeline (software); Data analysis; Data sharing; Data transformation; Data visualization; Health care; Data mining; Data warehouse; Visualization","score_opus":0.8491534457873675,"score_gpt":0.5524366211064039,"score_spread":0.2967168246809636,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1556370583","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014490169,0.00048562235,0.96044147,0.012424673,0.00035923946,0.0006259932,0.0007411756,0.005676435,0.004755214],"genre_scores_gemma":[0.044233922,0.00039777966,0.94825166,0.0022593888,0.00023501099,0.00026494553,0.002376812,0.0005036714,0.001476831],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.98574835,0.003961112,0.0016295315,0.0021933964,0.0056485366,0.000819201],"domain_scores_gemma":[0.97301924,0.0060096225,0.0020052355,0.007446979,0.008479397,0.003039493],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.037648626,0.00090517825,0.00097351323,0.0034635453,0.0015930193,0.012644478,0.0052609495,0.0032854602,0.001701508],"category_scores_gemma":[0.02440049,0.0012208738,0.0018774987,0.0033541229,0.0029860043,0.014449808,0.011131814,0.0057678595,0.0014033027],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00068594696,0.00089151895,0.023150193,0.0014147811,0.0005231083,0.0018321344,0.005898248,0.03401847,0.035456136,0.5093298,0.05983019,0.32696953],"study_design_scores_gemma":[0.00018223985,0.000510098,0.007754584,0.0011012807,0.00026707785,0.0010826653,0.0033158066,0.2454815,0.029885178,0.38795376,0.32218307,0.00028270713],"about_ca_topic_score_codex":0.002903474,"about_ca_topic_score_gemma":0.0020425033,"teacher_disagreement_score":0.037648626,"about_ca_system_score_codex":0.0018331959,"about_ca_system_score_gemma":0.010080094,"threshold_uncertainty_score":0.19910741},"labels":[],"label_agreement":null},{"id":"W1564399566","doi":"","title":"Accuracy of Approximate String Joins Using Grams","year":2007,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":16,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Substring; Joins; Similarity (geometry); Computer science; Data mining; String (physics); String metric; Matching (statistics); Join (topology); String searching algorithm; Algorithm; Pattern matching; Pattern recognition (psychology); Artificial intelligence; Mathematics; Statistics; Data structure","score_opus":0.3939898281848053,"score_gpt":0.48855991414726413,"score_spread":0.0945700859624588,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1564399566","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5395008,0.005858895,0.43901074,0.00095958845,0.00026516206,0.00013924835,0.0031453718,0.0052784164,0.005841808],"genre_scores_gemma":[0.86397374,0.000960259,0.1291524,0.000112644404,0.000110360575,0.000060813585,0.0043236413,0.0002720988,0.001033904],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.96785885,0.008517425,0.004050728,0.0033839545,0.015170361,0.0010187088],"domain_scores_gemma":[0.85883594,0.09468088,0.011699586,0.02441604,0.009555055,0.00081249373],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.020338086,0.000857349,0.0027203811,0.0045516393,0.001235016,0.005045484,0.0019197848,0.0021138096,0.0012146293],"category_scores_gemma":[0.10853258,0.00053850404,0.0009983815,0.0076848473,0.0011966372,0.0068959873,0.0028495993,0.001058983,0.000971602],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0057270373,0.00032596575,0.12510808,0.001079474,0.00084512646,0.00051743985,0.0016336537,0.3117005,0.024092713,0.024463758,0.009306186,0.49520013],"study_design_scores_gemma":[0.000087316985,0.0004771537,0.026924815,0.00011577311,0.00014320633,0.001121576,0.0007198964,0.894262,0.037092593,0.033128154,0.0057912455,0.00013621984],"about_ca_topic_score_codex":0.0022693444,"about_ca_topic_score_gemma":0.0017006504,"teacher_disagreement_score":0.020338086,"about_ca_system_score_codex":0.0010529126,"about_ca_system_score_gemma":0.0013351872,"threshold_uncertainty_score":0.10755938},"labels":[],"label_agreement":null},{"id":"W1569990199","doi":"10.1109/icdm.2002.1184040","title":"FD/spl I.bar/Mine: discovering functional dependencies in a database using equivalences","year":2003,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":49,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Regina","funders":"","keywords":"Computer science; Bar (unit); Database; Functional dependency; Data mining; Programming language; Relational database; Geology","score_opus":0.4113009556627037,"score_gpt":0.4381036786068579,"score_spread":0.0268027229441542,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1569990199","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.080457926,0.0014575835,0.90635633,0.0008543898,0.00007678732,0.00033272477,0.0036999823,0.004761558,0.0020027321],"genre_scores_gemma":[0.23221336,0.0004358866,0.7584822,0.0002619781,0.000069128575,0.00019253489,0.0071858633,0.00019918573,0.00095975527],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9970879,0.0006043852,0.00039494858,0.00076791155,0.0009637034,0.00018109815],"domain_scores_gemma":[0.9862511,0.009716497,0.0008601306,0.0018788405,0.0011018978,0.00019159456],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0038190396,0.0009798197,0.0014857781,0.0058328863,0.0012396666,0.0019287734,0.002452399,0.0014441238,0.00271087],"category_scores_gemma":[0.022046788,0.0007022263,0.0017230904,0.0033353595,0.0011822134,0.00495454,0.002638799,0.001546921,0.00065938337],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00050626526,0.0004336243,0.032794546,0.000739774,0.00024876688,0.0008377288,0.0005917504,0.017681979,0.008006271,0.022433119,0.014676379,0.9010498],"study_design_scores_gemma":[0.00028484708,0.0005263145,0.022329457,0.0003608639,0.0003409118,0.0042390437,0.0009760043,0.71381056,0.02920894,0.1868502,0.040946938,0.00012598188],"about_ca_topic_score_codex":0.003917208,"about_ca_topic_score_gemma":0.0053599393,"teacher_disagreement_score":0.0058328863,"about_ca_system_score_codex":0.00084415637,"about_ca_system_score_gemma":0.0015142376,"threshold_uncertainty_score":0.020197213},"labels":[],"label_agreement":null},{"id":"W1572842536","doi":"10.1016/b978-012088469-8.50109-1","title":"Trends in Data Warehousing","year":2004,"lang":"en","type":"book-chapter","venue":"Elsevier eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"IBM (Canada)","funders":"","keywords":"Data warehouse; Computer science; Intranet; Consolidation (business); Metadata; Business intelligence; Database; Concurrency; Data science; World Wide Web; Business; The Internet; Distributed computing","score_opus":0.26254447991093344,"score_gpt":0.410674666130839,"score_spread":0.14813018621990554,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1572842536","genre_codex":"other","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005231799,0.30475292,0.06449295,0.055265885,0.012744949,0.00014090787,0.0024135422,0.002818574,0.55213857],"genre_scores_gemma":[0.013829636,0.23648721,0.04190492,0.0075559723,0.0057250955,0.000121779325,0.003226665,0.00093513995,0.6902136],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99868745,0.00012983059,0.00010136213,0.00015745906,0.00085556443,0.00006838297],"domain_scores_gemma":[0.99659085,0.001381422,0.00014010449,0.00036957522,0.0012127848,0.00030538486],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0023813727,0.0009652049,0.0009983063,0.0042641833,0.00079873187,0.007893332,0.0013613636,0.002053985,0.056476288],"category_scores_gemma":[0.0034462889,0.0007507349,0.0005928879,0.014520178,0.0014437105,0.012835005,0.0017403249,0.003234349,0.03127221],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000011933843,0.00005555331,0.00029142352,0.0006925884,0.000008459473,0.000029503773,0.00021540049,0.00042345375,0.00059056137,0.07222566,0.36055088,0.5649046],"study_design_scores_gemma":[0.0000028740528,0.0000094794605,0.0003770518,0.00024335775,0.000005733813,0.00009260713,0.000111017645,0.0006251682,0.00018231764,0.025756637,0.9725854,0.00000836183],"about_ca_topic_score_codex":0.0037692508,"about_ca_topic_score_gemma":0.0050270683,"teacher_disagreement_score":0.056476288,"about_ca_system_score_codex":0.0021090414,"about_ca_system_score_gemma":0.0028701252,"threshold_uncertainty_score":0.188932},"labels":[],"label_agreement":null},{"id":"W1573082841","doi":"10.1007/11424918_24","title":"Probability and Equality: A Probabilistic Model of Identity Uncertainty","year":2005,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Identity (music); Computer science; Probabilistic logic; Task (project management); Context (archaeology); Similarity (geometry); Representation (politics); Object (grammar); Artificial intelligence; Theoretical computer science; Image (mathematics)","score_opus":0.1747452922368207,"score_gpt":0.36920874559150796,"score_spread":0.19446345335468726,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1573082841","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009947936,0.0008561483,0.9648439,0.0033934948,0.00015888207,0.00003493186,0.00020000132,0.000082982675,0.020481594],"genre_scores_gemma":[0.78518367,0.0021472417,0.192972,0.0011105487,0.0013109926,0.0003103276,0.00049808284,0.00017279401,0.016294265],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9908674,0.0041584084,0.0005089044,0.001239582,0.0025575233,0.00066825486],"domain_scores_gemma":[0.9776964,0.016448751,0.0012936156,0.0024518901,0.001535915,0.00057339505],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007754543,0.0009101441,0.001521412,0.0024740137,0.0020858352,0.0067585777,0.0047935518,0.0031842508,0.0071107754],"category_scores_gemma":[0.042207368,0.0011189588,0.0020537428,0.0037138332,0.008153167,0.017532285,0.0055631255,0.0054073664,0.0010033131],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000013202536,0.000008075999,0.00015876812,0.000020798712,0.000009206085,0.000034141336,0.00016433228,0.0064122677,0.00005536874,0.9869257,0.0008396086,0.005358509],"study_design_scores_gemma":[0.0000030936556,0.0000038934872,0.000051439907,0.000009098692,0.00000579895,0.000038936563,0.000025063951,0.023949252,0.000043713848,0.974957,0.0009047701,0.000007901727],"about_ca_topic_score_codex":0.0032062193,"about_ca_topic_score_gemma":0.0014906959,"teacher_disagreement_score":0.007754543,"about_ca_system_score_codex":0.002133112,"about_ca_system_score_gemma":0.0013879555,"threshold_uncertainty_score":0.04101044},"labels":[],"label_agreement":null},{"id":"W1577547142","doi":"10.1007/11430919_86","title":"The TIMERS II Algorithm for the Discovery of Causality","year":2005,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":25,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Regina","funders":"","keywords":"Causality (physics); Computer science; Algorithm; Artificial intelligence; Data mining; Theoretical computer science","score_opus":0.08055751605725435,"score_gpt":0.3605419344042727,"score_spread":0.2799844183470183,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1577547142","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0014886615,0.00022822832,0.995194,0.00019287388,0.000111379915,0.00012098688,0.0001461885,0.0014489779,0.0010686758],"genre_scores_gemma":[0.035904206,0.00025191126,0.9591157,0.00017578059,0.00018174812,0.00055745104,0.0006564154,0.00042842602,0.0027284161],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99515224,0.002347127,0.00048352123,0.00070243515,0.0010662904,0.0002483479],"domain_scores_gemma":[0.9793193,0.0150027275,0.0007156688,0.0027150437,0.0017197612,0.0005275139],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0091990335,0.0015358515,0.0025198164,0.004331171,0.0014873687,0.0037863837,0.004495086,0.0020920169,0.01832262],"category_scores_gemma":[0.04328125,0.0013966424,0.0024195288,0.0033366152,0.0017632489,0.0046289186,0.0037733046,0.0053083994,0.006017244],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010908042,0.00023904341,0.0027995824,0.0004751086,0.0003264125,0.00021019817,0.00027884866,0.06688188,0.0032837999,0.21559437,0.023966633,0.6848533],"study_design_scores_gemma":[0.00038393927,0.00014179699,0.00040102945,0.00009826215,0.00009557705,0.00023349204,0.000072143215,0.71813536,0.0032450352,0.26679698,0.010335843,0.00006065892],"about_ca_topic_score_codex":0.002192753,"about_ca_topic_score_gemma":0.002314372,"teacher_disagreement_score":0.01832262,"about_ca_system_score_codex":0.0010216185,"about_ca_system_score_gemma":0.0048855934,"threshold_uncertainty_score":0.06129527},"labels":[],"label_agreement":null},{"id":"W1578664299","doi":"","title":"Extending q-grams to estimate selectivity of string matching with low edit distance","year":2007,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":50,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Edit distance; Approximate string matching; String searching algorithm; String metric; Computer science; String (physics); Algorithm; Boyer–Moore string search algorithm; Matching (statistics); Similarity (geometry); Theoretical computer science; Data mining; Pattern matching; Mathematics; Artificial intelligence; Statistics; Image (mathematics)","score_opus":0.062628898205617,"score_gpt":0.42885606747204424,"score_spread":0.36622716926642723,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1578664299","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.055830795,0.0001633527,0.94271034,0.000068693196,0.00000942077,0.00005226845,0.00012217948,0.0006127775,0.00043011486],"genre_scores_gemma":[0.47434968,0.00016208543,0.52435195,0.000070585906,0.00004341544,0.00009686477,0.00039201922,0.0000724468,0.00046089856],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99708,0.0008744101,0.00026349194,0.0004368364,0.0011602172,0.00018495512],"domain_scores_gemma":[0.9838155,0.011547469,0.0014137848,0.0014326782,0.0015654947,0.00022509106],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0038266387,0.00053665607,0.0012380759,0.003146745,0.00045691093,0.0011332975,0.0013464758,0.0008381152,0.0008064439],"category_scores_gemma":[0.023684034,0.00034392189,0.00050912664,0.0025624852,0.0007846723,0.0031171888,0.0013569336,0.0007552242,0.0003823424],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007142143,0.00022431384,0.043375347,0.0003814039,0.00014088111,0.00037535242,0.0004235797,0.19357872,0.041180193,0.041586507,0.0020578918,0.67596155],"study_design_scores_gemma":[0.000022168852,0.0001209736,0.0027152512,0.0000126712475,0.000017929306,0.0002759857,0.00007185847,0.95559037,0.014888852,0.025251893,0.0010064972,0.000025634585],"about_ca_topic_score_codex":0.0024657103,"about_ca_topic_score_gemma":0.00230086,"teacher_disagreement_score":0.0038266387,"about_ca_system_score_codex":0.00075111736,"about_ca_system_score_gemma":0.0010322679,"threshold_uncertainty_score":0.020237386},"labels":[],"label_agreement":null},{"id":"W1586049858","doi":"10.1007/bf03405034","title":"Development of a computer linkage system for a blood recipient notification program in Nova Scotia.","year":2002,"lang":"en","type":"article","venue":"PubMed","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Health Canada","funders":"","keywords":"Nova scotia; Record linkage; Medical record; Data file; Medicine; Computer science; Medical emergency; Database; Geography; Surgery; Environmental health; Population","score_opus":0.26855825142610584,"score_gpt":0.35374264056325516,"score_spread":0.08518438913714932,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1586049858","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.4904339,0.011717464,0.124989256,0.021519275,0.001971611,0.056283202,0.19463967,0.024681842,0.0737638],"genre_scores_gemma":[0.5676928,0.0048576626,0.2990905,0.0021797288,0.00036103078,0.015441616,0.08685404,0.00079644116,0.022726102],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99076265,0.0034663042,0.0019700967,0.0008438959,0.002363528,0.0005935834],"domain_scores_gemma":[0.9370286,0.025501467,0.005794895,0.003119512,0.024200438,0.004355024],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.018173967,0.0003655881,0.0007242164,0.007829601,0.0017406207,0.002378549,0.0022265054,0.0008435803,0.0099273315],"category_scores_gemma":[0.05383484,0.0005222298,0.00038288912,0.007819965,0.00038234584,0.0014976555,0.0016951818,0.0006301392,0.003247323],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0040466753,0.0010747366,0.19065861,0.0039624283,0.00035915978,0.0016882361,0.003946041,0.0053945538,0.008189365,0.0020477825,0.13292873,0.6457036],"study_design_scores_gemma":[0.0024638094,0.0026281097,0.6166516,0.0037736048,0.0011588671,0.0011756031,0.005718147,0.03317897,0.014374182,0.0012348089,0.31723657,0.0004056885],"about_ca_topic_score_codex":0.42886254,"about_ca_topic_score_gemma":0.39155498,"teacher_disagreement_score":0.5711374,"about_ca_system_score_codex":0.008233761,"about_ca_system_score_gemma":0.0466244,"threshold_uncertainty_score":0.85273254},"labels":[],"label_agreement":null},{"id":"W1586702196","doi":"10.19173/irrodl.v13i3.1176","title":"Identification of conflicting questions in the PARES system","year":2012,"lang":"en","type":"article","venue":"The International Review of Research in Open and Distributed Learning","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Cheating; Test (biology); Computer science; Vocabulary; Similarity (geometry); Mathematics education; Identification (biology); Space (punctuation); Artificial intelligence; Mathematics; Psychology; Linguistics; Image (mathematics); Social psychology","score_opus":0.37724406529817267,"score_gpt":0.587940438919133,"score_spread":0.21069637362096028,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1586702196","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.20215707,0.0007573787,0.508588,0.0016587775,0.00028062996,0.0025706547,0.007036958,0.26334774,0.013602752],"genre_scores_gemma":[0.56681645,0.0002722216,0.39815482,0.0012733461,0.00022404233,0.0010947537,0.01453496,0.002550411,0.015079018],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.9873399,0.003234716,0.0014783806,0.0025972247,0.0049349405,0.0004147866],"domain_scores_gemma":[0.9626341,0.023133583,0.0034223096,0.0055307467,0.0043101152,0.00096920185],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010696816,0.0014181344,0.0018883654,0.0040627797,0.0007114751,0.003681119,0.0032841314,0.0021938058,0.012052338],"category_scores_gemma":[0.041098867,0.0009994588,0.0012156427,0.001624336,0.00092138926,0.0062636277,0.0055568563,0.0019077992,0.0066736145],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005684665,0.0014206695,0.03728932,0.0012573712,0.0003676268,0.002288627,0.0021035036,0.015843773,0.030566463,0.011201537,0.058389228,0.83358717],"study_design_scores_gemma":[0.00051728106,0.0015001564,0.02696365,0.00023680234,0.00015887879,0.0025502804,0.0010744829,0.80874646,0.060635507,0.021389341,0.0759611,0.00026609577],"about_ca_topic_score_codex":0.001447892,"about_ca_topic_score_gemma":0.0014382813,"teacher_disagreement_score":0.012052338,"about_ca_system_score_codex":0.0010491227,"about_ca_system_score_gemma":0.0013812891,"threshold_uncertainty_score":0.056570828},"labels":[],"label_agreement":null},{"id":"W1593995188","doi":"10.1007/11533962_24","title":"Lineage Tracing in Mediator-Based Information Integration Systems","year":2005,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Computer science; Tracing; Metadata; Context (archaeology); Schema (genetic algorithms); Lineage (genetic); Information retrieval; Theoretical computer science; Distributed computing; Programming language; World Wide Web","score_opus":0.06659882761350404,"score_gpt":0.334403244244845,"score_spread":0.26780441663134097,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1593995188","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.025460375,0.0014740279,0.9657122,0.00072476664,0.00006954655,0.00018356708,0.00010909606,0.0016319221,0.0046344013],"genre_scores_gemma":[0.316261,0.001208905,0.6720295,0.00021100543,0.00006655023,0.0002536556,0.00055865175,0.0005435343,0.008867249],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9956964,0.0018423026,0.00033297,0.0005050854,0.0013255107,0.00029774714],"domain_scores_gemma":[0.98932517,0.0064327144,0.00052459456,0.0024927026,0.000984093,0.0002407119],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009682654,0.00053496583,0.0012270852,0.0016605549,0.0023450481,0.0057749986,0.0036100033,0.0028761413,0.0042114407],"category_scores_gemma":[0.021306476,0.0011672316,0.0007927782,0.00296216,0.0020856338,0.008608061,0.004996523,0.0027801835,0.0009856293],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00085537025,0.00029186392,0.005623419,0.00039962714,0.00013910994,0.0008984616,0.0052968557,0.10677562,0.010535113,0.42455456,0.006753646,0.43787634],"study_design_scores_gemma":[0.000096194664,0.00014555467,0.0007135051,0.0001746996,0.00014029624,0.0005421076,0.00076540106,0.61377585,0.024197409,0.32882103,0.030556727,0.00007126444],"about_ca_topic_score_codex":0.003043681,"about_ca_topic_score_gemma":0.002605069,"teacher_disagreement_score":0.009682654,"about_ca_system_score_codex":0.0014111948,"about_ca_system_score_gemma":0.0019441221,"threshold_uncertainty_score":0.051207364},"labels":[],"label_agreement":null},{"id":"W1599163950","doi":"10.18438/b81596","title":"Name Authority Challenges for Indexing and Abstracting Databases","year":2006,"lang":"en","type":"article","venue":"Evidence Based Library and Information Practice","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Authority control; Metadata; Search engine indexing; Database; Information retrieval; Control (management); World Wide Web; Bibliographic database; Artificial intelligence","score_opus":0.17201754704839065,"score_gpt":0.39698351337865123,"score_spread":0.22496596633026059,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1599163950","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0799904,0.01840007,0.7764496,0.047969073,0.0016808722,0.0011037766,0.0029771745,0.008944663,0.062484358],"genre_scores_gemma":[0.50835055,0.009109959,0.4514028,0.004190789,0.0023439077,0.00069904426,0.0041700564,0.0018475134,0.017885419],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.8689781,0.037462357,0.02182065,0.012071959,0.055474117,0.004192752],"domain_scores_gemma":[0.750709,0.10463551,0.019274086,0.0774461,0.0432378,0.0046975384],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.06276393,0.0008896599,0.002122741,0.0075122234,0.006473725,0.029303927,0.008921754,0.0047077243,0.008711211],"category_scores_gemma":[0.18327664,0.0016487743,0.0018674941,0.015344218,0.008809927,0.05282034,0.01647702,0.0044604917,0.006787353],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00044810158,0.00024109974,0.012477544,0.0013485453,0.00010316759,0.0006963132,0.0064528813,0.012442606,0.003966019,0.524146,0.043371893,0.39430583],"study_design_scores_gemma":[0.00019005194,0.00028720807,0.0036310675,0.0011578526,0.00013804241,0.0035314937,0.009300842,0.058548696,0.015572677,0.40128824,0.5059913,0.00036255227],"about_ca_topic_score_codex":0.0052940273,"about_ca_topic_score_gemma":0.0024986025,"teacher_disagreement_score":0.9706961,"about_ca_system_score_codex":0.0061898446,"about_ca_system_score_gemma":0.0072224718,"threshold_uncertainty_score":0.33193135},"labels":[],"label_agreement":null},{"id":"W161959767","doi":"10.1007/978-3-642-14619-0_20","title":"Towards a Unified Data Management and Decision Support System for Health Care","year":2010,"lang":"en","type":"book-chapter","venue":"Smart innovation, systems and technologies","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"","keywords":"Health care; Decision support system; Computer science; Data management; Data science; Knowledge management; Process management; Psychology; Business; Data mining; Political science","score_opus":0.16804501472805397,"score_gpt":0.39154810809541796,"score_spread":0.223503093367364,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W161959767","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0018823822,0.002682517,0.9599203,0.008080668,0.00081390137,0.0002423911,0.0004901027,0.003022586,0.02286522],"genre_scores_gemma":[0.023079429,0.0038701799,0.94661087,0.0029541655,0.00082780607,0.00028117985,0.0014343542,0.0006189194,0.020323105],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99647886,0.00086839433,0.0004073276,0.00041008857,0.0016334302,0.00020185055],"domain_scores_gemma":[0.99657494,0.0012865169,0.00013234616,0.00061295246,0.001103668,0.00028958658],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008061126,0.0009157817,0.0013134636,0.0023642324,0.000997955,0.012074108,0.002933292,0.0029229259,0.0053737634],"category_scores_gemma":[0.00838188,0.0010060843,0.0011036594,0.0032496604,0.0019483959,0.010497013,0.0043277135,0.0050293086,0.0037673553],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000580783,0.00012441888,0.00075230154,0.00045202213,0.00010336232,0.00018679499,0.0011166878,0.0120759,0.0054254117,0.56067747,0.06924591,0.34978154],"study_design_scores_gemma":[0.000034144512,0.00007693939,0.0005834403,0.0004904692,0.00012342095,0.00023056308,0.00036744322,0.10038166,0.005957675,0.30498484,0.58669055,0.00007882933],"about_ca_topic_score_codex":0.0052620056,"about_ca_topic_score_gemma":0.004317936,"teacher_disagreement_score":0.012074108,"about_ca_system_score_codex":0.002696652,"about_ca_system_score_gemma":0.006410326,"threshold_uncertainty_score":0.042631805},"labels":[],"label_agreement":null},{"id":"W1620933693","doi":"10.1002/047148296x.tie082","title":"Information Quality in Internet and E‐business Environments","year":2004,"lang":"en","type":"other","venue":"The Internet Encyclopedia","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Impact","funders":"","keywords":"The Internet; Computer science; Information quality; Quality (philosophy); Business information; Knowledge management; World Wide Web; Information system; Business; Marketing; Engineering","score_opus":0.05312032767530156,"score_gpt":0.343006711105528,"score_spread":0.28988638343022644,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1620933693","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05398382,0.06542847,0.12969491,0.040227477,0.00090012583,0.00024376623,0.0007915868,0.00048614913,0.7082437],"genre_scores_gemma":[0.8447044,0.047099274,0.056971636,0.0030458693,0.00091495545,0.00024505836,0.0006004431,0.00018967658,0.046228737],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9898783,0.004303775,0.00050635013,0.00033127257,0.004617402,0.0003627923],"domain_scores_gemma":[0.98867714,0.0065704123,0.0010625575,0.00069955754,0.0026062569,0.00038423558],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0051305466,0.00022811918,0.00032176953,0.0040633394,0.0009195576,0.010000188,0.00056704675,0.00091629976,0.0076395418],"category_scores_gemma":[0.013524766,0.00021501789,0.00028156603,0.0073720235,0.0036886956,0.005912422,0.0026178316,0.0012629884,0.00081767444],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000031202606,0.00006531175,0.0047271294,0.0004218205,0.000020882495,0.00010671642,0.0018094402,0.0026897239,0.000339764,0.78326744,0.01864522,0.18787538],"study_design_scores_gemma":[0.000018712422,0.00008416925,0.01614946,0.0013853495,0.000035547786,0.00031895385,0.005399168,0.008216923,0.001531066,0.4896808,0.47713396,0.000045853376],"about_ca_topic_score_codex":0.0061250273,"about_ca_topic_score_gemma":0.0030678078,"teacher_disagreement_score":0.010000188,"about_ca_system_score_codex":0.003932263,"about_ca_system_score_gemma":0.0030764474,"threshold_uncertainty_score":0.028530717},"labels":[],"label_agreement":null},{"id":"W1626378195","doi":"10.1145/1938551.1938585","title":"Data cleaning and query answering with matching dependencies and matching functions","year":2011,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":69,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia; Carleton University","funders":"Natural Sciences and Engineering Research Council of Canada; International Business Machines Corporation","keywords":"Tuple; Matching (statistics); Computer science; Monotone polygon; Conjunctive query; Dependency (UML); Functional dependency; Semantics (computer science); Dependency theory (database theory); Query optimization; Upper and lower bounds; Theoretical computer science; Mathematics; Information retrieval; Discrete mathematics; Relational database; Artificial intelligence; Programming language","score_opus":0.3569999851508519,"score_gpt":0.37439216888693916,"score_spread":0.017392183736087252,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1626378195","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.019245194,0.00028360085,0.9775968,0.00081998797,0.000016435088,0.000112188296,0.00017785463,0.0004201394,0.0013277377],"genre_scores_gemma":[0.26604003,0.0004104662,0.7296931,0.0005222438,0.00013346199,0.00033466486,0.00082035444,0.00018350463,0.0018622606],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98088545,0.008164917,0.0016089462,0.0026317642,0.005406156,0.0013026898],"domain_scores_gemma":[0.9612765,0.027594931,0.0024956246,0.005575846,0.0024546967,0.00060242054],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.014756678,0.001067199,0.0021126904,0.0028142435,0.0015258997,0.0052843583,0.002940772,0.0026007362,0.0019850016],"category_scores_gemma":[0.04748325,0.0011618381,0.0032555938,0.004320249,0.004018411,0.013081789,0.0051572127,0.004582676,0.0005119955],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006304579,0.00042248663,0.0047450354,0.0006689017,0.00020449591,0.00034707924,0.0011882386,0.18412171,0.009360426,0.66391957,0.004725653,0.12966594],"study_design_scores_gemma":[0.00006460142,0.0001109613,0.0005742453,0.00003884728,0.00006940087,0.00036546396,0.0002164055,0.56108934,0.008078706,0.42432362,0.0050250124,0.000043362244],"about_ca_topic_score_codex":0.0026633497,"about_ca_topic_score_gemma":0.0018556851,"teacher_disagreement_score":0.014756678,"about_ca_system_score_codex":0.0023739506,"about_ca_system_score_gemma":0.0026146886,"threshold_uncertainty_score":0.07804173},"labels":[],"label_agreement":null},{"id":"W1691660836","doi":"10.1002/pds.2205","title":"Record linkage for pharmacoepidemiological studies in cancer patients","year":2011,"lang":"en","type":"review","venue":"Pharmacoepidemiology and Drug Safety","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":39,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Pharmacoepidemiology; Medicine; Cancer registry; Record linkage; Database; Epidemiology; Generalizability theory; Population; Linkage (software); Cancer; Family medicine; MEDLINE; Environmental health; Medical prescription; Internal medicine; Pharmacology","score_opus":0.7226817690093758,"score_gpt":0.6243594865246453,"score_spread":0.0983222824847304,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1691660836","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015783159,0.7621764,0.07576543,0.017114207,0.0033970096,0.028003063,0.07399337,0.00079236145,0.022974962],"genre_scores_gemma":[0.117961735,0.44347978,0.2447584,0.009413214,0.002987234,0.096171945,0.08174681,0.00034488976,0.003136054],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.5917367,0.24509147,0.111520596,0.01551339,0.03425625,0.0018816354],"domain_scores_gemma":[0.36082792,0.42148647,0.11762787,0.05023713,0.047983024,0.0018376573],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.22962838,0.0012021231,0.0056207827,0.04237734,0.0021490147,0.0070456243,0.0046746973,0.0038443494,0.012980953],"category_scores_gemma":[0.50645727,0.0015770077,0.005515566,0.060711402,0.0018768688,0.010663583,0.008700422,0.0031781376,0.0023121927],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010140724,0.0001963806,0.03129625,0.41310948,0.01412109,0.00042231084,0.0052780933,0.0008918639,0.0004745959,0.022859035,0.054252762,0.45608404],"study_design_scores_gemma":[0.001148845,0.00064846873,0.044723984,0.39504114,0.017097216,0.0012858908,0.0030552796,0.0011667997,0.001426915,0.0192438,0.5148624,0.00029923403],"about_ca_topic_score_codex":0.00520773,"about_ca_topic_score_gemma":0.005229407,"teacher_disagreement_score":0.22962838,"about_ca_system_score_codex":0.004297708,"about_ca_system_score_gemma":0.02558171,"threshold_uncertainty_score":0.95000535},"labels":[],"label_agreement":null},{"id":"W1748398123","doi":"10.5555/359640.359930","title":"Data quality in internet time, space, and communities (panel session)","year":2000,"lang":"en","type":"article","venue":"International Conference on Information Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Computer science; Session (web analytics); The Internet; Quality (philosophy); Computer network; World Wide Web; Physics","score_opus":0.4236509632793228,"score_gpt":0.4455404448422119,"score_spread":0.021889481562889113,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1748398123","genre_codex":"commentary","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.007718254,0.06980069,0.0054557915,0.74960226,0.09042531,0.0020788996,0.008714889,0.00023250321,0.0659714],"genre_scores_gemma":[0.10866833,0.10056407,0.012916661,0.43787155,0.12821877,0.0053141904,0.0077895615,0.00039737558,0.19825958],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9959396,0.00094483135,0.00029836257,0.00074000465,0.0014451273,0.0006320788],"domain_scores_gemma":[0.973128,0.0096517475,0.0014497752,0.0007989238,0.010499777,0.0044717863],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.020490162,0.0010539673,0.0013101115,0.001123116,0.0026212041,0.005974202,0.0031233814,0.022568014,0.01885382],"category_scores_gemma":[0.014534425,0.00075345946,0.0015230342,0.0031633493,0.002055702,0.004993127,0.0029887483,0.014078492,0.0053570294],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013303485,0.00016529413,0.002975608,0.0005411332,0.00005490237,0.000058317168,0.00024567716,0.00016912945,0.00035894808,0.0022672103,0.96727264,0.025758067],"study_design_scores_gemma":[0.00025216292,0.0001813613,0.042264573,0.0037771629,0.0003789347,0.00013968202,0.0018262857,0.0005047008,0.0012451165,0.008321968,0.9410051,0.00010298318],"about_ca_topic_score_codex":0.022137146,"about_ca_topic_score_gemma":0.06462753,"teacher_disagreement_score":0.022568014,"about_ca_system_score_codex":0.0034811294,"about_ca_system_score_gemma":0.009666742,"threshold_uncertainty_score":0.10836357},"labels":[],"label_agreement":null},{"id":"W1852280707","doi":"10.1609/aaai.v29i1.9404","title":"Existential Rule Languages with Finite Chase: Complexity and Expressiveness","year":2015,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Decidability; Computer science; Chase; Ontology language; Existentialism; Regular language; Property (philosophy); Mathematics; Discrete mathematics; Theoretical computer science; Artificial intelligence","score_opus":0.45711114531969094,"score_gpt":0.42983730638237017,"score_spread":0.02727383893732077,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1852280707","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.20280996,0.0006025751,0.78879523,0.0011889042,0.0000352739,0.00022822975,0.0004329371,0.00058764615,0.005319256],"genre_scores_gemma":[0.79016185,0.00042408347,0.20585135,0.00034037867,0.00012105839,0.0004094864,0.00065525045,0.00016557738,0.0018709477],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9926288,0.001362302,0.001191477,0.0014935799,0.0025210343,0.0008028182],"domain_scores_gemma":[0.9490072,0.038493387,0.0037186022,0.005476259,0.002337288,0.0009673006],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0050313156,0.00063421734,0.0010424983,0.0016221583,0.0011925919,0.0051479638,0.0022912463,0.0013966186,0.0019903698],"category_scores_gemma":[0.024687009,0.00082180585,0.0035571759,0.0013516376,0.0058945604,0.0102466,0.0040131207,0.0046163024,0.00023078514],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022627028,0.00021336615,0.0076476675,0.00045729437,0.00018640197,0.00093698996,0.0026778972,0.04790823,0.01563263,0.873542,0.0009473629,0.04962388],"study_design_scores_gemma":[0.000059211183,0.000090184294,0.0012380312,0.000086479624,0.0001149733,0.00085065595,0.00036765938,0.18526885,0.0133471815,0.79462165,0.0038615693,0.000093550305],"about_ca_topic_score_codex":0.001607733,"about_ca_topic_score_gemma":0.001241811,"teacher_disagreement_score":0.0051479638,"about_ca_system_score_codex":0.0015322443,"about_ca_system_score_gemma":0.001986094,"threshold_uncertainty_score":0.026608467},"labels":[],"label_agreement":null},{"id":"W1852537914","doi":"10.1109/nafips.1999.781771","title":"A characterization of information quality using fuzzy logic","year":2003,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":28,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Brandon University","funders":"","keywords":"Fuzzy logic; Computer science; Information quality; Quality (philosophy); Perspective (graphical); Information system; Fuzzy set; Characterization (materials science); Data mining; Artificial intelligence; Engineering","score_opus":0.3191743449327472,"score_gpt":0.44823633327241463,"score_spread":0.12906198833966742,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1852537914","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.061029878,0.0015785502,0.9212254,0.0020968018,0.000052312225,0.00009645899,0.00013982797,0.00016167267,0.013619132],"genre_scores_gemma":[0.79230225,0.00089769874,0.20480828,0.00027199477,0.00016678606,0.00012752698,0.00015100806,0.000040964187,0.0012334916],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98984504,0.0029589874,0.0009557901,0.0011825367,0.0044574784,0.0006001488],"domain_scores_gemma":[0.96860415,0.01922645,0.0046644676,0.0023253614,0.0041782465,0.0010012381],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011111654,0.0007209971,0.0007555975,0.0059564956,0.0012749303,0.0052865744,0.0013148756,0.0016877274,0.0020515176],"category_scores_gemma":[0.031659424,0.00040652795,0.0010531609,0.0035784948,0.0059812516,0.011865956,0.0021595077,0.0018960878,0.000271494],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015497216,0.00010634669,0.006066084,0.00033920578,0.00009537675,0.0001815584,0.0011728134,0.044159368,0.0042490326,0.87381196,0.0009107325,0.06875247],"study_design_scores_gemma":[0.000050615457,0.00025583047,0.0036428715,0.0002797394,0.00009115137,0.00030700606,0.00079093414,0.2789725,0.0063072755,0.70092714,0.008239032,0.00013583912],"about_ca_topic_score_codex":0.003113639,"about_ca_topic_score_gemma":0.0010746497,"teacher_disagreement_score":0.011111654,"about_ca_system_score_codex":0.0033369737,"about_ca_system_score_gemma":0.0011416819,"threshold_uncertainty_score":0.058764815},"labels":[],"label_agreement":null},{"id":"W1860275762","doi":"10.1109/nafips.1999.781722","title":"Fuzzy measures for data quality","year":2003,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Computer science; Fuzzy logic; Quality (philosophy); Data mining; Representation (politics); Data quality; Fuzzy set; External Data Representation; Information retrieval; Artificial intelligence; Engineering","score_opus":0.757558786964487,"score_gpt":0.5624620966962995,"score_spread":0.19509669026818743,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1860275762","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.018095411,0.011212215,0.91957444,0.010307645,0.0010402127,0.00040786623,0.00094011583,0.00041665463,0.038005497],"genre_scores_gemma":[0.47672552,0.004592075,0.50834733,0.0017298111,0.0022435826,0.0014511175,0.00082789804,0.00013120848,0.0039514625],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.94428813,0.021767985,0.0064769993,0.003965453,0.022317132,0.0011842642],"domain_scores_gemma":[0.87034655,0.084408075,0.0136611285,0.011770735,0.017592492,0.0022209743],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04848817,0.0011845513,0.0017412025,0.016423818,0.0024964558,0.009224319,0.0019930871,0.0032486503,0.004337523],"category_scores_gemma":[0.14195794,0.00051020394,0.0017991859,0.010160489,0.009606299,0.013528407,0.0050890367,0.003843714,0.0006073858],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00008247615,0.00003831556,0.0026875222,0.00050913054,0.00014546103,0.000063314445,0.0007221888,0.0072087934,0.00042335026,0.9145017,0.003489261,0.07012851],"study_design_scores_gemma":[0.000038245897,0.00013657683,0.0024619868,0.0005145697,0.000063387226,0.00023305578,0.0005963261,0.019953722,0.00068901957,0.9524032,0.022820791,0.00008914531],"about_ca_topic_score_codex":0.0017134848,"about_ca_topic_score_gemma":0.0012245773,"teacher_disagreement_score":0.04848817,"about_ca_system_score_codex":0.0057362076,"about_ca_system_score_gemma":0.002398584,"threshold_uncertainty_score":0.256433},"labels":[],"label_agreement":null},{"id":"W1863738141","doi":"10.32920/ryerson.14660694","title":"Identity matching in social media platforms","year":2021,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Computer science; Matching (statistics); Social media; Identity (music); Set (abstract data type); Task (project management); Information retrieval; World Wide Web; Similarity (geometry); Process (computing); Social Semantic Web; Semantic Web; Artificial intelligence; Mathematics; Engineering","score_opus":0.2828132511239933,"score_gpt":0.4597413444349298,"score_spread":0.1769280933109365,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1863738141","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.34188062,0.0012036476,0.6140053,0.0025669883,0.00020132051,0.0012838683,0.001960234,0.0007523124,0.036145672],"genre_scores_gemma":[0.8585778,0.0004838708,0.13515976,0.00016263213,0.00007226247,0.00028430816,0.0011379438,0.000041165862,0.0040801927],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98677176,0.005019026,0.0009131887,0.0018159506,0.0046097203,0.00087030645],"domain_scores_gemma":[0.9882686,0.0051925536,0.0027182489,0.001632725,0.0017924189,0.00039550968],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0090216305,0.00042029007,0.00068245275,0.007971009,0.0027088134,0.0047407676,0.0016895722,0.0017588038,0.0026414217],"category_scores_gemma":[0.028304605,0.00036386176,0.0010091302,0.0063455114,0.0014484843,0.0081683155,0.0049076243,0.00079548464,0.0010227964],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005950257,0.0006874631,0.09961914,0.00062131643,0.00032873545,0.0020446964,0.003530419,0.048391774,0.0070215184,0.32313615,0.00964916,0.5043746],"study_design_scores_gemma":[0.000048496186,0.00031325576,0.032770444,0.00039515976,0.00015684738,0.0016009383,0.008295743,0.5472046,0.019883582,0.3409506,0.048234295,0.00014603577],"about_ca_topic_score_codex":0.005012995,"about_ca_topic_score_gemma":0.003376781,"teacher_disagreement_score":0.0090216305,"about_ca_system_score_codex":0.0021039916,"about_ca_system_score_gemma":0.0021286781,"threshold_uncertainty_score":0.04771149},"labels":[],"label_agreement":null},{"id":"W1869211391","doi":"","title":"An XML Based Document Management Framework to Prevent Data Leakage (情報セキュリティ)","year":2014,"lang":"en","type":"article","venue":"India Software Engineering Conference","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of New Brunswick","funders":"","keywords":"Computer science; XML; Leakage (economics); Database; World Wide Web","score_opus":0.08554686642750002,"score_gpt":0.37492078300027526,"score_spread":0.2893739165727752,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1869211391","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009716758,0.00039935665,0.9206897,0.0007075492,0.0002384007,0.0005163214,0.0007384214,0.06253239,0.0044611655],"genre_scores_gemma":[0.11491164,0.0005550395,0.8585618,0.00075318426,0.00010495788,0.0004055318,0.0036262898,0.0020921847,0.018989403],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9983342,0.00026652726,0.0002854298,0.00021633864,0.0007522111,0.0001452688],"domain_scores_gemma":[0.99758744,0.0005079673,0.00021660812,0.0006721252,0.00083393237,0.00018207732],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0041421643,0.0005509263,0.00052133255,0.0017872714,0.00095062493,0.003631367,0.0021388077,0.0015012923,0.0041215136],"category_scores_gemma":[0.004656971,0.00050222443,0.0009750039,0.0009866317,0.00060116686,0.0026818004,0.0017464212,0.0017855265,0.002188442],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007967112,0.001186902,0.004374161,0.00080855127,0.00019017562,0.0010039118,0.0011600379,0.013781685,0.05705621,0.08137775,0.07450921,0.7637546],"study_design_scores_gemma":[0.00029883045,0.0005861829,0.0036475114,0.00054973975,0.00037741679,0.0014754807,0.00046214694,0.36629874,0.17222351,0.03789544,0.41588235,0.00030259354],"about_ca_topic_score_codex":0.0056929365,"about_ca_topic_score_gemma":0.0041584745,"teacher_disagreement_score":0.0056929365,"about_ca_system_score_codex":0.000758477,"about_ca_system_score_gemma":0.002121493,"threshold_uncertainty_score":0.021906137},"labels":[],"label_agreement":null},{"id":"W1924314351","doi":"10.1007/978-3-319-22849-5_11","title":"Quality Metrics for Linked Open Data","year":2015,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Computer science; Quality (philosophy); Data mining","score_opus":0.6007819523488969,"score_gpt":0.5116201951511121,"score_spread":0.08916175719778474,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1924314351","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0044372575,0.015796848,0.9482907,0.003324603,0.0011226969,0.00018553369,0.0014627437,0.0014616017,0.023918048],"genre_scores_gemma":[0.14518516,0.015866963,0.8087997,0.00076549134,0.0013882264,0.00070668105,0.005657402,0.001546571,0.020083837],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9765315,0.0059604994,0.0024131518,0.0013820907,0.013195456,0.00051729445],"domain_scores_gemma":[0.97092414,0.013388098,0.0031785876,0.0037840588,0.008051918,0.00067326485],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.015717011,0.0013222862,0.0012035157,0.009975504,0.0009770371,0.007435812,0.0020090158,0.0016031143,0.0050298194],"category_scores_gemma":[0.06608807,0.0006425229,0.0011700233,0.013106701,0.0016050182,0.010875575,0.004080451,0.0026176835,0.001440041],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000031517768,0.000044571883,0.0020222198,0.0007412011,0.000086920736,0.000055121713,0.0004321961,0.008012353,0.0009814755,0.48590228,0.039523713,0.46216652],"study_design_scores_gemma":[0.00001118154,0.00007967394,0.0026212898,0.001088795,0.000058529782,0.0003013756,0.00029548758,0.052798208,0.002987364,0.7586709,0.18100572,0.00008143573],"about_ca_topic_score_codex":0.0022788371,"about_ca_topic_score_gemma":0.0022396615,"teacher_disagreement_score":0.984283,"about_ca_system_score_codex":0.0034895989,"about_ca_system_score_gemma":0.0021548069,"threshold_uncertainty_score":0.083120525},"labels":[],"label_agreement":null},{"id":"W1946996879","doi":"10.2196/mhealth.4183","title":"Effectiveness of Using Mobile Phone Image Capture for Collecting Secondary Data: A Case Study on Immunization History Data Among Children in Remote Areas of Thailand","year":2015,"lang":"en","type":"article","venue":"JMIR mhealth and uhealth","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"Faculty of Tropical Medicine, Mahidol University; Mahidol University; Bill and Melinda Gates Foundation","keywords":"Logbook; Data quality; Data collection; Computer science; Mobile phone; Medicine; Multimedia; Engineering; Telecommunications; Operations management; Statistics","score_opus":0.3159661544709465,"score_gpt":0.48658033966033715,"score_spread":0.17061418518939064,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1946996879","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9952701,0.00028364203,0.0013239712,0.0006313491,0.0000130803855,0.00015822401,0.000059118862,0.000018300272,0.0022423246],"genre_scores_gemma":[0.9945831,0.0006902213,0.003308118,0.00024490908,0.000023185814,0.00008324145,0.000044400862,0.000016040338,0.0010067094],"study_design_codex":"qualitative","study_design_gemma":"observational","domain_scores_codex":[0.99317425,0.004276998,0.00042093458,0.00053712,0.0009056196,0.0006850869],"domain_scores_gemma":[0.9851067,0.009240871,0.00252194,0.0008652431,0.0012013237,0.0010639719],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004441309,0.00071613037,0.00042109453,0.0016021895,0.0038847718,0.0022669241,0.0018015741,0.0022444383,0.0021518366],"category_scores_gemma":[0.017319422,0.0006268734,0.00061873376,0.0017941437,0.002448824,0.0015658276,0.0021748585,0.0017431944,0.0002708696],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00019217157,0.0011928274,0.3062305,0.0012592071,0.00009468235,0.19365905,0.42593053,0.0006772812,0.005116577,0.0009373531,0.0016689573,0.06304092],"study_design_scores_gemma":[0.00003244847,0.001951635,0.16762662,0.00069956685,0.0002061702,0.17024381,0.6333033,0.0028728612,0.0078062527,0.00044606338,0.01464635,0.00016494733],"about_ca_topic_score_codex":0.016656306,"about_ca_topic_score_gemma":0.025673868,"teacher_disagreement_score":0.016656306,"about_ca_system_score_codex":0.002535871,"about_ca_system_score_gemma":0.002441795,"threshold_uncertainty_score":0.033118725},"labels":[],"label_agreement":null},{"id":"W1964327907","doi":"10.1145/1370256.1370264","title":"Design and development of a prototype system for detecting abnormal weather observations","year":2008,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Consistency (knowledge bases); Computer science; Weather forecasting; Weather patterns; Weather satellite; Data quality; Automatic weather station; Set (abstract data type); Model output statistics; Data mining; Meteorology; Satellite; Artificial intelligence; Engineering; Geography; Climate change","score_opus":0.4395776018191143,"score_gpt":0.38437826037872513,"score_spread":0.05519934144038918,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1964327907","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.029535701,0.00011357483,0.93107927,0.0005597567,0.00025047385,0.0027349342,0.00044580142,0.0318685,0.0034120348],"genre_scores_gemma":[0.15506026,0.0001189363,0.8362815,0.0004095261,0.00007305606,0.0017043315,0.0011216415,0.0009893477,0.004241442],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9979479,0.0004039723,0.00020387993,0.00052977505,0.0007171966,0.00019721054],"domain_scores_gemma":[0.9939507,0.0018450156,0.00028891244,0.0009777278,0.002414457,0.0005231873],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0039881715,0.0006961195,0.00097364443,0.00084053323,0.0005896304,0.001407317,0.0031340788,0.001478908,0.0071799746],"category_scores_gemma":[0.007911486,0.0006209246,0.0006004442,0.00052708463,0.00052829174,0.0020596175,0.00095932226,0.0014321485,0.0027689503],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017850051,0.0022011118,0.014449817,0.0016032286,0.00031819774,0.0024519796,0.0025454643,0.031212721,0.30699363,0.011721213,0.043945078,0.5807726],"study_design_scores_gemma":[0.0014012598,0.004661252,0.011684801,0.00034701033,0.00049033185,0.0027181467,0.00080440455,0.55238783,0.27396938,0.0059730066,0.14516407,0.00039855676],"about_ca_topic_score_codex":0.0027349736,"about_ca_topic_score_gemma":0.0010501837,"teacher_disagreement_score":0.0071799746,"about_ca_system_score_codex":0.0005310921,"about_ca_system_score_gemma":0.0016684216,"threshold_uncertainty_score":0.02401942},"labels":[],"label_agreement":null},{"id":"W1966277682","doi":"10.12927/hcpap.2012.22706","title":"\"In God We Trust; All Others Must Bring Data\"","year":2012,"lang":"en","type":"article","venue":"A Nudge Too Far? A Nudge at All? On Paying People to Be Healthy","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Psychology; Internet privacy; Business; Environmental ethics; Social psychology; Computer science; Philosophy","score_opus":0.38685212466784186,"score_gpt":0.4682621043301587,"score_spread":0.08140997966231683,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1966277682","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0012049902,0.0025444503,0.008473513,0.95701647,0.011096064,0.000035378074,0.000052464577,0.00017161245,0.01940518],"genre_scores_gemma":[0.048468668,0.001764962,0.0065689846,0.90845853,0.0042926003,0.00014056222,0.00007418525,0.00025054888,0.029980915],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.8682753,0.067461014,0.00624179,0.008137251,0.043393794,0.0064909454],"domain_scores_gemma":[0.7820971,0.07646032,0.015417663,0.03801356,0.05586286,0.032148395],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08039395,0.0011300246,0.0018025511,0.0019963773,0.0167543,0.024374679,0.0042237225,0.021156965,0.011094529],"category_scores_gemma":[0.2365855,0.0017555191,0.0014630877,0.0024050027,0.07709071,0.043498293,0.026699293,0.05779434,0.0058430345],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00004919533,0.000043990418,0.0013254408,0.000189813,0.00009776105,0.00018592435,0.013467943,0.00007282388,0.00023866513,0.32551628,0.63969564,0.019116499],"study_design_scores_gemma":[0.000042568427,0.000050372626,0.00081615953,0.000771007,0.00006724845,0.00046590556,0.011513317,0.00016664657,0.00036438098,0.18767549,0.79794973,0.00011720568],"about_ca_topic_score_codex":0.016635224,"about_ca_topic_score_gemma":0.01817059,"teacher_disagreement_score":0.08039395,"about_ca_system_score_codex":0.008490404,"about_ca_system_score_gemma":0.048721835,"threshold_uncertainty_score":0.42516893},"labels":[],"label_agreement":null},{"id":"W1967167578","doi":"10.14778/1453856.1453980","title":"Discovering data quality rules","year":2008,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":268,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Data quality; Consistency (knowledge bases); Context (archaeology); Quality (philosophy); Data mining; Data integrity; Set (abstract data type); Data consistency; Process (computing); Database; Artificial intelligence; Programming language; Engineering","score_opus":0.49777141101266814,"score_gpt":0.451736219472416,"score_spread":0.04603519154025215,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1967167578","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09791879,0.0024853484,0.8449972,0.0059248866,0.0002697595,0.0021822895,0.026526932,0.011324405,0.008370271],"genre_scores_gemma":[0.21355699,0.0008566868,0.75219357,0.00095190626,0.00010547928,0.0007087578,0.029345874,0.0007992009,0.0014815],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9650422,0.0049808673,0.0052169454,0.005815096,0.01771588,0.0012289743],"domain_scores_gemma":[0.8815446,0.070961155,0.009725274,0.014737435,0.021213263,0.0018182913],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.015119768,0.0018133466,0.0021014563,0.011942493,0.001823355,0.0073477565,0.004192876,0.0023776633,0.0022707505],"category_scores_gemma":[0.10615004,0.0015721194,0.0039983294,0.005548572,0.0018340886,0.008104751,0.0046804603,0.0039412472,0.0011317234],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005732684,0.0009830564,0.16744779,0.0036369914,0.0010304921,0.0034843583,0.0027495872,0.052523207,0.015778063,0.06386509,0.035902638,0.65202546],"study_design_scores_gemma":[0.00019053917,0.0003615384,0.024179332,0.001836159,0.00078768167,0.0028443085,0.002675211,0.6406669,0.0491715,0.15067647,0.12632138,0.00028893835],"about_ca_topic_score_codex":0.008356454,"about_ca_topic_score_gemma":0.011226863,"teacher_disagreement_score":0.015119768,"about_ca_system_score_codex":0.0028084274,"about_ca_system_score_gemma":0.0065222457,"threshold_uncertainty_score":0.079961896},"labels":[],"label_agreement":null},{"id":"W197224835","doi":"","title":"Automatic Message Triage: Decision Support from Patient-Provider Messages","year":2013,"lang":"en","type":"article","venue":"Americas Conference on Information Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Popularity; Triage; Health care; Computer science; Internet privacy; Decision support system; Work (physics); Medical emergency; Medicine; Data mining; Psychology","score_opus":0.10443091422551239,"score_gpt":0.36029266413013505,"score_spread":0.2558617499046227,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W197224835","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.31434864,0.0052606813,0.61715305,0.00935739,0.0016951415,0.0022449684,0.015723579,0.02431654,0.009900005],"genre_scores_gemma":[0.7019774,0.0011181831,0.27954188,0.000722587,0.0011576503,0.00047183837,0.010762044,0.00016721839,0.0040811785],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99772733,0.0007992058,0.0003708788,0.00037550426,0.0005607686,0.00016632599],"domain_scores_gemma":[0.9873016,0.008895917,0.0015113866,0.0005009924,0.0014707402,0.0003194171],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0022408916,0.0011437164,0.0010268982,0.0055996957,0.0008263277,0.0019316219,0.0011441546,0.001693842,0.0045225094],"category_scores_gemma":[0.014952212,0.00035881734,0.0006786818,0.0021735933,0.00023514121,0.0018982288,0.000940316,0.0014000656,0.0036937005],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001678332,0.0013214864,0.03442302,0.0010847013,0.00021930144,0.001189896,0.0007389268,0.011528848,0.02619524,0.0014580502,0.029710082,0.89045197],"study_design_scores_gemma":[0.00038229304,0.0012939654,0.040220045,0.00062669424,0.0004460027,0.0022990385,0.001848889,0.8235075,0.07329012,0.022112684,0.03376879,0.00020400243],"about_ca_topic_score_codex":0.0011061413,"about_ca_topic_score_gemma":0.0017254198,"teacher_disagreement_score":0.0055996957,"about_ca_system_score_codex":0.00037213785,"about_ca_system_score_gemma":0.0009794155,"threshold_uncertainty_score":0.015129268},"labels":[],"label_agreement":null},{"id":"W1974097983","doi":"10.1109/sose.2014.25","title":"Towards Knowledge Discovery in Big Data","year":2014,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":56,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Saskatchewan","funders":"","keywords":"NoSQL; Computer science; Unstructured data; Big data; Knowledge extraction; Data warehouse; Data science; Semi-structured data; Schema (genetic algorithms); SQL; Analytics; Database; Data mining; Information retrieval; Relational database","score_opus":0.5125727714900005,"score_gpt":0.47666404228785153,"score_spread":0.03590872920214894,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1974097983","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0071321805,0.0048618624,0.9679893,0.011811009,0.00024048999,0.00023523896,0.00069915666,0.0015700967,0.005460706],"genre_scores_gemma":[0.05874638,0.004662092,0.9308152,0.0016333938,0.00023190257,0.00029102855,0.0017672081,0.00012533479,0.0017274665],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9887967,0.004394358,0.00092893,0.0011425539,0.004388572,0.00034889835],"domain_scores_gemma":[0.9675885,0.02121168,0.0012576376,0.00639064,0.0026700776,0.00088143785],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0147842,0.0009675763,0.0018830809,0.010824002,0.0017668138,0.012872651,0.0035778452,0.0029595739,0.0021027327],"category_scores_gemma":[0.044765536,0.0012521036,0.0024638097,0.009714837,0.004471081,0.015621929,0.011451279,0.0052480344,0.001688707],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014999857,0.00029720657,0.005279253,0.0022908824,0.000424802,0.0010423022,0.0030999628,0.02292797,0.0031929596,0.5786696,0.019737355,0.36288765],"study_design_scores_gemma":[0.000025212428,0.000026537604,0.0005439337,0.0004595502,0.000054043492,0.0003029252,0.0011049393,0.10652649,0.0026832786,0.8372506,0.050983895,0.000038606795],"about_ca_topic_score_codex":0.00257408,"about_ca_topic_score_gemma":0.0031507532,"teacher_disagreement_score":0.0147842,"about_ca_system_score_codex":0.0018899182,"about_ca_system_score_gemma":0.0046501174,"threshold_uncertainty_score":0.07818729},"labels":[],"label_agreement":null},{"id":"W1975236650","doi":"10.1007/s10664-008-9101-9","title":"A subject-based empirical evaluation of SSUCD’s performance in reducing inconsistencies in use case models","year":2008,"lang":"en","type":"article","venue":"Empirical Software Engineering","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":23,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Subject (documents); Empirical research; Statistics; Mathematics; World Wide Web","score_opus":0.4411743086357212,"score_gpt":0.4184957454988292,"score_spread":0.022678563136892038,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1975236650","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9365168,0.00068986445,0.05409384,0.0003718446,0.000083672254,0.000614785,0.0011515688,0.0019627516,0.0045148325],"genre_scores_gemma":[0.87922734,0.00013622594,0.11743681,0.000082608196,0.000024404037,0.00027331864,0.0021271699,0.00011300271,0.00057913753],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.9749141,0.017411066,0.0027179222,0.0019784581,0.002580778,0.0003977379],"domain_scores_gemma":[0.6432277,0.29757187,0.008597016,0.024199877,0.024137087,0.0022665344],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.047930658,0.0007116714,0.0009963879,0.0056472453,0.000952384,0.002449361,0.0022349355,0.0015741902,0.0018691862],"category_scores_gemma":[0.17834319,0.00039672456,0.00088824914,0.0035806955,0.0013171164,0.0034883686,0.0031395182,0.00088700047,0.00036741595],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.008653301,0.0032131663,0.32389542,0.0012661574,0.00081205316,0.00020091962,0.0031322208,0.054431856,0.0055740746,0.0042795967,0.0041324417,0.59040874],"study_design_scores_gemma":[0.0015521751,0.0071251774,0.16814421,0.0002544254,0.0012041327,0.0005743662,0.0032773595,0.78192407,0.020090457,0.0051511712,0.010489985,0.00021243302],"about_ca_topic_score_codex":0.00959873,"about_ca_topic_score_gemma":0.010139022,"teacher_disagreement_score":0.047930658,"about_ca_system_score_codex":0.002134442,"about_ca_system_score_gemma":0.0027413722,"threshold_uncertainty_score":0.25348455},"labels":[],"label_agreement":null},{"id":"W1976355580","doi":"10.1007/s10115-011-0439-8","title":"Finding best evidence for evidence-based best practice recommendations in health care: the initial decision support system design","year":2011,"lang":"en","type":"article","venue":"Knowledge and Information Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Best practice; Medical prescription; Clinical decision support system; Decision support system; Harm; Health care; Quality (philosophy); eHealth; Evidence-based practice; Medicine; Risk analysis (engineering); Computer science; Data mining; Nursing; Psychology; Alternative medicine","score_opus":0.539744659034669,"score_gpt":0.4976609918738763,"score_spread":0.04208366716079265,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1976355580","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.088109374,0.085846074,0.55686074,0.11464869,0.0044103116,0.13050453,0.0055312077,0.0012531367,0.01283595],"genre_scores_gemma":[0.116424814,0.005325227,0.843739,0.004323019,0.00037052284,0.028878618,0.0005901824,0.00005975192,0.00028892697],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.60416955,0.29728827,0.06020134,0.00910348,0.027743315,0.0014939447],"domain_scores_gemma":[0.2345123,0.70249665,0.017880669,0.012322744,0.02752743,0.0052602217],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.33023068,0.0038454267,0.013390765,0.020123579,0.004487221,0.02192273,0.0069785276,0.011780768,0.011327439],"category_scores_gemma":[0.69716316,0.00533757,0.009681214,0.009313162,0.0059784623,0.018105129,0.011655856,0.011781845,0.0013698804],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.016824756,0.003141283,0.018615624,0.13584907,0.01799012,0.00065180176,0.010554362,0.011384175,0.0020081229,0.05017519,0.010645437,0.7221601],"study_design_scores_gemma":[0.041944567,0.015705451,0.015860189,0.18688777,0.062956646,0.0010509902,0.0082261255,0.116269715,0.011989528,0.47708184,0.059985913,0.0020413029],"about_ca_topic_score_codex":0.0017420165,"about_ca_topic_score_gemma":0.0051016402,"teacher_disagreement_score":0.6697693,"about_ca_system_score_codex":0.013332491,"about_ca_system_score_gemma":0.039695367,"threshold_uncertainty_score":0.8259448},"labels":[],"label_agreement":null},{"id":"W1977341443","doi":"10.1177/1460458205055685","title":"Managing hospital databases: can large hospitals really protect patient data?","year":2005,"lang":"en","type":"article","venue":"Health Informatics Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Legislation; Directive; Compliance (psychology); Data Protection Act 1998; Business; Internet privacy; Database; Medicine; Computer security; Computer science; Political science; Law","score_opus":0.1516301388436691,"score_gpt":0.43200304840649456,"score_spread":0.28037290956282546,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1977341443","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1337632,0.023757009,0.10955243,0.66582626,0.0014668166,0.0005624108,0.0011884354,0.0011034444,0.06278002],"genre_scores_gemma":[0.88849235,0.0102821365,0.0704006,0.022930402,0.0018782439,0.0002834887,0.0011536436,0.0002952912,0.0042839106],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.92937034,0.0475309,0.0044361036,0.0034246498,0.012884399,0.0023535793],"domain_scores_gemma":[0.6690699,0.21088241,0.03478036,0.050175235,0.026627632,0.008464532],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05701492,0.00043709623,0.0009698042,0.0021088768,0.002544207,0.020019334,0.0045105508,0.005177116,0.0035487877],"category_scores_gemma":[0.24096607,0.0009369882,0.0007175787,0.0062924805,0.007562911,0.044252988,0.007528599,0.003899454,0.0016927675],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006739517,0.00038141405,0.07747695,0.0018458591,0.00029853426,0.0007041308,0.02165914,0.0051730275,0.0020872038,0.24318056,0.09431808,0.5522011],"study_design_scores_gemma":[0.0003094893,0.0006094999,0.037762333,0.0026699982,0.00029796694,0.0025069579,0.04461815,0.014256716,0.0062293564,0.43621045,0.45426244,0.00026662563],"about_ca_topic_score_codex":0.004965137,"about_ca_topic_score_gemma":0.0039469157,"teacher_disagreement_score":0.05701492,"about_ca_system_score_codex":0.0042375834,"about_ca_system_score_gemma":0.007986246,"threshold_uncertainty_score":0.30152738},"labels":[],"label_agreement":null},{"id":"W1977628174","doi":"10.1071/ah080766","title":"A decade of data linkage in Western Australia: strategic design, applications and benefits of the WA data linkage system","year":2008,"lang":"en","type":"article","venue":"Australian Health Review","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":514,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Centre for Global Health Research","funders":"","keywords":"Linkage (software); Population health; Health economics; Record linkage; Data quality; Public health; Population; Data science; Linked data; Medicine; Business; Computer science; Environmental health; Marketing; World Wide Web; Biology; Genetics","score_opus":0.7754379927253564,"score_gpt":0.5261300498695192,"score_spread":0.24930794285583724,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1977628174","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.102749385,0.12722322,0.36052272,0.33994192,0.0046297545,0.0075038653,0.0014925295,0.0022957425,0.053640824],"genre_scores_gemma":[0.3471405,0.06811145,0.5199633,0.030082706,0.002300505,0.0068545924,0.0018971522,0.00070704205,0.0229428],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.7907809,0.15015107,0.017975533,0.008344643,0.029529825,0.0032178871],"domain_scores_gemma":[0.7989666,0.0642636,0.016330551,0.025158932,0.08710843,0.008171848],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.23734514,0.00067526894,0.0011660102,0.00628731,0.003717729,0.010565094,0.0037053898,0.0026337674,0.0017041828],"category_scores_gemma":[0.2177375,0.0015524167,0.0008852944,0.00998103,0.006001283,0.010857324,0.011207568,0.0045905504,0.00071322144],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021946673,0.0001573096,0.022175623,0.0032616234,0.00022827505,0.0004718395,0.016578995,0.0023358783,0.0013624433,0.061844792,0.034678716,0.856685],"study_design_scores_gemma":[0.00013740218,0.0011657486,0.0734209,0.0090534445,0.00020235043,0.000931272,0.012445406,0.008734473,0.002618543,0.03973135,0.85124797,0.00031114818],"about_ca_topic_score_codex":0.113022625,"about_ca_topic_score_gemma":0.07814931,"teacher_disagreement_score":0.23734514,"about_ca_system_score_codex":0.019958781,"about_ca_system_score_gemma":0.07356486,"threshold_uncertainty_score":0.94048923},"labels":[],"label_agreement":null},{"id":"W1980720057","doi":"10.1007/s00500-015-1632-6","title":"Feature-driven linguistic-based entity matching in linked data with application in pharmacy","year":2015,"lang":"en","type":"article","venue":"Soft Computing","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"SPARQL; Computer science; RDF; Process (computing); Linked data; Feature (linguistics); Information retrieval; Natural language; Hyperlink; Semantic Web; Natural language processing; World Wide Web; Web page; Linguistics; Programming language","score_opus":0.22022291767357507,"score_gpt":0.4482172416113033,"score_spread":0.2279943239377282,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1980720057","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.3414729,0.0010692361,0.6394137,0.0013721735,0.00020431868,0.00052009424,0.0070079733,0.0047168857,0.0042227446],"genre_scores_gemma":[0.70328724,0.00024843405,0.28920916,0.00015888878,0.000046076264,0.000148195,0.005607912,0.00012045814,0.0011735932],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9976307,0.0008014906,0.00027425305,0.0005131536,0.0006216097,0.00015873942],"domain_scores_gemma":[0.9942015,0.0036119157,0.0004317662,0.0005902502,0.0010234058,0.00014112699],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0029495403,0.000351636,0.0007488257,0.003751352,0.0009196917,0.0025411027,0.0015075612,0.001263356,0.0020742766],"category_scores_gemma":[0.013757659,0.00030331098,0.0013060712,0.0052494435,0.00040396227,0.0025262942,0.0019375252,0.0008046653,0.00076300575],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017095837,0.0014052938,0.064848825,0.0013108132,0.000601426,0.0018160766,0.0011619033,0.2143304,0.01688461,0.021587139,0.013704172,0.66063976],"study_design_scores_gemma":[0.000036048372,0.000094043135,0.007629949,0.000042297135,0.00010375294,0.0002265142,0.0002974439,0.96705997,0.0072238455,0.012964494,0.0042857723,0.000035842655],"about_ca_topic_score_codex":0.01068699,"about_ca_topic_score_gemma":0.014613143,"teacher_disagreement_score":0.01068699,"about_ca_system_score_codex":0.00092759135,"about_ca_system_score_gemma":0.0016668069,"threshold_uncertainty_score":0.021249592},"labels":[],"label_agreement":null},{"id":"W1981001739","doi":"10.14778/1454159.1454200","title":"Semandaq","year":2008,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":39,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Bell (Canada)","funders":"","keywords":"Computer science; Relational database; SQL; Quality (philosophy); Database; Data mining; User interface; Interface (matter); Data quality; Programming language; Engineering; Operating system; Metric (unit)","score_opus":0.19753170774097992,"score_gpt":0.36462387965471404,"score_spread":0.16709217191373413,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1981001739","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0059783524,0.00083827914,0.68141776,0.0011316633,0.0003828267,0.0004044065,0.015882572,0.2836559,0.010308139],"genre_scores_gemma":[0.09953402,0.001125266,0.77640474,0.0017305467,0.00021245293,0.0007050423,0.060979154,0.044859312,0.014449507],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99367934,0.0014303188,0.00078876526,0.0013330238,0.0024537486,0.00031484818],"domain_scores_gemma":[0.9818186,0.006126603,0.0009862324,0.007115166,0.0035002541,0.00045316917],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008801186,0.0013176543,0.0013069933,0.0026475566,0.0010359116,0.006549304,0.004904649,0.0013822885,0.023924958],"category_scores_gemma":[0.022697631,0.0015493806,0.0021239128,0.0025557228,0.001481745,0.009941374,0.006264762,0.0025107001,0.009237615],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0016289379,0.00031968846,0.009097397,0.0028615207,0.00040225653,0.00070522714,0.0017591246,0.009857164,0.019501662,0.09905809,0.37756753,0.47724143],"study_design_scores_gemma":[0.00036681333,0.00020169589,0.002613459,0.00026499608,0.00014407697,0.0009254937,0.00036769806,0.08870943,0.02532764,0.07789332,0.8029523,0.00023322857],"about_ca_topic_score_codex":0.0057245796,"about_ca_topic_score_gemma":0.0046405727,"teacher_disagreement_score":0.023924958,"about_ca_system_score_codex":0.0014472468,"about_ca_system_score_gemma":0.0031547274,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W1981314985","doi":"10.1016/j.im.2010.04.001","title":"Governing the data commons: Policy, practice, and the advancement of science","year":2010,"lang":"en","type":"article","venue":"Information & Management","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":31,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Canadian Space Agency; NASA Headquarters; Australian Government; Agência Espacial Brasileira; University of California Berkeley; National Aeronautics and Space Administration","keywords":"Data sharing; Commons; Intellectual property; Shared resource; Common-pool resource; Natural resource; Global commons; Political science; Knowledge management; Data science; Business; Computer science; Law; Economics; Computer security; Ecology","score_opus":0.08970413318049758,"score_gpt":0.43075133922144787,"score_spread":0.3410472060409503,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1981314985","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008579413,0.019118749,0.045082282,0.87318546,0.00211072,0.00018059461,0.00022555498,0.00015487759,0.05136229],"genre_scores_gemma":[0.732355,0.02425601,0.046076052,0.17401104,0.009687296,0.0011348014,0.00035502051,0.00035682155,0.011767948],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.7761931,0.14541632,0.012811363,0.016338034,0.039680295,0.009560922],"domain_scores_gemma":[0.30460176,0.56689733,0.027133306,0.054082327,0.030665075,0.016620114],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.31740287,0.0009446406,0.0027584787,0.0074805133,0.013342218,0.046902284,0.009121284,0.034124047,0.0077419863],"category_scores_gemma":[0.4163605,0.0015667336,0.0017938347,0.01104719,0.10166119,0.051791627,0.026255911,0.031195527,0.0015518374],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000033670203,0.00005930843,0.001193219,0.0002480038,0.00003366012,0.000047335066,0.0026560724,0.00079431717,0.00012210722,0.9630338,0.013320374,0.018458206],"study_design_scores_gemma":[0.000035565983,0.00001714595,0.00044220558,0.0007906695,0.000014171098,0.00003096416,0.0015308013,0.00088914373,0.00026522137,0.93975246,0.056196928,0.000034727058],"about_ca_topic_score_codex":0.019218761,"about_ca_topic_score_gemma":0.013137749,"teacher_disagreement_score":0.9908787,"about_ca_system_score_codex":0.023857862,"about_ca_system_score_gemma":0.10104387,"threshold_uncertainty_score":0.8417638},"labels":[],"label_agreement":null},{"id":"W1981578383","doi":"10.14778/2536336.2536345","title":"Discovering linkage points over web data","year":2013,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":41,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Schema matching; Schema (genetic algorithms); Data integration; Information retrieval; Data mining; Linked data; Linkage (software); Star schema; Database schema; Semi-structured model; Semantic Web; Database design","score_opus":0.1633565029719125,"score_gpt":0.3784563459656941,"score_spread":0.2150998429937816,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1981578383","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.28949118,0.001773605,0.6986631,0.0007150124,0.000043504595,0.0007180125,0.002406189,0.0034916846,0.00269773],"genre_scores_gemma":[0.41379312,0.00094834575,0.58015054,0.00009001524,0.000041293737,0.00025770807,0.0038075852,0.00018252083,0.00072891527],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9907555,0.0021227004,0.0010091561,0.0015660843,0.004121761,0.00042487198],"domain_scores_gemma":[0.98439085,0.008619614,0.0021413057,0.001899274,0.002524655,0.00042437864],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0076551847,0.0007929338,0.0016529519,0.018619763,0.0021604132,0.0050965534,0.0019565672,0.0021541088,0.0011050018],"category_scores_gemma":[0.0347103,0.0008109922,0.0015285908,0.016456425,0.0009282562,0.009267304,0.0047444184,0.0013509542,0.00067070394],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005510496,0.00084188255,0.10967456,0.0010816917,0.0006717798,0.0016395339,0.0031808547,0.07494428,0.012623176,0.03942991,0.0053371247,0.7500242],"study_design_scores_gemma":[0.00009022862,0.0002982656,0.021031523,0.0002288184,0.00032827276,0.0012493717,0.003720334,0.7906955,0.028199196,0.14077057,0.0132629955,0.000124915],"about_ca_topic_score_codex":0.003481897,"about_ca_topic_score_gemma":0.0037066275,"teacher_disagreement_score":0.018619763,"about_ca_system_score_codex":0.0010935799,"about_ca_system_score_gemma":0.0018752561,"threshold_uncertainty_score":0.040484965},"labels":[],"label_agreement":null},{"id":"W1983388548","doi":"10.1007/s10844-012-0229-0","title":"Reducing the size of databases for multirelational classification: a subgraph-based approach","year":2012,"lang":"en","type":"article","venue":"Journal of Intelligent Information Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa; National Research Council Canada","funders":"","keywords":"Computer science; Database; Preprocessor; Tuple; Data mining; Relational database; Data pre-processing; Schema (genetic algorithms); Machine learning; Artificial intelligence","score_opus":0.34538316626348664,"score_gpt":0.421210654523675,"score_spread":0.07582748826018837,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1983388548","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07274996,0.001019298,0.9175188,0.0013734871,0.000105859435,0.00033956367,0.001455453,0.003044857,0.002392752],"genre_scores_gemma":[0.3389491,0.0006730571,0.6530453,0.00031685462,0.00012381656,0.00023687632,0.00390146,0.00056506245,0.0021883706],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9970862,0.0009115334,0.00025601144,0.00056919875,0.0008861643,0.00029086997],"domain_scores_gemma":[0.98647016,0.005950574,0.00077111344,0.0044291797,0.0019473288,0.0004316931],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0016481776,0.0009828124,0.0027604578,0.0045117517,0.0013792694,0.0024835747,0.003293507,0.0013714659,0.0030011584],"category_scores_gemma":[0.012944194,0.00080089975,0.0026733163,0.0059912754,0.0010201513,0.005780153,0.002671729,0.0013201853,0.0008374558],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00079493853,0.000726792,0.00951367,0.000914754,0.00054274395,0.00044892658,0.00072955934,0.1846844,0.030628474,0.037921514,0.018166479,0.7149278],"study_design_scores_gemma":[0.00007123321,0.00016260643,0.0023753203,0.00005448109,0.00029970828,0.0002975422,0.00049040065,0.9083661,0.006351848,0.07638277,0.005107142,0.00004090392],"about_ca_topic_score_codex":0.010572015,"about_ca_topic_score_gemma":0.019399432,"teacher_disagreement_score":0.010572015,"about_ca_system_score_codex":0.001296954,"about_ca_system_score_gemma":0.0026050443,"threshold_uncertainty_score":0.021020949},"labels":[],"label_agreement":null},{"id":"W1983762395","doi":"10.2196/medinform.3463","title":"A Fuzzy-Match Search Engine for Physician Directories","year":2014,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Information retrieval; Fuzzy logic; Search engine; World Wide Web; MEDLINE; Medicine; Data mining; Artificial intelligence","score_opus":0.09893618723598034,"score_gpt":0.43024273842163446,"score_spread":0.3313065511856541,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1983762395","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.40601918,0.0025530034,0.43387946,0.0011771646,0.00029745873,0.0025068424,0.030834695,0.09060377,0.03212848],"genre_scores_gemma":[0.37673628,0.00034508682,0.59319645,0.00025560302,0.000044761524,0.00038648077,0.021598484,0.00042129194,0.0070154928],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99854076,0.00023463255,0.0002636186,0.00032862634,0.00053045823,0.00010196246],"domain_scores_gemma":[0.9969836,0.0015352854,0.00020819223,0.0002534943,0.00085004215,0.00016934531],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019163559,0.00072634115,0.00080765755,0.004947796,0.000998023,0.0014682036,0.0014073545,0.0010576572,0.009319804],"category_scores_gemma":[0.0104795545,0.0003346239,0.0005774155,0.002992988,0.00027276456,0.0024885093,0.00096537964,0.00047358137,0.0032810098],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002920618,0.0011440386,0.031044932,0.0018656531,0.00026755588,0.0008294733,0.00090777985,0.043010995,0.020284083,0.018152554,0.0930114,0.7865609],"study_design_scores_gemma":[0.00040907005,0.00059472787,0.009584126,0.00012829386,0.000116452175,0.0007602121,0.00081001746,0.89859164,0.033325583,0.00859238,0.046973497,0.0001139624],"about_ca_topic_score_codex":0.015707718,"about_ca_topic_score_gemma":0.019401219,"teacher_disagreement_score":0.015707718,"about_ca_system_score_codex":0.0013420723,"about_ca_system_score_gemma":0.0024771919,"threshold_uncertainty_score":0.031232595},"labels":[],"label_agreement":null},{"id":"W1983996307","doi":"10.1109/cscwd.2014.6846921","title":"A study of intents resolving for service discovery","year":2014,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Computer science; Matching (statistics); Service discovery; Service (business); Similarity (geometry); Information retrieval; Order (exchange); Data science; Empirical research; World Wide Web; Web service; Data mining; Artificial intelligence","score_opus":0.3462392937357613,"score_gpt":0.4645175144537989,"score_spread":0.11827822071803762,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1983996307","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.36251557,0.004173127,0.60896474,0.005600618,0.00032500376,0.0011514628,0.0032317294,0.00092619564,0.013111562],"genre_scores_gemma":[0.67800814,0.001177172,0.31253958,0.0004591757,0.00024970926,0.0003589663,0.0044533773,0.00014793318,0.0026059241],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9821016,0.008168895,0.0014433031,0.002654676,0.00489589,0.00073563046],"domain_scores_gemma":[0.8547275,0.113610744,0.008019946,0.0149429925,0.006878618,0.0018201686],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.020672336,0.00080461975,0.0013321235,0.0046058567,0.0030187818,0.004173505,0.0032345548,0.0021010593,0.003280291],"category_scores_gemma":[0.1233839,0.0005614209,0.0018722446,0.0071537127,0.0033463403,0.011006499,0.0026477166,0.0037186441,0.0006153188],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019112133,0.0016343453,0.065171756,0.0019454195,0.00046275897,0.0006544133,0.0037165699,0.100050874,0.010903353,0.33420816,0.015444052,0.46389708],"study_design_scores_gemma":[0.00014106755,0.0009807945,0.015634537,0.00016391955,0.00017622903,0.0013525583,0.0025539808,0.7479221,0.006847421,0.19867206,0.025439505,0.000115874784],"about_ca_topic_score_codex":0.006031701,"about_ca_topic_score_gemma":0.003460436,"teacher_disagreement_score":0.020672336,"about_ca_system_score_codex":0.0036939164,"about_ca_system_score_gemma":0.003045878,"threshold_uncertainty_score":0.10932708},"labels":[],"label_agreement":null},{"id":"W1985538849","doi":"10.1109/memea.2008.4543004","title":"Discrimination of Inconsistencies in Medical Data","year":2008,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Children's Hospital of Eastern Ontario; University of Ottawa; Carleton University","funders":"Philips Research Americas","keywords":"Missing data; Computer science; Outlier; Data mining; Data quality; Data cleansing; Process (computing); Information retrieval; Artificial intelligence; Machine learning","score_opus":0.6116560649423984,"score_gpt":0.49962681511967716,"score_spread":0.11202924982272128,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1985538849","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.4119252,0.003669472,0.5638683,0.0043762713,0.0007358138,0.0015581162,0.006376778,0.0017333439,0.0057566464],"genre_scores_gemma":[0.71862805,0.00061936455,0.27281,0.00061174575,0.0003244008,0.000523982,0.0057926527,0.0001548407,0.0005349016],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.89857286,0.03114503,0.028842809,0.011170602,0.02805057,0.002218167],"domain_scores_gemma":[0.62326205,0.24875316,0.04827575,0.034536704,0.04315125,0.0020211153],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08456209,0.00096029654,0.0024728677,0.020507095,0.0019255925,0.007230487,0.0030919649,0.0023532924,0.0012897446],"category_scores_gemma":[0.3163832,0.0009462865,0.001492025,0.01463254,0.0025241228,0.005943278,0.0043251663,0.0015662541,0.00034838548],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015812875,0.00038645012,0.58619046,0.0020366055,0.0012755471,0.0038903696,0.0070513445,0.01973896,0.004842509,0.04867205,0.00796677,0.31636757],"study_design_scores_gemma":[0.0005649297,0.0009590094,0.2735487,0.0032306372,0.0024264525,0.011979386,0.013312452,0.28536686,0.036879133,0.2963164,0.07473025,0.0006858694],"about_ca_topic_score_codex":0.0025917927,"about_ca_topic_score_gemma":0.001788775,"teacher_disagreement_score":0.08456209,"about_ca_system_score_codex":0.0020229185,"about_ca_system_score_gemma":0.0039711227,"threshold_uncertainty_score":0.44721246},"labels":[],"label_agreement":null},{"id":"W1990694685","doi":"10.1145/1297797.1297800","title":"Does data warehouse end-user metadata add value?","year":2007,"lang":"en","type":"article","venue":"Communications of the ACM","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":57,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"St. Francis Xavier University","funders":"","keywords":"Data warehouse; Metadata; Computer science; Database; End user; Value (mathematics); World Wide Web; Information retrieval","score_opus":0.4898806212217548,"score_gpt":0.5030314624550921,"score_spread":0.013150841233337318,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1990694685","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.117985174,0.019461889,0.022134256,0.7527004,0.0030744513,0.0001551361,0.0017426583,0.0009308902,0.08181522],"genre_scores_gemma":[0.9154621,0.017488692,0.021901635,0.02794628,0.0051088203,0.00008468972,0.0014491309,0.0004329147,0.010125801],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.98449326,0.007484609,0.00079452933,0.00087441754,0.0050739646,0.001279245],"domain_scores_gemma":[0.86998224,0.079119585,0.0073904935,0.0109124575,0.028249761,0.004345497],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.030923389,0.0004877116,0.0008709249,0.0034481564,0.0010756687,0.014162901,0.0020961661,0.0039136354,0.010065973],"category_scores_gemma":[0.14053038,0.0006565505,0.000638602,0.0064691696,0.0044530826,0.041151874,0.003401413,0.0024342488,0.004255496],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011009816,0.00058208,0.13748139,0.0018818986,0.00031438406,0.00062504556,0.0033239522,0.0007502327,0.003183356,0.10563179,0.122840464,0.6222844],"study_design_scores_gemma":[0.00040390054,0.00074083614,0.08289788,0.0036888297,0.00061063253,0.0016421746,0.030998683,0.0078104855,0.013050291,0.4278299,0.4300582,0.00026816622],"about_ca_topic_score_codex":0.0035991832,"about_ca_topic_score_gemma":0.0049507567,"teacher_disagreement_score":0.030923389,"about_ca_system_score_codex":0.002861319,"about_ca_system_score_gemma":0.004409594,"threshold_uncertainty_score":0.16354042},"labels":[],"label_agreement":null},{"id":"W1991083901","doi":"10.1007/s10606-008-9084-5","title":"alt.metadata.health: Ontological Context for Data Use and Integration","year":2008,"lang":"en","type":"article","venue":"Computer Supported Cooperative Work (CSCW)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":16,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Metadata; Computer science; Ontology; Context (archaeology); Data science; Data mapping; Data element; Set (abstract data type); Information retrieval; Data integration; Metadata modeling; Data integrity; World Wide Web; Data mining; Database","score_opus":0.5920331447390127,"score_gpt":0.4446306491918988,"score_spread":0.14740249554711388,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1991083901","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011427744,0.0023865052,0.7875375,0.015973903,0.0015185523,0.0005199797,0.052697174,0.044506337,0.08343226],"genre_scores_gemma":[0.22543594,0.0052158223,0.5637509,0.00686517,0.0016476266,0.00093220704,0.11102461,0.011324985,0.07380275],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99842036,0.0005193657,0.00031550162,0.00017043749,0.0004499192,0.00012442164],"domain_scores_gemma":[0.99567324,0.0018821565,0.00037417837,0.0010964527,0.0006536219,0.00032039877],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0044121235,0.0006334574,0.0005506691,0.0037378184,0.0014377321,0.006016885,0.0010939664,0.001919855,0.017595313],"category_scores_gemma":[0.008772622,0.0005924784,0.000652648,0.003909864,0.0011589339,0.008770627,0.00443538,0.0020941054,0.010205784],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00033855648,0.00015999444,0.0063491906,0.0012791741,0.000052866697,0.0005685676,0.0038685533,0.0016114684,0.007068492,0.5200352,0.21201427,0.24665369],"study_design_scores_gemma":[0.00004064243,0.00003855438,0.00175427,0.0002966472,0.00008009066,0.0003837846,0.0008665905,0.007682228,0.0077808634,0.12579238,0.85521716,0.00006682985],"about_ca_topic_score_codex":0.00799253,"about_ca_topic_score_gemma":0.008645759,"teacher_disagreement_score":0.017595313,"about_ca_system_score_codex":0.001296917,"about_ca_system_score_gemma":0.002007224,"threshold_uncertainty_score":0.05886221},"labels":[],"label_agreement":null},{"id":"W1993783004","doi":"10.1145/1645953.1646084","title":"A framework for semantic link discovery over relational data","year":2009,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":56,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Linked data; Semantic Web; Relational database management system; Relational database; RDF; Information retrieval; Data quality; World Wide Web; Data science; Service (business)","score_opus":0.3959281110422866,"score_gpt":0.4899961649284179,"score_spread":0.09406805388613132,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1993783004","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00024992807,0.00026268463,0.997068,0.00031265244,0.000046315057,0.0001332078,0.0002485343,0.00074911816,0.0009295971],"genre_scores_gemma":[0.008232867,0.00064639776,0.98835516,0.00020052963,0.000096584095,0.0002948624,0.0010134784,0.00014837121,0.0010117048],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98665583,0.0038915973,0.002126019,0.0018943211,0.00486413,0.0005680189],"domain_scores_gemma":[0.9899295,0.0040848027,0.0008600273,0.002755077,0.0017666097,0.00060400995],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.019531365,0.0016131579,0.0021545035,0.010034989,0.004117562,0.011208477,0.007167086,0.0034847967,0.0042458246],"category_scores_gemma":[0.02046237,0.002082067,0.006036074,0.0123146335,0.0047162045,0.01530054,0.007881384,0.005948971,0.0025009662],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000036816473,0.000071909446,0.00037752383,0.00038419775,0.000120516415,0.00057588646,0.0007669777,0.017219268,0.0010978635,0.9091924,0.007843515,0.062313296],"study_design_scores_gemma":[0.000041012194,0.000058061054,0.0001607468,0.00033877615,0.00012067507,0.00081518665,0.00031264452,0.11167394,0.002272572,0.71827656,0.16581151,0.00011844499],"about_ca_topic_score_codex":0.012352738,"about_ca_topic_score_gemma":0.012925704,"teacher_disagreement_score":0.019531365,"about_ca_system_score_codex":0.0029480767,"about_ca_system_score_gemma":0.00650811,"threshold_uncertainty_score":0.103293},"labels":[],"label_agreement":null},{"id":"W1994031640","doi":"10.4018/jdm.2014070102","title":"Improving Business Intelligence Traceability and Accountability","year":2014,"lang":"en","type":"article","venue":"Journal of Database Management","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Traceability; Computer science; Metadata; Business intelligence; Process management; Data warehouse; Workflow; Accountability; Product (mathematics); Quality (philosophy); Knowledge management; Business process; Database; Software engineering; World Wide Web; Business; Work in process","score_opus":0.10957770867008844,"score_gpt":0.3884190335479261,"score_spread":0.2788413248778377,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1994031640","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08518633,0.0005042632,0.8742403,0.0063148183,0.00014117737,0.00043170166,0.00021514828,0.004446582,0.028519772],"genre_scores_gemma":[0.6958334,0.00043467354,0.29846004,0.00044022323,0.00007565598,0.0002599156,0.0006357629,0.0004972825,0.0033630219],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.94893336,0.023448389,0.0039015363,0.0044207145,0.01681382,0.0024820876],"domain_scores_gemma":[0.8384902,0.05809577,0.012571115,0.060304884,0.02851588,0.0020221432],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.050513808,0.0013160645,0.00090036343,0.005924882,0.002782827,0.014502523,0.0040552816,0.0028967601,0.0038977948],"category_scores_gemma":[0.14653374,0.00096833374,0.0012663449,0.0040130406,0.0032551975,0.023247138,0.014385135,0.004230784,0.0011350564],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003624842,0.00075577165,0.034593232,0.00062961393,0.00016038008,0.0003186328,0.00833633,0.030357916,0.008203929,0.21415283,0.004602931,0.697526],"study_design_scores_gemma":[0.00020890062,0.00094756664,0.019099288,0.0015174729,0.00043953356,0.00082593196,0.008082294,0.28971544,0.059192248,0.4974604,0.122139156,0.00037176366],"about_ca_topic_score_codex":0.0074471524,"about_ca_topic_score_gemma":0.0032684836,"teacher_disagreement_score":0.050513808,"about_ca_system_score_codex":0.0036967688,"about_ca_system_score_gemma":0.008236982,"threshold_uncertainty_score":0.2671457},"labels":[],"label_agreement":null},{"id":"W1994820452","doi":"10.1109/i2ct.2014.7092302","title":"An effective way of mining knowledge from heterogeneous data sources","year":2014,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Trinity College","funders":"","keywords":"Computer science; Data science; Association rule learning; Medical knowledge; Medical information; Knowledge extraction; Knowledge management; Big data; Data mining; Medicine","score_opus":0.19365702921052286,"score_gpt":0.43583604375056156,"score_spread":0.2421790145400387,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1994820452","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010694954,0.0019824773,0.9806286,0.00146133,0.00014152488,0.00043342847,0.0011730426,0.00091016793,0.002574467],"genre_scores_gemma":[0.12101228,0.0019676292,0.8704728,0.0005330011,0.00019013451,0.00042399726,0.0035487928,0.00007715609,0.0017741787],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9938769,0.0012741279,0.00081157434,0.0012760735,0.00257443,0.00018687118],"domain_scores_gemma":[0.9956488,0.001867338,0.00049321307,0.0008282846,0.0010405892,0.00012189732],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0041214996,0.0012024541,0.0016206269,0.0086186435,0.0017818197,0.005278354,0.002168279,0.0013965281,0.0013315349],"category_scores_gemma":[0.010391329,0.0007517522,0.0018899281,0.008603378,0.0008100688,0.007487732,0.0033225953,0.0017178906,0.001039262],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00019093388,0.00040850078,0.012685311,0.0016532824,0.0013637657,0.0016730954,0.0013303305,0.019788507,0.012729095,0.034353208,0.015451044,0.8983729],"study_design_scores_gemma":[0.0001354183,0.00025259246,0.012041837,0.0010174363,0.0010946682,0.0031031,0.0033511287,0.5840044,0.027501473,0.2681276,0.099136285,0.00023399615],"about_ca_topic_score_codex":0.0027249607,"about_ca_topic_score_gemma":0.0032180194,"teacher_disagreement_score":0.0086186435,"about_ca_system_score_codex":0.0005916311,"about_ca_system_score_gemma":0.0023608385,"threshold_uncertainty_score":0.021796823},"labels":[],"label_agreement":null},{"id":"W1995541812","doi":"10.1007/s00778-009-0161-2","title":"Creating probabilistic databases from duplicated data","year":2009,"lang":"en","type":"article","venue":"The VLDB Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":61,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Probabilistic logic; Data mining; Scalability; Data deduplication; Task (project management); Cluster analysis; Database; String (physics); Probabilistic database; Information retrieval; Machine learning; Artificial intelligence; Database theory; Relational database","score_opus":0.47988074415434634,"score_gpt":0.47707972753851563,"score_spread":0.0028010166158307093,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1995541812","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.033633895,0.0003936307,0.95449805,0.0005678157,0.00009633327,0.00020148454,0.001916215,0.0075104674,0.0011820814],"genre_scores_gemma":[0.18324225,0.000406788,0.80930066,0.00014844302,0.00009252705,0.00022997949,0.0046754754,0.0009120769,0.0009918391],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9881392,0.002553105,0.0012740368,0.0021081758,0.005480946,0.00044451372],"domain_scores_gemma":[0.93718404,0.034241896,0.0029996645,0.019050362,0.005741648,0.00078225485],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011814,0.001015899,0.0021311915,0.005695032,0.0014786258,0.006886034,0.006783619,0.0022362608,0.0035795625],"category_scores_gemma":[0.07379757,0.0025108473,0.0029797207,0.00944797,0.0014225324,0.011774803,0.007296313,0.0022798423,0.0015519845],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010342164,0.00043809295,0.016092433,0.0010479343,0.0007365667,0.0022956277,0.0019051025,0.16309053,0.0124956705,0.079477556,0.022162318,0.6992239],"study_design_scores_gemma":[0.00010793951,0.00016016632,0.0016092645,0.0001122813,0.0003219376,0.0017488278,0.00056356966,0.82751906,0.02251518,0.12825261,0.016961262,0.00012782245],"about_ca_topic_score_codex":0.002422068,"about_ca_topic_score_gemma":0.0034706858,"teacher_disagreement_score":0.011814,"about_ca_system_score_codex":0.001218541,"about_ca_system_score_gemma":0.0030402478,"threshold_uncertainty_score":0.06247914},"labels":[],"label_agreement":null},{"id":"W2001097309","doi":"10.1007/s11306-014-0679-1","title":"The New Data Quality Task Group (DQTG): ensuring high quality data today and in the future","year":2014,"lang":"en","type":"article","venue":"Metabolomics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":20,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Task (project management); Quality (philosophy); Data quality; Task group; Computer science; Data science; Engineering; Engineering management; Operations management; Systems engineering","score_opus":0.2365783400962979,"score_gpt":0.4281732937617395,"score_spread":0.1915949536654416,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2001097309","genre_codex":"commentary","genre_gemma":"other","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012797405,0.023235565,0.2688082,0.6317958,0.025554057,0.0043725125,0.009387345,0.0051581375,0.018890956],"genre_scores_gemma":[0.06233481,0.0226504,0.69308347,0.15091795,0.017292988,0.005935667,0.033979375,0.0030494155,0.010756051],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.82259667,0.06273182,0.031465188,0.008053731,0.06642768,0.008724919],"domain_scores_gemma":[0.2954457,0.21143615,0.0724845,0.07020683,0.27340788,0.07701901],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3169838,0.0024736172,0.0050946022,0.012919853,0.00531347,0.020899275,0.011206147,0.015109453,0.0036641436],"category_scores_gemma":[0.3618169,0.0020894522,0.002773729,0.013067408,0.008822419,0.015192331,0.018677024,0.018742895,0.0043208892],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008078781,0.0006500586,0.027111953,0.003601997,0.0004715013,0.00042175635,0.0018177812,0.0047733136,0.009251779,0.05858281,0.5494308,0.3430784],"study_design_scores_gemma":[0.0002953491,0.00048883416,0.01880108,0.005575596,0.00030569,0.00058597926,0.0014968679,0.00873321,0.0074167997,0.059742514,0.89605606,0.000502001],"about_ca_topic_score_codex":0.022806,"about_ca_topic_score_gemma":0.013192363,"teacher_disagreement_score":0.6830162,"about_ca_system_score_codex":0.010614886,"about_ca_system_score_gemma":0.10158587,"threshold_uncertainty_score":0.8422806},"labels":[],"label_agreement":null},{"id":"W2004002671","doi":"10.4018/jhdri.2010070104","title":"Record Linkage in Healthcare","year":2010,"lang":"en","type":"article","venue":"International Journal of Healthcare Delivery Reform Initiatives","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Brock University","funders":"","keywords":"Record linkage; Confidentiality; Linkage (software); Computer science; Medical record; Health care; Probabilistic logic; Data science; Key (lock); Computer security; Medicine; Artificial intelligence","score_opus":0.12382062607717054,"score_gpt":0.44941090360488933,"score_spread":0.3255902775277188,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2004002671","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.007476294,0.06870408,0.7993998,0.04660322,0.003944448,0.0012781078,0.0027102104,0.0020648881,0.06781898],"genre_scores_gemma":[0.1488392,0.049976867,0.76418686,0.009651238,0.0032961995,0.0021088817,0.004577741,0.00039863636,0.016964413],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.8575669,0.104162425,0.009889086,0.009030417,0.018025575,0.0013255484],"domain_scores_gemma":[0.84356374,0.106872186,0.01156326,0.021465829,0.015085763,0.0014491583],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.084381394,0.0008316589,0.0020183567,0.012357335,0.0035848694,0.014194568,0.004401298,0.0061785937,0.011465224],"category_scores_gemma":[0.18869121,0.0010592327,0.0015939114,0.029183857,0.0044205016,0.014605407,0.0098441,0.003904647,0.0056109857],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013688394,0.0001039447,0.0055851787,0.002766043,0.00038896067,0.00029508056,0.0022507047,0.0041108932,0.0002998761,0.32642573,0.046184193,0.61145246],"study_design_scores_gemma":[0.000099039564,0.00020913835,0.004628153,0.0030331481,0.00025590786,0.00159426,0.0024681624,0.014957739,0.0019218877,0.47319058,0.49745598,0.0001859707],"about_ca_topic_score_codex":0.003810537,"about_ca_topic_score_gemma":0.0017428494,"teacher_disagreement_score":0.084381394,"about_ca_system_score_codex":0.005031285,"about_ca_system_score_gemma":0.012903353,"threshold_uncertainty_score":0.44625682},"labels":[],"label_agreement":null},{"id":"W2008481019","doi":"10.1145/1107499.1107509","title":"In memoriam Alberto Oscar Mendelzon","year":2005,"lang":"en","type":"article","venue":"ACM SIGMOD Record","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"TD Bank Group","funders":"","keywords":"Tribute; Battle; Friendship; Computer science; Intellect; Art history; Art; History; Ancient history; Theology; Philosophy; Sociology","score_opus":0.16446583863983466,"score_gpt":0.4286982494735129,"score_spread":0.26423241083367827,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2008481019","genre_codex":"editorial","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00011127402,0.011962084,0.00039366877,0.44122738,0.5401633,0.000023664148,0.00023227312,0.00014335364,0.0057429406],"genre_scores_gemma":[0.0050669652,0.023808626,0.00089467154,0.3562268,0.48585036,0.00012724573,0.000508217,0.0004095677,0.12710747],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9953525,0.00072128425,0.0003825006,0.00086840644,0.0023042068,0.00037103912],"domain_scores_gemma":[0.9713684,0.005537461,0.0012912549,0.00078493985,0.01570215,0.0053157853],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008293007,0.0014328088,0.002027283,0.0015544055,0.0029910097,0.009063325,0.002144347,0.0052607222,0.024049826],"category_scores_gemma":[0.047653064,0.00046634345,0.0010393764,0.00088528806,0.002015631,0.004406773,0.0030508616,0.017632872,0.026801705],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000015150468,0.0000035082955,0.000028677423,0.000020747453,0.0000029280664,0.000034773653,0.000026204489,0.000009295274,0.000014580335,0.00039156197,0.99572796,0.0037245757],"study_design_scores_gemma":[0.00000923903,0.000009277906,0.00011495369,0.00013640664,0.000005633988,0.00014085186,0.00007106481,0.000028446493,0.000044414424,0.000722844,0.99870753,0.000009315178],"about_ca_topic_score_codex":0.005001734,"about_ca_topic_score_gemma":0.008374852,"teacher_disagreement_score":0.024049826,"about_ca_system_score_codex":0.003982915,"about_ca_system_score_gemma":0.005416252,"threshold_uncertainty_score":0.08045465},"labels":[],"label_agreement":null},{"id":"W2008641248","doi":"10.1109/icde.2010.5447744","title":"ProbClean: A probabilistic duplicate detection system","year":2010,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Probabilistic logic; Data mining; Set (abstract data type); Space (punctuation); Relational database; Quality (philosophy); Artificial intelligence","score_opus":0.10251911695511381,"score_gpt":0.372236251015045,"score_spread":0.26971713405993114,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2008641248","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0060708527,0.0003554304,0.95108783,0.00062668003,0.00007329599,0.00022246435,0.0026496034,0.037657965,0.0012558404],"genre_scores_gemma":[0.15133508,0.00045156668,0.83418727,0.0007975446,0.00018337359,0.00057848037,0.0069407225,0.0018662892,0.003659681],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9931844,0.0012077152,0.0007093034,0.0016161071,0.0030353996,0.0002470243],"domain_scores_gemma":[0.98173726,0.008297974,0.0019281368,0.0046551637,0.0029187126,0.00046280204],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007968683,0.0012219195,0.0023744013,0.0036381518,0.0018931581,0.004499994,0.0051529873,0.0024442538,0.005594871],"category_scores_gemma":[0.040302392,0.0016105268,0.001575095,0.0038129303,0.0013437477,0.0076586953,0.006560622,0.002667373,0.0038177879],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0020914508,0.0005140746,0.013972616,0.0013361282,0.00055397954,0.001115916,0.00080088637,0.16170044,0.015211479,0.058872048,0.10386518,0.6399657],"study_design_scores_gemma":[0.00014346068,0.00014240971,0.0012256469,0.00006280467,0.00011787718,0.0005765383,0.00008693593,0.8765038,0.014653912,0.07659785,0.029746514,0.0001422463],"about_ca_topic_score_codex":0.0037059358,"about_ca_topic_score_gemma":0.0033443356,"teacher_disagreement_score":0.007968683,"about_ca_system_score_codex":0.0013804376,"about_ca_system_score_gemma":0.004243952,"threshold_uncertainty_score":0.042142928},"labels":[],"label_agreement":null},{"id":"W2009189347","doi":"10.1002/bult.2006.1720320605","title":"The IA of potentiality: Toward a grounded theory of information architecture philosophy, theory and research","year":2006,"lang":"en","type":"article","venue":"Bulletin of the American Society for Information Science and Technology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Conversation; Grounded theory; Sociology; Epistemology; Participant observation; Architecture; Qualitative research; Philosophy; Social science; Communication","score_opus":0.05059845871226172,"score_gpt":0.3659003217522842,"score_spread":0.3153018630400225,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2009189347","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.035822824,0.005175101,0.75897557,0.1254595,0.0009030905,0.0035267472,0.00039319007,0.00025804437,0.069485895],"genre_scores_gemma":[0.44680187,0.0030021712,0.53523374,0.007778756,0.00013086897,0.004417584,0.00032817066,0.00014172416,0.0021651643],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8929963,0.093572035,0.002373716,0.0029177482,0.006522352,0.0016178532],"domain_scores_gemma":[0.8930254,0.0863489,0.0031271665,0.005966006,0.008268843,0.0032636623],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.109477304,0.0011994867,0.0017303211,0.00822646,0.009444414,0.026466781,0.005578158,0.0049174777,0.001708322],"category_scores_gemma":[0.06266616,0.001284532,0.0013643574,0.007871961,0.06690041,0.025015658,0.011146768,0.01567627,0.00059520674],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000032926346,0.00009626421,0.0007535777,0.00060092425,0.000028329603,0.00010176054,0.10918029,0.0010295638,0.0004207821,0.85929286,0.0027028597,0.02575994],"study_design_scores_gemma":[0.00005066755,0.00006124416,0.00044256097,0.0022930112,0.000020411537,0.00008789578,0.097711496,0.003248282,0.0003593397,0.8546666,0.041014396,0.00004412829],"about_ca_topic_score_codex":0.009167856,"about_ca_topic_score_gemma":0.008489412,"teacher_disagreement_score":0.109477304,"about_ca_system_score_codex":0.022384176,"about_ca_system_score_gemma":0.03555455,"threshold_uncertainty_score":0.57897824},"labels":[],"label_agreement":null},{"id":"W2009382242","doi":"10.1109/cloud.2013.131","title":"Toward an Ecosystem for Precision Sharing of Segmented Big Data","year":2013,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Computer science; Big data; Analytics; Raw data; Data science; Data analysis; Data sharing; Set (abstract data type); Data mining","score_opus":0.6475747092139017,"score_gpt":0.4630136464326516,"score_spread":0.18456106278125012,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2009382242","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08514713,0.000480418,0.89268756,0.004877051,0.00030800694,0.0005995692,0.00017238321,0.0056973333,0.0100306105],"genre_scores_gemma":[0.39635593,0.00034217307,0.596028,0.0008163382,0.00014953618,0.0003887122,0.00056238315,0.00043190448,0.004925002],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9950832,0.0014202852,0.0003725284,0.00073775294,0.0018243206,0.0005620437],"domain_scores_gemma":[0.9901978,0.0011510788,0.0007098276,0.004498461,0.0017699744,0.001672923],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009004863,0.0007077931,0.0008096328,0.0016251496,0.0026945549,0.0061844583,0.0032532227,0.0022821962,0.0023472523],"category_scores_gemma":[0.013593609,0.0009733337,0.001034311,0.002283243,0.002200445,0.01538364,0.013012472,0.0029037527,0.0011293208],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017700965,0.0021243517,0.036988717,0.00054124073,0.00057058845,0.0023945956,0.00470725,0.076889805,0.060368784,0.4235366,0.036382373,0.3537257],"study_design_scores_gemma":[0.00026627674,0.0005802252,0.0035623936,0.00016417542,0.00013062682,0.00114143,0.001960263,0.45972648,0.025970357,0.40296534,0.1032947,0.00023774114],"about_ca_topic_score_codex":0.0019065067,"about_ca_topic_score_gemma":0.0018458087,"teacher_disagreement_score":0.009004863,"about_ca_system_score_codex":0.0011824144,"about_ca_system_score_gemma":0.0037370494,"threshold_uncertainty_score":0.0476228},"labels":[],"label_agreement":null},{"id":"W2011133830","doi":"10.1145/1871437.1871786","title":"Exploring and visualizing academic social networks","year":2010,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Visibility; Visualization; World Wide Web; Set (abstract data type); Citation; Social network (sociolinguistics); Social network analysis; Data science; Data visualization; Information retrieval; Data mining; Social media","score_opus":0.6616171706478876,"score_gpt":0.501443923905629,"score_spread":0.16017324674225863,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2011133830","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.16742705,0.001818051,0.7681565,0.004149259,0.00014109544,0.00022643094,0.007833495,0.021655558,0.028592566],"genre_scores_gemma":[0.46750066,0.0014777908,0.5218201,0.00019839269,0.00010170777,0.00021881818,0.0037418378,0.0009884152,0.0039521963],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9990415,0.00041755123,0.00006386983,0.00011544121,0.00030696226,0.000054781696],"domain_scores_gemma":[0.9964547,0.0022499436,0.0004294938,0.000376689,0.00028215503,0.0002070248],"candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.0016018661,0.0005745465,0.00032803527,0.0066459402,0.0008418133,0.0036180804,0.0005882081,0.00067205745,0.004640408],"category_scores_gemma":[0.005816192,0.00026776272,0.00047388073,0.0050092167,0.0005313197,0.0031173087,0.002825324,0.0007429265,0.00081058004],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00052019104,0.00030441457,0.039318692,0.0015429783,0.0003158936,0.001466162,0.023934439,0.060517874,0.052695263,0.24730414,0.057097442,0.5149824],"study_design_scores_gemma":[0.000116929725,0.00013429564,0.021157116,0.00045456726,0.0001788229,0.0010926716,0.0076397043,0.34197503,0.036316298,0.3059158,0.28480747,0.00021128033],"about_ca_topic_score_codex":0.0031112896,"about_ca_topic_score_gemma":0.0052055367,"teacher_disagreement_score":0.9933541,"about_ca_system_score_codex":0.0004911218,"about_ca_system_score_gemma":0.0008124909,"threshold_uncertainty_score":0.015523672},"labels":[],"label_agreement":null},{"id":"W2012837162","doi":"10.1109/icde.2012.105","title":"Discovering Conservation Rules","year":2012,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Intersection (aeronautics); Computer science; Class (philosophy); Data mining; Conservation law; Semantics (computer science); Process (computing); Quality (philosophy); Theoretical computer science; Artificial intelligence; Mathematics; Programming language","score_opus":0.3414115313259976,"score_gpt":0.4537697560876122,"score_spread":0.11235822476161461,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2012837162","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09136212,0.00109319,0.8988556,0.0015562581,0.00009551227,0.00035590824,0.003002492,0.0009367168,0.0027421324],"genre_scores_gemma":[0.511895,0.000657392,0.47822043,0.0007619698,0.0001858456,0.00042672374,0.0067773745,0.00018916781,0.00088607456],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9860633,0.0025726305,0.0016199381,0.0031085461,0.0059806984,0.00065488345],"domain_scores_gemma":[0.90894026,0.06579994,0.006911707,0.008712371,0.008641192,0.0009944423],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011276462,0.0011202476,0.0022954326,0.0051257736,0.0014987919,0.004656944,0.003939166,0.0018324334,0.0013451262],"category_scores_gemma":[0.08788477,0.00098841,0.0018670923,0.004200628,0.0018356006,0.00823872,0.0027236536,0.0028680805,0.00039765905],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00061889435,0.00077176467,0.12714525,0.0016017252,0.0008528264,0.0016204157,0.0016798651,0.19790265,0.0072353496,0.15232803,0.020290924,0.48795226],"study_design_scores_gemma":[0.000055931796,0.00009642919,0.005626138,0.00022182002,0.00014756485,0.0006969544,0.00041490156,0.75506616,0.0062780445,0.2189836,0.012351131,0.00006136992],"about_ca_topic_score_codex":0.005988834,"about_ca_topic_score_gemma":0.0059014605,"teacher_disagreement_score":0.011276462,"about_ca_system_score_codex":0.001328972,"about_ca_system_score_gemma":0.0031953098,"threshold_uncertainty_score":0.059636354},"labels":[],"label_agreement":null},{"id":"W2013003292","doi":"10.1590/s0034-89102003000100014","title":"Probabilistic linkage in household survey on hospital care usage","year":2003,"lang":"en","type":"article","venue":"Revista de Saúde Pública","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":24,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"Conselho Nacional de Desenvolvimento Científico e Tecnológico","keywords":"Record linkage; Database; Concordance; Medical record; Medicine; Hospital admission; Hospital care; Probabilistic logic; Linkage (software); Health care; Medical emergency; Environmental health; Computer science; Population","score_opus":0.1401548010313884,"score_gpt":0.3720897732461387,"score_spread":0.2319349722147503,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2013003292","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.88553834,0.0018010284,0.100087866,0.00057226495,0.000054687487,0.0012858186,0.004831164,0.00013677576,0.0056919893],"genre_scores_gemma":[0.98191226,0.00037225115,0.015232582,0.000055464545,0.00002972004,0.00073435676,0.0014312762,0.000010604033,0.0002214576],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.89463687,0.090270825,0.0028015608,0.0030545027,0.008379944,0.0008563391],"domain_scores_gemma":[0.89675945,0.07182571,0.019697573,0.006548592,0.004871236,0.00029750715],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0573828,0.00033604415,0.00064072234,0.0035293787,0.00047125792,0.0010699211,0.0010189217,0.00050079275,0.0018593852],"category_scores_gemma":[0.16723733,0.00033289293,0.00086591876,0.0066590514,0.00047662196,0.0013638831,0.0023196891,0.0003960772,0.00023955206],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00049517286,0.000100580866,0.93310255,0.00045755826,0.00072442397,0.00011721451,0.0016039435,0.007356408,0.00019662527,0.0023491404,0.0007646464,0.052731793],"study_design_scores_gemma":[0.000089630455,0.0007537007,0.91954154,0.0005292191,0.0005255786,0.0007098733,0.0020005554,0.06260031,0.0011331514,0.0058053653,0.006225187,0.00008581275],"about_ca_topic_score_codex":0.0044372287,"about_ca_topic_score_gemma":0.0019423002,"teacher_disagreement_score":0.0573828,"about_ca_system_score_codex":0.00088183087,"about_ca_system_score_gemma":0.0012990643,"threshold_uncertainty_score":0.30347294},"labels":[],"label_agreement":null},{"id":"W2016901333","doi":"10.1145/2479440.2482677","title":"Issues in big data testing and benchmarking","year":2013,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":29,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"European Institute of Innovation and Technology; University of Toronto; Deutsche Forschungsgemeinschaft; International Business Machines Corporation","keywords":"Benchmarking; Computer science; Big data; Scalability; Data science; Relational database; Data modeling; Data management; Database; Massively parallel; Volume (thermodynamics); Data mining; Parallel computing","score_opus":0.6107454406852676,"score_gpt":0.4649125596602122,"score_spread":0.14583288102505537,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2016901333","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.086043365,0.0075360327,0.77553064,0.0795797,0.0034972958,0.0023782481,0.0023211506,0.009115739,0.03399784],"genre_scores_gemma":[0.47143888,0.00170655,0.50627154,0.009312663,0.0015531403,0.0025863403,0.002649889,0.0025216208,0.0019593309],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.7748648,0.15537378,0.013411412,0.009121399,0.043626916,0.0036016311],"domain_scores_gemma":[0.5498267,0.28937295,0.012005612,0.09339369,0.049340177,0.006060833],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.15453546,0.0015077945,0.0023213816,0.0026327355,0.0025282598,0.010525018,0.0106268115,0.0043962332,0.002507489],"category_scores_gemma":[0.39912963,0.0012599203,0.0014602815,0.007166184,0.007885386,0.014839656,0.0056111137,0.005497478,0.0014475894],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013618233,0.0018655673,0.04111477,0.0029447395,0.00047968898,0.0010634579,0.0034565467,0.13915475,0.0068116076,0.28695932,0.098466836,0.41632095],"study_design_scores_gemma":[0.0003860627,0.000995066,0.008857262,0.0015286283,0.000106916836,0.0010575153,0.003971195,0.28110215,0.013646818,0.59161043,0.0965057,0.0002322459],"about_ca_topic_score_codex":0.0042147213,"about_ca_topic_score_gemma":0.0024705364,"teacher_disagreement_score":0.8454645,"about_ca_system_score_codex":0.0029118739,"about_ca_system_score_gemma":0.005957555,"threshold_uncertainty_score":0.81727135},"labels":[],"label_agreement":null},{"id":"W2017217509","doi":"10.1007/s10115-011-0397-1","title":"Scalable clustering methods for the name disambiguation problem","year":2011,"lang":"en","type":"article","venue":"Knowledge and Information Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":23,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"University of Illinois at Urbana-Champaign; University of British Columbia; Advanced Digital Sciences Center; Pennsylvania State University; National Science Foundation","keywords":"Cluster analysis; Computer science; Scalability; Artificial intelligence; Natural language processing; Entity linking; Data mining; Database","score_opus":0.22575786155557567,"score_gpt":0.43212848195334813,"score_spread":0.20637062039777246,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2017217509","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009259845,0.0013362265,0.9852647,0.00061902404,0.00016001651,0.00009745931,0.00052251184,0.0016257556,0.0011143294],"genre_scores_gemma":[0.1552874,0.0009935036,0.83585846,0.00030721942,0.0005553812,0.0003063303,0.0030197152,0.00057162123,0.003100267],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99588865,0.0014173252,0.00032061944,0.0009394631,0.0011545283,0.00027932352],"domain_scores_gemma":[0.9902293,0.0051353113,0.000702271,0.0022480988,0.0013636671,0.0003213358],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0044222646,0.0015482252,0.0029234984,0.0036842613,0.0020274103,0.0023698176,0.004323401,0.0022421256,0.003866598],"category_scores_gemma":[0.016044196,0.0010878262,0.0017050966,0.0064259195,0.0011911194,0.005085086,0.0042158505,0.0027134987,0.0014225547],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004587182,0.00037639972,0.0018704915,0.00048200856,0.00040749917,0.00012433493,0.00025798054,0.33779973,0.0045161443,0.043678764,0.02886019,0.5811678],"study_design_scores_gemma":[0.0000804997,0.00003216534,0.000441965,0.000020211266,0.000042631742,0.000047490797,0.000054595406,0.9029911,0.0008989739,0.092939384,0.0024284187,0.000022560978],"about_ca_topic_score_codex":0.010633742,"about_ca_topic_score_gemma":0.01596277,"teacher_disagreement_score":0.010633742,"about_ca_system_score_codex":0.0017282113,"about_ca_system_score_gemma":0.0035145045,"threshold_uncertainty_score":0.023387432},"labels":[],"label_agreement":null},{"id":"W2020414220","doi":"10.1016/j.hcmf.2011.03.003","title":"Client Satisfaction in Support of Service Planning within a Regulatory Framework: Experience of a Research Hospital","year":2011,"lang":"en","type":"article","venue":"Healthcare Management Forum","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University Health Network","funders":"","keywords":"Process management; Business; Stakeholder; Knowledge management; Service (business); Service quality; Key (lock); Process (computing); Computer science; Marketing; Public relations","score_opus":0.3511880478145705,"score_gpt":0.49749740769748396,"score_spread":0.14630935988291344,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2020414220","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.98442566,0.00015741774,0.0009583017,0.0069039525,0.00004489906,0.00010227506,0.00008525784,0.000077414625,0.007244756],"genre_scores_gemma":[0.99365026,0.00023234524,0.00096735207,0.0012021769,0.000024484967,0.000059911363,0.000056882367,0.00007668599,0.00372985],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.98619926,0.008951767,0.0003596947,0.00038155232,0.0013506231,0.0027571085],"domain_scores_gemma":[0.9793921,0.0067706057,0.0014314706,0.00077613565,0.003922998,0.007706589],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011132843,0.00032572856,0.00059744524,0.0006208527,0.008413519,0.0046097143,0.0022226719,0.0019718637,0.007833021],"category_scores_gemma":[0.022315828,0.00051278085,0.00052076863,0.0015308231,0.002664657,0.0014386723,0.003851443,0.003578408,0.0015638996],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001793355,0.009859407,0.14225367,0.00043049423,0.00012598114,0.010061286,0.51672155,0.001810637,0.002727371,0.0043766303,0.038308464,0.27153116],"study_design_scores_gemma":[0.00026074404,0.0056459056,0.09078334,0.00030063032,0.00011049213,0.004580294,0.8414366,0.0065875333,0.0023771082,0.0019282626,0.045726098,0.00026302025],"about_ca_topic_score_codex":0.03386987,"about_ca_topic_score_gemma":0.049812604,"teacher_disagreement_score":0.03386987,"about_ca_system_score_codex":0.008439535,"about_ca_system_score_gemma":0.012641234,"threshold_uncertainty_score":0.06734544},"labels":[],"label_agreement":null},{"id":"W2021255304","doi":"10.1007/s00778-013-0316-z","title":"Sampling from repairs of conditional functional dependency violations","year":2013,"lang":"en","type":"article","venue":"The VLDB Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":46,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Dependency (UML); Functional dependency; Data mining; Sampling (signal processing); Class (philosophy); Space (punctuation); Variety (cybernetics); Semantics (computer science); Artificial intelligence; Relational database; Programming language","score_opus":0.30258014556785606,"score_gpt":0.4077661213846789,"score_spread":0.10518597581682282,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2021255304","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6686205,0.0004916348,0.3253549,0.00056091434,0.00014150928,0.00024125386,0.0012925217,0.0018257515,0.0014710546],"genre_scores_gemma":[0.9538024,0.00008114153,0.04148501,0.00014722286,0.00005922643,0.00012558614,0.0029486415,0.00019324712,0.0011574405],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99150085,0.0038537104,0.00056593976,0.0017166586,0.0015708097,0.0007920372],"domain_scores_gemma":[0.8830783,0.08502354,0.0049302857,0.019526681,0.005538608,0.0019026343],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010535745,0.0008267699,0.0018141969,0.0020200307,0.00068760046,0.0011631215,0.0036523633,0.0019327428,0.0031611235],"category_scores_gemma":[0.08984218,0.000849051,0.0014346315,0.0016567705,0.0014307336,0.002351098,0.0021318304,0.0026005704,0.00057097],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.005039938,0.0012816082,0.22757772,0.0007922354,0.00078074326,0.0018505696,0.0014590302,0.37239835,0.00941426,0.033465374,0.017068949,0.32887125],"study_design_scores_gemma":[0.00013773656,0.0002794929,0.008612437,0.000052063766,0.00013541726,0.0003793274,0.0003094088,0.9500205,0.0034510365,0.035258636,0.0013320808,0.000031848533],"about_ca_topic_score_codex":0.00518581,"about_ca_topic_score_gemma":0.007995241,"teacher_disagreement_score":0.010535745,"about_ca_system_score_codex":0.00074382406,"about_ca_system_score_gemma":0.0021854548,"threshold_uncertainty_score":0.055719018},"labels":[],"label_agreement":null},{"id":"W2022686325","doi":"10.1016/j.procs.2014.08.023","title":"A Model for Privacy Compromisation Value","year":2014,"lang":"en","type":"article","venue":"Procedia Computer Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary; University of Ottawa","funders":"","keywords":"Computer science; Incentive; Compromise; Information privacy; Internet privacy; Population; Value (mathematics); Computer security; Private information retrieval; Data science; Machine learning","score_opus":0.22143880321785245,"score_gpt":0.4101181923389419,"score_spread":0.18867938912108947,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2022686325","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.032996196,0.0006923164,0.8697339,0.013631804,0.00026413894,0.0005239876,0.0007793251,0.0004855716,0.0808927],"genre_scores_gemma":[0.8541434,0.0010914115,0.105991535,0.0022962505,0.0006582722,0.0011119664,0.0005553023,0.00024447995,0.03390741],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.980078,0.008510867,0.0010458261,0.003406131,0.004286652,0.002672603],"domain_scores_gemma":[0.95855695,0.023003772,0.0038741315,0.008904627,0.003988129,0.0016723953],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.016415754,0.0017963175,0.0015331549,0.00342891,0.0037671525,0.01251776,0.006188108,0.008820463,0.014431634],"category_scores_gemma":[0.049242925,0.0011898606,0.00280197,0.004312472,0.009482045,0.024702158,0.007949715,0.009403683,0.002206599],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00004163184,0.000041616757,0.0006210525,0.000042476524,0.000032986678,0.00028246702,0.00034400605,0.010255584,0.00029449677,0.98011774,0.0020586078,0.005867317],"study_design_scores_gemma":[0.000042477892,0.00004315135,0.00020977316,0.000056667366,0.000053005435,0.00039730582,0.00015801397,0.08251277,0.0004021076,0.90606296,0.01002747,0.00003433118],"about_ca_topic_score_codex":0.0032889144,"about_ca_topic_score_gemma":0.0016414054,"teacher_disagreement_score":0.016415754,"about_ca_system_score_codex":0.006719927,"about_ca_system_score_gemma":0.0038413831,"threshold_uncertainty_score":0.08681589},"labels":[],"label_agreement":null},{"id":"W2024895566","doi":"10.1007/s11704-012-2007-0","title":"Matching dependencies: semantics and query answering","year":2012,"lang":"en","type":"article","venue":"Frontiers of Computer Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University; University of Ottawa","funders":"","keywords":"Computer science; Tuple; Matching (statistics); Enforcement; Semantics (computer science); Invariant (physics); Generalization; Similarity (geometry); Theoretical computer science; Data mining; Information retrieval; Artificial intelligence; Programming language; Mathematics; Discrete mathematics","score_opus":0.07187203828515723,"score_gpt":0.34902872659215306,"score_spread":0.2771566883069958,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2024895566","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.022271186,0.001982006,0.9669399,0.0035920432,0.00013808673,0.00013964278,0.0013717177,0.0010442153,0.0025211878],"genre_scores_gemma":[0.38498858,0.0031305018,0.5996969,0.0010114143,0.0007169115,0.00033853782,0.006531817,0.0005135129,0.00307179],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9860115,0.0049133706,0.0020352656,0.0024764047,0.0038999845,0.00066344766],"domain_scores_gemma":[0.96747476,0.02292769,0.0017342755,0.0046350225,0.002527173,0.000701121],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010593688,0.0010618591,0.0025767856,0.00606933,0.0018452721,0.008107415,0.003983395,0.0033909692,0.0041203042],"category_scores_gemma":[0.056050017,0.0014127372,0.0029557045,0.00905206,0.003604747,0.02874974,0.0053014546,0.0033118436,0.0008432882],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00042434258,0.0002631528,0.0036185174,0.001042195,0.00021086786,0.0004034127,0.001311027,0.030484654,0.003039012,0.7503083,0.01333675,0.1955578],"study_design_scores_gemma":[0.000030687293,0.000023189603,0.00037467442,0.00006657623,0.00006829571,0.00019486109,0.00024932096,0.098196045,0.0013971278,0.8932094,0.0061578737,0.000031930955],"about_ca_topic_score_codex":0.0048494576,"about_ca_topic_score_gemma":0.0033494793,"teacher_disagreement_score":0.010593688,"about_ca_system_score_codex":0.0022395689,"about_ca_system_score_gemma":0.002699445,"threshold_uncertainty_score":0.056025445},"labels":[],"label_agreement":null},{"id":"W2025146961","doi":"10.1177/1460458207086333","title":"A method to map heterogeneity between near but non-equivalent semantic attributes in multiple health data registries","year":2008,"lang":"en","type":"article","venue":"Health Informatics Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; Ontology; Metadata; Web Ontology Language; Information retrieval; Semantics (computer science); Semantic integration; Context (archaeology); Semantic heterogeneity; XML; Semantic Web; RDF; OWL-S; Data mapping; Ontology-based data integration; World Wide Web; Database; Semantic Web Stack; Geography; Programming language","score_opus":0.5805209750176058,"score_gpt":0.517028038760856,"score_spread":0.06349293625674979,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2025146961","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.004079585,0.000046522215,0.9924069,0.0002644137,0.000015307696,0.00017755572,0.00026286446,0.0020031717,0.00074364943],"genre_scores_gemma":[0.0505856,0.000056944045,0.9477385,0.000055422766,0.000018838296,0.00022039149,0.000518658,0.00018656247,0.00061899814],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.989513,0.003655096,0.0012866005,0.0019294324,0.0033224088,0.000293529],"domain_scores_gemma":[0.97139275,0.015314115,0.0030573558,0.007263068,0.0023730246,0.0005997034],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01784582,0.0007828537,0.001071072,0.0073065814,0.0019456429,0.0071245413,0.002280782,0.0016632844,0.003033689],"category_scores_gemma":[0.04183552,0.0012696553,0.0020704828,0.009374886,0.0015387469,0.008164739,0.0072299056,0.0019807364,0.0007273337],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00046147205,0.00023579894,0.015728863,0.00057687913,0.0005206659,0.0016390613,0.0070542702,0.021751244,0.013565216,0.25857252,0.00866822,0.6712258],"study_design_scores_gemma":[0.0003637458,0.00027633266,0.01008084,0.0005330319,0.0007435301,0.0043310127,0.004519455,0.4390587,0.03155688,0.35080996,0.15723448,0.0004920462],"about_ca_topic_score_codex":0.00565389,"about_ca_topic_score_gemma":0.0060917186,"teacher_disagreement_score":0.01784582,"about_ca_system_score_codex":0.0016502041,"about_ca_system_score_gemma":0.0036193097,"threshold_uncertainty_score":0.09437889},"labels":[],"label_agreement":null},{"id":"W20259189","doi":"10.3233/978-1-61499-488-6-170","title":"Using Business Intelligence for Efficient Inter-Facility Patient Transfer","year":2015,"lang":"en","type":"article","venue":"Studies in health technology and informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Northern British Columbia","funders":"","keywords":"Online analytical processing; Computer science; Data warehouse; Visualization; Context (archaeology); Data cube; Business intelligence; Consistency (knowledge bases); Transfer (computing); Web application; Database; Data science; Data mining; World Wide Web; Artificial intelligence","score_opus":0.501093311015246,"score_gpt":0.5101973292725414,"score_spread":0.009104018257295343,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W20259189","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05651192,0.000875227,0.9060147,0.0038753587,0.000104980514,0.00044746665,0.0005669274,0.0050104163,0.02659299],"genre_scores_gemma":[0.5257954,0.00093636836,0.46933725,0.00032792613,0.000047096353,0.00018264967,0.0010081416,0.00017268187,0.0021924777],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.9960045,0.0016115247,0.0003547081,0.00036632913,0.001351768,0.00031118206],"domain_scores_gemma":[0.9952791,0.0018596546,0.00081835256,0.0008724171,0.0008870646,0.00028345286],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004239763,0.00091182714,0.0007390354,0.0043772426,0.001289259,0.0072037904,0.0014085383,0.0012911317,0.003019963],"category_scores_gemma":[0.00883282,0.00052529207,0.0007173571,0.0067471145,0.00064147724,0.0054023787,0.0040084785,0.0013289353,0.0018602038],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00049077015,0.0006803319,0.016475279,0.0004901132,0.0002345319,0.0011732669,0.001613667,0.08246415,0.01248879,0.04397093,0.01603597,0.8238823],"study_design_scores_gemma":[0.00017057634,0.00039522318,0.011368547,0.00043734704,0.00024441286,0.0011220855,0.0057569053,0.7119054,0.035802703,0.1314428,0.10112711,0.00022686875],"about_ca_topic_score_codex":0.0031696318,"about_ca_topic_score_gemma":0.0023813818,"teacher_disagreement_score":0.0072037904,"about_ca_system_score_codex":0.0011486356,"about_ca_system_score_gemma":0.0024973464,"threshold_uncertainty_score":0.022422314},"labels":[],"label_agreement":null},{"id":"W2031616148","doi":"10.1109/oceans.2012.6404783","title":"Beyond data management: How to foster data exploitation and better science?","year":2012,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Ocean Networks Canada Society","funders":"Canarie; Consortium for Ocean Leadership","keywords":"Computer science; Sampling (signal processing); Data logger; Scientific instrument; Remote sensing; Data management; Bandwidth (computing); Data science; Data mining; Telecommunications; Geology","score_opus":0.42389306397412346,"score_gpt":0.4529110742181073,"score_spread":0.029018010243983816,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2031616148","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0024001603,0.028712507,0.15347423,0.7688817,0.0127630215,0.00027704757,0.0013079096,0.003624645,0.028558826],"genre_scores_gemma":[0.13053325,0.07731514,0.5355119,0.17893188,0.035080492,0.0017330432,0.005379842,0.0040846304,0.03142984],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.96115255,0.019353503,0.0032759418,0.004079649,0.0096681,0.0024702155],"domain_scores_gemma":[0.80512476,0.07383657,0.0063027362,0.052584954,0.04806742,0.01408364],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.07582901,0.002448641,0.0030852992,0.006229219,0.005770543,0.039014846,0.0105279535,0.009987473,0.015649348],"category_scores_gemma":[0.16718856,0.0016988477,0.0021176764,0.010563803,0.02219607,0.13879153,0.02462395,0.016872156,0.01481765],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017056767,0.00016155938,0.002366013,0.0013863874,0.00014747611,0.00016571148,0.002262405,0.0016860181,0.0008441184,0.481498,0.31322715,0.19608457],"study_design_scores_gemma":[0.000047673504,0.000039803992,0.00042252397,0.0015889652,0.00004178789,0.00012162205,0.0020229283,0.002009443,0.0008190579,0.4568513,0.53594637,0.00008860825],"about_ca_topic_score_codex":0.009017373,"about_ca_topic_score_gemma":0.0030336096,"teacher_disagreement_score":0.924171,"about_ca_system_score_codex":0.005569204,"about_ca_system_score_gemma":0.020980915,"threshold_uncertainty_score":0.4010269},"labels":[],"label_agreement":null},{"id":"W2032024758","doi":"10.1007/s10994-013-5421-0","title":"Tracking people over time in 19th century Canada for longitudinal analysis","year":2013,"lang":"en","type":"article","venue":"Machine Learning","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":36,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Waterloo; University of Guelph","funders":"Ontario Ministry of Research and Innovation; Research and Innovation Foundation","keywords":"Tracking (education); Late 19th century; Longitudinal data; Artificial intelligence; Computer science; Psychology; Data mining; Period (music); Art","score_opus":0.04624489143412698,"score_gpt":0.3420139273379866,"score_spread":0.2957690359038596,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2032024758","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9167041,0.0022942615,0.002851434,0.005073864,0.00020273731,0.0003594556,0.06448273,0.00014440385,0.00788704],"genre_scores_gemma":[0.9658022,0.0017954495,0.004178739,0.0010043121,0.000033176526,0.00035895876,0.014770015,0.00006308866,0.011994181],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99774927,0.0002092899,0.00016490421,0.0002633476,0.0007750669,0.0008382197],"domain_scores_gemma":[0.9879027,0.00053411815,0.0008978735,0.00042996032,0.008074002,0.0021613806],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00243411,0.0003160579,0.0005090985,0.0035883205,0.0043935063,0.0021646721,0.0022287173,0.0008086679,0.0032939264],"category_scores_gemma":[0.0084227845,0.00040204596,0.0006712087,0.009247007,0.00067295,0.0008773495,0.0018255875,0.0014962758,0.00061159814],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00012350632,0.00009748647,0.94967926,0.00008497878,0.00011400399,0.000119749275,0.0023520333,0.00057351246,0.00018911171,0.0011862796,0.020592412,0.024887638],"study_design_scores_gemma":[0.000026185517,0.00004609027,0.9737809,0.00023959193,0.000093671595,0.000071960436,0.0078539625,0.0019741526,0.00029101735,0.00025536315,0.015322863,0.000044387773],"about_ca_topic_score_codex":0.9987204,"about_ca_topic_score_gemma":0.9991572,"teacher_disagreement_score":0.040605113,"about_ca_system_score_codex":0.040605113,"about_ca_system_score_gemma":0.1228592,"threshold_uncertainty_score":0.2946121},"labels":[],"label_agreement":null},{"id":"W2032227143","doi":"10.4018/jissc.2010092905","title":"Managing Demographic Data Inconsistencies in Healthcare Information Systems","year":2010,"lang":"en","type":"article","venue":"International Journal of Information Systems and Social Change","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Agfa-Gevaert (Canada); Athabasca University","funders":"","keywords":"Computer science; Workflow; XML; Disparate system; Information system; Data exchange; RDF; DICOM; Data science; Database; Health informatics; Information retrieval; Health care; Data mining; World Wide Web; Semantic Web","score_opus":0.20577542931885426,"score_gpt":0.40513484979588366,"score_spread":0.1993594204770294,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2032227143","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.25402388,0.0030407968,0.7028724,0.01711323,0.0005601064,0.0008184659,0.0034445294,0.0029264835,0.015200092],"genre_scores_gemma":[0.69408095,0.0013144229,0.29377437,0.0018590365,0.00031277558,0.00043565413,0.0050696596,0.000561393,0.0025918793],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9175269,0.03962696,0.013223566,0.00598988,0.021846088,0.0017865883],"domain_scores_gemma":[0.8363639,0.09693948,0.02108387,0.019053096,0.025245259,0.001314394],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07491395,0.00048710688,0.0013596908,0.008000193,0.0041105226,0.009166405,0.003906925,0.0022903373,0.0018498792],"category_scores_gemma":[0.19741955,0.0013135499,0.0007983274,0.01138836,0.0030071181,0.016872339,0.007932097,0.0023440912,0.00045068745],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00061984785,0.00039079614,0.16042878,0.00086992915,0.000381226,0.004108275,0.018740311,0.041523773,0.002665344,0.3908905,0.015451004,0.36393017],"study_design_scores_gemma":[0.0002667165,0.00036900578,0.025816055,0.0017178004,0.00085784134,0.0062132287,0.024132878,0.23248672,0.03792361,0.41646194,0.25328624,0.00046799713],"about_ca_topic_score_codex":0.0059627364,"about_ca_topic_score_gemma":0.0032815994,"teacher_disagreement_score":0.07491395,"about_ca_system_score_codex":0.004402112,"about_ca_system_score_gemma":0.007841553,"threshold_uncertainty_score":0.39618754},"labels":[],"label_agreement":null},{"id":"W2035477134","doi":"10.1109/icdew.2014.6818333","title":"Extending contexts with ontologies for multidimensional data quality assessment","year":2014,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Datalog; Context (archaeology); Quality (philosophy); Data quality; Information retrieval; Quality assessment; Database; Data mining; Data science; Evaluation methods","score_opus":0.5683286373405844,"score_gpt":0.5618813134575109,"score_spread":0.0064473238830734525,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2035477134","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011597048,0.0011844283,0.9823093,0.0009828319,0.00008214845,0.00017857345,0.00022923404,0.00056460523,0.0028717984],"genre_scores_gemma":[0.2073972,0.0013463187,0.7890571,0.00041006276,0.00011647856,0.00028435577,0.00038992145,0.00016638894,0.0008322201],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98103195,0.00798573,0.0028691147,0.0025978768,0.004593776,0.00092157867],"domain_scores_gemma":[0.97651345,0.01035632,0.0023623286,0.0065951245,0.0033190148,0.0008537098],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01317657,0.0011823395,0.0011131024,0.005680502,0.0019527263,0.0068681124,0.0021612626,0.001923332,0.0013478198],"category_scores_gemma":[0.030469758,0.0010041136,0.0031544035,0.0058072847,0.004175325,0.015888935,0.010246817,0.0030072795,0.0003247676],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00012591395,0.00013717909,0.00796419,0.00079831824,0.0002563532,0.0010416443,0.005919734,0.02410679,0.005701717,0.8183867,0.0027149548,0.13284662],"study_design_scores_gemma":[0.000049702405,0.000113444374,0.002644783,0.0009015552,0.00034606876,0.0010488112,0.0024911796,0.106072865,0.008875953,0.77779365,0.09944174,0.00022016065],"about_ca_topic_score_codex":0.0053489152,"about_ca_topic_score_gemma":0.0049123215,"teacher_disagreement_score":0.01317657,"about_ca_system_score_codex":0.0016914305,"about_ca_system_score_gemma":0.0023400835,"threshold_uncertainty_score":0.06968522},"labels":[],"label_agreement":null},{"id":"W2037754936","doi":"10.1353/cja.2005.0055","title":"Data Quality in an Information-Rich Environment: Canada as an Example","year":2005,"lang":"en","type":"review","venue":"Canadian Journal on Aging / La Revue canadienne du vieillissement","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":195,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Toronto; University of Manitoba; Health Sciences Centre; Manitoba Health","funders":"","keywords":"Quality (philosophy); Information quality; Data quality; Computer science; Data science; Business; Information system; Political science; Marketing; Epistemology","score_opus":0.1882385821084955,"score_gpt":0.3704396366493099,"score_spread":0.1822010545408144,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2037754936","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0033002142,0.9695579,0.0020940907,0.01958627,0.00042395655,0.00018487444,0.00042115705,0.000037923477,0.0043935757],"genre_scores_gemma":[0.055654142,0.92536974,0.013839449,0.0036635832,0.00023617614,0.00021788712,0.00040584066,0.000022539447,0.0005906845],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9622637,0.013489429,0.003787564,0.0010717624,0.018373573,0.0010140549],"domain_scores_gemma":[0.85151213,0.08624004,0.0074245054,0.003184058,0.049926654,0.0017125483],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.045252867,0.0006590447,0.0029339795,0.007801506,0.0023004024,0.0055807377,0.0022983514,0.001634514,0.0009138776],"category_scores_gemma":[0.0836855,0.00040964302,0.0012991719,0.0297919,0.0032940297,0.0026560617,0.0015756508,0.0017286581,0.00015325405],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027211543,0.000071932125,0.006650652,0.050907888,0.0008056864,0.0006359603,0.003051684,0.0020899032,0.00043925727,0.026486726,0.04039952,0.8681886],"study_design_scores_gemma":[0.00040279116,0.00029140848,0.0662088,0.11780026,0.0030524523,0.0014767518,0.00480163,0.0026296098,0.0015291809,0.018126192,0.78331935,0.00036150706],"about_ca_topic_score_codex":0.84611136,"about_ca_topic_score_gemma":0.8808533,"teacher_disagreement_score":0.95474714,"about_ca_system_score_codex":0.05316317,"about_ca_system_score_gemma":0.14009523,"threshold_uncertainty_score":0.38572758},"labels":[],"label_agreement":null},{"id":"W2039548475","doi":"10.1145/2588555.2610520","title":"Descriptive and prescriptive data cleaning","year":2014,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":53,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Tuple; Scalability; Data mining; Transformation (genetics); Decoupling (probability); Quality (philosophy); Benchmark (surveying); Data quality; Data source; Database; Engineering","score_opus":0.48782631250696074,"score_gpt":0.44451026631315627,"score_spread":0.04331604619380447,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2039548475","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011734415,0.0006937836,0.9680576,0.0009211331,0.00008979318,0.0006275573,0.002067548,0.009997819,0.005810422],"genre_scores_gemma":[0.21012798,0.0011672223,0.7754181,0.0010833964,0.0001274132,0.00060412736,0.005747418,0.0012773542,0.0044469265],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9730216,0.007409014,0.003247532,0.004070922,0.011591885,0.0006590077],"domain_scores_gemma":[0.8672229,0.049395695,0.010612433,0.056893725,0.0150039485,0.00087118463],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.021577258,0.0013373067,0.0013699783,0.0042229206,0.0013035442,0.004800144,0.004654005,0.0015491726,0.0035090966],"category_scores_gemma":[0.07067107,0.0013925689,0.001682205,0.0049905903,0.0027094253,0.0050553144,0.0029011723,0.0031117126,0.0019278453],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006253257,0.0008257437,0.045955762,0.0033073172,0.00042959038,0.0009343505,0.0024311112,0.087001115,0.01795153,0.13025014,0.030430088,0.67985797],"study_design_scores_gemma":[0.00021404133,0.00048731334,0.016681403,0.0013813559,0.00030802775,0.0030375689,0.0015325333,0.5065267,0.09309501,0.19185115,0.18449959,0.00038531498],"about_ca_topic_score_codex":0.004683796,"about_ca_topic_score_gemma":0.0060671703,"teacher_disagreement_score":0.97842276,"about_ca_system_score_codex":0.0018325435,"about_ca_system_score_gemma":0.0057793777,"threshold_uncertainty_score":0.114112794},"labels":[],"label_agreement":null},{"id":"W2041442195","doi":"10.1109/icde.2013.6544854","title":"On the relative trust between inconsistent data and inaccurate constraints","year":2013,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":103,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Semantics (computer science); Consistency (knowledge bases); Data integrity; Data consistency; Data mining; Functional dependency; Data modeling; Theoretical computer science; Database; Programming language; Artificial intelligence; Relational database","score_opus":0.41102298245739677,"score_gpt":0.42876737936645853,"score_spread":0.017744396909061766,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2041442195","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08132374,0.0009693021,0.91022015,0.00385177,0.00007991478,0.00014479533,0.00020913775,0.0002289015,0.002972335],"genre_scores_gemma":[0.76197857,0.0005052573,0.23588526,0.00038568742,0.00012519603,0.00010731832,0.00019598985,0.00013145758,0.00068537064],"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9497326,0.026256187,0.004751659,0.006440037,0.01081911,0.002000356],"domain_scores_gemma":[0.502024,0.4182022,0.034990687,0.023901425,0.018035918,0.0028458035],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04340752,0.0013146037,0.002242007,0.004839991,0.0024895296,0.0069867573,0.0032269813,0.0036210988,0.0015337835],"category_scores_gemma":[0.30850703,0.0019258884,0.0016325115,0.004304893,0.009649187,0.017447144,0.007329548,0.0042244648,0.00019412243],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013984538,0.00025484865,0.031749446,0.0011224869,0.00076493144,0.0016346511,0.0051874863,0.47016734,0.004275161,0.34034088,0.003488576,0.13961582],"study_design_scores_gemma":[0.000080139915,0.00020187003,0.0035671175,0.00020550123,0.00020552122,0.0007833901,0.00086951983,0.7236353,0.0028348737,0.26511744,0.0023683135,0.00013098393],"about_ca_topic_score_codex":0.010179041,"about_ca_topic_score_gemma":0.006220823,"teacher_disagreement_score":0.04340752,"about_ca_system_score_codex":0.0044691265,"about_ca_system_score_gemma":0.0033328068,"threshold_uncertainty_score":0.2295636},"labels":[],"label_agreement":null},{"id":"W2044469685","doi":"10.1109/icde.2013.6544847","title":"Holistic data cleaning: Putting violations into context","year":2013,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":319,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Rotation formalisms in three dimensions; Hypergraph; Context (archaeology); Pipeline (software); Exploit; Reachability; Quality (philosophy); Functional dependency; Theoretical computer science; Isolation (microbiology); Data mining; Machine learning; Programming language; Relational database; Computer security","score_opus":0.5895766416565716,"score_gpt":0.5011305017614565,"score_spread":0.08844613989511518,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2044469685","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.041939516,0.0024585281,0.94859505,0.0012956643,0.00016917886,0.00021612878,0.00046928518,0.0026425014,0.0022142457],"genre_scores_gemma":[0.30676967,0.00090690947,0.68928313,0.00053198915,0.00010411129,0.00012049774,0.0008393391,0.0005062603,0.00093809963],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9887955,0.0034172898,0.0010162954,0.0028965923,0.003378685,0.0004956144],"domain_scores_gemma":[0.9780578,0.009552233,0.0030591947,0.00701956,0.0018446534,0.00046666927],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.006992122,0.0016680547,0.002517763,0.003499607,0.0019234244,0.0040788683,0.00368711,0.0024095469,0.0016962175],"category_scores_gemma":[0.028079405,0.0012454581,0.0021183637,0.004322083,0.0023695943,0.0075021973,0.007562257,0.0031926197,0.00033254182],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00060109637,0.0003340657,0.024912246,0.0020807565,0.0007303224,0.0022262945,0.004358881,0.17109878,0.015014596,0.101066306,0.010862565,0.666714],"study_design_scores_gemma":[0.00007194716,0.0003581979,0.0084376875,0.0009594062,0.0008135459,0.0029911546,0.0033601106,0.5753628,0.03608993,0.30388215,0.067324504,0.00034858077],"about_ca_topic_score_codex":0.0031260727,"about_ca_topic_score_gemma":0.005211889,"teacher_disagreement_score":0.9930079,"about_ca_system_score_codex":0.0010425161,"about_ca_system_score_gemma":0.002741166,"threshold_uncertainty_score":0.036978304},"labels":[],"label_agreement":null},{"id":"W2045966259","doi":"10.1007/bf02287353","title":"Current evaluation and future needs of a mental health data linkage system in a remote region: A canadian experience","year":2002,"lang":"en","type":"article","venue":"The Journal of Behavioral Health Services & Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Lakehead Psychiatric Hospital","funders":"","keywords":"Linkage (software); Health informatics; Health psychology; Mental health; Data collection; Public health; Business; Medicine; Nursing; Psychology; Psychiatry","score_opus":0.5089985575688837,"score_gpt":0.578344012495853,"score_spread":0.06934545492696931,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2045966259","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.82019997,0.0063383393,0.003149249,0.12629895,0.00030840162,0.001395213,0.0036669432,0.00023386294,0.03840915],"genre_scores_gemma":[0.9703938,0.0049205488,0.012140059,0.0046995305,0.000078260506,0.0001902687,0.0017159677,0.00007895175,0.0057825637],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9740777,0.0063383984,0.00192984,0.0013747409,0.011541738,0.004737619],"domain_scores_gemma":[0.90782106,0.014307669,0.0040174853,0.001633026,0.052018315,0.020202389],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04493797,0.0005346987,0.00061915343,0.0024762424,0.012581388,0.010235584,0.0050194543,0.0021708503,0.004858418],"category_scores_gemma":[0.048661713,0.0005108582,0.00074440666,0.00652863,0.004538149,0.0037398022,0.004322227,0.0024052318,0.00044683405],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0020743306,0.0019140717,0.52375275,0.0040201307,0.00039394258,0.0040386217,0.0842297,0.0054876218,0.0072837975,0.02326322,0.031574808,0.31196693],"study_design_scores_gemma":[0.00049540744,0.0014032589,0.5470934,0.002804341,0.00046504923,0.001879398,0.29002625,0.0060210233,0.002349242,0.0022960969,0.1446293,0.00053723884],"about_ca_topic_score_codex":0.98579013,"about_ca_topic_score_gemma":0.98994154,"teacher_disagreement_score":0.89767027,"about_ca_system_score_codex":0.10232976,"about_ca_system_score_gemma":0.2913705,"threshold_uncertainty_score":0.74245787},"labels":[],"label_agreement":null},{"id":"W2047745978","doi":"10.1145/1514894.1514901","title":"On approximating optimum repairs for functional dependency violations","year":2009,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":209,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Functional dependency; Tuple; Computer science; Set (abstract data type); Dependency theory (database theory); Constant (computer programming); Approximation algorithm; Dependency (UML); Algorithm; Database; Mathematics; Relational database; Discrete mathematics; Artificial intelligence","score_opus":0.2489855454233683,"score_gpt":0.4310638159039699,"score_spread":0.18207827048060163,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2047745978","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0726124,0.0010783235,0.92300296,0.0005990876,0.00006411428,0.0001040378,0.00036113968,0.00084971177,0.0013282744],"genre_scores_gemma":[0.40567985,0.0006584455,0.5898186,0.00024035727,0.00006874717,0.00019753534,0.001314371,0.00036168323,0.0016604576],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9969631,0.0009059246,0.00021733347,0.00060024415,0.00089189486,0.00042146625],"domain_scores_gemma":[0.9801451,0.0145094255,0.0015484107,0.002014122,0.0014617348,0.0003212365],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0043594916,0.0016676625,0.0025008055,0.0017967664,0.0010287409,0.0016712872,0.0030340075,0.0019441805,0.002683039],"category_scores_gemma":[0.034561068,0.001033947,0.0013504499,0.0032341874,0.001518143,0.0042682244,0.0020665477,0.002617009,0.0006026346],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00034061266,0.00010744385,0.0021415367,0.00021994555,0.00006216054,0.0001062401,0.00021335934,0.90874076,0.0018441624,0.009920135,0.0024671454,0.0738364],"study_design_scores_gemma":[0.000026683163,0.000079407575,0.00029966875,0.000021742864,0.000020369876,0.00011689033,0.000079480604,0.97688466,0.0013118155,0.020411054,0.0007372614,0.000011051972],"about_ca_topic_score_codex":0.0068517,"about_ca_topic_score_gemma":0.0063314564,"teacher_disagreement_score":0.0068517,"about_ca_system_score_codex":0.0020605058,"about_ca_system_score_gemma":0.002308066,"threshold_uncertainty_score":0.023055494},"labels":[],"label_agreement":null},{"id":"W2048988884","doi":"10.4018/jdm.2011070102","title":"Data Management and Data Administration","year":2011,"lang":"en","type":"article","venue":"Journal of Database Management","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":13,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Timeline; Quarter (Canadian coin); Set (abstract data type); Perception; Computer science; Data management; Data science; Subject matter; Subject (documents); Knowledge management; Political science; Data mining; Psychology; Library science; Statistics; Geography","score_opus":0.575305156144148,"score_gpt":0.47376205358806345,"score_spread":0.10154310255608456,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2048988884","genre_codex":"other","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015011676,0.0154986,0.3077877,0.060635827,0.009432076,0.0054739458,0.0133498665,0.007153063,0.56565726],"genre_scores_gemma":[0.3052952,0.026256392,0.30384707,0.030239843,0.009249233,0.0059351646,0.026883865,0.0037326792,0.28856066],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.93846035,0.02220233,0.009677106,0.006877465,0.020834435,0.0019482163],"domain_scores_gemma":[0.84709334,0.046291906,0.012462185,0.050963596,0.0369912,0.006197747],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.037270255,0.0006770629,0.001100068,0.0056274976,0.0034994076,0.019729389,0.002551689,0.001995063,0.042500727],"category_scores_gemma":[0.13313094,0.0007059688,0.0010672783,0.013307587,0.004391948,0.009343109,0.0070024757,0.0034867446,0.037233923],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00019508693,0.00017686075,0.010509303,0.0014475568,0.000114904535,0.0003048161,0.004025739,0.00070445525,0.0024608942,0.21068713,0.20210274,0.5672706],"study_design_scores_gemma":[0.00001433378,0.000046264493,0.002281878,0.00031597324,0.000016960987,0.00026633026,0.0006280365,0.0005159204,0.0011052766,0.015414325,0.97937006,0.000024678844],"about_ca_topic_score_codex":0.0043339087,"about_ca_topic_score_gemma":0.0015093015,"teacher_disagreement_score":0.042500727,"about_ca_system_score_codex":0.0048519718,"about_ca_system_score_gemma":0.019876417,"threshold_uncertainty_score":0.19710636},"labels":[],"label_agreement":null},{"id":"W2056689260","doi":"10.1108/13639511111106641","title":"Evidence‐based solution to information sharing between law enforcement agencies","year":2011,"lang":"en","type":"article","venue":"Policing An International Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":17,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Royal Canadian Mounted Police; University of the Fraser Valley","funders":"","keywords":"Identifier; Law enforcement; Information sharing; Merge (version control); Analytics; Enforcement; Originality; Computer science; Quality (philosophy); Unique identifier; Computer security; Data sharing; Agency (philosophy); Business; Data science; Law; World Wide Web; Political science; Information retrieval; Sociology","score_opus":0.6284452508351284,"score_gpt":0.4890381055243403,"score_spread":0.13940714531078807,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2056689260","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.35219815,0.03877299,0.34829268,0.15863527,0.0047517098,0.015250724,0.0015357172,0.001473852,0.07908875],"genre_scores_gemma":[0.6865317,0.009360442,0.28769204,0.0077026747,0.00068163057,0.0045534917,0.0006219734,0.00006835401,0.002787603],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.7567205,0.16862835,0.021249086,0.008885032,0.04222038,0.002296738],"domain_scores_gemma":[0.44224167,0.38290098,0.063636325,0.046567492,0.060058806,0.0045947735],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.13186173,0.00084103964,0.00086417457,0.006739015,0.0037867345,0.0096082585,0.00750241,0.0051421816,0.009488061],"category_scores_gemma":[0.4503037,0.0009597995,0.0017231872,0.003969041,0.0050627477,0.01265549,0.008522779,0.0035941475,0.0015473069],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001102037,0.0039770543,0.08644798,0.018540015,0.001365009,0.0010198812,0.007683524,0.004867563,0.001213244,0.043232273,0.012455721,0.81809574],"study_design_scores_gemma":[0.005909482,0.030096076,0.089424,0.13055953,0.0061409287,0.0065971855,0.07004852,0.04750089,0.027721206,0.21238713,0.37273413,0.0008808903],"about_ca_topic_score_codex":0.002820214,"about_ca_topic_score_gemma":0.003985566,"teacher_disagreement_score":0.13186173,"about_ca_system_score_codex":0.004834734,"about_ca_system_score_gemma":0.02209798,"threshold_uncertainty_score":0.6973598},"labels":[],"label_agreement":null},{"id":"W2058683286","doi":"10.1109/iccke.2014.6993457","title":"Data accuracy: What does it mean to LOD?","year":2014,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Computer science; Viewpoints; Data quality; Quality (philosophy); Linked data; Semantic Web; Realization (probability); Data mining; Set (abstract data type); Information retrieval; Data set; Data publishing; Data modeling; Open data; Data science; Artificial intelligence; World Wide Web; Publishing; Database; Statistics","score_opus":0.38382522781161926,"score_gpt":0.48710970674891013,"score_spread":0.10328447893729087,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2058683286","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05039817,0.09751094,0.43586487,0.35265416,0.0050766403,0.00026034596,0.002522344,0.001283487,0.054429118],"genre_scores_gemma":[0.7709656,0.033916295,0.1685926,0.013870782,0.0050345636,0.00037989815,0.0015042828,0.0007456639,0.0049904278],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.93743247,0.023903308,0.006195538,0.0037890035,0.026680868,0.0019986858],"domain_scores_gemma":[0.7851045,0.13701977,0.016354712,0.021104306,0.037167132,0.0032495137],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04071789,0.0009144729,0.0019616503,0.010929114,0.002727276,0.017154563,0.0038651624,0.0056572626,0.0025751144],"category_scores_gemma":[0.22107337,0.0007611448,0.0014418407,0.015463407,0.014014244,0.038337756,0.008258247,0.00498166,0.0009945717],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002081476,0.00012857387,0.060248177,0.002803876,0.0004883079,0.00021356807,0.0064591817,0.008576748,0.0008532708,0.55306435,0.0316552,0.33530062],"study_design_scores_gemma":[0.000051234158,0.00015034335,0.018317394,0.0038586834,0.00034919693,0.0009380647,0.008961954,0.0146164615,0.0025588293,0.75565827,0.19432731,0.00021215402],"about_ca_topic_score_codex":0.008039836,"about_ca_topic_score_gemma":0.0033358715,"teacher_disagreement_score":0.04071789,"about_ca_system_score_codex":0.006342301,"about_ca_system_score_gemma":0.003493775,"threshold_uncertainty_score":0.2153393},"labels":[],"label_agreement":null},{"id":"W2060060279","doi":"10.1109/mesoca.2014.13","title":"Prison Break: A Generic Schema Matching Solution to the Cloud Vendor Lock-in Problem","year":2014,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Cloud computing; Computer science; Vendor; Schema (genetic algorithms); Schema matching; Schema migration; Porting; Prison; Star schema; Artificial intelligence; World Wide Web; Information retrieval; Database; Programming language; Database schema; Operating system; Data integration; Semi-structured model; Software","score_opus":0.11157983450787211,"score_gpt":0.3718781701238266,"score_spread":0.2602983356159545,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2060060279","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015325666,0.0003080211,0.9710783,0.00089216535,0.00008043352,0.00035989613,0.00075114495,0.009328793,0.0018755768],"genre_scores_gemma":[0.07595882,0.0001915881,0.91895187,0.000444709,0.000025765054,0.00012775134,0.0018958008,0.00088233536,0.0015212964],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99171525,0.0022753153,0.001084091,0.0017695231,0.0026749726,0.00048074944],"domain_scores_gemma":[0.9826287,0.0034569777,0.0016386173,0.009627671,0.0022434525,0.0004046032],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008686528,0.0011146708,0.0012695875,0.0036631585,0.0021442447,0.0034273216,0.0057759043,0.0030546288,0.0045365533],"category_scores_gemma":[0.027462807,0.00134868,0.003276039,0.0052325707,0.0020299146,0.008502053,0.009852684,0.00319338,0.0014324493],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007518529,0.0006421553,0.014331859,0.0013369665,0.0007465941,0.0012190818,0.003228898,0.057624854,0.020376673,0.119299024,0.04744462,0.7329974],"study_design_scores_gemma":[0.00032605097,0.0003588911,0.0035029752,0.00037086313,0.00038865345,0.0026875408,0.002188154,0.6453757,0.036521208,0.18490852,0.12316394,0.00020746159],"about_ca_topic_score_codex":0.009160983,"about_ca_topic_score_gemma":0.0115094185,"teacher_disagreement_score":0.009160983,"about_ca_system_score_codex":0.0018958234,"about_ca_system_score_gemma":0.0050525335,"threshold_uncertainty_score":0.045939326},"labels":[],"label_agreement":null},{"id":"W2062133553","doi":"10.2218/ijdc.v7i2.227","title":"Digital Forensics Formats: Seeking a Digital Preservation Storage Container Format for Web Archiving","year":2012,"lang":"en","type":"article","venue":"International Journal of Digital Curation","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"European Commission","keywords":"Computer science; Container (type theory); File format; Digital forensics; Digital preservation; Image file formats; Database; World Wide Web; Point (geometry); File system; Information retrieval; Operating system; Engineering","score_opus":0.12336317467511576,"score_gpt":0.3905250777087929,"score_spread":0.26716190303367715,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2062133553","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.2952585,0.0024616714,0.6102983,0.006378303,0.00062811264,0.0034002487,0.004636802,0.0056996443,0.07123853],"genre_scores_gemma":[0.31308085,0.0013613391,0.67361534,0.00062933186,0.00018229982,0.00097421807,0.003152175,0.0009890691,0.00601547],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99224806,0.0026392513,0.0010376077,0.00049582263,0.0031344728,0.00044487067],"domain_scores_gemma":[0.97441804,0.0063884323,0.0027468787,0.0069192383,0.008649086,0.00087834924],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.017635373,0.00069751375,0.0006126582,0.006828973,0.002336365,0.010201002,0.0022370024,0.0012159866,0.006384517],"category_scores_gemma":[0.039140977,0.00039195883,0.0008461673,0.0067435876,0.0023563907,0.013816828,0.004315493,0.0015342035,0.0017112137],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001330871,0.0006094558,0.03253885,0.0013226945,0.00009028323,0.00081315305,0.007705143,0.007713988,0.020418316,0.21907401,0.025268609,0.68311465],"study_design_scores_gemma":[0.00033492697,0.0028414447,0.04879682,0.0036013157,0.00035069228,0.0051329443,0.035576522,0.06540268,0.19924033,0.13284218,0.505121,0.0007592304],"about_ca_topic_score_codex":0.0025577804,"about_ca_topic_score_gemma":0.0024758372,"teacher_disagreement_score":0.017635373,"about_ca_system_score_codex":0.0029869883,"about_ca_system_score_gemma":0.003219687,"threshold_uncertainty_score":0.09326589},"labels":[],"label_agreement":null},{"id":"W2068713655","doi":"10.3138/m457-6736-3l06-160p","title":"On-line Reporting and Mapping of Spatially Aggregated Individual Records Selected by User Queries","year":2004,"lang":"en","type":"article","venue":"Cartographica The International Journal for Geographic Information and Geovisualization","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Confidentiality; Computer science; Table (database); Public access; Profiling (computer programming); Database; World Wide Web; Computer security; Internet privacy; Information retrieval","score_opus":0.06447403285041445,"score_gpt":0.36770500764816144,"score_spread":0.30323097479774697,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2068713655","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.2152923,0.0005938502,0.58424246,0.0016733205,0.00032161415,0.005759596,0.017514234,0.12293077,0.05167195],"genre_scores_gemma":[0.62932473,0.0006354014,0.32421154,0.00046673842,0.00032212582,0.0023667584,0.0177155,0.0028105334,0.022146592],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9899095,0.0043433043,0.0010808031,0.0011930268,0.0030779615,0.00039535036],"domain_scores_gemma":[0.96040463,0.016488686,0.003278274,0.012832368,0.005954865,0.0010412527],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008654378,0.000943208,0.0010141593,0.005127909,0.0010304075,0.003860645,0.0016877587,0.0008952624,0.011632259],"category_scores_gemma":[0.025677972,0.0005156214,0.00046538093,0.0039473767,0.00050515746,0.0026445466,0.0023703508,0.0006256266,0.0056103133],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0018666962,0.0010373166,0.06898394,0.0005841905,0.0002111359,0.0011110139,0.0065270117,0.009567233,0.02786508,0.0058691674,0.09105376,0.78532344],"study_design_scores_gemma":[0.0006484271,0.0017036621,0.11409411,0.0005587185,0.00031670663,0.0020237383,0.009733515,0.31863636,0.1415378,0.012037079,0.398068,0.0006419664],"about_ca_topic_score_codex":0.0065664453,"about_ca_topic_score_gemma":0.004800096,"teacher_disagreement_score":0.011632259,"about_ca_system_score_codex":0.0008072359,"about_ca_system_score_gemma":0.0013908109,"threshold_uncertainty_score":0.045769215},"labels":[],"label_agreement":null},{"id":"W2070702247","doi":"10.1145/1328964.1328967","title":"Meeting of the MINDS","year":2007,"lang":"en","type":"article","venue":"ACM SIGIR Forum","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":76,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Field (mathematics); Key (lock); Space (punctuation); Probabilistic logic; Vector space model; Work (physics); Development (topology); Data science; World Wide Web; Information retrieval; Artificial intelligence","score_opus":0.12089356568520415,"score_gpt":0.4059370702158174,"score_spread":0.2850435045306132,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2070702247","genre_codex":"commentary","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009630064,0.037664488,0.006613737,0.5631464,0.032249905,0.000048894904,0.00026501497,0.00034638005,0.35003498],"genre_scores_gemma":[0.19981116,0.02322045,0.0068527805,0.2708757,0.017599229,0.00015923257,0.0004270778,0.00051684404,0.48053756],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9960096,0.0013823599,0.0001392014,0.0008190825,0.0010916413,0.00055814587],"domain_scores_gemma":[0.99504197,0.0008732871,0.00023635564,0.00046778965,0.0009855039,0.0023950362],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0032964526,0.0010071411,0.0008087241,0.0011857745,0.0062193293,0.009502744,0.0010590103,0.0044003217,0.0435963],"category_scores_gemma":[0.011982577,0.00029589588,0.00061891397,0.00064260035,0.008467154,0.0069485353,0.008048774,0.009997899,0.019013433],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000121064375,0.000061482,0.0013922729,0.00018665109,0.0000465771,0.0003035326,0.0119575625,0.00012756242,0.0015947637,0.16754201,0.7188264,0.097840145],"study_design_scores_gemma":[0.000006013919,0.000022362006,0.00037552207,0.00013951871,0.000004518277,0.00025217,0.0026293583,0.000056888624,0.00008287815,0.022844475,0.97357154,0.000014699429],"about_ca_topic_score_codex":0.0024257102,"about_ca_topic_score_gemma":0.002895963,"teacher_disagreement_score":0.0435963,"about_ca_system_score_codex":0.003079772,"about_ca_system_score_gemma":0.0034579393,"threshold_uncertainty_score":0.14584416},"labels":[],"label_agreement":null},{"id":"W2074916233","doi":"10.4067/s0718-18762014000200006","title":"A Metrics-Driven Approach for Quality Assessment of Linked Open Data","year":2014,"lang":"en","type":"article","venue":"Journal of theoretical and applied electronic commerce research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":64,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Computer science; Data quality; Data mining; Quality (philosophy); Consistency (knowledge bases); Set (abstract data type); Completeness (order theory); Cloud computing; Linked data; Metric (unit); Data science; Information retrieval; Semantic Web; Artificial intelligence","score_opus":0.4695965841699453,"score_gpt":0.5772331107280245,"score_spread":0.1076365265580792,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2074916233","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0068174526,0.00036916093,0.9878257,0.0010601257,0.00006012735,0.00068563974,0.0004757953,0.0004121584,0.002293866],"genre_scores_gemma":[0.115492836,0.00027545955,0.8814005,0.0001400607,0.00005416599,0.0011830431,0.00090172794,0.00013186967,0.00042032817],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.89461344,0.048002638,0.011571577,0.005112952,0.03940049,0.001298955],"domain_scores_gemma":[0.84590703,0.060897525,0.019451484,0.020685233,0.050506398,0.0025522334],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.066680685,0.0022592442,0.0019238392,0.02429179,0.002625686,0.012253891,0.004391686,0.002592107,0.0011771113],"category_scores_gemma":[0.18363334,0.0009864795,0.0024036842,0.018497718,0.0038968765,0.01023656,0.006674715,0.003716073,0.00046678356],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001626942,0.0005287484,0.02786887,0.0017682796,0.00060737506,0.0004259258,0.0035219314,0.079205275,0.007524385,0.6087283,0.0057198796,0.26393846],"study_design_scores_gemma":[0.000052787367,0.00059701287,0.010152691,0.0010918302,0.00019858104,0.00061827345,0.0023647135,0.5121459,0.01328185,0.42387924,0.035317726,0.00029934983],"about_ca_topic_score_codex":0.005027438,"about_ca_topic_score_gemma":0.0051307124,"teacher_disagreement_score":0.066680685,"about_ca_system_score_codex":0.008790975,"about_ca_system_score_gemma":0.008384821,"threshold_uncertainty_score":0.3526454},"labels":[],"label_agreement":null},{"id":"W2080549944","doi":"10.1145/1394251.1394257","title":"Advances in information and knowledge management","year":2008,"lang":"en","type":"article","venue":"ACM SIGIR Forum","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"Universidade de Lisboa; Pennsylvania State University","keywords":"Computer science; Data science; Knowledge extraction; Data management; Personal information management; XML; Digital library; World Wide Web; Information management; Information extraction; Knowledge management; Information system; Information retrieval; Management information systems; Database; Data mining","score_opus":0.07697138455936814,"score_gpt":0.3808004260670133,"score_spread":0.30382904150764517,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2080549944","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0042740274,0.49282628,0.13955747,0.114002064,0.0074374876,0.00013559114,0.00062582194,0.0006495241,0.24049176],"genre_scores_gemma":[0.13568561,0.6008281,0.16969472,0.015061072,0.024204012,0.00031211894,0.0013251809,0.00029045195,0.05259877],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9919459,0.002353255,0.0006406945,0.0010837353,0.0036052559,0.00037113667],"domain_scores_gemma":[0.97947854,0.012069859,0.0009363525,0.003299376,0.003266736,0.0009491253],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009750965,0.0009853438,0.0014535735,0.0049605924,0.0017954193,0.012280058,0.0030289434,0.0035786326,0.013614379],"category_scores_gemma":[0.019749573,0.00057537487,0.00096857833,0.008954282,0.006614923,0.023895573,0.0058767437,0.005031251,0.0061615184],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000030924337,0.000049400925,0.00042289266,0.0012765485,0.000050853916,0.0000942893,0.00070979755,0.0007521433,0.00030004643,0.6823932,0.044526093,0.2693938],"study_design_scores_gemma":[0.000008650321,0.000020215712,0.0002412096,0.00053929497,0.00001704725,0.0001481658,0.00036079463,0.0012795056,0.00021273641,0.38773862,0.60941184,0.00002197186],"about_ca_topic_score_codex":0.0022730085,"about_ca_topic_score_gemma":0.0017035519,"teacher_disagreement_score":0.013614379,"about_ca_system_score_codex":0.0042697038,"about_ca_system_score_gemma":0.0052418746,"threshold_uncertainty_score":0.051568627},"labels":[],"label_agreement":null},{"id":"W2083200098","doi":"10.6017/ital.v33i2.5341","title":"The Importance of Identifying and Accommodating E-Resource Usage Data for the Presence of Outliers. The Negative Impacts of Inaccurate E-Journal Usage Data.","year":2014,"lang":"en","type":"article","venue":"Information Technology and Libraries","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Laurentian University","funders":"","keywords":"Outlier; Upload; Computer science; Identification (biology); Sample (material); Usage data; Resource (disambiguation); Data mining; Statistics; Data science; Information retrieval; World Wide Web; Mathematics; Artificial intelligence","score_opus":0.13256765051236072,"score_gpt":0.3760560784491905,"score_spread":0.24348842793682976,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2083200098","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7562932,0.00333163,0.18568547,0.02205297,0.0008339173,0.0009886622,0.0034071023,0.0010396704,0.026367344],"genre_scores_gemma":[0.9517713,0.000488651,0.044306636,0.0011179756,0.00023444525,0.00018039305,0.0008021205,0.000114626746,0.0009838302],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.93719673,0.029844481,0.004801289,0.002962765,0.024275849,0.0009188588],"domain_scores_gemma":[0.61198086,0.26538503,0.05739404,0.021507705,0.041330554,0.0024017703],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.04020494,0.0004909662,0.0006475149,0.0033257122,0.0015035084,0.004875871,0.00096676487,0.0012483794,0.0013103224],"category_scores_gemma":[0.2542506,0.00037159742,0.000722846,0.0042456533,0.0022243254,0.0046182396,0.0019121434,0.0017804939,0.00087546394],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00045971468,0.0003273095,0.64456975,0.0008906881,0.00042324007,0.000485667,0.0056029554,0.008953154,0.005732096,0.0072365524,0.010724847,0.31459403],"study_design_scores_gemma":[0.00003945339,0.0009953694,0.8766519,0.0009067048,0.00025828395,0.0013573089,0.014231057,0.033209775,0.011755759,0.027485684,0.032761153,0.00034754712],"about_ca_topic_score_codex":0.006007868,"about_ca_topic_score_gemma":0.007950366,"teacher_disagreement_score":0.9951241,"about_ca_system_score_codex":0.0015503088,"about_ca_system_score_gemma":0.0044034477,"threshold_uncertainty_score":0.21262658},"labels":[],"label_agreement":null},{"id":"W2083947418","doi":"10.1504/ijiq.2014.068653","title":"Repairing integrity rules for improved data quality","year":2014,"lang":"en","type":"article","venue":"International Journal of Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Computer science; Data integrity; Constraint (computer-aided design); Data quality; Data mining; Data cleansing; Quality (philosophy); Set (abstract data type); Business rule; Domain (mathematical analysis); Data science; Business process; Database; Work in process","score_opus":0.37274437675812616,"score_gpt":0.5310786126391739,"score_spread":0.15833423588104772,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2083947418","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.034287028,0.00088366086,0.95241094,0.0023287626,0.0001654181,0.0007506402,0.0012457586,0.0056988667,0.0022289795],"genre_scores_gemma":[0.09732234,0.00038991743,0.89805466,0.00041384163,0.00007213607,0.00019536026,0.002048191,0.0006703592,0.00083330186],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9556271,0.012067119,0.0076011117,0.005002197,0.018275257,0.0014273883],"domain_scores_gemma":[0.76429087,0.08962894,0.030446876,0.08166741,0.032114536,0.0018514015],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.036266625,0.0016245975,0.0022696157,0.007318707,0.0025570807,0.007281277,0.0053710267,0.0024122165,0.0031075603],"category_scores_gemma":[0.19351073,0.0014719323,0.0028721837,0.0076403217,0.0027248843,0.010225479,0.007057748,0.0046556494,0.0011851094],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004806851,0.0006789713,0.042080063,0.0021898493,0.00069530663,0.001661345,0.005999249,0.10630976,0.028788222,0.04676764,0.02040799,0.7439409],"study_design_scores_gemma":[0.0002282833,0.00054970675,0.0127915405,0.0012458719,0.00079863344,0.003041333,0.0035616904,0.62060744,0.121577375,0.1291089,0.10606794,0.00042124654],"about_ca_topic_score_codex":0.008691045,"about_ca_topic_score_gemma":0.009836439,"teacher_disagreement_score":0.036266625,"about_ca_system_score_codex":0.0020949864,"about_ca_system_score_gemma":0.008291084,"threshold_uncertainty_score":0.19179851},"labels":[],"label_agreement":null},{"id":"W2087155295","doi":"10.1007/978-1-4419-1325-8_6","title":"Identity Management Architecture","year":2009,"lang":"en","type":"book-chapter","venue":"Annals of information systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":30,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Identity management; Identity (music); Interoperability; Computer science; Knowledge management; Variety (cybernetics); Homeland security; Key (lock); Government (linguistics); Computer security; World Wide Web; Political science; Authentication (law); Artificial intelligence; Linguistics","score_opus":0.19661352234585502,"score_gpt":0.40444497690502096,"score_spread":0.20783145455916593,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2087155295","genre_codex":"other","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005649019,0.0019212728,0.4701465,0.0053247996,0.0006576363,0.00021372254,0.00034889282,0.0030858777,0.5126523],"genre_scores_gemma":[0.16342174,0.004332204,0.345133,0.0014885691,0.00043368686,0.0003830852,0.0017316681,0.0007579888,0.48231807],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.998863,0.00026746915,0.00007128686,0.00022514873,0.00043008046,0.00014299522],"domain_scores_gemma":[0.9994387,0.00008846229,0.000022777394,0.00021934941,0.0001785611,0.000052104773],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0013049882,0.00062126224,0.00040727676,0.0013188048,0.002203221,0.0079530515,0.0016028793,0.0015658947,0.022300206],"category_scores_gemma":[0.0020196424,0.00056681246,0.00052928017,0.0019010812,0.0019660147,0.0075096143,0.0028723355,0.0023390483,0.010428859],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00000802191,0.000022056058,0.000108374516,0.000027213007,0.000004815297,0.000028819872,0.00021699464,0.0009422196,0.00046095136,0.92720026,0.01637482,0.05460544],"study_design_scores_gemma":[0.000007084976,0.000015727224,0.00019770135,0.00009461016,0.000016446424,0.00017328371,0.00024792884,0.014412251,0.001620073,0.50099325,0.482205,0.00001668561],"about_ca_topic_score_codex":0.0059370687,"about_ca_topic_score_gemma":0.005667226,"teacher_disagreement_score":0.022300206,"about_ca_system_score_codex":0.0027396532,"about_ca_system_score_gemma":0.003055916,"threshold_uncertainty_score":0.07460165},"labels":[],"label_agreement":null},{"id":"W2092295977","doi":"10.1145/2335484.2335520","title":"Solving manufacturing equipment monitoring through efficient complex event processing","year":2012,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Complex event processing; Computer science; Event (particle physics); Visualization; Latency (audio); Key (lock); Real-time computing; Throughput; Distributed computing; Data mining; Operating system","score_opus":0.3285297737278659,"score_gpt":0.458375936229109,"score_spread":0.1298461625012431,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2092295977","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.016056504,0.0000885084,0.9808292,0.00009797865,0.000015829219,0.00007931618,0.00008754527,0.002223488,0.000521669],"genre_scores_gemma":[0.46307635,0.000249457,0.5347867,0.000077795106,0.000075680124,0.00016217436,0.000477035,0.0001417828,0.0009529457],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99870217,0.0002519712,0.00010549582,0.0003460908,0.0004907118,0.00010355682],"domain_scores_gemma":[0.99826956,0.0009910872,0.00019513689,0.00028103436,0.00020043693,0.00006270916],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009899999,0.0011853046,0.0010732302,0.0006622321,0.0005970994,0.0018286227,0.0017512226,0.00079584133,0.0019753624],"category_scores_gemma":[0.0031061824,0.00040982035,0.000520238,0.00090060756,0.00040985591,0.0018685298,0.0010554318,0.0009189865,0.00045640182],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010664625,0.0005866641,0.0051534967,0.0006039986,0.0002118692,0.0007197603,0.00050889724,0.45654583,0.11742205,0.011078249,0.0065779905,0.39952472],"study_design_scores_gemma":[0.00004426135,0.00007908911,0.00075498637,0.00000631937,0.000024020637,0.00009315233,0.00006627644,0.97596675,0.016487392,0.004546605,0.0019145564,0.00001664826],"about_ca_topic_score_codex":0.0021574793,"about_ca_topic_score_gemma":0.0020043717,"teacher_disagreement_score":0.0021574793,"about_ca_system_score_codex":0.00038284936,"about_ca_system_score_gemma":0.0008031651,"threshold_uncertainty_score":0.0066082478},"labels":[],"label_agreement":null},{"id":"W2093594738","doi":"10.7152/acro.v24i1.14671","title":"Veracity Roadmap: Is Big Data Objective, Truthful and Credible?","year":2014,"lang":"en","type":"article","venue":"Advances in Classification Research Online","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":227,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Big data; Computer science; Data science; Operationalization; Objectivity (philosophy); Credibility; Data quality; Variety (cybernetics); Quality (philosophy); Data mining; Artificial intelligence","score_opus":0.68969663109607,"score_gpt":0.5918893972658551,"score_spread":0.09780723383021495,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2093594738","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10265563,0.01987519,0.493271,0.19549827,0.0021089383,0.00072365237,0.0022381688,0.00077841413,0.18285078],"genre_scores_gemma":[0.9462807,0.004690539,0.03987841,0.0043402044,0.0015902757,0.00043997468,0.00068313984,0.00020889181,0.0018878365],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.949641,0.023929631,0.0036747484,0.004482852,0.016468035,0.0018036886],"domain_scores_gemma":[0.6923213,0.22136669,0.031898703,0.022451133,0.02681964,0.0051425616],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.046317104,0.0012089119,0.0016678157,0.012605586,0.00441306,0.030115683,0.0025993972,0.0052064434,0.0053181397],"category_scores_gemma":[0.2572122,0.00081099605,0.0011956727,0.012537893,0.032732308,0.04978429,0.014091106,0.008584317,0.00084990426],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001259715,0.00005630888,0.017229524,0.0007815668,0.00012178144,0.00021858363,0.0062146746,0.0048376885,0.00028187837,0.87021166,0.007019268,0.09290109],"study_design_scores_gemma":[0.000012220028,0.000036770154,0.003069595,0.0008015738,0.000033321645,0.00016487743,0.0030227618,0.008136479,0.00035744085,0.9677425,0.016554715,0.00006776411],"about_ca_topic_score_codex":0.002142097,"about_ca_topic_score_gemma":0.0011029217,"teacher_disagreement_score":0.9536829,"about_ca_system_score_codex":0.0063147657,"about_ca_system_score_gemma":0.006239479,"threshold_uncertainty_score":0.24495119},"labels":[],"label_agreement":null},{"id":"W2100287013","doi":"10.5267/j.msl.2012.07.007","title":"A new approach to measure believability dimension of data quality","year":2012,"lang":"en","type":"article","venue":"Management Science Letters","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Measure (data warehouse); Dimension (graph theory); Computer science; Quality (philosophy); Psychology; Statistics; Data mining; Mathematics","score_opus":0.38560542171465445,"score_gpt":0.44313896161605776,"score_spread":0.05753353990140331,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2100287013","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07649585,0.002303776,0.8807958,0.002608849,0.00041163724,0.0009295503,0.0015281889,0.0005740168,0.034352444],"genre_scores_gemma":[0.5801901,0.0011759414,0.4121347,0.0005997263,0.00033328298,0.0016985172,0.0011574732,0.00009465775,0.0026155342],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.97520953,0.008308713,0.0028538578,0.002708025,0.010281627,0.0006382622],"domain_scores_gemma":[0.9437459,0.03138949,0.0072928756,0.0050858273,0.011296521,0.0011893047],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.014766914,0.0012631177,0.00096600165,0.013642449,0.0013553979,0.0057654707,0.0018247442,0.0017419262,0.0038213674],"category_scores_gemma":[0.05395319,0.00039408542,0.0019524114,0.009569107,0.0035241684,0.0091021815,0.0044101197,0.0031639438,0.0004984943],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00033895244,0.00073694385,0.124781236,0.0016730054,0.0011818486,0.0004596191,0.010474494,0.01535477,0.0075604585,0.44021326,0.008108428,0.38911697],"study_design_scores_gemma":[0.00018502274,0.0011878996,0.1319189,0.0013790927,0.0007150805,0.0016764855,0.009294842,0.19141422,0.012269981,0.5855756,0.06353459,0.00084827456],"about_ca_topic_score_codex":0.0017422023,"about_ca_topic_score_gemma":0.0014845789,"teacher_disagreement_score":0.014766914,"about_ca_system_score_codex":0.0031913316,"about_ca_system_score_gemma":0.0018790441,"threshold_uncertainty_score":0.07809585},"labels":[],"label_agreement":null},{"id":"W2100680488","doi":"10.1109/ic2e.2014.15","title":"Analytics-as-a-Service (AaaS) Tool for Unstructured Data Mining","year":2014,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Saskatchewan","funders":"","keywords":"NoSQL; Computer science; Unstructured data; Data warehouse; Big data; Schema (genetic algorithms); Analytics; Standardization; Data science; Service (business); Database; Data mining; Information retrieval","score_opus":0.36105620000405164,"score_gpt":0.46441128180952956,"score_spread":0.10335508180547792,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2100680488","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0030207252,0.00015364248,0.93206495,0.0005951642,0.000109965134,0.00030331727,0.0015584641,0.059196584,0.0029971306],"genre_scores_gemma":[0.080527596,0.000314783,0.90820724,0.00053771806,0.00010842597,0.00039498977,0.005052471,0.0018086082,0.0030481997],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9968845,0.00084111356,0.0004994157,0.00039346667,0.0011718207,0.00020965825],"domain_scores_gemma":[0.99303174,0.0032983248,0.00052583794,0.0016243998,0.0009185937,0.0006010982],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005593422,0.001237885,0.0009942031,0.0040336996,0.0014668844,0.00401273,0.002630932,0.0015760005,0.0060173296],"category_scores_gemma":[0.011304013,0.00068766664,0.0016067482,0.0034241292,0.0012169356,0.0047437544,0.0047399756,0.0024080079,0.0039296956],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013789762,0.00071417063,0.0101283835,0.0016436932,0.000481865,0.0021287631,0.0029796553,0.03444974,0.02671333,0.2555654,0.15237781,0.51143825],"study_design_scores_gemma":[0.0001421269,0.00016689325,0.0016371231,0.00027653814,0.00009362531,0.0007609203,0.0006728851,0.5979896,0.02000192,0.15811628,0.21997663,0.00016547022],"about_ca_topic_score_codex":0.0035345173,"about_ca_topic_score_gemma":0.0035226853,"teacher_disagreement_score":0.0060173296,"about_ca_system_score_codex":0.0009880376,"about_ca_system_score_gemma":0.0030300827,"threshold_uncertainty_score":0.02958119},"labels":[],"label_agreement":null},{"id":"W2103884285","doi":"10.1109/icdmw.2009.116","title":"LNBC: A Link-Based Naive Bayes Classifier","year":2009,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; Naive Bayes classifier; Artificial intelligence; Classifier (UML); Object (grammar); Data mining; Class (philosophy); Machine learning; Relational database; Link (geometry); Pattern recognition (psychology); Support vector machine","score_opus":0.23947869679751588,"score_gpt":0.443369581860508,"score_spread":0.20389088506299213,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2103884285","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012794029,0.003722444,0.9587579,0.0016065338,0.0007545663,0.0007432699,0.0033548737,0.010220811,0.008045648],"genre_scores_gemma":[0.1618197,0.0012811064,0.8140523,0.001671422,0.0010002743,0.0012132737,0.007640161,0.0004843237,0.010837453],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9951108,0.0015199999,0.00045010497,0.00083358097,0.0018328431,0.0002525928],"domain_scores_gemma":[0.99195534,0.0038507585,0.00032638494,0.0007947949,0.002885539,0.00018724451],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0052083996,0.0015704174,0.002590845,0.0045838747,0.0017202048,0.0026862845,0.0050558876,0.002811237,0.008916073],"category_scores_gemma":[0.020552495,0.0008024635,0.001071762,0.0031075324,0.0007113466,0.0038903554,0.0013708619,0.0028878066,0.007226579],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00047436953,0.00029116563,0.005163708,0.00035656057,0.00024062674,0.00017008292,0.00008441375,0.048318103,0.0015558666,0.006748201,0.046673086,0.88992375],"study_design_scores_gemma":[0.00018089254,0.00013216116,0.0009799437,0.00016393088,0.00017914177,0.00028546597,0.000057676956,0.9512426,0.0036943294,0.023727754,0.019288208,0.00006785444],"about_ca_topic_score_codex":0.026376767,"about_ca_topic_score_gemma":0.025789166,"teacher_disagreement_score":0.026376767,"about_ca_system_score_codex":0.002039083,"about_ca_system_score_gemma":0.0031521807,"threshold_uncertainty_score":0.052446425},"labels":[],"label_agreement":null},{"id":"W2104345001","doi":"10.1109/icif.2010.5711858","title":"Measures of effectiveness for high-level fusion","year":2010,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":106,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Defence Research and Development Canada","funders":"","keywords":"Robustness (evolution); Sensor fusion; Computer science; Situation awareness; Workload; Data collection; Reliability engineering; Data mining; Engineering; Artificial intelligence","score_opus":0.36313919370976094,"score_gpt":0.4469914579324498,"score_spread":0.08385226422268888,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2104345001","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.26075107,0.0065955296,0.6505382,0.0020261204,0.00039721452,0.00070135534,0.002433653,0.0014426888,0.07511421],"genre_scores_gemma":[0.8913282,0.00060050515,0.10433502,0.0002236343,0.00022119272,0.00035560486,0.00086167577,0.00012551209,0.0019486125],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9798068,0.006402612,0.0018215313,0.0013670204,0.009841561,0.0007605633],"domain_scores_gemma":[0.9325081,0.041713025,0.009865327,0.0067493506,0.008056584,0.0011075533],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01631566,0.0011782191,0.001193501,0.006873614,0.00071322755,0.0027854338,0.0008377315,0.0015995471,0.0031421878],"category_scores_gemma":[0.05595988,0.00022060995,0.0009782047,0.0031203052,0.0019981356,0.0039256527,0.0016718905,0.0011151078,0.0008328759],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013626796,0.000995246,0.12749836,0.0022951588,0.0018719094,0.0003263107,0.001296018,0.13252418,0.032772627,0.1942644,0.01064454,0.49414858],"study_design_scores_gemma":[0.0001617098,0.0042954944,0.25217378,0.00085610023,0.0012022428,0.0020254976,0.0030651314,0.3584449,0.0819417,0.2341586,0.061108872,0.0005659734],"about_ca_topic_score_codex":0.0005607738,"about_ca_topic_score_gemma":0.0006106799,"teacher_disagreement_score":0.01631566,"about_ca_system_score_codex":0.0014707547,"about_ca_system_score_gemma":0.00071971025,"threshold_uncertainty_score":0.086286485},"labels":[],"label_agreement":null},{"id":"W2107080109","doi":"10.14778/1454159.1454220","title":"A revival of integrity constraints for data cleaning","year":2008,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":46,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Bell (Canada)","funders":"Engineering and Physical Sciences Research Council","keywords":"Data integrity; Data quality; Computer science; Schema (genetic algorithms); Constraint (computer-aided design); Quality (philosophy); Risk analysis (engineering); Data science; Reliability engineering; Database; Information retrieval; Engineering; Operations management; Business; Mechanical engineering","score_opus":0.5397355688626213,"score_gpt":0.44987919658589165,"score_spread":0.08985637227672966,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2107080109","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0028282902,0.059265207,0.85972196,0.06505173,0.0032052407,0.00015165594,0.0007679772,0.0013773808,0.00763064],"genre_scores_gemma":[0.043935392,0.06594352,0.85882187,0.016313056,0.0062478227,0.0003991133,0.0016955896,0.0013918923,0.0052517345],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.93170804,0.025560662,0.005733217,0.006661665,0.028900038,0.001436318],"domain_scores_gemma":[0.83203167,0.092304304,0.0042348388,0.038077638,0.030883353,0.0024682283],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.065244034,0.00179881,0.003985106,0.0050329464,0.0039150766,0.013957338,0.0066970685,0.00608074,0.0045444933],"category_scores_gemma":[0.12633197,0.0021328705,0.003984455,0.010329834,0.010513643,0.036313187,0.012042548,0.023949435,0.0033579536],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018272456,0.000087703396,0.00088136556,0.0023553038,0.00026993558,0.00027440005,0.0014259241,0.0045965808,0.003450118,0.5161628,0.07784501,0.3924681],"study_design_scores_gemma":[0.00005291304,0.00009399231,0.00064633146,0.0012785398,0.00010344193,0.00087841623,0.0006140263,0.023695828,0.0070726722,0.43662885,0.52874213,0.00019278127],"about_ca_topic_score_codex":0.004303015,"about_ca_topic_score_gemma":0.00280382,"teacher_disagreement_score":0.065244034,"about_ca_system_score_codex":0.0058094407,"about_ca_system_score_gemma":0.0069112014,"threshold_uncertainty_score":0.34504753},"labels":[],"label_agreement":null},{"id":"W2108075439","doi":"","title":"Approximate joins: concepts and techniques","year":2005,"lang":"en","type":"article","venue":"Very Large Data Bases","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":29,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Joins; Multitude; Computer science; Database; Quality (philosophy); Data quality; Character (mathematics); Service (business); Relational database; Missing data; Data science; Data mining; World Wide Web; Business; Marketing","score_opus":0.2365840025725053,"score_gpt":0.4607702635409333,"score_spread":0.224186260968428,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2108075439","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0026884517,0.010040408,0.9739386,0.00075435895,0.00026033336,0.000109252695,0.0003528027,0.0007315455,0.011124185],"genre_scores_gemma":[0.09598676,0.016111223,0.8736335,0.00069232815,0.0020302222,0.00049263315,0.0013824686,0.0004471985,0.009223702],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9927654,0.0016660726,0.0006580524,0.0014117584,0.003171111,0.00032763864],"domain_scores_gemma":[0.99400604,0.0031927156,0.0005770659,0.0012163812,0.000822228,0.0001855755],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0060401033,0.0013723798,0.0017882354,0.0055304132,0.0020785113,0.007529389,0.004463063,0.0021236117,0.007152562],"category_scores_gemma":[0.014311964,0.0013455267,0.0020865074,0.01196514,0.003817465,0.0141124325,0.006193004,0.0039420747,0.0038183809],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000082302715,0.000057099416,0.0006265952,0.0005938731,0.00009858916,0.00015687889,0.0006541516,0.011403973,0.0007031186,0.8232879,0.011162531,0.15117304],"study_design_scores_gemma":[0.000019219538,0.000044858672,0.00019723272,0.00013402534,0.000051671865,0.00046390796,0.0001446096,0.02946806,0.00071584183,0.9121346,0.05660031,0.00002572359],"about_ca_topic_score_codex":0.0018656141,"about_ca_topic_score_gemma":0.0010323875,"teacher_disagreement_score":0.007529389,"about_ca_system_score_codex":0.0016497046,"about_ca_system_score_gemma":0.0016040823,"threshold_uncertainty_score":0.03194344},"labels":[],"label_agreement":null},{"id":"W2110848713","doi":"","title":"Linked Movie Data Base","year":2009,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":93,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"RDF; Linked data; Computer science; Metadata; World Wide Web; Database; Cloud computing; Information retrieval; Semantic Web","score_opus":0.5971839626278773,"score_gpt":0.5128323344859844,"score_spread":0.0843516281418929,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2110848713","genre_codex":"dataset","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0022910158,0.0006623221,0.022184102,0.0006333678,0.00029191392,0.0005465515,0.9269494,0.01420679,0.032234646],"genre_scores_gemma":[0.0054073106,0.000441893,0.01719744,0.00016614424,0.00005174465,0.00033178405,0.9719924,0.00058591075,0.0038254454],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9974771,0.00024377444,0.0003898303,0.00053796475,0.0011762407,0.00017506583],"domain_scores_gemma":[0.99421245,0.0008623293,0.00032867645,0.0018905927,0.0023050383,0.00040092782],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0022795473,0.0011352228,0.0013164375,0.0091726985,0.002382304,0.0045429706,0.0032607892,0.0017343112,0.05562624],"category_scores_gemma":[0.011775423,0.0006135073,0.0012343522,0.012163981,0.00048676808,0.004444783,0.0030246945,0.0022718657,0.0545899],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00039190697,0.00021017157,0.0028514166,0.0010295335,0.0001487274,0.00036394098,0.0002212132,0.0033832695,0.0027704535,0.023541637,0.8762167,0.08887093],"study_design_scores_gemma":[0.00009581556,0.000034783705,0.0027185827,0.00017075986,0.000059762267,0.00021412632,0.00014147192,0.006007641,0.0030362231,0.011339512,0.9761103,0.00007105207],"about_ca_topic_score_codex":0.022197219,"about_ca_topic_score_gemma":0.019335503,"teacher_disagreement_score":0.05562624,"about_ca_system_score_codex":0.0016885607,"about_ca_system_score_gemma":0.0041825715,"threshold_uncertainty_score":0.18608832},"labels":[],"label_agreement":null},{"id":"W2111094784","doi":"10.1109/iccit.2008.210","title":"Social Network Analysis on Name Disambiguation and More","year":2008,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Computer science; Disk formatting; String metric; Social network analysis; Information retrieval; Similarity (geometry); String (physics); Correct name; Social network (sociolinguistics); Natural language processing; Graph; World Wide Web; Artificial intelligence; String searching algorithm; Social media; Theoretical computer science; Pattern matching; Mathematics","score_opus":0.21796064294121784,"score_gpt":0.44268466009588664,"score_spread":0.2247240171546688,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2111094784","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.23914091,0.00688582,0.7208585,0.009169876,0.00046108346,0.0003952919,0.003121354,0.0014064135,0.018560767],"genre_scores_gemma":[0.7710302,0.0020326823,0.220265,0.00050687464,0.0004991405,0.00019712294,0.0022169112,0.00019109128,0.0030609816],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9826003,0.009672861,0.0010741397,0.0027646397,0.0035543053,0.00033379276],"domain_scores_gemma":[0.93388134,0.04440994,0.008522058,0.007671461,0.00487535,0.0006397531],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0119765205,0.0011463659,0.0013250016,0.017034294,0.0023917675,0.0051069,0.0018625986,0.0021059858,0.0039411685],"category_scores_gemma":[0.06350293,0.00042160344,0.0010128741,0.014157637,0.0029290093,0.01326179,0.0030765631,0.0010444323,0.0007560844],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006521411,0.00038769192,0.078859664,0.0013645994,0.00065301027,0.00072145864,0.0028133055,0.09989691,0.0055757933,0.1715251,0.016294476,0.6212559],"study_design_scores_gemma":[0.00006256446,0.00015855649,0.0300368,0.00029579652,0.00024422642,0.0007220625,0.002230343,0.6487479,0.009564059,0.28119195,0.026572369,0.0001733677],"about_ca_topic_score_codex":0.0055152285,"about_ca_topic_score_gemma":0.0049272985,"teacher_disagreement_score":0.017034294,"about_ca_system_score_codex":0.0026270272,"about_ca_system_score_gemma":0.0014952809,"threshold_uncertainty_score":0.0633387},"labels":[],"label_agreement":null},{"id":"W2111589117","doi":"10.1186/1471-2288-14-36","title":"Evaluating bias due to data linkage error in electronic healthcare records","year":2014,"lang":"en","type":"article","venue":"BMC Medical Research Methodology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":102,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Hospital for Sick Children; Intensive Care Society; Medical Research Council; National Institute for Health and Care Research; NHS Health Scotland","keywords":"Identifier; Record linkage; Linkage (software); Gold standard (test); Word error rate; Computer science; Imputation (statistics); Statistics; Probabilistic logic; Data mining; Missing data; Data set; Standard error; Medicine; Artificial intelligence; Mathematics; Population","score_opus":0.9728506852504919,"score_gpt":0.764426510343351,"score_spread":0.20842417490714094,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2111589117","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5200224,0.007986601,0.45664302,0.0034354106,0.00077489455,0.0025376973,0.0034760586,0.0010103326,0.0041135424],"genre_scores_gemma":[0.8706078,0.00069580827,0.123041354,0.0009345977,0.0002303898,0.0013110583,0.0023835457,0.00018099515,0.00061450584],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.6504805,0.29612404,0.019644944,0.013322733,0.018668426,0.0017592995],"domain_scores_gemma":[0.13233571,0.80557716,0.027187916,0.02108588,0.013268394,0.00054485956],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.29205847,0.0012514222,0.0013553784,0.0035638704,0.0014615441,0.003109443,0.0026228526,0.0033539427,0.001347696],"category_scores_gemma":[0.62197036,0.0008683711,0.0036039576,0.00530771,0.003180064,0.0032863175,0.003829881,0.002096628,0.00027779886],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0034900869,0.00036153893,0.63713574,0.0026008633,0.008001065,0.00058356026,0.0036576164,0.17876813,0.0011278931,0.016521739,0.003997956,0.14375383],"study_design_scores_gemma":[0.0015011843,0.0035430386,0.26304495,0.0042575416,0.0066051204,0.002989262,0.0021828318,0.5890253,0.016703418,0.090931125,0.018554255,0.0006618709],"about_ca_topic_score_codex":0.0057977396,"about_ca_topic_score_gemma":0.0038324255,"teacher_disagreement_score":0.70794153,"about_ca_system_score_codex":0.0032730338,"about_ca_system_score_gemma":0.0026248728,"threshold_uncertainty_score":0.87301797},"labels":[{"model":"gemma","categories":["metaresearch"],"domain":"methods","study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":["metaresearch"],"domain":"methods","study_design":"design_other","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"high"}],"label_agreement":"split"},{"id":"W2112840274","doi":"10.14778/1920841.1920870","title":"Sampling the repairs of functional dependency violations under hard constraints","year":2010,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":127,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Dependency (UML); Class (philosophy); Functional dependency; Context (archaeology); Sampling (signal processing); Relation (database); Data integrity; Variety (cybernetics); Space (punctuation); Data mining; Metric (unit); Theoretical computer science; Relational database; Database; Artificial intelligence","score_opus":0.1812498346188758,"score_gpt":0.3696657815601582,"score_spread":0.18841594694128241,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2112840274","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.34021884,0.0006179192,0.6543396,0.00095517363,0.000053308137,0.00030856577,0.0006021249,0.0017206756,0.0011837415],"genre_scores_gemma":[0.71432114,0.00017814402,0.28265762,0.00021190505,0.000045558594,0.000273417,0.0012507311,0.0002609746,0.00080050295],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99403507,0.0025469132,0.0005231496,0.0011374186,0.0013864412,0.00037105868],"domain_scores_gemma":[0.94591707,0.040354434,0.0028566248,0.0075910506,0.00261215,0.0006686944],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0066418583,0.00079139916,0.0014659105,0.0014289627,0.0007763588,0.0010597713,0.00187476,0.0015941503,0.0010445641],"category_scores_gemma":[0.04814147,0.00062318635,0.0011557956,0.0013181594,0.001356201,0.0021323955,0.001753863,0.0017977966,0.00027082418],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013545019,0.0005490964,0.026768569,0.000587062,0.00025553184,0.00066285237,0.0012894645,0.6412677,0.016597504,0.016591145,0.006223891,0.28785264],"study_design_scores_gemma":[0.00008066854,0.0002045106,0.001781795,0.0000381374,0.00006413247,0.0003125748,0.00034691385,0.95949066,0.011576187,0.024320481,0.0017576977,0.000026260092],"about_ca_topic_score_codex":0.002166295,"about_ca_topic_score_gemma":0.0033350252,"teacher_disagreement_score":0.0066418583,"about_ca_system_score_codex":0.00094127696,"about_ca_system_score_gemma":0.0017450983,"threshold_uncertainty_score":0.03512597},"labels":[],"label_agreement":null},{"id":"W2113415503","doi":"10.14778/1687627.1687695","title":"Modeling and querying possible repairs in duplicate detection","year":2009,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":57,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Scalability; Data mining; Parameterized complexity; Cluster analysis; Identification (biology); Set (abstract data type); Database; Algorithm; Machine learning","score_opus":0.08693929288766766,"score_gpt":0.34729863073080464,"score_spread":0.260359337843137,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2113415503","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.060350787,0.00064978836,0.93616796,0.00066856004,0.000019072038,0.00011827207,0.0007298392,0.00055565295,0.00074002997],"genre_scores_gemma":[0.58815515,0.00068780454,0.4079065,0.00019673625,0.00006462571,0.00032479194,0.0017453718,0.00012815002,0.0007908278],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9776638,0.008640594,0.0023521483,0.0043322453,0.0058632665,0.0011479724],"domain_scores_gemma":[0.9190702,0.05695133,0.0069022975,0.012796504,0.0035205225,0.00075923133],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01872432,0.0011442618,0.0027605547,0.004097712,0.0016488261,0.0063190577,0.006495992,0.0030682192,0.0012160786],"category_scores_gemma":[0.09447894,0.0018622846,0.0031444933,0.006874503,0.0031988504,0.011578902,0.004885925,0.002656908,0.0002922386],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00029142576,0.00012449591,0.0074175294,0.00025690804,0.00016935091,0.00034648782,0.00087269256,0.88031226,0.0015327351,0.059227042,0.0011312884,0.048317846],"study_design_scores_gemma":[0.000024901005,0.00006799228,0.0004971216,0.000037983697,0.00004871634,0.00027024024,0.00028398447,0.90090454,0.0022202558,0.09434089,0.0012642163,0.00003914677],"about_ca_topic_score_codex":0.007569163,"about_ca_topic_score_gemma":0.0052659125,"teacher_disagreement_score":0.01872432,"about_ca_system_score_codex":0.0032104037,"about_ca_system_score_gemma":0.002540408,"threshold_uncertainty_score":0.09902489},"labels":[],"label_agreement":null},{"id":"W2115008552","doi":"10.5539/mas.v4n9p142","title":"Entropy Based Measurement of Text Dissimilarity for Duplicate – Detection","year":2010,"lang":"en","type":"article","venue":"Modern Applied Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Similarity (geometry); Entropy (arrow of time); Data mining; Pattern recognition (psychology); Artificial intelligence; Physics; Image (mathematics)","score_opus":0.14603902885909179,"score_gpt":0.3735185434045063,"score_spread":0.2274795145454145,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2115008552","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.30716637,0.0018008794,0.68098205,0.0002936705,0.00026403365,0.00032703282,0.0022728988,0.0013300868,0.005562995],"genre_scores_gemma":[0.80898553,0.00038559802,0.18707702,0.000061680505,0.00019270738,0.00018006003,0.0018794601,0.00008882501,0.0011491473],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9956455,0.0008597717,0.0005683671,0.0005643174,0.0021996389,0.00016234153],"domain_scores_gemma":[0.98895895,0.00537318,0.0016603186,0.0016426679,0.0020918306,0.000273166],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0026381828,0.0004696979,0.0010718339,0.006733059,0.0005185375,0.0010878412,0.0008962678,0.00077576644,0.0015067253],"category_scores_gemma":[0.016302386,0.00016437688,0.0005894447,0.005014434,0.00075090444,0.0025302737,0.0013609093,0.0006332286,0.0006291518],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017208133,0.0004592988,0.067675605,0.0012973064,0.0005575246,0.00097354414,0.0011150434,0.04111168,0.1650503,0.02001567,0.004924445,0.6950989],"study_design_scores_gemma":[0.000085058564,0.0012496524,0.13195983,0.0001262074,0.0002967229,0.004495255,0.00076694804,0.639249,0.1703917,0.03934325,0.011674509,0.00036179772],"about_ca_topic_score_codex":0.0003361109,"about_ca_topic_score_gemma":0.00038181932,"teacher_disagreement_score":0.006733059,"about_ca_system_score_codex":0.0005252,"about_ca_system_score_gemma":0.0004236672,"threshold_uncertainty_score":0.013952196},"labels":[],"label_agreement":null},{"id":"W2115215982","doi":"10.14778/1453856.1453883","title":"Hashed samples","year":2008,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":68,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto; York University","funders":"","keywords":"Similarity (geometry); Estimator; A priori and a posteriori; Computer science; Overhead (engineering); Set (abstract data type); Sampling (signal processing); Cosine similarity; Algorithm; Data mining; Pattern recognition (psychology); Mathematics; Artificial intelligence; Statistics","score_opus":0.2910039101624485,"score_gpt":0.3717421828373335,"score_spread":0.08073827267488504,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2115215982","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.025844723,0.00028987697,0.97073495,0.00020050793,0.00005993759,0.00018417463,0.00034637266,0.0011961401,0.0011432981],"genre_scores_gemma":[0.443255,0.0003471438,0.55104184,0.00029902658,0.0002459524,0.0004468014,0.001448263,0.0002319907,0.0026840384],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9945505,0.001136465,0.00041310195,0.0011233565,0.0024313538,0.00034533706],"domain_scores_gemma":[0.9784055,0.011736033,0.0016165841,0.0057623526,0.0020851041,0.00039445606],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0045654657,0.0006726794,0.0013622333,0.0022301343,0.000921086,0.0020514354,0.0022303266,0.0011232707,0.004500926],"category_scores_gemma":[0.037763372,0.0005905165,0.000822903,0.0025668168,0.0011854644,0.005785041,0.0026672094,0.0013258606,0.0016924266],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0018529679,0.00037009097,0.016496953,0.0005989676,0.00021480629,0.00036969344,0.0008046987,0.11804186,0.025769064,0.1614239,0.009754835,0.6643022],"study_design_scores_gemma":[0.00013937874,0.0004997972,0.0017619636,0.000048504044,0.00005759515,0.0008079214,0.00027215428,0.85748637,0.029777082,0.099556014,0.009540191,0.00005301665],"about_ca_topic_score_codex":0.00088472944,"about_ca_topic_score_gemma":0.00090282987,"teacher_disagreement_score":0.0045654657,"about_ca_system_score_codex":0.0010667172,"about_ca_system_score_gemma":0.0010600479,"threshold_uncertainty_score":0.024144769},"labels":[],"label_agreement":null},{"id":"W2119457846","doi":"","title":"Privacy-Enhanced Public Name-Authority System for Building Research Communities","year":2011,"lang":"en","type":"article","venue":"Library and Archives Canada (Government of Canada)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Internet privacy; Information privacy; Public authority; Political science; Business; World Wide Web; Public administration; Computer science; Public relations","score_opus":0.1574086523976547,"score_gpt":0.3013402557264683,"score_spread":0.14393160332881358,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2119457846","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.028444063,0.00079854886,0.9267311,0.001798223,0.00034284356,0.00092623173,0.0017838028,0.030800194,0.008374844],"genre_scores_gemma":[0.3630557,0.00056448,0.61163366,0.00068229367,0.0005705296,0.0008098112,0.0052104276,0.0010876881,0.016385535],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9897646,0.003293856,0.0012625918,0.0020110826,0.0030467373,0.0006211605],"domain_scores_gemma":[0.97225237,0.005758102,0.0026200765,0.012671795,0.0043672877,0.0023303586],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.010089882,0.0007238315,0.001531159,0.0048568277,0.0047980007,0.0054399227,0.0044093765,0.0032562593,0.006567403],"category_scores_gemma":[0.02493569,0.00085827685,0.0011370205,0.004854645,0.0016111984,0.013479869,0.011763039,0.0024814964,0.0059327986],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0031232294,0.0013462852,0.017642103,0.0011496459,0.00034979926,0.0020154912,0.00575622,0.02157448,0.0362525,0.17470495,0.09554499,0.64054024],"study_design_scores_gemma":[0.0005763386,0.0005258622,0.0047944747,0.00022088154,0.00028152205,0.0020532445,0.0012583814,0.5480666,0.058586847,0.086346634,0.29673952,0.0005496695],"about_ca_topic_score_codex":0.0027507858,"about_ca_topic_score_gemma":0.0025462639,"teacher_disagreement_score":0.99456006,"about_ca_system_score_codex":0.0018622882,"about_ca_system_score_gemma":0.004343394,"threshold_uncertainty_score":0.05336106},"labels":[],"label_agreement":null},{"id":"W2125819120","doi":"10.1109/i-society18435.2011.5978521","title":"Managing and mapping data lineage for business intelligence and analytics applications in health care","year":2011,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Dashboard; Computer science; Business intelligence; Analytics; Data science; Architecture; Automation; Health care; Interface (matter); World Wide Web; Database; Engineering","score_opus":0.556294991467182,"score_gpt":0.47637182578268755,"score_spread":0.07992316568449442,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2125819120","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.050741434,0.00078925083,0.9328886,0.004869355,0.000076463875,0.0007060438,0.00082734984,0.006014037,0.003087473],"genre_scores_gemma":[0.24058688,0.0005585609,0.7545804,0.00041095345,0.00004810724,0.00037864182,0.0017227143,0.000549495,0.0011643231],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9830335,0.008257486,0.0029485684,0.0015139765,0.003825507,0.00042098537],"domain_scores_gemma":[0.9243642,0.0396411,0.0077065057,0.020156335,0.0066324463,0.0014994447],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.035320356,0.00093528954,0.0011114303,0.004833165,0.0022755188,0.011231596,0.003102033,0.001945464,0.0014052934],"category_scores_gemma":[0.084194615,0.0011404201,0.0010234299,0.0069330777,0.001682707,0.013206469,0.005403855,0.0026132925,0.00055115274],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00045239163,0.0005590448,0.05411926,0.0008344381,0.00018006141,0.0014518598,0.012711923,0.04182415,0.0098738745,0.11462835,0.01023655,0.7531282],"study_design_scores_gemma":[0.0001771443,0.0005088697,0.01465898,0.001163066,0.00025149994,0.0017261733,0.007172713,0.5205665,0.04739354,0.26702914,0.13899405,0.00035836417],"about_ca_topic_score_codex":0.005309661,"about_ca_topic_score_gemma":0.005443605,"teacher_disagreement_score":0.035320356,"about_ca_system_score_codex":0.002327995,"about_ca_system_score_gemma":0.00552423,"threshold_uncertainty_score":0.1867941},"labels":[],"label_agreement":null},{"id":"W2127665671","doi":"10.2196/medinform.3090","title":"Designing an Algorithm to Preserve Privacy for Medical Record Linkage With Error-Prone Data","year":2014,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"University at Buffalo; National Natural Science Foundation of China; Oklahoma Center for the Advancement of Science and Technology; National Science Foundation","keywords":"Computer science; Record linkage; Linkage (software); Information privacy; Exception handling; Data mining; Computer security; Algorithm; Medicine; Programming language","score_opus":0.22247027615608875,"score_gpt":0.4594914703253406,"score_spread":0.23702119416925185,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2127665671","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.007125665,0.00007147021,0.9912349,0.00018070819,0.000029241995,0.00018240952,0.0000501159,0.000754859,0.0003706417],"genre_scores_gemma":[0.08127088,0.0001166959,0.91676253,0.00014018982,0.000052003023,0.0003244265,0.00030153655,0.00008619711,0.00094553706],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.992362,0.0020013778,0.0009981798,0.0016856142,0.0024084563,0.00054435444],"domain_scores_gemma":[0.98969996,0.0037587378,0.0015069869,0.0022853995,0.0024526988,0.00029620132],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006096929,0.00083376205,0.0010664638,0.0026619493,0.0021692798,0.0024734149,0.0026576435,0.002466007,0.00199076],"category_scores_gemma":[0.018810028,0.0005856761,0.0014425815,0.0029901892,0.0015784528,0.0052109575,0.0036815598,0.0018520965,0.0012935251],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007759074,0.00040143658,0.009180834,0.00053535163,0.00029912713,0.0007197578,0.0013715376,0.14214657,0.035459284,0.060434442,0.008401322,0.74027455],"study_design_scores_gemma":[0.00017455743,0.00038268935,0.0012065875,0.00008091666,0.000120176664,0.0016473508,0.00038473643,0.86826235,0.0642614,0.044567302,0.018810414,0.0001015417],"about_ca_topic_score_codex":0.0008099546,"about_ca_topic_score_gemma":0.00051901414,"teacher_disagreement_score":0.006096929,"about_ca_system_score_codex":0.0012750487,"about_ca_system_score_gemma":0.003122418,"threshold_uncertainty_score":0.032244027},"labels":[],"label_agreement":null},{"id":"W2128322880","doi":"10.4018/jdwm.2005040101","title":"The Use of Smart Tokens in Cleaning Integrated Warehouse Data","year":2005,"lang":"en","type":"article","venue":"International Journal of Data Warehousing and Mining","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":24,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"","keywords":"Computer science; Data warehouse; Security token; Database; Alphanumeric; Matching (statistics); Data mining; Unique identifier; Identifier; Computer security","score_opus":0.5821457750325668,"score_gpt":0.47436071499941795,"score_spread":0.10778506003314886,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2128322880","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.049629368,0.0005188232,0.9429004,0.00017353459,0.00014092863,0.00021901353,0.0005592613,0.005003414,0.0008552823],"genre_scores_gemma":[0.1514124,0.00025979278,0.84476656,0.00009751943,0.000025911591,0.00013930314,0.0013733696,0.00044043572,0.0014846975],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9938956,0.0006992731,0.0010980136,0.0013727697,0.0026029982,0.00033131582],"domain_scores_gemma":[0.989056,0.0024477358,0.0023617097,0.0038794235,0.0018958458,0.00035928196],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0025751842,0.0007611071,0.0015786842,0.0034479515,0.0013652282,0.0031188636,0.0037442108,0.0010740433,0.0012429417],"category_scores_gemma":[0.012057822,0.0008173598,0.0014143506,0.006191608,0.0014550207,0.006390649,0.0034949507,0.0013657003,0.0019109097],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0018581644,0.00036409884,0.023472372,0.0008374796,0.0002505691,0.0009476087,0.002139027,0.028544856,0.07004926,0.03152947,0.0075022066,0.83250487],"study_design_scores_gemma":[0.00020407472,0.0013513474,0.011674156,0.00025481914,0.00042275063,0.004150433,0.0021796387,0.35194102,0.4796521,0.047291234,0.10031604,0.0005623276],"about_ca_topic_score_codex":0.0035320392,"about_ca_topic_score_gemma":0.0026551157,"teacher_disagreement_score":0.0037442108,"about_ca_system_score_codex":0.0011148677,"about_ca_system_score_gemma":0.0026616568,"threshold_uncertainty_score":0.013619065},"labels":[],"label_agreement":null},{"id":"W2129197327","doi":"10.1145/2661829.2661858","title":"CONDOR","year":2014,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Computer science; Data integrity; Functional dependency; Constraint (computer-aided design); Visualization; Set (abstract data type); Semantics (computer science); Dependency (UML); Data mining; Database; Software engineering; Programming language; Relational database","score_opus":0.3088274691573679,"score_gpt":0.4778635020973403,"score_spread":0.16903603293997238,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2129197327","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0056513916,0.0013492969,0.49803638,0.0019437316,0.0009829701,0.0007755557,0.038724028,0.39677945,0.05575729],"genre_scores_gemma":[0.06891128,0.0023367528,0.7125584,0.0022322123,0.0004893536,0.0014208073,0.09661946,0.064010754,0.05142102],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99473876,0.0008094247,0.0005167306,0.00095398095,0.002612541,0.00036862044],"domain_scores_gemma":[0.9872414,0.0055993143,0.0008034681,0.0032681779,0.0024880446,0.0005995958],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0064103142,0.0022569408,0.0013902156,0.0034356965,0.0016816558,0.0064435494,0.005252801,0.001710633,0.08687185],"category_scores_gemma":[0.022532403,0.0014986556,0.002908784,0.0028370437,0.0014644886,0.0074091554,0.0046999916,0.00250198,0.024300324],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012321102,0.00021075754,0.006275423,0.0025775845,0.0002933588,0.00083252555,0.00071840227,0.012141151,0.0045303614,0.08282872,0.59376764,0.29459205],"study_design_scores_gemma":[0.00021009351,0.000120105855,0.0010462824,0.0003466644,0.00009140535,0.00072809996,0.00015355971,0.040313102,0.0104116425,0.032367203,0.9140223,0.00018954572],"about_ca_topic_score_codex":0.010957468,"about_ca_topic_score_gemma":0.01637357,"teacher_disagreement_score":0.91312814,"about_ca_system_score_codex":0.001545473,"about_ca_system_score_gemma":0.004964103,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W2129684888","doi":"10.1145/1458082.1458197","title":"Records retention in relational database systems","year":2008,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":28,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Data retention; Records management; Scope (computer science); Legislation; Computer science; Identification (biology); Database; Relational database; Business; Information retrieval; Knowledge management; Computer security; Law; Political science","score_opus":0.4765472888744886,"score_gpt":0.41720244780285376,"score_spread":0.059344841071634846,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2129684888","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.097880155,0.013643398,0.8492395,0.0073376135,0.000493139,0.0008313955,0.001490556,0.0079987785,0.021085447],"genre_scores_gemma":[0.67784345,0.007360545,0.28990573,0.0015613787,0.0008603346,0.00048256002,0.00286885,0.0007619007,0.018355275],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.97069156,0.0076000816,0.0040610614,0.002335344,0.013549353,0.0017626395],"domain_scores_gemma":[0.94277763,0.024861213,0.0063052406,0.015868496,0.009115388,0.0010719487],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.025495203,0.00039728222,0.00107641,0.003290087,0.0022735968,0.00724005,0.0050029727,0.0018601603,0.003683535],"category_scores_gemma":[0.084895395,0.0012440705,0.00095167797,0.007858446,0.0024757737,0.018731996,0.0057703895,0.0029569722,0.0024305775],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007596428,0.00040325153,0.021911079,0.0013926724,0.00014116734,0.00086268235,0.004147513,0.02242218,0.0047375844,0.28022227,0.02077396,0.64222604],"study_design_scores_gemma":[0.00036407614,0.0012005013,0.007408237,0.0014355655,0.00052278035,0.0036643266,0.0034297968,0.30430397,0.038513537,0.40583056,0.2329477,0.00037890763],"about_ca_topic_score_codex":0.004704408,"about_ca_topic_score_gemma":0.0021107562,"teacher_disagreement_score":0.025495203,"about_ca_system_score_codex":0.0021719474,"about_ca_system_score_gemma":0.0035300443,"threshold_uncertainty_score":0.1348331},"labels":[],"label_agreement":null},{"id":"W2131060875","doi":"","title":"Extending dependencies with conditions","year":2007,"lang":"en","type":"article","venue":"Edinburgh Research Explorer (University of Edinburgh)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":108,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Bell (Canada)","funders":"Biotechnology and Biological Sciences Research Council; Engineering and Physical Sciences Research Council","keywords":"Undecidable problem; Computer science; Functional dependency; EXPTIME; Consistency (knowledge bases); Theoretical computer science; Data integrity; Inference; Decidability; Static analysis; Heuristic; Schema (genetic algorithms); Algorithm; Data mining; Computational complexity theory; Programming language; PSPACE; Artificial intelligence; Machine learning; Relational database; Database","score_opus":0.36871996505199645,"score_gpt":0.4567409499993181,"score_spread":0.08802098494732163,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2131060875","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015236733,0.0012221717,0.9318676,0.0017526378,0.00064706046,0.00041957817,0.0015952486,0.0029225303,0.044336483],"genre_scores_gemma":[0.33416268,0.002344624,0.6375757,0.001858098,0.001218438,0.0008110113,0.0027411038,0.0013856519,0.017902672],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9931346,0.0016318779,0.00065903715,0.0020224855,0.0017106517,0.0008413087],"domain_scores_gemma":[0.984233,0.009027114,0.0007623433,0.0035018898,0.0019638315,0.0005117913],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006102318,0.0015625427,0.00088674104,0.0034184358,0.0025486178,0.0028917552,0.0029804064,0.0016253167,0.013286211],"category_scores_gemma":[0.014856738,0.0013312534,0.003028038,0.0022555431,0.006014883,0.013818953,0.007461876,0.0043959646,0.0024049857],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000103981394,0.000069210415,0.0012509539,0.00039041118,0.00004047393,0.0005616484,0.0006373254,0.01165517,0.0027985466,0.9135829,0.0064950613,0.062414322],"study_design_scores_gemma":[0.000052579475,0.00006730824,0.00042242333,0.0001851728,0.00008107983,0.00038464795,0.0001613851,0.026494278,0.0046998383,0.8476852,0.119694166,0.00007203024],"about_ca_topic_score_codex":0.0056575583,"about_ca_topic_score_gemma":0.0049020294,"teacher_disagreement_score":0.013286211,"about_ca_system_score_codex":0.0025549582,"about_ca_system_score_gemma":0.0031706807,"threshold_uncertainty_score":0.044446766},"labels":[],"label_agreement":null},{"id":"W2131815873","doi":"10.1145/1559845.1559891","title":"Incremental maintenance of length normalized indexes for approximate string matching","year":2009,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":44,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Search engine indexing; Computer science; Security token; String (physics); Approximate string matching; Data mining; String searching algorithm; Matching (statistics); Key (lock); Similarity (geometry); False positive paradox; Feature (linguistics); Information retrieval; String metric; Limit (mathematics); Pattern matching; Theoretical computer science; Artificial intelligence; Mathematics","score_opus":0.13023303475302814,"score_gpt":0.40500304611254945,"score_spread":0.2747700113595213,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2131815873","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017156428,0.0006453084,0.9764142,0.00017693898,0.00006480667,0.0001492752,0.00021430741,0.0040285457,0.0011502024],"genre_scores_gemma":[0.2114089,0.00047431877,0.78441167,0.00013739883,0.00017039363,0.00026148497,0.0011832028,0.00036114687,0.0015915663],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99434125,0.0011409764,0.0006340233,0.00092883105,0.002675883,0.00027892116],"domain_scores_gemma":[0.972955,0.008495847,0.0028344723,0.011667298,0.003643195,0.00040414365],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0057638087,0.00069101644,0.0017049984,0.0036110636,0.0011326709,0.0032533847,0.004581569,0.001263318,0.0014116821],"category_scores_gemma":[0.043618876,0.0007104212,0.0007292722,0.0054955934,0.00124935,0.0072100135,0.0028946921,0.001298089,0.0013680547],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00055919506,0.00034480786,0.007065554,0.00031582106,0.00013201855,0.00024251587,0.0006664123,0.085260496,0.020368615,0.041432265,0.008825251,0.834787],"study_design_scores_gemma":[0.00013910099,0.00038159476,0.0023900815,0.00006073605,0.00017856203,0.0008081667,0.00021565802,0.8543391,0.046084177,0.07690357,0.018395456,0.000103712635],"about_ca_topic_score_codex":0.0026875013,"about_ca_topic_score_gemma":0.0027538352,"teacher_disagreement_score":0.0057638087,"about_ca_system_score_codex":0.0012338655,"about_ca_system_score_gemma":0.002596659,"threshold_uncertainty_score":0.030482352},"labels":[],"label_agreement":null},{"id":"W2131821459","doi":"10.5539/cis.v4n4p46","title":"An Integrated Conceptual Model for Temporal Data Warehouse Security","year":2011,"lang":"en","type":"article","venue":"Computer and Information Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Data warehouse; Conceptual model; Dimensional modeling; Temporal database; Warehouse; Data science; Data mining; Database","score_opus":0.40095079336145106,"score_gpt":0.4196588554264984,"score_spread":0.018708062065047326,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2131821459","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0031489597,0.0004087457,0.9875097,0.0011518481,0.000078434954,0.00024181101,0.00033197625,0.00043517933,0.006693301],"genre_scores_gemma":[0.060348704,0.0011010843,0.9327523,0.00038995268,0.000069875634,0.0007561311,0.001579312,0.00010299783,0.0028997152],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99606067,0.0012614359,0.0006742411,0.0005934615,0.0011565136,0.00025366887],"domain_scores_gemma":[0.9961514,0.0011800568,0.00045474138,0.0007824135,0.0011798971,0.00025152406],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0061327475,0.00095974957,0.0006822242,0.0040704585,0.0012008528,0.0065613147,0.0032773989,0.0024604262,0.003349233],"category_scores_gemma":[0.006582989,0.00095867255,0.0028914984,0.0040234355,0.0018517642,0.0097478805,0.002899126,0.0027109822,0.0010137748],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00003345198,0.00008323533,0.0006343792,0.00026129003,0.00004855403,0.00032101883,0.0011828988,0.019167885,0.0017547245,0.94185793,0.0030652697,0.031589355],"study_design_scores_gemma":[0.000093863964,0.00017295255,0.0007409671,0.0008355997,0.00018364882,0.0012529149,0.0014007495,0.27243847,0.0037070198,0.4220972,0.29693645,0.0001402072],"about_ca_topic_score_codex":0.0075903623,"about_ca_topic_score_gemma":0.0062042344,"teacher_disagreement_score":0.0075903623,"about_ca_system_score_codex":0.003368352,"about_ca_system_score_gemma":0.0053514224,"threshold_uncertainty_score":0.03243345},"labels":[],"label_agreement":null},{"id":"W2132698877","doi":"10.5596/c13-009","title":"Systematic Approaches to a Successful Literature Review","year":2013,"lang":"fr","type":"article","venue":"Journal of the Canadian Health Libraries Association / Journal de l Association de bilbiothèques de la santé du Canada","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":871,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Systematic review; Epistemology; History; Psychology; Engineering ethics; Political science; Philosophy; MEDLINE; Engineering; Law","score_opus":0.033106520738290075,"score_gpt":0.2956478694425366,"score_spread":0.26254134870424656,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2132698877","genre_codex":"review","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0056450553,0.64319026,0.20840083,0.05904642,0.0066580814,0.05954241,0.0031314376,0.0007687381,0.013616771],"genre_scores_gemma":[0.07014718,0.20777145,0.6207985,0.0127024315,0.0016184936,0.08341236,0.0009642364,0.00024580606,0.0023395522],"study_design_codex":"systematic_review","study_design_gemma":"not_applicable","domain_scores_codex":[0.48095536,0.35573265,0.106539354,0.008959831,0.044736434,0.0030763354],"domain_scores_gemma":[0.28331077,0.5929674,0.033202093,0.034344077,0.05292308,0.003252448],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.28221244,0.004311827,0.012222925,0.06837038,0.008986559,0.016515138,0.0072236545,0.01153583,0.011424503],"category_scores_gemma":[0.5691319,0.007196094,0.008084119,0.037384365,0.009461912,0.015639009,0.018381584,0.0057379724,0.002618427],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00057539024,0.00026307532,0.0021255673,0.4839751,0.015241482,0.002627822,0.015450887,0.0022346424,0.0013605368,0.059311803,0.033460233,0.38337353],"study_design_scores_gemma":[0.0015918016,0.0005376387,0.0017469595,0.6416797,0.020721229,0.0011055506,0.010014103,0.0034975763,0.0016274598,0.17052057,0.14654571,0.00041179126],"about_ca_topic_score_codex":0.008419269,"about_ca_topic_score_gemma":0.022129709,"teacher_disagreement_score":0.71778756,"about_ca_system_score_codex":0.017926224,"about_ca_system_score_gemma":0.102235846,"threshold_uncertainty_score":0.88515985},"labels":[],"label_agreement":null},{"id":"W2133647765","doi":"10.1109/wi.2006.134","title":"Privacy Preserving Multiagent Probabilistic Reasoning about Ambiguous Contexts: A Case Study","year":2006,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University; Saint Mary's University","funders":"","keywords":"Computer science; Probabilistic logic; Inference; Context (archaeology); Bayesian network; Multi-agent system; Representation (politics); Artificial intelligence; Domain (mathematical analysis); Ubiquitous computing; Intelligent agent; Human–computer interaction; Data science","score_opus":0.1407579980479361,"score_gpt":0.4195611289486224,"score_spread":0.2788031309006863,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2133647765","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.30629432,0.0027098465,0.65897816,0.008883339,0.00009624581,0.0004597779,0.00055090745,0.00043741736,0.021590026],"genre_scores_gemma":[0.8543238,0.0011379679,0.14167474,0.0002803753,0.00008925502,0.000143549,0.0001894413,0.000047504083,0.0021133926],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9940042,0.0033835704,0.0003187335,0.0005029353,0.0013756641,0.0004148902],"domain_scores_gemma":[0.98185307,0.014715819,0.00087030453,0.0013959289,0.00067076384,0.0004940474],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0070756446,0.0006963037,0.00088487985,0.000837506,0.0029618938,0.0031928837,0.002131149,0.0051555303,0.001779572],"category_scores_gemma":[0.01715158,0.00049771304,0.0013905567,0.0019918045,0.002935796,0.005098553,0.0034460337,0.0026945549,0.00025007752],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010382258,0.0007588343,0.015535082,0.000716629,0.00034031027,0.032495636,0.007215043,0.4325191,0.004204207,0.3369892,0.00792308,0.16026457],"study_design_scores_gemma":[0.00023235673,0.0002132636,0.0025396608,0.00010145872,0.0001540687,0.0076574543,0.0032504941,0.75003433,0.0055510504,0.20669568,0.023484405,0.00008573071],"about_ca_topic_score_codex":0.0070602675,"about_ca_topic_score_gemma":0.0063728904,"teacher_disagreement_score":0.0070756446,"about_ca_system_score_codex":0.0016145179,"about_ca_system_score_gemma":0.0012459239,"threshold_uncertainty_score":0.037419975},"labels":[],"label_agreement":null},{"id":"W2134077349","doi":"","title":"The TALP participation at TAC-KBP 2012","year":2012,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science","score_opus":0.07575633838207113,"score_gpt":0.39478770219948534,"score_spread":0.3190313638174142,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2134077349","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09295409,0.006014028,0.4200123,0.070708044,0.022398302,0.0058778287,0.05283913,0.045248434,0.2839479],"genre_scores_gemma":[0.22153395,0.0017919231,0.2933187,0.0072401683,0.003944506,0.0042568785,0.108538106,0.02297979,0.336396],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.97865546,0.008186732,0.00063775544,0.0027694923,0.0076138857,0.0021366493],"domain_scores_gemma":[0.9619705,0.005622908,0.00051288796,0.0050877626,0.020779917,0.006025951],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02612612,0.0019485237,0.0016543414,0.0029196953,0.004492535,0.008392877,0.0034384714,0.0036716906,0.036095787],"category_scores_gemma":[0.035797857,0.0009484912,0.0013466739,0.002214582,0.0016477619,0.005009486,0.0075961,0.0052912007,0.025893085],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017582212,0.00092061184,0.001415469,0.0005825856,0.00011917313,0.0011271723,0.0073091798,0.0029620181,0.025449967,0.016971152,0.7370907,0.20429373],"study_design_scores_gemma":[0.0002446837,0.00019891259,0.0022595073,0.00017256528,0.00004362297,0.00028546766,0.0019850724,0.0077238446,0.01271653,0.0035442119,0.97071975,0.00010587456],"about_ca_topic_score_codex":0.032697625,"about_ca_topic_score_gemma":0.015167544,"teacher_disagreement_score":0.036095787,"about_ca_system_score_codex":0.004166454,"about_ca_system_score_gemma":0.010194614,"threshold_uncertainty_score":0.13816977},"labels":[],"label_agreement":null},{"id":"W2135797260","doi":"10.1287/isre.2014.0537","title":"The IQ of the Crowd: Understanding and Improving Information Quality in Structured User-Generated Content","year":2014,"lang":"en","type":"article","venue":"Information Systems Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":152,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Computer science; Information quality; Quality (philosophy); Class (philosophy); Data science; Data mining; Knowledge management; Information retrieval; Information system; Artificial intelligence","score_opus":0.5163197398913468,"score_gpt":0.4719992757335768,"score_spread":0.04432046415777002,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2135797260","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.39061588,0.0015296316,0.5874307,0.005443627,0.00007322135,0.0008196309,0.00051827444,0.0014356656,0.012133428],"genre_scores_gemma":[0.8901523,0.00039120458,0.10807742,0.00034838964,0.000040155446,0.00019268494,0.00029006487,0.00010804482,0.0003998351],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.98228157,0.011086017,0.00093425583,0.0017275593,0.0034877995,0.00048275955],"domain_scores_gemma":[0.7818914,0.17649709,0.013395393,0.017855795,0.008455849,0.0019043805],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.028618688,0.0008632422,0.0010992509,0.004066629,0.0015374442,0.007313118,0.0019956382,0.0016707964,0.0016421833],"category_scores_gemma":[0.18531348,0.0007806553,0.00088509533,0.003171285,0.0044528292,0.015605117,0.0063942196,0.0023216577,0.00022929063],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015940925,0.0014095824,0.14798337,0.0021415108,0.00053235603,0.00050169096,0.068425424,0.10061983,0.008162526,0.15310636,0.007099881,0.5084234],"study_design_scores_gemma":[0.00016988102,0.0008628703,0.043465763,0.0008037567,0.0003593872,0.00038117592,0.0146600185,0.62726057,0.013722744,0.27579084,0.022279613,0.00024340716],"about_ca_topic_score_codex":0.008597853,"about_ca_topic_score_gemma":0.0034059756,"teacher_disagreement_score":0.028618688,"about_ca_system_score_codex":0.004147756,"about_ca_system_score_gemma":0.0022513126,"threshold_uncertainty_score":0.15135193},"labels":[],"label_agreement":null},{"id":"W2137775416","doi":"","title":"Improving data quality: consistency and accuracy","year":2007,"lang":"en","type":"article","venue":"Edinburgh Research Explorer (University of Edinburgh)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":312,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Bell (Canada)","funders":"Biotechnology and Biological Sciences Research Council; Engineering and Physical Sciences Research Council; Vlaamse regering; Fonds Wetenschappelijk Onderzoek","keywords":"Consistency (knowledge bases); Computer science; Data consistency; Data integrity; Consistency model; Sequential consistency; Set (abstract data type); Weak consistency; Heuristic; Data mining; Data quality; Quality (philosophy); Strong consistency; Database; Artificial intelligence; Mathematics; Programming language","score_opus":0.5859534533824458,"score_gpt":0.5006272625830552,"score_spread":0.08532619079939052,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2137775416","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014535547,0.0017305671,0.9776284,0.0024336008,0.00011107833,0.00019068226,0.0003622282,0.0012081454,0.0017996646],"genre_scores_gemma":[0.25917387,0.001104502,0.73618203,0.0007396912,0.00030412152,0.00036069407,0.0007764734,0.00047950182,0.00087906787],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.91626126,0.026802264,0.010610554,0.009167768,0.03502026,0.0021379085],"domain_scores_gemma":[0.6989079,0.1566437,0.024763104,0.0810882,0.036872834,0.0017242933],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04891176,0.0015323573,0.0026912214,0.0054926337,0.0016065516,0.007751905,0.005287916,0.0035621454,0.0019723808],"category_scores_gemma":[0.23220243,0.0014483554,0.0022116252,0.006271655,0.0043162717,0.015867297,0.008229802,0.0048233797,0.0009836822],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00072558445,0.00040513618,0.037274327,0.0019737184,0.00060252676,0.00022258864,0.0016996838,0.15133059,0.013316113,0.15207823,0.009778841,0.6305927],"study_design_scores_gemma":[0.0003517264,0.0008725201,0.015764885,0.0011760597,0.00054372434,0.0014341857,0.0010253374,0.58512217,0.058807246,0.28823745,0.046296205,0.00036850382],"about_ca_topic_score_codex":0.003624345,"about_ca_topic_score_gemma":0.0021803945,"teacher_disagreement_score":0.04891176,"about_ca_system_score_codex":0.0033995337,"about_ca_system_score_gemma":0.005891264,"threshold_uncertainty_score":0.25867325},"labels":[],"label_agreement":null},{"id":"W2137811660","doi":"10.1140/epjds/s13688-014-0011-3","title":"Exploiting citation networks for large-scale author name disambiguation","year":2014,"lang":"en","type":"article","venue":"EPJ Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":53,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Metadata; Ranking (information retrieval); Citation; Similarity (geometry); Cluster analysis; Precision and recall; Bibliographic coupling; Parameterized complexity; Heuristics","score_opus":0.3376502821107572,"score_gpt":0.46811139645195754,"score_spread":0.13046111434120033,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2137811660","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.04042672,0.0014213067,0.9515778,0.00046347207,0.00010868,0.0001049281,0.00096499705,0.0029944405,0.001937679],"genre_scores_gemma":[0.50063837,0.0007564305,0.49256903,0.00015652027,0.00034836895,0.00022710193,0.0032823049,0.0003125059,0.0017092868],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99361455,0.0020786521,0.00054317113,0.0013564413,0.0021027266,0.00030439356],"domain_scores_gemma":[0.96888083,0.019506503,0.0046095774,0.0032699676,0.0032678447,0.00046532092],"candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.0078755515,0.0015158103,0.0016483112,0.015674299,0.002226655,0.0040662563,0.0027257032,0.0026398997,0.001089376],"category_scores_gemma":[0.05275797,0.0006727188,0.001279095,0.0132458685,0.0011831394,0.0052356864,0.0030919178,0.001735655,0.001595353],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00031551876,0.00028793685,0.047761444,0.00048703776,0.0005465207,0.00038487223,0.0005664773,0.4262884,0.007856273,0.03586206,0.008151426,0.471492],"study_design_scores_gemma":[0.000015483589,0.000028508814,0.0027204393,0.00003833892,0.00003753697,0.00014523952,0.000073796604,0.9489338,0.0044947946,0.039700527,0.0037730297,0.000038526727],"about_ca_topic_score_codex":0.0047987476,"about_ca_topic_score_gemma":0.006249134,"teacher_disagreement_score":0.9843257,"about_ca_system_score_codex":0.0016928713,"about_ca_system_score_gemma":0.0025034763,"threshold_uncertainty_score":0.041650355},"labels":[],"label_agreement":null},{"id":"W2140609014","doi":"10.1145/1007568.1007650","title":"Information-theoretic tools for mining database structure from large data sets","year":2004,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":55,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Data mining; Redundancy (engineering); Categorical variable; Ranking (information retrieval); Data redundancy; Data modeling; Set (abstract data type); Information retrieval; Database; Machine learning","score_opus":0.21997362013458427,"score_gpt":0.4288470871589206,"score_spread":0.20887346702433635,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2140609014","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0017860263,0.0012392066,0.99454147,0.00046322614,0.000023949457,0.00020808233,0.00047277845,0.0006398019,0.0006254534],"genre_scores_gemma":[0.04223443,0.001369931,0.9535502,0.00021232318,0.00014566007,0.0007658925,0.0014267311,0.0000921354,0.00020268484],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9847734,0.006630018,0.0017529483,0.0012320654,0.005411,0.00020052696],"domain_scores_gemma":[0.9066713,0.07343424,0.005888759,0.010099476,0.00322375,0.00068257755],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.018267255,0.003181467,0.0036252232,0.020262225,0.0016903856,0.005681135,0.0039287754,0.0022045916,0.0024654309],"category_scores_gemma":[0.10148109,0.001820314,0.0034501627,0.017079834,0.004327216,0.009801391,0.0048065265,0.004643534,0.0009446218],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00028203882,0.0005057774,0.005721909,0.0031946704,0.0010951778,0.00055848155,0.00087241037,0.25969017,0.002336943,0.29102668,0.0103092,0.42440656],"study_design_scores_gemma":[0.00007920679,0.00015703688,0.0007611005,0.0003402364,0.00015645688,0.00027397255,0.00021720582,0.44907954,0.0020207413,0.53948814,0.007352931,0.00007349019],"about_ca_topic_score_codex":0.0016638776,"about_ca_topic_score_gemma":0.0024468922,"teacher_disagreement_score":0.020262225,"about_ca_system_score_codex":0.0028625953,"about_ca_system_score_gemma":0.0030832335,"threshold_uncertainty_score":0.096607625},"labels":[],"label_agreement":null},{"id":"W2142472956","doi":"10.1109/icde.2011.5767833","title":"A unified model for data and constraint repair","year":2011,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":92,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Data integrity; Scalability; Constraint (computer-aided design); Data quality; Data modeling; Set (abstract data type); Data mining; Semantics (computer science); Data model (GIS); Quality (philosophy); Database; Artificial intelligence; Programming language; Engineering","score_opus":0.7150539177874393,"score_gpt":0.46880357717375065,"score_spread":0.24625034061368867,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2142472956","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00239478,0.00031595305,0.9931103,0.0007314035,0.00006460467,0.00017057819,0.00040496618,0.00052859826,0.0022787875],"genre_scores_gemma":[0.1071028,0.00088611635,0.88169396,0.00041637724,0.00020507346,0.0009505178,0.001643669,0.0005491223,0.0065524043],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98267406,0.0049393103,0.0018480385,0.0030783564,0.006314751,0.0011454418],"domain_scores_gemma":[0.97143507,0.013168852,0.002815148,0.0067756325,0.0047958535,0.0010092971],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013081721,0.0023906732,0.0024427604,0.004994878,0.0017256612,0.009336548,0.011715016,0.005117954,0.0075353635],"category_scores_gemma":[0.04369455,0.0022361372,0.0043878015,0.0065659755,0.0039140186,0.018231329,0.0072677955,0.006072501,0.0020710456],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00012546882,0.00010332386,0.0014170639,0.00030482604,0.0001363308,0.0003429592,0.00039558593,0.4265677,0.000999367,0.50712085,0.0048216963,0.057664815],"study_design_scores_gemma":[0.000034817607,0.00007396519,0.00021420422,0.00007374649,0.00006176058,0.0002541374,0.00009794003,0.7615389,0.00080566225,0.22126028,0.015540533,0.00004410257],"about_ca_topic_score_codex":0.0134382015,"about_ca_topic_score_gemma":0.010338661,"teacher_disagreement_score":0.0134382015,"about_ca_system_score_codex":0.0054524234,"about_ca_system_score_gemma":0.0056489296,"threshold_uncertainty_score":0.06918353},"labels":[],"label_agreement":null},{"id":"W2143101325","doi":"10.1287/isre.1080.0189","title":"Is Query Reuse Potentially Harmful? Anchoring and Adjustment in Adapting Existing Database Queries","year":2008,"lang":"en","type":"article","venue":"Information Systems Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":59,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Computer science; Database; Anchoring; Domain (mathematical analysis); Correctness; Reuse; Sample (material); Task (project management); SQL; Information retrieval; Query language; Quality (philosophy); Psychology; Programming language","score_opus":0.5884636912233069,"score_gpt":0.5004324123803812,"score_spread":0.08803127884292572,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2143101325","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9382927,0.0009960748,0.046228997,0.0039882567,0.000060126244,0.00024099261,0.000044498665,0.0004498646,0.009698496],"genre_scores_gemma":[0.9894231,0.00026403664,0.008899831,0.000765516,0.000059514998,0.0000764965,0.000032599277,0.0000813275,0.0003975196],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.8893835,0.0713809,0.007223026,0.0052494314,0.023810998,0.002952141],"domain_scores_gemma":[0.53781134,0.33987376,0.05417103,0.04918632,0.016341183,0.0026162954],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.057579342,0.0006416188,0.00077758747,0.0017183946,0.0015606255,0.00369092,0.0015539962,0.002051873,0.0011957735],"category_scores_gemma":[0.36665064,0.0008359222,0.0012601832,0.0019488799,0.0056541176,0.008004792,0.0044087986,0.0022812854,0.0003286955],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0016514417,0.0009117097,0.45007294,0.0012545391,0.0008013648,0.001570529,0.09221923,0.0040154345,0.026343325,0.014615615,0.00266519,0.40387863],"study_design_scores_gemma":[0.00060780544,0.004360115,0.65056676,0.0015025917,0.0017039353,0.010849155,0.09443194,0.037477847,0.04840167,0.10291016,0.04640062,0.00078744435],"about_ca_topic_score_codex":0.0035858117,"about_ca_topic_score_gemma":0.0026874908,"teacher_disagreement_score":0.057579342,"about_ca_system_score_codex":0.0016893503,"about_ca_system_score_gemma":0.0021839247,"threshold_uncertainty_score":0.30451226},"labels":[],"label_agreement":null},{"id":"W2143280119","doi":"10.1111/j.1749-8198.2008.00150.x","title":"Database Ethnographies Using Social Science Methodologies to Enhance Data Analysis and Interpretation","year":2008,"lang":"en","type":"article","venue":"Geography Compass","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":36,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Metadata; Data science; Context (archaeology); Ethnography; Meaning (existential); Computer science; Data collection; Sociology; World Wide Web; Social science; Geography; Epistemology","score_opus":0.44097812542131515,"score_gpt":0.5281685338296038,"score_spread":0.08719040840828868,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2143280119","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.36688486,0.0033257322,0.4913413,0.01423426,0.00035789819,0.009695833,0.0022018296,0.0004823764,0.11147596],"genre_scores_gemma":[0.7084491,0.0024196533,0.27426654,0.0009360231,0.00012208862,0.0076971333,0.0005933528,0.00020530092,0.005310774],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.85673624,0.13106108,0.0047043595,0.0021301862,0.0040250397,0.0013430042],"domain_scores_gemma":[0.7043127,0.2590457,0.0073051644,0.017706243,0.01026592,0.0013642919],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.10027454,0.0006991349,0.0006701528,0.017730925,0.008882821,0.009255534,0.0020669578,0.0014482402,0.0054070028],"category_scores_gemma":[0.11399449,0.00085332047,0.00043831335,0.012611088,0.010965807,0.013672684,0.012870645,0.0019757582,0.0005464434],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006167143,0.00009052786,0.005803148,0.0007297377,0.000028922688,0.0010141332,0.83076376,0.00049938454,0.001718705,0.08317336,0.003502537,0.072614156],"study_design_scores_gemma":[0.000035807447,0.00006305252,0.0038780938,0.001959131,0.000032139706,0.00050125393,0.82003796,0.0020923072,0.0026003746,0.05582408,0.112913504,0.00006219865],"about_ca_topic_score_codex":0.00592352,"about_ca_topic_score_gemma":0.0119091,"teacher_disagreement_score":0.10027454,"about_ca_system_score_codex":0.0066455146,"about_ca_system_score_gemma":0.007390421,"threshold_uncertainty_score":0.5303088},"labels":[],"label_agreement":null},{"id":"W2146738361","doi":"10.1145/1242572.1242802","title":"BlogScope","year":2007,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":72,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Blogosphere; Computer science; Ranking (information retrieval); Information retrieval; Relevance (law); Set (abstract data type); World Wide Web; Data mining; The Internet","score_opus":0.36278635790261693,"score_gpt":0.5270323869453386,"score_spread":0.16424602904272168,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2146738361","genre_codex":"software","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":"software","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.021141443,0.0030051228,0.094139345,0.0032289466,0.002157042,0.0017048611,0.2759843,0.41299176,0.18564717],"genre_scores_gemma":[0.0850923,0.0027285265,0.16938317,0.002851688,0.0008491451,0.001220745,0.5681431,0.030846402,0.13888486],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9987165,0.00015046708,0.0001234109,0.00026532068,0.00063381094,0.00011040053],"domain_scores_gemma":[0.9943348,0.0015175245,0.0003131053,0.0016445348,0.0012244483,0.00096568116],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0015865217,0.00080874877,0.00085065776,0.0033370117,0.0010641828,0.004006914,0.0017867484,0.0009287985,0.061622597],"category_scores_gemma":[0.0073807696,0.0005300193,0.0006206051,0.0035872583,0.00040483233,0.0049378094,0.0031677205,0.0014396776,0.040470704],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005202105,0.00015420362,0.003436308,0.00078013603,0.000058164183,0.00024035656,0.00031743015,0.0005317281,0.003369627,0.0057598916,0.8414843,0.14334767],"study_design_scores_gemma":[0.00014468387,0.00008042793,0.003696583,0.00008417939,0.00003167242,0.0002982583,0.00014335888,0.0058355755,0.0030962564,0.0037978499,0.9827229,0.000068295936],"about_ca_topic_score_codex":0.0052990485,"about_ca_topic_score_gemma":0.007838556,"teacher_disagreement_score":0.061622597,"about_ca_system_score_codex":0.00063548156,"about_ca_system_score_gemma":0.0016280287,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W2148524305","doi":"10.14778/1687627.1687771","title":"Framework for evaluating clustering algorithms in duplicate detection","year":2009,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":232,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Scalability; Cluster analysis; Data mining; Data deduplication; Process (computing); Algorithm; Machine learning; Database","score_opus":0.2418184006816228,"score_gpt":0.4629068859449667,"score_spread":0.2210884852633439,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2148524305","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.028105475,0.0013989379,0.95894456,0.0006685856,0.00012316741,0.00202075,0.0008784202,0.0018990178,0.005961181],"genre_scores_gemma":[0.111879796,0.000395148,0.8841136,0.00017435553,0.00007874138,0.0016521391,0.00086940237,0.00016274957,0.00067410903],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9419968,0.032028615,0.004135181,0.003337024,0.017257826,0.0012445531],"domain_scores_gemma":[0.9364167,0.036468968,0.0055688643,0.008679273,0.011738107,0.001128086],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.058792125,0.0026015257,0.0029192106,0.011800542,0.002354739,0.0056906724,0.0053763054,0.0042554396,0.0017944205],"category_scores_gemma":[0.10664215,0.00083471637,0.0024088775,0.009012589,0.0026959646,0.00483065,0.0059125344,0.0026109472,0.0008506694],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009888812,0.001387541,0.0132535575,0.0012733405,0.0012114419,0.00025337542,0.0007350098,0.5713453,0.009797089,0.15096971,0.008617209,0.24016754],"study_design_scores_gemma":[0.0001858201,0.0011664745,0.0027726737,0.00016800388,0.00019230189,0.00022330823,0.00028831643,0.93214977,0.0057406253,0.04993129,0.007071983,0.00010932784],"about_ca_topic_score_codex":0.007920526,"about_ca_topic_score_gemma":0.0051574674,"teacher_disagreement_score":0.058792125,"about_ca_system_score_codex":0.004568572,"about_ca_system_score_gemma":0.004954954,"threshold_uncertainty_score":0.3109262},"labels":[],"label_agreement":null},{"id":"W2153257312","doi":"10.14778/1687553.1687599","title":"Linkage Query Writer","year":2009,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":25,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; SQL; Linkage (software); Interface (matter); Query language; Relational database; Linked data; Information retrieval; Process (computing); Programming language; Semantic Web","score_opus":0.1069606726619127,"score_gpt":0.37673219067138963,"score_spread":0.26977151800947696,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2153257312","genre_codex":"methods","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0025054528,0.0005531538,0.73061556,0.0013022188,0.00037891505,0.0009559208,0.010260396,0.2336056,0.01982274],"genre_scores_gemma":[0.055718172,0.0010721192,0.81254447,0.00393288,0.0005002337,0.0017905219,0.044807673,0.044889163,0.034744777],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9838792,0.0037951348,0.0021213323,0.003115896,0.0061525963,0.0009358173],"domain_scores_gemma":[0.966402,0.011148562,0.001579564,0.010220328,0.009620065,0.0010294256],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.019570697,0.001707782,0.00256768,0.004568843,0.0020735916,0.009725362,0.0065158373,0.003025261,0.057845797],"category_scores_gemma":[0.04496669,0.0019669675,0.0025509973,0.0041403547,0.0014763887,0.011793788,0.01100076,0.0040966147,0.038239606],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013436674,0.0004344051,0.006096487,0.0016285533,0.00030664826,0.0008737358,0.0019344353,0.004429451,0.011327384,0.08474396,0.47886577,0.40801543],"study_design_scores_gemma":[0.00041257526,0.00016938854,0.000970328,0.00023174097,0.00013681182,0.0009681618,0.0004797951,0.045655664,0.030283116,0.038893323,0.88153625,0.0002627447],"about_ca_topic_score_codex":0.0028881829,"about_ca_topic_score_gemma":0.002081652,"teacher_disagreement_score":0.057845797,"about_ca_system_score_codex":0.0015179254,"about_ca_system_score_gemma":0.0045759683,"threshold_uncertainty_score":0.19351351},"labels":[],"label_agreement":null},{"id":"W2156897283","doi":"10.1002/asi.22695","title":"Author name disambiguation: What difference does it make in author‐based citation analysis?","year":2012,"lang":"en","type":"article","venue":"Journal of the American Society for Information Science and Technology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":134,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Workaround; Citation; Computer science; Ambiguity; Ranking (information retrieval); Field (mathematics); Information retrieval; Citation analysis; Journal ranking; Publication; Data science; World Wide Web; Political science; Mathematics","score_opus":0.09078199573774924,"score_gpt":0.4091928979380296,"score_spread":0.31841090220028034,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2156897283","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.33206052,0.062398408,0.43648902,0.108526304,0.0068202866,0.0004174666,0.0015461335,0.0016983342,0.05004354],"genre_scores_gemma":[0.88136303,0.00627936,0.10177772,0.0041901846,0.0031371913,0.00016283382,0.0005941475,0.0005981516,0.0018972507],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.88422334,0.0762334,0.006983647,0.010260857,0.020987596,0.0013111026],"domain_scores_gemma":[0.507503,0.3837533,0.033434346,0.04008261,0.03296019,0.0022666024],"candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.13068636,0.0010691356,0.0021913603,0.009410322,0.0038636643,0.015013282,0.003114354,0.0027157085,0.0024426964],"category_scores_gemma":[0.44315907,0.00070758467,0.0014957808,0.023871696,0.008268805,0.029222695,0.0045716353,0.0037432539,0.0019452726],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006365787,0.00017187421,0.2649775,0.0017987861,0.0021297222,0.0002896631,0.010192013,0.017320516,0.0024828764,0.1299457,0.020823754,0.549231],"study_design_scores_gemma":[0.00023791446,0.00072693115,0.20666693,0.002682653,0.0014315466,0.0016374226,0.01711156,0.09908291,0.013287963,0.54253817,0.113769926,0.0008260411],"about_ca_topic_score_codex":0.0066401064,"about_ca_topic_score_gemma":0.0069275936,"teacher_disagreement_score":0.9905897,"about_ca_system_score_codex":0.0025867461,"about_ca_system_score_gemma":0.0035228608,"threshold_uncertainty_score":0.69114375},"labels":[{"model":"gemma","categories":["metaresearch","bibliometrics"],"domain":"methods","study_design":"simulation_or_modeling","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":["metaresearch","bibliometrics"],"domain":"methods","study_design":"design_other","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"high"}],"label_agreement":"split"},{"id":"W2156965754","doi":"10.4338/aci-2012-10-cr-0041","title":"Developing a Tool to Assess the Quality of Socio-Demographic Data in Community Health Centres","year":2013,"lang":"en","type":"article","venue":"Applied Clinical Informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Quality (philosophy); Community health; Data quality; Scale (ratio); Computer science; Test (biology); Medicine; Knowledge management; Data science; Nursing; Public health; Metric (unit); Engineering; Operations management","score_opus":0.6774011052767211,"score_gpt":0.5819635008242714,"score_spread":0.09543760445244975,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2156965754","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.51443505,0.0020542506,0.37820488,0.012019936,0.00087832904,0.03860743,0.010662609,0.011437096,0.031700555],"genre_scores_gemma":[0.38782972,0.0006349753,0.5943552,0.0007450871,0.000100498546,0.011093733,0.004094928,0.00020457376,0.00094121124],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8638276,0.07530977,0.021655401,0.004975805,0.030643366,0.003588076],"domain_scores_gemma":[0.61611164,0.2364272,0.04184966,0.015527037,0.08015834,0.009926122],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.14226185,0.0014234154,0.0019257638,0.022135371,0.002436189,0.0080569405,0.0050518573,0.0016683835,0.0028708023],"category_scores_gemma":[0.2855006,0.0011372403,0.002095845,0.0125147775,0.0018815518,0.007953533,0.009139921,0.0020732097,0.000836653],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006323815,0.0015784628,0.24135211,0.0065795947,0.00059268216,0.0006698902,0.028853424,0.0049657505,0.0032852339,0.0038370145,0.02579036,0.6818632],"study_design_scores_gemma":[0.001727702,0.006241317,0.60476893,0.014777107,0.0010630531,0.001919538,0.104589,0.08330658,0.017553449,0.019446146,0.14296904,0.001638086],"about_ca_topic_score_codex":0.012155285,"about_ca_topic_score_gemma":0.013178485,"teacher_disagreement_score":0.14226185,"about_ca_system_score_codex":0.009974968,"about_ca_system_score_gemma":0.027278995,"threshold_uncertainty_score":0.75236154},"labels":[],"label_agreement":null},{"id":"W2159146278","doi":"10.1145/1142473.1142557","title":"Using SPIDER","year":2006,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Spider; Computer science; Matching (statistics); Variety (cybernetics); Component (thermodynamics); Key (lock); Database; Artificial intelligence; Computer security; Mathematics","score_opus":0.5106669315941896,"score_gpt":0.5048891074743921,"score_spread":0.005777824119797548,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2159146278","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00945412,0.0010050426,0.7189107,0.0007641929,0.0003636624,0.00042127102,0.0035581137,0.21921961,0.04630329],"genre_scores_gemma":[0.1527606,0.0021441039,0.7523827,0.0011065673,0.00020386525,0.00071820855,0.023967346,0.023948733,0.042767953],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99718094,0.00059596106,0.00028362154,0.0005292773,0.0012342844,0.00017598172],"domain_scores_gemma":[0.9961009,0.0009506096,0.0002033061,0.0018617094,0.0005678651,0.00031568317],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002427251,0.0010375892,0.0009760127,0.002220357,0.0012602756,0.004698176,0.002030128,0.0012865713,0.02269211],"category_scores_gemma":[0.009372477,0.0008917812,0.0014371106,0.0023414553,0.00085262395,0.0059435056,0.0057548336,0.0013765942,0.018092727],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009968198,0.00030467444,0.0058895834,0.0010969396,0.0004535923,0.0007075002,0.0012585915,0.010336372,0.01383613,0.094647914,0.268408,0.60206383],"study_design_scores_gemma":[0.00019562304,0.00023839208,0.0015036241,0.00019815074,0.00012737498,0.0013235768,0.00038310376,0.07676823,0.017583314,0.14530613,0.7562368,0.00013563679],"about_ca_topic_score_codex":0.0021388931,"about_ca_topic_score_gemma":0.0022215967,"teacher_disagreement_score":0.02269211,"about_ca_system_score_codex":0.0005647283,"about_ca_system_score_gemma":0.0013092584,"threshold_uncertainty_score":0.075912714},"labels":[],"label_agreement":null},{"id":"W2160348740","doi":"10.2218/ijdc.v6i1.176","title":"Towards a Holistic Approach to Policy Interoperability in Digital Libraries and Digital Repositories","year":2011,"lang":"en","type":"article","venue":"International Journal of Digital Curation","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"U.S. Geological Survey","keywords":"Interoperability; Digital library; Computer science; World Wide Web; Metadata; Digital transformation; Digital preservation; Reuse; Key (lock); Digital curation; Domain (mathematical analysis); Cross-domain interoperability; Semantic interoperability; Computer security; Engineering","score_opus":0.20938298116014792,"score_gpt":0.3937515392860538,"score_spread":0.18436855812590586,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2160348740","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015477247,0.004152192,0.8433049,0.057708245,0.00023084137,0.0004771695,0.00014215772,0.00055989705,0.077947475],"genre_scores_gemma":[0.3614486,0.0035670442,0.6226159,0.004648307,0.0002962133,0.0009808086,0.0003212205,0.00018742452,0.0059343907],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.951554,0.029337076,0.003575801,0.0028112915,0.010358021,0.0023638909],"domain_scores_gemma":[0.9701802,0.016388543,0.0024697287,0.005520467,0.0037804097,0.0016606358],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.05394041,0.0011863874,0.0021580062,0.0127848005,0.00673748,0.032529544,0.006606008,0.010304273,0.0026674466],"category_scores_gemma":[0.035080984,0.0019168404,0.0027447164,0.011112378,0.030343326,0.04736264,0.019398857,0.011712743,0.00067503593],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000065394233,0.00003843821,0.00033914263,0.00008196156,0.00002513815,0.00007650098,0.002456421,0.002941129,0.00012137613,0.98527294,0.00062589266,0.008014582],"study_design_scores_gemma":[0.000011785077,0.00001571379,0.00027040613,0.0002775731,0.000028139824,0.000093897965,0.004329181,0.0067664427,0.00032639096,0.9636923,0.024162017,0.000026241185],"about_ca_topic_score_codex":0.010635357,"about_ca_topic_score_gemma":0.0063307933,"teacher_disagreement_score":0.96747047,"about_ca_system_score_codex":0.01930285,"about_ca_system_score_gemma":0.028631024,"threshold_uncertainty_score":0.2852676},"labels":[],"label_agreement":null},{"id":"W2161086867","doi":"10.1109/hicss.2003.1174352","title":"Storage model for CDA documents","year":2003,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Computer science; Relational database; XML; Information retrieval; Object (grammar); Markup language; Semantics (computer science); Database; Programming language; World Wide Web; Artificial intelligence","score_opus":0.32907078921171257,"score_gpt":0.47476268010164474,"score_spread":0.14569189088993217,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2161086867","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.018345028,0.0014411162,0.93446225,0.0026199452,0.0004442099,0.0007036282,0.0045478377,0.006396809,0.031039074],"genre_scores_gemma":[0.2896087,0.0029544747,0.6275673,0.0012420268,0.0004326915,0.0017778848,0.011443626,0.0012720725,0.06370124],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9959527,0.00073754846,0.0009052646,0.0006797071,0.0013381412,0.0003865312],"domain_scores_gemma":[0.9902462,0.0022846295,0.00072238036,0.0035704894,0.0028003266,0.0003760466],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00444047,0.0007167531,0.0010549689,0.003571909,0.0023284513,0.01457979,0.0047694063,0.0025902735,0.012833742],"category_scores_gemma":[0.011381442,0.00079847383,0.0018025511,0.0053096963,0.0019350069,0.0128661385,0.0034567646,0.001591213,0.0093443],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00042369575,0.00013766541,0.0018500886,0.00051227625,0.00006739738,0.0007416205,0.0013926865,0.057493787,0.0053448393,0.82523954,0.02402571,0.082770705],"study_design_scores_gemma":[0.00016359918,0.00026037873,0.00073685765,0.0003380221,0.00014147382,0.0015766707,0.0008362218,0.33425727,0.013726424,0.35197967,0.29581746,0.00016599841],"about_ca_topic_score_codex":0.010296777,"about_ca_topic_score_gemma":0.0061646844,"teacher_disagreement_score":0.01457979,"about_ca_system_score_codex":0.003947,"about_ca_system_score_gemma":0.004376459,"threshold_uncertainty_score":0.042933166},"labels":[],"label_agreement":null},{"id":"W2169710203","doi":"10.1504/ijiq.2008.019560","title":"Information quality chain analysis for total information quality management","year":2008,"lang":"en","type":"article","venue":"International Journal of Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Saint Mary's University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Information quality; Quality (philosophy); Data quality; Information management; Knowledge management; Information system; Information retrieval; Business","score_opus":0.1660276901368132,"score_gpt":0.459138105283643,"score_spread":0.2931104151468298,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2169710203","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006050219,0.00085039024,0.97272193,0.0005614727,0.0000764591,0.00025649174,0.00027560093,0.00020226488,0.019005194],"genre_scores_gemma":[0.2509207,0.0018352239,0.7390687,0.00027681168,0.00016810432,0.00088665937,0.0008453337,0.0001547262,0.0058437013],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99303997,0.0032457605,0.00045686233,0.00053581304,0.0024568655,0.00026474695],"domain_scores_gemma":[0.9894215,0.0057465783,0.0011092512,0.001284117,0.0022611187,0.00017747968],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0067658406,0.0009622813,0.0006530661,0.0072540944,0.0014802819,0.0041524777,0.0010808078,0.0008880109,0.0149671],"category_scores_gemma":[0.018733207,0.0003231853,0.0015397421,0.012427238,0.0019703112,0.0058958516,0.002196284,0.0017930553,0.0014736293],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000041037885,0.000058503858,0.0031205185,0.0003505003,0.00009080797,0.00008582362,0.00048327202,0.032284863,0.00064762164,0.82836705,0.0033742893,0.13109584],"study_design_scores_gemma":[0.000016363534,0.00008721681,0.002265194,0.00028446814,0.000086734726,0.000090711204,0.0006108731,0.2065676,0.0016799236,0.75885797,0.02939962,0.00005325694],"about_ca_topic_score_codex":0.0073795263,"about_ca_topic_score_gemma":0.0038485187,"teacher_disagreement_score":0.0149671,"about_ca_system_score_codex":0.0038978874,"about_ca_system_score_gemma":0.004512555,"threshold_uncertainty_score":0.050069988},"labels":[],"label_agreement":null},{"id":"W2170688652","doi":"10.1007/s00778-007-0067-9","title":"Applications of corpus-based semantic similarity and word segmentation to database schema matching","year":2007,"lang":"en","type":"article","venue":"The VLDB Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":26,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Schema matching; Computer science; Semantic similarity; Artificial intelligence; Schema (genetic algorithms); Star schema; Natural language processing; Information retrieval; Segmentation; Pattern recognition (psychology); Database schema; Data mining; Data integration","score_opus":0.1166235600128447,"score_gpt":0.4294959857511475,"score_spread":0.3128724257383028,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2170688652","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.087731756,0.0016429276,0.89731705,0.00069616997,0.00019119296,0.000377973,0.0012845567,0.003974736,0.0067835557],"genre_scores_gemma":[0.3245328,0.0007950961,0.66948104,0.0001539444,0.00010726123,0.00025709302,0.0029981444,0.0005318079,0.0011428744],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9953908,0.001990187,0.0006650296,0.0006860617,0.0011453221,0.00012253955],"domain_scores_gemma":[0.9822104,0.011597368,0.0007956791,0.002304488,0.0028222553,0.00026973317],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004904095,0.00054207304,0.001111243,0.010697845,0.0013743155,0.004032878,0.0015485914,0.0010182017,0.0039217896],"category_scores_gemma":[0.030561551,0.0004899811,0.000765036,0.011822916,0.0014636952,0.005064588,0.0020828717,0.0008781508,0.000922015],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00066971936,0.0004790099,0.009518186,0.0007994192,0.0003343703,0.0003659847,0.00244703,0.030786587,0.025090657,0.08084552,0.00869566,0.8399679],"study_design_scores_gemma":[0.00018800901,0.0002686151,0.0067073326,0.00021070293,0.0002709236,0.00094886386,0.0024550518,0.73573184,0.03135468,0.19494063,0.026786812,0.00013654852],"about_ca_topic_score_codex":0.0063467505,"about_ca_topic_score_gemma":0.006656075,"teacher_disagreement_score":0.010697845,"about_ca_system_score_codex":0.0014222182,"about_ca_system_score_gemma":0.002580957,"threshold_uncertainty_score":0.02593565},"labels":[],"label_agreement":null},{"id":"W2170712852","doi":"10.14778/2536258.2536262","title":"Discovering denial constraints","year":2013,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":252,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Rotation formalisms in three dimensions; Scalability; Inference; Data integrity; Set (abstract data type); Functional dependency; Constraint (computer-aided design); Theoretical computer science; Rank (graph theory); Semantics (computer science); Function (biology); Data mining; Artificial intelligence; Programming language; Database; Relational database","score_opus":0.08220481571088507,"score_gpt":0.3393964871060694,"score_spread":0.25719167139518434,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2170712852","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.063680425,0.0010135486,0.90881777,0.004080155,0.00025331488,0.0008495224,0.0064142724,0.0037341616,0.011156847],"genre_scores_gemma":[0.35496354,0.000549057,0.62687516,0.001354953,0.00018242103,0.00047059183,0.011079638,0.0007399461,0.0037846258],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9747038,0.007525744,0.002251216,0.00443259,0.009265797,0.0018208324],"domain_scores_gemma":[0.94536006,0.033583045,0.0032669096,0.008111537,0.008476475,0.0012019246],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010028486,0.001878893,0.0021406065,0.005793695,0.0028175898,0.0054228473,0.0048436513,0.0024929447,0.0060765715],"category_scores_gemma":[0.06524177,0.001217365,0.002575205,0.00521947,0.001869019,0.01194757,0.005861333,0.0043458138,0.0014685246],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000666251,0.0005313721,0.03876958,0.0017199554,0.00052659627,0.001871795,0.0012233825,0.111981764,0.011172602,0.23649277,0.056818943,0.53822505],"study_design_scores_gemma":[0.00007268655,0.000079262194,0.0029103525,0.0002359403,0.00014200316,0.0011650067,0.0011452487,0.6139483,0.0162853,0.31896272,0.04493577,0.00011747353],"about_ca_topic_score_codex":0.008869141,"about_ca_topic_score_gemma":0.011006945,"teacher_disagreement_score":0.010028486,"about_ca_system_score_codex":0.0027524345,"about_ca_system_score_gemma":0.0067490707,"threshold_uncertainty_score":0.053036332},"labels":[],"label_agreement":null},{"id":"W2171332293","doi":"10.1145/1366102.1366103","title":"Conditional functional dependencies for capturing data inconsistencies","year":2008,"lang":"en","type":"article","venue":"ACM Transactions on Database Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":458,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Bell (Canada)","funders":"Engineering and Physical Sciences Research Council","keywords":"Computer science; Functional dependency; Data integrity; Consistency (knowledge bases); Relational database; SQL; Data mining; Set (abstract data type); Schema (genetic algorithms); Database; Programming language; Theoretical computer science; Algorithm; Information retrieval; Artificial intelligence","score_opus":0.5917106512846138,"score_gpt":0.4156652633131301,"score_spread":0.17604538797148367,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2171332293","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014289715,0.0002522221,0.9796801,0.00044696988,0.0000645448,0.00018776473,0.0010892242,0.002497668,0.0014916924],"genre_scores_gemma":[0.24742,0.00033186268,0.7472166,0.00050925935,0.00009172968,0.00033564636,0.0022078482,0.00054350833,0.0013436428],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9896253,0.0024083557,0.0009249324,0.0018200872,0.0045621647,0.00065924093],"domain_scores_gemma":[0.9679843,0.01933556,0.0029470064,0.0053032762,0.0040651374,0.00036463712],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0059604896,0.0014937815,0.001008972,0.003373366,0.0013902142,0.002483564,0.0036197691,0.0014716295,0.004050264],"category_scores_gemma":[0.032023925,0.0010279831,0.0019267814,0.0031944667,0.0020399545,0.0072788573,0.0031405154,0.0034816687,0.0005684242],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005351298,0.00030448032,0.020626577,0.001195576,0.00026014788,0.0013535963,0.0010277877,0.25480938,0.023103612,0.35385057,0.016543103,0.32639],"study_design_scores_gemma":[0.000062278945,0.00015816547,0.0023927263,0.00017919947,0.00014578446,0.00094339176,0.00025014495,0.75459087,0.033036456,0.18093623,0.027165236,0.00013950255],"about_ca_topic_score_codex":0.009169787,"about_ca_topic_score_gemma":0.011122894,"teacher_disagreement_score":0.009169787,"about_ca_system_score_codex":0.0021762538,"about_ca_system_score_gemma":0.003973315,"threshold_uncertainty_score":0.031522512},"labels":[],"label_agreement":null},{"id":"W2171886215","doi":"","title":"Concordia University at the TREC 2007 QA Track.","year":2006,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Computer science; Track (disk drive); Database; Information retrieval; World Wide Web; Operating system","score_opus":0.10365957539795251,"score_gpt":0.34946924935584534,"score_spread":0.24580967395789283,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2171886215","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.045134336,0.0051774867,0.079553664,0.0072670677,0.0039141397,0.005499676,0.31723154,0.16158833,0.37463376],"genre_scores_gemma":[0.083467856,0.0010709965,0.12655954,0.0019624697,0.0005797424,0.0022976408,0.53742355,0.0071171178,0.2395211],"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9931732,0.002574615,0.00033875383,0.0012791291,0.0020240152,0.00061041175],"domain_scores_gemma":[0.98951364,0.0020469015,0.00026998762,0.002195742,0.0052010347,0.00077262777],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011123765,0.0014240633,0.0017150807,0.0055177766,0.0023203194,0.0037285734,0.0020680625,0.0016669576,0.08859458],"category_scores_gemma":[0.014456158,0.0007902243,0.00074569456,0.003665103,0.00060853106,0.0035683045,0.0025417213,0.0018706387,0.06803056],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002419608,0.00026109285,0.0011126037,0.0002711262,0.000035019526,0.00004796266,0.0002155618,0.00051857706,0.002789223,0.0027839998,0.90725976,0.084463194],"study_design_scores_gemma":[0.00029934265,0.00021548303,0.008362379,0.00017136933,0.00004841985,0.00011728007,0.0003497563,0.019738391,0.013014638,0.003117038,0.95446384,0.0001020716],"about_ca_topic_score_codex":0.07284252,"about_ca_topic_score_gemma":0.08508572,"teacher_disagreement_score":0.92715746,"about_ca_system_score_codex":0.0056354734,"about_ca_system_score_gemma":0.004674682,"threshold_uncertainty_score":0.29637843},"labels":[],"label_agreement":null},{"id":"W2175789071","doi":"10.1109/sdsoa.2007.9","title":"Mined-Knowledge and Decision Support Services in Electronic Health","year":2007,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":25,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"McMaster University","funders":"","keywords":"Service-oriented architecture; Information sharing; Decision support system; Computer science; Service (business); Information system; Clinical decision support system; Knowledge management; Identification (biology); Data sharing; Intelligent transportation system; Business; Computer security; Web service; World Wide Web; Engineering; Data mining; Transport engineering","score_opus":0.0776813602794446,"score_gpt":0.44896466930816425,"score_spread":0.37128330902871964,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2175789071","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.233551,0.0036391858,0.70483345,0.017767295,0.00014292251,0.00051853794,0.0020764,0.0028650793,0.03460618],"genre_scores_gemma":[0.6800851,0.0011447173,0.3143806,0.00060843216,0.000052837127,0.00009295952,0.0011665804,0.00008452849,0.0023841513],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9959972,0.0018107998,0.00039490225,0.00039023877,0.0012242687,0.00018267617],"domain_scores_gemma":[0.9934993,0.0043727015,0.000302876,0.0011504932,0.0005090294,0.00016570807],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005332893,0.0004101811,0.0006197208,0.0023302464,0.0010150075,0.0045591984,0.0013580188,0.0013158777,0.0025298693],"category_scores_gemma":[0.015397428,0.0004269675,0.00066880527,0.00336371,0.0014919101,0.0051225135,0.0028933107,0.00077228644,0.0007145549],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008358605,0.0008885555,0.021145293,0.0011622583,0.00027539136,0.0035038842,0.0070365844,0.062068596,0.007943212,0.24907243,0.01385115,0.63221675],"study_design_scores_gemma":[0.00011704917,0.00015656307,0.005181963,0.00043030607,0.0001174302,0.0015674827,0.003808996,0.4696647,0.022105016,0.43539643,0.06138348,0.0000705611],"about_ca_topic_score_codex":0.004217995,"about_ca_topic_score_gemma":0.004438472,"teacher_disagreement_score":0.005332893,"about_ca_system_score_codex":0.0013454842,"about_ca_system_score_gemma":0.0020348984,"threshold_uncertainty_score":0.028203368},"labels":[],"label_agreement":null},{"id":"W2181680766","doi":"10.3217/jucs-020-11-1564","title":"A Model to Guide the Open Government Data Implementation in Public Agencies","year":2014,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"International Development Research Centre","keywords":"Open government; Open data; Computer science; Capability Maturity Model; Maturity (psychological); Government (linguistics); Open source; Latin Americans; Data science; Simple (philosophy); Knowledge management; Process management; World Wide Web; Political science; Business","score_opus":0.4763705506484579,"score_gpt":0.4486828361147665,"score_spread":0.0276877145336914,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2181680766","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.020845462,0.00019726343,0.84752524,0.023967922,0.0001596955,0.0028086647,0.0010309207,0.0025780208,0.10088683],"genre_scores_gemma":[0.1442864,0.00026854267,0.8428913,0.0008453734,0.000024861078,0.0016705862,0.0010080632,0.00020106838,0.008803878],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98072505,0.009648225,0.001634893,0.0018008461,0.00478687,0.0014041584],"domain_scores_gemma":[0.97457224,0.010872277,0.0023648408,0.0030398737,0.0071135457,0.002037245],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.021299614,0.0013494343,0.0005964456,0.0067695263,0.0041312245,0.012929014,0.0034476174,0.0047687115,0.007958678],"category_scores_gemma":[0.030693978,0.00097440905,0.0016218502,0.004334925,0.0054002833,0.015303545,0.006770899,0.004039568,0.0034580543],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006246285,0.00044667884,0.009399983,0.00034690695,0.000045190864,0.0004158045,0.008355811,0.02976418,0.00087694,0.84432656,0.013070724,0.092888735],"study_design_scores_gemma":[0.00019062452,0.00034838164,0.0041902135,0.0016888097,0.0000756126,0.0005935739,0.018556572,0.1433019,0.0031227614,0.48922455,0.33842918,0.00027781076],"about_ca_topic_score_codex":0.023750326,"about_ca_topic_score_gemma":0.02082702,"teacher_disagreement_score":0.023750326,"about_ca_system_score_codex":0.011468462,"about_ca_system_score_gemma":0.025401054,"threshold_uncertainty_score":0.11264449},"labels":[],"label_agreement":null},{"id":"W2185266341","doi":"","title":"THUNLP at TAC KBP 2011 in Entity Linking","year":2011,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Entity linking; Ranking (information retrieval); Pairwise comparison; Task (project management); Information retrieval; String (physics); Context (archaeology); Knowledge base; Similarity (geometry); Key (lock); Rank (graph theory); Artificial intelligence; Natural language processing; Data mining; Image (mathematics); Mathematics","score_opus":0.09715954466342638,"score_gpt":0.3532432388839121,"score_spread":0.2560836942204857,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2185266341","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.11403373,0.0066350643,0.61324394,0.017996328,0.010723484,0.0036862225,0.0563004,0.07739778,0.09998305],"genre_scores_gemma":[0.18572827,0.002100874,0.54791826,0.0023456316,0.001396587,0.0014555234,0.13164656,0.005562596,0.121845774],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9896869,0.0040772404,0.00051517633,0.0019144564,0.0030274508,0.0007786809],"domain_scores_gemma":[0.9849284,0.004103778,0.00048914715,0.0031937174,0.005562595,0.0017223852],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.018458955,0.0014528123,0.0012294381,0.0036383506,0.003974638,0.005323606,0.0027694837,0.0032991688,0.019089406],"category_scores_gemma":[0.020718463,0.000830538,0.0008730669,0.006197429,0.000887604,0.008564908,0.004195991,0.0037447675,0.018994609],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011559284,0.0015075608,0.007384573,0.0006046881,0.00020945923,0.0009800913,0.0016663712,0.009384614,0.011976481,0.00723446,0.50132346,0.4565724],"study_design_scores_gemma":[0.0007050422,0.0012189109,0.012451122,0.00024666928,0.00024874674,0.0012124295,0.0012137032,0.12391075,0.05780093,0.015119794,0.78551173,0.00036021642],"about_ca_topic_score_codex":0.03128752,"about_ca_topic_score_gemma":0.037489068,"teacher_disagreement_score":0.03128752,"about_ca_system_score_codex":0.0022902524,"about_ca_system_score_gemma":0.004261374,"threshold_uncertainty_score":0.09762144},"labels":[],"label_agreement":null},{"id":"W2188957661","doi":"","title":"Linguistic Resources for 2011 Knowledge Base Population Evaluation.","year":2011,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"NIST; Computer science; Annotation; Knowledge base; Information extraction; Entity linking; Resource (disambiguation); Population; Information retrieval; Natural language processing; Artificial intelligence; Data science; World Wide Web","score_opus":0.15970588089702853,"score_gpt":0.40998874252481454,"score_spread":0.250282861627786,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2188957661","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.034764882,0.0034666164,0.35060322,0.014328413,0.0022307488,0.014990375,0.20356765,0.034793466,0.3412546],"genre_scores_gemma":[0.07393109,0.0012446425,0.5885644,0.0015527683,0.00026836863,0.012543961,0.2623339,0.0051813126,0.05437948],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9560475,0.017890906,0.0041343784,0.0018154973,0.018963832,0.0011478702],"domain_scores_gemma":[0.9141062,0.02056509,0.0031622113,0.0106227435,0.048588928,0.0029548127],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0436629,0.0013485684,0.001260466,0.01211283,0.004366966,0.007929853,0.0040769354,0.0023317712,0.041083496],"category_scores_gemma":[0.11011813,0.0009405939,0.0010397943,0.010301598,0.0010250937,0.0071698963,0.006593428,0.0023581996,0.02636562],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00074666855,0.0007211486,0.0033196884,0.0015424946,0.00009866398,0.0003004343,0.0016481661,0.0060405913,0.0044962144,0.03620684,0.46218175,0.4826974],"study_design_scores_gemma":[0.00028874807,0.0002527538,0.0061654747,0.0014792447,0.0001615221,0.00032242603,0.0017181579,0.020989113,0.016971353,0.022037908,0.9293756,0.00023774045],"about_ca_topic_score_codex":0.030303339,"about_ca_topic_score_gemma":0.02965655,"teacher_disagreement_score":0.0436629,"about_ca_system_score_codex":0.0074834954,"about_ca_system_score_gemma":0.022398038,"threshold_uncertainty_score":0.23091418},"labels":[],"label_agreement":null},{"id":"W2189052568","doi":"10.14778/2850583.2850586","title":"The iBench integration metadata generator","year":2015,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":59,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Metadata; Computer science; Schema evolution; Data integration; Generality; Schema (genetic algorithms); Generator (circuit theory); Data mapping; Data element; Data science; Information retrieval; Data mining; Database; World Wide Web; Database schema","score_opus":0.2684436286050799,"score_gpt":0.39426327919983467,"score_spread":0.12581965059475475,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2189052568","genre_codex":"methods","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.045728046,0.0006375628,0.49358281,0.0011393466,0.0006122246,0.0026828924,0.015424799,0.41694412,0.023248132],"genre_scores_gemma":[0.22860622,0.00060116267,0.65722114,0.00093843567,0.00015086783,0.0036947888,0.057286076,0.03996333,0.011537927],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9949244,0.0012729967,0.00068463635,0.0006499757,0.0021388673,0.00032910105],"domain_scores_gemma":[0.98130196,0.006048956,0.0007543368,0.0073435716,0.0037135568,0.00083769136],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010562896,0.0015749226,0.0009364938,0.004237203,0.0012177501,0.0038574976,0.004111745,0.0014121709,0.0104395775],"category_scores_gemma":[0.039223056,0.0015017636,0.0013452267,0.0031702002,0.0012173296,0.0052701156,0.0071255974,0.0030413985,0.0054846425],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0035891202,0.0020415368,0.030168256,0.0025393092,0.00045428987,0.0019982865,0.0036230357,0.07137456,0.030587593,0.088142894,0.2579482,0.50753295],"study_design_scores_gemma":[0.0010942215,0.00084449723,0.0059450227,0.0004959655,0.00019337445,0.0009596358,0.0009220625,0.5072443,0.07644674,0.066217706,0.33925876,0.00037776394],"about_ca_topic_score_codex":0.0032056158,"about_ca_topic_score_gemma":0.0022504753,"teacher_disagreement_score":0.010562896,"about_ca_system_score_codex":0.0015392151,"about_ca_system_score_gemma":0.003282546,"threshold_uncertainty_score":0.055862606},"labels":[],"label_agreement":null},{"id":"W2190899134","doi":"10.14778/2850578.2850579","title":"Messing up with BART","year":2015,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":80,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Scalability; Tuple; Computer science; Benchmarking; Completeness (order theory); Greedy algorithm; Process (computing); Benchmark (surveying); Property (philosophy); Scale (ratio); Control (management); Mathematical optimization; Algorithm; Database; Mathematics; Artificial intelligence; Programming language","score_opus":0.2772987549438379,"score_gpt":0.3926154589624858,"score_spread":0.11531670401864791,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2190899134","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10082119,0.0019633283,0.8649973,0.0076547395,0.00065462536,0.00023554444,0.0015204378,0.0035747963,0.018578015],"genre_scores_gemma":[0.6928823,0.0015139712,0.28527236,0.0019407201,0.00047627612,0.0002945711,0.002625486,0.001064332,0.01393005],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99037814,0.0027576508,0.0006147687,0.0022158464,0.003154902,0.0008787841],"domain_scores_gemma":[0.93841195,0.027278237,0.0044221687,0.022964537,0.0054696742,0.0014535175],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.012157496,0.00074120634,0.0014042972,0.0022441617,0.001964065,0.0052579483,0.0031294744,0.0018330895,0.009954876],"category_scores_gemma":[0.07621719,0.000671392,0.0011584188,0.0033112736,0.0037763442,0.0110402005,0.0058099995,0.002596701,0.0027232803],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008437378,0.00032042578,0.020713445,0.00052668154,0.00024665133,0.0010999211,0.0017863599,0.14541118,0.004094273,0.45317465,0.038467854,0.33331487],"study_design_scores_gemma":[0.00008081607,0.00023095553,0.0029496944,0.00017745547,0.00009290198,0.00079369964,0.00083880575,0.3059918,0.0064091543,0.6264041,0.055941198,0.000089498],"about_ca_topic_score_codex":0.0023797376,"about_ca_topic_score_gemma":0.0014902019,"teacher_disagreement_score":0.012157496,"about_ca_system_score_codex":0.0010142699,"about_ca_system_score_gemma":0.0020297968,"threshold_uncertainty_score":0.06429577},"labels":[],"label_agreement":null},{"id":"W2218881374","doi":"","title":"Trusted Data in IBM's Master Data Management","year":2011,"lang":"en","type":"article","venue":"Databases, Knowledge, and Data Applications","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"IBM; Computer science; Master data; Data quality; Quality (philosophy); Data warehouse; Process (computing); Data governance; Data modeling; Database; Process management; Data science; Operating system; Engineering; Operations management","score_opus":0.6106244189975273,"score_gpt":0.4788549332639887,"score_spread":0.13176948573353858,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2218881374","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0914806,0.007340105,0.8116284,0.029093558,0.0006297895,0.00027259273,0.0006240466,0.0025581408,0.05637282],"genre_scores_gemma":[0.6754409,0.0028239777,0.3095503,0.00093445665,0.00053332007,0.00016442673,0.0004683081,0.00032437826,0.009759937],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9883537,0.0038273977,0.00093458197,0.0010800398,0.0052255983,0.00057870045],"domain_scores_gemma":[0.9892356,0.0036717437,0.0014573116,0.0030155566,0.001933805,0.0006860646],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.012980238,0.00040174692,0.00058068306,0.0020645051,0.0020232708,0.009590116,0.0011218137,0.0012924623,0.002052491],"category_scores_gemma":[0.020517277,0.0005851162,0.0005843374,0.0046186983,0.0039554336,0.01099337,0.003634277,0.0030610207,0.00064327935],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017575559,0.000048048354,0.006370526,0.00013105877,0.000032211505,0.000294323,0.0023013535,0.015911862,0.0012358646,0.79980433,0.011587636,0.16210698],"study_design_scores_gemma":[0.00008015226,0.00017122972,0.002727202,0.0002866063,0.0000741674,0.0005683974,0.0017321287,0.13949186,0.0071083466,0.63499403,0.21267028,0.000095628355],"about_ca_topic_score_codex":0.009819113,"about_ca_topic_score_gemma":0.005346729,"teacher_disagreement_score":0.012980238,"about_ca_system_score_codex":0.004565392,"about_ca_system_score_gemma":0.004596551,"threshold_uncertainty_score":0.06864691},"labels":[],"label_agreement":null},{"id":"W2229414573","doi":"10.1007/978-3-319-23201-0_10","title":"Data Warehouse Design Methods Review: Trends, Challenges and Future Directions for the Healthcare Domain","year":2015,"lang":"en","type":"book-chapter","venue":"Communications in computer and information science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Centre Hospitalier Universitaire de Sherbrooke; Université de Sherbrooke","funders":"","keywords":"Computer science; Data warehouse; Traceability; Schema (genetic algorithms); Data integration; Data science; Information integration; Domain (mathematical analysis); Information retrieval; Software engineering; Database; Data mining","score_opus":0.6732383815595341,"score_gpt":0.543693081677569,"score_spread":0.12954529988196506,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2229414573","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0003109889,0.9690058,0.016510354,0.010241926,0.0017288558,0.000061331855,0.00038818413,0.00011378392,0.0016386183],"genre_scores_gemma":[0.002142993,0.9434825,0.043812376,0.0060867867,0.0018480443,0.00016716441,0.000719867,0.00013666297,0.0016036378],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.98864937,0.004924643,0.0018098523,0.00070367125,0.003694594,0.00021794872],"domain_scores_gemma":[0.8568592,0.113943726,0.0037628324,0.002886715,0.021251552,0.0012959593],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.039368987,0.0009553727,0.0026780204,0.007219911,0.00056217355,0.0068143993,0.003698364,0.0017324795,0.0052436274],"category_scores_gemma":[0.071001545,0.0010381459,0.002114397,0.014704291,0.0015519549,0.007704763,0.0023801846,0.0044780844,0.0022555625],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000047701476,0.00006356095,0.0007104989,0.019507032,0.00030498285,0.000041233514,0.0003075555,0.00057175895,0.0003289563,0.01758629,0.13071659,0.82981384],"study_design_scores_gemma":[0.000034875186,0.0000911756,0.00088025694,0.022775814,0.00031369322,0.00031661068,0.00031754898,0.0012282687,0.00042324723,0.02551382,0.9480385,0.000066109045],"about_ca_topic_score_codex":0.0042172056,"about_ca_topic_score_gemma":0.01175213,"teacher_disagreement_score":0.039368987,"about_ca_system_score_codex":0.0028447015,"about_ca_system_score_gemma":0.011118804,"threshold_uncertainty_score":0.20820558},"labels":[],"label_agreement":null},{"id":"W2237543400","doi":"","title":"Declarative entity resolution via matching dependencies and answer set programs","year":2012,"lang":"en","type":"article","venue":"Principles of Knowledge Representation and Reasoning","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":22,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia; Carleton University","funders":"","keywords":"Computer science; Expressive power; Matching (statistics); Programming language; Set (abstract data type); Theoretical computer science; Invariant (physics); Semantics (computer science); Task (project management); Class (philosophy); Artificial intelligence; Mathematics","score_opus":0.23934077864338069,"score_gpt":0.4310733909013771,"score_spread":0.1917326122579964,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2237543400","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00887162,0.00011131106,0.98687565,0.00078326266,0.000021316926,0.000088736364,0.0001819249,0.0006760658,0.00239013],"genre_scores_gemma":[0.18767111,0.00038560663,0.80533946,0.000677057,0.00013828733,0.0005021943,0.001161005,0.00028250998,0.0038427608],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98957413,0.003960559,0.0009328727,0.0016649407,0.0031513188,0.0007161637],"domain_scores_gemma":[0.98415864,0.01158065,0.0011316425,0.0016415982,0.0012477911,0.00023960903],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0092523955,0.0008937547,0.00084082206,0.0022167882,0.00093730923,0.0042024613,0.0029775063,0.001974319,0.003582673],"category_scores_gemma":[0.022061672,0.0008610516,0.0026281767,0.0018433706,0.0045995694,0.008326898,0.0052682017,0.0036510588,0.00062866416],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00011652169,0.00015070761,0.00092239166,0.00030942285,0.000077610865,0.0003241721,0.0011451172,0.04834589,0.002947867,0.88587075,0.0023161208,0.05747338],"study_design_scores_gemma":[0.000054674794,0.00005833611,0.00018913898,0.000080791084,0.00007641469,0.00023125997,0.0002150049,0.23095097,0.0069294614,0.7498003,0.011373612,0.000039944363],"about_ca_topic_score_codex":0.0018363862,"about_ca_topic_score_gemma":0.001777651,"teacher_disagreement_score":0.0092523955,"about_ca_system_score_codex":0.0015571617,"about_ca_system_score_gemma":0.0017176667,"threshold_uncertainty_score":0.048931956},"labels":[],"label_agreement":null},{"id":"W2237788583","doi":"","title":"Stepwise Variable Selection for Loglinear Mixture in Record Linkage","year":2010,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of New Brunswick; McMaster University","funders":"","keywords":"Log-linear model; Overfitting; Mathematics; Model selection; Covariate; Selection (genetic algorithm); Mixture model; Statistical model; Linkage (software); Probabilistic logic; Statistics; Linear model; Artificial intelligence; Computer science","score_opus":0.09442882874722106,"score_gpt":0.404395673341274,"score_spread":0.309966844594053,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2237788583","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00360125,0.00009453351,0.99536514,0.00009365027,0.000017842744,0.00006953706,0.00007729675,0.00053943845,0.0001414197],"genre_scores_gemma":[0.11734956,0.00038669506,0.87638974,0.00023136518,0.00011592107,0.0012280684,0.001588646,0.00038406358,0.0023259781],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98597187,0.009429627,0.00054919027,0.0021962437,0.0012150203,0.00063814904],"domain_scores_gemma":[0.9843975,0.011438854,0.0010110853,0.0012407444,0.0015341061,0.00037768442],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.020428386,0.0020749487,0.0034762842,0.004698406,0.0025218104,0.0032401725,0.007022035,0.0021079206,0.0054582627],"category_scores_gemma":[0.03058545,0.0016401659,0.005380131,0.0052243196,0.0016413415,0.0037993942,0.006485777,0.003502598,0.0021117448],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00058716274,0.0004321124,0.021890312,0.00055216916,0.0011611813,0.0008728357,0.0015074138,0.4360749,0.003060894,0.1272585,0.007226432,0.3993761],"study_design_scores_gemma":[0.00003859272,0.00007529882,0.0007836603,0.00003391796,0.000097249875,0.00010715989,0.00006374093,0.9662791,0.0007899452,0.029603595,0.00208156,0.000046230864],"about_ca_topic_score_codex":0.0077180555,"about_ca_topic_score_gemma":0.008057665,"teacher_disagreement_score":0.020428386,"about_ca_system_score_codex":0.0012880076,"about_ca_system_score_gemma":0.004993141,"threshold_uncertainty_score":0.108036935},"labels":[],"label_agreement":null},{"id":"W2238711864","doi":"10.1561/9781680830231","title":"Trends in Cleaning Relational Data: Consistency and Deduplication","year":2015,"lang":"en","type":"book","venue":"now publishers, Inc. eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":84,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Data quality; Computer science; Data deduplication; Data integrity; Relational database; Consistency (knowledge bases); Anomaly detection; Data consistency; Data mining; Data science; Automation; Process (computing); Data warehouse; Database; Quality (philosophy); Artificial intelligence; Engineering","score_opus":0.32777355947557785,"score_gpt":0.4006223382773515,"score_spread":0.07284877880177365,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2238711864","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.027584858,0.37394097,0.3885497,0.10103338,0.0066201063,0.00054478075,0.003810104,0.00509287,0.092823304],"genre_scores_gemma":[0.13380957,0.33154887,0.45351514,0.022654753,0.00760151,0.0004296119,0.009878591,0.0023509457,0.03821102],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9854219,0.0021797905,0.001132245,0.0015687054,0.009298247,0.00039918066],"domain_scores_gemma":[0.95655984,0.016972397,0.0034761154,0.0077339783,0.014215218,0.0010424579],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010984586,0.00068217027,0.0009068547,0.005752338,0.0014832407,0.009137965,0.0038173725,0.0020531125,0.008178614],"category_scores_gemma":[0.03156237,0.0008918704,0.000937893,0.014835537,0.002689613,0.018266683,0.004818475,0.0034064904,0.0046129124],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00012213232,0.00008134067,0.0054431,0.0021539356,0.000060823473,0.00022639733,0.0011931701,0.0019549206,0.004160232,0.07652466,0.108171575,0.79990774],"study_design_scores_gemma":[0.000024978342,0.000108670596,0.0053110044,0.0016217643,0.00005749675,0.0018049451,0.0018258172,0.007627277,0.008124229,0.05804368,0.9153707,0.00007936966],"about_ca_topic_score_codex":0.0032954954,"about_ca_topic_score_gemma":0.0027189648,"teacher_disagreement_score":0.010984586,"about_ca_system_score_codex":0.0027796347,"about_ca_system_score_gemma":0.0024660842,"threshold_uncertainty_score":0.058092713},"labels":[],"label_agreement":null},{"id":"W2250240387","doi":"","title":"How Joe and Jane Tweet about Their Health: Mining for Personal Health Information on Twitter","year":2013,"lang":"en","type":"article","venue":"Recent Advances in Natural Language Processing","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University; University of Ottawa","funders":"","keywords":"WordNet; Computer science; Social media; World Wide Web; Ontology; The Internet; Personally identifiable information; Information retrieval; Internet privacy; Information extraction; Health information; Data science; Health care; Computer security","score_opus":0.06336643424205922,"score_gpt":0.40170521289053357,"score_spread":0.33833877864847434,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2250240387","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9604774,0.0010957258,0.011660655,0.003910153,0.00020825719,0.00025393176,0.015401359,0.00022920639,0.0067633046],"genre_scores_gemma":[0.95482016,0.0009794009,0.021093963,0.0004560307,0.00031326155,0.00025550576,0.017886292,0.000059349248,0.0041360725],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9992021,0.00016885388,0.00014055707,0.00016653037,0.00022074235,0.00010125375],"domain_scores_gemma":[0.99644595,0.001938569,0.00083362905,0.00022442534,0.00038828177,0.00016917975],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00081719935,0.00041699962,0.00033988972,0.0046494817,0.0008643738,0.0011501614,0.00044037995,0.00091890164,0.0013592442],"category_scores_gemma":[0.006165479,0.0002469923,0.00051713735,0.004687574,0.00042169305,0.0024135686,0.00081257493,0.00059755205,0.00094572944],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00084166066,0.00053218106,0.7151824,0.001243806,0.0003599966,0.0029095986,0.007953608,0.0050801053,0.018305501,0.0047349324,0.027826888,0.2150293],"study_design_scores_gemma":[0.00006181645,0.00031993876,0.7398688,0.0004049175,0.00039505053,0.0031633968,0.024619102,0.11166785,0.0125840055,0.013403835,0.093344115,0.00016717604],"about_ca_topic_score_codex":0.006841688,"about_ca_topic_score_gemma":0.016394133,"teacher_disagreement_score":0.006841688,"about_ca_system_score_codex":0.00054111856,"about_ca_system_score_gemma":0.0005099008,"threshold_uncertainty_score":0.013603747},"labels":[],"label_agreement":null},{"id":"W2250317589","doi":"10.63317/5oexzp4sjvme","title":"Improving Entity Linking using Surface Form Refinement","year":2014,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":13,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University; Polytechnique Montréal","funders":"","keywords":"Entity linking; Computer science; Rewriting; Natural language processing; Context (archaeology); NIST; Annotation; Task (project management); Word (group theory); Matching (statistics); Information retrieval; Artificial intelligence; Knowledge base; Similarity (geometry); Process (computing); Named entity; Linguistics; Programming language; Mathematics","score_opus":0.20972799306754583,"score_gpt":0.4123134049304373,"score_spread":0.20258541186289145,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2250317589","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010324707,0.00024314602,0.9759444,0.00034177885,0.00015131282,0.0002403692,0.0009423498,0.009613407,0.0021985222],"genre_scores_gemma":[0.10010144,0.00032675033,0.88684,0.00023701738,0.000075088676,0.00015973122,0.006116931,0.0025253778,0.003617654],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9882172,0.0030981016,0.0015915656,0.002000409,0.0045511853,0.000541633],"domain_scores_gemma":[0.9599401,0.013116551,0.0016860104,0.015462247,0.00941959,0.00037541412],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008449505,0.0020006846,0.002512142,0.0073632463,0.0017571285,0.0059406916,0.0034426127,0.0026122585,0.014081709],"category_scores_gemma":[0.06307871,0.001378918,0.0038464207,0.0096137915,0.0012267411,0.009995803,0.00916355,0.0034053528,0.006962055],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00035408395,0.00035185623,0.0139858015,0.00077210856,0.00031125173,0.00049461646,0.0010896699,0.042321447,0.0147028705,0.036988087,0.033477854,0.8551503],"study_design_scores_gemma":[0.00010757367,0.00020453882,0.0035776698,0.00021648731,0.00041325667,0.000691084,0.0010874253,0.78623825,0.045661185,0.10384517,0.057834197,0.00012320967],"about_ca_topic_score_codex":0.005737483,"about_ca_topic_score_gemma":0.0074178334,"teacher_disagreement_score":0.014081709,"about_ca_system_score_codex":0.0007810948,"about_ca_system_score_gemma":0.002687873,"threshold_uncertainty_score":0.047108054},"labels":[],"label_agreement":null},{"id":"W2253088421","doi":"10.4018/978-1-61520-733-6.ch012","title":"New Technology and Implications for Healthcare and Public Health","year":2010,"lang":"en","type":"book-chapter","venue":"Advances in healthcare information systems and administration book series","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Brock University","funders":"","keywords":"Confidentiality; Linkage (software); Record linkage; Health care; Probabilistic logic; Medical record; Public health; Bridge (graph theory); Data science; Computer science; Business; Internet privacy; Knowledge management; Medicine; Computer security; Political science; Nursing; Population; Environmental health; Artificial intelligence","score_opus":0.10694852750238662,"score_gpt":0.40972359454677765,"score_spread":0.30277506704439106,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2253088421","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0010181338,0.4427493,0.042801965,0.107164755,0.010631146,0.00011838531,0.00027905006,0.00027713552,0.39496017],"genre_scores_gemma":[0.022100916,0.6559211,0.07391562,0.030532636,0.012612851,0.00037034188,0.0004724604,0.00027336116,0.20380078],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.99646074,0.0012229872,0.00020826171,0.00040390785,0.0015504685,0.00015372873],"domain_scores_gemma":[0.9943342,0.0044211783,0.00014164395,0.0003584023,0.0005748184,0.00016978043],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0047785253,0.0009390228,0.00095026096,0.002532618,0.001663629,0.009985234,0.0016250653,0.0038159236,0.020284293],"category_scores_gemma":[0.0075520817,0.0005080064,0.0007880586,0.005355828,0.0065061683,0.015282649,0.003289579,0.0054334947,0.0073823244],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000011912847,0.000022759683,0.00017595163,0.000661694,0.000015329784,0.00013154073,0.000766559,0.0004937941,0.00017972183,0.7207798,0.11475414,0.16200683],"study_design_scores_gemma":[0.0000025492743,0.000009520317,0.000099796285,0.00062112213,0.0000046915125,0.00023208333,0.00034041662,0.00023764414,0.000071262984,0.18013787,0.8182305,0.0000125100905],"about_ca_topic_score_codex":0.0031887447,"about_ca_topic_score_gemma":0.0035783672,"teacher_disagreement_score":0.020284293,"about_ca_system_score_codex":0.0041341134,"about_ca_system_score_gemma":0.004377656,"threshold_uncertainty_score":0.06785774},"labels":[],"label_agreement":null},{"id":"W2256186403","doi":"10.1108/lhtn-12-2015-0084","title":"Technological change, today and yesterday","year":2016,"lang":"en","type":"article","venue":"Library Hi Tech News","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Saskatchewan","funders":"","keywords":"Yesterday; Context (archaeology); Column (typography); Computer science; Metadata; Originality; World Wide Web; Publishing; Data science; Data sharing; Value (mathematics); Telecommunications; Sociology; History; Political science; Qualitative research","score_opus":0.20770992933145518,"score_gpt":0.36826680356743635,"score_spread":0.16055687423598117,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2256186403","genre_codex":"commentary","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008956738,0.052879132,0.001741708,0.80822533,0.038268924,0.00003440015,0.0012900875,0.0004924726,0.08811124],"genre_scores_gemma":[0.20049427,0.12937255,0.012811457,0.3959408,0.035608765,0.00025282017,0.0033268374,0.00089984987,0.22129264],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99093807,0.002232637,0.00075394165,0.0010681358,0.0037773738,0.0012297815],"domain_scores_gemma":[0.9818516,0.004481971,0.0018989329,0.0023698707,0.0061553745,0.0032423337],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008886079,0.0004680295,0.0005032058,0.002283408,0.005251324,0.018400919,0.0012746042,0.005257487,0.030708712],"category_scores_gemma":[0.03491259,0.00037028562,0.0011704062,0.0053611347,0.0052341274,0.021551166,0.0044911657,0.008179488,0.013649587],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000766642,0.000058590136,0.0036732724,0.00061969005,0.000035215904,0.00028367137,0.003595983,0.000065554224,0.00058726774,0.040652215,0.81192535,0.13842662],"study_design_scores_gemma":[0.0000028701397,0.000018669527,0.002730526,0.00022992479,0.0000083947525,0.00017717938,0.00378856,0.000020342708,0.00016108551,0.0028539028,0.9899899,0.000018747603],"about_ca_topic_score_codex":0.0070816004,"about_ca_topic_score_gemma":0.010216014,"teacher_disagreement_score":0.030708712,"about_ca_system_score_codex":0.007221036,"about_ca_system_score_gemma":0.0066068405,"threshold_uncertainty_score":0.10273081},"labels":[],"label_agreement":null},{"id":"W2260484439","doi":"10.14778/2824032.2824036","title":"SEMA-JOIN","year":2015,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":31,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Joins; Join (topology); Hash join; Table (database); Theoretical computer science; Data mining; Database; Programming language; Mathematics","score_opus":0.2932342444414948,"score_gpt":0.4016846612147633,"score_spread":0.1084504167732685,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2260484439","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005088016,0.00035264046,0.93887156,0.00037085518,0.00023529642,0.0004191787,0.005992004,0.039714493,0.008955968],"genre_scores_gemma":[0.062338136,0.00028284345,0.9093468,0.00050810835,0.00020219403,0.00059679704,0.016667908,0.0038467862,0.006210474],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9920025,0.0014772835,0.0008342109,0.0017985193,0.0035681548,0.00031939056],"domain_scores_gemma":[0.99186194,0.0029959015,0.00057850505,0.0031380313,0.001070841,0.00035469697],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0067278533,0.0011610825,0.0013388679,0.0025429972,0.0017648822,0.0044462197,0.0038195197,0.0012198699,0.01859626],"category_scores_gemma":[0.013819616,0.0009098294,0.0024249605,0.0034201012,0.0013175688,0.005640713,0.0058515277,0.0021240392,0.008025618],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001367992,0.00055523694,0.010361987,0.001324896,0.0005683992,0.00053224474,0.0012116589,0.025526438,0.016205773,0.20491359,0.19062479,0.546807],"study_design_scores_gemma":[0.0002060314,0.0003583563,0.0025434918,0.0001563545,0.00011322205,0.001222432,0.00051337853,0.31320184,0.027596142,0.23550934,0.41843736,0.00014200983],"about_ca_topic_score_codex":0.0016015635,"about_ca_topic_score_gemma":0.0033064082,"teacher_disagreement_score":0.01859626,"about_ca_system_score_codex":0.0007420597,"about_ca_system_score_gemma":0.0021019091,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W2260968375","doi":"10.6084/m9.figshare.1040467.v1","title":"#G2B2014 talk: Troubleshooting public data archiving: suggestions to increase participation","year":2014,"lang":"en","type":"article","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Troubleshooting; Public relations; Internet privacy; Computer science; World Wide Web; Business; Political science; Data science","score_opus":0.5569159018648346,"score_gpt":0.47340882206288176,"score_spread":0.08350707980195288,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2260968375","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00412185,0.001198765,0.06656902,0.2783036,0.050834835,0.0076843686,0.19474153,0.23278446,0.1637616],"genre_scores_gemma":[0.01615797,0.0015763128,0.15116043,0.07786576,0.011853045,0.012172267,0.12065025,0.15873301,0.44983098],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9891672,0.004314392,0.0010374744,0.0008500931,0.0035785253,0.0010522652],"domain_scores_gemma":[0.8957777,0.038888037,0.0032892744,0.016993977,0.03072643,0.014324536],"candidate_categories":["metaresearch","open_science","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.03538106,0.0020235626,0.0016111479,0.0056070476,0.003856118,0.0064993873,0.0036736554,0.0053013186,0.6922448],"category_scores_gemma":[0.11169225,0.0017018239,0.0019898384,0.004101121,0.002052454,0.008023731,0.008494415,0.0066807843,0.54858404],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00008591036,0.000017379522,0.00011613145,0.00008391913,0.0000034129837,0.00002842815,0.00014056075,0.000017852935,0.0003058839,0.0001603282,0.9875426,0.01149764],"study_design_scores_gemma":[0.000077027,0.000025850046,0.0006390664,0.00014935918,0.000009021602,0.000050565428,0.00032844595,0.00018753001,0.00072692276,0.0011423624,0.9966126,0.000051146355],"about_ca_topic_score_codex":0.0064331326,"about_ca_topic_score_gemma":0.014002784,"teacher_disagreement_score":0.9963263,"about_ca_system_score_codex":0.0027535288,"about_ca_system_score_gemma":0.006818363,"threshold_uncertainty_score":0.4389754},"labels":[],"label_agreement":null},{"id":"W2262592273","doi":"10.14778/2824032.2824109","title":"KATARA","year":2015,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":45,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Table (database); Crowdsourcing; Ambiguity; Tuple; Information retrieval; Annotation; Task (project management); Semantics (computer science); Reliability (semiconductor); Data mining; World Wide Web; Programming language; Artificial intelligence","score_opus":0.34404765762554373,"score_gpt":0.4117242000185209,"score_spread":0.06767654239297716,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2262592273","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.022866318,0.007839766,0.3081153,0.01293324,0.008711325,0.0012320622,0.05623797,0.11794175,0.4641222],"genre_scores_gemma":[0.14118034,0.0056861546,0.26111183,0.006753407,0.0019579544,0.0014884114,0.116329536,0.020051843,0.4454404],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99565244,0.00066803535,0.00044139792,0.0014613223,0.0013850472,0.00039174632],"domain_scores_gemma":[0.99126774,0.0012561235,0.00053823733,0.00333904,0.0027181683,0.0008806323],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0035849188,0.0013855334,0.001360952,0.0033498728,0.0021070254,0.0063824006,0.0028213796,0.002075268,0.19347334],"category_scores_gemma":[0.011869022,0.0010703319,0.001377244,0.0027884343,0.0009913269,0.0063070743,0.007136745,0.0024399213,0.20779921],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011540338,0.00019144836,0.007184934,0.0018745416,0.00019847415,0.0007565383,0.0011127007,0.0020059922,0.0126015395,0.043597545,0.4071482,0.52217406],"study_design_scores_gemma":[0.000052801945,0.00007480574,0.0017358921,0.00025788165,0.000058333106,0.0006711484,0.00028415068,0.0032081008,0.0066335304,0.0146901095,0.972272,0.00006125144],"about_ca_topic_score_codex":0.002117492,"about_ca_topic_score_gemma":0.002176022,"teacher_disagreement_score":0.19347334,"about_ca_system_score_codex":0.0013823997,"about_ca_system_score_gemma":0.0033568384,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W2284343953","doi":"10.1111/cobi.12706","title":"Emerging problems of data quality in citizen science","year":2016,"lang":"en","type":"editorial","venue":"Conservation Biology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":209,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Memorial University of Newfoundland; University of Saskatchewan","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Citizen science; Crowdsourcing; Citizen journalism; Open science; Data science; Open data; Resource (disambiguation); World Wide Web; Computer science; Political science; Public relations","score_opus":0.33745717628879024,"score_gpt":0.5204741367644338,"score_spread":0.18301696047564353,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2284343953","genre_codex":"commentary","genre_gemma":"editorial","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013383876,0.15388018,0.22202744,0.55371505,0.0047280453,0.0007676878,0.0035488252,0.0007690676,0.047179855],"genre_scores_gemma":[0.49171242,0.11263622,0.23173024,0.115406305,0.02839226,0.00421418,0.0048103193,0.0016264109,0.0094716605],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.69895595,0.18168199,0.017494494,0.031159798,0.06697934,0.0037284915],"domain_scores_gemma":[0.17536652,0.7092135,0.02119605,0.042109106,0.048473366,0.0036414491],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2851528,0.0017988451,0.0056598517,0.014901302,0.0075639747,0.025242236,0.013025277,0.019150108,0.008653533],"category_scores_gemma":[0.55624527,0.002881114,0.0024688942,0.026018191,0.055958267,0.045659795,0.0196701,0.017802881,0.0024405771],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027286683,0.00012330417,0.012527515,0.005622466,0.0003331814,0.00028891524,0.007921066,0.004994517,0.00035560012,0.7154412,0.04921416,0.20290506],"study_design_scores_gemma":[0.000084844,0.000043499076,0.002508661,0.0022414695,0.0000440724,0.00029473778,0.0023373817,0.0043725506,0.00027983668,0.89623487,0.0914482,0.00010976604],"about_ca_topic_score_codex":0.014927622,"about_ca_topic_score_gemma":0.0056326897,"teacher_disagreement_score":0.7148472,"about_ca_system_score_codex":0.019261947,"about_ca_system_score_gemma":0.01566631,"threshold_uncertainty_score":0.88153386},"labels":[],"label_agreement":null},{"id":"W2286638398","doi":"10.15353/joci.v12i2.3221","title":"User Centred Methods for Measuring the Value of Open Data","year":2016,"lang":"en","type":"article","venue":"The Journal of Community Informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":17,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"International Development Research Centre","keywords":"Open data; Computer science; Key (lock); Measure (data warehouse); Data science; Data quality; Quality (philosophy); Open source; Knowledge management; World Wide Web; Data mining; Engineering; Software; Operations management; Computer security; Metric (unit)","score_opus":0.6407874768984645,"score_gpt":0.5418677551865244,"score_spread":0.09891972171194008,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2286638398","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.039313465,0.00083041796,0.9321584,0.0014272687,0.00021791339,0.0050069103,0.0013643325,0.0010879596,0.018593285],"genre_scores_gemma":[0.28113097,0.00028668786,0.7075211,0.0004286971,0.00012122446,0.0075378628,0.00091857073,0.00027988307,0.0017749423],"study_design_codex":"design_other","study_design_gemma":"qualitative","domain_scores_codex":[0.5351165,0.3583815,0.020669589,0.014137904,0.06950147,0.0021930397],"domain_scores_gemma":[0.29772294,0.51893395,0.03627321,0.07685195,0.065830566,0.0043873223],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.19837213,0.0019717445,0.0014587542,0.021254541,0.0027125708,0.011065094,0.004913965,0.00391737,0.0035614667],"category_scores_gemma":[0.39556494,0.0012734364,0.0017978828,0.017933067,0.005966787,0.01295467,0.010373471,0.004107169,0.0012083288],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012691485,0.0017260896,0.07768032,0.0035498217,0.0009597534,0.00031859853,0.04693558,0.009654727,0.010187529,0.2301989,0.0092087975,0.6083107],"study_design_scores_gemma":[0.0007644551,0.0047010104,0.11649581,0.0038085815,0.0007583477,0.001548819,0.029942403,0.15892518,0.047539286,0.41123253,0.22219482,0.002088852],"about_ca_topic_score_codex":0.0026333781,"about_ca_topic_score_gemma":0.003068114,"teacher_disagreement_score":0.995086,"about_ca_system_score_codex":0.0051757535,"about_ca_system_score_gemma":0.0060511865,"threshold_uncertainty_score":0.9885499},"labels":[{"model":"gemma","categories":["open_science"],"domain":null,"study_design":"qualitative","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":["open_science"],"domain":null,"study_design":"design_other","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"medium"}],"label_agreement":"split"},{"id":"W2290810428","doi":"","title":"Disambiguating Multiple Links in Historical Record Linkage","year":2013,"lang":"en","type":"dissertation","venue":"The Atrium (University of Guelph)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Linkage (software); Record linkage; Genealogy; Data science; Geography; Computer science; History; Biology; Genetics; Sociology; Demography; Gene","score_opus":0.09021744308175651,"score_gpt":0.31516764603830777,"score_spread":0.22495020295655127,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2290810428","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.097781025,0.0031455017,0.88806605,0.0027183394,0.0004639675,0.0005025313,0.0005199972,0.0007494039,0.0060531707],"genre_scores_gemma":[0.29852757,0.0016044477,0.6943941,0.00041870965,0.00032664606,0.0003190644,0.0013765533,0.00017368006,0.0028592716],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.92210096,0.04833028,0.004598286,0.008603138,0.01489547,0.001471859],"domain_scores_gemma":[0.7506826,0.20187902,0.015707454,0.01603224,0.014597655,0.0011009537],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05889009,0.0009265437,0.0016508083,0.014010911,0.005147424,0.008458642,0.003821055,0.003969716,0.0022984375],"category_scores_gemma":[0.24622425,0.001412692,0.0014258539,0.015492137,0.0034197632,0.012189245,0.010275757,0.002958305,0.0011202295],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00045087526,0.000341886,0.060979534,0.0010393016,0.0005402877,0.0012378199,0.010569951,0.05214484,0.002534615,0.13400745,0.01264461,0.72350883],"study_design_scores_gemma":[0.00016640568,0.0002719755,0.017114235,0.0011882269,0.00077661884,0.0030610715,0.008965312,0.3936211,0.025718018,0.4738046,0.07491531,0.00039719202],"about_ca_topic_score_codex":0.0039037166,"about_ca_topic_score_gemma":0.0035736011,"teacher_disagreement_score":0.05889009,"about_ca_system_score_codex":0.002120171,"about_ca_system_score_gemma":0.0033344007,"threshold_uncertainty_score":0.31144428},"labels":[],"label_agreement":null},{"id":"W2294032921","doi":"10.1371/journal.pone.0150176","title":"Assessing Hepatitis C Burden and Treatment Effectiveness through the British Columbia Hepatitis Testers Cohort (BC-HTC): Design and Characteristics of Linked and Unlinked Participants","year":2016,"lang":"en","type":"article","venue":"PLoS ONE","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":65,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Ontario HIV Treatment Network; BC Cancer Agency; Ministry of Health; BC Centre for Disease Control; University of British Columbia; Provincial Health Services Authority","funders":"National Institute on Minority Health and Health Disparities; British Columbia Centre for Disease Control; BC Cancer Agency; Provincial Health Services Authority","keywords":"Medicine; Cohort; Hepatitis C; Record linkage; Epidemiology; Linkage (software); Tuberculosis; Hepatitis B; Cohort study; Environmental health; Internal medicine; Population; Pathology; Biology","score_opus":0.21807034899535468,"score_gpt":0.3528604604680532,"score_spread":0.1347901114726985,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2294032921","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9825073,0.00025838628,0.0015497302,0.00013389086,0.000016382959,0.002415427,0.011191116,0.00001832274,0.0019093619],"genre_scores_gemma":[0.976397,0.00023773247,0.0038922958,0.0002606234,0.000020498188,0.0052719144,0.011208032,0.00003112738,0.0026808376],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99576014,0.0016656363,0.0002488677,0.0008042893,0.0008912015,0.0006297662],"domain_scores_gemma":[0.99493045,0.0004800437,0.0012944578,0.0008424455,0.0016580827,0.0007945116],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005473782,0.00055912975,0.00043242678,0.0021814706,0.0024325738,0.00092689606,0.001409622,0.00069156266,0.0021887263],"category_scores_gemma":[0.009594415,0.0005016417,0.0006824304,0.003596614,0.00081013254,0.0004146502,0.001902764,0.0006985352,0.00044079928],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009113585,0.00022069772,0.9918745,0.000031166124,0.00012943923,0.00008161006,0.0007062105,0.00025820223,0.0002588287,0.00025103576,0.0010464742,0.0042304713],"study_design_scores_gemma":[0.0002352521,0.00064206036,0.99278486,0.000052815474,0.00013882786,0.0001613226,0.0009867093,0.0009458002,0.0002529453,0.00021575537,0.0035526447,0.000031087722],"about_ca_topic_score_codex":0.5175046,"about_ca_topic_score_gemma":0.46500987,"teacher_disagreement_score":0.48249543,"about_ca_system_score_codex":0.0055931597,"about_ca_system_score_gemma":0.006457803,"threshold_uncertainty_score":0.97067386},"labels":[],"label_agreement":null},{"id":"W2294497255","doi":"10.1007/978-3-319-26187-4_35","title":"A Data Quality Framework for Customer Relationship Analytics","year":2015,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Computer science; Data quality; Inefficiency; Key (lock); Quality (philosophy); Data analysis; Data science; Customer relationship management; Analytics; Set (abstract data type); Data management; Data set; Data modeling; Data mining; Database; Computer security; Business; Artificial intelligence; Marketing","score_opus":0.5334999294272715,"score_gpt":0.49637163349274754,"score_spread":0.03712829593452399,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2294497255","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0006066527,0.00047291373,0.9932226,0.001217646,0.00008880834,0.00016662573,0.000457236,0.0010120689,0.002755416],"genre_scores_gemma":[0.031826377,0.00092155044,0.9609218,0.00054070173,0.00025636356,0.00036622817,0.0017441096,0.0004224555,0.0030003712],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9835141,0.004523234,0.0023182535,0.0013696074,0.007537512,0.00073726266],"domain_scores_gemma":[0.9773228,0.007887516,0.0014881138,0.0050473767,0.007465517,0.000788659],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.022239478,0.0014280635,0.001501306,0.008164565,0.0018833731,0.011977513,0.004457315,0.0026647244,0.005678746],"category_scores_gemma":[0.03814236,0.0014028804,0.0037105072,0.009912996,0.0027900604,0.014428066,0.0066045746,0.0060022073,0.0026738832],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000517478,0.00011555535,0.001912738,0.00037819534,0.00009710674,0.00012379177,0.00043148347,0.012820237,0.0011310809,0.8099225,0.025471175,0.14754434],"study_design_scores_gemma":[0.00002950614,0.00005472434,0.00097083015,0.00047332808,0.00010070636,0.00029101028,0.0003366596,0.20410825,0.0031872303,0.6724781,0.1178918,0.00007781132],"about_ca_topic_score_codex":0.011588921,"about_ca_topic_score_gemma":0.007597815,"teacher_disagreement_score":0.022239478,"about_ca_system_score_codex":0.0038840743,"about_ca_system_score_gemma":0.005396919,"threshold_uncertainty_score":0.117614985},"labels":[],"label_agreement":null},{"id":"W2294768574","doi":"10.1109/icppw.2015.42","title":"Efficient Parallelization of the Google Trigram Method for Document Relatedness Computation","year":2015,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Computer science; Trigram; Computation; Set (abstract data type); Construct (python library); Theoretical computer science; Word (group theory); Parallel computing; Artificial intelligence; Algorithm; Programming language","score_opus":0.26415966669649316,"score_gpt":0.4911128465630769,"score_spread":0.22695317986658375,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2294768574","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.048597228,0.000676401,0.93059504,0.0003239807,0.0002682899,0.00024053644,0.00080774224,0.011262283,0.007228512],"genre_scores_gemma":[0.19486894,0.0003000295,0.7962405,0.00009059549,0.00010084676,0.00032699195,0.002079914,0.00041662555,0.005575553],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99910337,0.00014608896,0.00007243518,0.00015523424,0.0004053834,0.00011744726],"domain_scores_gemma":[0.9988728,0.00029232717,0.00006360275,0.0002804979,0.00041205995,0.00007864976],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00067621045,0.0008162631,0.00088779227,0.0016935315,0.0008565966,0.0012622194,0.0014972193,0.0004557032,0.0054564173],"category_scores_gemma":[0.0031608695,0.00028254543,0.00091905444,0.0030735706,0.00041260986,0.0013785555,0.00096152426,0.0007555226,0.0025511016],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005187017,0.00023211307,0.003175228,0.0002811559,0.00012131684,0.00043043218,0.00040222483,0.101287566,0.018935248,0.020533249,0.02420154,0.8298813],"study_design_scores_gemma":[0.0001158727,0.0000842885,0.0011484511,0.000013311471,0.000028879826,0.00021966494,0.0001863892,0.95876896,0.009826643,0.01842455,0.011150077,0.000032961638],"about_ca_topic_score_codex":0.016372671,"about_ca_topic_score_gemma":0.02283309,"teacher_disagreement_score":0.016372671,"about_ca_system_score_codex":0.0008734484,"about_ca_system_score_gemma":0.0023715533,"threshold_uncertainty_score":0.032554746},"labels":[],"label_agreement":null},{"id":"W2295201002","doi":"10.1109/ichi.2015.109","title":"What's to Learn from Unvalidated Sources of Health Information?","year":2015,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Identification (biology); Computer science; Risk analysis (engineering); Data science; Knowledge management; Management science; Engineering; Business","score_opus":0.28847573540003446,"score_gpt":0.44650085666489814,"score_spread":0.15802512126486368,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2295201002","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.14795464,0.054652303,0.04813314,0.68649364,0.0022196493,0.00047790536,0.0011338113,0.00028900444,0.058646046],"genre_scores_gemma":[0.88263184,0.044807922,0.040741146,0.024621887,0.0023137967,0.00030636997,0.00080701115,0.00017231685,0.0035977436],"study_design_codex":"design_other","study_design_gemma":"qualitative","domain_scores_codex":[0.9283115,0.05176404,0.003145123,0.0024644905,0.012049437,0.0022653798],"domain_scores_gemma":[0.6375975,0.27994165,0.022914486,0.022149,0.031730305,0.005667065],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07541787,0.00092553394,0.0016927916,0.0059748674,0.0044820355,0.030213146,0.0031111476,0.005511367,0.0056587923],"category_scores_gemma":[0.26420215,0.00082194846,0.0017649134,0.008032443,0.02023983,0.074678026,0.008840513,0.0069824415,0.001629678],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005010724,0.0007227336,0.123817995,0.009554635,0.0008689038,0.0015757752,0.052861866,0.0014404905,0.00091149914,0.24667542,0.032994878,0.5280747],"study_design_scores_gemma":[0.00011965571,0.00054792437,0.0384582,0.018928802,0.0008346973,0.0019578375,0.11921079,0.0045237336,0.0046385936,0.6449288,0.16554072,0.00031014346],"about_ca_topic_score_codex":0.005644314,"about_ca_topic_score_gemma":0.008559403,"teacher_disagreement_score":0.07541787,"about_ca_system_score_codex":0.005360186,"about_ca_system_score_gemma":0.009553013,"threshold_uncertainty_score":0.3988526},"labels":[],"label_agreement":null},{"id":"W2295468252","doi":"10.14778/2856318.2856325","title":"Combining quantitative and logical data cleaning","year":2015,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":104,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ontario Tech University; McMaster University; University of Toronto","funders":"","keywords":"Computer science; Metric (unit); Inference; Functional dependency; Set (abstract data type); Distortion (music); Statistical inference; Data mining; Algorithm; Theoretical computer science; Dependency (UML); Quality (philosophy); Data quality; Artificial intelligence; Relational database; Mathematics","score_opus":0.6149975953066957,"score_gpt":0.46831911800896336,"score_spread":0.14667847729773237,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2295468252","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0035928295,0.00014942081,0.99268883,0.0006299151,0.000032367505,0.00010547845,0.00017439549,0.00170846,0.00091824675],"genre_scores_gemma":[0.083998635,0.00016240145,0.9131966,0.00047913415,0.000047913436,0.0001651064,0.00075363653,0.00044064515,0.0007557734],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9740335,0.007640894,0.0025319667,0.0034688057,0.011448135,0.00087671354],"domain_scores_gemma":[0.9354174,0.030127212,0.0032918307,0.023640499,0.006916509,0.0006065988],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.019632932,0.0017632205,0.0020027785,0.0053363573,0.0016248866,0.0050921766,0.0063893017,0.0020154293,0.0025666994],"category_scores_gemma":[0.053283576,0.001416168,0.003621856,0.0052259257,0.0046578194,0.009263154,0.011523994,0.0046287426,0.00091144926],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00043006218,0.00048352548,0.010628262,0.0014547125,0.0005501051,0.00070050027,0.0012547749,0.16969982,0.026191847,0.16582385,0.011863963,0.6109186],"study_design_scores_gemma":[0.00008481284,0.00024936403,0.002097468,0.00024168649,0.00021772363,0.0009744816,0.00082373753,0.6208883,0.040977735,0.30364805,0.02963696,0.00015966262],"about_ca_topic_score_codex":0.0030136353,"about_ca_topic_score_gemma":0.0043534073,"teacher_disagreement_score":0.019632932,"about_ca_system_score_codex":0.0024096156,"about_ca_system_score_gemma":0.004903195,"threshold_uncertainty_score":0.1038301},"labels":[],"label_agreement":null},{"id":"W2295659583","doi":"","title":"DataXFormer: Leveraging the Web for Semantic Transformations","year":2015,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":18,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Transformation (genetics); Semantic Web; Data transformation; Code (set theory); Value (mathematics); Resource (disambiguation); Information retrieval; Data Web; Web application; Web service; Programming language; World Wide Web; Theoretical computer science; Database; Data warehouse; Set (abstract data type)","score_opus":0.46775781758491525,"score_gpt":0.4531624274002128,"score_spread":0.014595390184702461,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2295659583","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.004589598,0.00033556813,0.8803474,0.0008212099,0.00012338506,0.0004061676,0.0052732956,0.10222588,0.005877574],"genre_scores_gemma":[0.052167416,0.0006972075,0.89922786,0.0006675496,0.000081509905,0.00052401965,0.024199277,0.017344953,0.005090312],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9901446,0.0023413617,0.0013867455,0.001481754,0.0043056062,0.00033980788],"domain_scores_gemma":[0.9806598,0.007772519,0.0008294244,0.008231068,0.00215139,0.0003558642],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01017724,0.0014555972,0.0011713705,0.007474964,0.0013917085,0.0058125015,0.0023523935,0.0013644919,0.0050924397],"category_scores_gemma":[0.031844914,0.0015160267,0.0028004756,0.0066023106,0.0023052185,0.012732319,0.0076788315,0.0037053232,0.005030373],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005820901,0.0004545377,0.013925211,0.0016131798,0.00034666128,0.0015191189,0.003700419,0.018104156,0.017751615,0.17323259,0.11620801,0.6525623],"study_design_scores_gemma":[0.000100249694,0.00011850607,0.002925914,0.00054129516,0.000092707756,0.0010072266,0.0007978232,0.16702026,0.06169017,0.1969862,0.5684629,0.00025675131],"about_ca_topic_score_codex":0.0062388754,"about_ca_topic_score_gemma":0.0071855676,"teacher_disagreement_score":0.01017724,"about_ca_system_score_codex":0.0015543011,"about_ca_system_score_gemma":0.0029552167,"threshold_uncertainty_score":0.053823054},"labels":[],"label_agreement":null},{"id":"W2295712623","doi":"","title":"ualberta at TAC-KBP 2012: English and Cross-Lingual Entity Linking.","year":2012,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Entity linking; Knowledge base; Ambiguity; Information retrieval; Construct (python library); Task (project management); Information extraction; Pace; Natural language processing; Artificial intelligence; Programming language; Engineering","score_opus":0.0449615131411834,"score_gpt":0.3754842903132494,"score_spread":0.330522777172066,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2295712623","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07509057,0.010843364,0.13018282,0.013969783,0.002300497,0.0022378792,0.4611645,0.21617891,0.08803166],"genre_scores_gemma":[0.078576654,0.0018432332,0.17291026,0.0012961086,0.00019225512,0.0013288977,0.7123305,0.0051175975,0.026404426],"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9958515,0.0012514436,0.0005023385,0.0009058768,0.0012777299,0.00021120087],"domain_scores_gemma":[0.9878805,0.003958612,0.0006728806,0.002969486,0.0036297163,0.00088876084],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005588348,0.0016982501,0.0012158314,0.0073594553,0.0028604376,0.004024334,0.0025016991,0.0022550067,0.019269498],"category_scores_gemma":[0.020650906,0.0011334491,0.00084363134,0.00787737,0.00080179353,0.007188981,0.004781073,0.0023093587,0.014333621],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003885733,0.00039358417,0.0023221609,0.00086801907,0.00014254994,0.0007849924,0.0007951843,0.0013190121,0.002705112,0.0033892111,0.8633494,0.123542294],"study_design_scores_gemma":[0.00041682104,0.00009892959,0.015809275,0.0005222962,0.0001455511,0.0009138499,0.0012885027,0.046650358,0.0155420955,0.01244688,0.905961,0.00020433789],"about_ca_topic_score_codex":0.08148324,"about_ca_topic_score_gemma":0.08996775,"teacher_disagreement_score":0.08148324,"about_ca_system_score_codex":0.0020714062,"about_ca_system_score_gemma":0.0036838516,"threshold_uncertainty_score":0.16201794},"labels":[],"label_agreement":null},{"id":"W2312243314","doi":"10.1177/2327857914031002","title":"User Perception of Data and Medical Record Personalities","year":2014,"lang":"en","type":"article","venue":"Proceedings of the International Symposium on Human Factors and Ergonomics in Health Care","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo; Conestoga College","funders":"","keywords":"Data quality; Quality (philosophy); Computer science; Personality psychology; Personality; Data science; Perception; Psychology; Engineering; Social psychology","score_opus":0.12846512510153843,"score_gpt":0.40332280737459447,"score_spread":0.27485768227305607,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2312243314","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9965204,0.00011211543,0.0013680427,0.00019399113,0.000006811863,0.00002272107,0.00005620307,0.000029024906,0.0016908046],"genre_scores_gemma":[0.99827886,0.00006042798,0.0011128105,0.000077727265,0.000007127558,0.000015802882,0.00005460463,0.0000068615554,0.00038583283],"study_design_codex":"observational","study_design_gemma":"qualitative","domain_scores_codex":[0.9929454,0.004282444,0.00076429977,0.0004203709,0.0013289078,0.0002585882],"domain_scores_gemma":[0.90665746,0.07523818,0.005601063,0.003350642,0.0067731123,0.0023795685],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008866397,0.00021172015,0.00025752644,0.0012586148,0.0006468352,0.0022251224,0.0002604669,0.00062300457,0.001974195],"category_scores_gemma":[0.055371713,0.00020451199,0.000568554,0.00057353434,0.00064160227,0.0013011204,0.0009959015,0.0004707728,0.00031752634],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011367515,0.00034684205,0.8190023,0.00037422343,0.00019968586,0.00053295743,0.10912268,0.0005608822,0.0062790164,0.0005905758,0.00085363997,0.06100046],"study_design_scores_gemma":[0.0000894974,0.0021685797,0.8439879,0.00019735796,0.00020664759,0.0030431813,0.13017316,0.00781133,0.0036098645,0.0008705018,0.0075593414,0.00028268743],"about_ca_topic_score_codex":0.0019700017,"about_ca_topic_score_gemma":0.0016784293,"teacher_disagreement_score":0.008866397,"about_ca_system_score_codex":0.00048560507,"about_ca_system_score_gemma":0.00031152868,"threshold_uncertainty_score":0.046890557},"labels":[],"label_agreement":null},{"id":"W2328353948","doi":"10.2966/script.120215.154","title":"Reflections on the Concept of Open Data","year":2015,"lang":"en","type":"article","venue":"SCRIPTed A Journal of Law Technology & Society","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"McGill University","keywords":"Computer science; Data science","score_opus":0.6257464399519292,"score_gpt":0.5407464510057203,"score_spread":0.08499998894620897,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2328353948","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0010627401,0.0038585255,0.005416296,0.96487993,0.0028639582,0.000028732828,0.000056044144,0.000021185673,0.021812638],"genre_scores_gemma":[0.13615105,0.008552604,0.016266603,0.8053435,0.010974856,0.0005991637,0.000105718536,0.00031795708,0.021688478],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.85336953,0.08782063,0.0071778917,0.011991419,0.032580983,0.007059543],"domain_scores_gemma":[0.63142127,0.3219763,0.005747012,0.0132601075,0.018851824,0.008743475],"candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.1553262,0.0009000362,0.0017593589,0.0027988928,0.015095383,0.039069124,0.007743224,0.042485584,0.009193755],"category_scores_gemma":[0.17597295,0.0011258128,0.0024377182,0.0046592257,0.16507241,0.0772378,0.023196088,0.0779073,0.0017428244],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000009102956,0.000012317285,0.0000776111,0.00006146274,0.0000039695797,0.0000535528,0.0058069904,0.00010514309,0.000028948065,0.9586664,0.033139583,0.002034792],"study_design_scores_gemma":[0.000023188668,0.000015181994,0.00012353751,0.0006577629,0.0000044748526,0.00010259421,0.008028037,0.00024136406,0.00013961169,0.5652272,0.42539066,0.000046322235],"about_ca_topic_score_codex":0.018861571,"about_ca_topic_score_gemma":0.011505064,"teacher_disagreement_score":0.99225676,"about_ca_system_score_codex":0.021815313,"about_ca_system_score_gemma":0.026512533,"threshold_uncertainty_score":0.8214533},"labels":[],"label_agreement":null},{"id":"W233072892","doi":"","title":"Thoughts on a Design Framework for System Integration","year":2007,"lang":"en","type":"article","venue":"Defense Technical Information Center (DTIC)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Interoperability; System integration; Computer science; Process (computing); Data integration; Software engineering; Knowledge management; Systems engineering; Data science; Engineering; World Wide Web; Database","score_opus":0.20244393454300066,"score_gpt":0.4178670335534149,"score_spread":0.21542309901041426,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W233072892","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0011210965,0.001120177,0.9396995,0.010900178,0.00035415246,0.0004793702,0.000055060194,0.0005437009,0.04572676],"genre_scores_gemma":[0.0714791,0.0017615833,0.90282017,0.0027712155,0.00048221054,0.0029497256,0.00020835626,0.0003430722,0.017184583],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98348135,0.008680599,0.0011711569,0.001431418,0.004104082,0.001131389],"domain_scores_gemma":[0.99299663,0.0031767206,0.00048256913,0.0009337359,0.0018171086,0.0005931531],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.026723528,0.0021622716,0.0011534705,0.0033926617,0.0041923863,0.012924249,0.0053804987,0.006609066,0.0105922],"category_scores_gemma":[0.013443411,0.001662287,0.0032201447,0.0021707036,0.013369689,0.013938425,0.00626869,0.0058347885,0.0034173783],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000004869276,0.000017232684,0.00008576425,0.00010492645,0.00001374085,0.0000901701,0.00083550054,0.003877476,0.00015413294,0.98561966,0.0020455988,0.007150935],"study_design_scores_gemma":[0.000044441997,0.00008534804,0.00009203092,0.00036533448,0.00003730497,0.00026753717,0.0008792017,0.020740777,0.000499424,0.81334674,0.1636026,0.00003923182],"about_ca_topic_score_codex":0.0059853154,"about_ca_topic_score_gemma":0.0039377185,"teacher_disagreement_score":0.026723528,"about_ca_system_score_codex":0.0067589832,"about_ca_system_score_gemma":0.008836018,"threshold_uncertainty_score":0.14132923},"labels":[],"label_agreement":null},{"id":"W2330924252","doi":"10.1097/ede.0b013e318210aca5","title":"The New World of Data Linkages in Clinical Epidemiology","year":2011,"lang":"en","type":"review","venue":"Epidemiology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":27,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"National Cancer Institute","keywords":"Epidemiology; Geography; Data science; Computational biology; Medicine; Computer science; Biology; Pathology","score_opus":0.9333179870764827,"score_gpt":0.6914807965745963,"score_spread":0.24183719050188646,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2330924252","genre_codex":"methods","genre_gemma":"review","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0019977875,0.19074492,0.41892028,0.32396555,0.020275725,0.0010531276,0.0054917815,0.0050968924,0.032453932],"genre_scores_gemma":[0.057298712,0.18639605,0.61115265,0.079766646,0.0460012,0.0046698493,0.0059168763,0.002206737,0.006591298],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.7951982,0.15461732,0.015233609,0.014057099,0.019056763,0.0018370046],"domain_scores_gemma":[0.2497353,0.5948176,0.017194375,0.10276419,0.02692802,0.008560635],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.25750428,0.0021040426,0.005614491,0.01976792,0.0031298925,0.022663701,0.008424318,0.011149774,0.01994269],"category_scores_gemma":[0.4472889,0.0029505235,0.0037511683,0.02701057,0.02217065,0.052271437,0.023414249,0.020214891,0.0053371596],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025184342,0.00010577234,0.0035258206,0.0032955024,0.0004950814,0.00018731241,0.0019363213,0.00124283,0.00018016418,0.5183674,0.12705031,0.3433617],"study_design_scores_gemma":[0.00014884488,0.00010435597,0.0010131138,0.004014068,0.00009811923,0.00030065485,0.0006350978,0.0014462508,0.00011595843,0.45938557,0.5326141,0.00012384674],"about_ca_topic_score_codex":0.00429587,"about_ca_topic_score_gemma":0.0017039526,"teacher_disagreement_score":0.7424957,"about_ca_system_score_codex":0.007213864,"about_ca_system_score_gemma":0.01999367,"threshold_uncertainty_score":0.9156294},"labels":[],"label_agreement":null},{"id":"W2354815035","doi":"10.1117/12.2230236","title":"Toward unified query processing for ISR information needs and collection management","year":2016,"lang":"en","type":"article","venue":"Proceedings of SPIE, the International Society for Optical Engineering/Proceedings of SPIE","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Defence Research and Development Canada","funders":"","keywords":"Computer science; Data collection; Process (computing); Information management; Data science; Information integration; Information retrieval; Database","score_opus":0.040037764433041946,"score_gpt":0.28940851661955636,"score_spread":0.24937075218651442,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2354815035","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0055666044,0.00061952905,0.9855439,0.0019818882,0.000053127977,0.00044465592,0.00034991762,0.0019921018,0.0034483024],"genre_scores_gemma":[0.13288642,0.00093028176,0.8612186,0.00058722653,0.0002005026,0.0004198338,0.0015545673,0.00038839577,0.0018141328],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9757947,0.00703239,0.0034289674,0.0026793934,0.0097696595,0.0012949281],"domain_scores_gemma":[0.9866752,0.0032347217,0.0011560713,0.0037885627,0.004628463,0.0005169625],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.021024084,0.001476343,0.0035144845,0.0062107793,0.0022645462,0.014462573,0.005225085,0.0028406007,0.0019294289],"category_scores_gemma":[0.025093194,0.0012473406,0.0025182015,0.0081051495,0.0021984263,0.016210346,0.0072267023,0.0031387033,0.0014221247],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00046724506,0.00086789543,0.0076798466,0.0010604936,0.00046928367,0.0009705731,0.005214701,0.099321455,0.02741706,0.42845762,0.034213014,0.3938609],"study_design_scores_gemma":[0.00006110884,0.00015630144,0.0013673459,0.00020318065,0.0001919287,0.0003690273,0.0029592412,0.81006205,0.012324847,0.1280992,0.044049654,0.00015611017],"about_ca_topic_score_codex":0.009973008,"about_ca_topic_score_gemma":0.011124589,"teacher_disagreement_score":0.021024084,"about_ca_system_score_codex":0.002999086,"about_ca_system_score_gemma":0.00618382,"threshold_uncertainty_score":0.11118728},"labels":[],"label_agreement":null},{"id":"W2357632358","doi":"","title":"Data Backup and the Technical Plan for Recovery after Disaster for HIS in Our Hospital","year":2008,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"CAE (Canada)","funders":"","keywords":"Backup; Data loss; Guard (computer science); Disaster recovery; Plan (archaeology); Computer security; Data security; Computer science; Measure (data warehouse); Data recovery; Medical emergency; Engineering; Database; Medicine; Encryption; Operating system; Geography","score_opus":0.24951215798059395,"score_gpt":0.4114673316661513,"score_spread":0.16195517368555734,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2357632358","genre_codex":"commentary","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09236199,0.01131625,0.17093009,0.5376771,0.0053740023,0.0014147555,0.00043615536,0.0005408594,0.17994885],"genre_scores_gemma":[0.74123293,0.015479659,0.16599521,0.014222614,0.0018318354,0.00033569016,0.00033773854,0.000060207854,0.060504064],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9979955,0.0009494301,0.00013279251,0.0000711312,0.0005896852,0.000261444],"domain_scores_gemma":[0.99739033,0.00065187656,0.00031747998,0.00012831498,0.00076360436,0.000748429],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0036511852,0.0002777464,0.00012019653,0.00095305307,0.0024533956,0.0031377578,0.00065799186,0.001959175,0.0030547047],"category_scores_gemma":[0.0048122522,0.00025525235,0.00031173934,0.00049600925,0.0012130216,0.0019883437,0.0014232092,0.0016909224,0.00049899326],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00024249083,0.00047803888,0.019633163,0.0005435571,0.00003581003,0.0046109147,0.004644719,0.024288386,0.0033260158,0.32521173,0.26099324,0.35599196],"study_design_scores_gemma":[0.00006161769,0.00083377276,0.019004835,0.0012048723,0.000052434978,0.0057069715,0.026816795,0.023006095,0.0069279424,0.13255933,0.7835773,0.00024805608],"about_ca_topic_score_codex":0.004289998,"about_ca_topic_score_gemma":0.006503219,"teacher_disagreement_score":0.004289998,"about_ca_system_score_codex":0.0022581944,"about_ca_system_score_gemma":0.0092792595,"threshold_uncertainty_score":0.01930958},"labels":[],"label_agreement":null},{"id":"W2361231636","doi":"","title":"The Design Of A Rule-based Interactive Data Cleaning Framework","year":2009,"lang":"en","type":"article","venue":"Microcomputer applications","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Interactivity; Scalability; Extension (predicate logic); Data flow diagram; Currency; Human–computer interaction; Data mining; Database; Programming language; Multimedia","score_opus":0.20660549661684052,"score_gpt":0.44074881239422037,"score_spread":0.23414331577737985,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2361231636","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0012477604,0.00004041932,0.9969441,0.00010943076,0.000013082846,0.00013414286,0.000039006274,0.0009562592,0.0005157822],"genre_scores_gemma":[0.047239367,0.000078901205,0.9509864,0.00014223403,0.00003481166,0.00028730693,0.00021799534,0.00012216705,0.00089080597],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9944266,0.0011312609,0.00061423786,0.0010896716,0.0023850466,0.00035325042],"domain_scores_gemma":[0.99524504,0.0017409127,0.00031522638,0.0008634456,0.0014519108,0.00038338048],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008209845,0.00069446466,0.0012434289,0.0020058842,0.0017748415,0.00385927,0.0052800016,0.0022915527,0.0021248814],"category_scores_gemma":[0.009148604,0.0006757987,0.0020462663,0.0013243733,0.0025491053,0.0035732733,0.0031038136,0.002257788,0.0010755002],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004791688,0.0006333566,0.0034160155,0.00071034086,0.00036894478,0.0020374018,0.0019739803,0.2272843,0.04244762,0.45302358,0.010532843,0.25709248],"study_design_scores_gemma":[0.00008157029,0.00014218257,0.0003964713,0.00007888696,0.00010939332,0.000599622,0.00012012385,0.8894082,0.014271661,0.06602719,0.028658586,0.0001062263],"about_ca_topic_score_codex":0.006126476,"about_ca_topic_score_gemma":0.0038757555,"teacher_disagreement_score":0.008209845,"about_ca_system_score_codex":0.0010581334,"about_ca_system_score_gemma":0.003686965,"threshold_uncertainty_score":0.04341829},"labels":[],"label_agreement":null},{"id":"W2394807234","doi":"","title":"The UC3M team at the Knowledge Base Population task.","year":2009,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Spurious relationship; Computer science; Task (project management); Knowledge base; Entity linking; Baseline (sea); Population; Similarity (geometry); Information retrieval; Base (topology); Open source; Information extraction; Data mining; World Wide Web; Artificial intelligence; Machine learning; Software; Mathematics; Engineering; Programming language","score_opus":0.042355241823967514,"score_gpt":0.36662700195315157,"score_spread":0.3242717601291841,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2394807234","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.053882536,0.002194155,0.7475191,0.0132445805,0.0029597587,0.004960841,0.05080648,0.085640684,0.038791846],"genre_scores_gemma":[0.09187216,0.00045360377,0.7972837,0.0015142002,0.0005364393,0.0023011991,0.070945546,0.009303174,0.025790043],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.986126,0.005460273,0.0009465963,0.0033063763,0.0033273005,0.0008334593],"domain_scores_gemma":[0.9537999,0.018072238,0.0006589056,0.010644313,0.011855635,0.004969008],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.021161815,0.0024052786,0.0031136288,0.005593489,0.0022982901,0.005756226,0.0042337338,0.0035321536,0.055452466],"category_scores_gemma":[0.06353375,0.0012938178,0.0026605483,0.0040864586,0.0010756975,0.00799132,0.0059096036,0.005316102,0.02288388],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017162542,0.0010867359,0.0035655408,0.0009194444,0.000344274,0.0007889157,0.0018322996,0.011192445,0.011798397,0.012339559,0.5420276,0.41238853],"study_design_scores_gemma":[0.002266659,0.000802149,0.0069398535,0.00035045063,0.00039215334,0.0008060607,0.0019365781,0.26981804,0.03861706,0.028771397,0.6489924,0.00030719454],"about_ca_topic_score_codex":0.014201776,"about_ca_topic_score_gemma":0.00953321,"teacher_disagreement_score":0.055452466,"about_ca_system_score_codex":0.0039362074,"about_ca_system_score_gemma":0.0055149724,"threshold_uncertainty_score":0.185507},"labels":[],"label_agreement":null},{"id":"W2395059241","doi":"","title":"REACTION at the Entity Linking task in KBP 2011.","year":2011,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Task (project management); Computer science; Systems engineering; Engineering","score_opus":0.08199842474337567,"score_gpt":0.34680038930626156,"score_spread":0.2648019645628859,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2395059241","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08118264,0.0021059527,0.7358575,0.047911588,0.006183073,0.0017975267,0.017393868,0.039322782,0.06824516],"genre_scores_gemma":[0.38051966,0.0013460257,0.43972743,0.00983444,0.001045037,0.0011725599,0.036119092,0.011830022,0.118405774],"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9717485,0.014954165,0.0021161563,0.0030479857,0.0068633757,0.0012698226],"domain_scores_gemma":[0.9263752,0.04659077,0.0026529536,0.013129117,0.009041617,0.0022103172],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.032119334,0.0014120634,0.0012256852,0.0029261545,0.0044059763,0.0077397116,0.0023770821,0.0077348244,0.04997858],"category_scores_gemma":[0.14011745,0.0013302668,0.0016787531,0.0034099873,0.0017664387,0.019027263,0.011153182,0.00604745,0.029869804],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0023567018,0.00040289588,0.009052312,0.0014362949,0.00021659398,0.0018039879,0.010308667,0.010525806,0.010036204,0.094597906,0.4762813,0.38298133],"study_design_scores_gemma":[0.00031951896,0.00029701943,0.0056926226,0.0008014593,0.00029500888,0.0013060925,0.007396294,0.06760486,0.046618197,0.13856421,0.73065394,0.00045074435],"about_ca_topic_score_codex":0.011673452,"about_ca_topic_score_gemma":0.008052502,"teacher_disagreement_score":0.04997858,"about_ca_system_score_codex":0.0025083239,"about_ca_system_score_gemma":0.0069005145,"threshold_uncertainty_score":0.16986531},"labels":[],"label_agreement":null},{"id":"W2395690085","doi":"10.5281/zenodo.3781776","title":"Data Rescue in Canada, a Case Study","year":2010,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Carleton University","funders":"","keywords":"Computer science; Computer security; Business","score_opus":0.2674311170619187,"score_gpt":0.38603318131185566,"score_spread":0.11860206424993697,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2395690085","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8231956,0.0059138965,0.0074292673,0.04907396,0.00038932418,0.0011393193,0.0048263627,0.00033886856,0.10769344],"genre_scores_gemma":[0.95004374,0.0042939023,0.009042486,0.0036034938,0.00006831542,0.00019963902,0.0013167671,0.00013453534,0.031297207],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.995756,0.000812561,0.00020804479,0.00036795685,0.0014738219,0.0013816166],"domain_scores_gemma":[0.9922312,0.0020522568,0.00044365964,0.00033707006,0.0027371186,0.0021987245],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0026538079,0.00065158954,0.0004361421,0.0023833378,0.0229976,0.004980882,0.0027640383,0.0053115273,0.0035352646],"category_scores_gemma":[0.009932292,0.00044138206,0.00061641086,0.00926631,0.00532717,0.0015569126,0.003015546,0.0025977138,0.00048035194],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006287025,0.0011476547,0.12267698,0.0016054803,0.00020042127,0.22910404,0.26616642,0.016607823,0.0036782979,0.060457278,0.15506929,0.14265758],"study_design_scores_gemma":[0.00008153063,0.00014131176,0.05843504,0.00059435266,0.00007388065,0.016584527,0.47906455,0.0059057353,0.0014671294,0.004091209,0.43336323,0.00019753346],"about_ca_topic_score_codex":0.97645915,"about_ca_topic_score_gemma":0.9889365,"teacher_disagreement_score":0.99734616,"about_ca_system_score_codex":0.066244915,"about_ca_system_score_gemma":0.080179274,"threshold_uncertainty_score":0.48064274},"labels":[],"label_agreement":null},{"id":"W2395959986","doi":"","title":"BUPTTeam Participation at TAC 2012 Knowledge Base Population","year":2012,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Ranking (information retrieval); Node (physics); Computer science; Task (project management); Selection (genetic algorithm); Cluster analysis; Base (topology); Knowledge base; Population; Cluster (spacecraft); Data mining; Information retrieval; Artificial intelligence; Mathematics; Computer network; Engineering","score_opus":0.08896754430988418,"score_gpt":0.4073813255499505,"score_spread":0.3184137812400663,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2395959986","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.21119578,0.0028611952,0.5649914,0.012070934,0.0014621988,0.0044610323,0.014410679,0.049836613,0.13871005],"genre_scores_gemma":[0.43226466,0.0008269298,0.432366,0.0017259122,0.0005053985,0.0038399608,0.049222168,0.004439115,0.07480987],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99024814,0.0038095901,0.0004412455,0.0012182448,0.0035671203,0.0007156076],"domain_scores_gemma":[0.9890444,0.0042688064,0.00017828452,0.00283908,0.002644661,0.0010247322],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011268857,0.00097188994,0.0016136641,0.0035614124,0.0025375746,0.0038080579,0.004028194,0.0020128367,0.019061863],"category_scores_gemma":[0.026613582,0.00084831554,0.0009515537,0.0029013944,0.0006336023,0.005473384,0.007920369,0.0028257633,0.0066963425],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014801837,0.0016226914,0.0054587424,0.00053472904,0.00018501934,0.0010494423,0.003059002,0.013465028,0.014330365,0.0124493735,0.16000009,0.78636533],"study_design_scores_gemma":[0.00068925583,0.00090596866,0.007912595,0.00021599041,0.0002042923,0.0012904556,0.0018556863,0.2978851,0.034974586,0.014570087,0.63927877,0.00021731753],"about_ca_topic_score_codex":0.008176193,"about_ca_topic_score_gemma":0.010869099,"teacher_disagreement_score":0.019061863,"about_ca_system_score_codex":0.0019384025,"about_ca_system_score_gemma":0.0027150565,"threshold_uncertainty_score":0.06376827},"labels":[],"label_agreement":null},{"id":"W2398314932","doi":"","title":"The MSR.KM System for Entity Linking at TAC 2013.","year":2013,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science","score_opus":0.04564384244977663,"score_gpt":0.34152763407518755,"score_spread":0.2958837916254109,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2398314932","genre_codex":"software","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.022318572,0.0006925061,0.20845212,0.0026076226,0.00058262324,0.00090427895,0.19401343,0.49263296,0.07779591],"genre_scores_gemma":[0.13664955,0.0005985612,0.34338787,0.0007025432,0.00021779367,0.00093401375,0.45151773,0.023563284,0.04242865],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99730897,0.0008307971,0.00034227103,0.0003481034,0.0009368469,0.00023307334],"domain_scores_gemma":[0.99388784,0.0009807888,0.00041576885,0.0025300847,0.0016216139,0.0005639595],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004871338,0.00080944615,0.0006876742,0.0040583448,0.000986338,0.003901312,0.0019628596,0.0012699976,0.027042404],"category_scores_gemma":[0.013919465,0.0007069221,0.00057488173,0.004338967,0.0002992515,0.004862394,0.002484253,0.0014587214,0.032391377],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000635292,0.00024749208,0.004496677,0.00048723325,0.0001390446,0.00015620566,0.00062938425,0.0052356035,0.002969037,0.009609859,0.76785976,0.20753437],"study_design_scores_gemma":[0.00039915033,0.00016140209,0.014913345,0.00044197968,0.00014344315,0.00033959403,0.00059074705,0.070471846,0.013220395,0.024806451,0.87423706,0.0002745783],"about_ca_topic_score_codex":0.015624225,"about_ca_topic_score_gemma":0.014654998,"teacher_disagreement_score":0.027042404,"about_ca_system_score_codex":0.0010163912,"about_ca_system_score_gemma":0.0029653076,"threshold_uncertainty_score":0.0904659},"labels":[],"label_agreement":null},{"id":"W2398442511","doi":"","title":"Machine Learning for Information Retrieval: TREC 2009 Web, Relevance Feedback and Legal Tracks.","year":2009,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":27,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Relevance feedback; Relevance (law); Computer science; Information retrieval; World Wide Web; Artificial intelligence; Image retrieval","score_opus":0.06583608472360887,"score_gpt":0.36169415369887564,"score_spread":0.2958580689752668,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2398442511","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.018539527,0.041640576,0.1037664,0.043373358,0.016701074,0.01538542,0.5763234,0.07375421,0.110516],"genre_scores_gemma":[0.03257002,0.007044063,0.13287939,0.0065058894,0.003103672,0.008215744,0.7372357,0.0062460876,0.06619939],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.96854156,0.012162409,0.002645785,0.0026785203,0.011766533,0.0022052594],"domain_scores_gemma":[0.9412021,0.011166939,0.002792121,0.009816088,0.029190047,0.00583263],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.042944413,0.00713612,0.0060184104,0.011757786,0.005006247,0.008041848,0.011060231,0.006583819,0.03501713],"category_scores_gemma":[0.054695655,0.0018678514,0.002666465,0.009603686,0.0030081517,0.009315133,0.0036190862,0.00803405,0.04139151],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00011019305,0.00012896847,0.00023872215,0.00037862448,0.000044505883,0.000042338488,0.00003043275,0.0011960939,0.0008723325,0.0004750743,0.9706307,0.025852052],"study_design_scores_gemma":[0.0016576322,0.0013880006,0.021102887,0.001806864,0.00033979298,0.00074059167,0.00055419083,0.06408593,0.020296896,0.023975883,0.86309546,0.00095591677],"about_ca_topic_score_codex":0.14779408,"about_ca_topic_score_gemma":0.22597569,"teacher_disagreement_score":0.14779408,"about_ca_system_score_codex":0.013928375,"about_ca_system_score_gemma":0.020849815,"threshold_uncertainty_score":0.29386765},"labels":[],"label_agreement":null},{"id":"W2399833365","doi":"","title":"Open Data in Vancouver: The Inspiration and the Vision.","year":2011,"lang":"en","type":"article","venue":"IASSIST Conference","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Computer science; Computer graphics (images); Computer vision","score_opus":0.603460426186831,"score_gpt":0.4682804701029587,"score_spread":0.13517995608387234,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2399833365","genre_codex":"commentary","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02139573,0.06230604,0.007902379,0.8079834,0.00831012,0.00015115138,0.0064480156,0.0003153773,0.085187845],"genre_scores_gemma":[0.44296113,0.104705304,0.045257904,0.07390509,0.0050878376,0.00030306552,0.013235471,0.0009905595,0.31355375],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.98809296,0.0026789156,0.0006077593,0.0007754612,0.006220844,0.0016240265],"domain_scores_gemma":[0.9291067,0.018191691,0.0018914742,0.00514285,0.027765034,0.01790219],"candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.018571083,0.000460454,0.00053157296,0.0031576678,0.0073599215,0.02064526,0.0023178747,0.0048952466,0.010733386],"category_scores_gemma":[0.046774916,0.00060341513,0.00035136676,0.011215091,0.009108307,0.0073148212,0.0071369475,0.008179782,0.001973329],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00016432858,0.00007829132,0.013266832,0.00044894338,0.000032843785,0.0003472199,0.0022903744,0.00090187864,0.00044384587,0.09403537,0.6293016,0.2586885],"study_design_scores_gemma":[0.000012286687,0.000018039846,0.010730329,0.000687786,0.000009596343,0.000074686985,0.0044331765,0.0005524134,0.00042141063,0.02531041,0.9577023,0.000047512935],"about_ca_topic_score_codex":0.7962735,"about_ca_topic_score_gemma":0.8730136,"teacher_disagreement_score":0.99768215,"about_ca_system_score_codex":0.03136478,"about_ca_system_score_gemma":0.114898786,"threshold_uncertainty_score":0.4098525},"labels":[{"model":"gemma","categories":["open_science"],"domain":null,"study_design":"not_applicable","genre":"empirical","about_ca_system":false,"about_ca_topic":true,"confidence":"low"},{"model":"gpt","categories":[],"domain":null,"study_design":"theoretical_or_conceptual","genre":"commentary","about_ca_system":false,"about_ca_topic":true,"confidence":"high"}],"label_agreement":"split"},{"id":"W2400338427","doi":"","title":"Automatic Acquisition of isA Relationships from Web Tables.","year":2012,"lang":"en","type":"article","venue":"Software Engineering and Knowledge Engineering","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; World Wide Web; Information retrieval","score_opus":0.06541475244909939,"score_gpt":0.3047322870531124,"score_spread":0.239317534604013,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2400338427","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09841297,0.0047630933,0.72073656,0.0010121018,0.00043571802,0.00051336794,0.04229605,0.11415505,0.017675098],"genre_scores_gemma":[0.42068264,0.0017495583,0.51313776,0.00024362012,0.00019530859,0.00024291879,0.05697229,0.0018195285,0.0049564033],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9986609,0.00023768652,0.00014079935,0.00022105013,0.0006616668,0.000077873745],"domain_scores_gemma":[0.9929658,0.0025797025,0.00079849263,0.0015719902,0.0018931013,0.00019084942],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001377261,0.0006630736,0.0008209739,0.0052582975,0.00047726708,0.003199635,0.0011996278,0.0008162872,0.0057412246],"category_scores_gemma":[0.014118869,0.0005418987,0.0007644712,0.0043492233,0.00023815336,0.0040518087,0.0013268162,0.00083497615,0.005185645],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006778041,0.00035765456,0.02643301,0.00134533,0.00034694237,0.00060125184,0.0006113635,0.0084848385,0.029379213,0.01120753,0.074010134,0.846545],"study_design_scores_gemma":[0.00018562998,0.00037295322,0.040393796,0.0005605722,0.000459542,0.0016973952,0.0013672082,0.61287826,0.102505326,0.05313358,0.18627787,0.00016794744],"about_ca_topic_score_codex":0.002675211,"about_ca_topic_score_gemma":0.005823683,"teacher_disagreement_score":0.0057412246,"about_ca_system_score_codex":0.0004006128,"about_ca_system_score_gemma":0.001767279,"threshold_uncertainty_score":0.019206345},"labels":[],"label_agreement":null},{"id":"W2400809607","doi":"","title":"ECNU: Brief System Description of Submission to Knowledge Base Population at TAC 2011.","year":2011,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Entity linking; Knowledge base; Computer science; Base (topology); Population; Information retrieval; Natural language processing; World Wide Web; Mathematics; Medicine","score_opus":0.10956786629703463,"score_gpt":0.3443977628546998,"score_spread":0.23482989655766517,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2400809607","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0120130805,0.002143913,0.16906029,0.004977645,0.0064496226,0.004396206,0.3728081,0.33752033,0.09063077],"genre_scores_gemma":[0.035357878,0.00067631056,0.17377266,0.0024061806,0.0010141869,0.004791678,0.692557,0.041131005,0.048293147],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9859185,0.004756273,0.0021070254,0.0019477884,0.004248587,0.0010217907],"domain_scores_gemma":[0.95467925,0.007908607,0.00086391513,0.011066448,0.022721672,0.0027600748],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013319775,0.0015345636,0.0021906171,0.006576335,0.0032204906,0.008390663,0.003752218,0.0023757818,0.12908708],"category_scores_gemma":[0.07658915,0.0012652592,0.0011303024,0.0065852753,0.0005405245,0.0060652294,0.0054516243,0.0023378236,0.14729244],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004400314,0.00007510832,0.0012815828,0.0004879779,0.000044735254,0.0001690727,0.00032802243,0.000619542,0.001797263,0.0013558873,0.91964996,0.07375086],"study_design_scores_gemma":[0.00013889429,0.00012299052,0.003443629,0.00024043978,0.000052769436,0.0003618469,0.00040655112,0.009311281,0.007963984,0.0034898613,0.9743002,0.00016760305],"about_ca_topic_score_codex":0.017465489,"about_ca_topic_score_gemma":0.017801188,"teacher_disagreement_score":0.12908708,"about_ca_system_score_codex":0.0029033415,"about_ca_system_score_gemma":0.0076888585,"threshold_uncertainty_score":0.4318393},"labels":[],"label_agreement":null},{"id":"W2401187431","doi":"10.3233/978-1-61499-203-5-189","title":"Clinician Variations in Data Trust and Use","year":2013,"lang":"en","type":"article","venue":"Studies in health technology and informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria","funders":"","keywords":"Computer science; Data science","score_opus":0.5059977657776822,"score_gpt":0.5418432695702594,"score_spread":0.03584550379257723,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2401187431","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9903454,0.000945805,0.002835374,0.0013154151,0.000024768146,0.000080131416,0.00019033633,0.000029665367,0.0042330953],"genre_scores_gemma":[0.99887186,0.00015749819,0.0006542931,0.00008206611,0.000008576926,0.00002015971,0.000044301167,0.000006019252,0.00015512179],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.93096393,0.045758568,0.007828205,0.0028403245,0.011341741,0.0012671821],"domain_scores_gemma":[0.6070185,0.3038003,0.053961005,0.013988297,0.017760133,0.003471778],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.036342952,0.00013824196,0.0003789286,0.0017005127,0.00080775254,0.0026657968,0.0005586815,0.0006518215,0.0017949492],"category_scores_gemma":[0.2765462,0.0003828698,0.00048685068,0.0017046218,0.0010054403,0.0015636992,0.001966684,0.0010820982,0.00024647714],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00084711117,0.0001668971,0.85205245,0.00036902662,0.00033395196,0.0006391331,0.056707494,0.0005787356,0.0021640728,0.0009979234,0.0010514731,0.08409184],"study_design_scores_gemma":[0.00008051705,0.00062382466,0.93977004,0.0005275431,0.00020250496,0.0025951578,0.037556253,0.0032055043,0.0026818353,0.0021552544,0.0104634445,0.00013819031],"about_ca_topic_score_codex":0.004686022,"about_ca_topic_score_gemma":0.004441383,"teacher_disagreement_score":0.963657,"about_ca_system_score_codex":0.002615248,"about_ca_system_score_gemma":0.0020750416,"threshold_uncertainty_score":0.19220215},"labels":[],"label_agreement":null},{"id":"W2401451337","doi":"10.5281/zenodo.3781772","title":"Barriers to Data Sharing: New Evidence from a US Survey","year":2010,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Canadian Institute for Public Safety Research and Treatment","funders":"","keywords":"Computer science; Business; Data science","score_opus":0.44756446938417477,"score_gpt":0.42100436047184747,"score_spread":0.026560108912327296,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2401451337","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.98968226,0.0015945901,0.00070487685,0.0026534237,0.00001545991,0.000056423356,0.0011520414,0.000009472217,0.004131525],"genre_scores_gemma":[0.99655056,0.0013747995,0.00037732985,0.00066646293,0.000016037387,0.00009119151,0.0007354965,0.000009667085,0.00017847144],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9831131,0.009490631,0.002245823,0.0013913121,0.002786188,0.0009729394],"domain_scores_gemma":[0.8162099,0.10246708,0.055493005,0.010081873,0.01152488,0.004223279],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.018400883,0.00019156806,0.00047174603,0.0030488956,0.0011670381,0.0020358271,0.0011361219,0.00094531954,0.0032822203],"category_scores_gemma":[0.07681862,0.0004969235,0.00044451616,0.008389037,0.0018389393,0.0032177123,0.0025775027,0.0017209706,0.000348062],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000083323444,0.00015085265,0.97615314,0.00022061919,0.00008967495,0.000055740264,0.006958135,0.000050179948,0.000057682955,0.00049001153,0.0015309239,0.014159725],"study_design_scores_gemma":[0.000010391745,0.00007141681,0.97734374,0.00029023396,0.00004937034,0.000105438456,0.017441045,0.00020171134,0.00009177887,0.00034689446,0.004032083,0.00001578189],"about_ca_topic_score_codex":0.026280748,"about_ca_topic_score_gemma":0.02243664,"teacher_disagreement_score":0.9988639,"about_ca_system_score_codex":0.0010928228,"about_ca_system_score_gemma":0.0023109734,"threshold_uncertainty_score":0.0973143},"labels":[],"label_agreement":null},{"id":"W2402612754","doi":"10.22215/etd/2013-07045","title":"Multidimensional contexts for data quality assessment","year":2013,"lang":"en","type":"dissertation","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University; Canadian Heritage; Library and Archives Canada","funders":"","keywords":"Computer science","score_opus":0.5229680496476575,"score_gpt":0.5862770038323718,"score_spread":0.06330895418471427,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2402612754","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.049709573,0.019718826,0.8177794,0.02887028,0.0010241665,0.0010662897,0.0014585069,0.0007072901,0.07966562],"genre_scores_gemma":[0.39178246,0.0044064457,0.5966125,0.00091120397,0.00041857618,0.0010363922,0.00082938577,0.00015082314,0.0038521441],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9332906,0.04857103,0.005760456,0.0040386436,0.0071503664,0.0011889641],"domain_scores_gemma":[0.8528674,0.09296226,0.013809634,0.019876642,0.016217038,0.0042670313],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03384049,0.0011448943,0.0010955939,0.013585198,0.0048689097,0.020364415,0.0019465599,0.0022268603,0.007161005],"category_scores_gemma":[0.104696125,0.0009681969,0.002174419,0.015355837,0.011463501,0.02193799,0.013356895,0.0046018967,0.00085096253],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00005358298,0.000053169642,0.004722886,0.0006055968,0.00005967201,0.00015549008,0.007546261,0.0010533776,0.00044211312,0.91954297,0.003397011,0.062367946],"study_design_scores_gemma":[0.00002691895,0.00006243808,0.003849759,0.00205381,0.000084172476,0.0003314003,0.017892085,0.011270991,0.001091988,0.88121545,0.08202204,0.00009895399],"about_ca_topic_score_codex":0.0049778083,"about_ca_topic_score_gemma":0.0071325535,"teacher_disagreement_score":0.03384049,"about_ca_system_score_codex":0.007094567,"about_ca_system_score_gemma":0.00637299,"threshold_uncertainty_score":0.17896777},"labels":[],"label_agreement":null},{"id":"W2402684910","doi":"","title":"BIT's Slot-Filling Method for TAC-KBP 2013.","year":2013,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Bit (key); Computer science; Algorithm; Arithmetic; Mathematics; Computer network","score_opus":0.06833038482035207,"score_gpt":0.3975507777021472,"score_spread":0.3292203928817951,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2402684910","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0017637537,0.00046588527,0.9382462,0.00076273293,0.0006790668,0.00024330679,0.0070942417,0.039533857,0.011210829],"genre_scores_gemma":[0.049190227,0.00050585193,0.91404474,0.00056253496,0.00018524827,0.0006474865,0.012899687,0.008122625,0.01384174],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.994207,0.0017177871,0.0009647314,0.00068390294,0.002004609,0.00042185563],"domain_scores_gemma":[0.99178445,0.0028848657,0.00032946325,0.002874904,0.0018909158,0.0002353387],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004818708,0.0009933008,0.0011264038,0.0034509513,0.0017478357,0.006471799,0.002837779,0.0018698953,0.04370542],"category_scores_gemma":[0.025332764,0.0011789977,0.0019022976,0.0051342715,0.0014480678,0.0076210476,0.0046594534,0.0030011283,0.025984937],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007395266,0.00010027678,0.00082497083,0.0009853609,0.00010671833,0.0002065871,0.0010235013,0.0044437144,0.004048708,0.2218865,0.20070127,0.56493294],"study_design_scores_gemma":[0.0001467063,0.000089679765,0.0005377462,0.00047337866,0.00007906351,0.0005429032,0.00068868406,0.08017727,0.01798757,0.33675426,0.5623402,0.00018251679],"about_ca_topic_score_codex":0.0058440566,"about_ca_topic_score_gemma":0.0066723125,"teacher_disagreement_score":0.04370542,"about_ca_system_score_codex":0.0013996982,"about_ca_system_score_gemma":0.0044317935,"threshold_uncertainty_score":0.14620924},"labels":[],"label_agreement":null},{"id":"W2403315168","doi":"","title":"On Axiomatization and Inference Complexity over a Hierarchy of Functional Dependencies.","year":2015,"lang":"en","type":"article","venue":"AMW","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo; Ontario Tech University","funders":"","keywords":"Functional dependency; Inference; Hierarchy; Tuple; Mathematics; Dependency theory (database theory); Rule of inference; Theoretical computer science; Metric (unit); Antecedent (behavioral psychology); Focus (optics); Extension (predicate logic); Computer science; Algorithm; Discrete mathematics; Data mining; Artificial intelligence; Relational database; Programming language","score_opus":0.5096816871169793,"score_gpt":0.44880443507436196,"score_spread":0.06087725204261729,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2403315168","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.019370334,0.0005778258,0.9720257,0.0022039963,0.0000635385,0.00033272547,0.0011024429,0.0009307816,0.0033927136],"genre_scores_gemma":[0.14058365,0.00073878,0.85285085,0.00090140646,0.00028278527,0.00042095242,0.0023630175,0.00025866248,0.0015998419],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9760199,0.008423318,0.0023589062,0.00517834,0.0066935415,0.0013259957],"domain_scores_gemma":[0.78430474,0.19135994,0.0044214604,0.0118498765,0.0070706434,0.0009933922],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.016694846,0.001498187,0.0019201045,0.003977607,0.002315319,0.006038649,0.0050596,0.002394569,0.008455924],"category_scores_gemma":[0.09814243,0.0019117065,0.0063650482,0.0061788545,0.005252669,0.019295648,0.006149217,0.009843538,0.0010162097],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00033979325,0.0005313651,0.0069832043,0.0017126604,0.00051460456,0.0007232601,0.0013088913,0.16999817,0.0049066925,0.5522287,0.0111027295,0.24964991],"study_design_scores_gemma":[0.00007659594,0.000057782872,0.0011125355,0.00010012933,0.00015154821,0.00035313793,0.0001470138,0.36499363,0.002519026,0.6261682,0.0042558014,0.00006464423],"about_ca_topic_score_codex":0.013797811,"about_ca_topic_score_gemma":0.018113913,"teacher_disagreement_score":0.016694846,"about_ca_system_score_codex":0.0066594803,"about_ca_system_score_gemma":0.005913902,"threshold_uncertainty_score":0.088291824},"labels":[],"label_agreement":null},{"id":"W2404439713","doi":"","title":"Information Quality designed by ICT.","year":2013,"lang":"en","type":"article","venue":"Ingénierie des systèmes d information","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Information and Communications Technology; Quality (philosophy); Business; Computer science; World Wide Web; Physics","score_opus":0.06755227543677714,"score_gpt":0.3359734485110747,"score_spread":0.2684211730742976,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2404439713","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009733357,0.014450666,0.14638752,0.047841355,0.0047423383,0.0008905799,0.0076631648,0.0055848947,0.7627061],"genre_scores_gemma":[0.3187954,0.017230304,0.12744023,0.009840183,0.0037579983,0.0016107707,0.012075856,0.0023466109,0.5069026],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9882144,0.003972495,0.0010405367,0.0012828795,0.0047842823,0.00070541323],"domain_scores_gemma":[0.9625479,0.009721939,0.002254096,0.0065475,0.016936721,0.0019918582],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011462668,0.00080960355,0.0005873781,0.004969962,0.0013022696,0.007785335,0.0009799467,0.0019448327,0.05033118],"category_scores_gemma":[0.037323672,0.00052343006,0.0006006274,0.008186443,0.0018018606,0.005595701,0.0025658682,0.0021418158,0.018067343],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013921932,0.00007357362,0.004808569,0.001042709,0.000048641345,0.00007484628,0.0010640856,0.0013393802,0.0020278008,0.28737968,0.24593589,0.45606557],"study_design_scores_gemma":[0.000052444986,0.0000937036,0.008778131,0.00072683714,0.00007017359,0.00014671197,0.00042046676,0.0029884863,0.0042056884,0.042458203,0.94001853,0.000040643696],"about_ca_topic_score_codex":0.009036623,"about_ca_topic_score_gemma":0.0040003466,"teacher_disagreement_score":0.05033118,"about_ca_system_score_codex":0.0063930745,"about_ca_system_score_gemma":0.0115873795,"threshold_uncertainty_score":0.16837454},"labels":[],"label_agreement":null},{"id":"W2404580422","doi":"","title":"Benchmarks for Enterprise Linking: Thomson Reuters R&D at TAC 2013.","year":2013,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Benchmark (surveying); Task (project management); Computer science; Domain (mathematical analysis); Named-entity recognition; Entity linking; Information retrieval; Artificial intelligence; Mathematics; Knowledge base; Management","score_opus":0.03887689956804048,"score_gpt":0.3441753447018895,"score_spread":0.305298445133849,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2404580422","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.061801996,0.022475494,0.055046108,0.014989014,0.002958704,0.00096523244,0.59185576,0.077109024,0.1727987],"genre_scores_gemma":[0.07064866,0.0019379982,0.059400763,0.0010448047,0.00036929466,0.0006484881,0.8439688,0.0059559154,0.016025262],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9778105,0.0054813325,0.0019464681,0.0026776576,0.010625719,0.0014582406],"domain_scores_gemma":[0.9516458,0.010384796,0.0031692204,0.010570024,0.020398403,0.003831785],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01542784,0.0024913882,0.0014896217,0.012881294,0.0024233991,0.00477343,0.003107559,0.0026430818,0.012487341],"category_scores_gemma":[0.05501535,0.00076665945,0.0010918389,0.025822237,0.0009521564,0.004445591,0.004813166,0.0022979337,0.025652384],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002115803,0.0002439398,0.002174502,0.00056448864,0.00011481338,0.00010885343,0.00011583831,0.004120585,0.0006823919,0.0045480346,0.9259407,0.06117438],"study_design_scores_gemma":[0.00053100043,0.00028762652,0.024730563,0.00035590102,0.0001398955,0.0005796518,0.00050146476,0.037218984,0.013017821,0.02635459,0.89610535,0.00017717232],"about_ca_topic_score_codex":0.02545273,"about_ca_topic_score_gemma":0.030632487,"teacher_disagreement_score":0.02545273,"about_ca_system_score_codex":0.0033226712,"about_ca_system_score_gemma":0.0061729923,"threshold_uncertainty_score":0.08159119},"labels":[],"label_agreement":null},{"id":"W2404833249","doi":"10.5281/zenodo.3781385","title":"Bringing them in: what 5 years of data can tell us about growing a data service","year":2012,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"","keywords":"Computer science; Service (business); Data science; Business; Marketing","score_opus":0.3892335848361716,"score_gpt":0.3863174045296732,"score_spread":0.0029161803064983727,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2404833249","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0333542,0.033494726,0.024979724,0.844988,0.016413016,0.0004296218,0.012586825,0.002840292,0.030913558],"genre_scores_gemma":[0.48035488,0.08175817,0.107793994,0.22877555,0.018547988,0.0014179976,0.034191042,0.0055894013,0.041571047],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.9650048,0.01529446,0.0045049824,0.0016243072,0.01107649,0.002495013],"domain_scores_gemma":[0.80705106,0.08018357,0.024616562,0.017897807,0.047959566,0.022291478],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04419764,0.0010238928,0.0013973442,0.004567982,0.0052903774,0.02139467,0.0023040234,0.0064516775,0.013765684],"category_scores_gemma":[0.23121679,0.0011140757,0.001884693,0.008766259,0.0043072687,0.038348008,0.0068025556,0.011172614,0.010150759],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00054206664,0.00019456504,0.047446128,0.0021222797,0.00027467142,0.0006650892,0.010593179,0.0005709699,0.0013340003,0.013891983,0.642371,0.27999416],"study_design_scores_gemma":[0.00005494574,0.00032251026,0.030896004,0.003401208,0.00018488175,0.00064598175,0.026309306,0.00077853276,0.0012765896,0.032574445,0.90317637,0.00037929523],"about_ca_topic_score_codex":0.015674107,"about_ca_topic_score_gemma":0.02627776,"teacher_disagreement_score":0.04419764,"about_ca_system_score_codex":0.0058201854,"about_ca_system_score_gemma":0.0085108,"threshold_uncertainty_score":0.23374224},"labels":[],"label_agreement":null},{"id":"W2405050116","doi":"10.1016/j.jval.2016.03.1777","title":"PROBABILISTIC RECORD MATCHING USING MACHINE LEARNING TECHNIQUES","year":2016,"lang":"en","type":"article","venue":"Value in Health","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Computer science; Matching (statistics); Data mining; Weighting; Confusion matrix; Set (abstract data type); Metric (unit); Probabilistic logic; Levenshtein distance; Artificial intelligence; Algorithm; Mathematics; Statistics","score_opus":0.31160901547951836,"score_gpt":0.45121663754216795,"score_spread":0.1396076220626496,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2405050116","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012401585,0.00041606216,0.98377544,0.00044357008,0.00008036211,0.00022018325,0.00064244115,0.0010246242,0.000995733],"genre_scores_gemma":[0.2643044,0.00058151,0.7283452,0.00019607919,0.00016055019,0.00039611576,0.0025343734,0.00019431872,0.0032874907],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9808967,0.0069466494,0.0025806003,0.0030974532,0.0058730473,0.0006056132],"domain_scores_gemma":[0.9494806,0.0355022,0.0032808692,0.0069649788,0.0043632677,0.0004081657],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.012313659,0.0005183887,0.0019226867,0.0070964117,0.0015418004,0.0038199464,0.0038100863,0.002559528,0.0069547137],"category_scores_gemma":[0.07949434,0.0009177138,0.0027167704,0.011153165,0.0008383995,0.007273553,0.0033547461,0.0021177037,0.0019360929],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00063930603,0.00049654295,0.017663993,0.0007101074,0.00044720396,0.00032923298,0.00040269917,0.08708625,0.0033436932,0.05449773,0.008507355,0.8258759],"study_design_scores_gemma":[0.00007371393,0.0001493021,0.0031029738,0.00010704549,0.00024195213,0.00058648485,0.00014703085,0.85983306,0.0066784234,0.12038057,0.008633477,0.00006595687],"about_ca_topic_score_codex":0.0038573034,"about_ca_topic_score_gemma":0.004099174,"teacher_disagreement_score":0.012313659,"about_ca_system_score_codex":0.0013375661,"about_ca_system_score_gemma":0.0036817486,"threshold_uncertainty_score":0.06512165},"labels":[],"label_agreement":null},{"id":"W2405562871","doi":"10.3233/978-1-61499-289-9-861","title":"Development of a Public Health Reporting Data Warehouse: Lessons Learned","year":2013,"lang":"en","type":"article","venue":"Studies in health technology and informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":17,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria","funders":"","keywords":"Data warehouse; Formative assessment; Computer science; Process management; Scale (ratio); Data extraction; Knowledge management; Database; Engineering; MEDLINE","score_opus":0.8068837092946661,"score_gpt":0.5873405471340644,"score_spread":0.21954316216060177,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2405562871","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.38446775,0.007949887,0.3431333,0.21772645,0.0018987671,0.0022020012,0.0011412501,0.0029392107,0.038541403],"genre_scores_gemma":[0.403214,0.0072353557,0.5758076,0.0061721597,0.0005185607,0.0003605207,0.0011640781,0.00053874025,0.0049890284],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9816472,0.008932825,0.0015646723,0.0010005336,0.005733861,0.0011209783],"domain_scores_gemma":[0.9218624,0.032157116,0.0030594075,0.008483992,0.025993085,0.008444117],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.038730685,0.00091654505,0.00057015294,0.001499902,0.0013916157,0.008115235,0.0046152556,0.0030882985,0.0013511915],"category_scores_gemma":[0.062580146,0.0007672134,0.0007806732,0.0016722543,0.002397796,0.009367729,0.0036542676,0.005499783,0.00079632236],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018440098,0.0025781074,0.03029484,0.0032642868,0.0001284791,0.0028257081,0.014474448,0.016738897,0.0071302624,0.019842982,0.02824633,0.8742912],"study_design_scores_gemma":[0.0008487334,0.006769707,0.059308033,0.017677646,0.00050187454,0.011485453,0.09085584,0.10705193,0.078235574,0.10978832,0.51652575,0.0009512037],"about_ca_topic_score_codex":0.012647978,"about_ca_topic_score_gemma":0.010145193,"teacher_disagreement_score":0.038730685,"about_ca_system_score_codex":0.0037216237,"about_ca_system_score_gemma":0.014754467,"threshold_uncertainty_score":0.20482987},"labels":[],"label_agreement":null},{"id":"W2405781509","doi":"","title":"Rich Data: Risks, Issues, Controversies & Hype.","year":2015,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Big data; Government (linguistics); Promotion (chess); Business; State (computer science); Analytics; Marketing; Data science; Political science; Computer science; Politics; Law","score_opus":0.803639955861975,"score_gpt":0.5643870837347821,"score_spread":0.23925287212719293,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2405781509","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00053742086,0.08186176,0.0024348167,0.9059332,0.0033890284,0.000015560474,0.000043670658,0.000022681028,0.0057619107],"genre_scores_gemma":[0.10899034,0.3499964,0.015070979,0.47235808,0.04551716,0.00032503865,0.00020475828,0.00018598915,0.0073512695],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9560171,0.025818171,0.002104419,0.0023063046,0.012644482,0.0011096776],"domain_scores_gemma":[0.7350611,0.23085016,0.005413401,0.008413149,0.015508706,0.004753525],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08079533,0.0008554437,0.0012730567,0.004776047,0.0065820785,0.020637814,0.0035156189,0.015334847,0.007083941],"category_scores_gemma":[0.14199494,0.00085781486,0.0011451631,0.0058087353,0.040358014,0.042403575,0.011306615,0.021960508,0.0021051632],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00009284661,0.000054393913,0.0015752577,0.001485166,0.0000780069,0.00038384853,0.0031668607,0.00033569397,0.0001773078,0.5793401,0.23177789,0.18153267],"study_design_scores_gemma":[0.000038792794,0.00006477319,0.001074947,0.006309731,0.00004141078,0.00073382276,0.010092017,0.0010073214,0.0003179185,0.4924486,0.48776945,0.00010117211],"about_ca_topic_score_codex":0.0035073778,"about_ca_topic_score_gemma":0.0056166854,"teacher_disagreement_score":0.08079533,"about_ca_system_score_codex":0.0051241666,"about_ca_system_score_gemma":0.008308145,"threshold_uncertainty_score":0.4272917},"labels":[],"label_agreement":null},{"id":"W2405889505","doi":"10.5281/zenodo.3781572","title":"DataCite Canada: Canada's Data Registration Centre","year":2011,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Land registration; Computer science; Geography; Archaeology","score_opus":0.32616730933515403,"score_gpt":0.3245950437760552,"score_spread":0.00157226555909884,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2405889505","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00085860083,0.0016818069,0.0036549342,0.014398008,0.0019096456,0.0006002148,0.8545264,0.009051887,0.11331854],"genre_scores_gemma":[0.012654929,0.004083106,0.013655828,0.003793994,0.00035018622,0.0008912524,0.67542446,0.0076013366,0.28154495],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.985015,0.00090846117,0.0014280357,0.0013458595,0.009174976,0.0021278318],"domain_scores_gemma":[0.8288399,0.007839492,0.004856062,0.012000531,0.13538931,0.011074729],"candidate_categories":["scholarly_communication","open_science"],"consensus_categories":[],"category_scores_codex":[0.011799469,0.0025292737,0.003483055,0.017930003,0.009004565,0.021076575,0.0067467215,0.0040105847,0.19666211],"category_scores_gemma":[0.060868893,0.0022570032,0.001389309,0.057435896,0.0032234017,0.0066460813,0.0035945384,0.0051141414,0.124494284],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000040507908,0.000012037775,0.0004158161,0.00013518214,0.000008197572,0.000011678644,0.000033190325,0.000104515166,0.000057313187,0.0023614594,0.98700595,0.009814154],"study_design_scores_gemma":[0.000033509536,0.00000545147,0.0018177695,0.00020511716,0.000020425017,0.000011688655,0.000132983,0.00040201776,0.00031141625,0.0010684083,0.9959417,0.000049486152],"about_ca_topic_score_codex":0.98646754,"about_ca_topic_score_gemma":0.9767338,"teacher_disagreement_score":0.9932533,"about_ca_system_score_codex":0.07658873,"about_ca_system_score_gemma":0.4130165,"threshold_uncertainty_score":0.65790033},"labels":[],"label_agreement":null},{"id":"W2405922764","doi":"10.22215/etd/2017-11827","title":"Multidimensional Ontologies for Contextual Quality Data Specification and Extraction","year":2017,"lang":"en","type":"dissertation","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Datalog; Computer science; Ontology; Context (archaeology); Dimension (graph theory); Data model (GIS); Data mining; Information retrieval; Data quality; Web Ontology Language; Data modeling; Database; Theoretical computer science; Semantic Web; Artificial intelligence; Mathematics","score_opus":0.698625282896067,"score_gpt":0.6021789871339925,"score_spread":0.09644629576207442,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2405922764","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0027591712,0.0019507128,0.98549753,0.0022525324,0.00012399242,0.0001751439,0.00044048135,0.0003802546,0.0064202435],"genre_scores_gemma":[0.08215455,0.0029529512,0.91017187,0.0006595834,0.00022912415,0.0004910657,0.0015023471,0.00020522364,0.0016334393],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9722234,0.01109147,0.004533118,0.0032566208,0.00794813,0.00094725087],"domain_scores_gemma":[0.97546697,0.009724397,0.0018782703,0.007837651,0.00440337,0.000689468],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.017020926,0.001227601,0.0012487081,0.005453621,0.0023576198,0.00921974,0.0024558883,0.002389319,0.0023354893],"category_scores_gemma":[0.034763336,0.001193729,0.0039819144,0.007786819,0.0054172464,0.016145894,0.008933558,0.005981915,0.0008659418],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000019183095,0.000038358674,0.00062016613,0.00034749534,0.000063243424,0.00014150834,0.0010037789,0.0042449,0.0011242541,0.9465189,0.00298429,0.042893995],"study_design_scores_gemma":[0.00001577759,0.000022755834,0.0005987171,0.00059144926,0.000084815816,0.00027050154,0.0008771687,0.034562588,0.003132403,0.8759109,0.08387123,0.000061606916],"about_ca_topic_score_codex":0.0057944832,"about_ca_topic_score_gemma":0.0046223076,"teacher_disagreement_score":0.017020926,"about_ca_system_score_codex":0.0044300705,"about_ca_system_score_gemma":0.0044350303,"threshold_uncertainty_score":0.090016365},"labels":[],"label_agreement":null},{"id":"W2406968597","doi":"","title":"Breaking the Chains: On Declarative Analysis and Independence in the Big Data Era.","year":2014,"lang":"en","type":"article","venue":"GI-Jahrestagung","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Big data; Computer science; Data science; Data management; Scarcity; Database; Data mining","score_opus":0.34408772542810734,"score_gpt":0.4325429461399086,"score_spread":0.08845522071180129,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2406968597","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0034688548,0.0042713815,0.9711599,0.012735291,0.00045224474,0.00019106215,0.0003128777,0.0013561179,0.0060523036],"genre_scores_gemma":[0.067524344,0.0060816812,0.9074436,0.00817416,0.0015824925,0.00085615943,0.0017474032,0.0022196204,0.0043706023],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.95125276,0.023678275,0.00482115,0.0049977484,0.013245919,0.0020041505],"domain_scores_gemma":[0.7995169,0.1367729,0.0075322697,0.038613245,0.013886896,0.0036777526],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06629039,0.0022089207,0.0019966995,0.004334423,0.004419618,0.014529788,0.00744029,0.004785272,0.0037237422],"category_scores_gemma":[0.12518226,0.0038772526,0.004632494,0.005553721,0.032044295,0.052860368,0.020479187,0.015995886,0.00256438],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00012066981,0.000104082916,0.0013960243,0.0004328273,0.000072484334,0.0002111682,0.0042737285,0.0046729106,0.0008478154,0.9300574,0.010439159,0.047371577],"study_design_scores_gemma":[0.000037044985,0.000035240122,0.00023409221,0.00037017194,0.000049798684,0.000115291776,0.00031087332,0.016472142,0.0016982248,0.9400487,0.040552277,0.00007620982],"about_ca_topic_score_codex":0.00890087,"about_ca_topic_score_gemma":0.0055603352,"teacher_disagreement_score":0.06629039,"about_ca_system_score_codex":0.003938012,"about_ca_system_score_gemma":0.009531471,"threshold_uncertainty_score":0.3505813},"labels":[],"label_agreement":null},{"id":"W2407048971","doi":"10.5281/zenodo.3781914","title":"Taking the Pulse of our Members: Creating a Healthy Data Environment","year":2009,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Statistics Canada; Carleton University","funders":"","keywords":"Computer science; Pulse (music); Telecommunications","score_opus":0.3024859585988458,"score_gpt":0.40018767354960405,"score_spread":0.09770171495075824,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2407048971","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.13897224,0.007169029,0.03534071,0.65294623,0.025109382,0.0008341664,0.00069719413,0.004822896,0.1341082],"genre_scores_gemma":[0.5943935,0.0071944487,0.052696873,0.16057985,0.005098391,0.00072824274,0.0008675041,0.0016363107,0.1768049],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.99477273,0.0024472533,0.00014018697,0.00032152282,0.0012581545,0.001060147],"domain_scores_gemma":[0.9769372,0.00212578,0.0009769356,0.0011668021,0.0017256902,0.017067535],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.008768377,0.00046923832,0.00044213288,0.00058970344,0.011614472,0.009832288,0.0014133427,0.0043012113,0.018956041],"category_scores_gemma":[0.014807694,0.00061138574,0.00038312684,0.00062596326,0.0048524574,0.008301941,0.012022016,0.005832286,0.013034923],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000104736384,0.0003976158,0.011405,0.0004575677,0.000024646783,0.0013301687,0.09090773,0.00011696563,0.0052169506,0.0063123205,0.6821271,0.20159906],"study_design_scores_gemma":[0.000023463845,0.0002009017,0.00881956,0.00026655287,0.000012622751,0.0013161623,0.108525634,0.0001350452,0.00097353436,0.0036305885,0.8760123,0.00008360959],"about_ca_topic_score_codex":0.0029818434,"about_ca_topic_score_gemma":0.006315343,"teacher_disagreement_score":0.9912316,"about_ca_system_score_codex":0.0012920462,"about_ca_system_score_gemma":0.006134931,"threshold_uncertainty_score":0.063414276},"labels":[],"label_agreement":null},{"id":"W2407371826","doi":"10.5281/zenodo.3781406","title":"Collaborative Data Management: Best Practices throughout the Data Life Cycle","year":2012,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Ontario Council of University Libraries","funders":"","keywords":"Computer science; Data management; Product life-cycle management; Data science; Database; Business","score_opus":0.4229911267320463,"score_gpt":0.4652831398985137,"score_spread":0.04229201316646741,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2407371826","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006857091,0.0050926553,0.9172553,0.048961814,0.0006650407,0.0023742681,0.00028106227,0.0041362145,0.01437652],"genre_scores_gemma":[0.03976147,0.0032549636,0.94998384,0.001829491,0.00027895434,0.0012286195,0.0006493938,0.00087085745,0.0021424815],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.6053059,0.22627127,0.046553522,0.025203187,0.088391505,0.008274631],"domain_scores_gemma":[0.4795075,0.21196452,0.023739543,0.18440439,0.084954,0.015429967],"candidate_categories":["metaresearch","open_science"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.32358494,0.002649374,0.003654302,0.015537111,0.014763509,0.061655033,0.020286746,0.010633246,0.0025213729],"category_scores_gemma":[0.34315628,0.0049537504,0.0034935642,0.020014921,0.027363487,0.056709703,0.02883421,0.016222851,0.0037795226],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018210526,0.0006642864,0.008571537,0.0037448965,0.00056309387,0.0010249036,0.07254844,0.011393173,0.00283016,0.18845075,0.047504947,0.66252166],"study_design_scores_gemma":[0.00019292482,0.00030367117,0.0029478213,0.009139966,0.00027618842,0.0016721908,0.035784997,0.018660514,0.0061590546,0.44317633,0.48098883,0.0006975693],"about_ca_topic_score_codex":0.012265861,"about_ca_topic_score_gemma":0.008629047,"teacher_disagreement_score":0.97971326,"about_ca_system_score_codex":0.013827846,"about_ca_system_score_gemma":0.04401267,"threshold_uncertainty_score":0.8341402},"labels":[],"label_agreement":null},{"id":"W2420813781","doi":"10.1145/2882903.2899397","title":"BART in Action","year":2016,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Strengths and weaknesses; Set (abstract data type); Core (optical fiber); Action (physics); Data set; Data science; Artificial intelligence; Data mining; Programming language","score_opus":0.5820444491325807,"score_gpt":0.5371231260573351,"score_spread":0.044921323075245545,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2420813781","genre_codex":"software","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.007213371,0.003563679,0.27141508,0.010925702,0.006390552,0.0008258549,0.048549496,0.39597023,0.25514612],"genre_scores_gemma":[0.16376643,0.0036203503,0.41867638,0.0074975854,0.001916818,0.0014058233,0.083145894,0.039212633,0.28075808],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99768186,0.00048107613,0.00016548998,0.00055266166,0.00087142625,0.00024747834],"domain_scores_gemma":[0.99420553,0.0025726866,0.00036688536,0.0015635721,0.0006462447,0.0006450409],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0032190995,0.0016148153,0.0009781865,0.002169379,0.0010770325,0.0044957544,0.002981516,0.0027404102,0.2038443],"category_scores_gemma":[0.0142663075,0.0007100736,0.0010950346,0.0012238625,0.001451556,0.0038824768,0.0040107183,0.0018933645,0.103228934],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012562823,0.00012761784,0.0011550942,0.0009083298,0.00006581877,0.00045253022,0.00035517063,0.0032596127,0.0035354616,0.041479524,0.7180354,0.22936916],"study_design_scores_gemma":[0.00016168097,0.00009867641,0.00075896026,0.0001966317,0.00003408875,0.00042898045,0.00010374102,0.011821785,0.0039374153,0.03241468,0.9499698,0.00007348922],"about_ca_topic_score_codex":0.0034113633,"about_ca_topic_score_gemma":0.0036476622,"teacher_disagreement_score":0.2038443,"about_ca_system_score_codex":0.000867351,"about_ca_system_score_gemma":0.0019690655,"threshold_uncertainty_score":0.6819271},"labels":[],"label_agreement":null},{"id":"W2427822648","doi":"10.1109/icde.2016.7498319","title":"DataXFormer: A robust transformation discovery system","year":2016,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":66,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Transformation (genetics); Data transformation; Representation (politics); External Data Representation; Knowledge base; Information retrieval; Base (topology); World Wide Web; Data mining; Theoretical computer science; Artificial intelligence; Data warehouse; Mathematics","score_opus":0.20874692386325125,"score_gpt":0.37243103055243876,"score_spread":0.1636841066891875,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2427822648","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0077558937,0.00041330364,0.5711513,0.0004504763,0.00010066416,0.00045113664,0.015459409,0.40030217,0.0039156894],"genre_scores_gemma":[0.0757525,0.0004309657,0.8189064,0.00054925523,0.00006692667,0.00082245603,0.082473114,0.013570435,0.0074279546],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.995971,0.00055721856,0.0004930641,0.0013388341,0.0014838331,0.0001559293],"domain_scores_gemma":[0.9949687,0.0018336741,0.0003868423,0.0017962571,0.0008831067,0.00013158836],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004419406,0.001433894,0.0012985021,0.004296596,0.0010738402,0.0023481257,0.003427978,0.00125299,0.010607827],"category_scores_gemma":[0.011373621,0.0010842651,0.0020858948,0.0033414504,0.00094013824,0.004185558,0.0036940337,0.0018406187,0.007144825],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009608721,0.00040053256,0.0067951875,0.0010456267,0.00029982143,0.0008953918,0.000561409,0.018172283,0.022735441,0.01449943,0.2291798,0.70445424],"study_design_scores_gemma":[0.0006325949,0.00026129704,0.0065584313,0.0002639116,0.00021715031,0.0012406734,0.0004210259,0.39130893,0.11367418,0.04058236,0.444465,0.00037438248],"about_ca_topic_score_codex":0.0074537015,"about_ca_topic_score_gemma":0.008262133,"teacher_disagreement_score":0.010607827,"about_ca_system_score_codex":0.0013207424,"about_ca_system_score_gemma":0.0029069423,"threshold_uncertainty_score":0.035486758},"labels":[],"label_agreement":null},{"id":"W2435238507","doi":"","title":"Data Profiling","year":2018,"lang":"en","type":"book","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":20,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Profiling (computer programming); Computer science; Metadata; Inference; Data mining; Data science; Artificial intelligence; World Wide Web; Programming language","score_opus":0.6744232901337949,"score_gpt":0.5236971452500062,"score_spread":0.15072614488378866,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2435238507","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0038747096,0.021927595,0.8349635,0.007836225,0.0016958634,0.0009823502,0.01884035,0.012643716,0.09723566],"genre_scores_gemma":[0.06282921,0.038228955,0.7440152,0.006115002,0.002264297,0.0013543811,0.05380961,0.0070458963,0.08433737],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9933114,0.0013609973,0.0005637496,0.0012514209,0.003239556,0.00027298153],"domain_scores_gemma":[0.98173493,0.00692097,0.00068804534,0.006735859,0.0033780106,0.0005421739],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006754078,0.00129423,0.0013258979,0.005425397,0.0015320195,0.007729754,0.0027915332,0.0014855858,0.019006092],"category_scores_gemma":[0.02811282,0.0009781235,0.0014514516,0.011476184,0.00096494285,0.014031642,0.0054592774,0.0029882893,0.020183615],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00010915034,0.000073535884,0.0019497024,0.0013367924,0.00005654136,0.00020932469,0.00066095503,0.003090158,0.0041427184,0.17467685,0.17800313,0.6356911],"study_design_scores_gemma":[0.000009398,0.000030999694,0.0008847088,0.0006637423,0.000028180651,0.0006660806,0.00022538363,0.006016966,0.004960143,0.08951241,0.89695734,0.00004461824],"about_ca_topic_score_codex":0.0010267299,"about_ca_topic_score_gemma":0.0014031844,"teacher_disagreement_score":0.019006092,"about_ca_system_score_codex":0.0016780205,"about_ca_system_score_gemma":0.0023987875,"threshold_uncertainty_score":0.063581765},"labels":[],"label_agreement":null},{"id":"W2461005711","doi":"10.1145/2911451.2911456","title":"An Architecture for Privacy-Preserving and Replicable High-Recall Retrieval Experiments","year":2016,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Recall; Architecture; Precision and recall; Information retrieval; Order (exchange); Information privacy; Computer security","score_opus":0.15761016311109097,"score_gpt":0.429325468273088,"score_spread":0.27171530516199704,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2461005711","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.026385864,0.00020241251,0.9266318,0.00048656965,0.00012240055,0.0013042688,0.00025450467,0.041682463,0.002929735],"genre_scores_gemma":[0.39765555,0.0002164098,0.58986115,0.00073080085,0.00016467631,0.0025154708,0.00097561773,0.001875305,0.0060050376],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98137325,0.007656324,0.0013823531,0.004033024,0.0045710006,0.0009840492],"domain_scores_gemma":[0.9476318,0.015178904,0.0029950151,0.024460109,0.006771811,0.002962521],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.028068878,0.0011896061,0.0016833111,0.0017638055,0.0019448041,0.006049219,0.00968516,0.0038716688,0.010327207],"category_scores_gemma":[0.03936612,0.0015822056,0.0012760175,0.0011803798,0.004470754,0.009802399,0.00805986,0.004758125,0.0055581313],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.018401366,0.0062126853,0.021367028,0.0012945026,0.001038544,0.0013056935,0.0041916817,0.21143128,0.18895337,0.14017671,0.026681576,0.3789456],"study_design_scores_gemma":[0.0008103544,0.0017611512,0.003154547,0.00012318384,0.00021020105,0.00045452968,0.00019348772,0.8179203,0.08831165,0.061676886,0.025057882,0.0003257176],"about_ca_topic_score_codex":0.0029259776,"about_ca_topic_score_gemma":0.0019315933,"teacher_disagreement_score":0.9719311,"about_ca_system_score_codex":0.0027528561,"about_ca_system_score_gemma":0.0051973327,"threshold_uncertainty_score":0.14844424},"labels":[],"label_agreement":null},{"id":"W2463241984","doi":"10.29173/cais345","title":"Bringing Together Functional Classification and Business Process Analysis: Growing Trends in Records Management","year":2013,"lang":"fr","type":"article","venue":"Proceedings of the Annual Conference of CAIS / Actes du congrès annuel de l ACSI","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Perspective (graphical); Economic rent; Point (geometry); Business process; Process (computing); Function (biology); Knowledge management; Humanities; Sociology; Computer science; Library science; Business; Economics; Marketing; Philosophy; Artificial intelligence; Mathematics; Work in process","score_opus":0.07733218206249626,"score_gpt":0.32065348876196675,"score_spread":0.2433213066994705,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2463241984","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.116709776,0.06897847,0.66147417,0.10184169,0.0016554043,0.0003222828,0.00064882595,0.0016010788,0.046768397],"genre_scores_gemma":[0.45835486,0.035322502,0.4880618,0.0058284737,0.0031128,0.0004101166,0.0017705662,0.00081531255,0.0063235215],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.940308,0.027793081,0.0053038294,0.0047544814,0.019981626,0.001858961],"domain_scores_gemma":[0.70984554,0.19555138,0.024620185,0.018254891,0.04848374,0.0032443567],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.062175248,0.00072929997,0.0012076861,0.02172904,0.0032763816,0.020537686,0.004512647,0.0043227808,0.0033620142],"category_scores_gemma":[0.106899865,0.0009955064,0.0017289403,0.03685422,0.009188322,0.04180977,0.0058473735,0.0056319926,0.0011939359],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000080004946,0.00012100795,0.03431526,0.0024428305,0.00007616084,0.0001287434,0.017639041,0.0020851835,0.0011024027,0.16860539,0.0060504787,0.76735353],"study_design_scores_gemma":[0.00004974836,0.0004192527,0.0663148,0.007554902,0.00017081921,0.0021375944,0.056339182,0.03758583,0.0062049436,0.25897914,0.56371695,0.00052681344],"about_ca_topic_score_codex":0.014517839,"about_ca_topic_score_gemma":0.009432443,"teacher_disagreement_score":0.062175248,"about_ca_system_score_codex":0.010523325,"about_ca_system_score_gemma":0.010475446,"threshold_uncertainty_score":0.32881802},"labels":[],"label_agreement":null},{"id":"W2465051419","doi":"","title":"Critical implementation factors in data warehouse implementations in canadian financial institutions: qualitative expanded study","year":2006,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Data warehouse; Implementation; Quality (philosophy); Business; Data quality; Finance; Accounting; Qualitative property; Qualitative research; Knowledge management; Computer science; Database; Marketing; Sociology","score_opus":0.5690071729099726,"score_gpt":0.622903979228842,"score_spread":0.053896806318869395,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2465051419","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99710757,0.000117590185,0.0002772967,0.000530266,0.000008731059,0.00016195489,0.00009693852,0.000005676068,0.0016940344],"genre_scores_gemma":[0.9975284,0.00027871737,0.00063881115,0.00021978597,0.0000036181707,0.00010656716,0.00004596068,0.0000058662545,0.001172274],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.9900682,0.0025119148,0.00045898074,0.00068082823,0.0023602273,0.0039198077],"domain_scores_gemma":[0.97117054,0.010389049,0.0028479772,0.00047235558,0.010852907,0.004267119],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013017102,0.0004864246,0.0008008959,0.0031285759,0.017926374,0.0059284186,0.0020019913,0.0012110821,0.0022867292],"category_scores_gemma":[0.028949847,0.00078956835,0.0004461652,0.0053737,0.005324563,0.0023431568,0.0032464757,0.0021558807,0.0001599316],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000093709255,0.00030740796,0.07363757,0.00021631306,0.000011552765,0.00065974274,0.9016463,0.00012545809,0.001350561,0.0013091809,0.0010219143,0.019620404],"study_design_scores_gemma":[0.0000046690475,0.00007734499,0.029364834,0.00011012465,0.000008328202,0.000046589354,0.96592593,0.00013728482,0.0004649643,0.00005123461,0.0037810474,0.000027686325],"about_ca_topic_score_codex":0.8820137,"about_ca_topic_score_gemma":0.923878,"teacher_disagreement_score":0.11798632,"about_ca_system_score_codex":0.082879215,"about_ca_system_score_gemma":0.120791815,"threshold_uncertainty_score":0.6013336},"labels":[],"label_agreement":null},{"id":"W2469916400","doi":"","title":"Linking 2006 Census and hospital data in Canada.","year":2015,"lang":"en","type":"article","venue":"PubMed","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Geological Survey of Canada; Statistics Canada","funders":"","keywords":"Census; Record linkage; Demography; Linkage (software); Geography; Population; Matching (statistics); Database; Medicine; Computer science; Biology","score_opus":0.29811807224951903,"score_gpt":0.3500027166522466,"score_spread":0.05188464440272755,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2469916400","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.025464008,0.0024255407,0.0022818388,0.002353566,0.00023634594,0.0008537524,0.9391767,0.00044901014,0.026759243],"genre_scores_gemma":[0.17676689,0.00522706,0.017054388,0.0014399366,0.000093256866,0.0016766982,0.77586406,0.00026536264,0.02161237],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.99428844,0.0004360028,0.00062342227,0.00067108026,0.0030527366,0.0009283089],"domain_scores_gemma":[0.97634614,0.0010482669,0.0022409232,0.0007721054,0.018186176,0.0014063009],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0037963432,0.0005922136,0.000649053,0.0074578263,0.0026620545,0.0025399958,0.001544813,0.0004295535,0.013213095],"category_scores_gemma":[0.019153532,0.00044545426,0.0005826484,0.025117794,0.00043722708,0.0008263104,0.0019318443,0.0009529577,0.003538786],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002313236,0.000077524026,0.27931365,0.001760054,0.00020231982,0.0001862248,0.0014677136,0.0021137502,0.00020007376,0.005476464,0.59130085,0.1176701],"study_design_scores_gemma":[0.00006625662,0.000028552467,0.6642861,0.0012110284,0.00009071836,0.00013116586,0.0014974849,0.0024554804,0.00038320385,0.00086237106,0.328893,0.00009467645],"about_ca_topic_score_codex":0.9966184,"about_ca_topic_score_gemma":0.9960835,"teacher_disagreement_score":0.94076437,"about_ca_system_score_codex":0.059235625,"about_ca_system_score_gemma":0.18758811,"threshold_uncertainty_score":0.42978656},"labels":[],"label_agreement":null},{"id":"W2471940872","doi":"10.3163/1536-5050.104.3.014","title":"De-duplication of database search results for systematic reviews in EndNote","year":2016,"lang":"en","type":"article","venue":"Journal of the Medical Library Association JMLA","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1874,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia Hospital","funders":"","keywords":"Computer science; World Wide Web; Information retrieval; Data science; Library science; Database","score_opus":0.16035700940096184,"score_gpt":0.4287371023629208,"score_spread":0.26838009296195897,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2471940872","genre_codex":"protocol","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.019808058,0.101077236,0.20230204,0.020155322,0.020328548,0.31885266,0.23884775,0.014748179,0.06388014],"genre_scores_gemma":[0.052615736,0.034710914,0.468321,0.008593539,0.0024317496,0.378644,0.03650673,0.0041729743,0.014003355],"study_design_codex":"systematic_review","study_design_gemma":"not_applicable","domain_scores_codex":[0.51899886,0.17740224,0.2494578,0.0132575035,0.03675607,0.0041274712],"domain_scores_gemma":[0.3510341,0.45414758,0.077980824,0.059686843,0.054442015,0.002708644],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.27609956,0.0041184477,0.014833626,0.091419816,0.002766121,0.012324404,0.0062686335,0.0050950595,0.10418911],"category_scores_gemma":[0.5682161,0.0036833845,0.0141846705,0.07279209,0.004458722,0.010826146,0.013383371,0.0037670992,0.012098191],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0022960764,0.00012828493,0.003844363,0.7681987,0.006435527,0.0010384022,0.0049323207,0.0005002052,0.002630072,0.014680163,0.08978277,0.10553311],"study_design_scores_gemma":[0.0035066304,0.00067331817,0.013845841,0.42028508,0.010892092,0.002393704,0.0026184244,0.0019564745,0.004926056,0.028856872,0.5093296,0.0007159203],"about_ca_topic_score_codex":0.0025240593,"about_ca_topic_score_gemma":0.007998366,"teacher_disagreement_score":0.72390044,"about_ca_system_score_codex":0.00817895,"about_ca_system_score_gemma":0.037165012,"threshold_uncertainty_score":0.8926981},"labels":[],"label_agreement":null},{"id":"W2474544103","doi":"10.18260/p.26272","title":"Architectural Evaluation of Master Data Management (MDM): Literature Review","year":2016,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"St. Jude Medical; American Society for Engineering Education","keywords":"Computer science; Notation; Master data; Process (computing); Qualitative property; Quantitative analysis (chemistry); Software engineering; Data science; Business process; Management science; Process management; Knowledge management; Engineering; Data mining; Work in process; Operations management; Programming language","score_opus":0.5556549298580707,"score_gpt":0.5130888725810021,"score_spread":0.042566057277068636,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2474544103","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008465049,0.9825798,0.002081799,0.0015565094,0.00018642956,0.00018918634,0.00014792627,0.000026731796,0.0047664945],"genre_scores_gemma":[0.15030044,0.8381599,0.009241633,0.0007991673,0.0003467436,0.00027085535,0.00036543628,0.000031351537,0.00048444865],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.98149955,0.008098455,0.00320411,0.001042317,0.0057137175,0.0004417238],"domain_scores_gemma":[0.81943464,0.14225693,0.012628578,0.002944982,0.021881372,0.0008535174],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.018893993,0.00095356395,0.0016994874,0.01204956,0.0009223845,0.0043986966,0.0023021058,0.0017093404,0.0033827913],"category_scores_gemma":[0.08002782,0.000832837,0.0015462538,0.011692518,0.001937494,0.0045431843,0.0013874783,0.0009762518,0.00048607952],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00028536964,0.0002932155,0.009630138,0.09288839,0.00064264284,0.00011836293,0.00093368,0.001388039,0.0003605063,0.005559524,0.0074175317,0.8804826],"study_design_scores_gemma":[0.00014850443,0.0016726726,0.0737281,0.48337752,0.0072114747,0.0019318298,0.013097706,0.007828307,0.0040850644,0.0115272375,0.39510408,0.00028747885],"about_ca_topic_score_codex":0.006281872,"about_ca_topic_score_gemma":0.011511828,"teacher_disagreement_score":0.018893993,"about_ca_system_score_codex":0.004880292,"about_ca_system_score_gemma":0.007248548,"threshold_uncertainty_score":0.09992212},"labels":[],"label_agreement":null},{"id":"W2481701410","doi":"10.2495/dne-v11-n3-370-375","title":"Developing a data map for opening public sector information","year":2016,"lang":"en","type":"article","venue":"International Journal of Design & Nature and Ecodynamics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Metadata; Process (computing); Computer science; Task (project management); Automation; Key (lock); Data mapping; Data science; Knowledge management; Public sector; Process management; World Wide Web; Engineering; Database; Systems engineering; Computer security; Political science","score_opus":0.19609341919696013,"score_gpt":0.4051800031778149,"score_spread":0.20908658398085475,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2481701410","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.007956616,0.00019270938,0.9700884,0.0016174213,0.00016277168,0.0006276474,0.0019266868,0.0044740923,0.012953521],"genre_scores_gemma":[0.04630165,0.00020862692,0.9498182,0.00007036013,0.000028755818,0.00043475576,0.0016737799,0.00021075847,0.001253171],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9934853,0.0022160166,0.0007760271,0.0006748274,0.0025716098,0.00027627804],"domain_scores_gemma":[0.984481,0.005049048,0.0014198943,0.0035389091,0.0045186956,0.0009923872],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009525437,0.00061415136,0.0006076959,0.0081762,0.0021649534,0.007893265,0.0018303511,0.0013285904,0.004486832],"category_scores_gemma":[0.024914246,0.0008757021,0.0011677275,0.007092018,0.0017031942,0.012431885,0.0069505125,0.0017096789,0.0024122165],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025276138,0.00037681923,0.012958399,0.0016102917,0.0001337653,0.00061395334,0.0054068803,0.02737717,0.009659922,0.4055937,0.029284423,0.506732],"study_design_scores_gemma":[0.000085319756,0.00024318967,0.005210963,0.0009225085,0.000107841,0.00085329026,0.0061006425,0.13517918,0.029836403,0.23677544,0.58441114,0.0002741255],"about_ca_topic_score_codex":0.0042042756,"about_ca_topic_score_gemma":0.0031169204,"teacher_disagreement_score":0.009525437,"about_ca_system_score_codex":0.0015825379,"about_ca_system_score_gemma":0.0052175242,"threshold_uncertainty_score":0.05037588},"labels":[],"label_agreement":null},{"id":"W2482322048","doi":"10.1177/2327857916051007","title":"A Method for Developing Data Quality Measures and Metrics for Primary Health Care","year":2016,"lang":"en","type":"article","venue":"Proceedings of the International Symposium on Human Factors and Ergonomics in Health Care","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"Ontario Ministry of Health and Long-Term Care","keywords":"Quality (philosophy); Completeness (order theory); Computer science; Data quality; Quality management; Primary care; Exploratory research; Data science; Exploratory data analysis; Data mining; Knowledge management; Medicine; Metric (unit); Operations management; Engineering; Mathematics; Family medicine; Management system","score_opus":0.2942096064236911,"score_gpt":0.4812717803780066,"score_spread":0.1870621739543155,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2482322048","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0009081644,0.000041331627,0.9935616,0.00027717045,0.00006338897,0.002184512,0.00045327572,0.0011162132,0.0013942742],"genre_scores_gemma":[0.0038457874,0.000023878432,0.99304855,0.000034501223,0.000009558813,0.0024118642,0.00020050928,0.00009135269,0.0003338647],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.90628654,0.050929666,0.014761791,0.0064665927,0.020776246,0.00077929755],"domain_scores_gemma":[0.8146656,0.11031079,0.012144594,0.02399908,0.03716297,0.0017168709],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0812311,0.0021698363,0.0013596577,0.013964945,0.0025992598,0.0066633555,0.0028504287,0.0022994648,0.007023641],"category_scores_gemma":[0.16037628,0.0018291118,0.0027967189,0.011064337,0.0028330295,0.0059575094,0.0046945876,0.00392927,0.0028225712],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00031553343,0.00063602574,0.009916824,0.0035816715,0.0004008454,0.00048552276,0.012111671,0.0060390127,0.011453647,0.22406286,0.02710983,0.70388657],"study_design_scores_gemma":[0.0007787227,0.0016604363,0.013765468,0.0039576422,0.0005554166,0.0030613684,0.008442893,0.1439932,0.029785326,0.29151073,0.5013312,0.0011575072],"about_ca_topic_score_codex":0.0035202808,"about_ca_topic_score_gemma":0.004736009,"teacher_disagreement_score":0.9187689,"about_ca_system_score_codex":0.0036978319,"about_ca_system_score_gemma":0.012041236,"threshold_uncertainty_score":0.42959625},"labels":[],"label_agreement":null},{"id":"W2483857718","doi":"10.1109/swste.2016.14","title":"The Problem of the Lack of Benefit of a Document to Its Producer (PotLoBoaDtiP)","year":2016,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science","score_opus":0.1952275378131951,"score_gpt":0.42424984729057674,"score_spread":0.22902230947738164,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2483857718","genre_codex":"empirical","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6791881,0.00191831,0.12613975,0.05649537,0.00053783273,0.0004422503,0.00027696838,0.0005651033,0.13443634],"genre_scores_gemma":[0.9862067,0.00030237032,0.007140971,0.0011419236,0.00007354756,0.00010198339,0.000052276926,0.00017374799,0.004806488],"study_design_codex":"qualitative","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9679965,0.01684877,0.0023527897,0.0021407283,0.009361532,0.0012997031],"domain_scores_gemma":[0.8301395,0.14346345,0.00828914,0.0060264217,0.010875651,0.0012058326],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02105173,0.00036699552,0.00038779265,0.0019850896,0.004354467,0.005070033,0.0015399819,0.0023044618,0.003667749],"category_scores_gemma":[0.09150913,0.0005860477,0.00032240638,0.001979843,0.009444495,0.009627076,0.004914858,0.0044360724,0.00055447326],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004524198,0.00008488265,0.011874637,0.0017677909,0.000060030412,0.005682598,0.5994999,0.0008053211,0.017213004,0.18181923,0.013894403,0.1668457],"study_design_scores_gemma":[0.000046830824,0.00041730164,0.02027848,0.002343189,0.00012445288,0.007893088,0.54180366,0.004652585,0.015829202,0.058312315,0.34808016,0.00021880543],"about_ca_topic_score_codex":0.0038799457,"about_ca_topic_score_gemma":0.0033203538,"teacher_disagreement_score":0.02105173,"about_ca_system_score_codex":0.00514054,"about_ca_system_score_gemma":0.004663546,"threshold_uncertainty_score":0.11133355},"labels":[],"label_agreement":null},{"id":"W2489528053","doi":"","title":"Data Fusion for Mine Action Decision Support: An Example From Lebanon","year":2004,"lang":"en","type":"article","venue":"JMU Scholoraly Commons (James Madison University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Mine action; Decision support system; Operations research; Action (physics); Sensor fusion; Computer science; Mining engineering; Engineering; Data mining; Political science; Artificial intelligence; Law","score_opus":0.3898994090914583,"score_gpt":0.4086261089501165,"score_spread":0.018726699858658158,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2489528053","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6611283,0.01733372,0.11594135,0.081199825,0.00090956467,0.00086700136,0.0018296887,0.0013350444,0.11945544],"genre_scores_gemma":[0.93747973,0.0041501177,0.051250577,0.0017212755,0.00019058543,0.00013613307,0.00063200237,0.00007003882,0.0043695224],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9978263,0.0010671295,0.00010012739,0.00010178519,0.00068813434,0.0002164677],"domain_scores_gemma":[0.9958977,0.0017758069,0.00015049841,0.00016293878,0.0018596848,0.00015328448],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006806616,0.0004780778,0.00058832415,0.0018315346,0.0022168146,0.0033710601,0.0008702468,0.0015924339,0.0014997305],"category_scores_gemma":[0.005049243,0.00013932073,0.0005543882,0.0035919247,0.0012187754,0.0017122761,0.0016642158,0.00091556925,0.0003752885],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0018065786,0.00075356883,0.06382684,0.0012067081,0.0003734783,0.00952323,0.008057217,0.07497464,0.00682112,0.06052758,0.039496105,0.73263294],"study_design_scores_gemma":[0.0012298212,0.0014138756,0.08286245,0.0014363477,0.00052726286,0.0020712314,0.039970875,0.3185959,0.022322364,0.10488823,0.4242546,0.00042708943],"about_ca_topic_score_codex":0.043848947,"about_ca_topic_score_gemma":0.036830228,"teacher_disagreement_score":0.043848947,"about_ca_system_score_codex":0.0031394255,"about_ca_system_score_gemma":0.0029085556,"threshold_uncertainty_score":0.08718741},"labels":[],"label_agreement":null},{"id":"W2492590231","doi":"10.14778/2983200.2983203","title":"Distributed data deduplication","year":2016,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":80,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Data deduplication; Tuple; Computer science; Blocking (statistics); Block (permutation group theory); Relation (database); Backup; Locality; Process (computing); Theoretical computer science; Data mining; Database; Mathematics","score_opus":0.27015668142943616,"score_gpt":0.4095847037039765,"score_spread":0.13942802227454032,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2492590231","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.059925392,0.0018595963,0.92546886,0.0007775997,0.00047554227,0.0007247435,0.0017017503,0.003398426,0.0056680804],"genre_scores_gemma":[0.6663778,0.0010410012,0.31974822,0.00041169825,0.00023138057,0.00069858856,0.0033076024,0.0003751323,0.0078085666],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9977374,0.0004630889,0.00026144093,0.0006499902,0.00067651557,0.00021157479],"domain_scores_gemma":[0.98988885,0.001886859,0.0005392479,0.0057534343,0.0016314646,0.0003000933],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0029006386,0.0009624009,0.0015229644,0.0009954371,0.0015690282,0.0021685874,0.0028828953,0.0007436742,0.0028813796],"category_scores_gemma":[0.008180099,0.00047495659,0.00063607696,0.0023445673,0.00083552446,0.0030634664,0.003867195,0.0010695858,0.0011926611],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019077276,0.00073909527,0.010536206,0.0015383656,0.00039144306,0.001142978,0.0010137161,0.16711324,0.06034495,0.0474415,0.07294006,0.6348907],"study_design_scores_gemma":[0.00038228702,0.00061904197,0.003919673,0.00013251779,0.0001595308,0.0025902395,0.0010795408,0.72922444,0.1134366,0.07963128,0.06867234,0.00015251598],"about_ca_topic_score_codex":0.00071855006,"about_ca_topic_score_gemma":0.0011535881,"teacher_disagreement_score":0.0029006386,"about_ca_system_score_codex":0.00053356314,"about_ca_system_score_gemma":0.0018595309,"threshold_uncertainty_score":0.015340269},"labels":[],"label_agreement":null},{"id":"W2494687620","doi":"10.4018/978-1-61520-777-0.ch004","title":"A Framework for Privacy Assurance and Ubiquitous Knowledge Discovery in Health 2.0 Data Mashups","year":2010,"lang":"en","type":"book-chapter","venue":"IGI Global eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Context (archaeology); Internet privacy; Data discovery; Computer science; Health care; Information privacy; Interoperability; The Internet; Knowledge management; World Wide Web; Data science; Metadata","score_opus":0.19467658823010572,"score_gpt":0.4370473413932036,"score_spread":0.2423707531630979,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2494687620","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00062456506,0.0011079747,0.98167646,0.0030767156,0.00011319689,0.0002291731,0.00011992815,0.0004207271,0.012631254],"genre_scores_gemma":[0.03230597,0.0019390872,0.9564488,0.00083671324,0.00020268284,0.000594757,0.0003807219,0.00010992594,0.007181284],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9900367,0.004562656,0.00093296974,0.0011485124,0.002795423,0.0005236943],"domain_scores_gemma":[0.9939412,0.003720212,0.00031493802,0.0011245221,0.00053329766,0.0003658962],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013010678,0.001078902,0.0011419457,0.0031546166,0.0026581264,0.010174492,0.0051390626,0.004830526,0.004622301],"category_scores_gemma":[0.010023067,0.0011566883,0.0028313932,0.0043566907,0.0077979565,0.0109412335,0.008334119,0.006092695,0.0017821734],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000067004016,0.000018887,0.00007415674,0.000113307295,0.000012375262,0.00019626014,0.0005033443,0.003382891,0.0002855952,0.9729677,0.0027685326,0.019670326],"study_design_scores_gemma":[0.000020811502,0.00002509068,0.00009772455,0.00023926915,0.000024850973,0.00042133726,0.00031951454,0.043128535,0.000954508,0.79229563,0.16243741,0.00003526754],"about_ca_topic_score_codex":0.006369145,"about_ca_topic_score_gemma":0.0051172217,"teacher_disagreement_score":0.013010678,"about_ca_system_score_codex":0.0046390137,"about_ca_system_score_gemma":0.005443732,"threshold_uncertainty_score":0.0688079},"labels":[],"label_agreement":null},{"id":"W2506390062","doi":"10.4018/978-1-59904-857-4.ch055","title":"Statistical Data and Metadata Quality Assessment","year":2008,"lang":"en","type":"book-chapter","venue":"IGI Global eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Standardization; Quality (philosophy); Product (mathematics); Summary statistics; Metadata; Data quality; Business; Computer science; Statistics; Service (business); Operations research; Marketing; Engineering; Mathematics; World Wide Web","score_opus":0.3882986246822918,"score_gpt":0.48040005689706244,"score_spread":0.09210143221477063,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2506390062","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0026941723,0.041907877,0.58760256,0.029201271,0.003293829,0.0010085275,0.009451605,0.0024305845,0.32240963],"genre_scores_gemma":[0.07602213,0.075856075,0.66349536,0.006876485,0.00458157,0.0020034283,0.018576907,0.0027796126,0.14980832],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9794214,0.0081176665,0.0020740903,0.0015144139,0.008632501,0.00023994413],"domain_scores_gemma":[0.9665845,0.019880427,0.0013611751,0.0037522747,0.0081130685,0.00030856655],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01983643,0.00085139606,0.0008976989,0.011755957,0.001252019,0.008923171,0.0018870636,0.0018460038,0.021989599],"category_scores_gemma":[0.0437552,0.00059986766,0.0007769202,0.02075887,0.004170866,0.0074272864,0.0029781007,0.0025648936,0.011792859],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000010074663,0.000019748839,0.00048531758,0.0008780129,0.000020098536,0.00007648544,0.0012960124,0.001001212,0.0002583551,0.65998256,0.07487289,0.26109928],"study_design_scores_gemma":[0.0000032430487,0.000008893445,0.0004386967,0.00097465044,0.000010589567,0.00014844009,0.00051450013,0.0010873178,0.00043244203,0.2250189,0.7713394,0.000022906319],"about_ca_topic_score_codex":0.0044425805,"about_ca_topic_score_gemma":0.0034922494,"teacher_disagreement_score":0.021989599,"about_ca_system_score_codex":0.004880841,"about_ca_system_score_gemma":0.007089158,"threshold_uncertainty_score":0.10490632},"labels":[],"label_agreement":null},{"id":"W2512595308","doi":"10.14778/3067421.3067422","title":"Effective and complete discovery of order dependencies via set-based axiomatization","year":2017,"lang":"en","type":"preprint","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor; University of Waterloo; York University; Ontario Tech University","funders":"","keywords":"Computer science; Tuple; Completeness (order theory); Inference; Axiom; Rule of inference; Functional dependency; Set (abstract data type); Data mining; Theoretical computer science; Algorithm; Mathematics; Artificial intelligence; Relational database; Discrete mathematics","score_opus":0.10627989270277285,"score_gpt":0.36554846528466095,"score_spread":0.25926857258188807,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2512595308","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0070721395,0.00029209632,0.9850626,0.0009201721,0.000059455353,0.00033610157,0.002106992,0.0028715532,0.001278822],"genre_scores_gemma":[0.05584779,0.0003873443,0.9356506,0.00049575785,0.00009665486,0.00028764212,0.0057600504,0.0003096078,0.0011645985],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9805393,0.004525507,0.0026212211,0.004284365,0.007110383,0.00091914233],"domain_scores_gemma":[0.9591693,0.025202125,0.0020453515,0.007984961,0.0050581866,0.00054006005],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007920923,0.00194911,0.0023899614,0.0053123184,0.0019229841,0.0059317974,0.0049561486,0.0019330803,0.005811308],"category_scores_gemma":[0.039886728,0.0020539127,0.0068140407,0.0058106165,0.0027072642,0.010758898,0.00791899,0.0068782545,0.002311278],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00041341668,0.000787165,0.007527675,0.0019942587,0.0007226984,0.001013832,0.0011301936,0.11793128,0.01834963,0.2625605,0.032860544,0.5547089],"study_design_scores_gemma":[0.00015739976,0.000096920696,0.0010702173,0.0001953658,0.00027310156,0.0007382197,0.00037164698,0.55566514,0.017277392,0.4031721,0.020845665,0.00013673717],"about_ca_topic_score_codex":0.008497953,"about_ca_topic_score_gemma":0.015585256,"teacher_disagreement_score":0.008497953,"about_ca_system_score_codex":0.003190144,"about_ca_system_score_gemma":0.009888368,"threshold_uncertainty_score":0.041890323},"labels":[],"label_agreement":null},{"id":"W2513414733","doi":"10.1109/sai.2016.7556026","title":"A density-based data cleaning approach for deduplication with data consistency and accuracy","year":2016,"lang":"en","type":"article","venue":"2016 SAI Computing Conference (SAI)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Data deduplication; Computer science; Data mining; Correctness; Data warehouse; Data quality; Tuple; Data transformation; Consistency (knowledge bases); Scalability; Data consistency; Data modeling; Data set; Database; Data integrity; Set (abstract data type); Algorithm; Artificial intelligence; Mathematics","score_opus":0.4115022651312117,"score_gpt":0.4283854050917017,"score_spread":0.016883139960490012,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2513414733","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0088586835,0.00023330052,0.9893049,0.00020173404,0.000037074944,0.00016243817,0.000067455454,0.00064236164,0.0004920871],"genre_scores_gemma":[0.23670596,0.00036771863,0.75991315,0.00019407595,0.000110921545,0.00031184865,0.00040145623,0.00023194513,0.0017630038],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9928739,0.0014246898,0.0006471683,0.0011109922,0.0035501998,0.00039304022],"domain_scores_gemma":[0.9826925,0.0047176564,0.001733619,0.004319694,0.006078258,0.00045824648],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006211936,0.0012553326,0.0018705861,0.0038128851,0.001875623,0.002869184,0.0046851854,0.0015370526,0.0013498212],"category_scores_gemma":[0.031303734,0.0010448631,0.0017689242,0.004669575,0.0013804204,0.005635941,0.0046582134,0.002236048,0.0005436629],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00034478022,0.00049107405,0.010779378,0.00044397902,0.00027959686,0.00031980698,0.0010591754,0.28784922,0.011002759,0.059129387,0.006831299,0.62146956],"study_design_scores_gemma":[0.00002359238,0.00014667316,0.0016040874,0.000043159343,0.00008229415,0.00036949574,0.00016150813,0.9595872,0.009512382,0.023463653,0.0049483925,0.00005748708],"about_ca_topic_score_codex":0.004585028,"about_ca_topic_score_gemma":0.0046497597,"teacher_disagreement_score":0.006211936,"about_ca_system_score_codex":0.0020327526,"about_ca_system_score_gemma":0.0026129757,"threshold_uncertainty_score":0.032852232},"labels":[],"label_agreement":null},{"id":"W2516718098","doi":"10.1145/2883616","title":"Unifying Data and Constraint Repairs","year":2016,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Data integrity; Data quality; Constraint (computer-aided design); Scalability; Set (abstract data type); Data mining; Semantics (computer science); Data type; Data modeling; Quality (philosophy); Database; Programming language","score_opus":0.4241185632103378,"score_gpt":0.4856853147821305,"score_spread":0.0615667515717927,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2516718098","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011835425,0.000630103,0.98249006,0.00070823584,0.00011143181,0.00025752347,0.00075801526,0.0016101458,0.0015990719],"genre_scores_gemma":[0.19364792,0.00054490205,0.79936135,0.0003162349,0.00012297083,0.00045303046,0.0021063876,0.00083931186,0.002607861],"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9759837,0.006108108,0.0028735555,0.0049092807,0.00883339,0.0012920973],"domain_scores_gemma":[0.93942237,0.028154178,0.007101059,0.015888834,0.008328592,0.0011050118],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.016197674,0.002537354,0.002985861,0.0054753656,0.0014799542,0.006376355,0.009088022,0.003722545,0.0046137883],"category_scores_gemma":[0.082032666,0.001684524,0.0038431645,0.006112706,0.003289207,0.015127032,0.0072270585,0.004233909,0.0009097249],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00037594367,0.00019587872,0.0070993975,0.00075430307,0.00038160183,0.00040562556,0.00077858014,0.5699845,0.0020278234,0.13520548,0.005626826,0.27716404],"study_design_scores_gemma":[0.000037859187,0.0001166817,0.00076084386,0.000101713944,0.00009993762,0.00027746396,0.00022030217,0.8763836,0.0030746812,0.109442025,0.009425591,0.000059228532],"about_ca_topic_score_codex":0.012487928,"about_ca_topic_score_gemma":0.010666365,"teacher_disagreement_score":0.016197674,"about_ca_system_score_codex":0.004236169,"about_ca_system_score_gemma":0.004460956,"threshold_uncertainty_score":0.085662484},"labels":[],"label_agreement":null},{"id":"W2525564411","doi":"10.18438/b85g9j","title":"Academic Librarians’ Knowledge of Bibliometrics and Altmetrics","year":2016,"lang":"en","type":"article","venue":"Evidence Based Library and Information Practice","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":37,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Altmetrics; Bibliometrics; Library science; Sociology; Computer science; Data science","score_opus":0.14592259151478693,"score_gpt":0.4024911142746871,"score_spread":0.25656852275990016,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2525564411","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5513758,0.07109039,0.020123921,0.12736134,0.0008512094,0.00030534947,0.0021761241,0.0010959577,0.22561993],"genre_scores_gemma":[0.95499444,0.018916788,0.010777155,0.0076198056,0.0010496535,0.00011608559,0.00066685467,0.000100793455,0.005758427],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.9143779,0.03916409,0.009352407,0.0026572074,0.032908037,0.0015404307],"domain_scores_gemma":[0.55525035,0.2646821,0.071442,0.019794226,0.07882013,0.010011194],"candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.07384346,0.00030215704,0.0010415636,0.02142976,0.0029611504,0.011714951,0.001218307,0.0014867506,0.00627566],"category_scores_gemma":[0.28122458,0.000518578,0.0007243663,0.023941077,0.003685392,0.012600055,0.0041241664,0.0016175876,0.002437333],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00028386703,0.00027488367,0.35052845,0.00262748,0.0002862034,0.0003019738,0.029658694,0.00058171287,0.0011029353,0.008981714,0.028615976,0.57675606],"study_design_scores_gemma":[0.000056643228,0.000627806,0.61376566,0.0045984853,0.00029731393,0.001849303,0.044085592,0.0020181304,0.0024140605,0.017519526,0.3125049,0.0002626129],"about_ca_topic_score_codex":0.0063905544,"about_ca_topic_score_gemma":0.007624746,"teacher_disagreement_score":0.9785702,"about_ca_system_score_codex":0.0070230067,"about_ca_system_score_gemma":0.008516991,"threshold_uncertainty_score":0.39052618},"labels":[],"label_agreement":null},{"id":"W2528898284","doi":"","title":"Record linkage for web data","year":2012,"lang":"en","type":"dissertation","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Record linkage; Linkage (software); Linked data; Relational database; Task (project management); Information retrieval; Process (computing); Set (abstract data type); Matching (statistics); Data mining; Database; World Wide Web; Semantic Web; Data science; Engineering; Programming language","score_opus":0.5393046271116645,"score_gpt":0.5347174130476245,"score_spread":0.004587214064039946,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2528898284","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0010304208,0.005372739,0.9651229,0.00367492,0.0008071061,0.0005213086,0.00320214,0.005589664,0.0146788275],"genre_scores_gemma":[0.019954171,0.008147926,0.9447985,0.0016870173,0.0007371723,0.00113072,0.008069779,0.0014845136,0.013990174],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9820093,0.006191895,0.0018929886,0.0021597713,0.0072467774,0.00049938046],"domain_scores_gemma":[0.98131424,0.0073553966,0.0018353749,0.0064460877,0.0026904498,0.00035843905],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011376942,0.0013309624,0.0016674155,0.0071441988,0.0027775217,0.009575372,0.003932636,0.0041407915,0.017981568],"category_scores_gemma":[0.037839893,0.0012749752,0.0030040815,0.014210772,0.0022577979,0.013297417,0.0073056063,0.00510793,0.014998445],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000060058188,0.00009052065,0.00095801585,0.0016701123,0.00020889506,0.0006317664,0.00059737393,0.007794272,0.0012695363,0.59803694,0.08819236,0.30049008],"study_design_scores_gemma":[0.000030834795,0.000037048612,0.00037861042,0.0005350862,0.000060174152,0.0011088862,0.00024049768,0.03275068,0.0026962245,0.42378893,0.5382893,0.00008371382],"about_ca_topic_score_codex":0.0031026201,"about_ca_topic_score_gemma":0.0022769927,"teacher_disagreement_score":0.017981568,"about_ca_system_score_codex":0.0027304995,"about_ca_system_score_gemma":0.004420296,"threshold_uncertainty_score":0.06016779},"labels":[],"label_agreement":null},{"id":"W2530130430","doi":"","title":"Data quality through active constraint discovery and maintenance","year":2012,"lang":"en","type":"dissertation","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Leverage (statistics); Constraint (computer-aided design); Data integrity; Data quality; Data mining; Relation (database); Quality (philosophy); Set (abstract data type); Domain (mathematical analysis); Machine learning; Engineering; Mathematics; Database","score_opus":0.4121116768603989,"score_gpt":0.5156160078328202,"score_spread":0.10350433097242134,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2530130430","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008088269,0.00045978915,0.98517126,0.0010964968,0.00007261259,0.0002353402,0.0003287297,0.0031914841,0.0013560075],"genre_scores_gemma":[0.094527364,0.000410864,0.9009813,0.00038143102,0.00008745268,0.0002708676,0.001234263,0.00056427787,0.0015421365],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9678967,0.00946126,0.0030297318,0.005650813,0.012918542,0.0010429707],"domain_scores_gemma":[0.8179069,0.08899397,0.015147006,0.050226547,0.026227862,0.0014976779],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.029005479,0.0022410366,0.0024646372,0.0070356475,0.0028715585,0.009496144,0.010002529,0.0025910742,0.0034698646],"category_scores_gemma":[0.13782327,0.0019303609,0.0031754212,0.0064981775,0.0037532253,0.011358099,0.00888131,0.0053716586,0.0016311754],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003900967,0.0005166106,0.013271872,0.0010281311,0.00051418523,0.0003439531,0.0016293962,0.101211786,0.007925583,0.0700411,0.01626461,0.78686255],"study_design_scores_gemma":[0.00012331684,0.00013159009,0.0016575716,0.00028580826,0.00024301556,0.0004805742,0.00065673364,0.8399148,0.025952902,0.102167636,0.02826807,0.000118033335],"about_ca_topic_score_codex":0.012984184,"about_ca_topic_score_gemma":0.0103536695,"teacher_disagreement_score":0.029005479,"about_ca_system_score_codex":0.0034739214,"about_ca_system_score_gemma":0.008437449,"threshold_uncertainty_score":0.1533975},"labels":[],"label_agreement":null},{"id":"W2533963320","doi":"10.1186/s12911-016-0375-3","title":"Describing the linkages of the immigration, refugees and citizenship Canada permanent resident data and vital statistics death registry to Ontario’s administrative health database","year":2016,"lang":"en","type":"article","venue":"BMC Medical Informatics and Decision Making","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":204,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"College of Physicians and Surgeons of Ontario; Ottawa Hospital; Canadian Institute for Health Information; Institute for Clinical Evaluative Sciences","funders":"Canadian Institutes of Health Research; Ontario Ministry of Health and Long-Term Care; Institute for Clinical Evaluative Sciences","keywords":"Health informatics; Refugee; Citizenship; Immigration; Health statistics; Database; Health services research; Official statistics; Nationality; Data science; Medicine; Public health; Political science; Computer science; Nursing; Environmental health; Law; Population","score_opus":0.2748628273168988,"score_gpt":0.42740360635392416,"score_spread":0.15254077903702534,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2533963320","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.2504072,0.0026752527,0.05435567,0.00796928,0.00026829547,0.004228336,0.6370353,0.0011862285,0.041874543],"genre_scores_gemma":[0.5882051,0.00399848,0.07202266,0.00092895876,0.000089158304,0.004545977,0.31588864,0.00030183015,0.014019203],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99058175,0.0019068093,0.0017115624,0.0011235764,0.0037834356,0.00089276646],"domain_scores_gemma":[0.9674709,0.0077071395,0.006563998,0.0027871581,0.014801102,0.000669758],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011705598,0.0002834639,0.00030400432,0.005423367,0.001868864,0.0024083985,0.0013762874,0.0005589139,0.0039594523],"category_scores_gemma":[0.05046941,0.0004285527,0.0006970373,0.016063975,0.00045073428,0.0011787574,0.0015887227,0.00050252734,0.0008547079],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021690661,0.00006961466,0.70819056,0.0016453402,0.00034511104,0.00058034377,0.004753777,0.014172383,0.00075688824,0.01624645,0.118603654,0.1344189],"study_design_scores_gemma":[0.00008143588,0.0000712072,0.6540838,0.0012224478,0.00024015362,0.0003771663,0.0034395366,0.017452274,0.0016056444,0.002238808,0.31904352,0.00014403799],"about_ca_topic_score_codex":0.9178211,"about_ca_topic_score_gemma":0.9421678,"teacher_disagreement_score":0.08217889,"about_ca_system_score_codex":0.026517892,"about_ca_system_score_gemma":0.06810357,"threshold_uncertainty_score":0.19240165},"labels":[],"label_agreement":null},{"id":"W2537494674","doi":"10.1109/fskd.2016.7603389","title":"Characteristics and classification of big data in health care sector","year":2016,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Big data; Context (archaeology); Health care; Service (business); Human services; Business; Knowledge management; Service provider; Data science; Computer science; Internet privacy; Marketing; Data mining","score_opus":0.4701924603207224,"score_gpt":0.4564716473466358,"score_spread":0.013720812974086616,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2537494674","genre_codex":"empirical","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.85819435,0.019360078,0.01802944,0.030953696,0.00059050106,0.0011055684,0.02832052,0.00045523504,0.04299059],"genre_scores_gemma":[0.96834016,0.0037203566,0.010599155,0.0025110445,0.00055617985,0.00034665718,0.012480414,0.000082683335,0.001363407],"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98576885,0.0029005187,0.0026203094,0.0011231295,0.0062272055,0.0013599814],"domain_scores_gemma":[0.89232624,0.045221027,0.029381864,0.0071210046,0.02131013,0.0046397885],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007065883,0.00041169793,0.0006023992,0.012476481,0.0014557573,0.0049922434,0.0012981311,0.0011224278,0.0014473591],"category_scores_gemma":[0.05719622,0.0003080366,0.0008107847,0.029196883,0.001224792,0.0039186203,0.0034597144,0.0013691657,0.00061414205],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00023253779,0.000101993224,0.9110429,0.00053451053,0.00012036068,0.00045721701,0.0026723754,0.0015211774,0.0006534963,0.013156315,0.0103280265,0.05917913],"study_design_scores_gemma":[0.000024450233,0.0001353667,0.8902492,0.00095418503,0.00006128981,0.0014470405,0.012246722,0.016224226,0.0013730428,0.01871793,0.058468852,0.00009768776],"about_ca_topic_score_codex":0.0074059367,"about_ca_topic_score_gemma":0.0051236926,"teacher_disagreement_score":0.012476481,"about_ca_system_score_codex":0.003178322,"about_ca_system_score_gemma":0.002898598,"threshold_uncertainty_score":0.037368357},"labels":[],"label_agreement":null},{"id":"W2538383174","doi":"10.1145/2983323.2983326","title":"PARC","year":2016,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Computer science; Key (lock); Process (computing); Data quality; Set (abstract data type); Focus (optics); Information privacy; Visualization; Data anonymization; Data mining; Computer security; Engineering","score_opus":0.3665018902815535,"score_gpt":0.4727680972124533,"score_spread":0.10626620693089978,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2538383174","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.007085296,0.0027731191,0.18357968,0.012158873,0.00582521,0.0012762238,0.08212746,0.11792467,0.58724946],"genre_scores_gemma":[0.08602945,0.0036365897,0.16532154,0.0081905555,0.0021687492,0.0016773186,0.21682267,0.027167834,0.4889854],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99548703,0.0006254269,0.00028261152,0.001191531,0.0020218564,0.00039162295],"domain_scores_gemma":[0.9906619,0.0011823121,0.0004236436,0.0032718726,0.0036504918,0.00080984796],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0036513365,0.0011576893,0.0011361397,0.0028221821,0.0019886796,0.0063062883,0.003741892,0.0023319155,0.3692594],"category_scores_gemma":[0.012891375,0.00073151244,0.0011849271,0.0033515526,0.00080721313,0.004496911,0.004701055,0.0024500112,0.2864486],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00031836145,0.000096170625,0.0014247248,0.00039017398,0.000049601127,0.00020054576,0.00014135115,0.0014345925,0.0026679554,0.021024844,0.78047466,0.19177708],"study_design_scores_gemma":[0.000047238358,0.00003571558,0.00063726556,0.00006162671,0.00001478783,0.00021366721,0.000054664775,0.0031107347,0.0019011233,0.0053788903,0.9885194,0.000024871606],"about_ca_topic_score_codex":0.005949574,"about_ca_topic_score_gemma":0.005227413,"teacher_disagreement_score":0.63074064,"about_ca_system_score_codex":0.001986632,"about_ca_system_score_gemma":0.004215812,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W2542250253","doi":"10.1145/3012004","title":"The Challenge of Test Data Quality in Data Processing","year":2017,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"Natural Sciences and Engineering Research Council of Canada; Vienna Science and Technology Fund","keywords":"Citation; Test (biology); Computer science; Data quality; Library science; Quality (philosophy); World Wide Web; Data science; Engineering; Operations management","score_opus":0.6182808189797534,"score_gpt":0.5581897740451959,"score_spread":0.060091044934557525,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2542250253","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017871348,0.047383264,0.50983393,0.38950944,0.0053466777,0.00072216574,0.0023342383,0.0035617403,0.023437075],"genre_scores_gemma":[0.5030618,0.017871203,0.40436804,0.050286707,0.012674389,0.0013439236,0.002777225,0.0023849474,0.0052318824],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.5772017,0.29413798,0.022832807,0.022448434,0.08060777,0.0027712337],"domain_scores_gemma":[0.11087179,0.7254237,0.024047732,0.080973364,0.053751584,0.004931756],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.40300605,0.0017404434,0.0049650054,0.0065366016,0.0037394026,0.025654398,0.008660882,0.00834165,0.005173991],"category_scores_gemma":[0.71202195,0.0017388992,0.002399988,0.009797222,0.03329949,0.02914498,0.015739016,0.020059993,0.0025708668],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00082813227,0.0002890649,0.029848246,0.0032385716,0.0011862968,0.00024199377,0.0033042862,0.010630159,0.0014103297,0.30719832,0.08858178,0.5532428],"study_design_scores_gemma":[0.00023570114,0.00041907938,0.0065335883,0.00178713,0.0001940445,0.00039136174,0.0014254319,0.043843012,0.0018327798,0.87978894,0.06337265,0.00017623341],"about_ca_topic_score_codex":0.011417037,"about_ca_topic_score_gemma":0.0044709244,"teacher_disagreement_score":0.40300605,"about_ca_system_score_codex":0.010144838,"about_ca_system_score_gemma":0.01724264,"threshold_uncertainty_score":0.73619986},"labels":[],"label_agreement":null},{"id":"W2544442953","doi":"10.1017/s1743921316002702","title":"That over-used and much abused 4-letter word: DATA","year":2015,"lang":"en","type":"article","venue":"Proceedings of the International Astronomical Union","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dominion Astrophysical Observatory","funders":"","keywords":"Objectivity (philosophy); Optimal distinctiveness theory; Noun; Linguistics; Verb; Plural; Subjectivity; The Internet; Computer science; Conversation; Epistemology; Sociology; Psychology; World Wide Web; Philosophy; Social psychology","score_opus":0.2334190913761537,"score_gpt":0.3747928134479398,"score_spread":0.1413737220717861,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2544442953","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.049823955,0.012259391,0.102616556,0.47496969,0.12274083,0.00026925147,0.0067910757,0.0026207722,0.2279085],"genre_scores_gemma":[0.5792585,0.0085737035,0.07949401,0.1471853,0.027291508,0.0006354666,0.0038914224,0.006211466,0.14745858],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9893489,0.0053250813,0.0013375832,0.001197494,0.002273102,0.0005179209],"domain_scores_gemma":[0.9530129,0.026351092,0.0035736412,0.0054331208,0.010311662,0.0013176042],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0063571273,0.0007161484,0.0008553084,0.0027447636,0.005120325,0.0077811256,0.001278501,0.0035081229,0.021252416],"category_scores_gemma":[0.032533213,0.0004078349,0.00037846903,0.0058386875,0.008844265,0.007626878,0.0039132936,0.0074537788,0.010275564],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000528498,0.00006285078,0.0028225512,0.00076390465,0.00003904418,0.00050080556,0.012518311,0.00021549755,0.0026636664,0.38210258,0.5332643,0.06451793],"study_design_scores_gemma":[0.0000119940905,0.000038891332,0.0008921054,0.00035019993,0.000012581093,0.0004635875,0.0036534814,0.0003137807,0.0012309258,0.018484501,0.9745072,0.00004086971],"about_ca_topic_score_codex":0.0043343096,"about_ca_topic_score_gemma":0.0041493853,"teacher_disagreement_score":0.99364287,"about_ca_system_score_codex":0.0028641857,"about_ca_system_score_gemma":0.003737511,"threshold_uncertainty_score":0.07109642},"labels":[],"label_agreement":null},{"id":"W2544486974","doi":"10.14778/2994509.2994518","title":"Detecting data errors","year":2016,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":237,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"University of California Berkeley","keywords":"Computer science; Raw data; Outlier; Data mining; Set (abstract data type); Variety (cybernetics); Data quality; Ground truth; Anomaly detection; Quality (philosophy); Big data; Data science; Machine learning; Artificial intelligence; Engineering","score_opus":0.30976099780462824,"score_gpt":0.41262294928917714,"score_spread":0.10286195148454891,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2544486974","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.11729096,0.002201726,0.810873,0.0032461092,0.0008943844,0.0019433573,0.015100043,0.039766625,0.008683854],"genre_scores_gemma":[0.26726305,0.00065665913,0.7069734,0.0014015376,0.00014395389,0.0009840429,0.015839912,0.0027570985,0.0039804354],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9522556,0.009320097,0.007339614,0.011260907,0.018240035,0.0015837299],"domain_scores_gemma":[0.7991547,0.07963275,0.01970252,0.064534865,0.035493746,0.001481378],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.020980965,0.0022116809,0.001998074,0.009275529,0.0016451668,0.0051043616,0.004321513,0.002830164,0.002670607],"category_scores_gemma":[0.15179028,0.000865113,0.0020160691,0.007719268,0.0015979238,0.005799147,0.0065647718,0.0027270466,0.0028608919],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00095121656,0.00058896106,0.118958615,0.0037388871,0.00070832815,0.0023220924,0.008237539,0.013977137,0.03586598,0.021077884,0.048595954,0.7449773],"study_design_scores_gemma":[0.00020180193,0.00089806615,0.07099519,0.0021148338,0.0008785389,0.004792019,0.008833255,0.21652001,0.31197852,0.07103218,0.31104565,0.00070994796],"about_ca_topic_score_codex":0.0023586159,"about_ca_topic_score_gemma":0.002255817,"teacher_disagreement_score":0.020980965,"about_ca_system_score_codex":0.0013152073,"about_ca_system_score_gemma":0.0032493733,"threshold_uncertainty_score":0.11095929},"labels":[],"label_agreement":null},{"id":"W2548323776","doi":"10.1109/jcpc.2009.5420215","title":"The study and application of IMS Learning Design specifications in a mobile context","year":2009,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Athabasca University","funders":"","keywords":"Standardization; Software portability; Computer science; Implementation; Context (archaeology); Multimedia; Human–computer interaction; World Wide Web; Data science; Knowledge management; Software engineering; Programming language","score_opus":0.2655955715190111,"score_gpt":0.43201500241200147,"score_spread":0.16641943089299038,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2548323776","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12048009,0.0005128753,0.8331489,0.002068526,0.00010857544,0.0010228831,0.00018832591,0.000995349,0.04147452],"genre_scores_gemma":[0.44335353,0.0005206367,0.5484675,0.0002856029,0.000049983362,0.0008120179,0.00032082887,0.00017072778,0.0060191024],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9764307,0.0124031,0.002207635,0.0011849763,0.007213734,0.0005598115],"domain_scores_gemma":[0.95027506,0.027826486,0.0052402923,0.0068492843,0.009184847,0.00062398065],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02369973,0.00052078575,0.00042649705,0.0016172996,0.0013424245,0.006093041,0.0019144709,0.0014955286,0.0015900771],"category_scores_gemma":[0.047525052,0.000508579,0.0005994582,0.0014902721,0.0031430211,0.005580862,0.0023121894,0.0014089053,0.000687899],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025399038,0.00045408064,0.017633563,0.0013451463,0.000072453695,0.000606501,0.023750683,0.03140443,0.013158988,0.5311139,0.0041462537,0.37605998],"study_design_scores_gemma":[0.00017687607,0.0022537555,0.01627249,0.002425291,0.00020648068,0.0028816129,0.028035816,0.20348263,0.08508265,0.13935149,0.519534,0.0002969216],"about_ca_topic_score_codex":0.0045675077,"about_ca_topic_score_gemma":0.0046301465,"teacher_disagreement_score":0.02369973,"about_ca_system_score_codex":0.004619581,"about_ca_system_score_gemma":0.0052964156,"threshold_uncertainty_score":0.12533766},"labels":[],"label_agreement":null},{"id":"W2549035799","doi":"10.14778/3007263.3007320","title":"Qualitative data cleaning","year":2016,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":40,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Scripting language; Data quality; Data science; Analytics; Big data; Data mining; Qualitative property; Taxonomy (biology); Human error; Data analysis; Machine learning; Engineering; Reliability engineering","score_opus":0.49719438527572407,"score_gpt":0.5118316654115125,"score_spread":0.01463728013578841,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2549035799","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0063292184,0.0024080246,0.95290375,0.006619236,0.0009322039,0.0020391364,0.007603204,0.003262329,0.017902784],"genre_scores_gemma":[0.09568972,0.004334341,0.86402375,0.0046153786,0.0005877364,0.0041344156,0.011801747,0.0015289113,0.01328402],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.92576873,0.029795036,0.0071179285,0.007476767,0.028182898,0.0016586866],"domain_scores_gemma":[0.8062847,0.06957751,0.014324901,0.052234415,0.05603293,0.0015454716],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.053398643,0.002031484,0.002210829,0.0070739063,0.0042020124,0.009652482,0.0054167253,0.0020544787,0.012347684],"category_scores_gemma":[0.1973461,0.0011848024,0.0029508083,0.011121048,0.0044459286,0.009192078,0.009725417,0.004343951,0.0056048883],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005591808,0.00025971598,0.013604731,0.010330168,0.0005347159,0.00054726924,0.011457157,0.009163247,0.01463893,0.29438984,0.090151325,0.55436367],"study_design_scores_gemma":[0.00010920025,0.0003041657,0.006333708,0.0041732583,0.00026294318,0.00097269646,0.007900896,0.021722533,0.030341312,0.25585318,0.6717395,0.0002865991],"about_ca_topic_score_codex":0.005870326,"about_ca_topic_score_gemma":0.004911764,"teacher_disagreement_score":0.94660133,"about_ca_system_score_codex":0.0051969755,"about_ca_system_score_gemma":0.011822782,"threshold_uncertainty_score":0.2824024},"labels":[],"label_agreement":null},{"id":"W2550374641","doi":"10.48550/arxiv.1611.06951","title":"Enforcing Relational Matching Dependencies with Datalog for Entity Resolution","year":2016,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"","keywords":"Datalog; Computer science; Relational database; Matching (statistics); Conjunctive query; Programming language; Semantics (computer science); Task (project management); Resolution (logic); Dependency theory (database theory); Theoretical computer science; Database; Process (computing); Data mining; Functional dependency; Mathematics","score_opus":0.30729618089979704,"score_gpt":0.2671823725150406,"score_spread":0.04011380838475642,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2550374641","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009195866,0.00014379136,0.98599595,0.0007096861,0.00003167431,0.00016762054,0.00043307547,0.001849974,0.0014724297],"genre_scores_gemma":[0.26990497,0.00043953216,0.72400475,0.00080174214,0.00013034344,0.00040659463,0.0015726124,0.00049623696,0.0022432425],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.994505,0.0019695326,0.00048911246,0.00070265477,0.00197971,0.0003538768],"domain_scores_gemma":[0.9836198,0.011236708,0.0010249512,0.0027210913,0.0011384238,0.00025892592],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0074330503,0.00054704736,0.00066180975,0.0012772474,0.0007204809,0.0023043477,0.0023542002,0.0010000775,0.00234108],"category_scores_gemma":[0.022827629,0.0008364963,0.0015980554,0.0016176469,0.0022412422,0.0055477093,0.0032758196,0.003190359,0.0005353418],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00030912153,0.0004901265,0.0046929484,0.0005480468,0.00011853372,0.00053184055,0.00093147875,0.31459433,0.007041179,0.5040529,0.009349315,0.15734026],"study_design_scores_gemma":[0.000042904816,0.00006095056,0.0003263698,0.0000690657,0.0000524093,0.00013419978,0.00008650578,0.7128665,0.009689029,0.26037127,0.016269546,0.000031243966],"about_ca_topic_score_codex":0.0058661,"about_ca_topic_score_gemma":0.007975497,"teacher_disagreement_score":0.0074330503,"about_ca_system_score_codex":0.0022297525,"about_ca_system_score_gemma":0.0038592017,"threshold_uncertainty_score":0.039310217},"labels":[],"label_agreement":null},{"id":"W2557720241","doi":"10.15353/joci.v12i3.3276","title":"Data Literacy defined pro populo: To read this article, please provide a little information","year":2016,"lang":"en","type":"article","venue":"The Journal of Community Informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":29,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Literacy; Context (archaeology); Information literacy; Data science; Computer science; Sociology; Public relations; Political science; World Wide Web; Geography; Pedagogy","score_opus":0.23660703003835448,"score_gpt":0.42837699405994095,"score_spread":0.19176996402158647,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2557720241","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0029053774,0.04468984,0.0203926,0.8013778,0.037213936,0.00009683196,0.00060507027,0.0002003233,0.09251825],"genre_scores_gemma":[0.17421463,0.112608775,0.040222548,0.492136,0.07294156,0.00090639835,0.001500494,0.0011927363,0.104276836],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99066,0.005546779,0.00061602023,0.00081958174,0.0019435497,0.0004141003],"domain_scores_gemma":[0.96997684,0.019500198,0.0017412015,0.0015159897,0.005873967,0.0013918133],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007129336,0.00084043277,0.00072789675,0.003708338,0.003420961,0.010024509,0.0013739851,0.0056532007,0.009452121],"category_scores_gemma":[0.046626285,0.0003101465,0.00044935977,0.004313129,0.01087475,0.013746936,0.006161282,0.010503375,0.0045334776],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000402048,0.000036413716,0.0012988386,0.0006905204,0.000012863996,0.00019273623,0.00961241,0.00011651943,0.00024383016,0.31892827,0.5575384,0.111289],"study_design_scores_gemma":[0.000004586404,0.00001671973,0.0005331938,0.001193344,0.0000044968197,0.0003173772,0.00231174,0.00012001536,0.00020979313,0.040651724,0.9546139,0.00002312793],"about_ca_topic_score_codex":0.0022581103,"about_ca_topic_score_gemma":0.0019054201,"teacher_disagreement_score":0.010024509,"about_ca_system_score_codex":0.0018736272,"about_ca_system_score_gemma":0.003971651,"threshold_uncertainty_score":0.03770399},"labels":[],"label_agreement":null},{"id":"W2557723918","doi":"10.15353/joci.v12i3.3274","title":"Data Literacy - What is it and how can we make it happen?","year":2016,"lang":"en","type":"article","venue":"The Journal of Community Informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":64,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Literacy; Context (archaeology); Information literacy; The Internet; Computer science; Data science; Internet privacy; Political science; World Wide Web; Sociology; Geography; Pedagogy","score_opus":0.31089620332430623,"score_gpt":0.43750529438792857,"score_spread":0.12660909106362234,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2557723918","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005748375,0.04260472,0.003817451,0.91539234,0.0029698317,0.000060871185,0.00020957053,0.00008716077,0.02910965],"genre_scores_gemma":[0.41657528,0.29846284,0.02047693,0.23453517,0.008129151,0.0004433255,0.0010024682,0.00040884296,0.019966053],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9742319,0.014979762,0.0014257969,0.0015182472,0.005577724,0.002266616],"domain_scores_gemma":[0.9208875,0.04788995,0.0040283687,0.0041198456,0.010272025,0.012802342],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.026258228,0.0005611147,0.0014242438,0.0045150127,0.006574665,0.024539175,0.0023347994,0.006188718,0.010189078],"category_scores_gemma":[0.09095004,0.00058447075,0.0010054715,0.0048347204,0.02293364,0.04839615,0.011164363,0.014499477,0.0038979778],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000849067,0.00024804953,0.021579936,0.0040143747,0.00011773658,0.0004793305,0.035834573,0.00034157524,0.00049060886,0.30816817,0.2043583,0.42428246],"study_design_scores_gemma":[0.000017826,0.00012193635,0.008819853,0.015836554,0.000046888053,0.00091099454,0.05694653,0.00030386559,0.0004281542,0.27619532,0.6402711,0.00010106275],"about_ca_topic_score_codex":0.0076051247,"about_ca_topic_score_gemma":0.006872566,"teacher_disagreement_score":0.026258228,"about_ca_system_score_codex":0.0071123783,"about_ca_system_score_gemma":0.015976872,"threshold_uncertainty_score":0.13886845},"labels":[],"label_agreement":null},{"id":"W2559039427","doi":"10.1145/3005395","title":"Editorial","year":2016,"lang":"en","type":"editorial","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Citation; Library science; Amazon rainforest; Computer science; World Wide Web","score_opus":0.15522288639632592,"score_gpt":0.4827182751786968,"score_spread":0.3274953887823709,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2559039427","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000044934855,0.0025537976,0.00012769585,0.03326892,0.96054953,0.000019025778,0.00008320666,0.00006328568,0.0032896244],"genre_scores_gemma":[0.0006239277,0.0040047895,0.0001633735,0.02849727,0.94334215,0.000025830615,0.000121721794,0.00005974459,0.02316124],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99638736,0.0003525536,0.00043250757,0.0006228768,0.0018657875,0.00033893305],"domain_scores_gemma":[0.9843923,0.002769328,0.00091077556,0.0005850644,0.008249421,0.003093191],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0038301449,0.002055835,0.0020666518,0.002140365,0.002156095,0.006395786,0.0028055883,0.0072363154,0.041991618],"category_scores_gemma":[0.020663554,0.0005355041,0.0018792633,0.0010118528,0.0014913512,0.004367258,0.0015881495,0.011819017,0.034102105],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000140643015,0.000010813338,0.00003594464,0.00008929423,0.0000047185995,0.00009649937,0.000007837651,0.0000167267,0.000037227885,0.00033467717,0.99153453,0.007817762],"study_design_scores_gemma":[0.000013891066,0.000012503932,0.00013616952,0.00016064673,0.000008303337,0.00020129139,0.000026572907,0.000049519847,0.000062798485,0.0005618097,0.9987596,0.0000068938057],"about_ca_topic_score_codex":0.00096619944,"about_ca_topic_score_gemma":0.0024003854,"teacher_disagreement_score":0.041991618,"about_ca_system_score_codex":0.0019641013,"about_ca_system_score_gemma":0.0027473294,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W2560772377","doi":"10.5281/zenodo.1118394","title":"The Picasso Project","year":2016,"lang":"en","type":"article","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Statistics Canada","funders":"","keywords":"Metadata; Computer science; Metadata repository; Metadata management; Meta Data Services; RDF; Linked data; World Wide Web; Data dictionary; Data element; Data mapping; Database; Information retrieval; Semantic Web","score_opus":0.4956699751435978,"score_gpt":0.4794309033703781,"score_spread":0.016239071773219704,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2560772377","genre_codex":"other","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013962525,0.009598201,0.05919311,0.040464595,0.0048592035,0.001727243,0.10907591,0.0146739995,0.74644524],"genre_scores_gemma":[0.0801011,0.008818561,0.105297394,0.007946827,0.001372199,0.002405696,0.20143034,0.009980191,0.5826477],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.98957217,0.002802186,0.0003643735,0.0014781023,0.0043551386,0.0014279725],"domain_scores_gemma":[0.9852306,0.0022531117,0.0005401993,0.0025582865,0.005862131,0.0035557097],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010796875,0.0013304062,0.00096140563,0.005982383,0.0030177713,0.011971708,0.0029255578,0.0014136066,0.07387371],"category_scores_gemma":[0.016014848,0.00058853807,0.0011368976,0.008773177,0.0017441497,0.0035182876,0.0073237903,0.0020149117,0.02282832],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003175015,0.000117709606,0.005435316,0.00033153853,0.00006127035,0.00015606501,0.0008774803,0.001740909,0.00054172345,0.16052718,0.6602849,0.16960844],"study_design_scores_gemma":[0.000027905457,0.000012243749,0.0016342195,0.00015371467,0.000008802607,0.000033536144,0.00039250698,0.0008691513,0.00019927057,0.0071889786,0.98946476,0.000014743111],"about_ca_topic_score_codex":0.5475895,"about_ca_topic_score_gemma":0.45301962,"teacher_disagreement_score":0.5475895,"about_ca_system_score_codex":0.020476846,"about_ca_system_score_gemma":0.07904482,"threshold_uncertainty_score":0.9101497},"labels":[],"label_agreement":null},{"id":"W2564027179","doi":"10.1609/aaai.v30i1.9880","title":"Ontology Instance Linking: Towards Interlinked Knowledge Graphs","year":2016,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":13,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Thomson Reuters (Canada)","funders":"","keywords":"Computer science; Coreference; Identifier; Ontology; Information retrieval; Semantic Web; Linked data; Entity linking; Unique identifier; Data mining; Data science; Artificial intelligence; Resolution (logic); Knowledge base; Programming language","score_opus":0.33435980493086737,"score_gpt":0.424342706670221,"score_spread":0.08998290173935364,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2564027179","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008056728,0.00042192376,0.983518,0.00049820234,0.000053835978,0.00025090636,0.0015930072,0.0031647333,0.0024425678],"genre_scores_gemma":[0.06901214,0.0008948766,0.91625154,0.00048814595,0.0000886599,0.0003967168,0.010055331,0.00067652116,0.0021360535],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9913987,0.003090516,0.00054653845,0.0025495298,0.0021396175,0.00027512782],"domain_scores_gemma":[0.97552913,0.01436006,0.0018833308,0.0051173395,0.0026083176,0.0005017976],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0063391104,0.0020925724,0.0013532063,0.013458333,0.0027212661,0.004728414,0.0040460653,0.0032421907,0.003832642],"category_scores_gemma":[0.04633697,0.0013727577,0.0024772696,0.015485767,0.0018482455,0.010763492,0.008922614,0.0032078687,0.00214102],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00024506723,0.00044397952,0.0069437968,0.0014382687,0.000533503,0.0009024853,0.002911214,0.15250193,0.005973651,0.14026962,0.032418564,0.6554179],"study_design_scores_gemma":[0.000049249615,0.000055945617,0.0012845926,0.0003195991,0.00018656421,0.00040175152,0.0007302163,0.48928103,0.0076406053,0.4544375,0.045558292,0.00005468838],"about_ca_topic_score_codex":0.0069185654,"about_ca_topic_score_gemma":0.011418103,"teacher_disagreement_score":0.013458333,"about_ca_system_score_codex":0.0015282801,"about_ca_system_score_gemma":0.0025479598,"threshold_uncertainty_score":0.03352487},"labels":[],"label_agreement":null},{"id":"W2565866388","doi":"10.1109/dsaa.2016.91","title":"Meeting Health Care Research Needs in a Kimball Integrated Data Warehouse","year":2016,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria","funders":"","keywords":"Data warehouse; Business intelligence; Strengths and weaknesses; Data science; Computer science; Health care; Knowledge management; Process management; Business; Data mining; Psychology","score_opus":0.7122640670249207,"score_gpt":0.5932049366698655,"score_spread":0.11905913035505522,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2565866388","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.050406843,0.0017330761,0.90709937,0.023086192,0.0004759396,0.0022105558,0.0024260501,0.0019774546,0.010584669],"genre_scores_gemma":[0.05832282,0.0008681776,0.9357793,0.0017002559,0.00017490626,0.0005535907,0.001264577,0.00008888705,0.0012475275],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.97264594,0.011936726,0.005554183,0.003197227,0.005326895,0.0013390401],"domain_scores_gemma":[0.9417921,0.022264222,0.006929321,0.013021516,0.012843144,0.0031496629],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06827164,0.00091648445,0.0021347762,0.0080418065,0.003470336,0.029647386,0.0064254445,0.0037607055,0.0034960667],"category_scores_gemma":[0.06696816,0.002292293,0.0030921926,0.015479199,0.0021436233,0.024895417,0.013860253,0.0040757973,0.0023238666],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001332039,0.0013895833,0.036131654,0.0030312773,0.0010044253,0.004475552,0.010659723,0.034853667,0.014842537,0.47424513,0.034288988,0.38374555],"study_design_scores_gemma":[0.00076591264,0.0009498126,0.011213649,0.0031586625,0.0007269442,0.0032928851,0.020357579,0.22294806,0.010649862,0.4392673,0.28618294,0.00048641488],"about_ca_topic_score_codex":0.0055118925,"about_ca_topic_score_gemma":0.0082935,"teacher_disagreement_score":0.06827164,"about_ca_system_score_codex":0.003713768,"about_ca_system_score_gemma":0.010646165,"threshold_uncertainty_score":0.36105925},"labels":[],"label_agreement":null},{"id":"W2565966619","doi":"10.1109/cbi.2016.9","title":"ELM: An Extended Logic Matching Method on Record Linkage Analysis of Disparate Databases for Profiling Data Mining","year":2016,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Computer science; Data mining; Probabilistic logic; Profiling (computer programming); Data deduplication; Matching (statistics); Identifier; Artificial intelligence; Machine learning; Database; Mathematics; Statistics","score_opus":0.5979240502219576,"score_gpt":0.5597760552806768,"score_spread":0.03814799494128085,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2565966619","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0056009046,0.00021131485,0.9894387,0.00017743894,0.000035397203,0.0002549318,0.00060193235,0.0027817998,0.00089752086],"genre_scores_gemma":[0.054924194,0.00014010046,0.94214696,0.00016534749,0.000045121782,0.0003032523,0.001301485,0.00017987385,0.00079364446],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9889776,0.003896498,0.001274014,0.0016149032,0.0039473264,0.00028966932],"domain_scores_gemma":[0.990042,0.0058208797,0.0011553058,0.001583187,0.0011798259,0.00021869493],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011499365,0.0009390591,0.0013119945,0.0105722835,0.0014422546,0.0033626154,0.0031669333,0.0016259885,0.0049951645],"category_scores_gemma":[0.033985488,0.0005237712,0.0018711435,0.0106086135,0.0010468718,0.0044312486,0.0042576464,0.0016879386,0.0016166737],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005150264,0.0003808053,0.009708775,0.000558315,0.000483362,0.00073845783,0.0007316735,0.025664367,0.0072951424,0.047273304,0.007867398,0.8987834],"study_design_scores_gemma":[0.00012606823,0.00031221687,0.00469426,0.00024580734,0.00025016157,0.0016189096,0.00046096323,0.7711545,0.013468,0.17800236,0.029524919,0.00014184944],"about_ca_topic_score_codex":0.0018212005,"about_ca_topic_score_gemma":0.0021071525,"teacher_disagreement_score":0.011499365,"about_ca_system_score_codex":0.0010694402,"about_ca_system_score_gemma":0.0023199122,"threshold_uncertainty_score":0.060815156},"labels":[],"label_agreement":null},{"id":"W257370745","doi":"10.1007/978-3-642-38457-8_4","title":"Move Pruning and Duplicate Detection","year":2013,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Pruning; Computer science; Heuristic; Conjunction (astronomy); Simple (philosophy); State (computer science); Artificial intelligence; Machine learning; Data mining; Algorithm","score_opus":0.07483745370710014,"score_gpt":0.329650977274377,"score_spread":0.2548135235672768,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W257370745","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009270249,0.004514855,0.968439,0.0007664855,0.00070608483,0.00016834312,0.000591164,0.002332845,0.013210978],"genre_scores_gemma":[0.08992303,0.002641454,0.8635881,0.00039502754,0.00057690445,0.00022252575,0.002216967,0.0009142678,0.03952175],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9963547,0.00060762546,0.00022173964,0.0008984679,0.0016383107,0.00027921848],"domain_scores_gemma":[0.9932199,0.002702725,0.00039794235,0.0024156312,0.0010881079,0.00017573695],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002842665,0.0014793602,0.0023786058,0.004204633,0.0023234854,0.0033957958,0.0052478523,0.0022809925,0.009605746],"category_scores_gemma":[0.012351925,0.0012295663,0.0018414512,0.005784029,0.0015947409,0.004454804,0.004023493,0.0023325467,0.005141791],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022241108,0.000119823286,0.0011873706,0.0005433543,0.00019169779,0.00035484447,0.00029067328,0.023213105,0.0067020576,0.08700554,0.04858938,0.8315796],"study_design_scores_gemma":[0.000062013045,0.00019554076,0.0018266346,0.00027753806,0.00034721385,0.0025454215,0.00031516736,0.39782622,0.035053045,0.4332042,0.12821196,0.0001349882],"about_ca_topic_score_codex":0.0027671931,"about_ca_topic_score_gemma":0.004318518,"teacher_disagreement_score":0.009605746,"about_ca_system_score_codex":0.0012299353,"about_ca_system_score_gemma":0.0017175644,"threshold_uncertainty_score":0.032134414},"labels":[],"label_agreement":null},{"id":"W2574540012","doi":"10.1101/094888","title":"DataMed: Finding useful data across multiple biomedical data repositories","year":2016,"lang":"en","type":"preprint","venue":"bioRxiv (Cold Spring Harbor Laboratory)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"U.S. National Library of Medicine; National Institute of Allergy and Infectious Diseases; National Human Genome Research Institute; University of California, San Diego; National Institute of Environmental Health Sciences; University of California, Los Angeles; University of Manchester; Yale University; European Bioinformatics Institute; Arizona State University; McGill University; National Institute of Diabetes and Digestive and Kidney Diseases; Johns Hopkins University; Purdue University; School of Medicine, New York University; National Institutes of Health; Universitair Medisch Centrum Groningen; GlaxoSmithKline","keywords":"Metadata; Interoperability; Computer science; Big data; Data science; Data discovery; World Wide Web; Knowledge extraction; Service (business); Reusability; Information retrieval; Data mining; Software","score_opus":0.23407611614065013,"score_gpt":0.4000028326354582,"score_spread":0.16592671649480809,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2574540012","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12263867,0.007295388,0.7239127,0.029960923,0.000989291,0.0021717586,0.03467115,0.06270102,0.015659083],"genre_scores_gemma":[0.19817343,0.0010508873,0.76763725,0.002012776,0.0002558307,0.00043345656,0.026002347,0.0016644817,0.002769583],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9805925,0.0065078163,0.0022849203,0.0028835137,0.0071460814,0.00058509165],"domain_scores_gemma":[0.95603186,0.020140849,0.0042780833,0.011368055,0.005145709,0.0030353358],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.026021188,0.0013000625,0.0015633807,0.01683413,0.0021508376,0.011093205,0.004132461,0.0027929165,0.005260518],"category_scores_gemma":[0.056966662,0.0011306739,0.0018546565,0.013007978,0.0021282497,0.012152504,0.012289136,0.0020465497,0.0019703535],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0026096478,0.0012323671,0.07431273,0.004218296,0.0015677939,0.0028886772,0.0029394494,0.015506169,0.03245621,0.09812188,0.15803899,0.60610783],"study_design_scores_gemma":[0.00096724887,0.00084060564,0.026937632,0.0021284723,0.0009148493,0.002856224,0.0055473945,0.32930827,0.11161189,0.24176687,0.27647614,0.00064437545],"about_ca_topic_score_codex":0.003260916,"about_ca_topic_score_gemma":0.005775979,"teacher_disagreement_score":0.026021188,"about_ca_system_score_codex":0.002173916,"about_ca_system_score_gemma":0.004602063,"threshold_uncertainty_score":0.13761479},"labels":[],"label_agreement":null},{"id":"W2579288502","doi":"","title":"Record linkage procedures to detect cardiovascular endpoints in follow-up studies","year":2002,"lang":"en","type":"article","venue":"BOA (University of Milano-Bicocca)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Linkage (software); Record linkage; Medicine; Internal medicine; Biology; Genetics; Environmental health","score_opus":0.18828756166085972,"score_gpt":0.3266984085877627,"score_spread":0.138410846926903,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2579288502","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.04069216,0.0022708366,0.8127257,0.0009478298,0.000989127,0.068614386,0.0557572,0.004726696,0.013276077],"genre_scores_gemma":[0.11866481,0.0009132435,0.5676538,0.0006353734,0.00039518278,0.28299743,0.02259014,0.00057559495,0.0055744993],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.6805542,0.23864675,0.039305855,0.014307186,0.024411777,0.0027741515],"domain_scores_gemma":[0.5113758,0.30526072,0.038506318,0.1214018,0.021100909,0.0023545176],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.19124559,0.0016617815,0.0039981203,0.016511638,0.0030936333,0.0027129669,0.005237885,0.0027443054,0.025047401],"category_scores_gemma":[0.49852344,0.0021491058,0.002765679,0.01755007,0.0016840181,0.002713635,0.005107273,0.004115232,0.004326136],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.015174622,0.0023019565,0.1691915,0.01289648,0.015598071,0.0014254216,0.006239127,0.01063588,0.002119467,0.07241453,0.09100808,0.60099494],"study_design_scores_gemma":[0.015258961,0.009654996,0.27196684,0.0059482236,0.012449875,0.0032508457,0.0033708059,0.11543805,0.0117591275,0.16044186,0.38965535,0.0008050482],"about_ca_topic_score_codex":0.0040070987,"about_ca_topic_score_gemma":0.0042505465,"teacher_disagreement_score":0.80875444,"about_ca_system_score_codex":0.0013373137,"about_ca_system_score_gemma":0.006092966,"threshold_uncertainty_score":0.9973382},"labels":[],"label_agreement":null},{"id":"W2583699183","doi":"","title":"Data Ingestion for the Connected World.","year":2017,"lang":"en","type":"article","venue":"Conference on Innovative Data Systems Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":68,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Ingestion; Medicine","score_opus":0.9484017230905639,"score_gpt":0.6713623530691826,"score_spread":0.27703937002138135,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2583699183","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.051853023,0.014648803,0.68377143,0.045319203,0.0055823997,0.0011249152,0.02441284,0.091362715,0.081924684],"genre_scores_gemma":[0.46076953,0.010637851,0.41750494,0.0047654975,0.0020639661,0.0005849376,0.052537836,0.01098053,0.040154874],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9952683,0.0016585937,0.00041356945,0.0006789845,0.0016599242,0.00032056242],"domain_scores_gemma":[0.97776574,0.0066887415,0.00060129596,0.010751679,0.0031401417,0.001052456],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008336633,0.0009813579,0.0010152826,0.0034653135,0.0025260048,0.009847531,0.0028479074,0.002645242,0.021677388],"category_scores_gemma":[0.029643683,0.00088624563,0.0012401751,0.005397003,0.0019023519,0.018429665,0.008626588,0.0029728382,0.010067108],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015373876,0.0003571335,0.012599342,0.0008803311,0.00037520906,0.00092686503,0.0013166124,0.008563974,0.005718277,0.11959459,0.38008025,0.4680501],"study_design_scores_gemma":[0.00023223774,0.00019914916,0.00607223,0.0010230059,0.00026222013,0.0010105747,0.0022365537,0.112678744,0.020279258,0.270132,0.58571064,0.00016343122],"about_ca_topic_score_codex":0.003883541,"about_ca_topic_score_gemma":0.0039234124,"teacher_disagreement_score":0.021677388,"about_ca_system_score_codex":0.0014709058,"about_ca_system_score_gemma":0.0034303262,"threshold_uncertainty_score":0.07251805},"labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"bench_or_experimental","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":[],"domain":null,"study_design":"not_applicable","genre":"software","about_ca_system":false,"about_ca_topic":false,"confidence":"high"}],"label_agreement":"split"},{"id":"W2591159053","doi":"10.1515/jos-2017-0006","title":"Three Methods for Occupation Coding Based on Statistical Learning","year":2017,"lang":"en","type":"article","venue":"Journal of Official Statistics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":51,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Coding (social sciences); Computer science; Respondent; Statistical learning; German; Artificial intelligence; Machine learning; Data mining; Statistics; Mathematics; Geography","score_opus":0.35728536526680754,"score_gpt":0.5651666475921359,"score_spread":0.20788128232532832,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2591159053","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010020809,0.00014666472,0.98765135,0.00027914665,0.0000491675,0.00014759501,0.00013396106,0.00073311495,0.00083817466],"genre_scores_gemma":[0.15481351,0.00012930465,0.84171784,0.00013586882,0.000121978934,0.00045724807,0.0006515344,0.00018643485,0.001786278],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98129785,0.00878223,0.0015031047,0.0024490203,0.0053876187,0.0005801504],"domain_scores_gemma":[0.9198611,0.05101637,0.0044639865,0.010243106,0.013409443,0.0010060406],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.014357362,0.001088303,0.0014730471,0.008333919,0.0013478724,0.002892242,0.0045818733,0.0017883229,0.0029694396],"category_scores_gemma":[0.08516278,0.00067303685,0.0013638006,0.0058775125,0.0022480912,0.0043636393,0.004165878,0.0024867356,0.0012898963],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00036962333,0.0004075393,0.018888751,0.00029779098,0.00025691223,0.00014229193,0.0010434956,0.07355724,0.0022428199,0.045111436,0.006284544,0.8513975],"study_design_scores_gemma":[0.000038969396,0.00004587773,0.0025475784,0.00005590318,0.00004229261,0.00013012315,0.00029352243,0.94625014,0.0034991973,0.04470794,0.0023192302,0.00006916406],"about_ca_topic_score_codex":0.007773832,"about_ca_topic_score_gemma":0.0070481603,"teacher_disagreement_score":0.014357362,"about_ca_system_score_codex":0.0023579204,"about_ca_system_score_gemma":0.003446348,"threshold_uncertainty_score":0.07592988},"labels":[],"label_agreement":null},{"id":"W2591700809","doi":"10.14778/3137628.3137631","title":"HoloClean","year":2017,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":454,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada; Defense Advanced Research Projects Agency","keywords":"Leverage (statistics); Computer science; Probabilistic logic; Inference; Tuple; Data mining; Statistical model; Machine learning; Artificial intelligence; Mathematics","score_opus":0.22842113719041443,"score_gpt":0.4286142488382545,"score_spread":0.20019311164784007,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2591700809","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.002447318,0.0008144128,0.9284461,0.0006306557,0.00018847355,0.00025845022,0.0038877549,0.057100773,0.006226082],"genre_scores_gemma":[0.056501098,0.0006951344,0.90884465,0.0010321318,0.000120729215,0.00044922275,0.016860064,0.007929657,0.0075673508],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99493825,0.00079898984,0.00038757044,0.0014657937,0.0021026782,0.0003067198],"domain_scores_gemma":[0.9922168,0.0024181514,0.0004580509,0.0035613473,0.0011020446,0.00024355476],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004578141,0.001504516,0.0014914782,0.00361551,0.0010163506,0.0050338036,0.0068213055,0.0015344174,0.01789622],"category_scores_gemma":[0.02542172,0.0012098736,0.0031228617,0.00255591,0.0018275846,0.006923518,0.007741638,0.003278982,0.00826311],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00055648084,0.00020679584,0.006176967,0.001574929,0.00032541467,0.00046439565,0.000695684,0.06786154,0.004960692,0.11640966,0.123634756,0.6771326],"study_design_scores_gemma":[0.00010885186,0.000112434514,0.0010843189,0.00033627526,0.00009390851,0.00064940646,0.00017373175,0.46641612,0.012034581,0.2181794,0.3006937,0.00011725965],"about_ca_topic_score_codex":0.008731898,"about_ca_topic_score_gemma":0.015827257,"teacher_disagreement_score":0.01789622,"about_ca_system_score_codex":0.0021318803,"about_ca_system_score_gemma":0.0050244643,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W2603227181","doi":"10.35502/jcswb.39","title":"Data opportunities and risks: the dynamic of public, personal, and commercial interest","year":2017,"lang":"en","type":"article","venue":"Journal of Community Safety and Well-Being","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"Government of Saskatchewan","funders":"","keywords":"Public interest; Business; Internet privacy; Risk analysis (engineering); Computer science; Political science","score_opus":0.5241872281998107,"score_gpt":0.4611656499565048,"score_spread":0.0630215782433059,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2603227181","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.48876488,0.009383161,0.040812057,0.22197595,0.00054752216,0.0001725819,0.0011590408,0.00024090537,0.236944],"genre_scores_gemma":[0.9935953,0.0009638836,0.0015719624,0.0015109343,0.00020545794,0.000029633735,0.000053538366,0.000027954471,0.0020412754],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9837331,0.009406418,0.00057293416,0.0011851072,0.0036799542,0.0014225022],"domain_scores_gemma":[0.790116,0.15715182,0.021186339,0.005779658,0.014577206,0.011188932],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.023231048,0.00025863643,0.00054286397,0.0038315973,0.002942449,0.022435045,0.00160171,0.0040970836,0.012309451],"category_scores_gemma":[0.10142221,0.00053116475,0.00049815606,0.0030805934,0.008982177,0.020343935,0.006640783,0.0049427035,0.0009627811],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004544031,0.00074901973,0.21956259,0.00039175322,0.00023202975,0.0012117432,0.023890816,0.0028323082,0.0015961884,0.58795506,0.018922785,0.14220119],"study_design_scores_gemma":[0.000060514398,0.0002553346,0.13186076,0.00077958585,0.00016455434,0.0015950106,0.105093874,0.01252277,0.0017380891,0.6064955,0.13915706,0.000276969],"about_ca_topic_score_codex":0.0040049166,"about_ca_topic_score_gemma":0.0062052724,"teacher_disagreement_score":0.023231048,"about_ca_system_score_codex":0.004990822,"about_ca_system_score_gemma":0.0038603551,"threshold_uncertainty_score":0.122859},"labels":[],"label_agreement":null},{"id":"W2604978321","doi":"10.1145/3148239","title":"Ontological Multidimensional Data Models and Contextual Data Quality","year":2017,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":20,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University; Carleton University","funders":"","keywords":"Computer science; Datalog; Dimension (graph theory); Context (archaeology); Data model (GIS); Data quality; Representation (politics); Ontology; Data mining; Data modeling; Theoretical computer science; Quality (philosophy); Information retrieval; Artificial intelligence; Database; Mathematics","score_opus":0.7487698138314796,"score_gpt":0.5623588758904626,"score_spread":0.18641093794101693,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2604978321","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0072767143,0.001166417,0.9803412,0.00450157,0.00011402181,0.00010836866,0.00066617934,0.0003234757,0.005502139],"genre_scores_gemma":[0.21609728,0.0021458846,0.7759257,0.0013708837,0.00029945307,0.00046060252,0.0018281682,0.00013335483,0.0017387118],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9820619,0.0069721173,0.0025064172,0.0023073214,0.0053532254,0.0007990493],"domain_scores_gemma":[0.9761154,0.009785069,0.0027070222,0.0075488575,0.0031566273,0.000686997],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013514141,0.0009027799,0.00103902,0.00552889,0.0018481013,0.010056939,0.002522187,0.002114565,0.0017539631],"category_scores_gemma":[0.0298539,0.00090269954,0.00278258,0.0066193077,0.0059448862,0.016536504,0.008100551,0.0036327522,0.00036413834],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000022866801,0.00002346336,0.0013279449,0.00020704082,0.0000574868,0.00018499223,0.0006284381,0.010067315,0.00057121937,0.96793914,0.0013515347,0.017618528],"study_design_scores_gemma":[0.000016729295,0.000022695256,0.0006696394,0.00021440898,0.00007753968,0.0002773722,0.0005952217,0.061085857,0.0013492032,0.90118486,0.03446044,0.000045965717],"about_ca_topic_score_codex":0.0068888357,"about_ca_topic_score_gemma":0.005091314,"teacher_disagreement_score":0.013514141,"about_ca_system_score_codex":0.0038303123,"about_ca_system_score_gemma":0.0031089033,"threshold_uncertainty_score":0.0714705},"labels":[],"label_agreement":null},{"id":"W2606005405","doi":"10.23889/ijpds.v1i1.101","title":"Privacy-Preserving Record Linkage: An international collaboration between Canada, Australia and Wales","year":2017,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Institute for Clinical Evaluative Sciences","funders":"","keywords":"Record linkage; Linkage (software); Bloom filter; Computer science; Quality (philosophy); General partnership; Probabilistic logic; Data quality; Scale (ratio); Data mining; Data science; Business; Environmental health; Medicine; Geography; Marketing; Artificial intelligence","score_opus":0.4574532106082225,"score_gpt":0.5592249468859519,"score_spread":0.1017717362777294,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2606005405","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.3677464,0.023763862,0.18228991,0.24068,0.0034522165,0.013653554,0.0053484254,0.00596299,0.15710266],"genre_scores_gemma":[0.55547583,0.010943329,0.30413923,0.014807291,0.00029522314,0.0020537812,0.006171364,0.0009848742,0.10512907],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.93496346,0.022721706,0.002546698,0.0055031683,0.027900847,0.0063641076],"domain_scores_gemma":[0.8141057,0.014609069,0.0037293073,0.010488782,0.13224535,0.024821797],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08298914,0.0009026298,0.0010139631,0.0049726674,0.013581108,0.0073636817,0.004316772,0.0023438525,0.0043469323],"category_scores_gemma":[0.055228226,0.0007990211,0.0009054396,0.0077094273,0.0046050344,0.0045921328,0.01044728,0.0027065433,0.0009340406],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00080602465,0.0014433011,0.036970057,0.0013777082,0.00032064077,0.0016917697,0.026608402,0.008246195,0.014504172,0.03637109,0.13736582,0.7342948],"study_design_scores_gemma":[0.00029488985,0.001427819,0.06042824,0.0014251587,0.00017221028,0.0009710706,0.032004982,0.0164224,0.015468351,0.008514976,0.86224097,0.0006289678],"about_ca_topic_score_codex":0.8834139,"about_ca_topic_score_gemma":0.86537665,"teacher_disagreement_score":0.11658609,"about_ca_system_score_codex":0.055170655,"about_ca_system_score_gemma":0.33914062,"threshold_uncertainty_score":0.4388938},"labels":[],"label_agreement":null},{"id":"W2606083779","doi":"10.23889/ijpds.v1i1.165","title":"A review of a standards-based set of information security practices applied in Data Linkage Centers","year":2017,"lang":"en","type":"review","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Linkage (software); Record linkage; Confidentiality; Business; Standardization; Population; Public relations; Knowledge management; Internet privacy; Computer security; Computer science; Political science; Medicine; Environmental health; Law","score_opus":0.657427594685601,"score_gpt":0.6472529292939032,"score_spread":0.010174665391697757,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2606083779","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.003965001,0.97880405,0.003797666,0.007961058,0.00054737914,0.00033156082,0.0002373487,0.000047261587,0.0043086414],"genre_scores_gemma":[0.02955577,0.95513994,0.011293158,0.0025708317,0.00019277303,0.00050140335,0.00040476903,0.000039194783,0.00030215905],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.8930759,0.048385832,0.034157157,0.0030555264,0.020023488,0.0013022292],"domain_scores_gemma":[0.6731635,0.2205536,0.040333625,0.0075199604,0.056397796,0.0020315156],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.07794357,0.001005154,0.0021827237,0.03441483,0.0024713685,0.008551059,0.0034210745,0.0030899842,0.0015220287],"category_scores_gemma":[0.16529796,0.0015338506,0.0027383885,0.03988545,0.004348939,0.009164408,0.0039332807,0.0036174415,0.0004613417],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001330587,0.00014336029,0.005849524,0.1868088,0.0005533355,0.0003241256,0.011853519,0.0006734042,0.0009780902,0.013772686,0.013868084,0.76504207],"study_design_scores_gemma":[0.00004128036,0.00033233297,0.01784345,0.63147485,0.001478105,0.0011928214,0.008495343,0.00041864283,0.0016148055,0.0027061854,0.33427772,0.00012445371],"about_ca_topic_score_codex":0.01525117,"about_ca_topic_score_gemma":0.03005191,"teacher_disagreement_score":0.92205644,"about_ca_system_score_codex":0.014265335,"about_ca_system_score_gemma":0.041306302,"threshold_uncertainty_score":0.41220993},"labels":[],"label_agreement":null},{"id":"W2606367575","doi":"10.7939/r3183481s","title":"University of Alberta Service and Academic Unit Responses to Panel Discussion on Coordinating Research Data Practices and Infrastructure","year":2012,"lang":"en","type":"article","venue":"University of Alberta Library","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Unit (ring theory); Business; Service (business); Public relations; Operations management; Engineering management; Marketing; Political science; Engineering; Psychology; Mathematics education","score_opus":0.329703113892229,"score_gpt":0.4142972109465452,"score_spread":0.0845940970543162,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2606367575","genre_codex":"commentary","genre_gemma":"other","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.018319396,0.00075642794,0.0019928906,0.9359905,0.013930902,0.00095314666,0.0007545388,0.00023438408,0.027067704],"genre_scores_gemma":[0.09593441,0.0010562254,0.005947391,0.7618072,0.0055419477,0.0015638722,0.0005584766,0.00032099884,0.12726949],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9492254,0.013027586,0.0039058614,0.0038571807,0.015951203,0.014032721],"domain_scores_gemma":[0.81613225,0.0730846,0.005702619,0.003296068,0.06708571,0.0346988],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.088154964,0.0011687769,0.0011180589,0.0026137251,0.038633086,0.021993646,0.0066261874,0.05420611,0.017736167],"category_scores_gemma":[0.12669837,0.0027809462,0.0017168794,0.003896042,0.0063147023,0.0042297672,0.011281797,0.040968835,0.0033865212],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00032777982,0.00008246543,0.0040754303,0.0002971836,0.000037554935,0.0011900122,0.01823887,0.0009909772,0.0031312695,0.006715966,0.9534227,0.011489718],"study_design_scores_gemma":[0.00009930707,0.00007570159,0.008142418,0.00036023775,0.000060800445,0.00010583933,0.038735285,0.00053922983,0.001264535,0.0021548737,0.9481915,0.0002701442],"about_ca_topic_score_codex":0.57499653,"about_ca_topic_score_gemma":0.72653246,"teacher_disagreement_score":0.92472017,"about_ca_system_score_codex":0.07527982,"about_ca_system_score_gemma":0.16465516,"threshold_uncertainty_score":0.8550128},"labels":[],"label_agreement":null},{"id":"W2606372922","doi":"10.23889/ijpds.v1i1.388","title":"A Federated Data Linkage Strategy to Support Population Health Research in Canada","year":2017,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Canadian Partnership Against Cancer","funders":"","keywords":"Cohort; Custodians; Biobank; Medicine; Data quality; Cohort study; Government (linguistics); Family medicine; Health care; Gerontology; Business; Geography; Political science; Marketing","score_opus":0.7997039661952389,"score_gpt":0.6484931996867838,"score_spread":0.1512107665084551,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2606372922","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.029128406,0.0037071318,0.58019817,0.08303431,0.0025655397,0.030036641,0.11389034,0.017307842,0.14013161],"genre_scores_gemma":[0.11515379,0.0021310798,0.749636,0.012761919,0.0003935816,0.019379465,0.06424199,0.0013392174,0.03496304],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8984814,0.04676249,0.010685987,0.007488394,0.030268652,0.0063130623],"domain_scores_gemma":[0.736087,0.031398986,0.0073825535,0.038438316,0.17343402,0.013259102],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.16698572,0.0009740192,0.0015053729,0.016683288,0.009795858,0.009545815,0.008131033,0.0026101538,0.011446388],"category_scores_gemma":[0.21516578,0.001363689,0.0018546361,0.026120013,0.0023033505,0.004253759,0.017598461,0.0026139354,0.0037294535],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00068236724,0.00027786096,0.03855968,0.0012146479,0.00065836334,0.00068140024,0.0059807766,0.008875157,0.0012807333,0.09900528,0.43093374,0.41185004],"study_design_scores_gemma":[0.00044886256,0.00013557209,0.03944822,0.0016630111,0.00024030969,0.00020322784,0.0031166864,0.03312787,0.0015713588,0.02519051,0.8946015,0.00025280903],"about_ca_topic_score_codex":0.94423604,"about_ca_topic_score_gemma":0.920008,"teacher_disagreement_score":0.9234206,"about_ca_system_score_codex":0.07657941,"about_ca_system_score_gemma":0.38488328,"threshold_uncertainty_score":0.8831155},"labels":[],"label_agreement":null},{"id":"W2606501131","doi":"10.23889/ijpds.v1i1.76","title":"Social Data Linkage Environment","year":2017,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Statistics Canada","funders":"","keywords":"Identifier; Record linkage; Computer science; Index (typography); Personally identifiable information; Internet privacy; Unique identifier; Database; World Wide Web; Computer security; Sociology; Demography","score_opus":0.6447609076066653,"score_gpt":0.5948565105111473,"score_spread":0.04990439709551797,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2606501131","genre_codex":"dataset","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.001984932,0.00049928913,0.27236125,0.010175173,0.0013032464,0.0044433647,0.3642612,0.10705311,0.23791845],"genre_scores_gemma":[0.034596477,0.0013899894,0.3518631,0.0034655395,0.0008266397,0.010196848,0.423664,0.02864935,0.14534806],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9396775,0.02261439,0.007440388,0.0068641277,0.020593012,0.002810674],"domain_scores_gemma":[0.8159842,0.053802665,0.0085642245,0.054071408,0.06100238,0.0065751197],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06567216,0.001647202,0.0025515556,0.016532393,0.006759819,0.02099108,0.0062291804,0.0026927628,0.23049697],"category_scores_gemma":[0.11941839,0.003154873,0.0017476769,0.037890166,0.0034881583,0.010801878,0.015234251,0.003679851,0.11671311],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00033912377,0.00013275263,0.0030620382,0.0009472653,0.00015094636,0.00040350063,0.0031102584,0.0022697635,0.0005541175,0.12513034,0.69446695,0.16943291],"study_design_scores_gemma":[0.000054136057,0.0000119457745,0.0007263769,0.0002009529,0.000012938124,0.00005849156,0.00030378654,0.0011882806,0.00035146368,0.014002402,0.9830458,0.000043433134],"about_ca_topic_score_codex":0.12501621,"about_ca_topic_score_gemma":0.079069465,"teacher_disagreement_score":0.23049697,"about_ca_system_score_codex":0.015610641,"about_ca_system_score_gemma":0.074034475,"threshold_uncertainty_score":0.7710892},"labels":[],"label_agreement":null},{"id":"W2606743718","doi":"10.23889/ijpds.v1i1.77","title":"Record Linkage Project Process Model","year":2017,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Statistics Canada","funders":"","keywords":"Record linkage; Linkage (software); Linked data; Process (computing); Computer science; Session (web analytics); Information retrieval; Data science; World Wide Web; Sociology; Demography; Population","score_opus":0.5924316145985103,"score_gpt":0.6150809603045536,"score_spread":0.022649345706043267,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2606743718","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015434968,0.0007676868,0.7080126,0.01070967,0.00038347972,0.0117647275,0.021485053,0.0038972378,0.22754467],"genre_scores_gemma":[0.1922692,0.0018595047,0.6153018,0.0012019016,0.00014855317,0.015708478,0.037670877,0.00070542196,0.13513431],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.93809134,0.026891828,0.005445693,0.0053803558,0.020624533,0.003566227],"domain_scores_gemma":[0.9286961,0.017909493,0.003711724,0.008127037,0.039062355,0.0024933028],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05120443,0.0012063179,0.0008463895,0.0064996,0.0051502036,0.0156936,0.0074415333,0.0045550475,0.024920003],"category_scores_gemma":[0.062110763,0.0011722624,0.0020731862,0.011465688,0.0025561797,0.01049125,0.0068377582,0.003202707,0.0089017525],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000123942,0.00026363065,0.0068246424,0.0007315749,0.000072169976,0.00048516484,0.0044467594,0.042986546,0.0004064196,0.7591352,0.048951514,0.13557248],"study_design_scores_gemma":[0.00013340118,0.00016700948,0.0025337525,0.00095801265,0.00008412777,0.00038079155,0.0034249038,0.07178068,0.0015371839,0.15881649,0.760016,0.00016764937],"about_ca_topic_score_codex":0.20020777,"about_ca_topic_score_gemma":0.09811571,"teacher_disagreement_score":0.20020777,"about_ca_system_score_codex":0.03133721,"about_ca_system_score_gemma":0.0940497,"threshold_uncertainty_score":0.39808488},"labels":[],"label_agreement":null},{"id":"W2606772694","doi":"10.23889/ijpds.v1i1.307","title":"Information Management at a Health Services Research Organization in Toronto, Ontario, Canada: Moving from Identifiable Data to Coded Data","year":2017,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Institute for Clinical Evaluative Sciences","funders":"","keywords":"Identifier; Computer science; Population; Confidentiality; Data sharing; Data quality; Data collection; Business; Data science; Internet privacy; Knowledge management; Computer security; Medicine; Environmental health; Service (business)","score_opus":0.3377112444792492,"score_gpt":0.528678948045083,"score_spread":0.19096770356583376,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2606772694","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.053744994,0.012738189,0.0788532,0.6204982,0.0059451107,0.009686669,0.033908326,0.0065258495,0.17809953],"genre_scores_gemma":[0.30033144,0.03238463,0.32013884,0.08993451,0.0037087752,0.0063573094,0.055888243,0.0044609318,0.18679526],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.9245791,0.02289025,0.007947112,0.004919713,0.033813104,0.00585072],"domain_scores_gemma":[0.7353093,0.046882465,0.014218701,0.02737563,0.14728345,0.02893037],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.060756758,0.00080249406,0.0007588562,0.0073750494,0.0140015455,0.0202625,0.004898709,0.0026323912,0.022590443],"category_scores_gemma":[0.13403408,0.0014484347,0.00075571233,0.027112953,0.008023512,0.0068266056,0.008612302,0.0034206747,0.0063222046],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":true,"study_design_scores_codex":[0.00017798417,0.00006745474,0.028808678,0.0008120807,0.000043713793,0.00047523706,0.009010526,0.0011559835,0.0018000441,0.025050577,0.6847664,0.24783127],"study_design_scores_gemma":[0.00009685092,0.00011111851,0.07314469,0.0015228058,0.00004499422,0.00015614579,0.014661086,0.003409957,0.0015193134,0.0056466307,0.8994981,0.0001883043],"about_ca_topic_score_codex":0.9766242,"about_ca_topic_score_gemma":0.97548544,"teacher_disagreement_score":0.93924326,"about_ca_system_score_codex":0.18471834,"about_ca_system_score_gemma":0.38420588,"threshold_uncertainty_score":0.9456112},"labels":[],"label_agreement":null},{"id":"W2606808438","doi":"10.23889/ijpds.v1i1.49","title":"Record Linkage Methodology for the Social Data Linkage Environment at Statistics Canada","year":2017,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Statistics Canada","funders":"","keywords":"Record linkage; Probabilistic logic; Linkage (software); Statistic; Computer science; Population; Data science; Data mining; Statistics; Artificial intelligence; Mathematics","score_opus":0.6885121311704627,"score_gpt":0.5782337375018265,"score_spread":0.11027839366863623,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2606808438","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0016271897,0.0006757855,0.95518005,0.002655894,0.0002990988,0.0007734257,0.014953994,0.005892094,0.01794246],"genre_scores_gemma":[0.0276756,0.000963811,0.93683124,0.0007461213,0.0001592552,0.0026584105,0.012415672,0.0019206611,0.01662923],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.966649,0.014197142,0.0024160058,0.0021107905,0.013488326,0.0011388228],"domain_scores_gemma":[0.93054795,0.01996784,0.0036233095,0.008516053,0.036007453,0.0013374003],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.030723868,0.0010670521,0.0013783934,0.009494556,0.0048111747,0.0072758915,0.0037090816,0.0016668736,0.035660442],"category_scores_gemma":[0.094202556,0.0013581591,0.0018958903,0.023604853,0.0020489986,0.0033667774,0.0053948974,0.0034819432,0.008426421],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013166289,0.000082331266,0.007152881,0.0007750407,0.00042378565,0.00030293775,0.0014724671,0.020774325,0.0006575107,0.50942487,0.20183851,0.25696367],"study_design_scores_gemma":[0.00014764818,0.00004207471,0.006951348,0.0005991782,0.00013304142,0.00025330659,0.0007367832,0.09423986,0.0020998463,0.17585817,0.71872056,0.00021821361],"about_ca_topic_score_codex":0.66432565,"about_ca_topic_score_gemma":0.64524,"teacher_disagreement_score":0.9763894,"about_ca_system_score_codex":0.023610609,"about_ca_system_score_gemma":0.13123155,"threshold_uncertainty_score":0.6753024},"labels":[],"label_agreement":null},{"id":"W2611926229","doi":"","title":"Beyond the Dataset: Understanding Sociotechnical Aspects of the Knowledge Discovery Process Among Modern Data Professionals","year":2017,"lang":"en","type":"dissertation","venue":"UWSpace (University of Waterloo)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; University of Waterloo; Simon Fraser University","keywords":"Sociotechnical system; Data science; Process (computing); Knowledge management; Computer science","score_opus":0.15589358735361483,"score_gpt":0.3803340841839857,"score_spread":0.22444049683037084,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2611926229","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.84619904,0.000935048,0.11111074,0.018440902,0.000076841156,0.0004960394,0.00019582147,0.00008683866,0.022458715],"genre_scores_gemma":[0.9599973,0.00059451937,0.036716968,0.0009029591,0.000034835568,0.00033247386,0.00015166988,0.000049742473,0.0012195512],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.95535946,0.034787554,0.0013152983,0.0024917806,0.0045090546,0.0015369551],"domain_scores_gemma":[0.7533233,0.22321883,0.008063155,0.0061937105,0.006661057,0.0025399104],"candidate_categories":["metaresearch","sts"],"consensus_categories":[],"category_scores_codex":[0.058237955,0.00047715264,0.0006028374,0.0063868016,0.008450444,0.015289619,0.0020520254,0.0025747141,0.001412828],"category_scores_gemma":[0.10616194,0.0006926595,0.00051845075,0.004802518,0.014603958,0.019818932,0.009281198,0.0028710603,0.0003375899],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000035377772,0.0000867592,0.017773725,0.00022214126,0.000015948262,0.0003246845,0.9230875,0.00027264858,0.0007571943,0.025770718,0.0007087826,0.030944562],"study_design_scores_gemma":[0.000018058396,0.000052425858,0.011124968,0.00043148364,0.000019273984,0.00026343923,0.8929711,0.0050925314,0.00092408835,0.06468002,0.024383482,0.00003912584],"about_ca_topic_score_codex":0.008985182,"about_ca_topic_score_gemma":0.009753685,"teacher_disagreement_score":0.99154955,"about_ca_system_score_codex":0.006689593,"about_ca_system_score_gemma":0.012408134,"threshold_uncertainty_score":0.30799544},"labels":[],"label_agreement":null},{"id":"W261503754","doi":"10.20982/tqmp.02.1.p020","title":"Formatting data files for repeated-measures analyses in SPSS: Using the Aggregate and Restructure procedures","year":2006,"lang":"en","type":"article","venue":"Tutorials in Quantitative Methods for Psychology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"Concordia University; Université du Québec à Montréal","funders":"","keywords":"Disk formatting; Aggregate (composite); Computer science; Restructuring; Database; Operating system; Business; Materials science","score_opus":0.7403271780089065,"score_gpt":0.6902018180616303,"score_spread":0.05012535994727618,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W261503754","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005336535,0.0002908243,0.9210601,0.0013494045,0.0015802399,0.0057594175,0.022057166,0.0353884,0.007177944],"genre_scores_gemma":[0.008991358,0.00044642683,0.95419514,0.00046306438,0.00036041776,0.011786169,0.009912553,0.010103425,0.0037415305],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9898788,0.0037761815,0.0022434401,0.00080102973,0.0030617262,0.00023878596],"domain_scores_gemma":[0.8793505,0.08385482,0.0042894552,0.011537818,0.020424714,0.0005427022],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.016261319,0.0019099987,0.0014039958,0.005809094,0.001129966,0.002583455,0.0016825653,0.0008894988,0.06384122],"category_scores_gemma":[0.11528196,0.0013130278,0.001629564,0.004594444,0.0008013854,0.0032551128,0.00186533,0.0037502688,0.0326125],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00048670475,0.00044009378,0.0030738767,0.0026907977,0.0001875659,0.0005341782,0.00342372,0.00250654,0.015776075,0.020264918,0.35225716,0.5983584],"study_design_scores_gemma":[0.00044017978,0.0011215939,0.015925074,0.0017508918,0.00022993283,0.0015003803,0.0026450967,0.01874105,0.059323613,0.06850805,0.82908726,0.0007269009],"about_ca_topic_score_codex":0.00095215323,"about_ca_topic_score_gemma":0.0010636238,"teacher_disagreement_score":0.06384122,"about_ca_system_score_codex":0.0006773053,"about_ca_system_score_gemma":0.002589203,"threshold_uncertainty_score":0.21357018},"labels":[],"label_agreement":null},{"id":"W2615642425","doi":"10.1109/icde.2017.39","title":"SEDEX: Scalable Entity Preserving Data Exchange","year":2017,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Computer science; Schema (genetic algorithms); Ambiguity; Scalability; Data exchange; Star schema; Database schema; Tuple; Schema migration; Data mining; Information retrieval; Theoretical computer science; Semi-structured model; Database; Programming language; Database design","score_opus":0.6898325825479652,"score_gpt":0.5363748586287157,"score_spread":0.1534577239192495,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2615642425","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02286425,0.0004166043,0.94127584,0.000667684,0.00015112023,0.00077692507,0.0021384947,0.025808701,0.00590038],"genre_scores_gemma":[0.2505662,0.00049607805,0.7320594,0.00042052925,0.00008963871,0.000673881,0.0074516777,0.0009341659,0.007308369],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9953264,0.0010142745,0.00048750572,0.0006093627,0.0022120788,0.00035033075],"domain_scores_gemma":[0.99297637,0.0011188809,0.00049882167,0.0042420286,0.0008269946,0.00033695297],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005798265,0.0011387158,0.0010615315,0.0015294884,0.00089092006,0.0031074467,0.0048487308,0.00091493095,0.0046183714],"category_scores_gemma":[0.009922346,0.0005821216,0.0012626029,0.0025974014,0.0012269369,0.006231826,0.008068671,0.0015860043,0.0015619871],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0021852145,0.00084925897,0.00743985,0.00070519606,0.0005377188,0.0014175848,0.0008687169,0.13688016,0.03158672,0.13734114,0.08561109,0.5945774],"study_design_scores_gemma":[0.000567316,0.00041677678,0.001949473,0.00009350022,0.00009646528,0.0009855547,0.00043963568,0.72399956,0.05270572,0.10250413,0.11611374,0.0001280136],"about_ca_topic_score_codex":0.0024921766,"about_ca_topic_score_gemma":0.0024165635,"teacher_disagreement_score":0.005798265,"about_ca_system_score_codex":0.00096718775,"about_ca_system_score_gemma":0.001973949,"threshold_uncertainty_score":0.030664504},"labels":[],"label_agreement":null},{"id":"W2616147950","doi":"10.14778/3115404.3115409","title":"Auto-join","year":2017,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":66,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Joins; Join (topology); Computer science; Transformation (genetics); Domain (mathematical analysis); String (physics); Database; Data mining; Theoretical computer science; Programming language; Mathematics","score_opus":0.19962649177423786,"score_gpt":0.4134582450415684,"score_spread":0.21383175326733056,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2616147950","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013760381,0.00036082554,0.92473555,0.00021033104,0.00017048143,0.00039397788,0.0024952074,0.044915073,0.012958121],"genre_scores_gemma":[0.20912685,0.00036212246,0.75317687,0.00054457114,0.00018055574,0.00052862504,0.013611353,0.008758059,0.013711105],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9921705,0.0010297982,0.00072233396,0.0019501421,0.0037132483,0.00041398307],"domain_scores_gemma":[0.9898599,0.002834718,0.0004376196,0.004863498,0.0017167947,0.0002874784],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0052976366,0.0010989477,0.0011468601,0.0019706234,0.0013674515,0.0032207447,0.0033764248,0.000937036,0.019776393],"category_scores_gemma":[0.013722933,0.0007492726,0.0017462831,0.0022578677,0.0012211773,0.0047265384,0.0064447154,0.001458352,0.0058915266],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014578191,0.00048754466,0.014582558,0.00087992614,0.00033297966,0.0005058463,0.0012513328,0.023803703,0.022435477,0.09813234,0.0789342,0.75719625],"study_design_scores_gemma":[0.00028262648,0.0004530248,0.0039828815,0.0001628235,0.00017958853,0.0017424339,0.0008230765,0.4322891,0.0912307,0.18324469,0.2854356,0.00017343699],"about_ca_topic_score_codex":0.0016211531,"about_ca_topic_score_gemma":0.0021431157,"teacher_disagreement_score":0.019776393,"about_ca_system_score_codex":0.0006244694,"about_ca_system_score_gemma":0.0017373752,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W2626925008","doi":"10.1145/3106426.3106484","title":"Preference-driven similarity join","year":2017,"lang":"en","type":"article","venue":"Proceedings of the International Conference on Web Intelligence","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Similarity (geometry); Join (topology); Set (abstract data type); Object (grammar); Variety (cybernetics); Similitude","score_opus":0.4629911135755076,"score_gpt":0.44031049862763233,"score_spread":0.022680614947875266,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2626925008","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015155667,0.0004960791,0.97732145,0.0002848669,0.00013503211,0.00038286598,0.0005687328,0.0011502109,0.0045050727],"genre_scores_gemma":[0.37895346,0.00056438654,0.6075401,0.0005318423,0.00032274373,0.00044052207,0.0029020137,0.00039767087,0.0083473],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9891009,0.0026907846,0.00086588605,0.0020435106,0.0046943114,0.0006045617],"domain_scores_gemma":[0.9902278,0.0032263945,0.00066679926,0.0027257244,0.0025398985,0.0006133456],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005327923,0.0011603521,0.0021150995,0.0018914534,0.0013403728,0.0030564507,0.0035425003,0.001812085,0.0091853235],"category_scores_gemma":[0.018328836,0.0005839521,0.0015682359,0.003740165,0.0010076103,0.005833348,0.0048345253,0.0022136138,0.0033386631],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0016971726,0.0010887915,0.0066300873,0.0011698318,0.0005191261,0.00072285184,0.0009925253,0.15900648,0.026053857,0.1411336,0.031953644,0.629032],"study_design_scores_gemma":[0.00018642959,0.0006740185,0.0013577789,0.00004923422,0.00011478421,0.0010462744,0.0003174527,0.7852316,0.013469203,0.17366321,0.023762051,0.00012799134],"about_ca_topic_score_codex":0.0018766596,"about_ca_topic_score_gemma":0.0023469299,"teacher_disagreement_score":0.0091853235,"about_ca_system_score_codex":0.0008708166,"about_ca_system_score_gemma":0.0022808674,"threshold_uncertainty_score":0.030727923},"labels":[],"label_agreement":null},{"id":"W2631182992","doi":"10.1109/ccece.2017.7946661","title":"A content-based data masking technique for a built-in framework in Business Intelligence platform","year":2017,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Masking (illustration); Computer science; Data warehouse; Business intelligence; Database; Knowledge management; Data science; World Wide Web","score_opus":0.6792248335221864,"score_gpt":0.521441100059523,"score_spread":0.1577837334626634,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2631182992","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01933922,0.00011565444,0.974343,0.00033657762,0.00008495404,0.00035190344,0.00012726441,0.0031325144,0.002168791],"genre_scores_gemma":[0.18588655,0.000109636596,0.8092088,0.0001880401,0.000042092237,0.00020567296,0.00031034756,0.0004549677,0.0035939836],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99658895,0.0006759621,0.0002378673,0.0004878847,0.0015857276,0.00042355503],"domain_scores_gemma":[0.99521977,0.0011321998,0.00035840462,0.0020394227,0.0010386034,0.00021158521],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0036677506,0.00062804646,0.0006575239,0.0019431611,0.0017656476,0.0022555152,0.0017879409,0.0014291111,0.003729257],"category_scores_gemma":[0.008159207,0.00056408945,0.0012951536,0.001476208,0.0015792068,0.003996046,0.0039193225,0.0020865065,0.0016379654],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012662159,0.0006189114,0.0046239817,0.0005057303,0.00011859856,0.0015700664,0.0034885146,0.0074889576,0.20574255,0.17375591,0.010269735,0.59055066],"study_design_scores_gemma":[0.00016668235,0.00084956083,0.0049201506,0.00036223998,0.00039097096,0.002271327,0.0014493896,0.37366802,0.36746883,0.105730295,0.14246224,0.0002603313],"about_ca_topic_score_codex":0.0024798915,"about_ca_topic_score_gemma":0.0021484024,"teacher_disagreement_score":0.003729257,"about_ca_system_score_codex":0.001008674,"about_ca_system_score_gemma":0.002324539,"threshold_uncertainty_score":0.0193972},"labels":[],"label_agreement":null},{"id":"W2725122689","doi":"10.29173/cais912","title":"An Analysis of Seasonal and Topical Queries in a Large Public Library to Support User Engagement","year":2016,"lang":"fr","type":"article","venue":"Proceedings of the Annual Conference of CAIS / Actes du congrès annuel de l ACSI","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Analytics; Overtime; Identifier; Library science; Political science; Humanities; Computer science; Art; Data science","score_opus":0.07657643030396424,"score_gpt":0.3375330674694285,"score_spread":0.26095663716546424,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2725122689","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9876024,0.00050075335,0.0021552492,0.0005398884,0.000017641685,0.00009780979,0.0042086043,0.0006173885,0.0042601884],"genre_scores_gemma":[0.97791666,0.00039722995,0.006691842,0.00016850133,0.000058508558,0.00012746578,0.009630804,0.00023118965,0.004777912],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9956214,0.0011214678,0.00038003907,0.0004995698,0.0019487118,0.0004287804],"domain_scores_gemma":[0.9786863,0.0124295885,0.0022687644,0.0016753599,0.003957392,0.0009825671],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003011706,0.00031325905,0.0004874829,0.006104406,0.0011435557,0.0024021033,0.00077630405,0.0006643074,0.0017176815],"category_scores_gemma":[0.015405294,0.0002491603,0.0004304896,0.010515637,0.00045853597,0.0026840894,0.0017081065,0.00052982254,0.00106321],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014638028,0.0008388783,0.68812597,0.0012468925,0.00020887864,0.0023491466,0.05065574,0.0031942618,0.027866874,0.0019243968,0.019044854,0.20308027],"study_design_scores_gemma":[0.00002630786,0.0003802073,0.9054993,0.0000739886,0.00007948439,0.0007324048,0.027087573,0.017985668,0.008956397,0.0006650413,0.03841006,0.000103587925],"about_ca_topic_score_codex":0.043397322,"about_ca_topic_score_gemma":0.073572166,"teacher_disagreement_score":0.043397322,"about_ca_system_score_codex":0.0017169112,"about_ca_system_score_gemma":0.0016027136,"threshold_uncertainty_score":0.086289406},"labels":[],"label_agreement":null},{"id":"W2726342193","doi":"10.1145/3041761","title":"Dependable Data Repairing with Fixing Rules","year":2017,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; Tuple; Data mining; Set (abstract data type); Data integrity; Class (philosophy); Artificial intelligence; Database","score_opus":0.47292496259456906,"score_gpt":0.5056587030425448,"score_spread":0.03273374044797572,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2726342193","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014849988,0.00025064423,0.9802639,0.0003545671,0.000046565565,0.00025140957,0.0002991194,0.003096773,0.00058708875],"genre_scores_gemma":[0.12762414,0.00023856956,0.86902255,0.0002993166,0.00004876978,0.00025344524,0.0011424489,0.00047183063,0.00089891336],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9829055,0.0037868405,0.0022419647,0.004332307,0.0059423745,0.00079102657],"domain_scores_gemma":[0.9244609,0.037832383,0.0075196563,0.021432001,0.008228188,0.0005268757],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010490363,0.0017952261,0.0020420426,0.0045199553,0.0018858202,0.0035344772,0.005688857,0.0028231726,0.0021447274],"category_scores_gemma":[0.067579135,0.0014669088,0.0037183387,0.0034063468,0.0031837183,0.005229757,0.004463663,0.00403516,0.0010244406],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003551353,0.0004389968,0.015227605,0.0008381406,0.00046322486,0.0013136105,0.0010930835,0.2949863,0.018863749,0.04008886,0.008919382,0.6174118],"study_design_scores_gemma":[0.00008391734,0.00019749494,0.0020901014,0.00026227636,0.00027319722,0.0012965067,0.00036716755,0.81435925,0.0494641,0.11539156,0.016063187,0.00015115108],"about_ca_topic_score_codex":0.0050963187,"about_ca_topic_score_gemma":0.00471744,"teacher_disagreement_score":0.010490363,"about_ca_system_score_codex":0.0013504737,"about_ca_system_score_gemma":0.003630694,"threshold_uncertainty_score":0.05547899},"labels":[],"label_agreement":null},{"id":"W2729808627","doi":"10.1371/journal.pone.0178731","title":"A conceptual framework for quality assessment and management of biodiversity data","year":2017,"lang":"en","type":"article","venue":"PLoS ONE","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":59,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"Conselho Nacional de Desenvolvimento Científico e Tecnológico; Coordenação de Aperfeiçoamento de Pessoal de Nível Superior; Universidade de São Paulo; Fundação de Amparo à Pesquisa do Estado de São Paulo","keywords":"Computer science; Conceptual framework; Data science; Variety (cybernetics); Data management; Quality (philosophy); Data quality; Proof of concept; Management science; Data mining; Engineering; Artificial intelligence","score_opus":0.7553622666505247,"score_gpt":0.514162342283249,"score_spread":0.24119992436727578,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2729808627","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0029637618,0.0017417575,0.95493853,0.01642038,0.0002992426,0.0008123264,0.00038314846,0.0004419567,0.021998841],"genre_scores_gemma":[0.07432111,0.0016965505,0.9158173,0.0017183424,0.00028939647,0.0020074656,0.00085565227,0.00016054187,0.0031335778],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.93677086,0.03731387,0.007820386,0.0049943957,0.010721857,0.002378614],"domain_scores_gemma":[0.9414456,0.03263022,0.0045723757,0.0061286446,0.011732757,0.0034903914],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.079075456,0.0023678343,0.0016576326,0.016280165,0.0075717927,0.027195523,0.0105256885,0.008147874,0.0038904482],"category_scores_gemma":[0.05289676,0.0017861021,0.0043607256,0.015183764,0.032353796,0.03510881,0.01239797,0.00868193,0.0009753067],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000041171497,0.000014659563,0.00016643136,0.00012049656,0.000014534901,0.000081164406,0.0026469973,0.0014808325,0.00008251532,0.9890637,0.0012437272,0.005080982],"study_design_scores_gemma":[0.000031240317,0.00004127168,0.00023646791,0.00087633095,0.000045337583,0.0002571929,0.0038209201,0.01170033,0.0002768091,0.87531626,0.10733557,0.00006219203],"about_ca_topic_score_codex":0.033650205,"about_ca_topic_score_gemma":0.018308021,"teacher_disagreement_score":0.92092454,"about_ca_system_score_codex":0.016685493,"about_ca_system_score_gemma":0.028118305,"threshold_uncertainty_score":0.41819596},"labels":[],"label_agreement":null},{"id":"W2736121570","doi":"10.1145/3058750","title":"An Exploratory Case Study to Understand Primary Care Users and Their Data Quality Tradeoffs","year":2017,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo; Conestoga College","funders":"","keywords":"Completeness (order theory); Computer science; Data quality; Workflow; Quality (philosophy); Data mining; Data science; Database; Business; Mathematics; Marketing","score_opus":0.5819441096579165,"score_gpt":0.5200055265519502,"score_spread":0.06193858310596634,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2736121570","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9903072,0.0002983879,0.0032357622,0.0016409864,0.000013865524,0.00054928876,0.000132075,0.0000139775775,0.0038085443],"genre_scores_gemma":[0.98964685,0.0003738993,0.0073793354,0.00050922116,0.000023326846,0.00047981882,0.00007319487,0.000009756048,0.0015046049],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.98365927,0.012675334,0.00057777745,0.0007731576,0.0011618801,0.0011525969],"domain_scores_gemma":[0.94913846,0.041740857,0.0030212137,0.0012390306,0.0024574217,0.0024029682],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013372206,0.0005037371,0.0005636082,0.0016247744,0.0069360496,0.0027628934,0.0015194505,0.0028958374,0.0033884982],"category_scores_gemma":[0.02798397,0.0005437661,0.0005827384,0.0019257464,0.0021735986,0.0027271463,0.0025506637,0.0021273284,0.0003348524],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00064035493,0.0061534485,0.23824245,0.0011282742,0.00011944713,0.053783886,0.62899584,0.0020514273,0.003386479,0.012868252,0.0056368914,0.04699324],"study_design_scores_gemma":[0.00017716333,0.0038225513,0.06671479,0.00057318644,0.000077115925,0.017638376,0.87009764,0.0068849255,0.0024884853,0.004483483,0.026924947,0.000117320466],"about_ca_topic_score_codex":0.007623432,"about_ca_topic_score_gemma":0.01437208,"teacher_disagreement_score":0.013372206,"about_ca_system_score_codex":0.0046779267,"about_ca_system_score_gemma":0.0030754106,"threshold_uncertainty_score":0.07071984},"labels":[],"label_agreement":null},{"id":"W2736616122","doi":"10.1016/j.dib.2017.07.038","title":"Dataset of anomalies and malicious acts in a cyber-physical subsystem","year":2017,"lang":"en","type":"article","venue":"Data in Brief","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":44,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Thales Group; Department of Clinical Neurosciences, University of Calgary","keywords":"Computer science; Cyber-physical system; Computer security; Research article; Data science; Operating system","score_opus":0.30719743047038894,"score_gpt":0.47648082064911546,"score_spread":0.1692833901787265,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2736616122","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08196905,0.0005210163,0.0052369316,0.0006308839,0.00019677132,0.0003085377,0.905709,0.0021078733,0.003319962],"genre_scores_gemma":[0.0639149,0.00017149831,0.0056289034,0.00009628444,0.000030220886,0.0002171186,0.9290386,0.000048719252,0.00085384236],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.998237,0.00021105101,0.0002783486,0.000419894,0.0006537787,0.00019994851],"domain_scores_gemma":[0.9964876,0.00094227336,0.00045383823,0.0007639245,0.0010934487,0.00025899845],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011548288,0.00094268203,0.00065423286,0.0031046413,0.0005630519,0.0008787573,0.0011664317,0.0015159826,0.0019779624],"category_scores_gemma":[0.004579308,0.00021888726,0.0008707257,0.003230635,0.0004601192,0.00082369416,0.0010332607,0.0009774719,0.0023038457],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015177688,0.0017694967,0.18938287,0.0036066112,0.0006277298,0.002196666,0.0007044965,0.036143713,0.016206421,0.004868927,0.6380431,0.104932256],"study_design_scores_gemma":[0.00038911152,0.0007785434,0.39675605,0.00060417544,0.00028783726,0.0018940024,0.0017651266,0.06644037,0.02063215,0.00472538,0.50548756,0.00023965906],"about_ca_topic_score_codex":0.012103989,"about_ca_topic_score_gemma":0.0161526,"teacher_disagreement_score":0.012103989,"about_ca_system_score_codex":0.0010526252,"about_ca_system_score_gemma":0.0013968319,"threshold_uncertainty_score":0.024067044},"labels":[],"label_agreement":null},{"id":"W2737275827","doi":"","title":"SUMMA at TAC Knowledge Base Population Task 2017.","year":2017,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Task (project management); Base (topology); Knowledge base; Computer science; Population; Artificial intelligence; Mathematics; Medicine; Engineering; Environmental health; Systems engineering","score_opus":0.09041987003507082,"score_gpt":0.4039581842127519,"score_spread":0.3135383141776811,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2737275827","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.04581096,0.011270769,0.09795197,0.13843241,0.03643723,0.007420034,0.4892497,0.032104753,0.14132223],"genre_scores_gemma":[0.06742236,0.0026363605,0.070437714,0.009023664,0.0056906836,0.0050014304,0.6978812,0.005592737,0.13631375],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9865893,0.0046092835,0.0008106136,0.0012873512,0.005571258,0.0011322034],"domain_scores_gemma":[0.8979248,0.030971205,0.002108386,0.010182071,0.04228274,0.016530788],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.031301796,0.00190005,0.0025178946,0.0054949545,0.0053942855,0.008282644,0.005276246,0.004892107,0.06469362],"category_scores_gemma":[0.09147249,0.0007332688,0.0015230733,0.0043433653,0.0013054288,0.009032308,0.010457109,0.005010106,0.05314168],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018161471,0.0001742464,0.00044564766,0.00033425697,0.00003851519,0.000053601816,0.0001688601,0.00045120125,0.00048821347,0.0008824337,0.960485,0.036296427],"study_design_scores_gemma":[0.0005049541,0.00028603326,0.004387984,0.0008623852,0.00015606436,0.00012616042,0.0016762282,0.011374961,0.005293494,0.019560963,0.9556352,0.00013548546],"about_ca_topic_score_codex":0.03542819,"about_ca_topic_score_gemma":0.065762565,"teacher_disagreement_score":0.06469362,"about_ca_system_score_codex":0.0036293955,"about_ca_system_score_gemma":0.017877884,"threshold_uncertainty_score":0.21642172},"labels":[],"label_agreement":null},{"id":"W2737719817","doi":"10.23974/ijol.2017.vol2.1.38","title":"Editorial: Introducing this Special Issue on Data Librarianship","year":2017,"lang":"en","type":"editorial","venue":"International Journal of Librarianship","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"","keywords":"Library science; Computer science; Engineering ethics; Data science; Political science; Engineering","score_opus":0.188426744847238,"score_gpt":0.4376218285475843,"score_spread":0.2491950837003463,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2737719817","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000027617261,0.0018409375,0.000083984814,0.035378385,0.9615236,0.000026155154,0.000043235843,0.000040436942,0.0010356611],"genre_scores_gemma":[0.00020897307,0.0015066444,0.00008010806,0.014168443,0.9795578,0.000022803095,0.00003520997,0.000041161875,0.004378777],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.98214656,0.0030414977,0.0024341054,0.0017098573,0.009534308,0.0011337207],"domain_scores_gemma":[0.90932995,0.026098467,0.007782057,0.0026183217,0.040168047,0.014003162],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.016682403,0.004330324,0.0055296,0.011317589,0.0055491803,0.017516967,0.00470757,0.019545233,0.03037656],"category_scores_gemma":[0.06824657,0.0015144034,0.0037188244,0.0042851246,0.0039991043,0.0070906146,0.0046444377,0.018324131,0.019502824],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000016971057,0.000013635522,0.000040900813,0.00014282975,0.000014106313,0.000080286976,0.000013928932,0.000009153958,0.000028662553,0.00012544471,0.9960121,0.003502074],"study_design_scores_gemma":[0.000079660625,0.00003160423,0.0002889769,0.0006928253,0.00006598073,0.00023075617,0.0001046555,0.00011261655,0.000098829056,0.0008813415,0.9973889,0.00002400845],"about_ca_topic_score_codex":0.0012054145,"about_ca_topic_score_gemma":0.004649062,"teacher_disagreement_score":0.982483,"about_ca_system_score_codex":0.0047655553,"about_ca_system_score_gemma":0.0068889335,"threshold_uncertainty_score":0.10161972},"labels":[],"label_agreement":null},{"id":"W2737857854","doi":"10.23974/ijol.2017.vol2.1.35","title":"Lives in Data: Prominent Data Librarians, Archivists and Educators Share Their Thoughts","year":2017,"lang":"en","type":"article","venue":"International Journal of Librarianship","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Windsor","funders":"","keywords":"China; Library science; Field (mathematics); Political science; Public relations; Key (lock); Sociology; Law; Computer science","score_opus":0.4638614143762922,"score_gpt":0.47245123330095407,"score_spread":0.008589818924661874,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2737857854","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5748562,0.0194006,0.0035304003,0.34387344,0.004603948,0.00011880471,0.00038864877,0.00022781547,0.05300014],"genre_scores_gemma":[0.938031,0.004754729,0.0014158151,0.04629298,0.00093238207,0.00008969535,0.00011394314,0.00013520946,0.008234229],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.961345,0.029370906,0.0010924607,0.0017007935,0.0030599632,0.0034308434],"domain_scores_gemma":[0.943664,0.029867636,0.004334204,0.0020679096,0.0049534244,0.015112854],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.025180047,0.000790457,0.000892096,0.003875273,0.033723343,0.023143502,0.0023462377,0.0070938184,0.00437654],"category_scores_gemma":[0.035561755,0.0010960522,0.0007815302,0.0037749491,0.027203206,0.019916577,0.016576147,0.009520309,0.0012636821],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00003305507,0.000028863498,0.006034931,0.000109058594,0.000019318475,0.0005666363,0.96569735,0.000013869464,0.000308672,0.003158151,0.017283987,0.006746136],"study_design_scores_gemma":[0.000002719236,0.000011447516,0.0006923063,0.00006622607,0.000005009383,0.00019735281,0.962044,0.000009254802,0.00006724672,0.00065544405,0.03623454,0.000014408276],"about_ca_topic_score_codex":0.0057903174,"about_ca_topic_score_gemma":0.009151077,"teacher_disagreement_score":0.97685647,"about_ca_system_score_codex":0.0058653466,"about_ca_system_score_gemma":0.00496615,"threshold_uncertainty_score":0.13316637},"labels":[],"label_agreement":null},{"id":"W2742025582","doi":"10.1145/3077136.3080812","title":"Navigating Imprecision in Relevance Assessments on the Road to Total Recall","year":2017,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":23,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Recall; Relevance (law); Computer science; Precision and recall; Ground truth; Relevance feedback; Information retrieval; Data curation; Data mining; Artificial intelligence; Image retrieval; Cognitive psychology; Psychology; Image (mathematics)","score_opus":0.27943193789252796,"score_gpt":0.534968558435086,"score_spread":0.255536620542558,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2742025582","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.26733392,0.008727283,0.6939224,0.011204594,0.00018052178,0.00036222496,0.0008792062,0.0017012467,0.015688587],"genre_scores_gemma":[0.905555,0.000915951,0.09135923,0.0005495834,0.000055799883,0.00018400929,0.00026172903,0.00012463509,0.0009939984],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9436596,0.0396081,0.001934962,0.0060228524,0.0076522995,0.0011221949],"domain_scores_gemma":[0.6957809,0.2653461,0.010003599,0.016887821,0.010956956,0.0010246668],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.051132135,0.0012158823,0.0023197886,0.004039424,0.0016613061,0.009405167,0.0028737097,0.0033396217,0.0015158476],"category_scores_gemma":[0.26058912,0.001657385,0.0014597108,0.0035647424,0.0046849144,0.014132316,0.0063829655,0.0048984024,0.00061564904],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013262926,0.0002422795,0.022375774,0.00085153413,0.00039444314,0.00030263385,0.005400968,0.65607595,0.0023252345,0.12592788,0.0057968074,0.17898029],"study_design_scores_gemma":[0.00020606242,0.0004962447,0.006386007,0.0003038433,0.00012941912,0.00034193916,0.0012123449,0.6761714,0.0032775353,0.30557546,0.0056864363,0.0002131393],"about_ca_topic_score_codex":0.018490512,"about_ca_topic_score_gemma":0.014194901,"teacher_disagreement_score":0.051132135,"about_ca_system_score_codex":0.0051983413,"about_ca_system_score_gemma":0.0031825423,"threshold_uncertainty_score":0.27041578},"labels":[],"label_agreement":null},{"id":"W2743149664","doi":"10.2139/ssrn.3008736","title":"A Data Commons for Food Security","year":2017,"lang":"pl","type":"article","venue":"SSRN Electronic Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Food security; Business; Commons; Computer security; Internet privacy; Computer science; Political science; Law; Biology; Agriculture; Ecology","score_opus":0.23726940871807647,"score_gpt":0.44386986300763326,"score_spread":0.20660045428955678,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2743149664","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01186172,0.007839553,0.23181462,0.5086716,0.023300953,0.00056895154,0.0125860125,0.0074612736,0.1958954],"genre_scores_gemma":[0.5063424,0.014023518,0.19166194,0.10854558,0.024705105,0.002341924,0.01706238,0.007893749,0.12742344],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9710335,0.011725276,0.004671081,0.0030431068,0.008112672,0.0014143328],"domain_scores_gemma":[0.70473975,0.133829,0.012703206,0.11543277,0.018838475,0.0144567685],"candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.050875667,0.00068417983,0.0016068438,0.007852099,0.005847499,0.026460234,0.0042755585,0.008739516,0.05212753],"category_scores_gemma":[0.18122207,0.001333518,0.0020262154,0.008423147,0.02178195,0.05196935,0.02677203,0.013476997,0.016848333],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001079604,0.000040004936,0.001077668,0.00029123382,0.00002888535,0.00015757207,0.0009793562,0.00037519765,0.00041869635,0.8398638,0.117279634,0.03937994],"study_design_scores_gemma":[0.000029895587,0.000022709206,0.0005107655,0.0007285949,0.000027912987,0.00023481669,0.0008376101,0.0015593667,0.00067523867,0.4869336,0.5083947,0.000044872686],"about_ca_topic_score_codex":0.002859812,"about_ca_topic_score_gemma":0.001584372,"teacher_disagreement_score":0.99572444,"about_ca_system_score_codex":0.004761844,"about_ca_system_score_gemma":0.0150221195,"threshold_uncertainty_score":0.26905942},"labels":[],"label_agreement":null},{"id":"W2748020237","doi":"10.1007/978-3-319-56994-9_78","title":"Corroborating Quality of Data Through Density Information","year":2017,"lang":"en","type":"book-chapter","venue":"Lecture notes in networks and systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Data deduplication; Tuple; Data quality; Computer science; Master data; Data mining; Data integration; Process (computing); Quality (philosophy); Data integrity; Data pre-processing; Database; Data science; Engineering","score_opus":0.30176257184093275,"score_gpt":0.4222852155345378,"score_spread":0.12052264369360505,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2748020237","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12567843,0.0037767568,0.81198215,0.005880786,0.0007075789,0.00014372102,0.002152706,0.0008311472,0.048846625],"genre_scores_gemma":[0.8397116,0.0022045367,0.15255077,0.0004712347,0.00061868835,0.00009188547,0.0013126944,0.000154163,0.0028843675],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99097997,0.003389385,0.0004224726,0.0011692586,0.0037568342,0.00028218597],"domain_scores_gemma":[0.92008275,0.058539353,0.004924256,0.010496016,0.0054630996,0.00049451523],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008421315,0.00059807365,0.000912585,0.0040202513,0.0006592843,0.0040234867,0.0021501624,0.0019271886,0.0033038163],"category_scores_gemma":[0.077579565,0.0006483038,0.00066684245,0.004368098,0.004568234,0.006591124,0.0032552904,0.0019536465,0.00088435056],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00062402734,0.00017570153,0.07094774,0.0010374328,0.000439734,0.000360556,0.0016232627,0.053164423,0.019402366,0.40423876,0.010855423,0.4371306],"study_design_scores_gemma":[0.00007582254,0.00028005653,0.03251082,0.0004666142,0.00024727324,0.00080300274,0.0011987834,0.2630741,0.04055482,0.63471556,0.025865825,0.0002072866],"about_ca_topic_score_codex":0.0015081514,"about_ca_topic_score_gemma":0.0015297877,"teacher_disagreement_score":0.008421315,"about_ca_system_score_codex":0.0012683367,"about_ca_system_score_gemma":0.0007468858,"threshold_uncertainty_score":0.04453671},"labels":[],"label_agreement":null},{"id":"W2750213807","doi":"10.31937/ijnmt.v4i1.534","title":"Designing Information Product (IP) Maps On the Process of Data Processing and Academic Information","year":2017,"lang":"en","type":"article","venue":"IJNMT (International Journal of New Media Technology)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Ryerson University","keywords":"Computer science; Data management; Quality (philosophy); Information management; Information system; Data quality; Product (mathematics); Process (computing); Data science; Knowledge management; Database; Engineering; Operations management","score_opus":0.2337570832177952,"score_gpt":0.4385282002339322,"score_spread":0.20477111701613698,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2750213807","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010866728,0.00084988744,0.91748303,0.003143569,0.0001861701,0.0011051352,0.00019474527,0.0011070097,0.065063685],"genre_scores_gemma":[0.19365864,0.0016872095,0.788918,0.0004068758,0.00009849921,0.0019295504,0.00038042018,0.00037813673,0.01254272],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98931634,0.0061445823,0.0007223149,0.0010647172,0.0022803368,0.00047171355],"domain_scores_gemma":[0.9838087,0.008484568,0.0013522519,0.002540526,0.0032558606,0.0005580406],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011640266,0.0010139062,0.0005099499,0.005854083,0.0030769724,0.0094059985,0.0016284015,0.0019330885,0.010952545],"category_scores_gemma":[0.022630645,0.0010817384,0.0014105942,0.0071581886,0.005199414,0.024370087,0.007171288,0.0022027683,0.0029444736],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00010264499,0.000095764386,0.002420728,0.0010831722,0.000034591234,0.0003491183,0.012128807,0.0063293204,0.0016457355,0.734303,0.007720841,0.23378627],"study_design_scores_gemma":[0.00007025731,0.0004600454,0.00384584,0.0010175861,0.00012838791,0.00094805635,0.013159529,0.041317556,0.008439387,0.499655,0.430843,0.00011527621],"about_ca_topic_score_codex":0.0033028603,"about_ca_topic_score_gemma":0.0020150892,"teacher_disagreement_score":0.011640266,"about_ca_system_score_codex":0.002962392,"about_ca_system_score_gemma":0.006203467,"threshold_uncertainty_score":0.061560333},"labels":[],"label_agreement":null},{"id":"W2754893762","doi":"10.26789/jsc.2017.01.001","title":"Achieving interoperability of smart city data: An analysis of 311 data","year":2017,"lang":"en","type":"article","venue":"Journal of Smart Cities","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Ontology; Interoperability; Computer science; Semantics (computer science); Smart city; Construct (python library); Semantic interoperability; Service (business); Data science; World Wide Web; Linked data; Upper ontology; Information retrieval; Semantic Web; Internet of Things","score_opus":0.4986911969215018,"score_gpt":0.48408684875006247,"score_spread":0.014604348171439352,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2754893762","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.404617,0.00093744893,0.5604746,0.0068824124,0.00011191144,0.0007932883,0.009176509,0.0010796369,0.01592717],"genre_scores_gemma":[0.66994154,0.00055603456,0.31337562,0.0005163945,0.000036924466,0.00050600513,0.013985561,0.0002816446,0.0008003363],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"observational","domain_scores_codex":[0.9704377,0.00823534,0.003186345,0.002510302,0.014564103,0.0010663016],"domain_scores_gemma":[0.93979603,0.029209185,0.005159729,0.013808546,0.01128878,0.0007376577],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.023214655,0.00046144967,0.00073185965,0.013647351,0.0025035597,0.006402459,0.0014916195,0.0013990239,0.00074411614],"category_scores_gemma":[0.06287035,0.0004442728,0.0019578955,0.022665909,0.0037723642,0.012461906,0.0046208687,0.0018799386,0.00023740248],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00041117714,0.0005562218,0.16628452,0.0011867299,0.00064328,0.001341729,0.020899268,0.03445553,0.012377209,0.5431902,0.007538359,0.21111573],"study_design_scores_gemma":[0.00006220094,0.00019716818,0.12958305,0.0009799547,0.0003637959,0.0012256026,0.039709967,0.19785221,0.022277264,0.48156384,0.1259254,0.00025957453],"about_ca_topic_score_codex":0.011083134,"about_ca_topic_score_gemma":0.007947304,"teacher_disagreement_score":0.023214655,"about_ca_system_score_codex":0.0049879197,"about_ca_system_score_gemma":0.0046594576,"threshold_uncertainty_score":0.12277228},"labels":[],"label_agreement":null},{"id":"W2766870458","doi":"10.1002/asi.23972","title":"<i>JASIST</i> special issue on biomedical information retrieval","year":2017,"lang":"en","type":"article","venue":"Journal of the Association for Information Science and Technology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Library science; Columbia university; Computer science; Information science; Health informatics; Health care; Sociology; Media studies; Political science","score_opus":0.045010136248981716,"score_gpt":0.3755419098705108,"score_spread":0.3305317736215291,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2766870458","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0005247488,0.028962286,0.0052030575,0.089218825,0.81965315,0.00032974605,0.0034247038,0.002111484,0.05057206],"genre_scores_gemma":[0.0024930926,0.020838734,0.003878709,0.03176836,0.8218337,0.00023932409,0.005235895,0.0017853089,0.11192693],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99542266,0.0007123067,0.0006244365,0.00043353738,0.0023909388,0.0004160973],"domain_scores_gemma":[0.9683092,0.0067923237,0.0026271553,0.0023210712,0.01377791,0.006172434],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.006275755,0.002388219,0.0047895955,0.016204346,0.002426002,0.011750231,0.0032596893,0.005561271,0.10598047],"category_scores_gemma":[0.017391726,0.000993414,0.0022787265,0.008570238,0.0019832416,0.005488663,0.0039022628,0.0049350224,0.06986654],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000029289573,0.00001409299,0.00007005368,0.00016863893,0.000012782957,0.00002535384,0.0000049965583,0.000017361212,0.00017612737,0.00023532847,0.98476243,0.014483491],"study_design_scores_gemma":[0.000021813541,0.00005089495,0.001069684,0.00034999795,0.000043694847,0.00021014611,0.000026316846,0.00030302335,0.0004282947,0.0016886326,0.9957777,0.0000297635],"about_ca_topic_score_codex":0.0027455871,"about_ca_topic_score_gemma":0.011171882,"teacher_disagreement_score":0.9882498,"about_ca_system_score_codex":0.0032121008,"about_ca_system_score_gemma":0.0049362,"threshold_uncertainty_score":0.35454},"labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"not_applicable","genre":"editorial","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":[],"domain":null,"study_design":"not_applicable","genre":"editorial","about_ca_system":false,"about_ca_topic":false,"confidence":"high"}],"label_agreement":"agree"},{"id":"W2768756899","doi":"","title":"Multidimensional User Manual (MUM): A Tool to Manage and Communicate Data Quality Information","year":2004,"lang":"en","type":"preprint","venue":"HAL (Le Centre pour la Communication Scientifique Directe)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval","funders":"","keywords":"Computer science; Quality (philosophy); Human–computer interaction; Data quality; Engineering","score_opus":0.10053683324435912,"score_gpt":0.36463029976508593,"score_spread":0.2640934665207268,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2768756899","genre_codex":"software","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0054392177,0.00041195267,0.4738231,0.001127575,0.00039717444,0.0011003249,0.024145488,0.48423174,0.009323363],"genre_scores_gemma":[0.073279716,0.00071979675,0.7083945,0.0018879737,0.0005711595,0.0067542465,0.04458124,0.14864178,0.015169682],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99036205,0.0030476563,0.0025213663,0.0008168971,0.0028688216,0.00038319267],"domain_scores_gemma":[0.8605802,0.10018258,0.005291611,0.022037374,0.009685715,0.002222409],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.023826275,0.0031846007,0.0019774279,0.013467933,0.0016160941,0.0045980546,0.003081554,0.0022469896,0.072208636],"category_scores_gemma":[0.10027383,0.0026464853,0.0014203279,0.00565044,0.0010718722,0.006089857,0.007109113,0.002210689,0.022669148],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011578188,0.00023112382,0.004316214,0.003292417,0.0001735052,0.00070792314,0.004498368,0.0017957189,0.010247267,0.012908924,0.50555396,0.4551168],"study_design_scores_gemma":[0.00079360465,0.00035742825,0.0077784583,0.0017800838,0.00022962475,0.0020169867,0.0010486747,0.047656193,0.03632575,0.027725805,0.8736162,0.0006711204],"about_ca_topic_score_codex":0.0018633272,"about_ca_topic_score_gemma":0.0019014603,"teacher_disagreement_score":0.072208636,"about_ca_system_score_codex":0.0011896351,"about_ca_system_score_gemma":0.0024279002,"threshold_uncertainty_score":0.24156195},"labels":[],"label_agreement":null},{"id":"W2768921330","doi":"10.5220/0006582703100319","title":"Integrating a Survey Ontology into an Upper Level Ontology - Using the Data Collection Ontology (DCO) as the Basis for a Survey Ontology","year":2017,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Ontology; Ontology-based data integration; Computer science; Upper ontology; Process ontology; Information retrieval; Suggested Upper Merged Ontology; Ontology alignment; Semantic Web","score_opus":0.7661720941383888,"score_gpt":0.5633738214982361,"score_spread":0.2027982726401527,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2768921330","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009630605,0.00015227159,0.97210175,0.0027586196,0.000121916055,0.0005280735,0.0011139003,0.00096634723,0.012626595],"genre_scores_gemma":[0.12275679,0.0005316845,0.8678304,0.00080893876,0.00006056155,0.0007158927,0.0031622201,0.00027214692,0.0038613994],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98749477,0.004267173,0.0025939024,0.0013645353,0.0036215784,0.00065800804],"domain_scores_gemma":[0.979075,0.0060752556,0.0016044747,0.0049379137,0.0071150493,0.0011922432],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01646077,0.00047001455,0.00082249567,0.009460191,0.0026988664,0.008934399,0.0016841366,0.0011309895,0.0015820354],"category_scores_gemma":[0.02172177,0.0006486879,0.0019991857,0.011180388,0.0028372812,0.01072027,0.005293279,0.0023064986,0.00050201814],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00004807019,0.00014737181,0.015258533,0.0006848718,0.00012355427,0.00028898625,0.006075274,0.003533761,0.006325988,0.8210868,0.008883713,0.1375431],"study_design_scores_gemma":[0.000029420531,0.00007531699,0.010869094,0.0011775936,0.00029192623,0.00082521915,0.0104217995,0.05224305,0.008603723,0.41894802,0.49636057,0.00015429317],"about_ca_topic_score_codex":0.033994623,"about_ca_topic_score_gemma":0.03009046,"teacher_disagreement_score":0.9835392,"about_ca_system_score_codex":0.0060941526,"about_ca_system_score_gemma":0.018498687,"threshold_uncertainty_score":0.087053955},"labels":[],"label_agreement":null},{"id":"W2770448539","doi":"10.1177/0961000617742465","title":"Data science in data librarianship: Core competencies of a data librarian","year":2017,"lang":"en","type":"article","venue":"Journal of Librarianship and Information Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":92,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Data curation; Computer science; Data management; Metadata; Data science; World Wide Web; Library science; Database","score_opus":0.6056634588857582,"score_gpt":0.47246913967965815,"score_spread":0.1331943192061001,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2770448539","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.029832698,0.022542292,0.05904778,0.74519926,0.0052579576,0.00053164625,0.00041838113,0.00079203304,0.13637796],"genre_scores_gemma":[0.43959525,0.03912186,0.17667419,0.25801995,0.006410224,0.0010767176,0.0011307318,0.00055856555,0.07741246],"study_design_codex":"not_applicable","study_design_gemma":"qualitative","domain_scores_codex":[0.93590945,0.03786366,0.0058525773,0.0034438735,0.01203462,0.0048958184],"domain_scores_gemma":[0.8738648,0.06595158,0.0048860144,0.008735085,0.019248985,0.027313566],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.0480827,0.0005371724,0.0012492696,0.0047270297,0.0122609055,0.028471095,0.0027898587,0.008559946,0.007072372],"category_scores_gemma":[0.080706894,0.0010479435,0.00072295207,0.009131702,0.020567898,0.028872272,0.025658403,0.011986347,0.007233685],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000064419306,0.00070959,0.014140449,0.001569982,0.00005534058,0.0012463088,0.17414631,0.00050534203,0.0012525182,0.2561321,0.29452503,0.25565255],"study_design_scores_gemma":[0.000025946943,0.00007928037,0.0030652646,0.0011487718,0.000013849103,0.0011993004,0.051707823,0.0005840274,0.00051363365,0.096415065,0.84514505,0.00010199002],"about_ca_topic_score_codex":0.0046215444,"about_ca_topic_score_gemma":0.0037709393,"teacher_disagreement_score":0.9715289,"about_ca_system_score_codex":0.005100036,"about_ca_system_score_gemma":0.033758733,"threshold_uncertainty_score":0.2542886},"labels":[],"label_agreement":null},{"id":"W2770828134","doi":"10.1145/3110025.3120958","title":"datumPIPE","year":2017,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Computer science; Data quality; Data mining; Quality (philosophy); Data integrity; Set (abstract data type); Data set; Database; Artificial intelligence; Engineering","score_opus":0.644200694101546,"score_gpt":0.5830364078440127,"score_spread":0.06116428625753334,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2770828134","genre_codex":"software","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":"software","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01192379,0.0020294273,0.22567123,0.002366353,0.0012111436,0.0014486023,0.07334955,0.50612867,0.17587124],"genre_scores_gemma":[0.16852403,0.002918018,0.2784605,0.0036008426,0.00059490587,0.0028985916,0.26409748,0.09437162,0.18453404],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9974166,0.00038432988,0.00019104527,0.0006971282,0.0010804404,0.00023041798],"domain_scores_gemma":[0.9942683,0.0017698016,0.00029178718,0.0019370876,0.0013270202,0.0004059466],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0026987994,0.001275387,0.00097162975,0.0022620114,0.0010879423,0.0038383934,0.0039111697,0.0013373907,0.08051954],"category_scores_gemma":[0.011807294,0.0012272537,0.0011523026,0.0018384018,0.0011740918,0.0048314226,0.00508327,0.0029744683,0.049481302],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001631946,0.00020794751,0.003679192,0.0012920075,0.00012719967,0.0005121603,0.0006150241,0.0033712566,0.0068376465,0.032517623,0.76764625,0.18156174],"study_design_scores_gemma":[0.00030889706,0.00015083009,0.0016182417,0.00017133883,0.000051395913,0.0007228964,0.00009390841,0.01940621,0.013082787,0.0136375055,0.9506515,0.000104394676],"about_ca_topic_score_codex":0.002714908,"about_ca_topic_score_gemma":0.002415187,"teacher_disagreement_score":0.08051954,"about_ca_system_score_codex":0.00121629,"about_ca_system_score_gemma":0.0019213979,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W2773765147","doi":"10.1155/2017/6120820","title":"Using Distributed Data over HBase in Big Data Analytics Platform for Clinical Services","year":2017,"lang":"en","type":"article","venue":"Computational and Mathematical Methods in Medicine","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":31,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria; Island Health","funders":"Western Canada Research Grid","keywords":"Computer science; NoSQL; Big data; Metadata; Usability; SPARK (programming language); Database; Analytics; Distributed File System; Cloud computing; Distributed data store; Data mining; World Wide Web; Operating system","score_opus":0.9139543871601463,"score_gpt":0.7032738511653618,"score_spread":0.21068053599478453,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2773765147","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.14451262,0.0015075303,0.7998433,0.0057845074,0.001163553,0.0008083277,0.0042417375,0.029184328,0.012954044],"genre_scores_gemma":[0.64148116,0.00079850963,0.34652793,0.0008870659,0.00028865092,0.00041956585,0.006148711,0.00085076777,0.002597613],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9981621,0.00051378546,0.00017568076,0.00036399817,0.00059362303,0.00019091621],"domain_scores_gemma":[0.997191,0.0004848199,0.0001904709,0.0010055071,0.0007670961,0.00036115153],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0030365256,0.0005106204,0.00047427526,0.000761184,0.0007795317,0.0028627997,0.0017443482,0.0004893778,0.0018976171],"category_scores_gemma":[0.004969936,0.0003117188,0.0007482632,0.0014403714,0.0004892381,0.0028613408,0.002458614,0.0011503263,0.00078915124],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0023406337,0.0014213081,0.05932558,0.0013292677,0.0009750242,0.0023627966,0.0027268836,0.12239196,0.056477062,0.079137735,0.10753585,0.5639759],"study_design_scores_gemma":[0.00053105253,0.00063284434,0.01622726,0.00024257078,0.0002800574,0.0010567084,0.001897514,0.61758566,0.06285552,0.124054454,0.17435607,0.0002802669],"about_ca_topic_score_codex":0.0030433333,"about_ca_topic_score_gemma":0.0023258675,"teacher_disagreement_score":0.0030433333,"about_ca_system_score_codex":0.0005880679,"about_ca_system_score_gemma":0.0025542402,"threshold_uncertainty_score":0.016058862},"labels":[],"label_agreement":null},{"id":"W2775078427","doi":"10.1177/2053951717745678","title":"Challenges in administrative data linkage for research","year":2017,"lang":"en","type":"article","venue":"Big Data & Society","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":356,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute for Clinical Evaluative Sciences","funders":"Economic and Social Research Council; Wellcome Trust","keywords":"Linkage (software); Record linkage; Computer science; Data quality; Data science; Data collection; Confidentiality; Data mining; Sample (material); Population; Computer security; Engineering; Statistics; Sociology","score_opus":0.9805021151538041,"score_gpt":0.681924870153455,"score_spread":0.2985772450003491,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2775078427","genre_codex":"methods","genre_gemma":"methods","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005349892,0.043976746,0.5115274,0.4081247,0.00572695,0.001869902,0.0012235548,0.0005696813,0.021631202],"genre_scores_gemma":[0.11815463,0.03760586,0.77073365,0.04823246,0.009510733,0.009100664,0.0017597894,0.0008666036,0.004035654],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.22978987,0.6375625,0.040886283,0.018781269,0.06976727,0.003212799],"domain_scores_gemma":[0.16194247,0.6753441,0.02664045,0.07039847,0.06152676,0.004147772],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.6349509,0.0012411204,0.0046453197,0.01068699,0.012104456,0.03324808,0.012773449,0.010785478,0.0045730327],"category_scores_gemma":[0.74542415,0.0027509495,0.0038639782,0.030183611,0.028605012,0.03997223,0.030548848,0.01804472,0.0031263416],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00016224512,0.000081229504,0.0058232574,0.004581266,0.00049716275,0.00034031994,0.016724067,0.0054880064,0.0001545298,0.6513706,0.04124322,0.27353415],"study_design_scores_gemma":[0.00007716113,0.00009095342,0.0016010504,0.0076576876,0.0001525064,0.00053262664,0.008444296,0.004753542,0.00034441115,0.6970929,0.27907825,0.00017469809],"about_ca_topic_score_codex":0.009693236,"about_ca_topic_score_gemma":0.004298186,"teacher_disagreement_score":0.36504912,"about_ca_system_score_codex":0.014966426,"about_ca_system_score_gemma":0.057951126,"threshold_uncertainty_score":0.45017064},"labels":[{"model":"gemma","categories":["metaresearch"],"domain":"methods","study_design":"not_applicable","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":["metaresearch"],"domain":"methods","study_design":"design_other","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low"}],"label_agreement":"split"},{"id":"W2782105765","doi":"10.24251/hicss.2018.096","title":"Data Quality Challenges in Twitter Content Analysis for Informing Policy Making in Health Care","year":2018,"lang":"en","type":"article","venue":"Proceedings of the ... Annual Hawaii International Conference on System Sciences/Proceedings of the Annual Hawaii International Conference on System Sciences","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Social media; Microblogging; Computer science; Variety (cybernetics); Process (computing); Profiling (computer programming); Reliability (semiconductor); Content analysis; Set (abstract data type); Data science; Quality (philosophy); World Wide Web; Sociology; Artificial intelligence","score_opus":0.48591597449744817,"score_gpt":0.4817864261405992,"score_spread":0.004129548356848978,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2782105765","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.14998518,0.018832773,0.48495364,0.31041503,0.0015735799,0.0032690535,0.006325753,0.0011032587,0.02354181],"genre_scores_gemma":[0.6280223,0.005885376,0.34906182,0.008168582,0.00220313,0.0019531907,0.0024543796,0.0004639482,0.0017872703],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.7993025,0.14613964,0.014817333,0.0067946985,0.030960357,0.0019854587],"domain_scores_gemma":[0.34094724,0.5690483,0.023787118,0.022589037,0.04115628,0.0024720684],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1829368,0.00093463436,0.0020222033,0.009177966,0.004691093,0.02216363,0.0045283306,0.0058177416,0.0017950167],"category_scores_gemma":[0.46734,0.0014990524,0.0009843137,0.012252483,0.007729889,0.016311772,0.0074057123,0.0045388755,0.00090881647],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012968268,0.00083093805,0.12225694,0.008206322,0.0008440677,0.0013580081,0.03828197,0.045829825,0.008663277,0.21233186,0.062167346,0.4979326],"study_design_scores_gemma":[0.00032654993,0.00041878805,0.04303335,0.0053108647,0.000417459,0.0013961293,0.055957664,0.22919016,0.013047425,0.47907838,0.1712377,0.00058558816],"about_ca_topic_score_codex":0.018256342,"about_ca_topic_score_gemma":0.014416715,"teacher_disagreement_score":0.8170632,"about_ca_system_score_codex":0.00836355,"about_ca_system_score_gemma":0.010648818,"threshold_uncertainty_score":0.96747386},"labels":[],"label_agreement":null},{"id":"W2783287373","doi":"","title":"Quantifying duplication to improve data quality.","year":2017,"lang":"en","type":"article","venue":"Conference of the Centre for Advanced Studies on Collaborative Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Computer science; Data deduplication; Quality (philosophy); Gene duplication; Database","score_opus":0.8003330727568276,"score_gpt":0.6486310263808803,"score_spread":0.1517020463759473,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2783287373","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.13277167,0.017754465,0.7592188,0.042240176,0.0028752566,0.0038135068,0.011008239,0.0019820018,0.028335895],"genre_scores_gemma":[0.5834061,0.002726448,0.39939982,0.0033928764,0.0008624422,0.0017240194,0.0052882507,0.00042346795,0.0027765143],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.6462875,0.24188083,0.024625199,0.012442709,0.071362175,0.0034016916],"domain_scores_gemma":[0.26371968,0.46597672,0.06843974,0.09496896,0.102232255,0.0046626427],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.25382626,0.00098558,0.002140525,0.0111839995,0.0028286777,0.009270019,0.0042187436,0.0026099677,0.0043498864],"category_scores_gemma":[0.6026192,0.0009548086,0.0021625822,0.016432794,0.003834301,0.009919583,0.008396327,0.0032050218,0.0010069981],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017248935,0.00040446976,0.24799326,0.0042868224,0.002263074,0.00020320916,0.0053766076,0.023756314,0.004444405,0.1056582,0.06298158,0.5409071],"study_design_scores_gemma":[0.00063749315,0.0013510591,0.17596513,0.0060927477,0.0020785173,0.0008289388,0.0066936547,0.1931715,0.03945812,0.40944353,0.16368435,0.0005949228],"about_ca_topic_score_codex":0.010370261,"about_ca_topic_score_gemma":0.007563538,"teacher_disagreement_score":0.74617374,"about_ca_system_score_codex":0.00851664,"about_ca_system_score_gemma":0.021107422,"threshold_uncertainty_score":0.92016506},"labels":[],"label_agreement":null},{"id":"W2783291455","doi":"10.1109/bigdata.2017.8258218","title":"Identifying and mitigating risks to the quality of open data in the post-truth era","year":2017,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Open data; Big data; Data science; Transparency (behavior); Data quality; Computer science; Analytics; Quality (philosophy); Ground truth; Open government; Data analysis; Computer security; Data mining; World Wide Web; Business","score_opus":0.7811195203369069,"score_gpt":0.6219168215022497,"score_spread":0.1592026988346572,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2783291455","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10023793,0.0084410515,0.5460907,0.30015367,0.0015921626,0.001116825,0.0011343748,0.00059659855,0.040636618],"genre_scores_gemma":[0.8214017,0.005031728,0.1505731,0.015822493,0.0017453468,0.00086384825,0.0007350416,0.0002913983,0.0035353522],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8409704,0.08817682,0.010000369,0.009739111,0.047061395,0.00405194],"domain_scores_gemma":[0.2560848,0.50511426,0.097058184,0.082418986,0.053859424,0.0054643634],"candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.14679016,0.00090628595,0.0015599709,0.005441254,0.0067599635,0.01817388,0.0042500766,0.008763831,0.0037915513],"category_scores_gemma":[0.5344652,0.0012862612,0.0013390159,0.008744119,0.021091986,0.034490354,0.015884947,0.013834663,0.0007214356],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00046243303,0.00028480924,0.074568704,0.0013130333,0.0002664811,0.0011274645,0.013659709,0.011711418,0.001441693,0.7166216,0.019328346,0.15921439],"study_design_scores_gemma":[0.00006938997,0.0002299306,0.012759532,0.0029464592,0.00017419732,0.0009805079,0.009468155,0.019227622,0.004195378,0.8661589,0.08360276,0.00018711561],"about_ca_topic_score_codex":0.005518219,"about_ca_topic_score_gemma":0.0046739653,"teacher_disagreement_score":0.99574995,"about_ca_system_score_codex":0.006574345,"about_ca_system_score_gemma":0.013912313,"threshold_uncertainty_score":0.77630985},"labels":[],"label_agreement":null},{"id":"W2786093037","doi":"10.1109/hpcc-smartcity-dss.2017.35","title":"An Efficient Type-Agnostic Approach for Finding Sub-sequences in Data","year":2017,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Search engine indexing; Data mining; Data deduplication; Inverted index; Normalization (sociology); Semantics (computer science); Index (typography); Raw data; Data type; Data structure; Theoretical computer science; Information retrieval; Database","score_opus":0.5830582344166529,"score_gpt":0.5204564048528669,"score_spread":0.06260182956378602,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2786093037","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014240416,0.0006679238,0.97726667,0.00020770339,0.00012719887,0.0004033203,0.0017402322,0.0041136686,0.0012328472],"genre_scores_gemma":[0.056176957,0.0003276127,0.9373132,0.000121403784,0.000081424296,0.00021688001,0.0036389544,0.00031150048,0.0018121746],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99603575,0.00037184733,0.00061134034,0.0007190179,0.002084227,0.00017789389],"domain_scores_gemma":[0.9876885,0.0025256465,0.0013885037,0.005430305,0.002711412,0.00025571915],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0022844751,0.00088630425,0.0013434208,0.006611621,0.0009866096,0.002774151,0.0022319632,0.0010239044,0.0016977441],"category_scores_gemma":[0.01286577,0.00060891715,0.0012445546,0.0067064804,0.000989708,0.005484885,0.002689718,0.0015934281,0.002064403],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00049687206,0.00027473894,0.008996539,0.0006724451,0.00014685703,0.0003947685,0.00064536603,0.011257117,0.059401974,0.021422988,0.008886846,0.8874034],"study_design_scores_gemma":[0.00016086991,0.00068796775,0.008705699,0.00029033833,0.00026303664,0.0048687197,0.0015808116,0.5661399,0.22138129,0.100470886,0.095078595,0.0003718794],"about_ca_topic_score_codex":0.0017224122,"about_ca_topic_score_gemma":0.0025139686,"teacher_disagreement_score":0.006611621,"about_ca_system_score_codex":0.0008893476,"about_ca_system_score_gemma":0.0027008834,"threshold_uncertainty_score":0.012081623},"labels":[],"label_agreement":null},{"id":"W2787120925","doi":"10.3233/978-1-61499-830-3-1138","title":"Mapping the Electronic Health Record: A Method to Study Display Fragmentation","year":2017,"lang":"en","type":"article","venue":"Studies in health technology and informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria","funders":"Agency for Healthcare Research and Quality","keywords":"Fragmentation (computing); Computer science; Electronic health record; Computer graphics (images); Health care; Political science; Operating system","score_opus":0.2764781090987098,"score_gpt":0.5452845495756286,"score_spread":0.26880644047691876,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2787120925","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07374345,0.00062438444,0.90810645,0.00056912255,0.00012215688,0.0022290712,0.0017962499,0.0014439084,0.011365167],"genre_scores_gemma":[0.16653332,0.000256382,0.82687086,0.00011369006,0.000032649725,0.003270019,0.0004438476,0.00022090084,0.0022582528],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.98751885,0.007847915,0.00081690546,0.0011483697,0.0024430382,0.00022496353],"domain_scores_gemma":[0.95575213,0.02735613,0.004645812,0.006494562,0.0051603913,0.00059091544],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010051615,0.0009359514,0.0007335771,0.008389239,0.0015177535,0.0035282131,0.0013496842,0.001273508,0.0054167197],"category_scores_gemma":[0.04441074,0.00073567795,0.0007092678,0.010707599,0.0014669759,0.0048633954,0.0037179377,0.0013356844,0.0009536203],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012032139,0.0006848812,0.068275884,0.0024629156,0.00030389754,0.0004527041,0.02886582,0.005206904,0.021369345,0.071535505,0.008421632,0.7912174],"study_design_scores_gemma":[0.0013061072,0.0042584194,0.18170087,0.0026285248,0.0012849476,0.0048751743,0.06118495,0.16271418,0.08879051,0.1892456,0.3008654,0.001145299],"about_ca_topic_score_codex":0.002736976,"about_ca_topic_score_gemma":0.0032218012,"teacher_disagreement_score":0.010051615,"about_ca_system_score_codex":0.0011675279,"about_ca_system_score_gemma":0.0022999516,"threshold_uncertainty_score":0.05315864},"labels":[],"label_agreement":null},{"id":"W2789351899","doi":"10.3389/frobt.2018.00008","title":"Bridging Weighted Rules and Graph Random Walks for Statistical Relational Models","year":2018,"lang":"en","type":"article","venue":"Frontiers in Robotics and AI","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Statistical relational learning; Computer science; Random walk; Relational database; Theoretical computer science; Ranking (information retrieval); Artificial intelligence; Machine learning; Data mining; Mathematics; Statistics","score_opus":0.07816044410258924,"score_gpt":0.34746207764412407,"score_spread":0.2693016335415348,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2789351899","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0049791113,0.00052377896,0.992725,0.00050021365,0.000027078522,0.000027757202,0.00008811509,0.000086537046,0.0010422302],"genre_scores_gemma":[0.34848502,0.0025172003,0.64253664,0.00084708806,0.00037574576,0.0004222581,0.00091036205,0.0002178313,0.0036878102],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99126714,0.004718067,0.000491418,0.0017696111,0.001491073,0.00026273014],"domain_scores_gemma":[0.96189153,0.029947301,0.0027206803,0.0034538726,0.0014289374,0.0005576754],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008255583,0.001233009,0.0015864628,0.0028536546,0.00089553377,0.0032118065,0.0025694892,0.002312943,0.003961068],"category_scores_gemma":[0.04681504,0.0008196563,0.0018797482,0.003455098,0.003970297,0.009616975,0.003376014,0.0041810465,0.0010667914],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000025496465,0.000050744333,0.0011668337,0.00013262666,0.00008233406,0.00012192673,0.00021129867,0.0948471,0.00036617508,0.8645654,0.0010063758,0.037423845],"study_design_scores_gemma":[0.000004946589,0.000016924183,0.000114179275,0.000021113508,0.000010612683,0.00003784536,0.000016167385,0.25879228,0.000116018586,0.73960173,0.0012574617,0.00001072145],"about_ca_topic_score_codex":0.0028350684,"about_ca_topic_score_gemma":0.0028125513,"teacher_disagreement_score":0.008255583,"about_ca_system_score_codex":0.0014897614,"about_ca_system_score_gemma":0.0011601395,"threshold_uncertainty_score":0.043660223},"labels":[],"label_agreement":null},{"id":"W2789515120","doi":"10.1016/j.websem.2018.02.001","title":"Publishing privacy logs to facilitate transparency and accountability","year":2018,"lang":"en","type":"article","venue":"Journal of Web Semantics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":21,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Canada Research Chairs; University of Toronto; McMaster University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Accountability; Audit; Privacy policy; Information privacy; Transparency (behavior); SPARQL; Implementation; Computer security; World Wide Web; Semantic Web; Accounting; RDF; Business; Software engineering","score_opus":0.3420801518467736,"score_gpt":0.4188652556274554,"score_spread":0.07678510378068182,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2789515120","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.052082177,0.00046142074,0.8438811,0.029263848,0.0027626704,0.001066355,0.0060479683,0.03416683,0.03026771],"genre_scores_gemma":[0.683057,0.00063783827,0.28295222,0.0029855035,0.0017071472,0.0005594326,0.008192913,0.0042435937,0.015664415],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.94727105,0.025978588,0.006484287,0.0027606632,0.015990175,0.0015151912],"domain_scores_gemma":[0.540248,0.22446603,0.020288235,0.16855493,0.041089058,0.0053538154],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.054533903,0.0009302527,0.0014160203,0.0065544927,0.0030835648,0.019526355,0.002871777,0.005260201,0.011375612],"category_scores_gemma":[0.26329917,0.001559956,0.00095356815,0.0069779856,0.0032227645,0.03160399,0.0068335566,0.010107018,0.0055404846],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0016265914,0.0014395474,0.022796065,0.0006915315,0.00018798778,0.0014864891,0.0066950535,0.018184217,0.009533533,0.41540617,0.13848826,0.38346457],"study_design_scores_gemma":[0.00030534487,0.0002577933,0.0032719336,0.0006830383,0.00014894511,0.0009008851,0.0026707698,0.23975076,0.0432133,0.5132206,0.1953121,0.00026452198],"about_ca_topic_score_codex":0.0021833999,"about_ca_topic_score_gemma":0.0018571704,"teacher_disagreement_score":0.054533903,"about_ca_system_score_codex":0.002556981,"about_ca_system_score_gemma":0.010290054,"threshold_uncertainty_score":0.28840625},"labels":[],"label_agreement":null},{"id":"W2789592939","doi":"10.5441/002/edbt.2018.87","title":"FastOFD: Contextual Data Cleaning with Ontology Functional Dependencies","year":2018,"lang":"en","type":"article","venue":"Movebank","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ontario Tech University; University of Waterloo; McMaster University","funders":"","keywords":"Computer science; Ontology; Functional dependency; Dependency theory (database theory); Information retrieval; Data mining; Relational database","score_opus":0.4593973220632835,"score_gpt":0.4301787023006636,"score_spread":0.029218619762619913,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2789592939","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0058566923,0.000546157,0.793736,0.00065578264,0.00036533983,0.00040592928,0.029997222,0.16477121,0.003665711],"genre_scores_gemma":[0.0582063,0.0005394282,0.84378207,0.0005371999,0.000100727775,0.000560654,0.07616732,0.016644102,0.003462159],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99524564,0.0008593911,0.0005908396,0.0012067895,0.0017797234,0.0003175626],"domain_scores_gemma":[0.9893194,0.0034435624,0.00055869063,0.0052356855,0.0012622953,0.0001804309],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0055012833,0.0020884532,0.0015702201,0.005539618,0.0017722347,0.0045005777,0.0027080574,0.0015728036,0.011802543],"category_scores_gemma":[0.024360634,0.0019168613,0.0032529242,0.004010705,0.0010780452,0.0061423345,0.007785209,0.0025380792,0.0048215766],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00089838303,0.0003731871,0.011974604,0.0035417222,0.0010934509,0.00080034527,0.0016943213,0.022228474,0.01356815,0.058768418,0.3709923,0.5140667],"study_design_scores_gemma":[0.00022576173,0.00015517938,0.0065093804,0.000978058,0.0005989723,0.0009690012,0.0009782189,0.21277164,0.05560252,0.10612508,0.6147737,0.00031239795],"about_ca_topic_score_codex":0.011881907,"about_ca_topic_score_gemma":0.016876673,"teacher_disagreement_score":0.011881907,"about_ca_system_score_codex":0.0011898136,"about_ca_system_score_gemma":0.0044381265,"threshold_uncertainty_score":0.039483488},"labels":[],"label_agreement":null},{"id":"W2792505333","doi":"10.47622/978-1-928331-56-8","title":"The Social Dynamics of Open Data","year":2017,"lang":"en","type":"book","venue":"African Minds eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":17,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Comisión Nacional de Investigación Científica y Tecnológica; International Development Research Centre","keywords":"Open data; Data collection; Data science; Dynamics (music); Computer science; Open science; Open research; Open source; Management science; World Wide Web; Sociology; Social science; Engineering; Statistics; Mathematics","score_opus":0.412274993420936,"score_gpt":0.4866937168620067,"score_spread":0.0744187234410707,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2792505333","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.018992102,0.037769757,0.071359426,0.26990563,0.004633219,0.00032762237,0.000646609,0.00037658642,0.59598905],"genre_scores_gemma":[0.60195786,0.092731856,0.06402482,0.026173051,0.010014652,0.0019023411,0.0012037271,0.0018428718,0.20014887],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.96313906,0.021016717,0.0011399275,0.0021118107,0.01147941,0.0011130476],"domain_scores_gemma":[0.9102168,0.07608012,0.00246062,0.0054304684,0.0038178975,0.0019941276],"candidate_categories":["sts","open_science"],"consensus_categories":[],"category_scores_codex":[0.029302951,0.00043277937,0.0005072934,0.0049382662,0.008546771,0.02700382,0.0016624476,0.0035646947,0.009153101],"category_scores_gemma":[0.050625943,0.00072137505,0.00065996486,0.00750654,0.03471075,0.034540202,0.01597724,0.007995419,0.0020983077],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000075005396,0.000010067623,0.00027314477,0.00013524729,0.000008534557,0.000073140596,0.016931292,0.00022691839,0.00010711958,0.9233433,0.02795492,0.030928979],"study_design_scores_gemma":[0.000005137843,0.00000850852,0.0003834277,0.00039200284,0.000003737586,0.000109616994,0.006553587,0.00039021924,0.00016884388,0.3418851,0.65008086,0.000018941571],"about_ca_topic_score_codex":0.0029869173,"about_ca_topic_score_gemma":0.0027844275,"teacher_disagreement_score":0.99833757,"about_ca_system_score_codex":0.0087575745,"about_ca_system_score_gemma":0.008634376,"threshold_uncertainty_score":0.1549707},"labels":[{"model":"gemma","categories":["open_science","sts"],"domain":null,"study_design":"theoretical_or_conceptual","genre":"other","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":["scholarly_communication","open_science"],"domain":null,"study_design":"theoretical_or_conceptual","genre":"other","about_ca_system":false,"about_ca_topic":false,"confidence":"high"}],"label_agreement":"split"},{"id":"W2792572948","doi":"10.1145/3186549.3186559","title":"Data Quality","year":2018,"lang":"en","type":"article","venue":"ACM SIGMOD Record","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":32,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto; University of Waterloo","funders":"","keywords":"Computer science; Scope (computer science); Quality (philosophy); Data quality; Empiricism; Data science; Action (physics); Data mining; Epistemology; Programming language; Engineering","score_opus":0.6848192121373361,"score_gpt":0.55904053398058,"score_spread":0.12577867815675614,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2792572948","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006542586,0.01501703,0.46633467,0.31668064,0.008321189,0.0024976784,0.007229406,0.0020884564,0.17528841],"genre_scores_gemma":[0.2743502,0.017660363,0.5273928,0.09971249,0.009577886,0.0051124454,0.015738104,0.0026552517,0.047800545],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.7142184,0.13483924,0.03182683,0.018473815,0.09605062,0.004591084],"domain_scores_gemma":[0.36518064,0.23131172,0.0320962,0.18640155,0.17247032,0.012539674],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.23770383,0.00086830824,0.0020890315,0.008266796,0.005483202,0.02800883,0.0064671193,0.004075619,0.027704155],"category_scores_gemma":[0.50652224,0.0011696044,0.0027114619,0.012324504,0.011077821,0.025510427,0.014574925,0.008119707,0.009645497],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014278141,0.000095048,0.01157377,0.0017202668,0.00019285818,0.00019059239,0.002376759,0.001489982,0.0004210506,0.62495565,0.11219919,0.24464203],"study_design_scores_gemma":[0.000053706175,0.00011642106,0.0033375511,0.002637476,0.00006697126,0.00034630817,0.0014342512,0.0016993791,0.0006453721,0.30305153,0.68653667,0.0000742903],"about_ca_topic_score_codex":0.010360619,"about_ca_topic_score_gemma":0.006116215,"teacher_disagreement_score":0.23770383,"about_ca_system_score_codex":0.013526931,"about_ca_system_score_gemma":0.037954606,"threshold_uncertainty_score":0.9400469},"labels":[],"label_agreement":null},{"id":"W2793476072","doi":"10.1515/jos-2018-0003","title":"Design-Based Estimation with Record-Linked Administrative Files and a Clerical Review Sample","year":2018,"lang":"en","type":"review","venue":"Journal of Official Statistics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Statistics Canada","funders":"","keywords":"Estimator; Sample (material); Statistics; Record linkage; Estimation; Linkage (software); Population; Econometrics; Regression analysis; Computer science; Missing data; Regression; Mathematics; Demography; Sociology; Engineering","score_opus":0.49991367302203166,"score_gpt":0.5189310698110305,"score_spread":0.019017396788998886,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2793476072","genre_codex":"methods","genre_gemma":"review","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014173294,0.3117928,0.65549064,0.003607394,0.0011911123,0.0034261418,0.0008377665,0.00042835044,0.009052565],"genre_scores_gemma":[0.28646907,0.16511777,0.5324371,0.0020991692,0.0012115275,0.007804509,0.0014786285,0.0001332428,0.0032490173],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.85290647,0.12488479,0.00419542,0.0035519684,0.0140057495,0.00045567943],"domain_scores_gemma":[0.70754087,0.24532609,0.018471252,0.013361148,0.014846381,0.00045430043],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.09506091,0.0009238815,0.0023203138,0.0032034926,0.00036913046,0.0019182758,0.0038559898,0.0024247423,0.0030073354],"category_scores_gemma":[0.23398829,0.000723768,0.0017629133,0.0041170204,0.0012948015,0.0015547342,0.0012905071,0.0010914411,0.0009380003],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00024257235,0.00025594715,0.011715617,0.028077329,0.0025668035,0.00013017289,0.00041202392,0.010858258,0.0002741307,0.046009954,0.0076156864,0.8918415],"study_design_scores_gemma":[0.0024131227,0.0050106607,0.09008578,0.07717297,0.01587624,0.0025259396,0.0019994597,0.13051409,0.0064344653,0.1778942,0.4894062,0.0006668105],"about_ca_topic_score_codex":0.002829423,"about_ca_topic_score_gemma":0.0022767847,"teacher_disagreement_score":0.9049391,"about_ca_system_score_codex":0.0017569052,"about_ca_system_score_gemma":0.004660316,"threshold_uncertainty_score":0.50273615},"labels":[],"label_agreement":null},{"id":"W2795302121","doi":"10.1109/icde.2018.00093","title":"Seeping Semantics: Linking Datasets Using Word Embeddings for Data Discovery","year":2018,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":89,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Schema (genetic algorithms); Knowledge graph; Semantics (computer science); Linked data; Information retrieval; Semantic Web; Word (group theory); RDF; Distributional semantics; Natural language processing; Semantic similarity; Programming language","score_opus":0.49323168033993964,"score_gpt":0.519707133187662,"score_spread":0.026475452847722403,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2795302121","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02644702,0.0009132492,0.955642,0.00066551846,0.00019601428,0.00051206804,0.0044622305,0.009083256,0.002078697],"genre_scores_gemma":[0.07890739,0.00039460263,0.9115608,0.00020037252,0.000050210354,0.00040342213,0.0071633533,0.00043467287,0.00088512735],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9957366,0.0015719756,0.00063303846,0.00097502867,0.00090399286,0.00017931068],"domain_scores_gemma":[0.99134666,0.004072045,0.00086972996,0.0024924397,0.00092946575,0.00028958695],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004435755,0.0017956438,0.0011918037,0.011925423,0.0012774481,0.0032741947,0.0018593541,0.0016496032,0.0029989346],"category_scores_gemma":[0.02616591,0.0008620199,0.0021614444,0.011859265,0.0010246846,0.012535048,0.0063356515,0.0016980934,0.0018036489],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005347961,0.0005686339,0.015489757,0.0014690688,0.0006515134,0.00041007655,0.0025240171,0.01720436,0.0073787076,0.04172926,0.016153894,0.8958858],"study_design_scores_gemma":[0.00020118234,0.00058987347,0.0065536094,0.0004940627,0.0005088464,0.001072826,0.0038968856,0.46319142,0.017338112,0.43063527,0.0752804,0.00023744076],"about_ca_topic_score_codex":0.0036071183,"about_ca_topic_score_gemma":0.0077838534,"teacher_disagreement_score":0.011925423,"about_ca_system_score_codex":0.00073185825,"about_ca_system_score_gemma":0.001849453,"threshold_uncertainty_score":0.023458779},"labels":[],"label_agreement":null},{"id":"W2795335174","doi":"10.5539/cis.v11n2p34","title":"Constructing Metadata Schema of Scientific and Technical Report Based on FRBR","year":2018,"lang":"en","type":"article","venue":"Computer and Information Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"Nanjing University of Aeronautics and Astronautics; Nanjing University; Government of Jiangsu Province","keywords":"Computer science; Metadata; Schema (genetic algorithms); Information retrieval; Metadata modeling; Resource (disambiguation); Scientific literature; Data science; World Wide Web; Metadata repository","score_opus":0.11854589095090393,"score_gpt":0.3938698230366426,"score_spread":0.2753239320857387,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2795335174","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.025206406,0.0011384538,0.9268024,0.0023060453,0.00028658376,0.0014528504,0.0135991415,0.0033957786,0.025812354],"genre_scores_gemma":[0.100808546,0.0020185064,0.84485173,0.0005657568,0.00015049348,0.0012354936,0.040064465,0.00051049126,0.009794517],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9933287,0.0013682719,0.0021321578,0.0010789736,0.0018384764,0.00025347588],"domain_scores_gemma":[0.991319,0.0015973272,0.0014320457,0.0021289673,0.0032715988,0.0002510577],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.0062056193,0.0005493318,0.0006492575,0.010247823,0.0014711245,0.005049061,0.0020247097,0.0012464889,0.0035657708],"category_scores_gemma":[0.013269486,0.000544247,0.0016204262,0.010107849,0.0011035616,0.010344552,0.0025085374,0.0012109684,0.0021785507],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018583733,0.00030099176,0.018662076,0.0021386046,0.00015142787,0.0017268151,0.009181775,0.0066340915,0.020777244,0.60658646,0.038391743,0.295263],"study_design_scores_gemma":[0.00008842112,0.00016362543,0.009945532,0.0011341231,0.00034508243,0.0037868044,0.006035527,0.040647652,0.030468153,0.10845427,0.79871637,0.00021442436],"about_ca_topic_score_codex":0.008726171,"about_ca_topic_score_gemma":0.005759261,"teacher_disagreement_score":0.99495095,"about_ca_system_score_codex":0.0018845641,"about_ca_system_score_gemma":0.0057120244,"threshold_uncertainty_score":0.032818854},"labels":[],"label_agreement":null},{"id":"W2798581322","doi":"10.3233/978-1-61499-852-5-6","title":"Exploring Semantic Data Federation to Enable Malaria Surveillance Queries","year":2018,"lang":"en","type":"article","venue":"Studies in health technology and informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal; University of New Brunswick","funders":"","keywords":"Computer science; Malaria; Software deployment; Semantic Web; World Wide Web; Globe; Data science; Coding (social sciences); Medicine; Software engineering","score_opus":0.6290201994302058,"score_gpt":0.5107365077585378,"score_spread":0.11828369167166797,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2798581322","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.2031908,0.0005767954,0.7733983,0.0053283004,0.00015363735,0.00055582874,0.00091771985,0.007632336,0.008246257],"genre_scores_gemma":[0.60405487,0.00029114855,0.3924445,0.00039135414,0.000034547436,0.00017642691,0.0016475957,0.00015373324,0.00080576236],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99235594,0.003895223,0.0007529266,0.00085491524,0.0015921126,0.0005489366],"domain_scores_gemma":[0.9911472,0.004069573,0.0005360313,0.0023783448,0.0013168474,0.00055199984],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013102015,0.00044030295,0.0006578612,0.0018356668,0.0019260461,0.0040712957,0.0016105681,0.001432321,0.0007478608],"category_scores_gemma":[0.013635488,0.00045241028,0.0015041314,0.0027319787,0.0013601306,0.0075856363,0.0046933554,0.0016420417,0.0002504266],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001944721,0.0022883194,0.062166385,0.0009977916,0.0005546311,0.0034371882,0.012356464,0.1303362,0.035593163,0.32654983,0.01992441,0.40385085],"study_design_scores_gemma":[0.000108903834,0.00021727211,0.004390723,0.00011102181,0.0001514315,0.000599931,0.0041946825,0.82730466,0.017664978,0.09111445,0.05406251,0.00007942494],"about_ca_topic_score_codex":0.011819185,"about_ca_topic_score_gemma":0.009933994,"teacher_disagreement_score":0.013102015,"about_ca_system_score_codex":0.001671752,"about_ca_system_score_gemma":0.0033850684,"threshold_uncertainty_score":0.06929088},"labels":[],"label_agreement":null},{"id":"W2798653217","doi":"10.1145/3209978.3210021","title":"Automated Comparative Table Generation for Facilitating Human Intervention in Multi-Entity Resolution","year":2018,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"University of Toronto; National Natural Science Foundation of China","keywords":"Computer science; Automatic summarization; Crowdsourcing; Pairwise comparison; Table (database); Human-in-the-loop; Machine learning; Data mining; Graph; Set (abstract data type); Process (computing); Information retrieval; Artificial intelligence; Theoretical computer science; World Wide Web","score_opus":0.5955459466693872,"score_gpt":0.5512337355109547,"score_spread":0.044312211158432535,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2798653217","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.020141957,0.00036140246,0.97196823,0.00024126537,0.00005684295,0.0003065431,0.00091589993,0.004262695,0.0017451732],"genre_scores_gemma":[0.098325506,0.00013432783,0.8980172,0.00008009035,0.00003435015,0.00020317262,0.0022088636,0.00038788954,0.0006085575],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9971988,0.0011042631,0.00027485425,0.0006217478,0.00066196546,0.00013833302],"domain_scores_gemma":[0.9901814,0.0064304825,0.00068766094,0.0013518028,0.0011377798,0.00021087172],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00492767,0.0013587789,0.0013670126,0.0037384897,0.0011035342,0.002010809,0.0024033983,0.0012107458,0.007897904],"category_scores_gemma":[0.019715022,0.000526713,0.0011113045,0.003771436,0.0007398415,0.0036868579,0.0019588424,0.0011039044,0.0016631539],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007006216,0.00043525576,0.0067052194,0.00068155513,0.00013262048,0.0007536347,0.0009475721,0.10568107,0.023350084,0.04237908,0.029290793,0.78894246],"study_design_scores_gemma":[0.000119138094,0.00024503155,0.002025348,0.00007370897,0.00009557371,0.00070341746,0.00049614423,0.9152784,0.02325119,0.036753196,0.020884017,0.00007480948],"about_ca_topic_score_codex":0.0016421324,"about_ca_topic_score_gemma":0.003789293,"teacher_disagreement_score":0.007897904,"about_ca_system_score_codex":0.000908701,"about_ca_system_score_gemma":0.0017229181,"threshold_uncertainty_score":0.02642113},"labels":[],"label_agreement":null},{"id":"W2798664493","doi":"10.14778/3192965.3192973","title":"Table union search on open data","year":2018,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":193,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Table (database); Computer science; Benchmark (surveying); Data mining; Set (abstract data type); Semantic search; Domain (mathematical analysis); Ontology; Decision table; Probabilistic logic; Information retrieval; Search engine; Artificial intelligence; Mathematics; Programming language","score_opus":0.48054255452095584,"score_gpt":0.4884253644300699,"score_spread":0.007882809909114052,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2798664493","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08211512,0.002759091,0.8976465,0.0013900466,0.00014061107,0.00033665702,0.0049871216,0.0058034114,0.004821426],"genre_scores_gemma":[0.3087517,0.0007467618,0.67798907,0.00040061743,0.00009948557,0.00035815348,0.008297247,0.0005445703,0.0028124906],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9944501,0.0014248968,0.00050301076,0.0013894216,0.001759829,0.00047275302],"domain_scores_gemma":[0.98208505,0.012250816,0.0011970783,0.0027038248,0.0012919145,0.00047134855],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00439759,0.0009174236,0.0021785507,0.0051318347,0.0019497307,0.0040698266,0.003392497,0.0019510234,0.0052774074],"category_scores_gemma":[0.028504001,0.00093093805,0.0025374359,0.01051983,0.0016488842,0.009212591,0.004871484,0.0015438154,0.0011078159],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00087642454,0.0005574672,0.015572079,0.0012703029,0.00044382308,0.001172553,0.0013181301,0.40512142,0.004733785,0.10754552,0.033207204,0.42818123],"study_design_scores_gemma":[0.00009483257,0.00011524092,0.001094164,0.00011171024,0.000097161574,0.00049658254,0.00052198995,0.8407168,0.0041857557,0.14210503,0.010419548,0.000041256662],"about_ca_topic_score_codex":0.006355432,"about_ca_topic_score_gemma":0.006847159,"teacher_disagreement_score":0.006355432,"about_ca_system_score_codex":0.0016372895,"about_ca_system_score_gemma":0.0028072912,"threshold_uncertainty_score":0.023256958},"labels":[],"label_agreement":null},{"id":"W2801222526","doi":"10.4095/288849","title":"L'Infrastructure canadienne de données : De meilleures connaissances pour de meilleures décisions","year":2005,"lang":"fr","type":"report","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Political science","score_opus":0.16920314612412135,"score_gpt":0.3944777780384163,"score_spread":0.22527463191429498,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2801222526","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005237065,0.037785593,0.47801086,0.40461776,0.0039012039,0.0007200343,0.001094213,0.0014380498,0.0671952],"genre_scores_gemma":[0.10243806,0.05888723,0.7662025,0.024655119,0.003445531,0.0012160112,0.003156582,0.0012832204,0.038715802],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.885281,0.053624064,0.0103084175,0.0096596265,0.03729731,0.0038295446],"domain_scores_gemma":[0.87284994,0.05946772,0.0034619947,0.020579403,0.039028276,0.0046126437],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.105658546,0.0031167488,0.002446273,0.011148177,0.007830142,0.04231711,0.00725798,0.012106047,0.010783402],"category_scores_gemma":[0.111431286,0.0028074833,0.003986433,0.012196597,0.023654405,0.06375648,0.023282276,0.020662447,0.003323355],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000681414,0.00009630615,0.0013378138,0.0013851979,0.000117281095,0.00046488142,0.012768881,0.0028563866,0.0017926221,0.8051794,0.04356282,0.13037024],"study_design_scores_gemma":[0.000024729141,0.000042990654,0.0008399028,0.0026850807,0.000046884943,0.00057983666,0.008261648,0.006054594,0.0011112143,0.20446293,0.7757257,0.00016431605],"about_ca_topic_score_codex":0.071482316,"about_ca_topic_score_gemma":0.045541663,"teacher_disagreement_score":0.97685623,"about_ca_system_score_codex":0.023143746,"about_ca_system_score_gemma":0.03592491,"threshold_uncertainty_score":0.55878246},"labels":[],"label_agreement":null},{"id":"W2802214269","doi":"10.20381/ruor-21830","title":"Tri-Agency Data Management Policy Initiative","year":2017,"lang":"en","type":"article","venue":"uO Research (University of Ottawa)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Social Sciences and Humanities Research Council","funders":"","keywords":"Agency (philosophy); Business; Public administration; Data management; Process management; Political science; Computer science; Data mining; Sociology","score_opus":0.7321984042348094,"score_gpt":0.5575252311577853,"score_spread":0.17467317307702412,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2802214269","genre_codex":"commentary","genre_gemma":"methods","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.001841386,0.0032492832,0.0069743283,0.5707331,0.013933025,0.0010702596,0.016369613,0.005221391,0.38060772],"genre_scores_gemma":[0.020953912,0.0035767935,0.03210973,0.25751904,0.005631864,0.0024931594,0.019504515,0.0031833118,0.6550278],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.88971436,0.021843407,0.009579867,0.006990797,0.06014752,0.011724006],"domain_scores_gemma":[0.7753272,0.048450388,0.010806126,0.023822214,0.10827338,0.03332064],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.09435091,0.0011250906,0.0018149827,0.004915233,0.016866596,0.04009253,0.010127691,0.033790566,0.09256946],"category_scores_gemma":[0.13546786,0.0023354804,0.0028153225,0.014018086,0.004734706,0.021828372,0.012913378,0.028591447,0.064158075],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00005416233,0.00005003916,0.00024660834,0.000096115466,0.000010355573,0.000052938856,0.00037995772,0.000045450426,0.0001065345,0.023577888,0.9701744,0.005205677],"study_design_scores_gemma":[0.000018417391,0.000012799801,0.0003338111,0.00010586618,0.000008550389,0.000021305057,0.00041481858,0.00008941732,0.00013075733,0.0010708162,0.9977671,0.000026355343],"about_ca_topic_score_codex":0.22855872,"about_ca_topic_score_gemma":0.22722282,"teacher_disagreement_score":0.98987234,"about_ca_system_score_codex":0.03347122,"about_ca_system_score_gemma":0.1545997,"threshold_uncertainty_score":0.4989813},"labels":[],"label_agreement":null},{"id":"W2804792234","doi":"10.23889/ijpds.v3i1.450","title":"Unlocking First Nations health information through data linkage","year":2018,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Toronto; Laurentian University; Institute for Work & Health; Sunnybrook Health Science Centre; Institute for Clinical Evaluative Sciences","funders":"Ontario Ministry of Health and Long-Term Care; Institute for Clinical Evaluative Sciences","keywords":"Indigenous; Linkage (software); Sovereignty; Context (archaeology); Linked data; Population; Record linkage; Geography; Metis; Economic growth; Database; Political science; Medicine; Environmental health; Biology; Law; Genetics; Ecology; World Wide Web; Computer science; Economics; Politics","score_opus":0.47246174585891115,"score_gpt":0.5651324642231068,"score_spread":0.09267071836419566,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2804792234","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.061322484,0.016958822,0.7104252,0.06452769,0.0014289785,0.0071678883,0.04096789,0.0022710557,0.094929986],"genre_scores_gemma":[0.28471315,0.010309971,0.6536589,0.006123816,0.00076183054,0.00845784,0.028556744,0.00056749256,0.0068501355],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.80298924,0.13770255,0.0166441,0.011571974,0.028581344,0.0025108468],"domain_scores_gemma":[0.6860916,0.15450376,0.043509495,0.061880257,0.049749896,0.004265008],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.17250806,0.00077002455,0.001424336,0.014388259,0.004354548,0.009389689,0.0052430653,0.0019732642,0.0076065785],"category_scores_gemma":[0.30074728,0.0008342699,0.0013696273,0.03057709,0.004445591,0.008814375,0.017688397,0.00250843,0.001741021],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00028703615,0.00015877506,0.114535645,0.0071314643,0.00088394515,0.00043212232,0.030878622,0.0049308427,0.00078830565,0.19048785,0.0650557,0.5844297],"study_design_scores_gemma":[0.00015266823,0.00020352146,0.06163185,0.017633278,0.0006687419,0.0007895524,0.016206585,0.014288581,0.0025926388,0.17944257,0.7060558,0.00033420944],"about_ca_topic_score_codex":0.09804869,"about_ca_topic_score_gemma":0.07777833,"teacher_disagreement_score":0.17250806,"about_ca_system_score_codex":0.012238784,"about_ca_system_score_gemma":0.07005542,"threshold_uncertainty_score":0.91232073},"labels":[],"label_agreement":null},{"id":"W2805138799","doi":"","title":"The IBM Systems for Entity Discovery and Linking at TAC 2017.","year":2017,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"IBM; Computer science; Operating system; Database; Nanotechnology; Materials science","score_opus":0.07877614834923444,"score_gpt":0.38673919880046786,"score_spread":0.3079630504512334,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2805138799","genre_codex":"software","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006057216,0.0041546905,0.30462766,0.010455961,0.004492532,0.0008579128,0.1300356,0.45643416,0.08288435],"genre_scores_gemma":[0.0582256,0.003270654,0.40540203,0.0014840511,0.0024772899,0.0010024015,0.3762896,0.05509055,0.096757814],"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9912724,0.0021813656,0.00065176823,0.0015841534,0.0035608732,0.00074933947],"domain_scores_gemma":[0.9788771,0.0033890533,0.0008871169,0.008798562,0.005074282,0.002973818],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.016359752,0.0027863665,0.0028044933,0.006228463,0.0023079992,0.013630059,0.0039521605,0.0018320279,0.14873518],"category_scores_gemma":[0.03549856,0.0023923647,0.0017635126,0.0117719555,0.001504523,0.014082869,0.0072425115,0.005735046,0.15519498],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005197373,0.00008861558,0.00076100667,0.00016174621,0.00010442464,0.000083619336,0.00019890268,0.0009405481,0.0008859873,0.018152406,0.91252345,0.06557969],"study_design_scores_gemma":[0.0005043921,0.000110955625,0.0021043755,0.00018898449,0.00009317684,0.00018261418,0.00023282785,0.028100722,0.0045449007,0.09184277,0.87194467,0.00014957147],"about_ca_topic_score_codex":0.016144138,"about_ca_topic_score_gemma":0.012197211,"teacher_disagreement_score":0.14873518,"about_ca_system_score_codex":0.0024506452,"about_ca_system_score_gemma":0.008214824,"threshold_uncertainty_score":0.49756873},"labels":[],"label_agreement":null},{"id":"W2805217704","doi":"","title":"FOFE-based Deep Neural Networks for Entity Discovery and Linking.","year":2017,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Artificial neural network; Deep neural networks; Artificial intelligence","score_opus":0.05583899060996958,"score_gpt":0.3677476582644973,"score_spread":0.31190866765452774,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2805217704","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.06401734,0.004426892,0.91928804,0.0021089711,0.00022235664,0.000113048125,0.0014073865,0.002320791,0.006095057],"genre_scores_gemma":[0.7709942,0.001161882,0.21292473,0.0006452863,0.0001862166,0.00020033187,0.0036847445,0.00011913407,0.010083537],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9991014,0.00028212473,0.00006460101,0.00020790593,0.00019079504,0.00015328809],"domain_scores_gemma":[0.9955094,0.0027842093,0.000300688,0.00055217656,0.00071109243,0.00014241839],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0030379957,0.0006179712,0.0011578398,0.002227811,0.00075915817,0.0013505721,0.0028069587,0.0022238535,0.0037086622],"category_scores_gemma":[0.013190818,0.00038375283,0.0007754349,0.002256683,0.0008559639,0.0040830853,0.0020478247,0.0021181079,0.0010826451],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00046160817,0.00032824354,0.0062091057,0.00030907866,0.00023258844,0.00017732607,0.00021975087,0.39323857,0.0016115227,0.066744104,0.021600734,0.5088673],"study_design_scores_gemma":[0.0000069439825,0.000021276042,0.00033972992,0.00002950102,0.000016705013,0.000032461954,0.000019524068,0.96516734,0.00070189155,0.032246646,0.0014119503,0.0000060571174],"about_ca_topic_score_codex":0.016565321,"about_ca_topic_score_gemma":0.01927321,"teacher_disagreement_score":0.016565321,"about_ca_system_score_codex":0.0019859606,"about_ca_system_score_gemma":0.0016371476,"threshold_uncertainty_score":0.032937825},"labels":[],"label_agreement":null},{"id":"W2805327586","doi":"","title":"CMU System for Entity Discovery and Linking at TAC-KBP 2016.","year":2016,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science","score_opus":0.04356788796697616,"score_gpt":0.339607856484424,"score_spread":0.29603996851744785,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2805327586","genre_codex":"software","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005397104,0.0008711914,0.16672488,0.0010244523,0.0006554587,0.0006549436,0.12632036,0.6846253,0.013726355],"genre_scores_gemma":[0.053730607,0.0007213209,0.46525174,0.0008785451,0.0003385228,0.0017890275,0.4182921,0.043553323,0.015444783],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99496514,0.0014307171,0.00055617216,0.0010967482,0.0015906873,0.00036056899],"domain_scores_gemma":[0.98818654,0.0034232752,0.00076328614,0.004649267,0.0021045883,0.0008730863],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008828788,0.0020363426,0.001971494,0.009135628,0.0021416203,0.005550467,0.0040493673,0.002757907,0.050161403],"category_scores_gemma":[0.03847553,0.001372806,0.0012540169,0.009145648,0.00088064023,0.0075767287,0.006338459,0.0032972342,0.049675647],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014166143,0.00019987838,0.0024616597,0.0011532634,0.0003496689,0.0004960322,0.00084594346,0.0027680679,0.0044436427,0.016380133,0.81650317,0.15298189],"study_design_scores_gemma":[0.0004976255,0.00013781594,0.0042858887,0.00061284774,0.00016189543,0.000519917,0.0004654645,0.07562869,0.0208137,0.036622316,0.8599729,0.00028097292],"about_ca_topic_score_codex":0.0150572825,"about_ca_topic_score_gemma":0.011566695,"teacher_disagreement_score":0.050161403,"about_ca_system_score_codex":0.0017738414,"about_ca_system_score_gemma":0.0055136387,"threshold_uncertainty_score":0.16780663},"labels":[],"label_agreement":null},{"id":"W2805545340","doi":"","title":"Illinois CCG TAC 2015 Event Nugget, Entity Discovery and Linking, and Slot Filler Validation Systems","year":2015,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":14,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Filler (materials); Event (particle physics); Computer science; Materials science; Composite material; Physics","score_opus":0.06286482228217304,"score_gpt":0.36153977177700314,"score_spread":0.2986749494948301,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2805545340","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.030045552,0.001677173,0.5847348,0.028435051,0.0031171474,0.0019472624,0.017295348,0.04485361,0.28789404],"genre_scores_gemma":[0.33670345,0.0012126962,0.3962431,0.0041749454,0.0009533696,0.0013538703,0.037329458,0.0037971265,0.21823207],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98899466,0.0040233694,0.0005718762,0.0013910243,0.0043576183,0.00066146906],"domain_scores_gemma":[0.9665582,0.011618664,0.0010183183,0.009862649,0.009451615,0.0014905218],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.022898026,0.00079916394,0.0009313293,0.005412103,0.0040916456,0.010593344,0.0028644213,0.002835401,0.03241226],"category_scores_gemma":[0.03229886,0.0008293245,0.0007259051,0.0040553776,0.0035773355,0.0088911075,0.0044791577,0.004031825,0.009967902],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008277404,0.0003170133,0.00577967,0.00017956934,0.00005190887,0.00013447841,0.0005775127,0.015719716,0.0018502044,0.21237375,0.44709864,0.31508982],"study_design_scores_gemma":[0.00016709144,0.00015873517,0.0036900698,0.00026922065,0.000067636385,0.00015404446,0.00040796885,0.16431156,0.010134168,0.1509707,0.66951317,0.00015562265],"about_ca_topic_score_codex":0.06889508,"about_ca_topic_score_gemma":0.089567475,"teacher_disagreement_score":0.06889508,"about_ca_system_score_codex":0.0072826482,"about_ca_system_score_gemma":0.013864295,"threshold_uncertainty_score":0.1369881},"labels":[],"label_agreement":null},{"id":"W2805831109","doi":"","title":"The ZJU-EDL System for Entity Discovery and Linking at TAC KBP 2015.","year":2015,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Artificial intelligence","score_opus":0.07136923357888218,"score_gpt":0.37166902919747385,"score_spread":0.30029979561859166,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2805831109","genre_codex":"software","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006032007,0.00084202766,0.2841707,0.0010764804,0.0003596979,0.00059229473,0.20953096,0.47485253,0.022543272],"genre_scores_gemma":[0.043034162,0.00073191675,0.3594598,0.0005890712,0.00013364649,0.0009380863,0.5517532,0.02335259,0.020007545],"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99607337,0.0010881637,0.0006809093,0.0005727139,0.0013427484,0.00024219784],"domain_scores_gemma":[0.9906413,0.002819947,0.00054715207,0.0037900733,0.0017606636,0.00044086413],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0068285614,0.0013795458,0.0013430344,0.00896535,0.0013638851,0.0059406892,0.003254197,0.0017537235,0.055070285],"category_scores_gemma":[0.025289964,0.0012761519,0.0010208528,0.006918569,0.00066696666,0.0070026116,0.005930549,0.0018171802,0.04860727],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010431173,0.00020465309,0.0035536052,0.0018551205,0.00031168663,0.00046768467,0.0009840052,0.004329221,0.0065043704,0.027975677,0.7225198,0.23025101],"study_design_scores_gemma":[0.0003978468,0.00008798231,0.004766973,0.000512845,0.00014395636,0.00030659145,0.00040481417,0.0456864,0.0163477,0.034305304,0.8968204,0.00021904155],"about_ca_topic_score_codex":0.013780607,"about_ca_topic_score_gemma":0.012646568,"teacher_disagreement_score":0.055070285,"about_ca_system_score_codex":0.001648789,"about_ca_system_score_gemma":0.0036788199,"threshold_uncertainty_score":0.18422842},"labels":[],"label_agreement":null},{"id":"W2806382634","doi":"","title":"The lilian Cold Start System for TAC 2016.","year":2016,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science","score_opus":0.04819693834677411,"score_gpt":0.34347019672230644,"score_spread":0.2952732583755323,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2806382634","genre_codex":"software","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013493495,0.0013039879,0.15710828,0.0035165427,0.0024715813,0.0015370873,0.16980648,0.55768275,0.09307985],"genre_scores_gemma":[0.12945828,0.0008449553,0.21162489,0.0017493904,0.0007723322,0.002372349,0.52450174,0.05222491,0.07645117],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9954526,0.0013985994,0.00039154704,0.0006152514,0.0016559322,0.000486163],"domain_scores_gemma":[0.98630047,0.0024544518,0.00060186285,0.0055611483,0.0038269847,0.0012549977],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009494677,0.00088685256,0.0008804972,0.0027262399,0.0012444799,0.004191982,0.0022391607,0.0012831631,0.05411932],"category_scores_gemma":[0.029658157,0.00066956994,0.00088272826,0.0027130044,0.0006109917,0.0042821025,0.0033927567,0.0023049915,0.048484188],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017176447,0.00012068232,0.0026906023,0.0003008067,0.00006221182,0.00008816047,0.00029924588,0.0031877763,0.001432235,0.009929737,0.8994904,0.080680445],"study_design_scores_gemma":[0.0004513575,0.0002018099,0.00461027,0.00029520094,0.000038646933,0.00009154314,0.00016452515,0.0400278,0.004295363,0.021263955,0.9284129,0.00014649032],"about_ca_topic_score_codex":0.020290846,"about_ca_topic_score_gemma":0.021080535,"teacher_disagreement_score":0.05411932,"about_ca_system_score_codex":0.0020671545,"about_ca_system_score_gemma":0.0053298636,"threshold_uncertainty_score":0.18104714},"labels":[],"label_agreement":null},{"id":"W2806493583","doi":"","title":"The ijk System for EAL at TAC KBP 2016 Event Track.","year":2016,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Track (disk drive); Event (particle physics); Computer science; Environmental science; Operating system; Physics","score_opus":0.043996545623482534,"score_gpt":0.3575506512461208,"score_spread":0.31355410562263825,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2806493583","genre_codex":"software","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0036660272,0.00048068853,0.0893173,0.0007484788,0.00051750895,0.00044515732,0.20414643,0.6614277,0.03925073],"genre_scores_gemma":[0.06639003,0.00068257423,0.1525218,0.0008494133,0.0002821975,0.0010554438,0.631474,0.08762109,0.059123415],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99615437,0.0006443107,0.000811271,0.00078788045,0.0013275015,0.00027456423],"domain_scores_gemma":[0.9910478,0.002057617,0.00059246767,0.0036491477,0.0021177058,0.00053528463],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0045339656,0.0014877043,0.0013921016,0.006130493,0.0010181939,0.0078200055,0.003138605,0.0014423096,0.13864861],"category_scores_gemma":[0.0264033,0.0009914421,0.0008621571,0.0049381494,0.0006436203,0.008628583,0.0050360635,0.0019606955,0.1383814],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001088748,0.00015486813,0.0031893705,0.0014691968,0.00014676219,0.0002623287,0.0008712068,0.0021667168,0.0041986946,0.01067398,0.810229,0.16554919],"study_design_scores_gemma":[0.00036307197,0.00009795986,0.0044915336,0.00047119512,0.000097942764,0.00025259348,0.0005588112,0.021862378,0.011117649,0.019767256,0.9406929,0.00022683162],"about_ca_topic_score_codex":0.013572334,"about_ca_topic_score_gemma":0.01009092,"teacher_disagreement_score":0.13864861,"about_ca_system_score_codex":0.0018935844,"about_ca_system_score_gemma":0.0033315371,"threshold_uncertainty_score":0.46382582},"labels":[],"label_agreement":null},{"id":"W2806702131","doi":"","title":"UFV in the TAC 2015 Cold Start Knowledge Base Population Track.","year":2015,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Track (disk drive); Cold start (automotive); Base (topology); Population; Knowledge base; Computer science; Artificial intelligence; Mathematics; Demography; Engineering; Operating system; Sociology; Aerospace engineering","score_opus":0.11575770991222244,"score_gpt":0.402875549658632,"score_spread":0.28711783974640953,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2806702131","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07031358,0.00869688,0.3198362,0.017031653,0.003923163,0.002741384,0.3431463,0.07415797,0.16015291],"genre_scores_gemma":[0.12233723,0.0016769565,0.22623377,0.0025029485,0.0003664742,0.0014649325,0.5974634,0.004509806,0.04344446],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9906784,0.0022106222,0.0005636917,0.0014263624,0.004491359,0.00062958756],"domain_scores_gemma":[0.9593389,0.011096371,0.0014808147,0.008743809,0.01655892,0.002781269],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.019481225,0.0007630869,0.0011681748,0.0068126894,0.0022160911,0.0066726473,0.00408754,0.002237952,0.017621005],"category_scores_gemma":[0.07400408,0.0006504771,0.00075697945,0.0056946506,0.0006721985,0.009195987,0.005256539,0.002913142,0.014329061],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006821099,0.0004542445,0.011602492,0.0006304511,0.00014564095,0.0001220744,0.0008522037,0.0068364,0.0024699967,0.0240974,0.56887,0.38323697],"study_design_scores_gemma":[0.00014790436,0.00035332312,0.008732746,0.00069740985,0.000100319034,0.00013187218,0.00061825756,0.049602814,0.0070998967,0.021701451,0.910693,0.00012111824],"about_ca_topic_score_codex":0.0957199,"about_ca_topic_score_gemma":0.09786837,"teacher_disagreement_score":0.0957199,"about_ca_system_score_codex":0.0045252666,"about_ca_system_score_gemma":0.010458036,"threshold_uncertainty_score":0.1903255},"labels":[],"label_agreement":null},{"id":"W2807617704","doi":"","title":"CMU System for Entity Discovery and Linking at TAC-KBP 2015.","year":2015,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science","score_opus":0.07956800820654318,"score_gpt":0.3750757211903893,"score_spread":0.2955077129838461,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2807617704","genre_codex":"software","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005425276,0.00079495617,0.19557498,0.00093179644,0.0005485263,0.0006764265,0.1151637,0.6667832,0.014101109],"genre_scores_gemma":[0.05991913,0.00063992885,0.5089265,0.00097013573,0.00029447337,0.0019229446,0.37259114,0.0397263,0.01500939],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99513775,0.0014025387,0.0005437387,0.001045126,0.0015176792,0.00035325228],"domain_scores_gemma":[0.9880062,0.0037659102,0.00077906065,0.004458706,0.0021774098,0.0008127182],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0087109525,0.0018372263,0.001828527,0.009336407,0.0021127327,0.0053213765,0.0040408825,0.0026911164,0.051695026],"category_scores_gemma":[0.039135557,0.0013555354,0.0011800363,0.008857509,0.0008387783,0.007090793,0.0060817436,0.0030255155,0.0452172],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012921465,0.00019066343,0.0024714998,0.0011686826,0.00034132355,0.0004907991,0.0008961319,0.0027776377,0.0043784683,0.01929148,0.8081426,0.15855856],"study_design_scores_gemma":[0.0004570028,0.00013484643,0.0045922026,0.00064521184,0.0001657689,0.00054279045,0.00046822216,0.07659567,0.022272721,0.03949214,0.85433626,0.00029713346],"about_ca_topic_score_codex":0.014475813,"about_ca_topic_score_gemma":0.010764294,"teacher_disagreement_score":0.051695026,"about_ca_system_score_codex":0.0018507201,"about_ca_system_score_gemma":0.0053782896,"threshold_uncertainty_score":0.1729371},"labels":[],"label_agreement":null},{"id":"W2807916905","doi":"10.18438/eblip29416","title":"European Academic Libraries Offer or Plan to Offer Research Data Services","year":2018,"lang":"en","type":"article","venue":"Evidence Based Library and Information Practice","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Staffing; Demographics; Library science; Plan (archaeology); Computer science; Political science; Sociology; Geography","score_opus":0.44345729700962516,"score_gpt":0.4875060085835866,"score_spread":0.04404871157396145,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2807916905","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.033256277,0.06896008,0.007270943,0.12518576,0.007593825,0.0007996791,0.02213078,0.009046639,0.725756],"genre_scores_gemma":[0.18004584,0.048282277,0.026521768,0.06753781,0.0065481155,0.0009030382,0.027019689,0.002743218,0.6403983],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.97953254,0.0066941376,0.0027807448,0.0019965612,0.0058838115,0.003112284],"domain_scores_gemma":[0.9191441,0.018701114,0.010815691,0.013225704,0.020763643,0.017349817],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.021999596,0.0006388385,0.0006982773,0.005024705,0.0022595483,0.013539287,0.0024550147,0.0039876564,0.15499005],"category_scores_gemma":[0.05554465,0.0007677583,0.0011165784,0.0143532725,0.0015963985,0.016314764,0.008837805,0.0016068316,0.11002021],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00026756313,0.00020549426,0.009102502,0.0023354082,0.000070118396,0.0003796934,0.0013517853,0.00009582257,0.0008388676,0.032216158,0.5856143,0.36752233],"study_design_scores_gemma":[0.00001509652,0.000026716241,0.0033210018,0.0002970468,0.000011166127,0.000108092805,0.0005457418,0.00002994555,0.00028327646,0.0004195534,0.99492824,0.000014088543],"about_ca_topic_score_codex":0.0028122463,"about_ca_topic_score_gemma":0.0032503093,"teacher_disagreement_score":0.9864607,"about_ca_system_score_codex":0.0045576994,"about_ca_system_score_gemma":0.014304654,"threshold_uncertainty_score":0.51849335},"labels":[],"label_agreement":null},{"id":"W2807917947","doi":"10.18438/eblip29415","title":"Social Scientists’ Data Reuse Principally Influenced by Disciplinary Norms, Attitude, and Perceived Effort","year":2018,"lang":"en","type":"article","venue":"Evidence Based Library and Information Practice","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Reuse; Normative; Technology acceptance model; Survey data collection; Psychology; Social psychology; Computer science; Usability; Engineering; Political science; Mathematics; Statistics","score_opus":0.12229839151762797,"score_gpt":0.4236701941639364,"score_spread":0.3013718026463085,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2807917947","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9743508,0.002922645,0.0053410814,0.0028766284,0.00006914961,0.0000819701,0.00010864858,0.00004513856,0.014203961],"genre_scores_gemma":[0.99616134,0.0012328589,0.0015374332,0.00037653037,0.00005203217,0.000048386264,0.00007362793,0.000014323483,0.0005034172],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9758011,0.011408661,0.0020965405,0.0023651842,0.007620912,0.0007076408],"domain_scores_gemma":[0.80836356,0.11830815,0.0361864,0.011949754,0.02043782,0.0047543086],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.02450563,0.00028330882,0.00040304154,0.0044035357,0.0015405839,0.0041417275,0.0005318069,0.0007889456,0.0010324671],"category_scores_gemma":[0.11169263,0.0003210234,0.00065245514,0.0034325272,0.0034552848,0.003425244,0.0025458497,0.0010935997,0.00024281719],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00010580833,0.0002608676,0.7856892,0.0007655087,0.00049691915,0.00023211271,0.03906757,0.00031943654,0.0020021289,0.0038705734,0.0013968012,0.16579308],"study_design_scores_gemma":[0.00002961703,0.00021669369,0.9424329,0.00057686475,0.0002799247,0.0004562906,0.025287226,0.00090784294,0.002166817,0.009094219,0.018440304,0.00011135749],"about_ca_topic_score_codex":0.0028360821,"about_ca_topic_score_gemma":0.0037598065,"teacher_disagreement_score":0.9994682,"about_ca_system_score_codex":0.0014083204,"about_ca_system_score_gemma":0.0029126394,"threshold_uncertainty_score":0.12959969},"labels":[],"label_agreement":null},{"id":"W2810994727","doi":"10.4000/terminal.1964","title":"Du statut d’objet technique à celui d’objet social dans le contexte de la production automatisée d’informations journalistiques","year":2018,"lang":"fr","type":"article","venue":"Terminal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"World Federation of Science Journalists","funders":"","keywords":"Humanities; Philosophy","score_opus":0.045377497070914104,"score_gpt":0.38709924338014934,"score_spread":0.34172174630923524,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2810994727","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07660771,0.0070153573,0.75925833,0.019119184,0.0018454848,0.0026503936,0.0024735034,0.0065862024,0.12444388],"genre_scores_gemma":[0.19777998,0.0034629728,0.7596975,0.0018006059,0.0007923532,0.0020960697,0.0016338531,0.0020410682,0.030695627],"study_design_codex":"design_other","study_design_gemma":"qualitative","domain_scores_codex":[0.91949,0.043079004,0.0049671065,0.009082389,0.021444643,0.0019369905],"domain_scores_gemma":[0.6804987,0.23049751,0.01320518,0.04278361,0.030317532,0.0026974047],"candidate_categories":["sts"],"consensus_categories":[],"category_scores_codex":[0.0698763,0.0017222065,0.0013552951,0.012535361,0.0037067898,0.02400291,0.0034415545,0.004030665,0.016912028],"category_scores_gemma":[0.12948763,0.0018376495,0.0023073514,0.011211686,0.007283304,0.015030157,0.0055723633,0.004266555,0.009559024],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00058519834,0.0004101004,0.022033177,0.0054305466,0.00040238354,0.00061913504,0.044766188,0.001882402,0.029202903,0.17679228,0.015353787,0.7025218],"study_design_scores_gemma":[0.00026165045,0.0009359502,0.044232376,0.0034706916,0.00048288226,0.0019385795,0.022971494,0.014807344,0.04553445,0.120552294,0.7443798,0.000432426],"about_ca_topic_score_codex":0.0052624173,"about_ca_topic_score_gemma":0.0050856457,"teacher_disagreement_score":0.9962932,"about_ca_system_score_codex":0.0037355302,"about_ca_system_score_gemma":0.009029734,"threshold_uncertainty_score":0.36954558},"labels":[],"label_agreement":null},{"id":"W286555265","doi":"","title":"A New Method for Database Data Quality Evaluation at the Canadian Institute for Health Information (CIHI).","year":2002,"lang":"en","type":"article","venue":"ICIQ","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":22,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Data quality; Health information; Quality (philosophy); Information quality; Quality management; Health care; Information system; Computer science; Database; Medicine; Operations management; Engineering","score_opus":0.7377534273204825,"score_gpt":0.6092499060943046,"score_spread":0.12850352122617792,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W286555265","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.003194001,0.0023569409,0.95354545,0.002734999,0.00080584816,0.0072607547,0.0048153936,0.005254409,0.020032201],"genre_scores_gemma":[0.015066643,0.0005280512,0.97159135,0.0004429471,0.00009670836,0.004199434,0.002255435,0.0003518927,0.0054675727],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9026126,0.029910322,0.008203498,0.0070933434,0.050960258,0.0012199408],"domain_scores_gemma":[0.8949445,0.02912793,0.0057145683,0.010404273,0.057578776,0.0022299618],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.056038454,0.0022521506,0.0018957008,0.01807152,0.003708359,0.0080871135,0.0029152122,0.0018975928,0.013157975],"category_scores_gemma":[0.13263527,0.0013164569,0.002052487,0.011336825,0.002972437,0.0060952944,0.0058705346,0.003900845,0.0045010904],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00039648562,0.00023970129,0.007937748,0.0018431358,0.00040013756,0.00013817179,0.0016432572,0.0020848997,0.0052332813,0.04967857,0.08078118,0.8496233],"study_design_scores_gemma":[0.00088577403,0.0006523059,0.032606654,0.0030821636,0.0010841165,0.0020264743,0.00270647,0.10288622,0.024644764,0.08065592,0.7478529,0.00091626437],"about_ca_topic_score_codex":0.06538587,"about_ca_topic_score_gemma":0.07524302,"teacher_disagreement_score":0.9908764,"about_ca_system_score_codex":0.009123603,"about_ca_system_score_gemma":0.02738433,"threshold_uncertainty_score":0.29636323},"labels":[],"label_agreement":null},{"id":"W2884960754","doi":"","title":"2006-4 Nested Pseudo-likelihood Estimation and Bootstrap-based Inference for Structural Discrete Markov Decision Models","year":2006,"lang":"en","type":"article","venue":"Econstor (Econstor)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Inference; Econometrics; Markov chain; Mathematics; Statistics; Computer science; Maximum likelihood; Artificial intelligence","score_opus":0.052838607905845325,"score_gpt":0.34667005567276027,"score_spread":0.29383144776691494,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2884960754","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011390015,0.00020714283,0.9867678,0.00034176774,0.000019262894,0.000043331303,0.00007627534,0.000104495724,0.0010499414],"genre_scores_gemma":[0.4363056,0.00044863447,0.5602926,0.00023266085,0.000076328135,0.00041415016,0.00050551805,0.000101528836,0.0016229487],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98560184,0.011748181,0.00035450034,0.0005494862,0.0015347122,0.00021130334],"domain_scores_gemma":[0.91076607,0.07695651,0.0031748952,0.005415006,0.0031310418,0.0005565789],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02211466,0.00048922596,0.0012045846,0.0013367241,0.000590164,0.0020816342,0.0015291978,0.0012031404,0.0042836173],"category_scores_gemma":[0.14435968,0.00084551086,0.0011527478,0.0013973522,0.0027844103,0.0033702704,0.0026200237,0.0021020602,0.00070028857],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013906075,0.00015024772,0.007928674,0.00022720137,0.00015603325,0.00022745067,0.00033412557,0.2726529,0.00086010416,0.60788536,0.0021584067,0.10728043],"study_design_scores_gemma":[0.000029990046,0.000026020392,0.0007702298,0.00002467488,0.0000101055775,0.000040605293,0.000017247097,0.82016593,0.00045881467,0.1772552,0.0011868434,0.000014311347],"about_ca_topic_score_codex":0.0032642377,"about_ca_topic_score_gemma":0.004302919,"teacher_disagreement_score":0.02211466,"about_ca_system_score_codex":0.0019059451,"about_ca_system_score_gemma":0.0024250238,"threshold_uncertainty_score":0.11695492},"labels":[],"label_agreement":null},{"id":"W2889191855","doi":"10.23889/ijpds.v3i1.697","title":"The International Population Data Linkage Network – Banff and Beyond","year":2018,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Institute for Clinical Evaluative Sciences; University of Calgary","funders":"","keywords":"Context (archaeology); Population; NOMINATE; Public relations; Library science; Computer science; Political science; Sociology; Geography","score_opus":0.29041916002824336,"score_gpt":0.5082813043779627,"score_spread":0.21786214434971934,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2889191855","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0010177288,0.035580873,0.009071218,0.3511715,0.033706266,0.00057827187,0.07077661,0.00418022,0.4939173],"genre_scores_gemma":[0.010987113,0.035120778,0.034655824,0.15557323,0.010251308,0.0032654097,0.14836474,0.0038347973,0.59794676],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9892721,0.0028049492,0.0006258043,0.0015196006,0.004763405,0.0010141018],"domain_scores_gemma":[0.96740305,0.007341734,0.0016744396,0.0037502146,0.011717421,0.008113135],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.018201264,0.0009942998,0.0012123955,0.0047481214,0.0034861367,0.0070029064,0.003860097,0.0050156377,0.10485815],"category_scores_gemma":[0.039231442,0.0007115981,0.00061728386,0.00836569,0.0021100591,0.0066427677,0.0061854227,0.006228035,0.068708435],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000026099202,0.0000075940548,0.00031170194,0.000063378466,0.0000043016994,0.000014322475,0.000033206914,0.000020820127,0.000029456725,0.0050565787,0.9444546,0.049977865],"study_design_scores_gemma":[0.000006733784,0.0000026761702,0.00088110974,0.00023227945,0.0000022497006,0.00001759967,0.000034772987,0.000039419305,0.000026682612,0.0019415681,0.99680614,0.000008697982],"about_ca_topic_score_codex":0.10653552,"about_ca_topic_score_gemma":0.07480353,"teacher_disagreement_score":0.8934645,"about_ca_system_score_codex":0.0078085186,"about_ca_system_score_gemma":0.03689774,"threshold_uncertainty_score":0.3507855},"labels":[],"label_agreement":null},{"id":"W2889743896","doi":"10.23889/ijpds.v3i4.991","title":"Linking primary care EMR data and administrative data in Alberta, Canada: experiences, challenges, and potential solutions","year":2018,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Alberta; University of Calgary","funders":"","keywords":"Custodians; Analytics; Health care; Data collection; Medical record; Medical emergency; Medicine; Computer science; Data science; Political science","score_opus":0.37580310792389104,"score_gpt":0.4723326321179541,"score_spread":0.09652952419406308,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2889743896","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5051589,0.021184262,0.014530756,0.37995026,0.0014271507,0.0018515268,0.008789617,0.0011265212,0.065980956],"genre_scores_gemma":[0.88086927,0.013370599,0.044742387,0.03762013,0.00037891182,0.00049233984,0.006603955,0.00026406033,0.01565843],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.95289886,0.014121306,0.0031300576,0.003132605,0.016251577,0.010465501],"domain_scores_gemma":[0.91529137,0.02609307,0.004416248,0.00532065,0.03678091,0.012097623],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.044934835,0.0006473193,0.0006321869,0.0032841582,0.015122495,0.013071554,0.0062539536,0.0022660883,0.0028479495],"category_scores_gemma":[0.05712379,0.00074376556,0.00079805515,0.016167974,0.0057147956,0.0040845033,0.011073179,0.0028955552,0.00038348476],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00032347644,0.00038644674,0.3590668,0.0021571214,0.0002840789,0.005241293,0.14928478,0.002702766,0.0017264585,0.020686034,0.10180557,0.3563352],"study_design_scores_gemma":[0.000094624025,0.00025112153,0.3222133,0.003457734,0.00024503088,0.00164071,0.35988128,0.0055833636,0.0015198984,0.008530577,0.2962139,0.00036842818],"about_ca_topic_score_codex":0.9932882,"about_ca_topic_score_gemma":0.99452645,"teacher_disagreement_score":0.12610365,"about_ca_system_score_codex":0.12610365,"about_ca_system_score_gemma":0.3027486,"threshold_uncertainty_score":0.9149503},"labels":[],"label_agreement":null},{"id":"W2889869750","doi":"10.23889/ijpds.v3i4.959","title":"Public views and recommendations on the use of linked data for research: preliminary results from a public deliberation engagement","year":2018,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph; University of British Columbia","funders":"","keywords":"Deliberation; Public relations; Public engagement; Harm; Data sharing; Political science; Secrecy; Internet privacy; Sociology; Psychology; Social psychology; Computer science; Medicine; Law","score_opus":0.9500920201003664,"score_gpt":0.617412246931546,"score_spread":0.33267977316882047,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2889869750","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"evaluation","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"evaluation","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7420317,0.0010004113,0.027483648,0.13366531,0.0007393254,0.0075672674,0.0011709257,0.00042705485,0.085914336],"genre_scores_gemma":[0.92838705,0.0010561252,0.02142323,0.019299604,0.00022000886,0.011201379,0.0008774208,0.00041815772,0.017117076],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.5148937,0.4225759,0.010503238,0.0065607,0.029259505,0.016206916],"domain_scores_gemma":[0.29400775,0.6258432,0.013327246,0.017251449,0.03533745,0.014232837],"candidate_categories":["metaresearch","open_science"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3155498,0.0011399698,0.0011923312,0.0045978646,0.028111424,0.027708193,0.0050578504,0.013618639,0.010965688],"category_scores_gemma":[0.43245932,0.001526747,0.0020890725,0.0052128015,0.023538884,0.02056797,0.046552353,0.016247489,0.0023725168],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027279707,0.0007108075,0.0067411726,0.00067244103,0.000038373135,0.00076224154,0.9313374,0.0007222053,0.00045652373,0.016922774,0.009806843,0.031556442],"study_design_scores_gemma":[0.00013222509,0.00025364434,0.004392938,0.0010759439,0.000048718102,0.00015869024,0.8841478,0.0011562976,0.0011095323,0.01599531,0.091387324,0.00014148917],"about_ca_topic_score_codex":0.011456574,"about_ca_topic_score_gemma":0.00896344,"teacher_disagreement_score":0.9949421,"about_ca_system_score_codex":0.02379018,"about_ca_system_score_gemma":0.0339574,"threshold_uncertainty_score":0.844049},"labels":[],"label_agreement":null},{"id":"W2890164357","doi":"10.23889/ijpds.v3i4.683","title":"Extending follow up of randomised clinical trials by linkage to routinely collected data – results of a scoping review of the published literature","year":2018,"lang":"en","type":"review","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba; Ontario Council of University Libraries; University of Toronto","funders":"","keywords":"Linkage (software); Medicine; Record linkage; Data extraction; Protocol (science); Family medicine; MEDLINE; Data mining; Alternative medicine; Computer science; Population; Environmental health; Pathology","score_opus":0.7130505119794814,"score_gpt":0.6578263544840742,"score_spread":0.05522415749540721,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2890164357","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012307622,0.89633113,0.015950585,0.0070738215,0.002287695,0.05355487,0.0062261093,0.00022593148,0.006042251],"genre_scores_gemma":[0.084335454,0.7573673,0.049348805,0.0040737144,0.0012209428,0.096137226,0.0061322823,0.00026077722,0.0011234725],"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","domain_scores_codex":[0.5449982,0.22807433,0.1733747,0.010832883,0.03961437,0.0031055072],"domain_scores_gemma":[0.30025965,0.5039224,0.091472685,0.025442045,0.07735297,0.0015502579],"candidate_categories":["metaresearch","metaepi_broad"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3828542,0.0037431438,0.01253015,0.061558988,0.0027580159,0.0134870745,0.005067607,0.005059504,0.009067527],"category_scores_gemma":[0.6252817,0.0034358108,0.018194405,0.04619242,0.003783915,0.014331284,0.009030306,0.002708056,0.0017691895],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00052031805,0.00009095201,0.0024114668,0.8665504,0.0142529085,0.00027706078,0.0034441715,0.00054861046,0.0003914445,0.0018593755,0.0037859392,0.10586735],"study_design_scores_gemma":[0.00014763391,0.00017344489,0.0018534915,0.96545845,0.016501514,0.00011892929,0.0008106847,0.0001475631,0.00033841052,0.0010297288,0.013369208,0.00005095109],"about_ca_topic_score_codex":0.0035511793,"about_ca_topic_score_gemma":0.007961577,"teacher_disagreement_score":0.98746985,"about_ca_system_score_codex":0.0114786625,"about_ca_system_score_gemma":0.04416769,"threshold_uncertainty_score":0.76105064},"labels":[],"label_agreement":null},{"id":"W2890268673","doi":"10.23889/ijpds.v3i4.1034","title":"A New Standards-based Grammar for Linking Aggregate Datasets","year":2018,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Session (web analytics); Government (linguistics); Interoperability; Aggregate data; Computer science; Human immunodeficiency virus (HIV); Data science; World Wide Web; Medicine; Family medicine","score_opus":0.2856651451075076,"score_gpt":0.5436897848150035,"score_spread":0.2580246397074959,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2890268673","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00051191845,0.00013356039,0.98449916,0.0030014,0.0009197817,0.0005262878,0.0010385809,0.0035618246,0.005807558],"genre_scores_gemma":[0.014587163,0.00076461845,0.95537186,0.003241958,0.000656433,0.0023163187,0.006202619,0.0055814893,0.011277548],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9528223,0.022113679,0.010157656,0.005225259,0.008360218,0.0013207592],"domain_scores_gemma":[0.947476,0.025610954,0.0020341056,0.009983304,0.013652862,0.0012428688],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.044282563,0.0020023677,0.0022660377,0.0046621677,0.0046147294,0.0145245455,0.006323164,0.0064175706,0.012656456],"category_scores_gemma":[0.0556195,0.003906814,0.00534356,0.0048823813,0.0076537654,0.02988538,0.011815781,0.014735819,0.009512844],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000072656745,0.000082815255,0.0005174128,0.00054793974,0.000051941977,0.0002890448,0.0058511854,0.0033114178,0.0024391904,0.8599936,0.06549232,0.061350502],"study_design_scores_gemma":[0.000045048208,0.000057033056,0.00017032237,0.000508342,0.000044820612,0.00034411545,0.0010462924,0.014760465,0.0037536735,0.2751446,0.7039777,0.00014752956],"about_ca_topic_score_codex":0.009216186,"about_ca_topic_score_gemma":0.0073068445,"teacher_disagreement_score":0.044282563,"about_ca_system_score_codex":0.005153366,"about_ca_system_score_gemma":0.0121102845,"threshold_uncertainty_score":0.23419142},"labels":[],"label_agreement":null},{"id":"W2890622483","doi":"10.23889/ijpds.v3i4.835","title":"Establishing an International Data Linkage Repository Workgroup Toward a Benchmarking Repository","year":2018,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Workgroup; Benchmarking; Computer science; Record linkage; Linkage (software); Data science; Metadata; Field (mathematics); Custodians; Information repository; Data mining; World Wide Web; Computer data storage; Business","score_opus":0.40029979659605125,"score_gpt":0.5237836597062985,"score_spread":0.12348386311024723,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2890622483","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012751482,0.003583088,0.59296095,0.21304719,0.013674569,0.032060508,0.0116613405,0.024144653,0.09611622],"genre_scores_gemma":[0.026333442,0.0016051057,0.8492322,0.015511167,0.0033629942,0.016601346,0.0409913,0.0060941684,0.040268224],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.69341415,0.13672696,0.035200182,0.023839358,0.088720016,0.022099325],"domain_scores_gemma":[0.3017588,0.052733175,0.040255837,0.15713191,0.3478292,0.10029105],"candidate_categories":["metaresearch","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.464704,0.0033191121,0.0033777438,0.031275257,0.019840555,0.043300055,0.025794322,0.011835552,0.039960913],"category_scores_gemma":[0.3130573,0.0031238014,0.0049915663,0.025692243,0.008545894,0.048620317,0.061380867,0.018617924,0.03995765],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00046812012,0.0020892855,0.012102523,0.0019858037,0.00018230894,0.00061982643,0.006381074,0.0029042412,0.0050925543,0.1412189,0.47926435,0.3476909],"study_design_scores_gemma":[0.0001651191,0.0005455605,0.0030600016,0.0028049522,0.00007487951,0.000259125,0.0037526123,0.0041457666,0.0061686207,0.022382045,0.9563875,0.00025371474],"about_ca_topic_score_codex":0.0066242986,"about_ca_topic_score_gemma":0.004915814,"teacher_disagreement_score":0.95669997,"about_ca_system_score_codex":0.016061021,"about_ca_system_score_gemma":0.12535405,"threshold_uncertainty_score":0.66011524},"labels":[],"label_agreement":null},{"id":"W2890629418","doi":"10.23889/ijpds.v3i4.872","title":"Leveraging best practices in data governance: An organization-wide data inventory and mapping project to support a five year data strategy","year":2018,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"College of Physicians and Surgeons of Ontario","funders":"","keywords":"Data governance; Data quality; Data warehouse; Computer science; Enterprise data management; Data management; Workflow; Metadata; Data dictionary; Data element; Data virtualization; Information governance; Data science; Database; World Wide Web; Business; Information system; Engineering; Management information systems; Marketing","score_opus":0.6289315489095745,"score_gpt":0.5585743379486544,"score_spread":0.07035721096092007,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2890629418","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.77028346,0.0007090706,0.095401764,0.08736909,0.000457453,0.01644617,0.0026943577,0.0017816039,0.024856966],"genre_scores_gemma":[0.5658149,0.0007654667,0.39725634,0.00544571,0.00008118863,0.011038864,0.0054855533,0.00046349026,0.013648477],"study_design_codex":"design_other","study_design_gemma":"qualitative","domain_scores_codex":[0.95913243,0.024686903,0.0020112155,0.002197764,0.0070402203,0.0049314117],"domain_scores_gemma":[0.8915117,0.027794877,0.007386338,0.013394837,0.027565358,0.032346874],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.11663384,0.00065640634,0.00038233527,0.0030182377,0.007896907,0.012770334,0.0052659125,0.0026068564,0.0028617082],"category_scores_gemma":[0.05237505,0.0007642461,0.000620753,0.0031764568,0.0047289548,0.00722854,0.013484835,0.0041104895,0.001082625],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005032907,0.0146111,0.05433211,0.0012668429,0.00015197982,0.0018581018,0.20524573,0.0054331403,0.012961156,0.049230512,0.08710404,0.56730205],"study_design_scores_gemma":[0.0005304901,0.0050718877,0.0783915,0.0015036123,0.00010672233,0.00083039736,0.4927185,0.018362865,0.015141496,0.021916805,0.36517358,0.00025219866],"about_ca_topic_score_codex":0.015067095,"about_ca_topic_score_gemma":0.02050926,"teacher_disagreement_score":0.11663384,"about_ca_system_score_codex":0.015600151,"about_ca_system_score_gemma":0.07900103,"threshold_uncertainty_score":0.61682606},"labels":[],"label_agreement":null},{"id":"W2890912884","doi":"10.23889/ijpds.v3i4.918","title":"Population Data Science: The science of data about people","year":2018,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"Economic and Social Research Council; Medical Research Council","keywords":"Population; Data science; Computer science; Informatics; Field (mathematics); Knowledge management; Political science; Sociology","score_opus":0.455399970034002,"score_gpt":0.5671411276653473,"score_spread":0.11174115763134529,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2890912884","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011223744,0.10981875,0.44483805,0.27080107,0.012264968,0.0012651334,0.013519521,0.0013293899,0.1349393],"genre_scores_gemma":[0.3072653,0.188903,0.36162803,0.05624894,0.02435585,0.0038009875,0.01674471,0.0010314676,0.040021725],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9504332,0.02947784,0.0029919026,0.005037774,0.0113111,0.0007481158],"domain_scores_gemma":[0.86702865,0.10282027,0.005852069,0.011664385,0.010501565,0.0021331217],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.036448892,0.00082754,0.00167736,0.009553929,0.0031100444,0.016249334,0.0040622014,0.0046630776,0.014042387],"category_scores_gemma":[0.08552008,0.0007363689,0.0012317866,0.016152736,0.017249687,0.017944787,0.009696537,0.0076006884,0.004030326],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00004010064,0.000046586632,0.0050994013,0.0028347736,0.00011380897,0.00023888222,0.0038342946,0.001581459,0.00040967888,0.7347598,0.05939159,0.19164965],"study_design_scores_gemma":[0.000012141612,0.000042962783,0.0019881683,0.0032069208,0.00003793601,0.0003351836,0.0025459563,0.0017933012,0.0004892433,0.49183062,0.49765617,0.00006134581],"about_ca_topic_score_codex":0.0053154086,"about_ca_topic_score_gemma":0.0027455792,"teacher_disagreement_score":0.036448892,"about_ca_system_score_codex":0.0048693162,"about_ca_system_score_gemma":0.014835035,"threshold_uncertainty_score":0.1927625},"labels":[],"label_agreement":null},{"id":"W2891156194","doi":"10.23889/ijpds.v3i4.675","title":"Governance Challenges to Promoting Data Readiness and Data Linkage for Not-for-Profit Organizational Service Data","year":2018,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Alberta; Alberta Health Services","funders":"","keywords":"Business; Data governance; Public relations; Corporate governance; Data sharing; Information governance; Service (business); Internet privacy; Political science; Marketing; Information system; Data quality; Law","score_opus":0.5205717022128199,"score_gpt":0.5341023824725832,"score_spread":0.013530680259763339,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2891156194","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.04090387,0.003320251,0.05615365,0.8066207,0.00079125195,0.001244109,0.00050002674,0.00034794022,0.09011824],"genre_scores_gemma":[0.80007404,0.005247248,0.1197775,0.053073913,0.0010012514,0.0016911183,0.0010382663,0.00028773406,0.017808983],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"qualitative","domain_scores_codex":[0.7894927,0.13190576,0.011727958,0.01302402,0.038347334,0.015502298],"domain_scores_gemma":[0.56269246,0.24815272,0.026857592,0.042727824,0.0943266,0.025242869],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2145561,0.00040208697,0.0007819307,0.0055148154,0.021761004,0.050501,0.007401041,0.008368439,0.0061304257],"category_scores_gemma":[0.26944327,0.0012472989,0.0009280033,0.009515805,0.036821432,0.025529388,0.023113547,0.0095038125,0.001299428],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00004179636,0.00018156046,0.018400839,0.0010325848,0.00006617141,0.00087014737,0.045875,0.002334837,0.0009199449,0.7723971,0.059023514,0.09885653],"study_design_scores_gemma":[0.00004583222,0.00007401049,0.011686809,0.0031662846,0.000038804526,0.00069531624,0.09469165,0.0036427367,0.0016827899,0.36813197,0.5159833,0.00016052187],"about_ca_topic_score_codex":0.15558036,"about_ca_topic_score_gemma":0.14479043,"teacher_disagreement_score":0.2145561,"about_ca_system_score_codex":0.059669267,"about_ca_system_score_gemma":0.20925085,"threshold_uncertainty_score":0.96859217},"labels":[],"label_agreement":null},{"id":"W2891521002","doi":"10.23889/ijpds.v3i4.942","title":"Data Linkage Methods in Manitoba","year":2018,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Manitoba Health","funders":"","keywords":"Linkage (software); Computer science; Record linkage; Linked data; Data quality; Population; Data mining; Process (computing); Data science; Information retrieval; Engineering; Medicine","score_opus":0.6645466192572466,"score_gpt":0.6439882190382802,"score_spread":0.020558400218966377,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2891521002","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05295418,0.062114578,0.54971504,0.040881023,0.0022998063,0.0055669947,0.020482516,0.0053809322,0.26060492],"genre_scores_gemma":[0.2138007,0.028503899,0.62869453,0.004747255,0.00045154628,0.0067624515,0.013977085,0.0009625852,0.10209994],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9786962,0.01415171,0.0012097848,0.0018714991,0.003475344,0.0005954709],"domain_scores_gemma":[0.97406703,0.012109973,0.0015239926,0.0018657191,0.0098370565,0.0005961416],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.025363117,0.0009038812,0.0009333627,0.0063771014,0.0055943322,0.005449585,0.0037806716,0.0016813682,0.023168461],"category_scores_gemma":[0.04900607,0.0011059553,0.0010802714,0.017297938,0.0020850792,0.0020644688,0.005988513,0.0021685408,0.0027397221],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018635568,0.00022628398,0.029410852,0.0019700483,0.00037580778,0.0011879896,0.009226262,0.014644963,0.0005983051,0.27082127,0.099659614,0.5716922],"study_design_scores_gemma":[0.000099592144,0.00011685695,0.029130043,0.003199402,0.00014686376,0.00069207203,0.006241811,0.029634075,0.0010492126,0.07578082,0.85374135,0.00016798396],"about_ca_topic_score_codex":0.5125136,"about_ca_topic_score_gemma":0.48089227,"teacher_disagreement_score":0.48748642,"about_ca_system_score_codex":0.024598004,"about_ca_system_score_gemma":0.049000766,"threshold_uncertainty_score":0.9807147},"labels":[],"label_agreement":null},{"id":"W2891566313","doi":"10.23889/ijpds.v3i4.749","title":"Ligo: An Open Source Application for the Management and Execution of Administrative Data Linkage","year":2018,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Computer science; Python (programming language); Probabilistic logic; Population; Plug-in; Cloud computing; Interface (matter); Data science; Data mining; Software engineering; Programming language; Artificial intelligence; Operating system","score_opus":0.5482114767746085,"score_gpt":0.5869358928333936,"score_spread":0.03872441605878518,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2891566313","genre_codex":"software","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":"software","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0021167104,0.00025564502,0.16664645,0.0008797529,0.00034017753,0.00069769187,0.020750621,0.7944811,0.013831813],"genre_scores_gemma":[0.041887295,0.0008182593,0.39770406,0.0033275078,0.00044308015,0.0037409465,0.17548555,0.33149132,0.04510197],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9954857,0.0008243493,0.00044789183,0.00080478,0.002000207,0.0004371102],"domain_scores_gemma":[0.99362,0.002134194,0.0005801105,0.0015803741,0.0011688698,0.0009163817],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0072883973,0.0021431749,0.0013487559,0.0032041962,0.0013451217,0.00510525,0.004263084,0.0018440491,0.08399982],"category_scores_gemma":[0.017362855,0.0018796766,0.002635227,0.0023586338,0.00148433,0.005952254,0.010127132,0.0038148707,0.066345654],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010805668,0.00028052705,0.006170245,0.0011148623,0.00029491298,0.00077580387,0.0008463157,0.0045224647,0.006558959,0.01315874,0.80834347,0.15685305],"study_design_scores_gemma":[0.000486686,0.00011532762,0.0063588456,0.00046838878,0.00007828764,0.00052502897,0.00019225001,0.037366953,0.012441428,0.025173437,0.91637236,0.00042097116],"about_ca_topic_score_codex":0.0043641655,"about_ca_topic_score_gemma":0.0034670774,"teacher_disagreement_score":0.08399982,"about_ca_system_score_codex":0.0018184391,"about_ca_system_score_gemma":0.0037839492,"threshold_uncertainty_score":0.28100735},"labels":[],"label_agreement":null},{"id":"W2892008580","doi":"10.23889/ijpds.v3i4.947","title":"Meeting the challenge of data linkage for special populations","year":2018,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Linkage (software); Record linkage; Population; Christian ministry; Medical record; Identifier; Unique identifier; Medicine; Data set; Demography; Computer science; Statistics; Biology; Environmental health; Genetics; Surgery; Mathematics; Political science; Law","score_opus":0.6449232329171355,"score_gpt":0.5775271401239062,"score_spread":0.06739609279322933,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2892008580","genre_codex":"commentary","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011139828,0.018185532,0.37226704,0.562827,0.00744863,0.0016896807,0.0044964533,0.0017109602,0.020234907],"genre_scores_gemma":[0.13722274,0.016466308,0.6867462,0.12024065,0.013406117,0.010971282,0.005492452,0.0015791544,0.007875133],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.60489845,0.30916265,0.01811467,0.019472709,0.045294385,0.0030570824],"domain_scores_gemma":[0.28579405,0.5373084,0.02554876,0.072783284,0.07261813,0.00594741],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.39745495,0.0011983389,0.003489166,0.0072568497,0.0067883725,0.012838336,0.008275921,0.0069613727,0.009171898],"category_scores_gemma":[0.5828116,0.0017976587,0.002811034,0.009733286,0.010982166,0.01524812,0.017729422,0.015385887,0.003565166],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00024928217,0.00011922993,0.021942306,0.0043967296,0.0009917297,0.0006013404,0.0118557,0.0031594266,0.000522275,0.19358218,0.20381042,0.55876946],"study_design_scores_gemma":[0.00014793989,0.00020661637,0.013109361,0.008466489,0.00030892878,0.0017585184,0.0053979894,0.008612872,0.0010282587,0.50190985,0.45878148,0.00027164223],"about_ca_topic_score_codex":0.012420439,"about_ca_topic_score_gemma":0.008794928,"teacher_disagreement_score":0.602545,"about_ca_system_score_codex":0.009400393,"about_ca_system_score_gemma":0.029854123,"threshold_uncertainty_score":0.74304533},"labels":[],"label_agreement":null},{"id":"W2892138780","doi":"10.23889/ijpds.v3i4.999","title":"Perspectives on Linkage Involving Indigenous data","year":2018,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University nuhelot'ine thaiyots'i nistameyimâkanak Blue Quills; Providence Health Care; Laurentian University","funders":"","keywords":"Indigenous; Sovereignty; Population; Metis; Political science; Sociology; Geography; Public relations; Law; Politics; Database","score_opus":0.46462911489124337,"score_gpt":0.5578686461454321,"score_spread":0.09323953125418871,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2892138780","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015815495,0.00793939,0.01197959,0.8793135,0.0038515052,0.00013307558,0.00023081695,0.00006341434,0.080673136],"genre_scores_gemma":[0.6099056,0.028048564,0.022386268,0.2860904,0.005687667,0.0009991294,0.00055462425,0.000545758,0.04578202],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.7153752,0.22156908,0.007961627,0.010819198,0.030137926,0.014137025],"domain_scores_gemma":[0.7387702,0.2080128,0.005819225,0.011334221,0.024754906,0.011308589],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.25259545,0.0009514349,0.0016823668,0.0050996877,0.060363032,0.03781702,0.008401811,0.022737551,0.011585693],"category_scores_gemma":[0.17360622,0.0015939395,0.002842933,0.011648185,0.06586896,0.054318357,0.04668772,0.03075534,0.0013170512],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00002168889,0.000021563985,0.00078447774,0.00038102322,0.000023211267,0.00069888076,0.7385135,0.00012165604,0.00017479685,0.22662772,0.022819512,0.009812091],"study_design_scores_gemma":[0.000012716262,0.000027335109,0.00051654584,0.0014965384,0.00002934716,0.0006275864,0.4613606,0.00021695954,0.00018951505,0.06278883,0.4726608,0.00007328843],"about_ca_topic_score_codex":0.1000229,"about_ca_topic_score_gemma":0.05520758,"teacher_disagreement_score":0.25259545,"about_ca_system_score_codex":0.033935055,"about_ca_system_score_gemma":0.06347144,"threshold_uncertainty_score":0.9216829},"labels":[],"label_agreement":null},{"id":"W2894874337","doi":"10.1145/3209280.3232788","title":"The Quest for Total Recall","year":2018,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Due diligence; Recall; Computer science; Categorization; Precision and recall; Haystack; Information retrieval; Government (linguistics); Enforcement; Data science; Knowledge management; Business; Psychology; Political science; World Wide Web; Finance; Artificial intelligence","score_opus":0.316517329864422,"score_gpt":0.5082093572738737,"score_spread":0.19169202740945174,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2894874337","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.028103946,0.1850534,0.5779976,0.080171615,0.005841923,0.0010049467,0.009215909,0.0022840763,0.11032654],"genre_scores_gemma":[0.4681794,0.05124619,0.4079363,0.03251768,0.011317095,0.0031497863,0.009101033,0.0015213218,0.015031292],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.8718408,0.062884,0.014169404,0.023854535,0.025699025,0.0015522294],"domain_scores_gemma":[0.6161007,0.29836565,0.011723904,0.04459889,0.027694767,0.0015160701],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.11370964,0.0027632865,0.0059032147,0.014453291,0.002651894,0.015566472,0.0058796303,0.0053968853,0.0072436673],"category_scores_gemma":[0.38960215,0.0019244519,0.003058506,0.012449419,0.009415604,0.03133532,0.0071892766,0.006739925,0.004825179],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007982983,0.00016426282,0.020140821,0.007309707,0.003303614,0.00021202117,0.0023508344,0.0067257923,0.0011025965,0.36871794,0.06411133,0.5250627],"study_design_scores_gemma":[0.00011570973,0.0003015515,0.005455529,0.0018247835,0.00062547793,0.0006067644,0.00077382824,0.009637804,0.001127823,0.90826476,0.07109377,0.00017216546],"about_ca_topic_score_codex":0.0049632858,"about_ca_topic_score_gemma":0.003782186,"teacher_disagreement_score":0.11370964,"about_ca_system_score_codex":0.005493618,"about_ca_system_score_gemma":0.0057245498,"threshold_uncertainty_score":0.6013613},"labels":[],"label_agreement":null},{"id":"W2894983428","doi":"10.1109/tkde.2018.2874004","title":"Precise and Fast Cryptanalysis for Bloom Filter Based Privacy-Preserving Record Linkage","year":2018,"lang":"en","type":"article","venue":"IEEE Transactions on Knowledge and Data Engineering","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":56,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"Australian Research Council; Engineering and Physical Sciences Research Council; Simons Foundation","keywords":"Bloom filter; Computer science; Cryptanalysis; Encoding (memory); Scalability; Data mining; Filter (signal processing); Information retrieval; Algorithm; Database; Cryptography; Artificial intelligence","score_opus":0.1370625278578638,"score_gpt":0.37971452956261115,"score_spread":0.24265200170474735,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2894983428","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.053670228,0.0011564286,0.93291837,0.0013077316,0.00016936584,0.00040641078,0.00043109464,0.005563008,0.004377346],"genre_scores_gemma":[0.60878927,0.00066187157,0.38399288,0.0007536131,0.00011605849,0.0003894629,0.0005912464,0.00026634012,0.0044392203],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.98273164,0.0041718516,0.0014913304,0.0015650995,0.008570208,0.0014699552],"domain_scores_gemma":[0.97553205,0.009919424,0.0029100336,0.008930675,0.002313276,0.00039457832],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0058503766,0.0011087719,0.0015724772,0.002319164,0.0019806148,0.0036092966,0.0020599675,0.0024197786,0.002685955],"category_scores_gemma":[0.020873755,0.00075357145,0.0014360716,0.0032750256,0.00231772,0.009522171,0.0042148833,0.0031712595,0.0018672941],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0030544922,0.0007620446,0.0080675045,0.00074311305,0.0005532136,0.0010433979,0.0015084903,0.090854764,0.121162124,0.1693958,0.016214095,0.58664095],"study_design_scores_gemma":[0.00028435787,0.00062128337,0.0013921655,0.00021581218,0.0001726644,0.002172864,0.00038320458,0.6150941,0.20786297,0.14529003,0.026274124,0.00023637229],"about_ca_topic_score_codex":0.0012071242,"about_ca_topic_score_gemma":0.0008897713,"teacher_disagreement_score":0.0058503766,"about_ca_system_score_codex":0.003027432,"about_ca_system_score_gemma":0.0039812033,"threshold_uncertainty_score":0.030940115},"labels":[],"label_agreement":null},{"id":"W2895460691","doi":"10.32920/24132891","title":"Integrity Proofs for RDF Graphs","year":2023,"lang":"en","type":"preprint","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; RDF; Merkle tree; Mathematical proof; Data integrity; Hash function; Construct (python library); SPARQL; Theoretical computer science; Data mining; Information retrieval; Semantic Web; Database; Programming language; Cryptographic hash function; Mathematics","score_opus":0.660765239254517,"score_gpt":0.5361311141273202,"score_spread":0.12463412512719685,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2895460691","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0064050104,0.00053734385,0.98026913,0.0020985205,0.0001580562,0.00038083555,0.0017056442,0.0030455296,0.0053999056],"genre_scores_gemma":[0.28375423,0.0015828821,0.69843376,0.0016589104,0.00055745116,0.0007490709,0.006574471,0.0013424832,0.005346713],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9738321,0.009276175,0.0021881983,0.0024516757,0.01139503,0.0008568814],"domain_scores_gemma":[0.9184689,0.044062436,0.006434709,0.021834493,0.008348246,0.00085117156],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011828817,0.0010588025,0.000846523,0.0037472055,0.0021602323,0.0056915144,0.0023490721,0.0020681925,0.008079804],"category_scores_gemma":[0.07910376,0.0008252104,0.0020734842,0.0032761903,0.0032886425,0.015473102,0.0051082517,0.0039011734,0.0019947344],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00028167135,0.0001842587,0.0022619325,0.00089131127,0.00020695777,0.00048628822,0.0005716803,0.069017775,0.0059326165,0.6133028,0.024882682,0.28198013],"study_design_scores_gemma":[0.00006316491,0.00008314407,0.0003717894,0.00022913615,0.000049832586,0.00051172625,0.0002277673,0.19558963,0.015313543,0.7454111,0.042090688,0.000058499718],"about_ca_topic_score_codex":0.0025641164,"about_ca_topic_score_gemma":0.0022331986,"teacher_disagreement_score":0.011828817,"about_ca_system_score_codex":0.002668137,"about_ca_system_score_gemma":0.0039064353,"threshold_uncertainty_score":0.06255758},"labels":[],"label_agreement":null},{"id":"W2897914812","doi":"10.48550/arxiv.1810.04361","title":"Semi-supervised clustering for de-duplication","year":2018,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Cluster analysis; Oracle; Correlation clustering; Computer science; Graph; Cluster (spacecraft); Combinatorics; Complete-linkage clustering; Data mining; Mathematics; Theoretical computer science; Pattern recognition (psychology); CURE data clustering algorithm; Artificial intelligence","score_opus":0.3552284649169554,"score_gpt":0.3098680257081865,"score_spread":0.04536043920876892,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2897914812","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.020162411,0.0013116762,0.9720228,0.0010611349,0.00011206471,0.00020282177,0.0010596124,0.0019161007,0.0021512965],"genre_scores_gemma":[0.44324753,0.0012464419,0.5369131,0.0011659795,0.00047211253,0.00063140097,0.008164669,0.00096397876,0.0071947523],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9923652,0.0022579832,0.00039732055,0.0028319054,0.0017694355,0.00037813652],"domain_scores_gemma":[0.983067,0.0068724877,0.001913469,0.005270025,0.0024012986,0.00047560182],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005017576,0.0019066556,0.0040567783,0.002885619,0.0022937462,0.0021820322,0.0063153757,0.004064401,0.0032446554],"category_scores_gemma":[0.01931199,0.0014422595,0.002447371,0.0042850818,0.003167853,0.005378317,0.0036660887,0.004119574,0.0022071714],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00067518174,0.00039730838,0.004377104,0.001034761,0.0006085503,0.00040577486,0.0008592934,0.6955331,0.005487765,0.06856941,0.0347449,0.18730678],"study_design_scores_gemma":[0.00002971874,0.00006552508,0.00061742135,0.00003866861,0.000032127675,0.00016035735,0.00010080602,0.919986,0.0016984611,0.073459774,0.0037757186,0.000035439196],"about_ca_topic_score_codex":0.004741231,"about_ca_topic_score_gemma":0.0067754667,"teacher_disagreement_score":0.0063153757,"about_ca_system_score_codex":0.0036681653,"about_ca_system_score_gemma":0.0028408815,"threshold_uncertainty_score":0.026614487},"labels":[],"label_agreement":null},{"id":"W2899051575","doi":"10.1109/pst.2018.8514187","title":"Managing Publicly Known Security Vulnerabilities in Software Systems","year":2018,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Secure coding; Computer science; Vulnerability management; Security bug; Computer security; NIST; Software security assurance; Vulnerability (computing); Software system; Software; Context (archaeology); Backporting; Software development; Software engineering; Component-based software engineering; Vulnerability assessment; Information security; Security service; Operating system","score_opus":0.12740275896242967,"score_gpt":0.39009731930467745,"score_spread":0.2626945603422478,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2899051575","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.596619,0.00660271,0.31323147,0.004715921,0.0002747668,0.0010941942,0.05790928,0.013043048,0.0065096],"genre_scores_gemma":[0.76432806,0.0016346509,0.19011298,0.00031192787,0.00023372912,0.00036809084,0.04156254,0.00018014999,0.001267941],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99055594,0.0010558312,0.0020224042,0.0027061403,0.003207074,0.0004526863],"domain_scores_gemma":[0.9595946,0.017525224,0.01142001,0.0070354156,0.0037678776,0.0006568528],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004880804,0.001239578,0.0017007961,0.019778641,0.0012530665,0.004217796,0.0024352483,0.0024837377,0.0007345176],"category_scores_gemma":[0.03743148,0.0007406662,0.0013258385,0.011964457,0.0007939753,0.008466849,0.0032062011,0.0019302388,0.001024523],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00052524084,0.0006723227,0.35953844,0.0016045246,0.00064894435,0.0017217025,0.0019013431,0.039185207,0.018455781,0.006429892,0.018375527,0.55094117],"study_design_scores_gemma":[0.00005052171,0.00032229145,0.14509141,0.00067267724,0.00042172332,0.002431771,0.0021700894,0.7219621,0.04822908,0.040496055,0.037934657,0.00021770406],"about_ca_topic_score_codex":0.0060598045,"about_ca_topic_score_gemma":0.00909147,"teacher_disagreement_score":0.019778641,"about_ca_system_score_codex":0.0015372693,"about_ca_system_score_gemma":0.0023473753,"threshold_uncertainty_score":0.025812447},"labels":[],"label_agreement":null},{"id":"W2899225985","doi":"10.5267/j.uscm.2018.7.004","title":"Integration between open records and target cost to effectively manage supply chain costs","year":2018,"lang":"en","type":"article","venue":"Uncertain Supply Chain Management","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Supply chain; Business; Chain (unit); Supply chain risk management; Computer science; Risk analysis (engineering); Operations management; Supply chain management; Process management; Marketing; Service management; Economics","score_opus":0.08179337785974011,"score_gpt":0.3845704567543373,"score_spread":0.3027770788945972,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2899225985","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6328794,0.004596481,0.25792402,0.010285231,0.00020782801,0.0017350968,0.0016044113,0.00059578917,0.09017176],"genre_scores_gemma":[0.90284896,0.0012722238,0.09245312,0.00017767765,0.00009303071,0.00026993031,0.0005112358,0.000035320547,0.0023385144],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9838037,0.0059087714,0.0016244776,0.00073169044,0.007291671,0.0006396926],"domain_scores_gemma":[0.9469469,0.026664019,0.010777273,0.0032213232,0.01151324,0.00087725965],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008781861,0.00043287897,0.0005556997,0.0059842714,0.001197599,0.0068520443,0.0009466611,0.00057916745,0.0030899034],"category_scores_gemma":[0.034271117,0.00030998894,0.00053213723,0.0093916,0.00081395236,0.009404932,0.0022955844,0.001125571,0.0003418799],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002086918,0.0008375454,0.20293736,0.0012983204,0.00032262303,0.00023631286,0.0053363177,0.009677814,0.00254088,0.040911917,0.0040750634,0.7316173],"study_design_scores_gemma":[0.00013418695,0.0014770472,0.6663809,0.002906137,0.0009991127,0.0009366571,0.04099068,0.10609943,0.010449415,0.07854717,0.090597026,0.00048230405],"about_ca_topic_score_codex":0.0057612574,"about_ca_topic_score_gemma":0.008085717,"teacher_disagreement_score":0.008781861,"about_ca_system_score_codex":0.0032445553,"about_ca_system_score_gemma":0.005684357,"threshold_uncertainty_score":0.046443522},"labels":[],"label_agreement":null},{"id":"W2900691829","doi":"10.1109/tkde.2019.2893175","title":"Similarity Join and Similarity Self-Join Size Estimation in a Streaming Environment","year":2019,"lang":"en","type":"article","venue":"IEEE Transactions on Knowledge and Data Engineering","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Similarity (geometry); Join (topology); Nearest neighbor search; Sublinear function; Range (aeronautics); Unary operation; Range query (database)","score_opus":0.0592414764365441,"score_gpt":0.3250866367617011,"score_spread":0.265845160325157,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2900691829","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.047567494,0.0004829929,0.9491134,0.00028032536,0.000044498636,0.0001116269,0.00023746361,0.0013058401,0.0008562581],"genre_scores_gemma":[0.43471354,0.00028601004,0.56121,0.00013822303,0.0001887246,0.0002016174,0.0009646149,0.00021675571,0.002080584],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9942122,0.0010398199,0.0004404968,0.001688699,0.0022493945,0.00036928325],"domain_scores_gemma":[0.9821284,0.009946557,0.002174752,0.003043858,0.002110787,0.0005956065],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0041529136,0.0009851683,0.0020901682,0.0017388882,0.0010789077,0.0022823177,0.0033865694,0.0020527402,0.0019662366],"category_scores_gemma":[0.019717285,0.0007387457,0.0009365455,0.0026294535,0.0012427068,0.0055075292,0.0024820983,0.0013732433,0.00075404235],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014065789,0.00056704896,0.017652959,0.0005180104,0.00023324588,0.00046192223,0.0008489854,0.5072699,0.03632749,0.03151319,0.0075609875,0.39563966],"study_design_scores_gemma":[0.00002279194,0.00010995819,0.0012937561,0.000008085674,0.000016264374,0.00024692932,0.00009774821,0.9790693,0.00925255,0.008690711,0.0011734748,0.000018417684],"about_ca_topic_score_codex":0.0028873314,"about_ca_topic_score_gemma":0.0023160283,"teacher_disagreement_score":0.0041529136,"about_ca_system_score_codex":0.0011724517,"about_ca_system_score_gemma":0.0015433817,"threshold_uncertainty_score":0.02196294},"labels":[],"label_agreement":null},{"id":"W2901302597","doi":"10.23889/ijpds.v3i5.1045","title":"Administrative Data Format Standardization for Efficient Analytics","year":2018,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Statistics Canada","funders":"","keywords":"Computer science; Standardization; Data quality; Data management; Data science; Data pre-processing; Metadata; Data governance; Data processing; Data warehouse; Database; Data mining; World Wide Web; Engineering","score_opus":0.5881116757594165,"score_gpt":0.5992713194419055,"score_spread":0.011159643682489007,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2901302597","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0046124402,0.0010846143,0.8909556,0.0069747004,0.002066764,0.0021774208,0.018765055,0.01121278,0.062150776],"genre_scores_gemma":[0.040809747,0.0024389138,0.8876351,0.0027226852,0.0009777631,0.0030251886,0.043119628,0.003653073,0.015617794],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9677203,0.010354599,0.008663129,0.0032754054,0.0088349795,0.001151529],"domain_scores_gemma":[0.87897474,0.014608324,0.007438101,0.06359694,0.033917204,0.001464702],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.038383473,0.0013750867,0.0011864557,0.007259388,0.0025381348,0.017621541,0.0056595327,0.0020984046,0.012816036],"category_scores_gemma":[0.08196423,0.0013456258,0.0020388423,0.016163955,0.0024581733,0.015445842,0.007769423,0.0061306003,0.013826656],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000141441,0.00019247703,0.0040985765,0.000869564,0.00007554391,0.00025522846,0.0014627897,0.006089345,0.0043172054,0.60632634,0.16783363,0.20833789],"study_design_scores_gemma":[0.000034271667,0.00005705681,0.0017025288,0.00062169903,0.000041772608,0.00023748974,0.00069058145,0.0071870736,0.008791556,0.059599824,0.92093873,0.00009739265],"about_ca_topic_score_codex":0.008941055,"about_ca_topic_score_gemma":0.0040361085,"teacher_disagreement_score":0.038383473,"about_ca_system_score_codex":0.004294088,"about_ca_system_score_gemma":0.017227245,"threshold_uncertainty_score":0.20299363},"labels":[],"label_agreement":null},{"id":"W2901674170","doi":"10.1186/s40965-018-0058-3","title":"The conceptual schema in geospatial data standard design with application to GroundWaterML2","year":2018,"lang":"en","type":"article","venue":"Open Geospatial Data Software and Standards","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Geological Survey of Canada","funders":"Bureau de Recherches Géologiques et Minières; U.S. Geological Survey; Natural Resources Canada; Muséum National d'Histoire Naturelle; Universität Salzburg; Institut Français de Recherche pour l'Exploitation de la Mer","keywords":"Geospatial analysis; Conceptual schema; Schema (genetic algorithms); Computer science; Data mining; Data science; Database; Information retrieval; Geography; Remote sensing","score_opus":0.21380253530369708,"score_gpt":0.4468257726292829,"score_spread":0.23302323732558583,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2901674170","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0023129787,0.000046195753,0.99564797,0.00029693783,0.000031088097,0.00024761388,0.000073285046,0.0003460059,0.0009980373],"genre_scores_gemma":[0.015569687,0.00004812875,0.9833456,0.000084360305,0.00001101105,0.00030157564,0.00015685278,0.0001382291,0.00034447273],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.95102596,0.028452953,0.0055692936,0.0034502326,0.010806318,0.00069533684],"domain_scores_gemma":[0.93233484,0.031048255,0.004831306,0.013132074,0.017555855,0.0010977319],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.059196927,0.000993034,0.0005492278,0.0028668833,0.0012352031,0.0052436497,0.0027112516,0.002179241,0.0035322239],"category_scores_gemma":[0.082745135,0.0015858994,0.0017026366,0.002839165,0.0040511084,0.007105604,0.004187939,0.0032751223,0.001007472],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00023659323,0.00023621382,0.005032382,0.0009195351,0.00012745708,0.0003018843,0.0038928848,0.02243867,0.009382197,0.7326998,0.0056443163,0.21908808],"study_design_scores_gemma":[0.00048047566,0.00072154944,0.0019657079,0.0011693984,0.00029519352,0.0011007579,0.0018896377,0.24814558,0.054297023,0.36404833,0.3256234,0.0002629056],"about_ca_topic_score_codex":0.002506593,"about_ca_topic_score_gemma":0.0030145682,"teacher_disagreement_score":0.059196927,"about_ca_system_score_codex":0.0022049274,"about_ca_system_score_gemma":0.006212101,"threshold_uncertainty_score":0.31306708},"labels":[],"label_agreement":null},{"id":"W2905047743","doi":"10.18438/eblip29478","title":"Research Support Priorities of and Relationships among Librarians and Research Administrators: A Content Analysis of the Professional Literature","year":2018,"lang":"en","type":"article","venue":"Evidence Based Library and Information Practice","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"University of Regina","funders":"Canadian Association of Research Libraries; Association of Research Libraries","keywords":"Content analysis; Thematic analysis; Library science; Coding (social sciences); Sociology; Psychology; Qualitative research; Computer science; Social science","score_opus":0.38705307610005246,"score_gpt":0.48127285290946137,"score_spread":0.0942197768094089,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2905047743","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9672098,0.0050684763,0.0050617494,0.0063204234,0.00018002566,0.001066725,0.00079038256,0.00004504824,0.014257387],"genre_scores_gemma":[0.9792142,0.0043312293,0.012219422,0.0009574523,0.0001313769,0.0012753892,0.0006337545,0.000039223825,0.0011979705],"study_design_codex":"qualitative","study_design_gemma":"observational","domain_scores_codex":[0.97126645,0.013903947,0.00494268,0.0018817098,0.0066808993,0.0013243194],"domain_scores_gemma":[0.8184853,0.13615033,0.014427428,0.0024548292,0.025772141,0.0027099361],"candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.039297815,0.00034504785,0.0007976571,0.030239515,0.005722191,0.01170145,0.001512021,0.0014073397,0.0021048868],"category_scores_gemma":[0.13381083,0.0006620024,0.0006525609,0.0250174,0.005255276,0.009488936,0.006464847,0.001213889,0.00036292948],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017794993,0.00015902406,0.09393164,0.0048820097,0.00014438173,0.00067571946,0.75245214,0.00019190599,0.0023119147,0.012514851,0.003278583,0.12927982],"study_design_scores_gemma":[0.000022490463,0.00009065014,0.04958112,0.003539455,0.00010671595,0.00031506107,0.91648066,0.0005578244,0.00082014024,0.0031271959,0.025305346,0.00005335449],"about_ca_topic_score_codex":0.004307021,"about_ca_topic_score_gemma":0.0045020734,"teacher_disagreement_score":0.9697605,"about_ca_system_score_codex":0.010618197,"about_ca_system_score_gemma":0.019889353,"threshold_uncertainty_score":0.20782924},"labels":[],"label_agreement":null},{"id":"W2905078980","doi":"10.2196/10436","title":"Where No Universal Health Care Identifier Exists: Comparison and Determination of the Utility of Score-Based Persons Matching Algorithms Using Demographic Data","year":2018,"lang":"en","type":"article","venue":"JMIR Public Health and Surveillance","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Matching (statistics); Computer science; Health care; Identifier; Data mining; Statistics; Medicine; Algorithm; Mathematics","score_opus":0.23936289667713462,"score_gpt":0.4463407364047887,"score_spread":0.2069778397276541,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2905078980","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.78456146,0.001484396,0.2057396,0.0006175462,0.000119139455,0.0009584694,0.001327702,0.0007860993,0.004405559],"genre_scores_gemma":[0.79103,0.0004231819,0.20587386,0.00013935455,0.00003406394,0.0004906878,0.0015155673,0.00008954682,0.00040377182],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.95801836,0.030172633,0.002830414,0.003990686,0.004243488,0.0007443204],"domain_scores_gemma":[0.848611,0.12933792,0.007797851,0.006787405,0.006836902,0.00062888424],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.053819288,0.00060653803,0.0009808966,0.0051442627,0.0009610613,0.0022780588,0.0018170998,0.001447251,0.0010993901],"category_scores_gemma":[0.1729817,0.00041713918,0.0012913457,0.0042318706,0.0009579737,0.0032360277,0.0026475578,0.00091155694,0.00033748665],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.003281039,0.0007699581,0.48411095,0.00079902523,0.0018447555,0.000104179744,0.0011905732,0.08911798,0.0011846608,0.016442697,0.0027244564,0.3984297],"study_design_scores_gemma":[0.00038924138,0.0017649925,0.10431838,0.00026796546,0.0005682478,0.00038953326,0.0013655797,0.87127686,0.0033668468,0.013186981,0.002989388,0.00011600443],"about_ca_topic_score_codex":0.0073698675,"about_ca_topic_score_gemma":0.00509475,"teacher_disagreement_score":0.053819288,"about_ca_system_score_codex":0.0016901982,"about_ca_system_score_gemma":0.002419728,"threshold_uncertainty_score":0.28462696},"labels":[],"label_agreement":null},{"id":"W2911562225","doi":"","title":"Proceedings of third international workshop on MapReduce and its Applications Date","year":2012,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Variety (cybernetics); Computer science; Data science; Cover (algebra); Pleasure; World Wide Web; Software engineering; Engineering; Artificial intelligence","score_opus":0.20678318828991238,"score_gpt":0.43681681384126736,"score_spread":0.23003362555135498,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2911562225","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017516693,0.065395735,0.32779682,0.05971689,0.20069988,0.00123529,0.006159935,0.006961915,0.31451684],"genre_scores_gemma":[0.055068024,0.03708623,0.11122609,0.005330458,0.025857888,0.0006223316,0.014853152,0.004128991,0.74582684],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99785584,0.00044208206,0.00013749897,0.00036514318,0.0009209968,0.00027850832],"domain_scores_gemma":[0.99626154,0.00049364957,0.0000813795,0.0004572303,0.0015843927,0.0011218056],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0039993473,0.0012070973,0.0011046329,0.0014819002,0.0013720049,0.0059175924,0.0020663913,0.0015971968,0.061146505],"category_scores_gemma":[0.004780437,0.00055065384,0.0013963558,0.0016658478,0.00064036273,0.003963294,0.003135335,0.0037016072,0.03185571],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021572586,0.00017212424,0.00045779013,0.00032476982,0.000046130684,0.00018959396,0.00029609568,0.0010567595,0.0029179207,0.008812181,0.76513976,0.22037126],"study_design_scores_gemma":[0.000013940659,0.00006116862,0.00051884004,0.00011484823,0.000016351292,0.00016299378,0.00014467452,0.0015583092,0.0014549654,0.004999985,0.99093235,0.000021616708],"about_ca_topic_score_codex":0.0030840852,"about_ca_topic_score_gemma":0.0048781503,"teacher_disagreement_score":0.061146505,"about_ca_system_score_codex":0.0010920308,"about_ca_system_score_gemma":0.002887746,"threshold_uncertainty_score":0.20455539},"labels":[],"label_agreement":null},{"id":"W2913052408","doi":"","title":"Proceedings of the 10th IEEE international conference on Information Reuse & Integration","year":2009,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Reuse; Computer science; Engineering","score_opus":0.21812931853070847,"score_gpt":0.4171971717500172,"score_spread":0.19906785321930873,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2913052408","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.06015041,0.051944703,0.53693295,0.028369714,0.037705906,0.0009568454,0.0013099696,0.0038367189,0.27879286],"genre_scores_gemma":[0.25396064,0.038295895,0.21915998,0.0037856894,0.007301765,0.00043387315,0.007185368,0.0014156455,0.46846113],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99683434,0.0008327062,0.00026115123,0.00028247442,0.0013495495,0.00043971292],"domain_scores_gemma":[0.993425,0.0012256501,0.00016027,0.0012499944,0.0032144831,0.0007246223],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0069485353,0.0008578827,0.0017071571,0.0021819377,0.0017914821,0.008577181,0.0015930451,0.0018690936,0.040630847],"category_scores_gemma":[0.006351067,0.0005231183,0.0013577181,0.0028293298,0.0015126452,0.0053618792,0.0027205804,0.0021396554,0.010588863],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006223997,0.0007479823,0.005278957,0.00044071992,0.00028529143,0.0003557008,0.000714017,0.0016396515,0.0077526704,0.037018526,0.2730465,0.67209756],"study_design_scores_gemma":[0.000058193305,0.00024308429,0.0063011595,0.00040175865,0.0003044375,0.00067264144,0.0010543789,0.023620822,0.012432848,0.035639856,0.9191838,0.000087209504],"about_ca_topic_score_codex":0.009438817,"about_ca_topic_score_gemma":0.017111603,"teacher_disagreement_score":0.9593692,"about_ca_system_score_codex":0.0013521186,"about_ca_system_score_gemma":0.0034999629,"threshold_uncertainty_score":0.13592374},"labels":[],"label_agreement":null},{"id":"W2913421376","doi":"","title":"Proceedings of the 4th workshop on Workshop for Ph.D. students in information & knowledge management","year":2011,"lang":"en","type":"article","venue":"Conference on Information and Knowledge Management","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Systems, Applications & Products in Data Processing (Canada)","funders":"","keywords":"Computer science; Viewpoints; Presentation (obstetrics); Point (geometry); Resource (disambiguation); Citation; World Wide Web; Library science; Data science","score_opus":0.1676516052721033,"score_gpt":0.38694816375382723,"score_spread":0.21929655848172394,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2913421376","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010440022,0.024672441,0.036195703,0.17557542,0.24100979,0.0018381843,0.008399536,0.004798498,0.49707034],"genre_scores_gemma":[0.021889888,0.009733707,0.017206118,0.013880767,0.017448537,0.0010273668,0.007810747,0.0020253786,0.9089775],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99477285,0.0015227381,0.00034030146,0.000927602,0.0015406847,0.0008957566],"domain_scores_gemma":[0.98821753,0.0009462323,0.00031371988,0.00058700587,0.0037608077,0.006174736],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009565979,0.0016221366,0.0012103093,0.0016732407,0.0024198662,0.010081479,0.002341637,0.0031406407,0.2560834],"category_scores_gemma":[0.008482207,0.0006131752,0.001406183,0.0013833882,0.0011147473,0.0058533726,0.0077749463,0.004917146,0.14932203],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013145666,0.00016491316,0.00029322645,0.00020095393,0.000007788026,0.000103218525,0.0003771618,0.00009650081,0.00093805674,0.0023442977,0.9120844,0.08325801],"study_design_scores_gemma":[0.000017833965,0.0000760473,0.0005937658,0.00015101326,0.000006484531,0.000073696036,0.00051800726,0.00013742784,0.0003230856,0.0017770624,0.9963129,0.000012761184],"about_ca_topic_score_codex":0.001415043,"about_ca_topic_score_gemma":0.0033841839,"teacher_disagreement_score":0.2560834,"about_ca_system_score_codex":0.0024148123,"about_ca_system_score_gemma":0.005845556,"threshold_uncertainty_score":0.8566843},"labels":[],"label_agreement":null},{"id":"W2916773830","doi":"10.1007/s12652-019-01252-y","title":"A configurable identity matching algorithm for community care management","year":2019,"lang":"en","type":"article","venue":"Journal of Ambient Intelligence and Humanized Computing","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Computational intelligence; Identity (music); Identity management; Matching (statistics); Algorithm; Artificial intelligence; Mathematics; Computer security","score_opus":0.12942504875229946,"score_gpt":0.4084695099433377,"score_spread":0.2790444611910382,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2916773830","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07049864,0.00026716702,0.92229,0.00017598241,0.00011206463,0.00027115777,0.00026038592,0.0035208215,0.0026037674],"genre_scores_gemma":[0.47825792,0.00007628085,0.5184984,0.00010838263,0.000031635976,0.00012340439,0.00054993335,0.00011937676,0.0022346596],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9989164,0.0002475205,0.000086478925,0.00032064208,0.0002887589,0.00014025367],"domain_scores_gemma":[0.9988003,0.00037656145,0.000089933725,0.00030533012,0.00033648766,0.000091488946],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0014527348,0.00045443067,0.0008366367,0.0013870972,0.0010653625,0.0011381523,0.0023853239,0.00109976,0.0052612615],"category_scores_gemma":[0.0042251465,0.00027533004,0.00046381407,0.0013575855,0.00034541602,0.001597923,0.0018147081,0.0007843026,0.0012580628],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00083587784,0.0007440438,0.005525208,0.000070056776,0.000095142466,0.00015847923,0.00011437354,0.09112661,0.0132361585,0.0061869184,0.006295758,0.87561136],"study_design_scores_gemma":[0.00006625875,0.00010949336,0.0010738397,0.000008015561,0.000020833499,0.00012790503,0.0000629992,0.9871623,0.005280765,0.0044319555,0.0016401514,0.000015541016],"about_ca_topic_score_codex":0.0056092013,"about_ca_topic_score_gemma":0.0045490367,"teacher_disagreement_score":0.0056092013,"about_ca_system_score_codex":0.00082885433,"about_ca_system_score_gemma":0.001215249,"threshold_uncertainty_score":0.017600715},"labels":[],"label_agreement":null},{"id":"W2920914950","doi":"10.18438/eblip29516","title":"Data Librarians’ Skills and Competencies Are Heterogeneous and Cluster into Those for Generalists and Specialists","year":2019,"lang":"en","type":"article","venue":"Evidence Based Library and Information Practice","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Presentation (obstetrics); Medical education; Psychology; Subject (documents); Interpersonal communication; Work (physics); Computer science; Library science; Medicine; Social psychology; Engineering","score_opus":0.09420204864177724,"score_gpt":0.3646789076947657,"score_spread":0.27047685905298846,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2920914950","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.68690354,0.06007881,0.009518392,0.049119532,0.0007685679,0.0005207373,0.005294543,0.0006070232,0.18718883],"genre_scores_gemma":[0.92933786,0.025946949,0.009485082,0.013540902,0.0003190234,0.00031072306,0.002753496,0.00017884655,0.018126996],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.99140805,0.002299919,0.0012774471,0.0011294016,0.002694016,0.0011911693],"domain_scores_gemma":[0.9647168,0.01639596,0.004727743,0.002188057,0.006637024,0.0053344],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007435576,0.00032416813,0.0007002852,0.0066212146,0.0019697207,0.0034067398,0.000946258,0.0009830067,0.013780245],"category_scores_gemma":[0.033698887,0.00044739989,0.00061531906,0.0057273647,0.0018090326,0.0047235317,0.0044862335,0.0011667951,0.0047401646],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013854819,0.00024476944,0.27935648,0.004508657,0.00015177368,0.00068077614,0.034355413,0.00018815439,0.0011346675,0.006877612,0.060630757,0.61173236],"study_design_scores_gemma":[0.00003362784,0.00020700475,0.63856196,0.0039685257,0.00007420336,0.0026043905,0.06133299,0.00023927796,0.0009927902,0.0077035255,0.28418308,0.000098559656],"about_ca_topic_score_codex":0.0080473125,"about_ca_topic_score_gemma":0.014383607,"teacher_disagreement_score":0.013780245,"about_ca_system_score_codex":0.002581738,"about_ca_system_score_gemma":0.0064482037,"threshold_uncertainty_score":0.046099484},"labels":[],"label_agreement":null},{"id":"W2921690166","doi":"10.48550/arxiv.1903.05228","title":"Distributed Dependency Discovery","year":2019,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Pruning; Dependency (UML); Focus (optics); Distributed computing; Implementation; Space (punctuation); Big data; Computation; Theoretical computer science; Distributed Computing Environment; Data mining; Algorithm; Artificial intelligence; Programming language","score_opus":0.27525841916614996,"score_gpt":0.27968798770166714,"score_spread":0.004429568535517181,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2921690166","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012323097,0.00035760092,0.98370576,0.00087658083,0.000061843755,0.00013633065,0.0004466409,0.00062595936,0.0014661133],"genre_scores_gemma":[0.38195977,0.0006528472,0.6107977,0.00045067962,0.00024404866,0.0004440758,0.0021858895,0.00030363124,0.0029613269],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9944971,0.0016967553,0.0002780117,0.0014994789,0.0016591998,0.0003694617],"domain_scores_gemma":[0.9754642,0.016197907,0.0015679422,0.0044843173,0.001647814,0.00063767954],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0048377593,0.0011622749,0.0013446446,0.00240613,0.0014759571,0.0027544864,0.0030744239,0.0013747711,0.0033474567],"category_scores_gemma":[0.03068894,0.0007934478,0.0016591912,0.0039176843,0.0015924255,0.0051033203,0.003994537,0.0026308054,0.00070649985],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000430487,0.0004184581,0.0142420875,0.0009110364,0.00046263507,0.00060895627,0.00065719977,0.43129516,0.0036001569,0.19696806,0.022069685,0.32833615],"study_design_scores_gemma":[0.000031965712,0.00005238496,0.0009089291,0.000030346262,0.000055745364,0.00018188632,0.000096275086,0.79707235,0.0020242305,0.19394448,0.0055831107,0.000018266292],"about_ca_topic_score_codex":0.0027103918,"about_ca_topic_score_gemma":0.004420527,"teacher_disagreement_score":0.0048377593,"about_ca_system_score_codex":0.0014987818,"about_ca_system_score_gemma":0.003112285,"threshold_uncertainty_score":0.025584877},"labels":[],"label_agreement":null},{"id":"W2922217177","doi":"10.13016/m231pw-vd2z","title":"RESTORE: Automated Regression Testing for Datasets","year":2019,"lang":"en","type":"preprint","venue":"Maryland Shared Open Access Repository (USMAI Consortium)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; Ontario Centres of Excellence","keywords":"Computer science; Set (abstract data type); Data mining; Process (computing); Scale (ratio); Quality (philosophy); Data set; Data quality; Artificial intelligence","score_opus":0.36935616054139486,"score_gpt":0.5077334092430275,"score_spread":0.1383772487016326,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2922217177","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0859937,0.00047915278,0.49474388,0.00091374636,0.00023084394,0.00036035397,0.0083013205,0.40619805,0.0027789003],"genre_scores_gemma":[0.4164039,0.0002697074,0.5369196,0.00067154155,0.00014809985,0.00078926195,0.023205398,0.01847569,0.0031168275],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9921669,0.002978326,0.00083760265,0.0015220058,0.0021620598,0.00033307142],"domain_scores_gemma":[0.9695114,0.020051038,0.0017361918,0.0062516527,0.0021097849,0.00034000198],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0075578564,0.0016774765,0.0008494241,0.0034488183,0.00051249086,0.001529653,0.0028141513,0.0011036084,0.0055518546],"category_scores_gemma":[0.048315994,0.00081811246,0.00165694,0.0018377851,0.0010230688,0.002149624,0.0022003006,0.0016948261,0.0029846958],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010833105,0.0006004289,0.048613157,0.0011352791,0.0007171265,0.0010743267,0.0007626412,0.14140512,0.02422266,0.008737148,0.12976404,0.64188474],"study_design_scores_gemma":[0.00036105685,0.00034394505,0.013153748,0.00010892398,0.00008999775,0.0005812135,0.00019453812,0.91481483,0.033239476,0.016420951,0.02060344,0.000087973334],"about_ca_topic_score_codex":0.0029145663,"about_ca_topic_score_gemma":0.003547882,"teacher_disagreement_score":0.99244213,"about_ca_system_score_codex":0.00051687617,"about_ca_system_score_gemma":0.001593363,"threshold_uncertainty_score":0.03997022},"labels":[],"label_agreement":null},{"id":"W2934046129","doi":"10.2478/jos-2019-0007","title":"An Evolutionary Schema for Using “it-is-what-it-is” Data in Official Statistics","year":2019,"lang":"en","type":"article","venue":"Journal of Official Statistics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Health Canada","funders":"","keywords":"Data science; Schema (genetic algorithms); Computer science; Set (abstract data type); Big data; Agency (philosophy); Process (computing); Data mining; Information retrieval; Sociology; Social science","score_opus":0.33696849945233176,"score_gpt":0.4966412882000322,"score_spread":0.15967278874770047,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2934046129","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00590991,0.0010153693,0.9264815,0.04166785,0.0011022986,0.0007427885,0.00056310266,0.00080781744,0.021709444],"genre_scores_gemma":[0.0673285,0.0008418838,0.9229077,0.0038153261,0.00027848352,0.0010227747,0.0007298996,0.0003245979,0.002750861],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9177893,0.056795508,0.008791584,0.0055302703,0.009553523,0.0015398295],"domain_scores_gemma":[0.9128823,0.038413547,0.005530451,0.017462393,0.021825692,0.0038856997],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.093475476,0.00075676345,0.0010922982,0.009199608,0.006293026,0.021118872,0.0055636344,0.006896842,0.0039562415],"category_scores_gemma":[0.07339408,0.0013354791,0.0022095123,0.011820204,0.027432926,0.03810327,0.010417105,0.010415492,0.0015206243],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000008280497,0.000021791524,0.00064907596,0.000092971975,0.000018757954,0.00008600347,0.005936255,0.00035492814,0.00021223024,0.9784362,0.0035463516,0.010637203],"study_design_scores_gemma":[0.000027181324,0.00006763402,0.00079988886,0.000861331,0.00005835874,0.00061892206,0.010488753,0.0047174166,0.0010713214,0.62683827,0.35435915,0.00009186374],"about_ca_topic_score_codex":0.006836001,"about_ca_topic_score_gemma":0.005993392,"teacher_disagreement_score":0.093475476,"about_ca_system_score_codex":0.007187177,"about_ca_system_score_gemma":0.011245552,"threshold_uncertainty_score":0.49435145},"labels":[],"label_agreement":null},{"id":"W2936904543","doi":"","title":"Working Across Boundaries - Follow-Up Survey","year":2017,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Survey data collection; Dimension (graph theory); Work (physics); Agency (philosophy); USable; Argument (complex analysis); Public relations; Plan (archaeology); Order (exchange); Dissemination; Political science; Sociology; Computer science; World Wide Web; Business; Engineering; Geography; Social science; Law","score_opus":0.4935244230268321,"score_gpt":0.5068713704100264,"score_spread":0.013346947383194308,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2936904543","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9515078,0.00089313736,0.0023376655,0.009660568,0.0006962324,0.0077057974,0.014145557,0.0002284166,0.012824747],"genre_scores_gemma":[0.91791916,0.002019288,0.005969257,0.0127576385,0.00031894748,0.022116484,0.015264031,0.00017757977,0.023457661],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99490607,0.001494439,0.0007714128,0.00047885888,0.001081653,0.001267679],"domain_scores_gemma":[0.979802,0.0037994466,0.0030552275,0.0018320346,0.0074788253,0.0040325103],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011649925,0.00045441752,0.00079155905,0.002510101,0.0019135417,0.0023518708,0.00079830573,0.0025926903,0.009425661],"category_scores_gemma":[0.024882918,0.0005762719,0.00091512146,0.001401774,0.0006389594,0.0034443852,0.0032037927,0.0035142174,0.005737532],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006755475,0.004187875,0.6344546,0.0021949718,0.00016708221,0.0017885629,0.09023448,0.00044661376,0.0024727734,0.0021273636,0.15103674,0.11021337],"study_design_scores_gemma":[0.00010261482,0.0021939054,0.7023867,0.00081509387,0.00004263002,0.0005972028,0.15994899,0.0004882997,0.0008014177,0.00063481455,0.13183284,0.00015558595],"about_ca_topic_score_codex":0.006528822,"about_ca_topic_score_gemma":0.004938599,"teacher_disagreement_score":0.011649925,"about_ca_system_score_codex":0.0019174607,"about_ca_system_score_gemma":0.0023015738,"threshold_uncertainty_score":0.061611414},"labels":[],"label_agreement":null},{"id":"W2938471675","doi":"10.5683/sp/e6lsvq","title":"Research Data Management Survey of Queen's University, 2018","year":2018,"lang":"en","type":"dataset","venue":"QSpace (Queen's University Library)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ontario Council of University Libraries; Queen's University","funders":"","keywords":"Queen (butterfly); RDM; Library science; Data management plan; Survey research; Data management; Research data; Sociology; Engineering; Management; Computer science; Database; Pedagogy","score_opus":0.1725551812751804,"score_gpt":0.3636516977416655,"score_spread":0.1910965164664851,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2938471675","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0014422993,0.00015893589,0.00026951314,0.00033700856,0.000043445933,0.00010796808,0.99544585,0.00018531618,0.0020096544],"genre_scores_gemma":[0.003366858,0.00019643767,0.0010414416,0.0002928208,0.000025588739,0.0010284738,0.9907566,0.00008557299,0.003206234],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.9938443,0.0011462991,0.0012504085,0.0009358342,0.0022404152,0.00058291067],"domain_scores_gemma":[0.97493595,0.0055117817,0.0029887266,0.0032536716,0.011203798,0.0021061734],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0059816027,0.000591179,0.0010933189,0.0044364096,0.0011445922,0.0024706481,0.0019712904,0.00095457793,0.021821715],"category_scores_gemma":[0.031161893,0.00058902404,0.00051193696,0.010060102,0.0004744672,0.0010966789,0.002452846,0.001383209,0.022860188],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025525538,0.00003576073,0.008404002,0.000805216,0.000030560364,0.000040314226,0.00020056653,0.00017051431,0.00020314916,0.0011979768,0.98078245,0.007874308],"study_design_scores_gemma":[0.00012074782,0.000017016637,0.032009114,0.00037205024,0.0000199291,0.000036891593,0.0002538933,0.00020108664,0.0003948838,0.00050106796,0.96604997,0.00002344409],"about_ca_topic_score_codex":0.08954392,"about_ca_topic_score_gemma":0.13107537,"teacher_disagreement_score":0.99458617,"about_ca_system_score_codex":0.005413815,"about_ca_system_score_gemma":0.016778927,"threshold_uncertainty_score":0.17804539},"labels":[],"label_agreement":null},{"id":"W2941717757","doi":"10.3390/info10050156","title":"Exploring Whether Data Can be Represented as a Composite Unit in Form Processing Using the Manufacturing of Information Approach","year":2019,"lang":"en","type":"article","venue":"Information","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"École de Technologie Supérieure; Université du Québec à Montréal","funders":"","keywords":"Relevance (law); Computer science; Representation (politics); Block (permutation group theory); Unit (ring theory); Quality (philosophy); Data mining; Simple (philosophy); Data quality; Information retrieval; Artificial intelligence; Mathematics; Engineering; Operations management","score_opus":0.49072795230219474,"score_gpt":0.41395952453904594,"score_spread":0.0767684277631488,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2941717757","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.2552335,0.00077406934,0.7250807,0.0012756832,0.000052373827,0.0004969811,0.000263399,0.00032029205,0.016503053],"genre_scores_gemma":[0.61787295,0.00044088604,0.3798965,0.00008631121,0.000017517385,0.00015671343,0.00018100365,0.000028749708,0.001319451],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99641883,0.0019284614,0.00024553225,0.0004472709,0.00081512565,0.00014487178],"domain_scores_gemma":[0.98637563,0.008650578,0.0014486182,0.0019128426,0.0013985217,0.00021376168],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0044646505,0.00044028633,0.00050915265,0.0032850464,0.0006543997,0.004561391,0.0009076383,0.0008238382,0.0028513125],"category_scores_gemma":[0.01846197,0.00029227315,0.0011917533,0.003740552,0.0017252308,0.005544893,0.0014319475,0.00085435616,0.00031995767],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007293254,0.0004996627,0.050430868,0.0009132279,0.0002953472,0.0006466141,0.003912336,0.10298491,0.010610915,0.28603682,0.0022340682,0.5407058],"study_design_scores_gemma":[0.000090227106,0.00076930935,0.029321805,0.00030256686,0.00029818751,0.0006270808,0.004110905,0.774746,0.009359972,0.15375938,0.026511775,0.000102744976],"about_ca_topic_score_codex":0.0045978706,"about_ca_topic_score_gemma":0.004414225,"teacher_disagreement_score":0.0045978706,"about_ca_system_score_codex":0.002019646,"about_ca_system_score_gemma":0.0016297105,"threshold_uncertainty_score":0.023611665},"labels":[],"label_agreement":null},{"id":"W2944628792","doi":"10.5479/10088/96518","title":"Data Standards for BARCODE Records in INSDC (BRIs)","year":2012,"lang":"en","type":"report","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":52,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Barcode; Computer science; Database; Operating system","score_opus":0.7631249978993779,"score_gpt":0.585327695359493,"score_spread":0.1777973025398849,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2944628792","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":"reporting","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"reporting","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.018374888,0.0011283798,0.1789104,0.011880816,0.0030998401,0.011631236,0.39196157,0.018652732,0.36436015],"genre_scores_gemma":[0.030768324,0.0012010867,0.31352025,0.004006821,0.00041906873,0.00955217,0.51595527,0.0038907493,0.12068626],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.8874372,0.024205448,0.019017002,0.004376602,0.058928523,0.0060351472],"domain_scores_gemma":[0.67603374,0.04078457,0.018521935,0.057334736,0.19956155,0.0077634323],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.08319809,0.0013518519,0.001332562,0.0141601395,0.00354478,0.0093125375,0.0077722757,0.0059559424,0.0236245],"category_scores_gemma":[0.14967111,0.0015132949,0.001552623,0.019385226,0.0018868435,0.0068359165,0.0048950748,0.00532425,0.03354882],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000508801,0.0008731118,0.012564965,0.0012260812,0.000067026434,0.00016769934,0.001263634,0.0036207119,0.0041362154,0.08985762,0.7698998,0.11581434],"study_design_scores_gemma":[0.00010662113,0.00016025062,0.022745835,0.0012441579,0.00004867362,0.00013391893,0.0009543561,0.0021843328,0.011404397,0.007073247,0.9538191,0.00012516518],"about_ca_topic_score_codex":0.11063482,"about_ca_topic_score_gemma":0.08138091,"teacher_disagreement_score":0.9168019,"about_ca_system_score_codex":0.013092942,"about_ca_system_score_gemma":0.059454005,"threshold_uncertainty_score":0.4399988},"labels":[],"label_agreement":null},{"id":"W2945741697","doi":"","title":"Enhancing Data Quality Using Data Management Strategies, Performance Measures, and Technology to Support Evidence-Based Practice","year":2019,"lang":"en","type":"article","venue":"Sigma's 30th International Nursing Research Congress","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Registered Nurses' Association of Ontario","funders":"","keywords":"Computer science; Data quality; Quality (philosophy); Quality management; Data governance; Data science; Process management; Risk analysis (engineering); Data mining; Business; Operations management; Management system; Engineering; Marketing","score_opus":0.6182450282767503,"score_gpt":0.609395430094628,"score_spread":0.008849598182122276,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2945741697","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.15473847,0.012136466,0.6632903,0.12066057,0.0015039416,0.005579788,0.0008707048,0.0036638172,0.0375559],"genre_scores_gemma":[0.35677746,0.0032099274,0.6314888,0.0050118687,0.0004064923,0.0013384721,0.0004315376,0.0001797829,0.0011557194],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.84182477,0.08634894,0.023673397,0.0045202565,0.041345865,0.0022867646],"domain_scores_gemma":[0.48926255,0.32869732,0.059088036,0.033360533,0.08161764,0.007973931],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.18477416,0.0011480543,0.0014494475,0.010929434,0.002061774,0.021303874,0.002588538,0.0025093297,0.0019434135],"category_scores_gemma":[0.3811004,0.0008624389,0.001428211,0.008451807,0.0022438702,0.012661426,0.009020625,0.0039531966,0.00076201133],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027632093,0.0013791062,0.04509378,0.0029868486,0.000524242,0.00006145775,0.0040114187,0.0045471266,0.0030786328,0.026688468,0.011602516,0.8997501],"study_design_scores_gemma":[0.0024086575,0.008035469,0.13893406,0.040541768,0.0037850537,0.0011388483,0.030321583,0.17369708,0.06749841,0.31180486,0.22038224,0.0014520419],"about_ca_topic_score_codex":0.0035104405,"about_ca_topic_score_gemma":0.0043674423,"teacher_disagreement_score":0.18477416,"about_ca_system_score_codex":0.0077547007,"about_ca_system_score_gemma":0.030225331,"threshold_uncertainty_score":0.97719085},"labels":[],"label_agreement":null},{"id":"W2946207881","doi":"10.1007/978-3-030-18305-9_52","title":"Name2Vec: Personal Names Embeddings","year":2019,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":13,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Computer science; Task (project management); Word (group theory); Information retrieval; Proper noun; Linkage (software); Natural language processing; Embedding; Artificial intelligence; Linguistics","score_opus":0.07252391469650568,"score_gpt":0.35107711140850406,"score_spread":0.2785531967119984,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2946207881","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009317662,0.0020405506,0.76721066,0.0014819854,0.0029219869,0.00022355425,0.06761595,0.1176644,0.031523213],"genre_scores_gemma":[0.081723124,0.002567268,0.60079527,0.0010975248,0.00072775607,0.00058823626,0.20886777,0.012029157,0.09160391],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9991266,0.00017066658,0.00006236985,0.00027594974,0.0002741192,0.000090292306],"domain_scores_gemma":[0.99922895,0.00016522313,0.000040612686,0.00033837502,0.0001812122,0.000045701276],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006479927,0.002061772,0.00067656755,0.0014363779,0.0005436124,0.0016797571,0.0010798532,0.0010758323,0.036781702],"category_scores_gemma":[0.0030184013,0.0007845508,0.001242428,0.0018006089,0.00038363304,0.0041052536,0.0023566452,0.0017976349,0.040906455],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00012794051,0.000091937996,0.00074535824,0.00028926058,0.000067212306,0.00009303211,0.0000945013,0.006592368,0.0033108904,0.013883303,0.47879392,0.49591023],"study_design_scores_gemma":[0.000053989424,0.00015246443,0.0019849492,0.00025171298,0.0000932472,0.00079399784,0.00023203329,0.28910238,0.029560445,0.09826658,0.5793713,0.00013682747],"about_ca_topic_score_codex":0.002281088,"about_ca_topic_score_gemma":0.0057783667,"teacher_disagreement_score":0.036781702,"about_ca_system_score_codex":0.00044034404,"about_ca_system_score_gemma":0.0007530101,"threshold_uncertainty_score":0.123047054},"labels":[],"label_agreement":null},{"id":"W2949244208","doi":"10.48550/arxiv.1702.00820","title":"HoloClean: Holistic Data Repairs with Probabilistic Inference","year":2017,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":57,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Inference; Leverage (statistics); Probabilistic logic; Tuple; Computer science; Data mining; Statistical model; Machine learning; Artificial intelligence; Mathematics","score_opus":0.631797409494457,"score_gpt":0.3557862297306885,"score_spread":0.27601117976376843,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2949244208","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.002085466,0.00027873262,0.9797173,0.00033190878,0.000056320434,0.00012120514,0.0009212209,0.015714712,0.0007731129],"genre_scores_gemma":[0.06430685,0.00031461037,0.9256713,0.00044445222,0.00007262766,0.00028208026,0.0046714745,0.0023469552,0.001889575],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9927712,0.0015203911,0.0005263504,0.002011495,0.0028320954,0.00033851582],"domain_scores_gemma":[0.98606384,0.0055137696,0.0010769437,0.005601836,0.0014500493,0.00029354013],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006983992,0.0018586861,0.001934413,0.003497685,0.0010638721,0.0037858784,0.0065703406,0.0018065469,0.0068347803],"category_scores_gemma":[0.036934186,0.0014023981,0.004149397,0.0026240253,0.002675645,0.0061807144,0.008092601,0.004132321,0.0029443312],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00046519784,0.00021736242,0.008345112,0.0014218446,0.00046740708,0.0005117674,0.0008443043,0.26437363,0.007827181,0.06220427,0.050541617,0.60278034],"study_design_scores_gemma":[0.000061962106,0.0000825638,0.00070004765,0.00013856271,0.000078560246,0.000358944,0.00014155485,0.8605657,0.011517063,0.097883545,0.02840046,0.000070992224],"about_ca_topic_score_codex":0.0075203907,"about_ca_topic_score_gemma":0.012831146,"teacher_disagreement_score":0.0075203907,"about_ca_system_score_codex":0.0021619578,"about_ca_system_score_gemma":0.0054665958,"threshold_uncertainty_score":0.03693533},"labels":[],"label_agreement":null},{"id":"W2949348411","doi":"10.48550/arxiv.1008.4627","title":"Matching Dependencies with Arbitrary Attribute Values: Semantics, Query Answering and Integrity Constraints","year":2010,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University; University of Ottawa","funders":"","keywords":"Tuple; Computer science; Matching (statistics); Functional dependency; Data integrity; Semantics (computer science); Data mining; Generalization; Invariant (physics); Theoretical computer science; Relational database; Database; Mathematics; Programming language; Discrete mathematics","score_opus":0.2250640965752461,"score_gpt":0.2770791278655393,"score_spread":0.052015031290293195,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2949348411","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05932071,0.0010194804,0.93038666,0.0038956988,0.000057977522,0.00014079198,0.0006724728,0.00029099724,0.0042151883],"genre_scores_gemma":[0.60858095,0.0013518287,0.384491,0.00061499194,0.00029801868,0.00033209453,0.0011752364,0.0001710813,0.0029848206],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9869387,0.004577617,0.0014622937,0.0018834714,0.0043932805,0.0007446774],"domain_scores_gemma":[0.95771736,0.026296604,0.0051949704,0.006633325,0.0033102904,0.00084737927],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011719175,0.0006876316,0.0014424318,0.0034672637,0.001766663,0.0054273736,0.003106844,0.0023541835,0.0019122026],"category_scores_gemma":[0.044494033,0.0009736904,0.0015397063,0.0072209025,0.0077838534,0.018884214,0.0040588286,0.0038067428,0.00031647432],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00008593267,0.00008019589,0.0014053417,0.00021201932,0.000042444764,0.00023651269,0.000901511,0.03300101,0.0012935174,0.93216264,0.0016504879,0.028928433],"study_design_scores_gemma":[0.000019469657,0.000021760527,0.00036572866,0.0000350907,0.000021455548,0.00018561243,0.0002188881,0.11219949,0.0017560223,0.88145703,0.0036929427,0.000026521164],"about_ca_topic_score_codex":0.0044471063,"about_ca_topic_score_gemma":0.0022353097,"teacher_disagreement_score":0.011719175,"about_ca_system_score_codex":0.0030815774,"about_ca_system_score_gemma":0.0022690876,"threshold_uncertainty_score":0.061977684},"labels":[],"label_agreement":null},{"id":"W2949999477","doi":"10.48550/arxiv.1312.7373","title":"Extending Contexts with Ontologies for Multidimensional Data Quality Assessment","year":2013,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Datalog; Context (archaeology); Quality (philosophy); Data quality; Quality assessment; Database; Information retrieval; Data mining; Data science; Evaluation methods; Engineering","score_opus":0.6427823544612737,"score_gpt":0.39728055478711893,"score_spread":0.2455017996741548,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2949999477","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009931116,0.0011068743,0.98419815,0.0011355896,0.000079857455,0.00014506714,0.00022393993,0.00044881992,0.0027305495],"genre_scores_gemma":[0.2057762,0.0014441211,0.79054797,0.0004330727,0.00014724598,0.00026819398,0.0003928262,0.0001615137,0.0008288873],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.97931576,0.008998891,0.0029047185,0.002913388,0.00501597,0.00085131166],"domain_scores_gemma":[0.9727025,0.012562939,0.0026625954,0.007448656,0.0036691534,0.00095420476],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013481263,0.0011923823,0.0011146177,0.005888807,0.001926918,0.0069383522,0.0021817924,0.002015235,0.001422783],"category_scores_gemma":[0.035260998,0.000995634,0.0029969097,0.0061364663,0.00438554,0.016275758,0.010786536,0.0033793624,0.0003400346],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000094214396,0.00011112375,0.0065785395,0.00063098373,0.0002144732,0.00077518565,0.0041740257,0.021571683,0.0042203777,0.84940153,0.0024577212,0.10977016],"study_design_scores_gemma":[0.00003479578,0.000072910916,0.0018301411,0.0005330049,0.00023182842,0.00070164737,0.001576386,0.09023719,0.005689369,0.8333983,0.06554849,0.00014599069],"about_ca_topic_score_codex":0.004901418,"about_ca_topic_score_gemma":0.004273044,"teacher_disagreement_score":0.013481263,"about_ca_system_score_codex":0.0017986996,"about_ca_system_score_gemma":0.002238215,"threshold_uncertainty_score":0.07129657},"labels":[],"label_agreement":null},{"id":"W2950110688","doi":"","title":"Leveraging Technology to Promote Evidence-Based Practice and Enhance Data Quality","year":2019,"lang":"en","type":"article","venue":"Sigma's 30th International Nursing Research Congress","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Registered Nurses' Association of Ontario","funders":"","keywords":"Quality (philosophy); Computer science; Business; Data quality; Risk analysis (engineering); Data science; Process management; Marketing","score_opus":0.41006287526702284,"score_gpt":0.613996217070361,"score_spread":0.20393334180333816,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2950110688","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.041514143,0.017960817,0.6570181,0.2303145,0.0042542033,0.0021679497,0.00043294945,0.0023742868,0.04396303],"genre_scores_gemma":[0.20216435,0.011785389,0.76156634,0.017038317,0.0021731025,0.00090964045,0.00048435177,0.0003198204,0.0035586962],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.81907666,0.10270607,0.019708209,0.004744624,0.05098868,0.0027757492],"domain_scores_gemma":[0.47673434,0.3508809,0.039992906,0.056151535,0.06729562,0.008944731],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.16482876,0.0011345608,0.0012257104,0.0093678525,0.0017820046,0.02306275,0.0028807083,0.0054937536,0.0038924224],"category_scores_gemma":[0.31883168,0.001028468,0.0018446557,0.00749759,0.004246262,0.019563297,0.015014487,0.00781285,0.002137375],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013385018,0.0007385483,0.018082399,0.004094359,0.0006740913,0.00023872711,0.005652196,0.002766957,0.008095938,0.06501722,0.021760544,0.87274516],"study_design_scores_gemma":[0.00047063007,0.0024010204,0.02389413,0.028041102,0.0011158012,0.0013218704,0.01075341,0.026226168,0.035664268,0.46054095,0.4089104,0.0006603537],"about_ca_topic_score_codex":0.0013811127,"about_ca_topic_score_gemma":0.002738055,"teacher_disagreement_score":0.16482876,"about_ca_system_score_codex":0.0042436803,"about_ca_system_score_gemma":0.023088673,"threshold_uncertainty_score":0.8717082},"labels":[],"label_agreement":null},{"id":"W2950296358","doi":"10.1088/1742-6596/1213/2/022021","title":"Research on data cleaning technology based on instance level","year":2019,"lang":"en","type":"article","venue":"Journal of Physics Conference Series","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Computer science; Process (computing); Data quality; Quality (philosophy); Data mining; Engineering; Programming language","score_opus":0.6678248949701602,"score_gpt":0.519995239498033,"score_spread":0.14782965547212723,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2950296358","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.016593922,0.002215664,0.97663283,0.0008875744,0.00016810898,0.00008944871,0.00018748976,0.0012244211,0.0020005968],"genre_scores_gemma":[0.36429644,0.0043039722,0.6265012,0.00070198195,0.0003157896,0.00018799685,0.0010593219,0.00029898642,0.002334324],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9931398,0.0014683021,0.0005572797,0.0016736671,0.0028382947,0.00032264562],"domain_scores_gemma":[0.9924257,0.0025342184,0.0007120294,0.0021576877,0.0019935982,0.00017676296],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00373189,0.0005499762,0.0012523893,0.0031879325,0.0010396655,0.004403795,0.0027281684,0.0011367659,0.0019892913],"category_scores_gemma":[0.010822751,0.0005537186,0.0019998814,0.0040291664,0.0013718074,0.0076734377,0.0019020729,0.0029640037,0.0006220746],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00044230153,0.00028507842,0.014837991,0.0014584556,0.00054678106,0.00034954582,0.0007722407,0.034337074,0.07496901,0.1755219,0.008887347,0.6875923],"study_design_scores_gemma":[0.000072390656,0.0004323806,0.00814866,0.00030920404,0.00049699564,0.0013869028,0.0006575459,0.5648112,0.21756417,0.14754042,0.05839004,0.00019003756],"about_ca_topic_score_codex":0.0015151376,"about_ca_topic_score_gemma":0.0005590831,"teacher_disagreement_score":0.004403795,"about_ca_system_score_codex":0.001171024,"about_ca_system_score_gemma":0.0016774399,"threshold_uncertainty_score":0.01973635},"labels":[],"label_agreement":null},{"id":"W2950545869","doi":"10.22215/etd/2018-13359","title":"Pairwise Estimating Equations for the Analysis of Linked Data","year":2018,"lang":"en","type":"dissertation","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"Schweizerischer Nationalfonds zur Förderung der Wissenschaftlichen Forschung","keywords":"Pairwise comparison; Record linkage; Computer science; Covariate; Linkage (software); Independence (probability theory); Data mining; Statistics; Econometrics; Mathematics; Machine learning; Sociology","score_opus":0.5450385659262785,"score_gpt":0.5499591261972531,"score_spread":0.004920560270974539,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2950545869","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0015271408,0.00085706887,0.99446255,0.0003927779,0.00013764737,0.00023101643,0.0011204764,0.00019026866,0.0010808936],"genre_scores_gemma":[0.04457333,0.003481563,0.9332959,0.0003846665,0.00059285905,0.0041206735,0.0054013054,0.00029205866,0.007857654],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9542713,0.03363019,0.0018862153,0.005200484,0.0040956945,0.0009160889],"domain_scores_gemma":[0.8325474,0.14869691,0.007080442,0.0058045476,0.0053982777,0.00047245793],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.052454848,0.0028987909,0.0036813081,0.0052850074,0.0013210694,0.004051401,0.005856684,0.0030625386,0.020532122],"category_scores_gemma":[0.15047002,0.0017282327,0.005152415,0.011677663,0.0019884042,0.0065709013,0.005074384,0.0078028506,0.006146467],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000108800625,0.00019547837,0.016551215,0.0010199193,0.002055895,0.00043340743,0.0008775065,0.100325085,0.00021472992,0.65318716,0.016247978,0.20878293],"study_design_scores_gemma":[0.000089048575,0.00018253294,0.005582685,0.0004188931,0.000507287,0.00023357231,0.00027028276,0.29743367,0.00038545678,0.6612722,0.033477765,0.00014644879],"about_ca_topic_score_codex":0.010902589,"about_ca_topic_score_gemma":0.008698461,"teacher_disagreement_score":0.052454848,"about_ca_system_score_codex":0.0026161391,"about_ca_system_score_gemma":0.004715486,"threshold_uncertainty_score":0.27741104},"labels":[],"label_agreement":null},{"id":"W2950622432","doi":"","title":"Guided Data Repair","year":2011,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Rank (graph theory); Process (computing); Quality (philosophy); Set (abstract data type); Data quality; Data mining; Data set; Machine learning; Information retrieval; Artificial intelligence; Engineering","score_opus":0.7109900226280569,"score_gpt":0.33696403490400567,"score_spread":0.3740259877240512,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2950622432","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01703925,0.0007738121,0.96743,0.0006393586,0.00012647793,0.00039301804,0.00048233432,0.011827363,0.001288401],"genre_scores_gemma":[0.18591191,0.00029923097,0.8068439,0.00076277775,0.000085491076,0.00030973402,0.0017780135,0.0013757865,0.0026331472],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.97569054,0.009785255,0.0018492648,0.0043237447,0.007567562,0.0007836528],"domain_scores_gemma":[0.879153,0.052744534,0.0059784474,0.051411238,0.009673699,0.0010390737],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.020867929,0.0018149363,0.002282661,0.0026500167,0.0015308537,0.0032785626,0.0075455233,0.0028389546,0.0050416216],"category_scores_gemma":[0.09035598,0.0012574015,0.0018620896,0.0018137471,0.0020090614,0.006051117,0.006241383,0.0038999543,0.0026914172],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013368167,0.00081700354,0.010051382,0.0014065746,0.00032453248,0.0005594119,0.0032250036,0.055059403,0.025339823,0.014900248,0.026627606,0.8603522],"study_design_scores_gemma":[0.00031046322,0.0012162931,0.0050656367,0.0005178339,0.00025203198,0.0034169608,0.0022099968,0.71308017,0.09545797,0.06634092,0.111752756,0.00037899596],"about_ca_topic_score_codex":0.0031809907,"about_ca_topic_score_gemma":0.0044626417,"teacher_disagreement_score":0.020867929,"about_ca_system_score_codex":0.0011092895,"about_ca_system_score_gemma":0.0027262631,"threshold_uncertainty_score":0.11036146},"labels":[],"label_agreement":null},{"id":"W2950704571","doi":"10.1109/icde.2019.00149","title":"Distributed Discovery of Functional Dependencies","year":2019,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Focus (optics); Distributed computing; Distributed database; Distributed algorithm; Computation; Distributed Computing Environment; Big data; Distributed data store; Data mining; Algorithm","score_opus":0.14862455253260098,"score_gpt":0.36350999751358415,"score_spread":0.21488544498098316,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2950704571","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.033682927,0.00041578288,0.9611402,0.00063263124,0.00008258723,0.00010200593,0.00064443913,0.0013536582,0.0019457],"genre_scores_gemma":[0.5560923,0.00038362367,0.4371466,0.00030801565,0.00020377956,0.00022568261,0.0025161584,0.00022623558,0.0028976053],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9972446,0.0005706524,0.00012097123,0.00094115816,0.00088012766,0.00024246112],"domain_scores_gemma":[0.98774326,0.0066449605,0.0008784432,0.003170759,0.0011801563,0.00038241583],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002882762,0.0010128384,0.0017542103,0.0023033428,0.0012320201,0.0017356665,0.0028099222,0.0010800271,0.002706475],"category_scores_gemma":[0.014881842,0.0007524144,0.0012820209,0.0028007524,0.0012793276,0.0037279832,0.0026533662,0.0016713715,0.00053558545],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005081821,0.00052154576,0.018359138,0.000731591,0.00036546984,0.0009770035,0.00048249797,0.3992507,0.012036537,0.05937346,0.016519008,0.4908749],"study_design_scores_gemma":[0.000051045325,0.000052674517,0.0015401042,0.000015673431,0.000041586834,0.00022633576,0.00007823342,0.8926124,0.0033951383,0.098291464,0.0036763765,0.000019033469],"about_ca_topic_score_codex":0.0039600595,"about_ca_topic_score_gemma":0.0065324195,"teacher_disagreement_score":0.0039600595,"about_ca_system_score_codex":0.0009764773,"about_ca_system_score_gemma":0.0029720059,"threshold_uncertainty_score":0.015245676},"labels":[],"label_agreement":null},{"id":"W2951405260","doi":"10.1007/978-3-030-23381-5_5","title":"Big Data Quality: A Data Quality Profiling Model","year":2019,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":13,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Data quality; Profiling (computer programming); Computer science; Data governance; Big data; Data mining; Data science; Engineering","score_opus":0.5635995789952036,"score_gpt":0.47028224481804565,"score_spread":0.09331733417715798,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2951405260","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01072778,0.00054844934,0.9724559,0.0038050495,0.00009040009,0.00016573658,0.0005362483,0.00078632956,0.010884026],"genre_scores_gemma":[0.5881675,0.001220184,0.39717948,0.001063112,0.0003534346,0.00038968268,0.0011529599,0.00033941097,0.010134138],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.994888,0.001620542,0.0003014061,0.00081067876,0.001957801,0.00042164003],"domain_scores_gemma":[0.9839633,0.008126445,0.002101953,0.0018790937,0.0031599673,0.00076915754],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008647586,0.0010910829,0.0007725279,0.0037779126,0.0010665033,0.0056219953,0.0023093333,0.0015295933,0.0038590427],"category_scores_gemma":[0.023430688,0.0007121955,0.0014687373,0.0045088874,0.0019811408,0.011169844,0.0030411396,0.0025721914,0.0008610815],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021839706,0.00023592777,0.016865522,0.00037843708,0.00013986531,0.00014238553,0.0008449011,0.11748467,0.0012706439,0.6377418,0.019982202,0.20469534],"study_design_scores_gemma":[0.0000158893,0.00006379586,0.003099595,0.00012507907,0.00006532667,0.0001478554,0.000264219,0.6623379,0.0011673653,0.32124245,0.011427501,0.00004302932],"about_ca_topic_score_codex":0.005101338,"about_ca_topic_score_gemma":0.0039769965,"teacher_disagreement_score":0.008647586,"about_ca_system_score_codex":0.003120563,"about_ca_system_score_gemma":0.0024383396,"threshold_uncertainty_score":0.045733392},"labels":[],"label_agreement":null},{"id":"W2952029797","doi":"10.1145/3294052.3322190","title":"Database Repairs and Consistent Query Answering","year":2019,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":43,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"","keywords":"Computer science; Database; Query language; Information retrieval; Database theory; View; Query optimization; Tracing; Query by Example; Database design; Web search query; Programming language; Search engine","score_opus":0.14865963805331375,"score_gpt":0.39704578246770367,"score_spread":0.24838614441438991,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2952029797","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0071030557,0.014161264,0.9703738,0.0039994395,0.00027724635,0.00013539717,0.00032784828,0.00064300536,0.0029789472],"genre_scores_gemma":[0.37232685,0.017380767,0.59697443,0.0032237673,0.0024678255,0.00058256485,0.0023254165,0.0005803462,0.004138095],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.95849407,0.015921885,0.004694755,0.0074577634,0.011545369,0.0018862014],"domain_scores_gemma":[0.91922307,0.054069225,0.0053565158,0.014479582,0.006073653,0.00079793774],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.026399022,0.0014276067,0.0030649288,0.0047396966,0.001963438,0.0070760837,0.005659122,0.0036001203,0.0035737797],"category_scores_gemma":[0.08188791,0.0015904495,0.0034675847,0.0074834772,0.009579665,0.020591708,0.0077666333,0.006043966,0.00097497785],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00029259655,0.00011174146,0.0026718674,0.0017541811,0.0003217778,0.0005540407,0.0017727391,0.027921304,0.0017189845,0.7885032,0.0075600054,0.16681753],"study_design_scores_gemma":[0.000049317543,0.00009011485,0.00045388044,0.0002443188,0.00011869539,0.0006318864,0.0004200966,0.035498537,0.0020616425,0.94010407,0.020256912,0.000070534865],"about_ca_topic_score_codex":0.0031070064,"about_ca_topic_score_gemma":0.0011641645,"teacher_disagreement_score":0.026399022,"about_ca_system_score_codex":0.0027800815,"about_ca_system_score_gemma":0.0032383,"threshold_uncertainty_score":0.13961303},"labels":[],"label_agreement":null},{"id":"W2952039710","doi":"10.1109/icde.2019.00024","title":"CurrentClean: Spatio-Temporal Cleaning of Stale Data","year":2019,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":23,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Computer science; Timestamp; Data mining; Probabilistic logic; Inference; Set (abstract data type); Data set; Data modeling; Database; Artificial intelligence; Real-time computing","score_opus":0.3638930345167121,"score_gpt":0.4612833997347684,"score_spread":0.09739036521805627,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2952039710","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.021687072,0.0010763182,0.9277857,0.00057052297,0.00022019433,0.0003415737,0.0051733907,0.04163177,0.001513533],"genre_scores_gemma":[0.25977054,0.0008123211,0.7140656,0.0005362038,0.0001512461,0.0003497612,0.019282017,0.0022134203,0.002818876],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99333125,0.00071933406,0.00066458975,0.0014550318,0.0035218762,0.00030790648],"domain_scores_gemma":[0.97384226,0.0055185985,0.0029947525,0.011790173,0.0052430285,0.0006111547],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0066838064,0.0012850845,0.0016020325,0.00451009,0.0016812602,0.0035979315,0.0052325805,0.0014404168,0.0026879918],"category_scores_gemma":[0.032611568,0.0011736059,0.001803356,0.00542831,0.001297479,0.0061139837,0.0054359124,0.0022986762,0.002422901],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000891633,0.00040913819,0.057364207,0.0012802045,0.0006918539,0.0009550198,0.0021989902,0.08337309,0.022287881,0.016120201,0.08362397,0.7308038],"study_design_scores_gemma":[0.00008144145,0.00022495136,0.012229192,0.00021028212,0.00018201208,0.0010322146,0.0006954109,0.83526796,0.04788651,0.025794012,0.07624772,0.00014823509],"about_ca_topic_score_codex":0.010615783,"about_ca_topic_score_gemma":0.013518178,"teacher_disagreement_score":0.010615783,"about_ca_system_score_codex":0.00096756336,"about_ca_system_score_gemma":0.0038150072,"threshold_uncertainty_score":0.03534782},"labels":[],"label_agreement":null},{"id":"W2952193585","doi":"10.3917/proj.020.0155","title":"Data governance maturity assessment tool: A design science approach","year":2019,"lang":"fr","type":"article","venue":"Projectics / Proyéctica / Projectique","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":22,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"HEC Montréal; Ministère de l’Immigration, de la Francisation et de l’Intégration; Université du Québec à Montréal","funders":"","keywords":"Political science; Humanities; Philosophy","score_opus":0.25794174737655695,"score_gpt":0.45577485403319234,"score_spread":0.1978331066566354,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2952193585","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005081543,0.0006737306,0.9598141,0.0037194649,0.00016475482,0.002950558,0.00215947,0.003967393,0.021469146],"genre_scores_gemma":[0.032801185,0.00053916866,0.95698816,0.00035385857,0.0000362338,0.0034118393,0.0016117631,0.00033261723,0.0039252318],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9627692,0.019276282,0.0048017865,0.0021218655,0.0102081075,0.00082273973],"domain_scores_gemma":[0.91409236,0.056102067,0.0045579993,0.006246007,0.017474247,0.0015272956],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.049843352,0.0019980073,0.0014415805,0.01400983,0.0021601543,0.015402554,0.004477655,0.0035627615,0.011439668],"category_scores_gemma":[0.081074886,0.0018231571,0.0032146927,0.007907804,0.0024457346,0.008859456,0.005893261,0.005079989,0.0035268574],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00029609806,0.00081021927,0.007201835,0.0065414435,0.00046835828,0.00048283994,0.008974667,0.029329937,0.008859295,0.38318577,0.025058195,0.52879137],"study_design_scores_gemma":[0.0003754626,0.0009179643,0.0039550057,0.008344088,0.000581267,0.0007838178,0.010370361,0.18879908,0.017856162,0.23832612,0.5292313,0.00045937474],"about_ca_topic_score_codex":0.004656712,"about_ca_topic_score_gemma":0.005369236,"teacher_disagreement_score":0.049843352,"about_ca_system_score_codex":0.006974749,"about_ca_system_score_gemma":0.0133043695,"threshold_uncertainty_score":0.2636},"labels":[],"label_agreement":null},{"id":"W2953388369","doi":"10.48550/arxiv.cs/0211042","title":"Database Repairs and Analytic Tableaux","year":2002,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"","keywords":"Database; Computer science; Information retrieval","score_opus":0.4269583216933262,"score_gpt":0.4318917152394451,"score_spread":0.0049333935461188805,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2953388369","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.03580466,0.0011131032,0.9544801,0.0008901683,0.000097011194,0.00012563188,0.00046230547,0.00058198307,0.006445038],"genre_scores_gemma":[0.5335171,0.0012065519,0.45434892,0.0004416059,0.00018440228,0.00029666602,0.0012500902,0.00033531382,0.008419356],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9951599,0.0011677431,0.00051820016,0.00092673366,0.0018708344,0.00035664067],"domain_scores_gemma":[0.9778463,0.013593436,0.0025470937,0.0027771217,0.0026796153,0.00055632344],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0041787643,0.0006719903,0.0008204444,0.0017726456,0.0012386439,0.004455466,0.0015519104,0.001347148,0.003605348],"category_scores_gemma":[0.025428934,0.0005669108,0.001051109,0.0020176184,0.00501595,0.00674497,0.0018650708,0.0026799198,0.0006998976],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00009868668,0.00002590342,0.0013222201,0.0001586748,0.00002520467,0.000312416,0.00078449224,0.03039269,0.0030919795,0.93012124,0.0019264976,0.031740002],"study_design_scores_gemma":[0.00002142575,0.000061376,0.00026135906,0.000067364264,0.00002931677,0.00037689885,0.00032829674,0.062886626,0.005897369,0.913433,0.016604092,0.000032798238],"about_ca_topic_score_codex":0.0018216097,"about_ca_topic_score_gemma":0.001380999,"teacher_disagreement_score":0.004455466,"about_ca_system_score_codex":0.0021306563,"about_ca_system_score_gemma":0.0014807244,"threshold_uncertainty_score":0.022099674},"labels":[],"label_agreement":null},{"id":"W2955281392","doi":"10.1145/3331184.3331311","title":"On Tradeoffs Between Document Signature Methods for a Legal Due Diligence Corpus","year":2019,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Cisco Systems (Canada)","funders":"","keywords":"Due diligence; Computer science; Hash function; Context (archaeology); Diligence; Signature (topology); Limit (mathematics); Information retrieval; Computer security; Political science; Mathematics; Law; Geography","score_opus":0.152014877530545,"score_gpt":0.4960927056453076,"score_spread":0.3440778281147626,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2955281392","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.83088845,0.008737757,0.14113036,0.0051838066,0.00029831458,0.00053483096,0.0006832677,0.0024835863,0.010059633],"genre_scores_gemma":[0.77792233,0.0012781523,0.21477623,0.00028179566,0.00015871094,0.00024258182,0.00083861256,0.000601343,0.003900229],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.97429514,0.012835772,0.002213709,0.0021632907,0.0072762985,0.0012157909],"domain_scores_gemma":[0.7270859,0.22704944,0.008993646,0.01817136,0.01582621,0.0028734857],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.039056435,0.0009373915,0.0014786271,0.004443656,0.0022667581,0.005585762,0.0023422262,0.0025154003,0.0025728203],"category_scores_gemma":[0.18105946,0.00088554964,0.00095707556,0.0047155507,0.0019681763,0.008538168,0.0030746418,0.0019501722,0.001296881],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0074233687,0.0010691567,0.043590754,0.00086403574,0.00030380764,0.00038525037,0.0020192792,0.18879473,0.032143645,0.016442163,0.009314107,0.6976497],"study_design_scores_gemma":[0.00043445418,0.0024774894,0.028957274,0.00029809878,0.0002346772,0.0016098018,0.003247643,0.8803797,0.049195137,0.023783633,0.0091214925,0.000260635],"about_ca_topic_score_codex":0.0045941076,"about_ca_topic_score_gemma":0.007878812,"teacher_disagreement_score":0.039056435,"about_ca_system_score_codex":0.004038402,"about_ca_system_score_gemma":0.0024698314,"threshold_uncertainty_score":0.20655262},"labels":[],"label_agreement":null},{"id":"W2962752375","doi":"10.4230/lipics.icdt.2019.6","title":"A Formal Framework for Probabilistic Unclean Databases.","year":2019,"lang":"en","type":"article","venue":"DROPS (Schloss Dagstuhl – Leibniz Center for Informatics)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":22,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Probabilistic logic; Computer science; Tuple; Cardinality (data modeling); Database; Probabilistic database; Realization (probability); Data mining; Theoretical computer science; Database theory; Database design; Artificial intelligence; Mathematics","score_opus":0.13311431167096552,"score_gpt":0.405443553735199,"score_spread":0.2723292420642335,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2962752375","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00082946353,0.00056294614,0.9939103,0.001109821,0.000071709735,0.00011439028,0.00045851755,0.00026277854,0.0026800944],"genre_scores_gemma":[0.10142073,0.0017186854,0.8847226,0.0018476509,0.00063010235,0.0013212576,0.002252975,0.00039389246,0.005692112],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98163915,0.005825458,0.0021384633,0.003962256,0.0054094177,0.0010253515],"domain_scores_gemma":[0.9687572,0.01917444,0.0023928424,0.0058189845,0.0029743644,0.0008822261],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.016643556,0.0017368756,0.0015607472,0.004538955,0.002910065,0.0094438335,0.0076176627,0.004219567,0.009494969],"category_scores_gemma":[0.034998372,0.0023618808,0.0060520982,0.005791965,0.008919773,0.019639578,0.010968688,0.009946758,0.002901128],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000021120306,0.000025994084,0.00025518663,0.00011492569,0.000027294718,0.00013185498,0.00029188345,0.009814603,0.00029053874,0.9777899,0.0015321511,0.009704633],"study_design_scores_gemma":[0.000023730041,0.000023315135,0.00007767458,0.000089162524,0.000030046485,0.00028406736,0.00010215994,0.050134834,0.00053980644,0.9249571,0.023705333,0.000032929158],"about_ca_topic_score_codex":0.006224689,"about_ca_topic_score_gemma":0.004551849,"teacher_disagreement_score":0.016643556,"about_ca_system_score_codex":0.004734007,"about_ca_system_score_gemma":0.0053057917,"threshold_uncertainty_score":0.08802056},"labels":[],"label_agreement":null},{"id":"W2964507227","doi":"","title":"Entity Retrieval Docker Image for OSIRRC at SIGIR 2019.","year":2019,"lang":"en","type":"article","venue":"International ACM SIGIR Conference on Research and Development in Information Retrieval","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Computer science; Information retrieval; Natural language processing; Artificial intelligence","score_opus":0.23495533717681732,"score_gpt":0.4577698368885389,"score_spread":0.22281449971172157,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2964507227","genre_codex":"other","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0016851202,0.0039074393,0.028739177,0.023857389,0.028832966,0.0009272718,0.08982072,0.13294443,0.6892856],"genre_scores_gemma":[0.0027870275,0.00085451355,0.009940381,0.0019466173,0.0032645252,0.00015924308,0.055950172,0.009907455,0.91519004],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9983523,0.0001348568,0.000059789974,0.0002968818,0.00092977745,0.00022647351],"domain_scores_gemma":[0.9927649,0.0007920847,0.00023625822,0.0010613446,0.0023005696,0.0028449006],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0042418833,0.0020326066,0.0020928693,0.0048346515,0.0021641469,0.009368203,0.0033595883,0.0037454597,0.82382905],"category_scores_gemma":[0.008000875,0.0009293553,0.0014028363,0.0033958054,0.0006868541,0.007930278,0.004389193,0.0027483304,0.769774],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00003961383,0.000018900315,0.000018647263,0.000029591312,0.000002029562,0.00001067259,0.0000052349606,0.000021949161,0.00022835634,0.00037074785,0.9883519,0.0109024355],"study_design_scores_gemma":[0.000045412333,0.00003973628,0.00019551869,0.000040596668,0.0000051260076,0.000036057285,0.000018968647,0.0004706813,0.00038722486,0.0011491199,0.99759537,0.000016133354],"about_ca_topic_score_codex":0.0089581255,"about_ca_topic_score_gemma":0.013780627,"teacher_disagreement_score":0.82382905,"about_ca_system_score_codex":0.0015574775,"about_ca_system_score_gemma":0.0027394004,"threshold_uncertainty_score":0.2512864},"labels":[],"label_agreement":null},{"id":"W2965162069","doi":"10.1002/pds.4861","title":"Validation of drug prescription records for senior patients in Alberta's Tomorrow Project: Assessing agreement between two population‐level administrative pharmaceutical databases in Alberta, Canada","year":2019,"lang":"en","type":"article","venue":"Pharmacoepidemiology and Drug Safety","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":13,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Alberta Health Services; Alberta Health; University of Alberta","funders":"Alberta Cancer Foundation","keywords":"Medicine; Medical prescription; Database; Medical record; Socioeconomic status; Cohort; Pharmacoepidemiology; Population; Family medicine; Demography; Environmental health; Internal medicine; Pharmacology; Computer science","score_opus":0.2259439955820089,"score_gpt":0.4808991853069036,"score_spread":0.2549551897248947,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2965162069","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9764945,0.0012723407,0.0018503101,0.0004932027,0.000050890347,0.00030860567,0.01551906,0.00007035853,0.0039408063],"genre_scores_gemma":[0.9823086,0.000368369,0.0026292552,0.00023070902,0.000020642128,0.000102684615,0.013544485,0.000014741772,0.0007804338],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.98266315,0.0027135739,0.001559486,0.0019032594,0.009793165,0.0013674395],"domain_scores_gemma":[0.9510033,0.0066418876,0.0109184235,0.0029646961,0.026103843,0.002367873],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.016709505,0.0006084455,0.0007192985,0.004994975,0.00208294,0.0025725206,0.00326027,0.00067299133,0.001033977],"category_scores_gemma":[0.04404806,0.00057399453,0.00076381146,0.00928711,0.0012079565,0.00075488706,0.0029926484,0.000673853,0.0002752337],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000101614416,0.000022084574,0.99298227,0.00005827556,0.00013170831,0.0000335938,0.0006775196,0.00029381187,0.00010545349,0.00010743128,0.00080111634,0.0046849786],"study_design_scores_gemma":[0.000009440796,0.00001836039,0.9966493,0.000074632895,0.000047472684,0.00003716939,0.00075277284,0.0009869308,0.0001541319,0.000024647443,0.0012343465,0.00001078326],"about_ca_topic_score_codex":0.9736736,"about_ca_topic_score_gemma":0.9781302,"teacher_disagreement_score":0.9832905,"about_ca_system_score_codex":0.02221791,"about_ca_system_score_gemma":0.030272273,"threshold_uncertainty_score":0.16120303},"labels":[],"label_agreement":null},{"id":"W2965517117","doi":"","title":"Limits and Potentials of Grasping User Interaction in Controlled and Open World Environments - Contrasting PIAAC Large-Scale-Assessment Usage Data with Web Analytics.","year":2017,"lang":"en","type":"article","venue":"Ingénierie des systèmes d information","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Analytics; Scale (ratio); Computer science; Data science; World Wide Web; Geography; Cartography","score_opus":0.11396934142905063,"score_gpt":0.3862381193686624,"score_spread":0.2722687779396118,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2965517117","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8718162,0.0015417906,0.08544601,0.0016280556,0.00011443817,0.0002481236,0.000441845,0.0007336108,0.038029935],"genre_scores_gemma":[0.98875856,0.00017454194,0.010067327,0.000081704646,0.00001735253,0.00012405713,0.00007544132,0.000066192944,0.00063482596],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.99188954,0.005048943,0.00025492284,0.0009636518,0.0014375921,0.0004053469],"domain_scores_gemma":[0.9405993,0.049466185,0.0020970597,0.003824849,0.0023194412,0.0016931924],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0067050955,0.00047597228,0.00045926435,0.0015619479,0.00086536404,0.0063675153,0.0012906725,0.0016646754,0.0040071215],"category_scores_gemma":[0.06192668,0.00048249357,0.00035450325,0.0008121232,0.0029555426,0.008150858,0.004459177,0.0008891489,0.0008651096],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0070733386,0.0011076973,0.110768236,0.002756359,0.00035040232,0.0010197902,0.047302034,0.01893703,0.07753924,0.06019711,0.005614252,0.6673346],"study_design_scores_gemma":[0.00037792622,0.0038308227,0.38634562,0.001953509,0.00041956236,0.0024923312,0.087341584,0.22668575,0.03936675,0.21084896,0.039556812,0.00078043615],"about_ca_topic_score_codex":0.0026314612,"about_ca_topic_score_gemma":0.0024479134,"teacher_disagreement_score":0.0067050955,"about_ca_system_score_codex":0.00063964754,"about_ca_system_score_gemma":0.0010025745,"threshold_uncertainty_score":0.035460353},"labels":[],"label_agreement":null},{"id":"W2966210203","doi":"10.29173/cais436","title":"Theories for the New Millennium: The Deployment of Theory in LIS Research","year":2013,"lang":"en","type":"article","venue":"Proceedings of the Annual Conference of CAIS / Actes du congrès annuel de l ACSI","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Sociology; Library science; Epistemology; Psychology; Social science; Philosophy; Computer science","score_opus":0.146704670753629,"score_gpt":0.38757768989470687,"score_spread":0.24087301914107787,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2966210203","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5716476,0.07409592,0.10973939,0.104541495,0.0033562025,0.0004883921,0.0008392419,0.00035511598,0.13493665],"genre_scores_gemma":[0.9511302,0.011824459,0.03161321,0.0027063678,0.0006038228,0.00029885324,0.0003065621,0.00010950102,0.0014071048],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9227404,0.048100192,0.006886117,0.0038479478,0.015973473,0.0024519088],"domain_scores_gemma":[0.39010093,0.5029826,0.039672833,0.021517087,0.03890794,0.006818612],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.14202346,0.00046779448,0.0008842554,0.032450866,0.0043373606,0.024716016,0.0023798791,0.0023938562,0.003893252],"category_scores_gemma":[0.26376644,0.000755959,0.0011826588,0.028350975,0.01917777,0.028441066,0.01079662,0.004569895,0.0004968643],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00026549835,0.00019519574,0.18442866,0.0036943147,0.00032813262,0.0009838704,0.20174763,0.0012068613,0.0013969342,0.30754504,0.0076715006,0.29053646],"study_design_scores_gemma":[0.00010150622,0.0006072808,0.11483827,0.016757902,0.00049377704,0.0015918673,0.28005517,0.007710824,0.0034288866,0.35928875,0.21482062,0.00030512942],"about_ca_topic_score_codex":0.0036348659,"about_ca_topic_score_gemma":0.0049344767,"teacher_disagreement_score":0.85797656,"about_ca_system_score_codex":0.011714388,"about_ca_system_score_gemma":0.01789023,"threshold_uncertainty_score":0.75110084},"labels":[],"label_agreement":null},{"id":"W2966214405","doi":"10.1017/ice.2019.184","title":"Using data linkage methodologies to augment healthcare-associated infection surveillance data","year":2019,"lang":"en","type":"article","venue":"Infection Control and Hospital Epidemiology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Alberta Health Services; Alberta Health; University of Calgary","funders":"","keywords":"Medicine; Medical record; Health care; Population; Infection control; Record linkage; Linkage (software); Medical emergency; Database; Emergency medicine; Environmental health; Intensive care medicine; Internal medicine","score_opus":0.5950403739063242,"score_gpt":0.5430483500076243,"score_spread":0.051992023898699946,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2966214405","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07986417,0.0041324007,0.88278955,0.004975266,0.0005622243,0.004002965,0.012701279,0.0020024944,0.008969638],"genre_scores_gemma":[0.1998735,0.0013643642,0.7848283,0.0009432558,0.00027999302,0.0033583094,0.008383256,0.00023732192,0.0007316934],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.73189557,0.22513278,0.0132894665,0.012083569,0.016437162,0.0011614398],"domain_scores_gemma":[0.5586352,0.30560184,0.05233757,0.048896298,0.032862253,0.0016668675],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.1993435,0.0018975512,0.0019064541,0.02164129,0.002129291,0.0077234367,0.0041620918,0.0019576605,0.0027945999],"category_scores_gemma":[0.38469273,0.0015005771,0.0031431615,0.02548646,0.0013695041,0.007036024,0.008649855,0.0024327035,0.00085658237],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004526118,0.0006813293,0.51176614,0.0040762303,0.011065251,0.00044875772,0.007950311,0.027404178,0.0015589633,0.028679706,0.012856904,0.39305967],"study_design_scores_gemma":[0.0013062634,0.0024518613,0.29988292,0.008238562,0.009820733,0.0018921434,0.013663277,0.33225453,0.009001523,0.17538722,0.14512628,0.00097472325],"about_ca_topic_score_codex":0.022286544,"about_ca_topic_score_gemma":0.020842265,"teacher_disagreement_score":0.8006565,"about_ca_system_score_codex":0.0031184263,"about_ca_system_score_gemma":0.010671182,"threshold_uncertainty_score":0.987352},"labels":[],"label_agreement":null},{"id":"W2966581343","doi":"10.14778/3339490.3339501","title":"Ontology-based entity matching in attributed graphs","year":2019,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":42,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Subgraph isomorphism problem; Computer science; Matching (statistics); Theoretical computer science; Graph; Node (physics); Ontology; Ontology alignment; Factor-critical graph; Induced subgraph isomorphism problem; Semantic Web; Line graph; Mathematics; Artificial intelligence; Voltage graph; Process ontology","score_opus":0.07418500935219877,"score_gpt":0.34623299728772483,"score_spread":0.2720479879355261,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2966581343","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.029661192,0.00016555797,0.96555036,0.00049239467,0.000029023191,0.00029416502,0.001198708,0.0011055913,0.0015030033],"genre_scores_gemma":[0.34697852,0.0003421664,0.64732236,0.00017215926,0.000036153644,0.0002562406,0.0024600413,0.00026290872,0.0021694454],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9925403,0.0025510772,0.0008125678,0.0017694236,0.0016990452,0.00062756374],"domain_scores_gemma":[0.98238796,0.009776312,0.0014209778,0.004460885,0.0014702331,0.0004835869],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0054618125,0.000884705,0.0015824331,0.0034211772,0.0019930322,0.004033792,0.0032112368,0.0018663761,0.003947645],"category_scores_gemma":[0.029762201,0.00085403025,0.0017049903,0.0065551293,0.0019511117,0.01642431,0.0058215023,0.0016546943,0.0007097323],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004408231,0.00029103874,0.004029928,0.0006342128,0.00014226984,0.0002658444,0.00073912495,0.38378888,0.0054912176,0.3332412,0.0068333205,0.2641022],"study_design_scores_gemma":[0.00006721368,0.000054217595,0.0005386161,0.000044522574,0.00006744947,0.00013615451,0.00040181848,0.6079054,0.006887747,0.37580192,0.008060287,0.000034775054],"about_ca_topic_score_codex":0.009379285,"about_ca_topic_score_gemma":0.013171856,"teacher_disagreement_score":0.009379285,"about_ca_system_score_codex":0.00303643,"about_ca_system_score_gemma":0.0039280104,"threshold_uncertainty_score":0.028885186},"labels":[],"label_agreement":null},{"id":"W2967736654","doi":"10.1007/978-3-030-27615-7_29","title":"Ontario: Federated Query Processing Against a Semantic Data Lake","year":2019,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":45,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Computer science; Exploit; Schema (genetic algorithms); Semantic heterogeneity; Query optimization; SPARQL; Information retrieval; RDF; Query language; Data integration; Database; Overhead (engineering); Data mining; Semantic Web; Ontology-based data integration","score_opus":0.13596844554397938,"score_gpt":0.3560912968233141,"score_spread":0.2201228512793347,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2967736654","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.119171746,0.001083664,0.38647512,0.0044292007,0.00052278006,0.0013366498,0.055422954,0.25199717,0.17956063],"genre_scores_gemma":[0.44163254,0.00084851106,0.29893076,0.0006922929,0.00007678437,0.00035495017,0.0669715,0.013833709,0.17665896],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9986761,0.000103040285,0.0000861254,0.0001882216,0.000753911,0.00019262066],"domain_scores_gemma":[0.9985843,0.00027289448,0.000045649496,0.00042867113,0.0005606212,0.00010798906],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001420146,0.0007897313,0.0007383519,0.0018874328,0.0024781192,0.0035324574,0.0021216108,0.0009095624,0.019869715],"category_scores_gemma":[0.004155131,0.000920168,0.0007397435,0.003251235,0.0010378051,0.0039750044,0.0028750505,0.00081290904,0.004512133],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002752581,0.00033029818,0.0077717192,0.0005886333,0.00020001766,0.0009157511,0.0019729375,0.022682782,0.0351755,0.05243207,0.55567837,0.31949934],"study_design_scores_gemma":[0.00058238395,0.00021756756,0.008099717,0.00016119097,0.00020461096,0.00036553555,0.0020660965,0.45036134,0.054867502,0.032310158,0.4504925,0.00027130535],"about_ca_topic_score_codex":0.7281256,"about_ca_topic_score_gemma":0.7856242,"teacher_disagreement_score":0.27187443,"about_ca_system_score_codex":0.0076543777,"about_ca_system_score_gemma":0.013452097,"threshold_uncertainty_score":0.54695106},"labels":[],"label_agreement":null},{"id":"W2969231583","doi":"","title":"Welcome to Sigmod 2019 - The 2019 ACM SIGMOD International Conference on the Management of Data!","year":2019,"lang":"en","type":"article","venue":"Centrum Wiskunde & Informatica (CWI), the national research institute for mathematics and computer science in the Netherlands","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Oak Ridge National Laboratory; University of Illinois at Urbana-Champaign; Universität Rostock; Universität Stuttgart; Universidade Federal de Minas Gerais; Tsinghua University; Technische Universität München; Indian Institute of Technology Delhi; Universität Salzburg; University of California, San Diego; Universitetet i Oslo; Johannes Gutenberg-Universität Mainz; National and Kapodistrian University of Athens; Centre National de la Recherche Scientifique; University of Pennsylvania; George Washington University; Georgia Institute of Technology; Rice University; Technische Universität Dresden; Hochschule Darmstadt; Pohang University of Science and Technology; Brandeis University; Nanyang Technological University; Seoul National University; Google; York University; University of Glasgow; University of Oxford; University of Warwick; TU Graz, Internationale Beziehungen und Mobilitätsprogramme; Universiteit van Amsterdam; Université du Luxembourg; Huazhong University of Science and Technology; Athens University of Economics and Business; Carnegie Mellon University; University at Buffalo; Renmin University of China; National University of Singapore; Ohio State University; Technische Universität Kaiserslautern; Imperial College London; National Technical University of Athens; Washington State University; Harvard University; University of Texas at Arlington; University of Waterloo; University of Science and Technology of China; Microsoft Research; Technische Universität Darmstadt; Aalborg Universitet; Universiteit Antwerpen; State University of New York; Beijing Institute of Technology; Loughborough University; University of Wisconsin-Madison; Arizona State University; Brown University; Massachusetts Institute of Technology","keywords":"Library science; Computer science","score_opus":0.4059641957481789,"score_gpt":0.485559362712492,"score_spread":0.07959516696431312,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2969231583","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0020423424,0.02011751,0.022809396,0.15633957,0.5178716,0.001339295,0.014657502,0.021767253,0.24305554],"genre_scores_gemma":[0.0040692417,0.01463393,0.0067766933,0.023427969,0.090629205,0.00063842104,0.022221945,0.009550337,0.82805216],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99540955,0.00077334075,0.0002789861,0.0006051716,0.0021217433,0.0008111211],"domain_scores_gemma":[0.9845813,0.0013159988,0.00060258975,0.0012574028,0.0051742857,0.0070684482],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.008461147,0.002491335,0.0023314806,0.004345156,0.0042743855,0.020652885,0.0033902556,0.0067413007,0.44059476],"category_scores_gemma":[0.01828466,0.0012223608,0.0016763383,0.0038658236,0.0016219019,0.019129746,0.015106488,0.009868033,0.42062336],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000027255803,0.000015376136,0.00003215119,0.00003682526,0.0000029185526,0.000017426104,0.000023302764,0.0000113757205,0.00010608583,0.00068964675,0.98766774,0.01136986],"study_design_scores_gemma":[0.000012564873,0.000028898035,0.00010815335,0.000071340284,0.000002868919,0.000023697086,0.00007784402,0.00006204224,0.00006605849,0.0005559599,0.9989749,0.000015722426],"about_ca_topic_score_codex":0.0027973652,"about_ca_topic_score_gemma":0.004855583,"teacher_disagreement_score":0.44059476,"about_ca_system_score_codex":0.0018595506,"about_ca_system_score_gemma":0.0029749959,"threshold_uncertainty_score":0.7979237},"labels":[],"label_agreement":null},{"id":"W2970727798","doi":"10.14778/3342263.3342638","title":"Distributed implementations of dependency discovery algorithms","year":2019,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":27,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Implementation; Pruning; Dependency (UML); Focus (optics); Space (punctuation); Computation; Distributed computing; Big data; Theoretical computer science; Distributed algorithm; Algorithm; Parallel computing; Data mining; Artificial intelligence; Programming language","score_opus":0.07908823019991898,"score_gpt":0.3774095362212648,"score_spread":0.29832130602134577,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2970727798","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00914007,0.00015244464,0.9877407,0.00023237163,0.000034804478,0.00007865781,0.000050250008,0.0012293936,0.0013413499],"genre_scores_gemma":[0.26836255,0.00023237741,0.72867286,0.00017436994,0.00006416039,0.00030434722,0.00029938726,0.00026307817,0.0016267891],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99627787,0.0011380382,0.00031070455,0.0009744327,0.0010340584,0.00026491782],"domain_scores_gemma":[0.98868495,0.0056152805,0.0006219729,0.0037278729,0.001052319,0.00029756204],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004650561,0.0010002266,0.0009893214,0.0009601292,0.0011156396,0.0027591505,0.003324919,0.0014127669,0.0037322042],"category_scores_gemma":[0.018046895,0.0006610148,0.0010203404,0.001818923,0.0012627352,0.0042113387,0.0027894261,0.0026792218,0.000973572],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006605982,0.00062834675,0.0057470915,0.0005433969,0.00031896983,0.00022105628,0.00053671486,0.41448835,0.00816999,0.15528922,0.008083122,0.40531322],"study_design_scores_gemma":[0.0001031578,0.000093266,0.00026664042,0.000024152203,0.00004619503,0.00010288457,0.000074512885,0.90708786,0.004508978,0.08386495,0.0038104164,0.000016959248],"about_ca_topic_score_codex":0.0016196619,"about_ca_topic_score_gemma":0.0030158297,"teacher_disagreement_score":0.004650561,"about_ca_system_score_codex":0.0011677019,"about_ca_system_score_gemma":0.0028346195,"threshold_uncertainty_score":0.024594843},"labels":[],"label_agreement":null},{"id":"W2970992672","doi":"10.14778/3352063.3352116","title":"Data lake management","year":2019,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":236,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"TD Bank Group; University of Toronto","funders":"","keywords":"Metadata; Data management; Metadata management; Data science; Data management plan; Computer science; Data integration; Software versioning; Data mapping; Data extraction; Data element; Research data; Data virtualization; Data curation; Database; World Wide Web; Software","score_opus":0.19096554616353498,"score_gpt":0.3896089267691528,"score_spread":0.19864338060561784,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2970992672","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011691869,0.007111954,0.55940956,0.02324033,0.0028328507,0.0030808086,0.10107316,0.17754924,0.11401019],"genre_scores_gemma":[0.11187629,0.007822782,0.5482424,0.0051960056,0.001630319,0.0024580685,0.22207904,0.02403266,0.07666242],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9902188,0.0013882162,0.001680583,0.0014432638,0.0045852875,0.00068390084],"domain_scores_gemma":[0.97794515,0.0032139625,0.0015340964,0.009015027,0.006640497,0.001651296],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013512635,0.0010647658,0.0014221334,0.007892552,0.0031229446,0.012696608,0.005567789,0.0014988105,0.0280816],"category_scores_gemma":[0.041428905,0.0010784767,0.0014979772,0.009107835,0.0011268331,0.017185194,0.0112716155,0.0032642502,0.01830473],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021415568,0.00008546647,0.006912315,0.0009170364,0.00013103639,0.00025021736,0.0011389395,0.0024277007,0.003093446,0.07858947,0.5607018,0.34553835],"study_design_scores_gemma":[0.00003398857,0.00003280322,0.0018507765,0.00025515116,0.00004663851,0.00020707393,0.0004127493,0.011222766,0.0059730695,0.032935698,0.94695944,0.00006990021],"about_ca_topic_score_codex":0.0065349108,"about_ca_topic_score_gemma":0.004540147,"teacher_disagreement_score":0.0280816,"about_ca_system_score_codex":0.002542973,"about_ca_system_score_gemma":0.0071443515,"threshold_uncertainty_score":0.093942285},"labels":[],"label_agreement":null},{"id":"W2971298513","doi":"","title":"OPERA: Operations-oriented Probabilistic Extraction, Reasoning, and Analysis.","year":2018,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Probabilistic logic; Opera; Computer science; Artificial intelligence; Art; Art history","score_opus":0.036190137567943564,"score_gpt":0.37420932681193797,"score_spread":0.33801918924399443,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2971298513","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0022815997,0.0016555265,0.9581595,0.0019451816,0.00036768764,0.00052685745,0.0047963625,0.020562815,0.009704409],"genre_scores_gemma":[0.07197579,0.00221418,0.8990834,0.001172071,0.00069183094,0.001235242,0.012125534,0.0025987802,0.008903301],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99144816,0.002301402,0.0010237918,0.0009297534,0.0038760863,0.00042085373],"domain_scores_gemma":[0.9844134,0.00872343,0.0007694389,0.0034499355,0.0020761108,0.00056773185],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010063821,0.0019588917,0.0016933114,0.005221374,0.0016361395,0.00847736,0.003993894,0.0016413735,0.017895794],"category_scores_gemma":[0.029618906,0.001303821,0.0036302165,0.0052464064,0.003044102,0.011994489,0.0075412714,0.0038997282,0.009298057],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006654167,0.00031954612,0.0022374291,0.0016952322,0.00035568004,0.00044702349,0.0006982651,0.009885994,0.0031562771,0.469532,0.12759945,0.38340774],"study_design_scores_gemma":[0.00007949754,0.00007831567,0.0009844841,0.00037184014,0.00015493658,0.0004338699,0.00028303594,0.09885197,0.0063042687,0.77082545,0.12154593,0.00008633196],"about_ca_topic_score_codex":0.0040924437,"about_ca_topic_score_gemma":0.003913299,"teacher_disagreement_score":0.017895794,"about_ca_system_score_codex":0.0017291731,"about_ca_system_score_gemma":0.004774681,"threshold_uncertainty_score":0.059867382},"labels":[],"label_agreement":null},{"id":"W2972941956","doi":"10.1109/tkde.2019.2940019","title":"Bayesian Networks for Data Integration in the Absence of Foreign Keys","year":2019,"lang":"en","type":"article","venue":"IEEE Transactions on Knowledge and Data Engineering","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Canada Research Chairs; University of New Brunswick","funders":"Natural Sciences and Engineering Research Council of Canada; Ontario Centres of Excellence","keywords":"Computer science; Relational database; Probabilistic logic; Inference; Data integration; Bayesian network; Data mining; Cardinality (data modeling); Relation (database); Population; Theoretical computer science; Data science; Information retrieval; Machine learning; Artificial intelligence","score_opus":0.12352446206391332,"score_gpt":0.36871568932336674,"score_spread":0.24519122725945341,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2972941956","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0026202076,0.00024813268,0.9954757,0.00051569997,0.00001590534,0.000043292748,0.00016813018,0.00027580038,0.0006369895],"genre_scores_gemma":[0.19688036,0.00081200845,0.7967286,0.00083366776,0.0002430873,0.000513001,0.0016581438,0.00025981927,0.0020713212],"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9794922,0.009880295,0.0012482129,0.005177793,0.0036096335,0.00059183873],"domain_scores_gemma":[0.94509614,0.04319925,0.0033975726,0.005053985,0.0026549296,0.0005981139],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.024196872,0.0015272836,0.0026133384,0.00453459,0.0016934904,0.0053636315,0.00417495,0.0026783426,0.0028336355],"category_scores_gemma":[0.08909432,0.002722905,0.0034119114,0.005167773,0.0035126065,0.01280874,0.0065338956,0.006499369,0.0008003059],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001702395,0.00009354457,0.0042316415,0.000265082,0.00048904127,0.00037103152,0.00066686206,0.6137443,0.0007190916,0.29602185,0.0026053747,0.08062199],"study_design_scores_gemma":[0.000014607658,0.000011503953,0.00036021095,0.000033380395,0.000045735058,0.000047610847,0.00003249727,0.74110144,0.0002849596,0.25612217,0.0019264548,0.000019446023],"about_ca_topic_score_codex":0.024927998,"about_ca_topic_score_gemma":0.02193068,"teacher_disagreement_score":0.024927998,"about_ca_system_score_codex":0.005082397,"about_ca_system_score_gemma":0.0037701176,"threshold_uncertainty_score":0.12796688},"labels":[],"label_agreement":null},{"id":"W2974677520","doi":"10.1109/icmcis.2019.8842749","title":"CRISIS: Integrating AIS and Ocean Data Streams Using Semantic Web Standards for Event Detection","year":2019,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":38,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Defence Research and Development Canada","funders":"","keywords":"Computer science; Data stream mining; Semantic Web; Interoperability; Data science; Agile software development; Event (particle physics); Process (computing); World Wide Web; Data mining; Software engineering","score_opus":0.17588645195985086,"score_gpt":0.45533094904342614,"score_spread":0.27944449708357527,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2974677520","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012508366,0.00045120437,0.9455766,0.002724194,0.00031584117,0.00083165785,0.0034567763,0.023897918,0.010237418],"genre_scores_gemma":[0.19368373,0.0013557792,0.7796208,0.0011556275,0.00018032358,0.0007505476,0.016266607,0.0014422777,0.005544292],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99492955,0.0010158702,0.0010381876,0.0004970184,0.0022560884,0.00026328996],"domain_scores_gemma":[0.9932603,0.001647928,0.00064078585,0.0018613419,0.0021719234,0.00041760344],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009848182,0.00094272377,0.0007512742,0.005249884,0.0012264461,0.007242717,0.0019521927,0.0017840662,0.0016578687],"category_scores_gemma":[0.013716165,0.0006186975,0.0010316549,0.004518447,0.0014295711,0.0109751355,0.004884754,0.002559748,0.001404849],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011926502,0.001073439,0.019810643,0.0011643373,0.00056659034,0.0018203347,0.00324774,0.045725968,0.026506377,0.30217507,0.06553652,0.5311804],"study_design_scores_gemma":[0.00016890578,0.000187808,0.007620117,0.00062451913,0.00023798009,0.00078629685,0.0024853256,0.44321153,0.039065465,0.24906775,0.25628275,0.0002614964],"about_ca_topic_score_codex":0.012067074,"about_ca_topic_score_gemma":0.010320211,"teacher_disagreement_score":0.012067074,"about_ca_system_score_codex":0.0015086555,"about_ca_system_score_gemma":0.0036696976,"threshold_uncertainty_score":0.052082777},"labels":[],"label_agreement":null},{"id":"W2974699184","doi":"10.1002/pra2.2018.14505501026","title":"Understanding the information needs of social scientists in Germany","year":2018,"lang":"en","type":"article","venue":"Proceedings of the Association for Information Science and Technology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Information needs; Data collection; Quarter (Canadian coin); Data science; Social needs; Information seeking; Computer science; Knowledge management; Sociology; World Wide Web; Information retrieval; Social science; Political science; Geography","score_opus":0.08734379789931224,"score_gpt":0.34830575575210093,"score_spread":0.2609619578527887,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2974699184","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9909479,0.000729702,0.00028382885,0.0047816457,0.000015586755,0.000025652107,0.00012976168,0.000008146732,0.0030777704],"genre_scores_gemma":[0.9984322,0.00047679472,0.00031805603,0.00031981128,0.000012677089,0.00002865399,0.00006613017,0.0000034847071,0.0003420711],"study_design_codex":"qualitative","study_design_gemma":"observational","domain_scores_codex":[0.97785634,0.01423252,0.0013594587,0.0007991368,0.0031640613,0.0025884788],"domain_scores_gemma":[0.9277424,0.054736458,0.007098602,0.0013245357,0.0050346614,0.004063328],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.025964238,0.0003640328,0.000604188,0.006737241,0.004421561,0.006467545,0.0007800021,0.0023614045,0.0019980776],"category_scores_gemma":[0.046362307,0.00046197404,0.0002640185,0.005046506,0.0036006165,0.0067526354,0.006835997,0.0010239615,0.0002839984],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00036823968,0.00021306933,0.16875829,0.0009574406,0.00010407101,0.0015220433,0.75396466,0.0006885881,0.003020828,0.016383912,0.0043934137,0.04962539],"study_design_scores_gemma":[0.00002743472,0.00023808901,0.097060926,0.0006207763,0.000054154963,0.0005651031,0.8549873,0.001189215,0.0015440392,0.006595636,0.0370156,0.0001017319],"about_ca_topic_score_codex":0.008162839,"about_ca_topic_score_gemma":0.0057951044,"teacher_disagreement_score":0.9935325,"about_ca_system_score_codex":0.005889628,"about_ca_system_score_gemma":0.0056206975,"threshold_uncertainty_score":0.13731372},"labels":[],"label_agreement":null},{"id":"W2974767122","doi":"10.22230/cjc.2019v44n3a3647","title":"Special Section: Data Power","year":2019,"lang":"en","type":"article","venue":"Canadian Journal of Communication","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"Universität Bremen","keywords":"Section (typography); Special section; Power (physics); Computer science; Engineering; Physics; Engineering physics","score_opus":0.24225037217171924,"score_gpt":0.4055047114123008,"score_spread":0.16325433924058158,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2974767122","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0003260404,0.0054905135,0.0013253884,0.07211947,0.8766055,0.00012228235,0.00044071637,0.00042517052,0.043144964],"genre_scores_gemma":[0.003771855,0.0048336345,0.000515655,0.04467697,0.7783045,0.00015140334,0.0005204666,0.00040741847,0.1668181],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9971457,0.00041201254,0.00039301015,0.00053640205,0.0011957196,0.00031718152],"domain_scores_gemma":[0.9778211,0.0074497173,0.0016901024,0.0020584392,0.007951979,0.003028638],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0033959749,0.0017954654,0.0020551367,0.0031983366,0.0028716088,0.0044717174,0.0024729052,0.011258051,0.09249838],"category_scores_gemma":[0.021646358,0.0009301525,0.001297748,0.0022742385,0.0017018716,0.0032735937,0.0023593341,0.008201311,0.054014992],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000013764295,0.0000115002795,0.000059942777,0.000074662275,0.0000034217599,0.000081309045,0.0000056825006,0.000029094168,0.00007084283,0.0005412294,0.9916298,0.0074787843],"study_design_scores_gemma":[0.000010242855,0.000023571518,0.0004821247,0.0001093406,0.0000059536274,0.00026153188,0.000018343222,0.00010311762,0.000112988455,0.0009665853,0.997898,0.000008241234],"about_ca_topic_score_codex":0.0017824568,"about_ca_topic_score_gemma":0.0047204457,"teacher_disagreement_score":0.09249838,"about_ca_system_score_codex":0.0022646722,"about_ca_system_score_gemma":0.00292007,"threshold_uncertainty_score":0.30943787},"labels":[],"label_agreement":null},{"id":"W2976986740","doi":"","title":"Analyse de la performance de la méthode d'imputation de données manquantes missForest et application à des données environnementales","year":2019,"lang":"fr","type":"article","venue":"Espace École de technologie supérieure (École de technologie supérieure)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Imputation (statistics); Humanities; Political science; Forestry; Mathematics; Philosophy; Geography; Missing data; Statistics","score_opus":0.05752648360426363,"score_gpt":0.3485177996458281,"score_spread":0.2909913160415645,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2976986740","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.11848622,0.001791315,0.86852306,0.0007956678,0.00026108132,0.0004012001,0.0025483258,0.0040610204,0.003132144],"genre_scores_gemma":[0.23436975,0.0005644115,0.7553736,0.00019368714,0.000050911327,0.0005261037,0.0034910901,0.0003714173,0.005059063],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.98469687,0.007905728,0.0011660677,0.0026621965,0.0031611423,0.00040797496],"domain_scores_gemma":[0.92865044,0.053335786,0.0021165572,0.0056561367,0.009859737,0.00038135855],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02278717,0.0014694058,0.0018014301,0.0027006343,0.0012551288,0.004282228,0.0023868755,0.0022377763,0.00408112],"category_scores_gemma":[0.06075243,0.0009718279,0.002631266,0.0036627094,0.0007941134,0.0023858526,0.001621651,0.0020492785,0.002203654],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015549582,0.0005465737,0.075311676,0.0017933047,0.002355459,0.00035391544,0.0022258956,0.20856978,0.019591622,0.0066988887,0.006755735,0.6742422],"study_design_scores_gemma":[0.00009988888,0.0005102518,0.0371038,0.00032145678,0.00032697656,0.0004859079,0.0011147625,0.9076255,0.024906049,0.0056288843,0.021679655,0.00019687651],"about_ca_topic_score_codex":0.030093217,"about_ca_topic_score_gemma":0.025150737,"teacher_disagreement_score":0.030093217,"about_ca_system_score_codex":0.0013976856,"about_ca_system_score_gemma":0.0036772091,"threshold_uncertainty_score":0.12051153},"labels":[],"label_agreement":null},{"id":"W2980058748","doi":"10.29173/iasl7390","title":"School Librarians as Data Coaches","year":2019,"lang":"en","type":"article","venue":"IASL Annual Conference Proceedings","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"Institute of Museum and Library Services","keywords":"Information literacy; Medical education; Focus group; Service (business); Psychology; Pedagogy; Medicine; Sociology; Business","score_opus":0.24690350325259464,"score_gpt":0.40067053009046766,"score_spread":0.15376702683787302,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2980058748","genre_codex":"empirical","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.68145627,0.0071404283,0.006254384,0.043755278,0.0010928084,0.001359731,0.0005277023,0.0017019621,0.25671148],"genre_scores_gemma":[0.8175125,0.0029562179,0.008399247,0.010810704,0.00023268489,0.0005055662,0.0004814125,0.0002940169,0.1588075],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9705635,0.016583344,0.0016319273,0.003397993,0.0042785667,0.003544623],"domain_scores_gemma":[0.9489191,0.018732963,0.004137688,0.0059548393,0.00823742,0.01401803],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.014575775,0.00044797212,0.00082942087,0.0063998112,0.014690569,0.018556591,0.001967812,0.0030015376,0.03307126],"category_scores_gemma":[0.039652362,0.0014189685,0.0005225171,0.005814552,0.0046940995,0.008002866,0.009297231,0.0039514136,0.011570653],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00041418517,0.0046234545,0.15811998,0.000918619,0.00011202709,0.002290798,0.21721354,0.0002996137,0.0014188791,0.035761792,0.1675284,0.4112986],"study_design_scores_gemma":[0.00018270317,0.00042744473,0.03492406,0.0006918025,0.00008413595,0.0012404143,0.26668587,0.00055837946,0.0021786524,0.0067343307,0.68619895,0.000093186594],"about_ca_topic_score_codex":0.007602224,"about_ca_topic_score_gemma":0.020979093,"teacher_disagreement_score":0.03307126,"about_ca_system_score_codex":0.0058853133,"about_ca_system_score_gemma":0.017339196,"threshold_uncertainty_score":0.11063433},"labels":[],"label_agreement":null},{"id":"W2981358885","doi":"10.1007/s40273-019-00850-0","title":"Improving Transparency in Decision Models: Current Issues and Potential Solutions","year":2019,"lang":"en","type":"editorial","venue":"PharmacoEconomics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University; McGill University Health Centre","funders":"","keywords":"Quality of Life Research; Transparency (behavior); Health economics; Health administration; Public health; Current (fluid); Management science; Business; Risk analysis (engineering); Computer science; Economics; Medicine; Engineering; Nursing","score_opus":0.1391068268644732,"score_gpt":0.440017613013958,"score_spread":0.30091078614948474,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2981358885","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000029072415,0.011026655,0.00067679345,0.13730134,0.85012925,0.000021663916,0.00006988584,0.000050425002,0.00069483084],"genre_scores_gemma":[0.0006552751,0.008271719,0.0006543715,0.02483472,0.9636622,0.000027579666,0.000029148749,0.000043353375,0.0018215694],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9560555,0.015509375,0.0068693575,0.0024946926,0.017846365,0.0012246912],"domain_scores_gemma":[0.55282205,0.32996568,0.011043008,0.0064682616,0.08862397,0.011077121],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.058979847,0.0035650355,0.006015071,0.006161982,0.0043804627,0.019648518,0.0071199522,0.032470275,0.009579321],"category_scores_gemma":[0.24630126,0.0018338556,0.0043447926,0.0045486437,0.0075045093,0.010042072,0.0028640754,0.042908646,0.004771992],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00003393291,0.000015906326,0.000027813363,0.00055612513,0.000056146935,0.00005388533,0.000034110937,0.000081022095,0.000021915232,0.0015615377,0.98957306,0.007984535],"study_design_scores_gemma":[0.00021844987,0.000043936074,0.00035370374,0.0043663653,0.00028020242,0.00027303555,0.00019831484,0.0015398317,0.00018888501,0.025812345,0.96662205,0.00010285104],"about_ca_topic_score_codex":0.004675587,"about_ca_topic_score_gemma":0.009886164,"teacher_disagreement_score":0.94102013,"about_ca_system_score_codex":0.0068949843,"about_ca_system_score_gemma":0.01341244,"threshold_uncertainty_score":0.31191903},"labels":[],"label_agreement":null},{"id":"W2981442932","doi":"10.4095/219696","title":"Data Quality Requirements for Future SAR","year":2000,"lang":"en","type":"report","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Natural Resources Canada","funders":"","keywords":"Quality (philosophy); Computer science; Data quality; Remote sensing; Geology; Engineering; Operations management; Physics","score_opus":0.8194886233788209,"score_gpt":0.622003661711994,"score_spread":0.19748496166682694,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2981442932","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.18593563,0.0076663457,0.67239493,0.017576894,0.0006872248,0.00089015637,0.0059538023,0.003330917,0.105564125],"genre_scores_gemma":[0.7311445,0.0038659058,0.24194956,0.0022456557,0.00086176896,0.00068263296,0.010006171,0.0008593577,0.008384419],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98647493,0.0020285624,0.0014805612,0.00072763546,0.008511343,0.0007769947],"domain_scores_gemma":[0.91607714,0.030923232,0.005168673,0.0066247494,0.039308432,0.0018978236],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013373376,0.00035955457,0.0007298792,0.0020270178,0.001071817,0.0032513042,0.0015826358,0.0014894018,0.006737359],"category_scores_gemma":[0.05741515,0.00038904155,0.0004933815,0.0021061741,0.00086433726,0.003328511,0.0020525965,0.0012522998,0.0023172693],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001025576,0.00041418642,0.052105725,0.0017462047,0.0001457114,0.0018204245,0.0023941558,0.14092614,0.06007225,0.15730347,0.051603775,0.5304424],"study_design_scores_gemma":[0.0003779187,0.0016833172,0.072497375,0.0010063263,0.00020721414,0.0099513205,0.003362399,0.21145315,0.079595044,0.1718578,0.44761312,0.00039505388],"about_ca_topic_score_codex":0.0033143405,"about_ca_topic_score_gemma":0.001766781,"teacher_disagreement_score":0.013373376,"about_ca_system_score_codex":0.0010408731,"about_ca_system_score_gemma":0.0017011183,"threshold_uncertainty_score":0.07072604},"labels":[],"label_agreement":null},{"id":"W2985772508","doi":"10.5703/1288284317068","title":"What Are We Doing? Capturing the Uncaptured: Workload Data to Demonstrate Service","year":2019,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Purdue Pharma (Canada)","funders":"","keywords":"Computer science; Service (business); Workload; Task (project management); Categorization; Data as a service; World Wide Web; Database; Services computing; Database transaction; Web service; Data science; Engineering; Business; Artificial intelligence","score_opus":0.33004837715176083,"score_gpt":0.4184693254346535,"score_spread":0.08842094828289265,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2985772508","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.83845794,0.0004846748,0.06532657,0.0053887665,0.00029003032,0.00092397805,0.03216304,0.0011577765,0.05580728],"genre_scores_gemma":[0.9035164,0.00036034064,0.07138781,0.0006273291,0.00012253437,0.00085852947,0.015671909,0.00031414127,0.007140981],"study_design_codex":"observational","study_design_gemma":"not_applicable","domain_scores_codex":[0.99388325,0.001957013,0.0007919515,0.00071063056,0.0020479497,0.0006092494],"domain_scores_gemma":[0.94970655,0.01979508,0.00642209,0.0063921427,0.014855914,0.0028282725],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007152687,0.00052161736,0.0004478827,0.0071868915,0.0010305154,0.004611555,0.00097118557,0.0007457315,0.0042151776],"category_scores_gemma":[0.049748193,0.00025477094,0.00041124804,0.008887945,0.0007920472,0.006514307,0.0016761436,0.0010917437,0.0025335625],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00029124354,0.00043721916,0.60914797,0.00057218387,0.00009632123,0.0001944327,0.027836429,0.0015521994,0.0042105806,0.011865088,0.03451661,0.3092797],"study_design_scores_gemma":[0.000028363856,0.0004783526,0.76245457,0.0005011295,0.0000728992,0.0002628711,0.070997894,0.023962352,0.008168927,0.018503647,0.11431637,0.00025257413],"about_ca_topic_score_codex":0.015411601,"about_ca_topic_score_gemma":0.021108681,"teacher_disagreement_score":0.015411601,"about_ca_system_score_codex":0.0024812568,"about_ca_system_score_gemma":0.0022424967,"threshold_uncertainty_score":0.03782749},"labels":[],"label_agreement":null},{"id":"W2989076415","doi":"10.5703/1288284317002","title":"Data Expeditions: Mining Data for Effective Decision-Making","year":2019,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Purdue Pharma (Canada)","funders":"","keywords":"Computer science; Sorting; Variety (cybernetics); Session (web analytics); Data science; Publishing; World Wide Web; Scratch; Political science; Artificial intelligence","score_opus":0.37462084330536694,"score_gpt":0.5247623304457705,"score_spread":0.15014148714040354,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2989076415","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.022029366,0.010657638,0.88011736,0.04808199,0.0010518552,0.0033211396,0.013316529,0.006248565,0.0151754925],"genre_scores_gemma":[0.08454623,0.0042020353,0.8955405,0.001444119,0.00057902676,0.0014464043,0.010385111,0.00040295415,0.0014537184],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9658223,0.018945938,0.0041657034,0.0031206375,0.007258184,0.0006872228],"domain_scores_gemma":[0.86574113,0.098951146,0.0081948815,0.014862431,0.009627577,0.0026228144],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04514036,0.0023864622,0.003446055,0.018360108,0.0033116136,0.019021252,0.0055442145,0.0034881597,0.0053452835],"category_scores_gemma":[0.13383824,0.0017354789,0.0031290432,0.018974228,0.0044905646,0.015393841,0.008288458,0.0068648667,0.004146612],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00042243235,0.000917925,0.022302315,0.0060909907,0.0010703717,0.00073782884,0.005263073,0.032208692,0.0023954287,0.08186411,0.09846457,0.7482622],"study_design_scores_gemma":[0.000119952376,0.0001946089,0.006258788,0.0040085115,0.00025609028,0.0003275679,0.010552392,0.13367952,0.003544729,0.70811546,0.1326856,0.00025693374],"about_ca_topic_score_codex":0.0044918885,"about_ca_topic_score_gemma":0.0063374746,"teacher_disagreement_score":0.04514036,"about_ca_system_score_codex":0.0032050433,"about_ca_system_score_gemma":0.009833226,"threshold_uncertainty_score":0.23872787},"labels":[],"label_agreement":null},{"id":"W2990073915","doi":"10.29249/selcuksbmyd.580424","title":"Veri Ambarı Projelerinde ETL Performansını Etkileyen Faktörlerin Belirlenmesi","year":2019,"lang":"tr","type":"article","venue":"Selçuk Üniversitesi Sosyal Bilimler Meslek Yüksekokulu dergisi","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Yukon University","funders":"","keywords":"Mathematics; Physics","score_opus":0.041888416829430355,"score_gpt":0.30598130087538017,"score_spread":0.2640928840459498,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2990073915","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.22066028,0.009343545,0.554772,0.0064130896,0.0019893472,0.0012349252,0.0037039982,0.024787027,0.17709586],"genre_scores_gemma":[0.6383806,0.0065530976,0.23438928,0.001349084,0.0005295109,0.0006967761,0.0052139238,0.002478037,0.11040967],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.9971131,0.00041891797,0.00017142326,0.000444342,0.0015661833,0.00028601036],"domain_scores_gemma":[0.99438334,0.0015708824,0.00045263418,0.0011346507,0.0022140297,0.0002444742],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0027528103,0.0015543315,0.0009918333,0.0015232967,0.0013592817,0.0055241724,0.0013324408,0.0018287757,0.023214845],"category_scores_gemma":[0.0073233927,0.00064801,0.000753093,0.001601276,0.0010644849,0.0045722015,0.0020349496,0.0015567302,0.013278148],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012360464,0.00031654045,0.010428218,0.0015882128,0.00013076198,0.0010056,0.0018663594,0.005771278,0.06792024,0.014271292,0.037634797,0.8578306],"study_design_scores_gemma":[0.00022652528,0.0017131483,0.048776276,0.0012718805,0.0004970975,0.0038606871,0.006264016,0.09036346,0.2854448,0.026082907,0.5349218,0.0005773888],"about_ca_topic_score_codex":0.0036700638,"about_ca_topic_score_gemma":0.0027734663,"teacher_disagreement_score":0.023214845,"about_ca_system_score_codex":0.0009785588,"about_ca_system_score_gemma":0.0016522015,"threshold_uncertainty_score":0.077661395},"labels":[],"label_agreement":null},{"id":"W2990325812","doi":"10.23889/ijpds.v4i3.1209","title":"Linked Administrative Data at Statistics Canada – new data resources for horizontal research","year":2019,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Statistics Canada","funders":"","keywords":"Record linkage; Linkage (software); Immigration; Analytics; Data science; Business; Public relations; Geography; Database; Political science; Sociology; Computer science; Law","score_opus":0.6937162468840304,"score_gpt":0.6065499564550645,"score_spread":0.08716629042896595,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2990325812","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.001275568,0.0020487092,0.022699635,0.015898753,0.001201191,0.0011242494,0.88301367,0.010586289,0.06215192],"genre_scores_gemma":[0.013705079,0.0056794942,0.11427413,0.0069969795,0.00064415834,0.0030054625,0.820311,0.0066966927,0.028686956],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.94975525,0.007498772,0.004141519,0.0037657209,0.030986007,0.003852685],"domain_scores_gemma":[0.6964021,0.034467783,0.0092205675,0.042948376,0.19601752,0.020943703],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03257833,0.0015938112,0.0023492656,0.027413672,0.0073040673,0.015259925,0.006810112,0.0028698961,0.060133584],"category_scores_gemma":[0.15636638,0.0023279507,0.0025714783,0.06881136,0.0022101412,0.007013549,0.011047492,0.0062763114,0.028788947],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00008294187,0.000031082476,0.004045168,0.0003844073,0.00008894317,0.00007062909,0.00039489265,0.0007659265,0.00018056422,0.023241103,0.9195201,0.05119426],"study_design_scores_gemma":[0.000045060788,0.0000063496495,0.0057523204,0.00062777393,0.000028334833,0.00002367685,0.00028790662,0.0007732724,0.00024928222,0.0050547,0.98705894,0.00009238276],"about_ca_topic_score_codex":0.96950096,"about_ca_topic_score_gemma":0.95650554,"teacher_disagreement_score":0.90739715,"about_ca_system_score_codex":0.092602864,"about_ca_system_score_gemma":0.30261302,"threshold_uncertainty_score":0.67188394},"labels":[],"label_agreement":null},{"id":"W2991578290","doi":"10.5703/1288284317144","title":"The Time Has Come... To Build, Reflect, and Analyze Connections Between Qualitative and Quantitative Data","year":2020,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Purdue Pharma (Canada)","funders":"","keywords":"Computer science; Extant taxon; Transparency (behavior); Accountability; Process (computing); Process management; Qualitative property; Data science; Management science; Knowledge management; Engineering; Political science","score_opus":0.6070544362019351,"score_gpt":0.5467733598393073,"score_spread":0.060281076362627806,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2991578290","genre_codex":"commentary","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.025680652,0.007878511,0.42898718,0.46707588,0.013172796,0.0036262171,0.0015591147,0.0016364363,0.05038319],"genre_scores_gemma":[0.20163316,0.00482656,0.6881293,0.073201984,0.0023838854,0.009974499,0.0010422571,0.0016478349,0.017160485],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.7971244,0.14734314,0.009416981,0.00854688,0.034030423,0.0035382076],"domain_scores_gemma":[0.45533907,0.3390128,0.018797375,0.05487492,0.11798007,0.013995799],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.29205605,0.0013720687,0.002120181,0.007218199,0.011070751,0.021264158,0.0039436496,0.0044144075,0.020694988],"category_scores_gemma":[0.39341146,0.0016623915,0.001964354,0.0056699426,0.018256303,0.028241834,0.013695055,0.0151298195,0.007013197],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00024232022,0.00041330475,0.008143228,0.004904683,0.00037447846,0.00034797942,0.13947754,0.0013747752,0.0048319553,0.20509578,0.118340135,0.5164539],"study_design_scores_gemma":[0.00014887887,0.0005428959,0.0044586184,0.010498785,0.00016282986,0.0006617157,0.12510963,0.0028572436,0.0031996178,0.2228983,0.6289625,0.0004990212],"about_ca_topic_score_codex":0.012142679,"about_ca_topic_score_gemma":0.01136824,"teacher_disagreement_score":0.29205605,"about_ca_system_score_codex":0.013100086,"about_ca_system_score_gemma":0.043914355,"threshold_uncertainty_score":0.87302095},"labels":[],"label_agreement":null},{"id":"W2992507139","doi":"10.1177/1833358319887743","title":"Data quality in healthcare: A report of practical experience with the Canadian Primary Care Sentinel Surveillance Network data","year":2019,"lang":"en","type":"article","venue":"Health Information Management Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":91,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Queen's University","funders":"","keywords":"Consistency (knowledge bases); Data quality; Computer science; Context (archaeology); Completeness (order theory); Quality (philosophy); Data consistency; Construct (python library); Health care; Data mining; Risk analysis (engineering); Medicine; Operations management; Database; Engineering; Artificial intelligence; Mathematics","score_opus":0.28133070735268717,"score_gpt":0.48354025563839564,"score_spread":0.20220954828570847,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2992507139","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7162097,0.016491001,0.03536337,0.17119057,0.0012571595,0.0050458773,0.0027119464,0.0009204592,0.05080988],"genre_scores_gemma":[0.8686921,0.014325171,0.09327561,0.009827323,0.00036749896,0.00077124324,0.0021098568,0.0004951369,0.010135931],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.7786027,0.11559189,0.009934451,0.0068117776,0.07717329,0.011885889],"domain_scores_gemma":[0.6768309,0.148059,0.0075189685,0.0150309475,0.12508357,0.0274767],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.23100203,0.0009107079,0.0010261886,0.003249344,0.013346801,0.013669978,0.0061369548,0.0026111074,0.0012531875],"category_scores_gemma":[0.2656405,0.00080165645,0.0009769533,0.009768721,0.010244525,0.0046489234,0.012090546,0.0039414023,0.00028762472],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00035031085,0.0011199042,0.090546645,0.0024037785,0.00024870175,0.0017763297,0.39668927,0.0030826284,0.002202906,0.006862316,0.07993188,0.41478536],"study_design_scores_gemma":[0.00021001058,0.0019256047,0.11290667,0.0033728427,0.00028093677,0.0016966402,0.40977633,0.0071961223,0.004577212,0.004726077,0.45282483,0.00050663593],"about_ca_topic_score_codex":0.79105026,"about_ca_topic_score_gemma":0.8258737,"teacher_disagreement_score":0.91259015,"about_ca_system_score_codex":0.087409824,"about_ca_system_score_gemma":0.15339346,"threshold_uncertainty_score":0.9483114},"labels":[],"label_agreement":null},{"id":"W2996302565","doi":"10.17269/s41997-019-00265-6","title":"A new record linkage for assessing infant mortality rates in Ontario, Canada","year":2019,"lang":"en","type":"article","venue":"Canadian Journal of Public Health","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":true,"route_about_ca":true,"ca_institutions":"University of Toronto; St. Michael's Hospital; Ontario Stroke Network; Children's Hospital of Eastern Ontario; University of Ottawa","funders":"Ontario Ministry of Health and Long-Term Care; CHEO Research Institute","keywords":"Infant mortality; Medicine; Demography; Live birth; Mortality rate; Birth records; Pediatrics; Birth weight; Population; Pregnancy; Environmental health","score_opus":0.2975005878732344,"score_gpt":0.4327427143190817,"score_spread":0.13524212644584727,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2996302565","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.4517677,0.007658126,0.08111609,0.0026842076,0.0004496597,0.017159697,0.40472525,0.0023765923,0.032062724],"genre_scores_gemma":[0.69690907,0.0037257536,0.13690169,0.0005558312,0.00017729534,0.017096365,0.13284576,0.00022603723,0.011562322],"study_design_codex":"observational","study_design_gemma":"design_other","domain_scores_codex":[0.9876424,0.0018357831,0.0017773594,0.0015383296,0.0065179816,0.00068814197],"domain_scores_gemma":[0.9669224,0.0034310478,0.006680094,0.002371896,0.019723896,0.0008706521],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0147247175,0.0006323508,0.0010555398,0.0089161275,0.00290969,0.0025150867,0.0024200215,0.0005902945,0.0040958794],"category_scores_gemma":[0.04033765,0.00062383054,0.0012489138,0.01678113,0.00044224167,0.0013550157,0.002529529,0.0006071407,0.0006718059],"study_design_candidate":"design_other","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005038633,0.0001217165,0.82954717,0.0014422812,0.0010076805,0.00016881686,0.0014249636,0.0029642428,0.0007651801,0.0015017189,0.03394116,0.12661123],"study_design_scores_gemma":[0.00022911659,0.00014096886,0.9579262,0.00035741972,0.0004464903,0.00016308582,0.0006526386,0.007966924,0.00046459003,0.00034600354,0.031218503,0.000087990455],"about_ca_topic_score_codex":0.9597004,"about_ca_topic_score_gemma":0.9602836,"teacher_disagreement_score":0.040299594,"about_ca_system_score_codex":0.03077095,"about_ca_system_score_gemma":0.07369839,"threshold_uncertainty_score":0.22325993},"labels":[],"label_agreement":null},{"id":"W2997328546","doi":"10.1007/978-3-030-25674-6_12","title":"Information Ecology to Map the Arctic Information Ecosystem","year":2020,"lang":"en","type":"book-chapter","venue":"Informed decisionmaking for sustainability","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"","keywords":"Arctic; Ecology; Environmental resource management; Resilience (materials science); The arctic; Ecosystem; Computer science; Geography; Environmental science; Oceanography; Biology","score_opus":0.07595091540846031,"score_gpt":0.37672227488969084,"score_spread":0.3007713594812305,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2997328546","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0018644079,0.0117282905,0.13116424,0.009543625,0.002368797,0.000077620425,0.0006710797,0.00081432133,0.8417676],"genre_scores_gemma":[0.04551006,0.028702825,0.17644434,0.004048647,0.0010370602,0.00013033718,0.0024069361,0.0011904248,0.74052936],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99963665,0.00013623634,0.000012599087,0.000038895287,0.00014079614,0.000034692905],"domain_scores_gemma":[0.9993426,0.00030005485,0.000021836544,0.00010941559,0.00016745782,0.00005864162],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.0008390388,0.0005450561,0.00023195363,0.0021549577,0.0010509178,0.0067228526,0.0007936145,0.001115866,0.028898174],"category_scores_gemma":[0.0019833331,0.00026299348,0.00030430502,0.003312092,0.0011993634,0.0061202543,0.002015626,0.0017616333,0.009772504],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000007911849,0.000021409922,0.0003141554,0.0001492687,0.000013601696,0.000061544524,0.00067927164,0.0018128083,0.000485794,0.4588744,0.21103813,0.32654166],"study_design_scores_gemma":[9.3154335e-7,0.0000029215762,0.00023032073,0.00018220914,0.000003854311,0.000072959214,0.00035751125,0.0012112111,0.00023989732,0.08946816,0.90822434,0.0000056728777],"about_ca_topic_score_codex":0.011297301,"about_ca_topic_score_gemma":0.020176899,"teacher_disagreement_score":0.99327713,"about_ca_system_score_codex":0.0017347564,"about_ca_system_score_gemma":0.0021003156,"threshold_uncertainty_score":0.096674025},"labels":[],"label_agreement":null},{"id":"W2999189714","doi":"10.2196/15917","title":"Comparing Methods for Record Linkage for Public Health Action: Matching Algorithm Validation Study","year":2020,"lang":"en","type":"article","venue":"JMIR Public Health and Surveillance","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":29,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"National Institute of Allergy and Infectious Diseases","keywords":"Record linkage; Precision and recall; Context (archaeology); Computer science; Public health; Matching (statistics); Algorithm; Linkage (software); Data mining; Psychological intervention; Medicine; Population; Machine learning; Statistics; Mathematics; Environmental health; Geography","score_opus":0.5653348348544291,"score_gpt":0.5458407834458321,"score_spread":0.019494051408597057,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2999189714","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.3740459,0.0073388168,0.60082185,0.0022390536,0.00055594195,0.008054861,0.0019267051,0.00096498063,0.0040518492],"genre_scores_gemma":[0.69376814,0.0010520251,0.2952469,0.0006861743,0.00012551904,0.006553769,0.0017021348,0.00024375158,0.00062153506],"study_design_codex":"simulation_or_modeling","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.6257295,0.3396651,0.011043575,0.009794334,0.012312925,0.0014544892],"domain_scores_gemma":[0.21523686,0.7230928,0.016081871,0.02620036,0.018628776,0.000759367],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.3686821,0.0019062037,0.0023685126,0.0037516193,0.002030472,0.0032585661,0.004624079,0.004129475,0.0035378307],"category_scores_gemma":[0.6049316,0.0014435704,0.007241153,0.00429608,0.0021295545,0.0066717207,0.0048284684,0.0042082323,0.00053162087],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.018588118,0.004161111,0.22273757,0.005913587,0.02875571,0.00020966356,0.0034921742,0.35542998,0.0007162268,0.035270505,0.007857197,0.31686825],"study_design_scores_gemma":[0.0049489457,0.0061917957,0.026314966,0.0013937056,0.004609703,0.00033626682,0.0007874083,0.9208828,0.0018932001,0.026289826,0.006068611,0.00028278076],"about_ca_topic_score_codex":0.008835145,"about_ca_topic_score_gemma":0.004453322,"teacher_disagreement_score":0.3686821,"about_ca_system_score_codex":0.005749434,"about_ca_system_score_gemma":0.008179414,"threshold_uncertainty_score":0.7785274},"labels":[],"label_agreement":null},{"id":"W2999486412","doi":"","title":"Identification des informations sensibles dans des sources de données hétérogènes","year":2019,"lang":"fr","type":"article","venue":"Archipelago (Université du Québec à Montréal)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Political science; Humanities; Philosophy","score_opus":0.029944044051013256,"score_gpt":0.2398146214254995,"score_spread":0.20987057737448625,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2999486412","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.15083434,0.0047497265,0.80228436,0.0032974796,0.00023947054,0.0013241268,0.0057479013,0.016239231,0.015283374],"genre_scores_gemma":[0.49015328,0.0036495836,0.47171834,0.0007832151,0.00022103061,0.00081843405,0.01108356,0.0015732744,0.019999264],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9809094,0.0029741295,0.0019833432,0.0040987944,0.009384633,0.000649757],"domain_scores_gemma":[0.94948447,0.024278961,0.005711697,0.010260095,0.009456221,0.00080854614],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01016996,0.0016282379,0.0025239908,0.013208215,0.00277349,0.014704283,0.0026333327,0.0035531626,0.0030288612],"category_scores_gemma":[0.048417542,0.0016126083,0.0019165,0.010097324,0.0018747698,0.011593952,0.005370871,0.0029314542,0.0027586387],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0016569641,0.0006379049,0.07212078,0.0029337343,0.0007264328,0.004449283,0.021558901,0.015264328,0.06184922,0.04517961,0.017107677,0.7565152],"study_design_scores_gemma":[0.00018454279,0.00067282113,0.08521493,0.0025717914,0.0015515516,0.008543107,0.014856621,0.31670317,0.21316643,0.10179381,0.25393364,0.000807678],"about_ca_topic_score_codex":0.009501138,"about_ca_topic_score_gemma":0.010281084,"teacher_disagreement_score":0.014704283,"about_ca_system_score_codex":0.002815582,"about_ca_system_score_gemma":0.005419549,"threshold_uncertainty_score":0.05378449},"labels":[],"label_agreement":null},{"id":"W2999637374","doi":"10.1145/3379106.3379118","title":"Winners of 2018 SIGAda Awards","year":2020,"lang":"en","type":"article","venue":"ACM SIGAda Ada Letters","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"General Dynamics (Canada)","funders":"","keywords":"Management; Library science; Engineering; State (computer science); Art history; Art; Computer science; Programming language","score_opus":0.2553201262360162,"score_gpt":0.38521288592447095,"score_spread":0.12989275968845476,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2999637374","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005555152,0.01965418,0.0044161105,0.118208386,0.58845806,0.0006345958,0.0048296615,0.0024758766,0.2557679],"genre_scores_gemma":[0.016092516,0.013084852,0.0026704404,0.010913121,0.068760455,0.00065637403,0.0066275373,0.0015161788,0.8796786],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.98922896,0.0007484951,0.00047731283,0.00063628994,0.006940759,0.0019682387],"domain_scores_gemma":[0.96984756,0.00079489907,0.0005616674,0.0008682147,0.014312858,0.013614757],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0111311525,0.0026020429,0.0018354938,0.005012576,0.0048173293,0.015994025,0.0020217628,0.004802819,0.1427292],"category_scores_gemma":[0.01809884,0.000601854,0.0013662408,0.0031363335,0.0011317827,0.004773174,0.007907355,0.006190983,0.14259915],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00005135446,0.000042189473,0.00017964152,0.000054812077,0.0000058015203,0.000056062694,0.000024827354,0.000048423364,0.000077972276,0.001315259,0.96843106,0.029712697],"study_design_scores_gemma":[0.000018637067,0.000036179717,0.0005790354,0.00006470865,0.000005463988,0.000038846614,0.00012853385,0.00008836849,0.00011284258,0.000839096,0.9980744,0.000013808217],"about_ca_topic_score_codex":0.0039482466,"about_ca_topic_score_gemma":0.008411191,"teacher_disagreement_score":0.1427292,"about_ca_system_score_codex":0.003613044,"about_ca_system_score_gemma":0.007851921,"threshold_uncertainty_score":0.47747672},"labels":[],"label_agreement":null},{"id":"W3006704404","doi":"10.2196/16757","title":"Privacy-Preserving Record Linkage of Deidentified Records Within a Public Health Surveillance System: Evaluation Study","year":2020,"lang":"en","type":"article","venue":"Journal of Medical Internet Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":43,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"NSW Ministry of Health; Department of Health, State Government of Victoria; Department of Health, Government of Western Australia; Monash University; NSW Health Pathology; McGill University; University of New South Wales; Burnet Institute; University of Pennsylvania","keywords":"Record linkage; Medical record; Internet privacy; Public health; Computer science; Medicine; Environmental health; Nursing","score_opus":0.649057499612472,"score_gpt":0.5757913744496808,"score_spread":0.0732661251627913,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3006704404","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9920414,0.0006605253,0.0030846784,0.00046612514,0.000032779815,0.001628214,0.0010928216,0.00005176847,0.0009415996],"genre_scores_gemma":[0.99136704,0.00032860585,0.004583909,0.00015406955,0.000039047347,0.0013992698,0.0019636273,0.000013287042,0.00015110486],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.8990802,0.08320395,0.0049331766,0.0037823871,0.0071047707,0.0018954927],"domain_scores_gemma":[0.7711409,0.15716943,0.02926175,0.019822927,0.017752515,0.0048524095],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08878707,0.00080841326,0.0009285835,0.0019700704,0.0012397906,0.0022518346,0.0021163134,0.0014320163,0.0016488809],"category_scores_gemma":[0.15624402,0.00044328903,0.002416413,0.0029335888,0.0020460326,0.0037358424,0.0033724832,0.0015165024,0.00029966803],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.024822066,0.016792282,0.74931484,0.0032591887,0.0058543566,0.0005939515,0.0053348183,0.012922024,0.0005797037,0.0023823644,0.006207003,0.17193751],"study_design_scores_gemma":[0.00961708,0.10352864,0.7545727,0.0016121068,0.005376488,0.0024840473,0.010643295,0.09591471,0.003323086,0.002751637,0.009873321,0.00030284797],"about_ca_topic_score_codex":0.007113867,"about_ca_topic_score_gemma":0.00343443,"teacher_disagreement_score":0.08878707,"about_ca_system_score_codex":0.0043838266,"about_ca_system_score_gemma":0.0043186746,"threshold_uncertainty_score":0.4695565},"labels":[],"label_agreement":null},{"id":"W3011721738","doi":"10.1101/2020.03.16.20036962","title":"Assessing the quality of clinical and administrative data extracted from hospitals: The General Medicine Inpatient Initiative (GEMINI) experience","year":2020,"lang":"en","type":"preprint","venue":"medRxiv","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Sunnybrook Health Science Centre; Trillium Health Centre; Institute for Clinical Evaluative Sciences; University Health Network; University of Toronto; Health Sciences Centre; Mount Sinai Hospital; Queen's University; St. Michael's Hospital","funders":"","keywords":"Data quality; Gold standard (test); Computer science; Medicine; Quality (philosophy); Quality management; Medical record; Data mining; Database; Missing data; Data collection; Medical physics; Statistics; Machine learning; Operations management; Surgery; Internal medicine; Mathematics","score_opus":0.8098649904626021,"score_gpt":0.6374224943190503,"score_spread":0.17244249614355178,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3011721738","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9397043,0.0018556002,0.024655899,0.006706051,0.00018719338,0.0015779883,0.017546013,0.0014632604,0.00630373],"genre_scores_gemma":[0.8919343,0.00056258537,0.07344418,0.0016879671,0.00013036423,0.00045463545,0.030764587,0.00031657866,0.0007048573],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9270381,0.041010294,0.008049775,0.005554864,0.016561983,0.0017849733],"domain_scores_gemma":[0.6959934,0.16486323,0.025764596,0.043637365,0.06397807,0.005763409],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.12590249,0.00070101634,0.00089613587,0.003616771,0.0011579242,0.0042264108,0.0031453331,0.0009982294,0.0007467061],"category_scores_gemma":[0.25267297,0.0006401864,0.0010225923,0.008205847,0.002187168,0.0023725417,0.0047869273,0.0013931713,0.0002915593],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012560834,0.0003539211,0.8528337,0.0008685919,0.00063416053,0.00020506914,0.0067886007,0.008416928,0.0015580684,0.0026043153,0.01926638,0.10521419],"study_design_scores_gemma":[0.00048143943,0.0011081151,0.87050784,0.0009860486,0.00060871226,0.0007337841,0.005671756,0.05673925,0.0097545525,0.003419993,0.049683332,0.00030521056],"about_ca_topic_score_codex":0.08794669,"about_ca_topic_score_gemma":0.07895877,"teacher_disagreement_score":0.8740975,"about_ca_system_score_codex":0.009395327,"about_ca_system_score_gemma":0.010418579,"threshold_uncertainty_score":0.66584396},"labels":[],"label_agreement":null},{"id":"W3012331815","doi":"10.1108/rmj-03-2019-0010","title":"The adoption of electronic records management system (ERMS) in the Yemeni oil and gas sector","year":2020,"lang":"en","type":"article","venue":"Records Management Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":27,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Business; Context (archaeology); Ranking (information retrieval); Knowledge management; Originality; Identification (biology); Marketing; Computer science; Qualitative research; Geography","score_opus":0.07092484439600934,"score_gpt":0.3248076612507608,"score_spread":0.2538828168547515,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3012331815","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9159181,0.07190769,0.000504387,0.0041383626,0.000051890158,0.0001890218,0.00076691905,0.000013674488,0.0065101264],"genre_scores_gemma":[0.9617368,0.03549719,0.0013485269,0.0004051318,0.00002024446,0.00009743175,0.00034873025,0.0000027133922,0.0005432553],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9962287,0.0017447884,0.00069501944,0.00022174246,0.0007944759,0.0003152696],"domain_scores_gemma":[0.98357636,0.008161293,0.0053197443,0.00015537543,0.0025364757,0.00025082697],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005560061,0.0003399612,0.0003183399,0.004136806,0.00079858454,0.0021018772,0.00042193715,0.0005855804,0.00088574545],"category_scores_gemma":[0.011262579,0.00024047017,0.0003528469,0.0074465745,0.0006154056,0.0016615744,0.0007502199,0.00046419338,0.00008645017],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00029704912,0.00020247603,0.5979619,0.026808146,0.00038961155,0.004663122,0.019224249,0.0011332689,0.0052322997,0.00411441,0.0029642826,0.33700916],"study_design_scores_gemma":[0.00002772903,0.000598985,0.8708739,0.013324229,0.0005448497,0.0013598122,0.077200316,0.0008913572,0.0035006811,0.0003663485,0.031243768,0.00006788752],"about_ca_topic_score_codex":0.02456659,"about_ca_topic_score_gemma":0.036934715,"teacher_disagreement_score":0.02456659,"about_ca_system_score_codex":0.0037209168,"about_ca_system_score_gemma":0.008715953,"threshold_uncertainty_score":0.0488472},"labels":[],"label_agreement":null},{"id":"W3013218212","doi":"10.23889/ijpds.v4i2.1133","title":"Population Data BC: Supporting population data science in British Columbia.","year":2019,"lang":"en","type":"article","venue":"PubMed","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":28,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of British Columbia; The Quebec Population Health Research Network","funders":"","keywords":"Data access; Computer science; Variety (cybernetics); Data science; Data governance; Data quality; Identifier; Population; Linkage (software); Linked data; Record linkage; Data management; Process (computing); Database; World Wide Web; Business; Service (business)","score_opus":0.28120928523712746,"score_gpt":0.41126158589052864,"score_spread":0.13005230065340118,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3013218212","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0036323564,0.0045289835,0.015567853,0.029583191,0.0017178976,0.0012890379,0.66005826,0.009765438,0.27385697],"genre_scores_gemma":[0.053738646,0.0100527285,0.067203715,0.013398941,0.00054141774,0.005124398,0.56070024,0.0058110855,0.28342894],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.992603,0.0012802389,0.0007372224,0.00094989367,0.003768647,0.0006610972],"domain_scores_gemma":[0.9379489,0.010520026,0.0017170474,0.0057799565,0.03702592,0.0070081027],"candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.01020786,0.0010025458,0.0011149888,0.007739485,0.0048652515,0.0071730064,0.004170171,0.001866187,0.12884247],"category_scores_gemma":[0.05756055,0.0011405308,0.0005880545,0.016954407,0.001676007,0.003064901,0.005936782,0.0039419266,0.040990364],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00005379331,0.000024234754,0.004962574,0.00046875773,0.000032166423,0.00012145642,0.00038551827,0.00034289912,0.00022325727,0.005970839,0.9118181,0.075596355],"study_design_scores_gemma":[0.000031708434,0.0000059350805,0.01558124,0.0011653379,0.000019552986,0.000044763332,0.0003588766,0.00084714877,0.00022129565,0.0034831283,0.978196,0.000045046443],"about_ca_topic_score_codex":0.9405252,"about_ca_topic_score_gemma":0.92425287,"teacher_disagreement_score":0.9958298,"about_ca_system_score_codex":0.029866632,"about_ca_system_score_gemma":0.14579868,"threshold_uncertainty_score":0.43102103},"labels":[],"label_agreement":null},{"id":"W3015809928","doi":"10.1016/j.knosys.2020.105881","title":"A situation refinement model for complex event processing","year":2020,"lang":"en","type":"article","venue":"Knowledge-Based Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Event (particle physics); Process mining; Complex event processing; Process (computing); Context (archaeology); Data mining; Set (abstract data type); Task (project management); Domain (mathematical analysis); Domain knowledge; Artificial intelligence; Work in process; Programming language; Business process management","score_opus":0.4712097033115339,"score_gpt":0.45519512028276765,"score_spread":0.01601458302876624,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3015809928","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00267286,0.000054254095,0.99342865,0.00023720165,0.000026704762,0.0000958331,0.00021757216,0.00053419766,0.0027327088],"genre_scores_gemma":[0.2660362,0.00033529106,0.72407794,0.0002728883,0.00008130249,0.00044463435,0.0011567409,0.00018502446,0.0074099475],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99812025,0.0005117971,0.00021251131,0.00040772295,0.0005570699,0.00019055605],"domain_scores_gemma":[0.9962535,0.002073756,0.00025103218,0.00053375534,0.0007206278,0.00016723514],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003121011,0.0008014208,0.0007440846,0.0014068077,0.0008138271,0.0027576631,0.0027058367,0.00148658,0.008457823],"category_scores_gemma":[0.00909016,0.000714544,0.0019051887,0.0014615754,0.0013527207,0.004458682,0.0020320225,0.0021211607,0.0018805391],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00031779168,0.00019224142,0.0017458668,0.00025545803,0.00012747425,0.00058951817,0.0012509007,0.36202973,0.0036407262,0.5432106,0.0053185923,0.08132108],"study_design_scores_gemma":[0.00004308645,0.000039870956,0.00018292147,0.000032487893,0.000059681544,0.00010380611,0.00009160543,0.8536857,0.0010648367,0.13789292,0.006772738,0.000030377758],"about_ca_topic_score_codex":0.017779557,"about_ca_topic_score_gemma":0.012977593,"teacher_disagreement_score":0.017779557,"about_ca_system_score_codex":0.0014674056,"about_ca_system_score_gemma":0.002270098,"threshold_uncertainty_score":0.03535217},"labels":[],"label_agreement":null},{"id":"W3016677020","doi":"10.1109/access.2020.2988120","title":"Sampling for Big Data Profiling: A Survey","year":2020,"lang":"en","type":"article","venue":"IEEE Access","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":32,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"National Natural Science Foundation of China","keywords":"Big data; Profiling (computer programming); Computer science; Data mining; Metadata; Data science; World Wide Web","score_opus":0.9190001080756124,"score_gpt":0.5835216452442223,"score_spread":0.33547846283139005,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3016677020","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008745376,0.6270015,0.3370054,0.00833048,0.002023998,0.00059492374,0.001279431,0.0018441044,0.013174844],"genre_scores_gemma":[0.13169444,0.6642568,0.18657814,0.0037116439,0.0058964207,0.0008457823,0.0034927656,0.00057114626,0.0029529247],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9881016,0.0037862684,0.0011726718,0.0018262898,0.004706936,0.00040618077],"domain_scores_gemma":[0.9721709,0.018949112,0.0013039593,0.002916946,0.0039855368,0.00067353115],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009235054,0.0023209963,0.0032725655,0.006415248,0.0014618573,0.005181494,0.0038983186,0.0023403717,0.002397871],"category_scores_gemma":[0.028936286,0.0013262394,0.0021991504,0.013482039,0.0019094968,0.009626735,0.0027634364,0.0024423283,0.0017973499],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00024998712,0.00018930472,0.010847494,0.0060843583,0.00020805397,0.00020084884,0.00051452615,0.009525438,0.001670759,0.040098615,0.023447718,0.90696293],"study_design_scores_gemma":[0.00011814913,0.000847649,0.016685499,0.0075549274,0.0005013512,0.003457722,0.002967736,0.15713422,0.011275595,0.17312407,0.62587774,0.00045538362],"about_ca_topic_score_codex":0.003118262,"about_ca_topic_score_gemma":0.0013246874,"teacher_disagreement_score":0.009235054,"about_ca_system_score_codex":0.0014253822,"about_ca_system_score_gemma":0.0025663893,"threshold_uncertainty_score":0.048840225},"labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"not_applicable","genre":"review","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":[],"domain":null,"study_design":"design_other","genre":"review","about_ca_system":false,"about_ca_topic":false,"confidence":"medium"}],"label_agreement":"split"},{"id":"W3023802345","doi":"10.1093/jamia/ocaa031","title":"Assessment of the Nursing Quality Indicators for Reporting and Evaluation (NQuIRE) database using a data quality index","year":2020,"lang":"en","type":"article","venue":"Journal of the American Medical Informatics Association","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":16,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Registered Nurses' Association of Ontario","funders":"Government of Ontario","keywords":"Data quality; Database; Quality (philosophy); Metric (unit); Index (typography); Computer science; Quality management; Data mining; Operations management; Engineering; World Wide Web","score_opus":0.46353160777092506,"score_gpt":0.5916964321350855,"score_spread":0.12816482436416043,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3023802345","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"evaluation","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"evaluation","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1250956,0.0025466026,0.7628106,0.022013446,0.0010462963,0.0116726635,0.01132833,0.0035428845,0.059943683],"genre_scores_gemma":[0.28476086,0.0010995779,0.7001035,0.0010988893,0.00021402066,0.005016876,0.0052549057,0.00027586013,0.002175497],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.8266107,0.060048796,0.044699837,0.0060465625,0.060736228,0.0018578891],"domain_scores_gemma":[0.58877397,0.12596214,0.049595222,0.041426346,0.18912394,0.005118361],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.14523695,0.0007421983,0.0014812696,0.01916812,0.0033352806,0.010713631,0.0034330185,0.0012072416,0.0017729704],"category_scores_gemma":[0.25966394,0.0005037277,0.0011346175,0.014137399,0.0017932899,0.007853377,0.0065290723,0.0022170425,0.0006653101],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00039993765,0.000639027,0.21337985,0.002695876,0.00041519766,0.00041684098,0.008507279,0.006612929,0.004370944,0.093979225,0.03338852,0.63519436],"study_design_scores_gemma":[0.0003385796,0.0030082848,0.23419823,0.00766831,0.0009398398,0.0021022293,0.024511121,0.12524882,0.040014815,0.08240508,0.47831127,0.0012534293],"about_ca_topic_score_codex":0.0133792665,"about_ca_topic_score_gemma":0.010445362,"teacher_disagreement_score":0.85476303,"about_ca_system_score_codex":0.009776201,"about_ca_system_score_gemma":0.016856084,"threshold_uncertainty_score":0.7680956},"labels":[],"label_agreement":null},{"id":"W3023807074","doi":"10.1002/cpe.5746","title":"Data linking over RDF knowledge graphs: A survey","year":2020,"lang":"en","type":"article","venue":"Concurrency and Computation Practice and Experience","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Chicoutimi; Université du Québec à Montréal","funders":"","keywords":"Computer science; Matching (statistics); Relation (database); Context (archaeology); Process (computing); Task (project management); RDF; Data science; Asset (computer security); Information retrieval; Object (grammar); Data mining; Semantic Web; Artificial intelligence; Mathematics; Programming language","score_opus":0.48924196060170927,"score_gpt":0.5236692874574922,"score_spread":0.034427326855782925,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3023807074","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.020495845,0.4885844,0.42223382,0.006807708,0.0004685004,0.00038279503,0.003561931,0.0032703872,0.054194618],"genre_scores_gemma":[0.14721356,0.6254916,0.20932359,0.002662921,0.0009775324,0.00034228736,0.009028557,0.0007788359,0.004181139],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9945391,0.0017782244,0.0006140903,0.0010687697,0.0017440866,0.00025565448],"domain_scores_gemma":[0.98275626,0.013230452,0.0008323733,0.0018336232,0.0011760081,0.00017130125],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007438621,0.00087140716,0.0013881947,0.014928176,0.0008139931,0.0037626585,0.0022327302,0.0016064384,0.0034432788],"category_scores_gemma":[0.01627914,0.0011535458,0.0017813093,0.021578204,0.0012075825,0.011161915,0.0029658657,0.0012656944,0.0012472145],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000052970263,0.00009972823,0.0055751344,0.0056071407,0.00021067054,0.00021219833,0.0004786197,0.015834607,0.0008024068,0.112561785,0.022892786,0.835672],"study_design_scores_gemma":[0.000020354117,0.000065765526,0.005336038,0.0065829405,0.00022245578,0.0014465187,0.0012982484,0.047575578,0.0041435137,0.16338791,0.76981175,0.00010876353],"about_ca_topic_score_codex":0.0050549065,"about_ca_topic_score_gemma":0.0029028363,"teacher_disagreement_score":0.014928176,"about_ca_system_score_codex":0.0018106514,"about_ca_system_score_gemma":0.0018976579,"threshold_uncertainty_score":0.039339602},"labels":[],"label_agreement":null},{"id":"W3027407410","doi":"10.1108/rmj-09-2019-0055","title":"Natural language processing and machine learning as practical toolsets for archival processing","year":2020,"lang":"en","type":"article","venue":"Records Management Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":39,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Saskatchewan","funders":"","keywords":"Workflow; Artificial intelligence; Computer science; Machine learning; Implementation; Interoperability; USable; Natural language processing; Originality; Software engineering; Database; World Wide Web","score_opus":0.1476724865815801,"score_gpt":0.43580338208965674,"score_spread":0.28813089550807663,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3027407410","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0057413145,0.14018059,0.70110726,0.06750117,0.002172689,0.0011590802,0.00056619634,0.0021849028,0.07938693],"genre_scores_gemma":[0.06262898,0.096039,0.82165694,0.0073970095,0.0020807316,0.0016996125,0.00061572716,0.00056235364,0.007319671],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.94616127,0.03675428,0.004505678,0.0023233013,0.009712034,0.0005435274],"domain_scores_gemma":[0.8557936,0.117948465,0.0044564884,0.011891423,0.008965158,0.00094485225],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06671011,0.0012610417,0.0012831385,0.011876182,0.002052407,0.018268168,0.0034635619,0.0033254942,0.004894954],"category_scores_gemma":[0.06450071,0.000886089,0.0012197904,0.009374913,0.013777899,0.022310559,0.0060558915,0.0054326984,0.0020128053],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000050560946,0.00008872368,0.00091752334,0.0073923506,0.000063199135,0.0002553493,0.0043861554,0.0017418491,0.0012126934,0.6416238,0.009980859,0.33228698],"study_design_scores_gemma":[0.000026463871,0.00012600714,0.0011775154,0.01015419,0.000058388017,0.00057335384,0.0052909926,0.004326588,0.0027453352,0.5088413,0.46656418,0.00011571869],"about_ca_topic_score_codex":0.0022262174,"about_ca_topic_score_gemma":0.0019629335,"teacher_disagreement_score":0.06671011,"about_ca_system_score_codex":0.0053183567,"about_ca_system_score_gemma":0.010260755,"threshold_uncertainty_score":0.35280097},"labels":[],"label_agreement":null},{"id":"W3033222122","doi":"","title":"Improving and assessing data quality of knowledge graphs","year":2020,"lang":"en","type":"dissertation","venue":"Ghent University Academic Bibliography (Ghent University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"Vlaamse regering; Universiteit Gent; European Commission; Fonds Wetenschappelijk Onderzoek; Agentschap Innoveren en Ondernemen","keywords":"Knowledge graph; Data science; Computer science; Quality (philosophy); Data quality; Information retrieval; Data mining; Natural language processing; Engineering; Epistemology; Operations management; Philosophy","score_opus":0.24364253656691043,"score_gpt":0.4041145478195157,"score_spread":0.1604720112526053,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3033222122","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.22319825,0.011277196,0.7150935,0.0067015556,0.001154777,0.0011090873,0.019349437,0.01252465,0.009591569],"genre_scores_gemma":[0.60523456,0.0030102863,0.35806522,0.000891284,0.00035290676,0.0004899644,0.02793379,0.001714803,0.0023072711],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.94804966,0.016141754,0.005517213,0.0059398017,0.023054896,0.0012966662],"domain_scores_gemma":[0.7008514,0.18373989,0.021006199,0.032112736,0.059588633,0.0027011929],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03925596,0.0018137876,0.0018679474,0.015228887,0.0017445317,0.010123495,0.004100905,0.003027065,0.0022393004],"category_scores_gemma":[0.26336926,0.0011955474,0.0020453103,0.010915241,0.0028326064,0.009781123,0.005135585,0.0027674483,0.0006180368],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019021102,0.00047364837,0.103928365,0.006013528,0.0018150661,0.0010275559,0.004370356,0.23471849,0.008776274,0.05009749,0.027823234,0.5590539],"study_design_scores_gemma":[0.00031935755,0.00052851246,0.036940146,0.0016661006,0.0010401987,0.00075512164,0.0033876933,0.70764357,0.019288966,0.17910816,0.049009174,0.000312974],"about_ca_topic_score_codex":0.01382208,"about_ca_topic_score_gemma":0.012448,"teacher_disagreement_score":0.03925596,"about_ca_system_score_codex":0.003799811,"about_ca_system_score_gemma":0.0039884574,"threshold_uncertainty_score":0.20760787},"labels":[],"label_agreement":null},{"id":"W3035096436","doi":"","title":"A comparison of machine learning classifiers for use on historical record linkage","year":2020,"lang":"en","type":"dissertation","venue":"The Atrium (University of Guelph)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Linkage (software); Artificial intelligence; Record linkage; Machine learning; Computer science; Biology; Sociology; Genetics; Demography","score_opus":0.19990060368948404,"score_gpt":0.3669767055172541,"score_spread":0.16707610182777005,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3035096436","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5908546,0.042665526,0.313981,0.004172657,0.004242271,0.0016240877,0.0071677933,0.008870741,0.026421523],"genre_scores_gemma":[0.7495992,0.0088415295,0.22639854,0.00048512514,0.0006678874,0.0007356745,0.007902236,0.00038560026,0.004984224],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9865736,0.0059207026,0.0014286498,0.0014409792,0.003994668,0.0006414566],"domain_scores_gemma":[0.93929964,0.04617658,0.0013871207,0.0028571957,0.009712821,0.00056663237],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.026490273,0.0019636042,0.0025031203,0.0074859327,0.0014732316,0.0027519334,0.002219542,0.002491962,0.0022941544],"category_scores_gemma":[0.06103544,0.00047538872,0.0017854008,0.0059132297,0.0005002531,0.004331979,0.0012903068,0.0021894877,0.0014153233],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0033348245,0.0007333351,0.027148226,0.0007494845,0.0012048576,0.00015593204,0.00021823123,0.08972984,0.0010800093,0.0034700956,0.013476301,0.85869896],"study_design_scores_gemma":[0.00023091453,0.0016258392,0.018546773,0.0004122498,0.0005085746,0.00021432615,0.00057833805,0.9585096,0.004349293,0.005902534,0.008997856,0.0001236053],"about_ca_topic_score_codex":0.012233228,"about_ca_topic_score_gemma":0.0068000657,"teacher_disagreement_score":0.026490273,"about_ca_system_score_codex":0.0023219383,"about_ca_system_score_gemma":0.002179178,"threshold_uncertainty_score":0.14009559},"labels":[],"label_agreement":null},{"id":"W3036298035","doi":"10.18438/eblip29746","title":"Researchers at Arab Universities Hold Positive Views on Research Data Management and Data Sharing","year":2020,"lang":"en","type":"article","venue":"Evidence Based Library and Information Practice","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Data sharing; Data management; Metadata; Data management plan; Confidentiality; Publishing; Research data; Scholarly communication; Psychology; Medical education; World Wide Web; Computer science; Political science; Medicine; Data curation; Alternative medicine","score_opus":0.6510536390123486,"score_gpt":0.5121208040241152,"score_spread":0.1389328349882334,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3036298035","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.48903316,0.045715593,0.010920575,0.19247176,0.0032027527,0.0003463307,0.0006583402,0.000573631,0.25707784],"genre_scores_gemma":[0.92165875,0.022436976,0.0064545595,0.02942617,0.0012822099,0.0001731145,0.00026085868,0.00007664778,0.018230803],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.97094065,0.016296193,0.0021383578,0.0011635534,0.007198578,0.0022626512],"domain_scores_gemma":[0.83223313,0.07440626,0.022950038,0.008680784,0.041840203,0.01988962],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.04322668,0.0006095707,0.0005154754,0.003741007,0.0075198323,0.009883303,0.0009514771,0.0031507874,0.013160241],"category_scores_gemma":[0.06313171,0.00045353814,0.0006203969,0.005731961,0.0068522547,0.007735776,0.006039193,0.002418623,0.0033863732],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00031123258,0.00048177052,0.14349802,0.005666848,0.00031911043,0.0018236486,0.22825707,0.0004935819,0.006331954,0.027733663,0.10297608,0.482107],"study_design_scores_gemma":[0.000056366007,0.0004739548,0.06833984,0.003062983,0.00013020291,0.003700649,0.40702146,0.00023847974,0.0021206278,0.008656873,0.50591314,0.00028548195],"about_ca_topic_score_codex":0.0028497877,"about_ca_topic_score_gemma":0.004256173,"teacher_disagreement_score":0.95677334,"about_ca_system_score_codex":0.0031004823,"about_ca_system_score_gemma":0.009313035,"threshold_uncertainty_score":0.22860724},"labels":[],"label_agreement":null},{"id":"W3040360098","doi":"10.1017/ssh.2020.15","title":"Selection Bias Encountered in the Systematic Linking of Historical Census Records","year":2020,"lang":"en","type":"article","venue":"Social Science History","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"St. Francis Xavier University; University of Guelph","funders":"","keywords":"Census; Selection bias; Matching (statistics); Sample (material); Population; Selection (genetic algorithm); Sampling bias; Econometrics; Statistics; Information bias; Genealogy; Geography; Sample size determination; Computer science; Sociology; Economics; History; Demography; Mathematics; Artificial intelligence","score_opus":0.44764715922640047,"score_gpt":0.3994208451867887,"score_spread":0.04822631403961175,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3040360098","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.19913359,0.0044019115,0.7488305,0.012118432,0.0014673052,0.003147168,0.0016961902,0.00047490525,0.028730087],"genre_scores_gemma":[0.7028323,0.0018049165,0.28324124,0.003925637,0.0006783655,0.002477988,0.0007184132,0.00019335323,0.0041278186],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.69519496,0.24276236,0.015195417,0.009784671,0.035150208,0.0019124149],"domain_scores_gemma":[0.44444162,0.41968545,0.049630392,0.056887835,0.028260207,0.001094543],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.20402387,0.00042792136,0.00084803795,0.0040483195,0.0034984995,0.0035352863,0.0018897518,0.0015649393,0.0024437564],"category_scores_gemma":[0.48966798,0.0007767181,0.0006188514,0.009310365,0.0055186427,0.0033903955,0.0044789454,0.0016647958,0.0007264636],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006872382,0.00020723674,0.30848864,0.0032719611,0.0011907921,0.001456809,0.030107716,0.0065840697,0.005692856,0.19627474,0.02185122,0.42418677],"study_design_scores_gemma":[0.0003290225,0.0010742925,0.26939905,0.00845739,0.0014386964,0.004434175,0.019052854,0.026295403,0.024543952,0.4004521,0.24408369,0.00043937683],"about_ca_topic_score_codex":0.008970401,"about_ca_topic_score_gemma":0.011993629,"teacher_disagreement_score":0.79597616,"about_ca_system_score_codex":0.0028357152,"about_ca_system_score_gemma":0.004123814,"threshold_uncertainty_score":0.98158026},"labels":[],"label_agreement":null},{"id":"W3042293458","doi":"10.1145/3328747","title":"Characterizing Disinformation Risk to Open Data in the Post-Truth Era","year":2020,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":34,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Dalhousie University","funders":"","keywords":"Disinformation; Open data; Computer science; Data science; Data quality; Big data; Analytics; Harm; Transparency (behavior); Quality (philosophy); Business intelligence; Social media; Internet privacy; Computer security; Risk analysis (engineering); Business; Data mining; World Wide Web; Political science; Marketing","score_opus":0.4065919786832916,"score_gpt":0.48860726632065876,"score_spread":0.08201528763736715,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3042293458","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.75900084,0.001642472,0.08908599,0.054072674,0.00014312493,0.00059214653,0.0008559813,0.00016788497,0.0944389],"genre_scores_gemma":[0.9897592,0.00037318896,0.007515496,0.00091894215,0.00004354352,0.00007322928,0.00013199497,0.000034959918,0.0011494196],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9558169,0.023988439,0.0017526266,0.0021398235,0.012818224,0.0034838358],"domain_scores_gemma":[0.60500497,0.3065259,0.044601902,0.016419522,0.02409555,0.003352159],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.041423514,0.000470222,0.00048192294,0.0058464287,0.0068922588,0.0121227335,0.0016104386,0.0047402005,0.003026488],"category_scores_gemma":[0.20968719,0.0005157298,0.00075986347,0.0052108583,0.013521962,0.014981033,0.0068663433,0.0071728397,0.00026905735],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00048293386,0.00023591261,0.15659629,0.0006524089,0.00013438358,0.003994393,0.17824255,0.013168518,0.0025085108,0.58481145,0.0077867955,0.051385842],"study_design_scores_gemma":[0.00005641285,0.00027098032,0.08168539,0.0023060823,0.00019746152,0.0033526977,0.30198038,0.05805468,0.0072291237,0.44284326,0.10161298,0.00041059408],"about_ca_topic_score_codex":0.0576504,"about_ca_topic_score_gemma":0.057378598,"teacher_disagreement_score":0.99838954,"about_ca_system_score_codex":0.014189031,"about_ca_system_score_gemma":0.009671052,"threshold_uncertainty_score":0.21907109},"labels":[],"label_agreement":null},{"id":"W3043650557","doi":"10.5220/0009820201930199","title":"Toward a New Quality Measurement Model for Big Data","year":2020,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Computer science; Quality (philosophy); Big data; Data modeling; Data science; Data mining; Database","score_opus":0.964848145575868,"score_gpt":0.5473252033427349,"score_spread":0.417522942233133,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3043650557","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.004321741,0.00018012364,0.9865672,0.005224273,0.0001197927,0.0001514892,0.0001470892,0.00041605756,0.002872273],"genre_scores_gemma":[0.21832749,0.00044726158,0.77686006,0.0012166072,0.0002840068,0.0005970046,0.00047221614,0.00018107066,0.0016143362],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9747791,0.010583689,0.00221963,0.0033055174,0.008230567,0.0008815439],"domain_scores_gemma":[0.92741275,0.027071375,0.006901673,0.0084377965,0.027735615,0.002440811],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.029529171,0.0012124036,0.0017654132,0.004515493,0.0016779909,0.011825863,0.004165934,0.002617681,0.0022484162],"category_scores_gemma":[0.07963712,0.0009330498,0.0017752311,0.0044260575,0.003190778,0.021065127,0.005165342,0.0057509905,0.00083909166],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013408175,0.00036718944,0.01416576,0.00048164613,0.0002980737,0.00007522603,0.0011755106,0.05400685,0.0017263041,0.78700405,0.010681895,0.1298833],"study_design_scores_gemma":[0.000041712887,0.00015602694,0.0026000969,0.00025792627,0.0001165556,0.00008207189,0.0005331383,0.45897204,0.0013174941,0.5253649,0.010482811,0.000075341704],"about_ca_topic_score_codex":0.008341121,"about_ca_topic_score_gemma":0.007634374,"teacher_disagreement_score":0.029529171,"about_ca_system_score_codex":0.005341462,"about_ca_system_score_gemma":0.008347102,"threshold_uncertainty_score":0.15616703},"labels":[],"label_agreement":null},{"id":"W3046273131","doi":"10.29173/jchla29436","title":"Implementing a Three-Tiered Service Model for Knowledge Syntheses at an Academic Teaching Hospital","year":2020,"lang":"en","type":"article","venue":"Journal of the Canadian Health Libraries Association / Journal de l Association de bilbiothèques de la santé du Canada","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"University Health Network; University of Toronto","funders":"","keywords":"Publishing; Service model; Service (business); Computer science; Knowledge management; Control (management); Engineering management; World Wide Web; Data science; Business; Engineering; Political science","score_opus":0.06125921148517065,"score_gpt":0.3562460078358835,"score_spread":0.29498679635071284,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3046273131","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.029774034,0.0012573424,0.6622922,0.16651613,0.0033510334,0.04658242,0.0021409737,0.028828114,0.05925777],"genre_scores_gemma":[0.056807324,0.00068619195,0.8953375,0.013833931,0.0007008939,0.017888755,0.00085907435,0.0016970785,0.012189164],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.7493748,0.1687883,0.026094371,0.008921099,0.035383966,0.011437452],"domain_scores_gemma":[0.4814693,0.18888642,0.023514295,0.062850066,0.14576405,0.09751582],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.28250274,0.0016627682,0.0020907032,0.011775341,0.0098579,0.020640446,0.00969884,0.0077842735,0.038587466],"category_scores_gemma":[0.27338386,0.0033448408,0.0036687753,0.013063204,0.005737132,0.017654879,0.029548831,0.008862387,0.025260111],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0023536403,0.005185441,0.012532329,0.0046139625,0.0006302333,0.0011589614,0.02378712,0.007067223,0.0059670885,0.05574772,0.18417831,0.696778],"study_design_scores_gemma":[0.0049108844,0.00410912,0.013561714,0.006240013,0.0005452202,0.0014877217,0.015180538,0.06404011,0.007839152,0.13399084,0.74637043,0.0017242418],"about_ca_topic_score_codex":0.037624437,"about_ca_topic_score_gemma":0.07154812,"teacher_disagreement_score":0.9617987,"about_ca_system_score_codex":0.038201287,"about_ca_system_score_gemma":0.24001597,"threshold_uncertainty_score":0.88480186},"labels":[],"label_agreement":null},{"id":"W3046721769","doi":"10.3233/sji-200658","title":"A vision on future advanced data collection","year":2020,"lang":"en","type":"article","venue":"Statistical Journal of the IAOS","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Statistics Canada","funders":"","keywords":"Data collection; Metadata; Confidentiality; Big data; Computer science; Data science; Data governance; Data quality; Process (computing); Business; Knowledge management; Marketing; World Wide Web; Data mining; Computer security; Sociology","score_opus":0.2210306705076511,"score_gpt":0.470280161569638,"score_spread":0.24924949106198688,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3046721769","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0017429887,0.10183913,0.08991485,0.7640957,0.01491548,0.00043212078,0.001991541,0.0012873993,0.023780735],"genre_scores_gemma":[0.05058646,0.2122102,0.5211302,0.16187096,0.022165313,0.0027697159,0.0074986573,0.0008538097,0.020914698],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.92077065,0.04314978,0.0067118346,0.0057794526,0.019559966,0.004028211],"domain_scores_gemma":[0.6848323,0.16305065,0.008590662,0.041414347,0.0794645,0.022647504],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.18006995,0.002247368,0.0033270624,0.009443745,0.0049266373,0.02441675,0.00988664,0.016427144,0.017534142],"category_scores_gemma":[0.14461869,0.0015663853,0.0051509487,0.011463317,0.01694724,0.050760422,0.0152116055,0.022201002,0.009234736],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022990127,0.00045651922,0.0026538973,0.002910776,0.00018628193,0.00015421363,0.00182824,0.0018606586,0.000633813,0.429094,0.2505592,0.30943248],"study_design_scores_gemma":[0.000055613844,0.00016362194,0.0014813815,0.0039374963,0.000050742947,0.00015792964,0.0021231761,0.0014504765,0.0002941316,0.25625837,0.73391116,0.00011594249],"about_ca_topic_score_codex":0.009710531,"about_ca_topic_score_gemma":0.0053762486,"teacher_disagreement_score":0.18006995,"about_ca_system_score_codex":0.010025708,"about_ca_system_score_gemma":0.058719628,"threshold_uncertainty_score":0.9523123},"labels":[],"label_agreement":null},{"id":"W304693962","doi":"10.1007/978-3-319-13186-3_34","title":"Models for Distributed, Large Scale Data Cleaning","year":2014,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Computer science; Data quality; Big data; Data mining; Dynamic data; Scale (ratio); Data stream mining; Variety (cybernetics); Distributed computing; Real-time computing; Database; Artificial intelligence","score_opus":0.17030871493081626,"score_gpt":0.3783480416925222,"score_spread":0.20803932676170592,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W304693962","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0014696047,0.0005551538,0.9955706,0.0005142321,0.00007658926,0.00003069954,0.0002430592,0.000463343,0.0010767871],"genre_scores_gemma":[0.24005029,0.003305811,0.72975856,0.00088896375,0.00065618905,0.0010256055,0.0024573335,0.0009247604,0.02093252],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99792945,0.00090019003,0.00014464445,0.00042775934,0.00045281067,0.00014519812],"domain_scores_gemma":[0.9892757,0.007953207,0.00049104664,0.0012460026,0.0007967301,0.00023729222],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0042807586,0.0011724137,0.0019093417,0.0008727097,0.0008333764,0.0030400238,0.004388974,0.002231752,0.0074893134],"category_scores_gemma":[0.017726324,0.0010942797,0.0019227307,0.0020008304,0.0011964685,0.004669081,0.0023066248,0.003977892,0.0024484163],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001123768,0.000084404266,0.0007402058,0.00021771375,0.0001518247,0.000083546554,0.00011731409,0.7448041,0.00055218296,0.17732045,0.013257139,0.062558696],"study_design_scores_gemma":[0.000013533538,0.000009596249,0.00007205511,0.0000141827295,0.00001651452,0.0000242223,0.000012252329,0.8671008,0.00016174764,0.13017382,0.0023913188,0.000009956846],"about_ca_topic_score_codex":0.0070220185,"about_ca_topic_score_gemma":0.008521091,"teacher_disagreement_score":0.0074893134,"about_ca_system_score_codex":0.0017491773,"about_ca_system_score_gemma":0.0019354114,"threshold_uncertainty_score":0.025054276},"labels":[],"label_agreement":null},{"id":"W3047731084","doi":"10.23889/ijpds.v5i2.1383","title":"Prospective data linkage to facilitate COVID-19 trials – A call to action","year":2020,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia; Institute for Work & Health; Process Simulations Limited (Canada); British Columbia Environmental and Occupational Health Research Network; University of Toronto","funders":"Medical Research Council","keywords":"Coronavirus disease 2019 (COVID-19); Linkage (software); Call to action; Record linkage; Severe acute respiratory syndrome coronavirus 2 (SARS-CoV-2); 2019-20 coronavirus outbreak; Clinical trial; Data science; Computer science; Business; Medicine; Outbreak; Biology; Virology; Marketing; Environmental health; Internal medicine; Disease; Infectious disease (medical specialty)","score_opus":0.8802420608172462,"score_gpt":0.6327254420537285,"score_spread":0.24751661876351772,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3047731084","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0003324714,0.004294803,0.020671772,0.95856255,0.010216005,0.0006844114,0.0012058945,0.0010706481,0.0029615252],"genre_scores_gemma":[0.009030141,0.008713582,0.308643,0.6352689,0.020514758,0.004893412,0.006748064,0.0013422649,0.004845814],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.36054176,0.5174454,0.044459075,0.011854911,0.055102084,0.010596885],"domain_scores_gemma":[0.07546492,0.5845045,0.03315001,0.10854626,0.1403177,0.05801658],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.711844,0.0028877116,0.008794571,0.0111531075,0.007042426,0.034387518,0.018482577,0.04085687,0.044035632],"category_scores_gemma":[0.78390336,0.0038126917,0.012642805,0.017821684,0.016637158,0.067096,0.034968816,0.06508334,0.022724057],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005538994,0.000319899,0.0033473563,0.0018212169,0.0004917283,0.00013620402,0.0018463569,0.0007187462,0.00018589348,0.03114024,0.8441309,0.11530764],"study_design_scores_gemma":[0.0009036519,0.00035284428,0.003668848,0.009522981,0.00032444406,0.0002388163,0.0023636683,0.0020894383,0.000381088,0.089124285,0.89052117,0.0005088255],"about_ca_topic_score_codex":0.017607309,"about_ca_topic_score_gemma":0.014870185,"teacher_disagreement_score":0.28815597,"about_ca_system_score_codex":0.012751304,"about_ca_system_score_gemma":0.11513181,"threshold_uncertainty_score":0.3553477},"labels":[],"label_agreement":null},{"id":"W3080942770","doi":"10.2196/18920","title":"Secure Record Linkage of Large Health Data Sets: Evaluation of a Hybrid Cloud Model","year":2020,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"Australian Government","keywords":"Cloud computing; Custodians; Computer science; Identifier; Container (type theory); Overhead (engineering); Linkage (software); Record linkage; Database; Computer security; Software; Data mining; Distributed computing; Computer network; Operating system; Engineering","score_opus":0.3796766782781779,"score_gpt":0.5127085377994934,"score_spread":0.13303185952131552,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3080942770","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.710193,0.00057921617,0.27891922,0.0017564897,0.00018155952,0.0010380689,0.0009530804,0.0015234882,0.00485588],"genre_scores_gemma":[0.8642295,0.00027989765,0.13377407,0.000120173136,0.000027871589,0.00023211523,0.00045437412,0.00006377376,0.00081821054],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9960716,0.0019063095,0.00029101464,0.0004991034,0.00089876784,0.00033323208],"domain_scores_gemma":[0.9868333,0.008260053,0.0007223334,0.0015310184,0.002052343,0.0006009528],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008200004,0.0006048988,0.00082167116,0.0009843264,0.0010459198,0.0025181535,0.0025091567,0.000978743,0.0017878618],"category_scores_gemma":[0.014024111,0.00027636177,0.0007972908,0.0018758051,0.00087618956,0.0028493975,0.0019603046,0.0007749149,0.0002683298],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0034850696,0.001014603,0.013851775,0.00032143635,0.00025577768,0.00041028493,0.00033853,0.88958496,0.0040597785,0.011929207,0.002335545,0.072413124],"study_design_scores_gemma":[0.00007995338,0.0002659238,0.0007725097,0.0000095341275,0.000023925106,0.000041631487,0.00011372003,0.9954803,0.0010644338,0.0017649345,0.00037382715,0.000009306665],"about_ca_topic_score_codex":0.027826153,"about_ca_topic_score_gemma":0.012430245,"teacher_disagreement_score":0.027826153,"about_ca_system_score_codex":0.0037002938,"about_ca_system_score_gemma":0.004111241,"threshold_uncertainty_score":0.05532837},"labels":[],"label_agreement":null},{"id":"W3081234131","doi":"10.48550/arxiv.2008.10549","title":"On sampling from data with duplicate records","year":2020,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Data deduplication; Sampling (signal processing); Data mining; Set (abstract data type); Task (project management); Complement (music); Mathematical proof; Data set; Process (computing); Sample (material); Algorithm; Database; Mathematics; Artificial intelligence","score_opus":0.6244679694520039,"score_gpt":0.32815989725208594,"score_spread":0.29630807219991795,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3081234131","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.055651914,0.00077359064,0.94067377,0.00087061204,0.00007880998,0.00042789403,0.00026673125,0.00053396437,0.00072260504],"genre_scores_gemma":[0.4634541,0.0008510718,0.5302734,0.0008994615,0.00040507162,0.0010135024,0.0017446763,0.00016907587,0.0011896506],"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.97185946,0.017907502,0.0013570042,0.0029138073,0.0052716862,0.0006904701],"domain_scores_gemma":[0.76121444,0.1948305,0.008099731,0.0267623,0.007731534,0.0013615204],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.043835863,0.0012945172,0.002585879,0.0029761333,0.0019206564,0.0033036454,0.004150317,0.0025522413,0.0008500707],"category_scores_gemma":[0.17208812,0.0010721408,0.0013180149,0.0039839917,0.0033044494,0.004681507,0.0039441274,0.0024779544,0.00046285675],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0027432991,0.00075895386,0.05251346,0.0012538023,0.0009130762,0.0013376282,0.0025337723,0.5167314,0.008417041,0.12175842,0.009197002,0.28184217],"study_design_scores_gemma":[0.00021971225,0.00024612097,0.0026944366,0.00009627349,0.00008487878,0.0006097568,0.00041550663,0.8998994,0.0059407796,0.08712835,0.002609247,0.000055498],"about_ca_topic_score_codex":0.0034463282,"about_ca_topic_score_gemma":0.0030552435,"teacher_disagreement_score":0.9561641,"about_ca_system_score_codex":0.0017670989,"about_ca_system_score_gemma":0.0024709536,"threshold_uncertainty_score":0.23182899},"labels":[],"label_agreement":null},{"id":"W3081840895","doi":"10.1029/2020gl088048","title":"Thank You to Our 2019 Peer Reviewers","year":2020,"lang":"en","type":"article","venue":"Geophysical Research Letters","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":17,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Presentation (obstetrics); Reading (process); Library science; Rigour; Quality (philosophy); Peer review; Computer science; Political science; History; Engineering ethics; Data science; Public relations; Law; Medicine; Epistemology; Engineering","score_opus":0.39791782158928635,"score_gpt":0.5136762855153798,"score_spread":0.11575846392609346,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3081840895","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":"evaluation","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":"evaluation","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0006543297,0.007421312,0.0061164196,0.2711468,0.67837816,0.0012066594,0.0028328903,0.003785288,0.028458172],"genre_scores_gemma":[0.010319917,0.011151839,0.021614607,0.18078613,0.333838,0.0034467075,0.0055155684,0.006543771,0.42678344],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9488194,0.01222737,0.006914561,0.0058488795,0.023773136,0.0024166673],"domain_scores_gemma":[0.48655567,0.018070403,0.013873537,0.016041357,0.43382224,0.031636734],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.038799215,0.0023944483,0.0031228869,0.008602289,0.0074390997,0.029812742,0.004277573,0.009754386,0.18956932],"category_scores_gemma":[0.260407,0.0013962268,0.002252144,0.0047456454,0.003038475,0.0084298,0.007118435,0.010420501,0.2973887],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000012908096,0.0000062095173,0.00010271822,0.00007207541,0.000004367533,0.00004720838,0.00004915575,0.000010404065,0.000045901208,0.00016945162,0.98644596,0.013033596],"study_design_scores_gemma":[0.0000126876785,0.000009986358,0.00018951998,0.00016348055,0.000006944826,0.00012952088,0.00024819828,0.000056695077,0.0000698335,0.0005214054,0.9985642,0.000027563125],"about_ca_topic_score_codex":0.0034432067,"about_ca_topic_score_gemma":0.006510022,"teacher_disagreement_score":0.9612008,"about_ca_system_score_codex":0.0041997265,"about_ca_system_score_gemma":0.019051112,"threshold_uncertainty_score":0.63417256},"labels":[],"label_agreement":null},{"id":"W3087826863","doi":"10.48550/arxiv.2009.12415","title":"A Big Data Lake for Multilevel Streaming Analytics","year":2020,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University","funders":"Ontario Centres of Excellence","keywords":"Computer science; Big data; Analytics; Data warehouse; Data science; Data management; Scalability; Raw data; Volume (thermodynamics); Data analysis; Database; Unstructured data; Variety (cybernetics); Architecture; Business intelligence; Data mining","score_opus":0.7545566830413366,"score_gpt":0.3475097281097882,"score_spread":0.4070469549315484,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3087826863","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.028336065,0.0010274164,0.8508818,0.016732171,0.0011097583,0.0015267032,0.0062416797,0.07152594,0.022618402],"genre_scores_gemma":[0.15244298,0.0006582292,0.82402074,0.0013081803,0.00037287473,0.00068725937,0.010288702,0.002735933,0.007485048],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99580646,0.0007272247,0.0003763711,0.00055679475,0.0022638524,0.00026916043],"domain_scores_gemma":[0.9900074,0.0018330748,0.00045502017,0.0028286465,0.0034425955,0.0014331656],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007047119,0.0007721713,0.00060172554,0.0021508695,0.0024074467,0.006277382,0.0029615725,0.0012711326,0.0069113253],"category_scores_gemma":[0.016371466,0.00097157987,0.0009479261,0.003122955,0.0016041466,0.010698289,0.008109072,0.0032941676,0.0027639067],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001307819,0.00059934903,0.015924903,0.0008987634,0.00031749392,0.0014368535,0.0029347613,0.026943523,0.033715617,0.1446639,0.4043422,0.36691484],"study_design_scores_gemma":[0.00030906466,0.00048106795,0.0052499045,0.00038441055,0.00008846166,0.00052984385,0.0018208271,0.34116024,0.027216315,0.17315337,0.44939947,0.00020709369],"about_ca_topic_score_codex":0.0036095865,"about_ca_topic_score_gemma":0.005430643,"teacher_disagreement_score":0.007047119,"about_ca_system_score_codex":0.0017912877,"about_ca_system_score_gemma":0.004468654,"threshold_uncertainty_score":0.037269175},"labels":[],"label_agreement":null},{"id":"W3088102886","doi":"10.31485/admindatahandbook.1.0","title":"Handbook on Using Administrative Data for Research and Evidence-based Policy","year":2020,"lang":"en","type":"book","venue":"Abdul Latif Jameel Poverty Action Lab eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Political science; Research data; Public administration; Business; Data science; Computer science; Data curation","score_opus":0.882626387677327,"score_gpt":0.5973062587538313,"score_spread":0.2853201289234958,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3088102886","genre_codex":"other","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00035071498,0.12046016,0.0940905,0.06130558,0.013150967,0.0015024806,0.01187713,0.0037543264,0.69350815],"genre_scores_gemma":[0.0053528207,0.16920657,0.17369099,0.028087022,0.006068518,0.002955487,0.012006256,0.0041608852,0.5984714],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9831834,0.005450221,0.0017174637,0.0006745855,0.008665823,0.00030847214],"domain_scores_gemma":[0.94100416,0.044930495,0.0014736,0.0029335956,0.008895451,0.00076271314],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.012780612,0.0012781352,0.001596856,0.005878092,0.0015777324,0.009684785,0.0024156715,0.0035050337,0.053589594],"category_scores_gemma":[0.033023026,0.0015861033,0.0009846076,0.011085173,0.0028316665,0.007985078,0.0032943788,0.0059205415,0.046767775],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000007769205,0.000017118882,0.000056497996,0.00064819766,0.0000086511955,0.00004041409,0.00031048158,0.00033632366,0.00008053698,0.060129188,0.79667974,0.1416851],"study_design_scores_gemma":[0.000002804031,0.0000039755187,0.00007069048,0.0004752575,0.0000022322004,0.00006094691,0.000051180217,0.000069614645,0.00003165022,0.013632695,0.9855899,0.0000090223075],"about_ca_topic_score_codex":0.00775141,"about_ca_topic_score_gemma":0.010368759,"teacher_disagreement_score":0.053589594,"about_ca_system_score_codex":0.0038189192,"about_ca_system_score_gemma":0.011132906,"threshold_uncertainty_score":0.17927504},"labels":[],"label_agreement":null},{"id":"W3094404806","doi":"10.1145/3340531.3412173","title":"IoT Data Quality","year":2020,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":31,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Data quality; Data science; Quality (philosophy); Data consistency; Consistency (knowledge bases); Data management; Benchmark (surveying); Data mining; Artificial intelligence; Database; Engineering","score_opus":0.9391081827859995,"score_gpt":0.6295491855445623,"score_spread":0.3095589972414372,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3094404806","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.020767365,0.033160355,0.80717003,0.022671176,0.0038412155,0.0011318441,0.018183798,0.0038957882,0.089178436],"genre_scores_gemma":[0.55184627,0.050371185,0.3176749,0.010340837,0.0051905513,0.0014255161,0.04228765,0.0021530944,0.018710008],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9624441,0.0076834727,0.004647652,0.0040318323,0.019963033,0.001229847],"domain_scores_gemma":[0.9183977,0.028129257,0.007690943,0.015400558,0.028724747,0.0016566706],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.024363883,0.0011852928,0.0019135143,0.0048827864,0.0016500194,0.012172251,0.0031235714,0.0020861817,0.008941013],"category_scores_gemma":[0.102375805,0.00059771177,0.0015578128,0.009660754,0.002559719,0.015202257,0.006987161,0.0036917867,0.002877326],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00043824196,0.00014003353,0.02488323,0.003537801,0.00048226205,0.00041859632,0.0007418789,0.020455834,0.0044227284,0.3310445,0.091797,0.521638],"study_design_scores_gemma":[0.000080630685,0.00023039266,0.013439869,0.003018678,0.00041148424,0.0013500581,0.0012900603,0.08785282,0.014069,0.387912,0.4901056,0.00023941105],"about_ca_topic_score_codex":0.004459808,"about_ca_topic_score_gemma":0.0022247795,"teacher_disagreement_score":0.024363883,"about_ca_system_score_codex":0.0043623718,"about_ca_system_score_gemma":0.0052377083,"threshold_uncertainty_score":0.1288501},"labels":[],"label_agreement":null},{"id":"W3094735162","doi":"10.2196/21811","title":"Developing a Standardized and Reusable Method to Link Distributed Health Plan Databases to the National Death Index: Methods Development Study Protocol","year":2020,"lang":"en","type":"article","venue":"JMIR Research Protocols","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"Perelman School of Medicine, University of Pennsylvania; University of Illinois at Urbana-Champaign; Hamilton Health Sciences Foundation; University of Washington; University of Pennsylvania; U.S. Department of Health and Human Services","keywords":"Medicine; Protocol (science); Database; National Death Index; Medical emergency; Computer science; Confidence interval; Alternative medicine","score_opus":0.8752735118553996,"score_gpt":0.7522096772877518,"score_spread":0.1230638345676478,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3094735162","genre_codex":"protocol","genre_gemma":"protocol","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"protocol","genre_consensus":"protocol","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0021401062,0.00022527327,0.20983362,0.0009204495,0.0004659098,0.7710815,0.010131987,0.0015504349,0.0036506455],"genre_scores_gemma":[0.0015005124,0.00014218649,0.15438057,0.00029331897,0.00003980308,0.84071136,0.0020504391,0.00015736975,0.00072439807],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9077964,0.057993528,0.017754586,0.004415615,0.0106472755,0.0013924594],"domain_scores_gemma":[0.7894056,0.10210151,0.013933416,0.025227902,0.06465782,0.0046737418],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.17618425,0.0034136502,0.0015447851,0.0059205783,0.0029590912,0.0034116697,0.004981026,0.0028442768,0.05990137],"category_scores_gemma":[0.20429067,0.0036731632,0.0036108268,0.003610475,0.0024359075,0.0026087936,0.0044161137,0.005571084,0.014049604],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0077750096,0.0053956495,0.010928906,0.028035691,0.00095761835,0.0011805841,0.0056382683,0.0077018454,0.0068204314,0.025210246,0.236169,0.6641867],"study_design_scores_gemma":[0.022492709,0.0052932464,0.017594766,0.025809761,0.0014704275,0.00083325413,0.003990803,0.024533423,0.026419468,0.025624555,0.84523517,0.00070247747],"about_ca_topic_score_codex":0.004934526,"about_ca_topic_score_gemma":0.007952803,"teacher_disagreement_score":0.82381576,"about_ca_system_score_codex":0.0055611474,"about_ca_system_score_gemma":0.04752144,"threshold_uncertainty_score":0.9317625},"labels":[],"label_agreement":null},{"id":"W3095626157","doi":"","title":"Author Name Disambiguation Using Co-training","year":2020,"lang":"en","type":"article","venue":"Scholarship at UWindsor (University of Windsor)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"University of Windsor","keywords":"Training (meteorology); Computer science; Artificial intelligence; Natural language processing; Linguistics; Philosophy; Geography","score_opus":0.43159331807673795,"score_gpt":0.4039498218923242,"score_spread":0.02764349618441375,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3095626157","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09263193,0.010148831,0.8658454,0.0020828785,0.0018627344,0.00045698625,0.0022831343,0.015234132,0.009453989],"genre_scores_gemma":[0.493201,0.0015838451,0.48365688,0.001180181,0.0010680142,0.0003389977,0.008593467,0.0006646881,0.0097129205],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9924185,0.0024721865,0.0007257254,0.002742292,0.0011209997,0.00052037823],"domain_scores_gemma":[0.9730435,0.014027601,0.0020210035,0.00512187,0.0049960813,0.0007900024],"candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.009525738,0.0022587047,0.002586044,0.008691797,0.0016359183,0.0030453235,0.0039046768,0.0039647454,0.0028490764],"category_scores_gemma":[0.024205351,0.0007294974,0.0023128013,0.0072232652,0.0012281776,0.0059797578,0.0030314715,0.0031942634,0.0036863275],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009974225,0.00074766926,0.021834336,0.00059426227,0.0005290132,0.00043366916,0.0005125573,0.060433954,0.0062574307,0.0044026608,0.03295796,0.87029904],"study_design_scores_gemma":[0.00012603705,0.0003030189,0.0044523207,0.00016531386,0.00030853576,0.0008767064,0.00029327167,0.93318385,0.017997157,0.01892277,0.023278993,0.00009201067],"about_ca_topic_score_codex":0.0027998497,"about_ca_topic_score_gemma":0.0054115406,"teacher_disagreement_score":0.9913082,"about_ca_system_score_codex":0.0012859729,"about_ca_system_score_gemma":0.0021356298,"threshold_uncertainty_score":0.050377488},"labels":[],"label_agreement":null},{"id":"W3106195149","doi":"10.1093/jamia/ocaa225","title":"Assessing the quality of clinical and administrative data extracted from hospitals: the General Medicine Inpatient Initiative (GEMINI) experience","year":2020,"lang":"en","type":"article","venue":"Journal of the American Medical Informatics Association","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":96,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Sunnybrook Health Science Centre; Trillium Health Centre; Institute for Clinical Evaluative Sciences; Health Sciences Centre; Mount Sinai Hospital; University of Toronto; University Health Network; Queen's University; St. Michael's Hospital","funders":"University of Toronto","keywords":"Data quality; Data extraction; Computer science; Gold standard (test); Quality (philosophy); Quality management; Data collection; Data mining; Database; Medicine; MEDLINE; Statistics; Operations management; Mathematics","score_opus":0.540661436719735,"score_gpt":0.5948575964308802,"score_spread":0.05419615971114522,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3106195149","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.91232526,0.0030218281,0.039610535,0.013177321,0.00020797687,0.0014382643,0.020641692,0.0013866792,0.008190529],"genre_scores_gemma":[0.8826638,0.00087790616,0.08732111,0.0016336272,0.0001142742,0.00030891513,0.02614539,0.00022706593,0.00070788694],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9433017,0.026323274,0.007050904,0.004033037,0.017990233,0.0013009481],"domain_scores_gemma":[0.7605157,0.1266459,0.02672993,0.026010426,0.056194652,0.003903469],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.084415674,0.0006869121,0.0007062837,0.0035700542,0.00129702,0.004396054,0.0027437783,0.0007317749,0.00071570225],"category_scores_gemma":[0.22933103,0.0005387535,0.001086156,0.009297737,0.0020524666,0.0021747798,0.0037919166,0.0011815205,0.00018313839],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00070479687,0.0001607664,0.86873674,0.0009049939,0.00066920783,0.00016145244,0.004858674,0.012527316,0.0012219644,0.003288073,0.017159829,0.089606136],"study_design_scores_gemma":[0.0003277104,0.00068263005,0.8505705,0.0010703654,0.00052494474,0.000631149,0.005413148,0.07881287,0.007263667,0.004621894,0.049835164,0.00024594655],"about_ca_topic_score_codex":0.2271769,"about_ca_topic_score_gemma":0.22144514,"teacher_disagreement_score":0.9155843,"about_ca_system_score_codex":0.015948962,"about_ca_system_score_gemma":0.020542175,"threshold_uncertainty_score":0.45170915},"labels":[],"label_agreement":null},{"id":"W3107627972","doi":"10.1145/3397536.3422227","title":"NUMA-Aware Spatio-Textual Similarity Join","year":2020,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of New Brunswick","funders":"","keywords":"Joins; Join (topology); Similarity (geometry); Computer science; Information retrieval; Resource (disambiguation); Artificial intelligence; Programming language; Mathematics; Image (mathematics)","score_opus":0.35557215213223436,"score_gpt":0.4236913501634345,"score_spread":0.06811919803120015,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3107627972","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.033518992,0.002328235,0.9265379,0.0007639789,0.0005336206,0.00048422904,0.0032286358,0.015574273,0.01703017],"genre_scores_gemma":[0.30427426,0.0006765622,0.67470336,0.0003585788,0.00028105878,0.0003375919,0.007116418,0.0009264037,0.0113256825],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9961338,0.00062976073,0.00043186135,0.00092500355,0.0016226827,0.00025690903],"domain_scores_gemma":[0.995673,0.0009784894,0.00031245837,0.0017811145,0.0009436668,0.00031134914],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0022680794,0.0010353881,0.0019506261,0.0021083069,0.0018840948,0.004651508,0.0032647187,0.0012142366,0.008472952],"category_scores_gemma":[0.0104528265,0.00062812783,0.0016001833,0.0032251321,0.000838505,0.0061467434,0.0065658637,0.0011148995,0.0048334636],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002685254,0.0007752142,0.010436648,0.0014226189,0.0005317629,0.0009727325,0.0011883036,0.13604802,0.050829202,0.0723176,0.06098329,0.6618093],"study_design_scores_gemma":[0.00012162118,0.00015175548,0.0017161679,0.000062950974,0.00014666973,0.0007744863,0.0004207618,0.87664574,0.020227196,0.041475434,0.058184024,0.000073208765],"about_ca_topic_score_codex":0.004084251,"about_ca_topic_score_gemma":0.008061355,"teacher_disagreement_score":0.008472952,"about_ca_system_score_codex":0.0011517324,"about_ca_system_score_gemma":0.0023255323,"threshold_uncertainty_score":0.02834481},"labels":[],"label_agreement":null},{"id":"W3110853613","doi":"10.23889/ijpds.v5i5.1556","title":"Using the Canadian Institute for Health Information’s Information Quality Framework to Support Integration and Utilization of Complex, Multi-Jurisdictional Data","year":2020,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Canadian Institute for Health Information","funders":"","keywords":"Data quality; Information quality; Computer science; Documentation; Operationalization; Data science; Health informatics; Quality (philosophy); Information system; Data governance; Health care; Knowledge management; Business; Engineering","score_opus":0.7470190652398002,"score_gpt":0.5982658809769009,"score_spread":0.1487531842628993,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3110853613","genre_codex":"commentary","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.004272069,0.0151855815,0.28598377,0.34091073,0.0044027404,0.008187879,0.02930614,0.004008651,0.3077425],"genre_scores_gemma":[0.07712056,0.016525375,0.81015974,0.03812155,0.0013171054,0.004896014,0.029403312,0.0011390024,0.021317257],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.6714513,0.11514351,0.030701956,0.012292177,0.1549937,0.015417381],"domain_scores_gemma":[0.5146268,0.14229578,0.017252637,0.04973261,0.25661132,0.019480873],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.22649778,0.0018250019,0.002418592,0.03660759,0.016118165,0.03220737,0.010788419,0.0065420754,0.009948322],"category_scores_gemma":[0.33127314,0.0021319147,0.003649805,0.057359103,0.016894791,0.01642995,0.025523577,0.01070215,0.0026393472],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":true,"study_design_scores_codex":[0.00005026742,0.00008290747,0.008714699,0.0019943453,0.00021147092,0.00027160937,0.0070693884,0.0025022416,0.0004619544,0.5010336,0.34172106,0.13588652],"study_design_scores_gemma":[0.000047044137,0.00005509372,0.011257602,0.0056253662,0.00011074976,0.00014629427,0.0040442427,0.0033686613,0.0006992094,0.07570296,0.898677,0.00026570627],"about_ca_topic_score_codex":0.91447866,"about_ca_topic_score_gemma":0.89035845,"teacher_disagreement_score":0.8570772,"about_ca_system_score_codex":0.1429228,"about_ca_system_score_gemma":0.5044722,"threshold_uncertainty_score":0.99408805},"labels":[],"label_agreement":null},{"id":"W3111257782","doi":"10.23889/ijpds.v5i5.1542","title":"Evaluating PPRL Vs Clear Text Linkage with Real-World Data","year":2020,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Linkage (software); Identifier; Genetic linkage; Computer science; Record linkage; Population; Hash function; Genetics; Biology; Gene; Medicine","score_opus":0.6781494335367946,"score_gpt":0.5956232882520471,"score_spread":0.08252614528474744,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3111257782","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7044018,0.006293139,0.2429071,0.0027474104,0.00073657546,0.0013231669,0.01976809,0.011239047,0.010583629],"genre_scores_gemma":[0.6627031,0.0009341467,0.29528052,0.0004895769,0.0002758312,0.0008878401,0.03660668,0.0008145173,0.0020078318],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.94427687,0.031144882,0.005777237,0.0073911687,0.01049445,0.00091540767],"domain_scores_gemma":[0.7994889,0.15594852,0.013645896,0.015393508,0.014164109,0.001359123],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0784123,0.0015797692,0.0011419985,0.009408238,0.0017390671,0.004974357,0.0031035112,0.0030307109,0.0041292435],"category_scores_gemma":[0.19392377,0.00046924505,0.0018381691,0.009418589,0.0017036119,0.0056441454,0.0047858236,0.0013308421,0.0015026976],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0049095396,0.0015668226,0.2183055,0.00384269,0.0039313976,0.0006285283,0.002069146,0.29073957,0.0041536395,0.015146474,0.037740402,0.4169662],"study_design_scores_gemma":[0.0007254666,0.0024571342,0.06275851,0.00074080063,0.000653614,0.0008091267,0.0024193535,0.8637145,0.017147632,0.022653567,0.025630709,0.0002895097],"about_ca_topic_score_codex":0.005476407,"about_ca_topic_score_gemma":0.0054282844,"teacher_disagreement_score":0.0784123,"about_ca_system_score_codex":0.001875673,"about_ca_system_score_gemma":0.001624203,"threshold_uncertainty_score":0.41468883},"labels":[],"label_agreement":null},{"id":"W3112495257","doi":"10.23889/ijpds.v5i5.1630","title":"Using A Privacy Preserving Record Linkage to Facilitate an Ongoing Crosswalk Between Research and Health Administrative Databases","year":2020,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Indoc Research; Ontario Brain Institute","funders":"","keywords":"Schema crosswalk; Record linkage; Computer science; Database; Data science; Medicine; Engineering; Transport engineering","score_opus":0.9620375251486527,"score_gpt":0.6997589936175305,"score_spread":0.26227853153112224,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3112495257","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.024222735,0.00027527427,0.9291355,0.0047098235,0.00035791635,0.015395536,0.0064554247,0.0064033256,0.013044515],"genre_scores_gemma":[0.038104665,0.0001241205,0.9463219,0.00041854536,0.00007507871,0.007302548,0.0039329743,0.0004321126,0.0032880087],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.80090016,0.12234565,0.023686253,0.01741662,0.031959545,0.0036918637],"domain_scores_gemma":[0.7132887,0.08294238,0.04167438,0.09701823,0.05997806,0.0050981883],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.18654422,0.0011682331,0.0010367472,0.009764626,0.0044861226,0.010828649,0.0050796997,0.0019000742,0.012537368],"category_scores_gemma":[0.22570315,0.001645011,0.0028124696,0.010775664,0.0022015476,0.009015946,0.017173732,0.0029628836,0.0067312513],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009518315,0.0012615349,0.04100986,0.003026761,0.0005858396,0.000827993,0.020817589,0.00849746,0.010295282,0.08958496,0.04936071,0.77378017],"study_design_scores_gemma":[0.00089726056,0.0028389904,0.049331304,0.0042730654,0.0007901958,0.0022138658,0.01653359,0.06499162,0.072243616,0.10844881,0.67631364,0.0011240557],"about_ca_topic_score_codex":0.0065063285,"about_ca_topic_score_gemma":0.008494636,"teacher_disagreement_score":0.18654422,"about_ca_system_score_codex":0.004804084,"about_ca_system_score_gemma":0.027725471,"threshold_uncertainty_score":0.98655194},"labels":[],"label_agreement":null},{"id":"W3112904752","doi":"10.23889/ijpds.v5i5.1420","title":"Creation of First Nations Health Profiles Through Data Linkage in Manitoba","year":2020,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"First Nations Health and Social Secretariat of Manitoba","funders":"","keywords":"Mandate; Information governance; Data sharing; Political science; Business; Public administration; Medicine; Information system; Law","score_opus":0.5272190626369835,"score_gpt":0.5404742119118103,"score_spread":0.01325514927482685,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3112904752","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.32220295,0.006076567,0.06002132,0.06311112,0.0024479865,0.025632877,0.26804164,0.0047270576,0.24773847],"genre_scores_gemma":[0.39673108,0.007479232,0.2405025,0.015739867,0.00043205862,0.035318173,0.15602584,0.0011597833,0.14661151],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.9899575,0.0032754554,0.0011865544,0.0012766233,0.0029460003,0.0013577124],"domain_scores_gemma":[0.9659878,0.003835986,0.0027055724,0.004368401,0.019512657,0.003589598],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0250586,0.0004956812,0.0005851201,0.008153251,0.006750071,0.004692153,0.0034537993,0.0010457883,0.016048893],"category_scores_gemma":[0.035322387,0.0010192377,0.0006647127,0.014370768,0.0011595213,0.0021938402,0.008273405,0.0015331651,0.003404356],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00047947833,0.0005888765,0.26621908,0.002233577,0.00034671373,0.0018824954,0.029080894,0.002917148,0.0024176976,0.047922127,0.36168826,0.28422374],"study_design_scores_gemma":[0.00016591622,0.000121701494,0.26019835,0.0032107877,0.00016288891,0.0003652161,0.018452015,0.0043367865,0.0018561927,0.0067128823,0.70425093,0.00016639668],"about_ca_topic_score_codex":0.8150213,"about_ca_topic_score_gemma":0.8045282,"teacher_disagreement_score":0.18497872,"about_ca_system_score_codex":0.029227925,"about_ca_system_score_gemma":0.15873747,"threshold_uncertainty_score":0.37213618},"labels":[],"label_agreement":null},{"id":"W3115634801","doi":"10.23889/ijpds.v5i5.1541","title":"How Are Linkage Results Using Privacy-Preserving Record Linkage Different?","year":2020,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Linkage (software); Record linkage; Computer science; Internet privacy; Genetics; Biology; Medicine; Environmental health; Gene","score_opus":0.5276143466944776,"score_gpt":0.49682370186658736,"score_spread":0.030790644827890234,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3115634801","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.21060339,0.011007045,0.69851106,0.021958137,0.002355397,0.0012836712,0.016281797,0.009499041,0.028500538],"genre_scores_gemma":[0.55540437,0.0026790486,0.42255786,0.002071717,0.00054506835,0.0004965271,0.011197102,0.0018615817,0.0031866394],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8788203,0.06550822,0.010886582,0.014500111,0.026657606,0.0036270977],"domain_scores_gemma":[0.7761664,0.12523091,0.014732721,0.05189413,0.030652918,0.0013229937],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.13072158,0.0017827707,0.0028042078,0.009375369,0.0034519418,0.019732313,0.0043741385,0.003148151,0.0069683017],"category_scores_gemma":[0.3138482,0.0008496766,0.004099349,0.014449448,0.0039998144,0.014790978,0.006712642,0.002484215,0.003450897],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0022061896,0.00057407614,0.18209091,0.0029399355,0.0042203814,0.0007989619,0.006221179,0.04836208,0.0033970145,0.10612119,0.043014437,0.60005355],"study_design_scores_gemma":[0.000613754,0.0010626029,0.05275214,0.0025733376,0.0022552237,0.003815031,0.013504328,0.14639398,0.034794305,0.6268817,0.114548184,0.0008053846],"about_ca_topic_score_codex":0.0041285357,"about_ca_topic_score_gemma":0.0030588026,"teacher_disagreement_score":0.13072158,"about_ca_system_score_codex":0.0027188356,"about_ca_system_score_gemma":0.0045489757,"threshold_uncertainty_score":0.6913301},"labels":[],"label_agreement":null},{"id":"W3116133199","doi":"","title":"Attribute-Based Semantic Reconciliation of Multiple Data Sources.","year":2003,"lang":"en","type":"article","venue":"Journal on Data Semantics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia; Memorial University of Newfoundland","funders":"","keywords":"Computer science; Schema (genetic algorithms); Information retrieval; Semantics (computer science); Information integration; Data mining","score_opus":0.4778145243269458,"score_gpt":0.43881745860081595,"score_spread":0.038997065726129876,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3116133199","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.016803492,0.0015447222,0.96986365,0.0010597,0.00031283312,0.00033648303,0.001534086,0.004886734,0.0036582497],"genre_scores_gemma":[0.2880606,0.0009789037,0.7004239,0.00044591373,0.00021142497,0.00027572675,0.0074909744,0.0005557788,0.0015567932],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9713959,0.015586663,0.0026194851,0.0021770603,0.007492611,0.0007282564],"domain_scores_gemma":[0.95519114,0.014598953,0.0026123708,0.019966926,0.007116834,0.00051374367],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.026883986,0.000991071,0.0017042989,0.007747868,0.0015534682,0.00714584,0.0042480812,0.0019171605,0.002002136],"category_scores_gemma":[0.07558892,0.0008754853,0.0022598538,0.008409005,0.0017012641,0.014222988,0.008529418,0.0025756462,0.0011412209],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012447361,0.0004106112,0.009688775,0.0015446823,0.0018507263,0.0009128958,0.0031403399,0.043998368,0.0069866832,0.15661663,0.03239728,0.7412083],"study_design_scores_gemma":[0.0002279288,0.00024180982,0.0040256176,0.00087496534,0.001361001,0.0012578598,0.0020426058,0.42259872,0.045634694,0.434574,0.08691626,0.0002445571],"about_ca_topic_score_codex":0.0018690526,"about_ca_topic_score_gemma":0.0022222437,"teacher_disagreement_score":0.026883986,"about_ca_system_score_codex":0.0010528013,"about_ca_system_score_gemma":0.003320911,"threshold_uncertainty_score":0.14217782},"labels":[],"label_agreement":null},{"id":"W3121734764","doi":"10.2139/ssrn.1975336","title":"Dependence Modeling in Multivariate Claims Run-Off Triangles","year":2011,"lang":"en","type":"article","venue":"SSRN Electronic Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Actua","funders":"","keywords":"Multivariate statistics; Multivariate analysis; Econometrics; Statistics; Mathematics","score_opus":0.22825680730450323,"score_gpt":0.3817565436088361,"score_spread":0.15349973630433286,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3121734764","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.28394446,0.001099123,0.69643635,0.002973227,0.00012978424,0.000189899,0.0012821833,0.0005566532,0.013388326],"genre_scores_gemma":[0.9484584,0.00066890864,0.029615691,0.00018648566,0.00018646999,0.00020974864,0.0012524896,0.0002817179,0.019140134],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99407756,0.003444967,0.00024195471,0.000890897,0.0005238717,0.00082066],"domain_scores_gemma":[0.8906702,0.09337238,0.0057418956,0.0048733135,0.0032581887,0.0020839267],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013666288,0.0009988662,0.0032239673,0.0025862628,0.0016121024,0.0038465413,0.004813694,0.0032324274,0.018123388],"category_scores_gemma":[0.08013554,0.0013831549,0.0023090995,0.0033333153,0.0030799988,0.0070738993,0.0033960056,0.005345867,0.001429003],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00046245698,0.00019790455,0.016862677,0.00014131992,0.00016270648,0.00053413445,0.0006558857,0.3574578,0.00027737775,0.58659595,0.0064825495,0.030169362],"study_design_scores_gemma":[0.000023577062,0.000034502133,0.0011989274,0.00002323153,0.00002781938,0.00005286451,0.00012641857,0.8360566,0.000075455944,0.16162577,0.00073566334,0.000019142697],"about_ca_topic_score_codex":0.016835101,"about_ca_topic_score_gemma":0.011471679,"teacher_disagreement_score":0.018123388,"about_ca_system_score_codex":0.0019475113,"about_ca_system_score_gemma":0.001215359,"threshold_uncertainty_score":0.0722751},"labels":[],"label_agreement":null},{"id":"W3122531144","doi":"10.6084/m9.figshare.14687696","title":"Fast Bayesian Record Linkage With Record-Specific Disagreement Parameters","year":2021,"lang":"en","type":"dataset","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Record linkage; Linkage (software); Bayesian probability; Computer science; Statistics; Econometrics; Artificial intelligence; Mathematics; Biology; Sociology; Genetics; Demography","score_opus":0.20242576117650027,"score_gpt":0.36523436655654057,"score_spread":0.1628086053800403,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3122531144","genre_codex":"methods","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010408083,0.0012819112,0.83185226,0.0013524292,0.0002434925,0.0006839481,0.116221495,0.03379197,0.004164355],"genre_scores_gemma":[0.046470642,0.0006113012,0.75355303,0.00048025826,0.00013647995,0.0017562511,0.19061282,0.0023780325,0.0040012742],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9869235,0.005232548,0.0012443804,0.0034414388,0.0027587926,0.0003992965],"domain_scores_gemma":[0.973118,0.013879359,0.0016501042,0.007584647,0.0034352758,0.00033272489],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.021756902,0.0015195169,0.0022858602,0.006495842,0.0020679287,0.00430018,0.0052660303,0.0027604038,0.013744363],"category_scores_gemma":[0.088902794,0.0018333547,0.002727159,0.01206759,0.0007608323,0.005417958,0.0050031985,0.0039761486,0.012070479],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010424864,0.00034835402,0.020935621,0.0019509989,0.0012413976,0.00027402816,0.00081946194,0.060117844,0.0025343355,0.04131908,0.41731915,0.45209724],"study_design_scores_gemma":[0.0009450049,0.00012681576,0.008483217,0.0004088299,0.00036381817,0.000758927,0.00033915174,0.49613494,0.008089997,0.22135659,0.26275405,0.00023854626],"about_ca_topic_score_codex":0.012153712,"about_ca_topic_score_gemma":0.022277338,"teacher_disagreement_score":0.021756902,"about_ca_system_score_codex":0.0018648676,"about_ca_system_score_gemma":0.005946335,"threshold_uncertainty_score":0.11506289},"labels":[],"label_agreement":null},{"id":"W3124015549","doi":"10.2966/scrip.120215.154","title":"Reflections on the Concept of Open Data","year":2015,"lang":"en","type":"article","venue":"SCRIPTed A Journal of Law Technology & Society","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"McGill University","keywords":"Open data; Linked data; Interoperability; Computer science; Transparency (behavior); Data science; Accountability; Meaning (existential); Knowledge management; Open education; World Wide Web; Political science; Semantic Web; Epistemology; Computer security; Law","score_opus":0.6257464399519292,"score_gpt":0.5407464510057203,"score_spread":0.08499998894620897,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3124015549","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0032377753,0.004979779,0.012177118,0.9325639,0.0032180997,0.000064671134,0.0000740719,0.000029656985,0.04365492],"genre_scores_gemma":[0.37736064,0.012900125,0.02719088,0.53684014,0.009223947,0.00091936975,0.00013796249,0.00053972733,0.03488723],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.89003456,0.07030528,0.0040737167,0.008275891,0.021376349,0.005934137],"domain_scores_gemma":[0.7791737,0.1970146,0.003388199,0.0060899067,0.010655373,0.0036782764],"candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.10566406,0.0010078667,0.0013876185,0.0034803504,0.021218516,0.039655942,0.0061150934,0.029035896,0.0063070743],"category_scores_gemma":[0.11240647,0.0011488036,0.0018830613,0.005242441,0.17782183,0.062085636,0.018468885,0.06545188,0.001125148],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000045992415,0.0000053929784,0.000037750964,0.00003293332,0.0000015443967,0.000051997707,0.012294056,0.00006758575,0.000028115846,0.97636414,0.010194337,0.0009175459],"study_design_scores_gemma":[0.000013975407,0.000013327861,0.000091442154,0.0005529292,0.0000038151948,0.00012812164,0.02449641,0.00028686135,0.00019726469,0.6080062,0.36617005,0.000039506813],"about_ca_topic_score_codex":0.01988152,"about_ca_topic_score_gemma":0.011269234,"teacher_disagreement_score":0.9938849,"about_ca_system_score_codex":0.030681558,"about_ca_system_score_gemma":0.026928144,"threshold_uncertainty_score":0.55881166},"labels":[],"label_agreement":null},{"id":"W3124163813","doi":"","title":"Open or Closed? Open Licensing of Real-Time Public Sector Transit Data","year":2016,"lang":"en","type":"article","venue":"SSRN Electronic Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Open data; Business; Public transport; Public sector; Transit (satellite); Open government; Transport engineering; Computer science; Economics; Engineering; World Wide Web; Economy","score_opus":0.3281475856506092,"score_gpt":0.44504167216564205,"score_spread":0.11689408651503286,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3124163813","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.37538236,0.0031986393,0.15357453,0.053090237,0.0028979362,0.0010471863,0.004564264,0.004218407,0.40202644],"genre_scores_gemma":[0.95298797,0.00076358457,0.00967997,0.0036783882,0.0011578207,0.00028202185,0.0016446763,0.0007517589,0.029053826],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.95968527,0.012645128,0.0038204282,0.0035623675,0.015383089,0.0049037193],"domain_scores_gemma":[0.68886614,0.16861102,0.019903466,0.075016655,0.037952457,0.009650208],"candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.037910074,0.00026932504,0.00096247566,0.0036975471,0.0024828599,0.01879473,0.0042699757,0.0039092363,0.027803987],"category_scores_gemma":[0.22838524,0.00058933353,0.0009929452,0.0052417796,0.0065098796,0.03087721,0.009565862,0.0054162834,0.006484616],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013515401,0.00071839435,0.040601064,0.0006600668,0.0001277623,0.0007992256,0.007123953,0.004058785,0.005187588,0.48787758,0.06414189,0.38735214],"study_design_scores_gemma":[0.0004576601,0.0006558993,0.030202093,0.0014467975,0.000167764,0.0011000017,0.010495429,0.034043726,0.014642852,0.5393396,0.36712742,0.0003207154],"about_ca_topic_score_codex":0.00434145,"about_ca_topic_score_gemma":0.0027580278,"teacher_disagreement_score":0.99573004,"about_ca_system_score_codex":0.003731424,"about_ca_system_score_gemma":0.008663424,"threshold_uncertainty_score":0.20049006},"labels":[],"label_agreement":null},{"id":"W3125002781","doi":"10.5539/gjhs.v13n3p23","title":"Data Cleaning Needs and Issues: A Case Study of the National Reproductive Health Assessment (RHA) Data from Solomon Islands","year":2021,"lang":"en","type":"article","venue":"Global Journal of Health Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Data collection; Reproductive health; Standardization; Data entry; Reliability (semiconductor); Process (computing); Research data; Medicine; Computer science; Environmental health; Database; Data science; Statistics; Mathematics","score_opus":0.4862324880655968,"score_gpt":0.5819926248280866,"score_spread":0.09576013676248973,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3125002781","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9785825,0.00057962944,0.0030853602,0.010308007,0.000046784604,0.00083994697,0.00024322406,0.000025264386,0.0062893163],"genre_scores_gemma":[0.98070097,0.0012704635,0.01133584,0.0019928934,0.000037887203,0.00063792325,0.00020402615,0.00004058622,0.003779556],"study_design_codex":"qualitative","study_design_gemma":"observational","domain_scores_codex":[0.9810635,0.012913469,0.0013959894,0.0007599706,0.0023577753,0.0015093798],"domain_scores_gemma":[0.9615303,0.026108539,0.0034696287,0.0020926804,0.004674688,0.0021241643],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.017342364,0.0004103211,0.00047969943,0.0016912492,0.009033784,0.0026780306,0.0027390565,0.0024650064,0.002354543],"category_scores_gemma":[0.036477245,0.00047423886,0.00050559436,0.0029485617,0.002791012,0.0016050762,0.003498471,0.0020952597,0.00023360824],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021473014,0.000718692,0.11393442,0.0017827486,0.00013113115,0.086487584,0.7097188,0.00095472543,0.0024149716,0.005101157,0.007187934,0.07135312],"study_design_scores_gemma":[0.000024469266,0.00039330157,0.06810889,0.001242643,0.000065722146,0.010789733,0.8646383,0.0012795919,0.0016082966,0.0013454144,0.050432023,0.000071542316],"about_ca_topic_score_codex":0.11508166,"about_ca_topic_score_gemma":0.17518592,"teacher_disagreement_score":0.11508166,"about_ca_system_score_codex":0.008578945,"about_ca_system_score_gemma":0.011438315,"threshold_uncertainty_score":0.22882366},"labels":[],"label_agreement":null},{"id":"W3125074818","doi":"","title":"Is Practitioners' Views on Core Concepts of Information Integrity","year":2005,"lang":"en","type":"article","venue":"SSRN Electronic Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"COBIT; Process management; Information quality; Knowledge management; Information system; Data integrity; Guideline; Computer science; Business; Control (management); Engineering; Computer security; Political science","score_opus":0.1427847610628718,"score_gpt":0.44481753360301507,"score_spread":0.30203277254014327,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3125074818","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.36053368,0.026436834,0.15036605,0.27520433,0.0009996555,0.00047649545,0.00020017501,0.0001691701,0.18561365],"genre_scores_gemma":[0.97101235,0.007587538,0.014642905,0.0045890952,0.00019497672,0.00015421855,0.000064678854,0.000020757887,0.0017335151],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"observational","domain_scores_codex":[0.8966624,0.062243707,0.008354544,0.002823543,0.02534961,0.004566162],"domain_scores_gemma":[0.7948353,0.13527764,0.017974956,0.008621854,0.035492957,0.0077972263],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.11769893,0.00056445866,0.0012704505,0.008318111,0.005751757,0.019444106,0.0025104233,0.0047075483,0.0015612072],"category_scores_gemma":[0.13365814,0.0007432477,0.00083589234,0.008021132,0.026292315,0.017948063,0.013237034,0.010774536,0.0002043083],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000095880205,0.00010142772,0.017743608,0.0010711661,0.00006178766,0.00064263743,0.41475606,0.0018500078,0.001352278,0.48823196,0.0047530783,0.069340125],"study_design_scores_gemma":[0.000038640163,0.00022984116,0.009697259,0.0038692192,0.00008526057,0.0013189678,0.5214252,0.0041392525,0.0014979097,0.32006606,0.13746634,0.00016606973],"about_ca_topic_score_codex":0.0047555673,"about_ca_topic_score_gemma":0.0027182307,"teacher_disagreement_score":0.11769893,"about_ca_system_score_codex":0.009007876,"about_ca_system_score_gemma":0.016937105,"threshold_uncertainty_score":0.6224589},"labels":[],"label_agreement":null},{"id":"W3125101722","doi":"10.2139/ssrn.3180340","title":"Publishing Privacy Logs to Facilitate Transparency and Accountability","year":2018,"lang":"en","type":"article","venue":"SSRN Electronic Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto; McMaster University","funders":"","keywords":"Computer science; Accountability; Privacy policy; Audit; Transparency (behavior); Information privacy; SPARQL; Implementation; Computer security; World Wide Web; Internet privacy; Semantic Web; Accounting; Business; RDF; Software engineering","score_opus":0.19793799768639578,"score_gpt":0.3898169333303212,"score_spread":0.1918789356439254,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3125101722","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08538182,0.0009048578,0.56556696,0.06798815,0.009747937,0.003963979,0.0418079,0.09769134,0.1269471],"genre_scores_gemma":[0.5846655,0.0013043621,0.29588896,0.0058782026,0.004187137,0.0019522571,0.03736132,0.01069512,0.058067206],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9453218,0.026137037,0.009390964,0.0028449665,0.014876502,0.0014286916],"domain_scores_gemma":[0.4133088,0.29876074,0.0334099,0.19486776,0.05421312,0.005439679],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.060586795,0.0010121409,0.0012172695,0.010771177,0.0031373268,0.018964972,0.0025614554,0.0040448857,0.027472323],"category_scores_gemma":[0.33165053,0.0016321789,0.0007239742,0.01048257,0.0019063362,0.021403488,0.005173738,0.007729454,0.016600829],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013468409,0.0011057118,0.02820873,0.000972647,0.00011914978,0.0009773343,0.008486343,0.005739233,0.0069874544,0.10302801,0.38536265,0.45766592],"study_design_scores_gemma":[0.00046294654,0.00046725204,0.010680224,0.0017526576,0.0001585279,0.00088203733,0.0065892944,0.079589464,0.04429215,0.18510154,0.6695782,0.0004457377],"about_ca_topic_score_codex":0.0024142505,"about_ca_topic_score_gemma":0.0022220144,"teacher_disagreement_score":0.99743855,"about_ca_system_score_codex":0.0026375942,"about_ca_system_score_gemma":0.01205817,"threshold_uncertainty_score":0.3204174},"labels":[],"label_agreement":null},{"id":"W3126588461","doi":"10.29012/jpc.765","title":"Reflections on the Successes and Challenges of Research Data Centers in Canada and the U.S.","year":2021,"lang":"en","type":"article","venue":"Journal of Privacy and Confidentiality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Political science; Regional science; Library science; Data science; Engineering ethics; Geography; Engineering; Computer science","score_opus":0.513031489092612,"score_gpt":0.5069444633669749,"score_spread":0.00608702572563713,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3126588461","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0038924352,0.003189793,0.00030056,0.98359483,0.0007844634,0.000019779816,0.00014615124,0.000019409139,0.008052514],"genre_scores_gemma":[0.2672077,0.016074046,0.0040088743,0.68731546,0.0020554708,0.00014809132,0.00046531702,0.0002902002,0.022434859],"study_design_codex":"not_applicable","study_design_gemma":"qualitative","domain_scores_codex":[0.9236495,0.02621479,0.0028859694,0.004147133,0.024222696,0.01888001],"domain_scores_gemma":[0.73579836,0.10670045,0.009752095,0.005985927,0.06350981,0.07825336],"candidate_categories":["metaresearch","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.11356659,0.00056300685,0.0008998853,0.0016947985,0.02899119,0.03160616,0.007807518,0.018587071,0.008546302],"category_scores_gemma":[0.13770258,0.0011171082,0.0010057689,0.00603354,0.03349739,0.016891688,0.01382719,0.0316677,0.00097230484],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015969659,0.00009192668,0.009770304,0.00027705135,0.00005348961,0.00054589956,0.031104421,0.0007969105,0.00039747584,0.14315192,0.7744579,0.039193045],"study_design_scores_gemma":[0.00007116631,0.00008487612,0.017131012,0.0011439207,0.00003330666,0.00022082812,0.12089495,0.0006010264,0.0005781718,0.034481548,0.82448477,0.00027449607],"about_ca_topic_score_codex":0.8866827,"about_ca_topic_score_gemma":0.9423958,"teacher_disagreement_score":0.96839386,"about_ca_system_score_codex":0.11684681,"about_ca_system_score_gemma":0.29788184,"threshold_uncertainty_score":0.8477869},"labels":[],"label_agreement":null},{"id":"W3126683361","doi":"10.5281/zenodo.3988104","title":"Engaging Citizens in Data Governance in Net Zero Precincts","year":2020,"lang":"en","type":"article","venue":"Monash University Research Portal (Monash University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Corporate governance; Zero (linguistics); Business; Political science; Public administration; Finance; Linguistics; Philosophy","score_opus":0.44643837642139783,"score_gpt":0.41171423010937125,"score_spread":0.03472414631202658,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3126683361","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.85629165,0.00027667457,0.050423164,0.0069689807,0.00012459919,0.0017465006,0.00016607971,0.00021172345,0.08379064],"genre_scores_gemma":[0.97492254,0.000086261374,0.016507065,0.00042875911,0.000010621492,0.0004366337,0.00009044926,0.00004372815,0.0074739805],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.93706816,0.052058455,0.00093072094,0.0021224758,0.003480375,0.004339755],"domain_scores_gemma":[0.96310323,0.022898786,0.002284198,0.0054735467,0.0024381918,0.0038019842],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.040450934,0.00039138438,0.00044708035,0.0011179253,0.008449748,0.011067113,0.0024391855,0.0015598632,0.0063179317],"category_scores_gemma":[0.029771794,0.0004725023,0.00041145706,0.0012932571,0.015928978,0.0061767003,0.017404363,0.0027610864,0.00070965727],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00068311434,0.001213715,0.025176462,0.0009214268,0.000040919113,0.0011756743,0.6597688,0.004102931,0.00695414,0.16863182,0.0071056024,0.12422537],"study_design_scores_gemma":[0.0001689674,0.0013111947,0.011123001,0.0006815461,0.00002638541,0.00045681995,0.6335378,0.0030944953,0.008188874,0.04048915,0.30081227,0.00010943439],"about_ca_topic_score_codex":0.0050796997,"about_ca_topic_score_gemma":0.011507254,"teacher_disagreement_score":0.040450934,"about_ca_system_score_codex":0.007924165,"about_ca_system_score_gemma":0.01280886,"threshold_uncertainty_score":0.2139275},"labels":[],"label_agreement":null},{"id":"W3126704983","doi":"10.5539/ibr.v14n3p15","title":"Investigating IT Governance Practice and Its Application, Benefits, and Administrative Implications in the Banking Sector, Saudi Arabia","year":2021,"lang":"en","type":"article","venue":"International Business Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Corporate governance; Reputation; Likert scale; Business; Accounting; Value (mathematics); Control (management); Customer satisfaction; Competitive advantage; Marketing; Scale (ratio); Finance; Economics; Management","score_opus":0.39759292426441756,"score_gpt":0.5201846290822916,"score_spread":0.12259170481787401,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3126704983","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9967024,0.00040687423,0.00010871549,0.0006394047,0.0000037943619,0.000007820187,0.000008013246,7.909008e-7,0.0021223067],"genre_scores_gemma":[0.9992508,0.00034441694,0.0000804794,0.00005756504,0.000002281952,0.0000019667098,0.0000068822546,2.9062357e-7,0.00025532313],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9985695,0.0006227494,0.00014080956,0.00008812158,0.00032848696,0.00025034504],"domain_scores_gemma":[0.9948708,0.0013025231,0.001656057,0.00012002867,0.0013432291,0.0007073134],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00233188,0.00011464582,0.00011321063,0.00091438316,0.0011127929,0.0022222542,0.00019664728,0.00031892923,0.0008450042],"category_scores_gemma":[0.00402458,0.000114491566,0.00009357415,0.0011949912,0.0012290915,0.0009926254,0.0009788166,0.00042753466,0.000092750444],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00010826373,0.0002895433,0.7848066,0.00031796063,0.00004774062,0.0008429373,0.120593324,0.0004983676,0.0022204726,0.008045098,0.0013553795,0.080874234],"study_design_scores_gemma":[0.000012715296,0.00021730416,0.6680154,0.00038082228,0.000033840584,0.000401016,0.31436545,0.0013621112,0.0009683464,0.00096059294,0.013261881,0.000020575248],"about_ca_topic_score_codex":0.017748125,"about_ca_topic_score_gemma":0.032611903,"teacher_disagreement_score":0.017748125,"about_ca_system_score_codex":0.0031919912,"about_ca_system_score_gemma":0.003222132,"threshold_uncertainty_score":0.035289645},"labels":[],"label_agreement":null},{"id":"W3126869922","doi":"10.1080/0960085x.2020.1869507","title":"Skipping class: improving human-driven data exploration and querying through instances","year":2021,"lang":"en","type":"article","venue":"European Journal of Information Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Memorial University of Newfoundland; University of British Columbia","funders":"","keywords":"Computer science; Data science; Class (philosophy); Analytics; Schema (genetic algorithms); USable; External Data Representation; Information retrieval; Data mining; World Wide Web; Artificial intelligence","score_opus":0.32684809512526897,"score_gpt":0.3967332117913389,"score_spread":0.06988511666606995,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3126869922","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.083130024,0.0004937302,0.9016931,0.0012376785,0.00008494202,0.00040715205,0.0009141765,0.0076776645,0.0043614917],"genre_scores_gemma":[0.2833918,0.00032089985,0.71105087,0.00048058238,0.000036140293,0.00034459308,0.0020234548,0.00059401675,0.0017575377],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99461704,0.0026055013,0.00032464587,0.0010879616,0.001141474,0.00022344544],"domain_scores_gemma":[0.9756832,0.016185364,0.0010325862,0.005324014,0.0011246768,0.0006501307],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006329048,0.0010986306,0.0012454487,0.0012049507,0.00054084015,0.0037855061,0.0032051802,0.0015202,0.004567009],"category_scores_gemma":[0.0335042,0.00045804013,0.0012688877,0.0018263768,0.0012213268,0.010166562,0.0048842095,0.002191641,0.0010044992],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0018920745,0.0011953291,0.015004651,0.0011733155,0.00020848727,0.00041136608,0.0068474696,0.018482488,0.025844945,0.03514953,0.014101394,0.8796889],"study_design_scores_gemma":[0.00043708086,0.001333338,0.007465535,0.0003777292,0.00031168383,0.0012064934,0.0033870393,0.7032185,0.04418835,0.1666981,0.071101084,0.00027508545],"about_ca_topic_score_codex":0.0028018102,"about_ca_topic_score_gemma":0.0032957664,"teacher_disagreement_score":0.006329048,"about_ca_system_score_codex":0.00058971107,"about_ca_system_score_gemma":0.0017891651,"threshold_uncertainty_score":0.033471584},"labels":[],"label_agreement":null},{"id":"W3128109697","doi":"10.21810/jicw.v3i3.2529","title":"Leading in a Data Centric Society","year":2021,"lang":"en","type":"article","venue":"The Journal of Intelligence Conflict and Warfare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Context (archaeology); Data quality; Key (lock); Data science; Quality (philosophy); Political science; Computer science; Computer security; Public relations; Engineering; Geography; Operations management; Epistemology","score_opus":0.3582713015373094,"score_gpt":0.45455658729887205,"score_spread":0.09628528576156264,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3128109697","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.018330049,0.008215188,0.015833907,0.79759175,0.011791254,0.00016365579,0.00029881945,0.00028287162,0.14749254],"genre_scores_gemma":[0.64820325,0.01918554,0.02137243,0.17025575,0.008642226,0.00042849922,0.0007836309,0.00043801536,0.13069059],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.95897514,0.02192988,0.0014964954,0.0030585448,0.008951972,0.005587931],"domain_scores_gemma":[0.921348,0.023325322,0.004555434,0.0068082083,0.016715433,0.027247591],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05380717,0.00064909604,0.00069482945,0.0028192326,0.015659414,0.02968052,0.0016689833,0.005105374,0.017199496],"category_scores_gemma":[0.059151217,0.00065191067,0.000667967,0.004206768,0.011507726,0.02481873,0.02166368,0.010213767,0.003982081],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015738512,0.00009201238,0.00475448,0.0002911464,0.000055987122,0.00031367212,0.0127425315,0.00076968863,0.0002702369,0.49907237,0.377508,0.10397249],"study_design_scores_gemma":[0.000029943405,0.00008370993,0.0007290591,0.00040077322,0.000012816061,0.00007325833,0.009684156,0.00053117983,0.00024859788,0.08168232,0.9064809,0.000043176933],"about_ca_topic_score_codex":0.005617372,"about_ca_topic_score_gemma":0.008365301,"teacher_disagreement_score":0.05380717,"about_ca_system_score_codex":0.008597073,"about_ca_system_score_gemma":0.02531673,"threshold_uncertainty_score":0.2845629},"labels":[],"label_agreement":null},{"id":"W3129744650","doi":"10.14778/3436905.3436907","title":"Astrid","year":2020,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":29,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Substring; Computer science; Suffix; String (physics); Embedding; String searching algorithm; Suffix tree; Prefix; Theoretical computer science; Artificial intelligence; Algorithm; Pattern matching; Data structure; Mathematics","score_opus":0.23727257312021974,"score_gpt":0.3685803821593431,"score_spread":0.13130780903912334,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3129744650","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0059815133,0.0040311636,0.13743742,0.005060445,0.00357266,0.0008026523,0.07464096,0.26682124,0.5016518],"genre_scores_gemma":[0.069856025,0.0041447864,0.16708837,0.0077056787,0.0008750779,0.0010953606,0.26209033,0.05130776,0.43583658],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99788827,0.00024406456,0.00017685551,0.00049513136,0.00092730374,0.00026837786],"domain_scores_gemma":[0.9974376,0.0003924532,0.00013624957,0.0010959931,0.00070787675,0.00022984012],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012788738,0.0020897575,0.001457095,0.0017859176,0.0013945942,0.004763247,0.0043104617,0.0028900593,0.30434948],"category_scores_gemma":[0.0064688907,0.0010830284,0.0014613513,0.0019653619,0.00068538194,0.006202341,0.0051799067,0.002845559,0.34184963],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003834506,0.000094398674,0.00087080617,0.0006248831,0.000053724452,0.00022503323,0.00010807308,0.002163166,0.0027132763,0.01928807,0.8245985,0.14887668],"study_design_scores_gemma":[0.00007528558,0.000053655272,0.0003382589,0.00009183629,0.000024481797,0.00031755926,0.000073294985,0.007876948,0.0032998447,0.014252793,0.9735537,0.00004218449],"about_ca_topic_score_codex":0.0033777007,"about_ca_topic_score_gemma":0.004702401,"teacher_disagreement_score":0.30434948,"about_ca_system_score_codex":0.0013147659,"about_ca_system_score_gemma":0.0021034682,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W3129961804","doi":"10.23889/ijpds.v6i1.1407","title":"Use of administrative record linkage to measure medical and social risk factors for early developmental vulnerability in Ontario, Canada","year":2021,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Institute for Clinical Evaluative Sciences; Hospital for Sick Children; McMaster University; University of Toronto","funders":"","keywords":"Medical record; Population; Concordance; Vulnerability (computing); Record linkage; Residence; Medicine; Demography; Psychology; Gerontology; Environmental health; Computer security","score_opus":0.48513685475496204,"score_gpt":0.4814978207620087,"score_spread":0.0036390339929533444,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3129961804","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8801069,0.0046166726,0.007812737,0.0035422384,0.00011575219,0.0021513107,0.082119025,0.000206313,0.01932908],"genre_scores_gemma":[0.968381,0.0023736309,0.006353162,0.00043549403,0.000032021482,0.0012478952,0.018359292,0.000032315627,0.0027851758],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9891338,0.0016363673,0.0011929311,0.001319835,0.005285556,0.0014314546],"domain_scores_gemma":[0.97021174,0.0027430821,0.007629148,0.0017565113,0.01589295,0.0017664974],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009789685,0.00053500204,0.00074347225,0.004867297,0.004472013,0.002453741,0.0025658805,0.00037537725,0.0016504084],"category_scores_gemma":[0.025805429,0.00065689255,0.0008470168,0.013614937,0.0010083835,0.00074284547,0.0030732667,0.00064208766,0.0002133895],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006586673,0.000031846663,0.97399986,0.00027803195,0.00024788696,0.00006261278,0.0025423244,0.0006627532,0.00013135956,0.000569587,0.0060156044,0.015392165],"study_design_scores_gemma":[0.000020543497,0.00001956136,0.99228317,0.00022295346,0.000090034104,0.000025686844,0.0012305821,0.0012202107,0.0001134964,0.00011152154,0.0046397527,0.000022541048],"about_ca_topic_score_codex":0.9973967,"about_ca_topic_score_gemma":0.99731535,"teacher_disagreement_score":0.06719827,"about_ca_system_score_codex":0.06719827,"about_ca_system_score_gemma":0.14486596,"threshold_uncertainty_score":0.48755985},"labels":[],"label_agreement":null},{"id":"W3133429097","doi":"10.1007/s11192-020-03840-8","title":"Mapping the intellectual structure of GIS-T field (2008–2019): a dynamic co-word analysis","year":2021,"lang":"en","type":"article","venue":"Scientometrics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":38,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"Kungliga Tekniska Högskolan","keywords":"Field (mathematics); Computer science; Geographic information system; Data science; Geography; Cartography; Mathematics","score_opus":0.15018153582932317,"score_gpt":0.4231165180604795,"score_spread":0.2729349822311563,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3133429097","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.95745116,0.0033157754,0.008527798,0.0022280507,0.00008912976,0.0005480949,0.013718732,0.0000708683,0.014050257],"genre_scores_gemma":[0.9809379,0.0011590254,0.010156855,0.00005927125,0.000041417203,0.0006624482,0.0057879803,0.00003028296,0.0011649823],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9933089,0.0018294615,0.0014215816,0.00082525547,0.002214434,0.0004003937],"domain_scores_gemma":[0.950762,0.02811279,0.009033076,0.0014655684,0.0098289475,0.00079769816],"candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.007720663,0.00028963573,0.0005901862,0.05135373,0.0013258071,0.004499315,0.00069964916,0.00049864064,0.0027986905],"category_scores_gemma":[0.038346317,0.00016772775,0.00061081146,0.079470284,0.001821484,0.00326457,0.0036704123,0.0005194328,0.00038269593],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005337101,0.00013525924,0.5362998,0.0078857355,0.00065097347,0.0019805771,0.12523828,0.0021583003,0.0042749327,0.051095787,0.013641021,0.25610563],"study_design_scores_gemma":[0.00004807019,0.00018182844,0.67662865,0.002354192,0.00041725909,0.0009097871,0.21158396,0.00853506,0.0030683042,0.018237775,0.07792501,0.00011006021],"about_ca_topic_score_codex":0.011647005,"about_ca_topic_score_gemma":0.008072225,"teacher_disagreement_score":0.94864625,"about_ca_system_score_codex":0.005298702,"about_ca_system_score_gemma":0.0062268344,"threshold_uncertainty_score":0.040831268},"labels":[],"label_agreement":null},{"id":"W3136500690","doi":"","title":"Les réutilisateurs et les réutilisatrices des données publiques ouvertes : Le cas de Montréal","year":2021,"lang":"fr","type":"article","venue":"EspaceINRS (National Institute for Scientific Research (Canada))","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Political science; Art; Humanities","score_opus":0.2428502168306204,"score_gpt":0.4158214539767816,"score_spread":0.1729712371461612,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3136500690","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.45302257,0.037246816,0.022130117,0.13927637,0.0014067736,0.0008423598,0.030668052,0.0014482016,0.31395876],"genre_scores_gemma":[0.8818258,0.01541157,0.017865224,0.004657203,0.00031385734,0.000255118,0.006891186,0.0005317663,0.07224823],"study_design_codex":"design_other","study_design_gemma":"qualitative","domain_scores_codex":[0.9860474,0.003028936,0.00069958606,0.0017100993,0.006178334,0.0023355477],"domain_scores_gemma":[0.95646346,0.013339978,0.0040145693,0.0023180365,0.020242454,0.0036215438],"candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.009738201,0.00059346796,0.0004909285,0.006312121,0.0068003205,0.01882994,0.0026669113,0.0014905838,0.01443438],"category_scores_gemma":[0.039215393,0.0006910833,0.0011327739,0.018987564,0.005113513,0.0073268623,0.005631103,0.0023636848,0.0011780608],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008151187,0.00016727415,0.19712885,0.0041132667,0.00067830266,0.0038487625,0.07839645,0.0058784024,0.010852745,0.18503468,0.1538756,0.3592106],"study_design_scores_gemma":[0.00004673171,0.0001221096,0.22636074,0.0016885559,0.00018792658,0.0006371264,0.05578847,0.0031871272,0.002988841,0.005664566,0.70293665,0.0003911448],"about_ca_topic_score_codex":0.96923536,"about_ca_topic_score_gemma":0.9761574,"teacher_disagreement_score":0.9973331,"about_ca_system_score_codex":0.06474464,"about_ca_system_score_gemma":0.06851635,"threshold_uncertainty_score":0.46975744},"labels":[],"label_agreement":null},{"id":"W3137444831","doi":"10.7202/1075712ar","title":"Le projet 1142 : mise en place de nouveaux espaces numériques de travail à l’Université de Montréal1","year":2021,"lang":"fr","type":"article","venue":"Archives","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":true,"ca_institutions":"Université de Montréal","funders":"","keywords":"Humanities; Political science; Art","score_opus":0.027234275998372172,"score_gpt":0.2967873321323399,"score_spread":0.2695530561339677,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3137444831","genre_codex":"empirical","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.53088963,0.008757836,0.118150994,0.06317003,0.0020866017,0.0055800807,0.014747734,0.0070671444,0.24955],"genre_scores_gemma":[0.6157753,0.0034607854,0.1473339,0.002588049,0.00031660066,0.0017184075,0.010251904,0.001389481,0.21716553],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.98077184,0.0050790473,0.00083755504,0.0025290863,0.008608054,0.0021744124],"domain_scores_gemma":[0.9435996,0.010166887,0.0025077807,0.0051217848,0.029685637,0.008918293],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.025534756,0.0010676606,0.00070282986,0.0053244242,0.008503922,0.015891649,0.0035420526,0.002430358,0.016457776],"category_scores_gemma":[0.044671997,0.0007890516,0.00090822275,0.0077380165,0.004058543,0.0050128377,0.008795677,0.0034168474,0.0039572525],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00077514077,0.00077047845,0.07705781,0.0014387816,0.00015464849,0.00089869887,0.059868883,0.004716101,0.011222017,0.05598095,0.14930329,0.63781327],"study_design_scores_gemma":[0.00015384295,0.000680836,0.13430117,0.001072369,0.000084571315,0.0002952651,0.045742765,0.0046480414,0.014193203,0.0056191557,0.7928771,0.00033159292],"about_ca_topic_score_codex":0.7577166,"about_ca_topic_score_gemma":0.73744535,"teacher_disagreement_score":0.2422834,"about_ca_system_score_codex":0.048722852,"about_ca_system_score_gemma":0.102030545,"threshold_uncertainty_score":0.4874205},"labels":[],"label_agreement":null},{"id":"W3146147323","doi":"","title":"Lakehouse: A New Generation of Open Platforms that Unify Data Warehousing and Advanced Analytics.","year":2021,"lang":"en","type":"article","venue":"Conference on Innovative Data Systems Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":123,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Analytics; Data warehouse; Data science; Database","score_opus":0.946872203848267,"score_gpt":0.6271471361658597,"score_spread":0.31972506768240727,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3146147323","genre_codex":"software","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.06195461,0.0037265436,0.3011427,0.01107496,0.0018902267,0.001886712,0.04864962,0.49917987,0.07049476],"genre_scores_gemma":[0.18445843,0.0037676094,0.3934363,0.0056364425,0.0016651498,0.002605648,0.17409687,0.0449231,0.18941046],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99590474,0.00040495166,0.0002769852,0.00046770927,0.0024827004,0.00046289866],"domain_scores_gemma":[0.99185747,0.00181728,0.0007296607,0.0024280883,0.0014120667,0.0017554058],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004961494,0.0011727673,0.0008321572,0.003113824,0.0015354757,0.005280169,0.003856873,0.0014165815,0.025851853],"category_scores_gemma":[0.010858477,0.0013537813,0.0010702284,0.003616216,0.0013785923,0.015312176,0.010572937,0.0034686741,0.011164952],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0025034053,0.00089715084,0.0066113696,0.0009564207,0.00032140146,0.00081510533,0.0017276544,0.0017056712,0.040792402,0.03384379,0.6478489,0.26197678],"study_design_scores_gemma":[0.00091059005,0.0006041232,0.011172151,0.00037200924,0.00022828186,0.0005993579,0.00074337557,0.028838025,0.032670483,0.04026911,0.88311267,0.0004798861],"about_ca_topic_score_codex":0.005541218,"about_ca_topic_score_gemma":0.007719381,"teacher_disagreement_score":0.025851853,"about_ca_system_score_codex":0.0007915081,"about_ca_system_score_gemma":0.004133927,"threshold_uncertainty_score":0.08648306},"labels":[],"label_agreement":null},{"id":"W31491858","doi":"10.3390/vetsci6030073","title":"Entwicklung von Konzepten zur flexiblen Integration der Datenqualitätssicherung in analytischen Anwendungen.","year":2005,"lang":"en","type":"article","venue":"Veterinary Sciences","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Computer science","score_opus":0.4367512115559696,"score_gpt":0.4963433225596985,"score_spread":0.05959211100372891,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W31491858","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01245661,0.004890054,0.9516067,0.0022577245,0.00027877212,0.0016422682,0.001183805,0.015086903,0.010597214],"genre_scores_gemma":[0.055874012,0.0032757483,0.9324454,0.0008717602,0.00011054616,0.0011786689,0.0021475344,0.0010581241,0.0030382986],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98052764,0.006370279,0.0031152437,0.0021820327,0.0070864526,0.0007183513],"domain_scores_gemma":[0.9735469,0.011461386,0.0017397248,0.007855016,0.004293278,0.0011037713],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02839112,0.0020244352,0.0014957445,0.0039390763,0.0007165075,0.009140676,0.0029538372,0.001970359,0.005212658],"category_scores_gemma":[0.039569575,0.0015066435,0.0019117594,0.0021318346,0.0016353475,0.008016755,0.0067617274,0.0047409683,0.004802901],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007554583,0.0006957564,0.0068095266,0.002946001,0.00066085346,0.0004233851,0.0019113814,0.008247724,0.026036581,0.039100196,0.010328264,0.9020849],"study_design_scores_gemma":[0.00047818455,0.00132113,0.00923285,0.0065990794,0.0009728134,0.0020442517,0.0023326771,0.17550987,0.122810975,0.21433261,0.46374992,0.000615617],"about_ca_topic_score_codex":0.0018724683,"about_ca_topic_score_gemma":0.0017685512,"teacher_disagreement_score":0.02839112,"about_ca_system_score_codex":0.0013728433,"about_ca_system_score_gemma":0.0040355893,"threshold_uncertainty_score":0.15014839},"labels":[],"label_agreement":null},{"id":"W3150711643","doi":"10.5441/002/edbt.2021.35","title":"HorsePower: Accelerating Database Queries for Advanced Data Analytics","year":2021,"lang":"en","type":"article","venue":"Movebank","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Horsepower; Computer science; Analytics; Database; Data analysis; Data modeling; Data mining; Engineering","score_opus":0.5144424565501053,"score_gpt":0.4858367395349261,"score_spread":0.02860571701517922,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3150711643","genre_codex":"methods","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.025580417,0.0018352938,0.5113565,0.004814524,0.0018017495,0.0008550236,0.018116213,0.42325112,0.012389073],"genre_scores_gemma":[0.14360103,0.0014693218,0.7685826,0.002563579,0.0007255688,0.00082317117,0.04146746,0.02345543,0.017311735],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.990681,0.0021787893,0.00087559066,0.0015771781,0.004183102,0.0005044559],"domain_scores_gemma":[0.9743429,0.010848643,0.0010294933,0.00946394,0.0032791388,0.0010359018],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009991231,0.002563024,0.0014696325,0.004506375,0.001072411,0.0065382184,0.0041223885,0.0016858275,0.030352881],"category_scores_gemma":[0.05456606,0.001703354,0.001688604,0.005007587,0.0011898464,0.010012975,0.007408303,0.003102647,0.014398317],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0027641463,0.0005156377,0.009214008,0.0010498317,0.0005827291,0.00043499563,0.0011761101,0.0062087006,0.017943777,0.028119879,0.49737588,0.43461433],"study_design_scores_gemma":[0.0016768088,0.0007121997,0.0090558175,0.00053236226,0.0006106183,0.00075448124,0.0013991715,0.46002686,0.05059222,0.09007354,0.3842151,0.00035078003],"about_ca_topic_score_codex":0.00962234,"about_ca_topic_score_gemma":0.010085787,"teacher_disagreement_score":0.030352881,"about_ca_system_score_codex":0.0013859213,"about_ca_system_score_gemma":0.00328823,"threshold_uncertainty_score":0.101540506},"labels":[],"label_agreement":null},{"id":"W3151061208","doi":"","title":"An Information Governance Methodology to Tackle Digital Recordkeeping Challenges: The Convergence of Artificial Intelligence, Business Analysis and Information Architecture","year":2020,"lang":"en","type":"article","venue":"Proceedings of the Annual Conference of CAIS / Actes du congrès annuel de l'ACSI","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Humanities; Corporate governance; Knowledge management; Process management; Computer science; Artificial intelligence; Engineering; Management; Philosophy","score_opus":0.12994318594565615,"score_gpt":0.33762642501605117,"score_spread":0.20768323907039501,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3151061208","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0020766028,0.00016366395,0.99039817,0.0013497984,0.000027405718,0.00018518057,0.000029442816,0.00019040873,0.005579374],"genre_scores_gemma":[0.043505814,0.00027518117,0.9527537,0.00016879982,0.000033261516,0.00042531034,0.00009078311,0.000089501715,0.002657627],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98107177,0.012167908,0.0014942944,0.0014314798,0.0034004631,0.00043403724],"domain_scores_gemma":[0.98117906,0.010375384,0.0013161273,0.003613611,0.0030467594,0.00046910488],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.024129426,0.001142886,0.0007384324,0.0066427267,0.0023999342,0.011366091,0.002642805,0.0022833224,0.0027756116],"category_scores_gemma":[0.019290727,0.0009257857,0.0016999277,0.0051017515,0.008131625,0.012540171,0.004942739,0.003560123,0.00087750336],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000011796379,0.00008045533,0.0011447693,0.00035090555,0.000038258706,0.00018306842,0.004092974,0.006989564,0.0016841635,0.89146274,0.0013304743,0.092630886],"study_design_scores_gemma":[0.000036780235,0.00013251325,0.00093976146,0.00085012824,0.00006897952,0.0005392984,0.004923735,0.083012655,0.0072877533,0.7544067,0.14772765,0.000074050535],"about_ca_topic_score_codex":0.00320054,"about_ca_topic_score_gemma":0.0034881632,"teacher_disagreement_score":0.024129426,"about_ca_system_score_codex":0.0044656466,"about_ca_system_score_gemma":0.010791147,"threshold_uncertainty_score":0.12761009},"labels":[],"label_agreement":null},{"id":"W3154149429","doi":"","title":"Collaborating for Greater Impact: Building an Integrated Data Ecosystem","year":2018,"lang":"en","type":"article","venue":"TSpace","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"University of Toronto; Australian Government","keywords":"Ecosystem; Environmental resource management; Environmental science; Business; Computer science; Ecology","score_opus":0.4099295516535472,"score_gpt":0.558409725810772,"score_spread":0.14848017415722475,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3154149429","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.084479,0.005126967,0.39181322,0.14597966,0.0029021134,0.0029676615,0.018806852,0.015444187,0.3324804],"genre_scores_gemma":[0.26831314,0.0041900673,0.6376229,0.004654418,0.00044507236,0.0008954095,0.02338583,0.0037044755,0.056788713],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9892832,0.0036437693,0.00070949364,0.0011841088,0.0044334773,0.00074598554],"domain_scores_gemma":[0.975271,0.0060417727,0.000840108,0.007597003,0.005872119,0.0043780734],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.018754018,0.0007405031,0.00072617293,0.0049584936,0.0034246726,0.017547233,0.0017907285,0.0018288202,0.020884216],"category_scores_gemma":[0.03183251,0.0010546227,0.00078180217,0.0078518875,0.0028962796,0.017434282,0.01869041,0.0031468435,0.0057414942],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017042132,0.00028304965,0.018986661,0.0007681693,0.00019730466,0.00055240054,0.011331114,0.00642923,0.006775612,0.092908435,0.2981575,0.56344],"study_design_scores_gemma":[0.00008163717,0.00010516585,0.011027464,0.0009849112,0.00013232481,0.00019877992,0.0061069583,0.009354403,0.0023394886,0.05860179,0.9109806,0.00008650344],"about_ca_topic_score_codex":0.06287556,"about_ca_topic_score_gemma":0.10398359,"teacher_disagreement_score":0.06287556,"about_ca_system_score_codex":0.005556139,"about_ca_system_score_gemma":0.018919382,"threshold_uncertainty_score":0.1250192},"labels":[],"label_agreement":null},{"id":"W3155972762","doi":"10.1136/bmjopen-2020-043497","title":"Can synthetic data be a proxy for real clinical trial data? A validation study","year":2021,"lang":"en","type":"article","venue":"BMJ Open","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":103,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa; McGill University Health Centre; Children's Hospital of Eastern Ontario; McGill University","funders":"Natural Sciences and Engineering Research Council of Canada; Canadian Institutes of Health Research","keywords":"Univariate; Medicine; Bivariate analysis; Multivariate statistics; Metric (unit); Synthetic data; Statistic; Multivariate analysis; Data mining; Proxy (statistics); Statistics; Internal medicine; Computer science; Mathematics","score_opus":0.8969700184148548,"score_gpt":0.6912436001651321,"score_spread":0.2057264182497227,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3155972762","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.4945783,0.009431945,0.4540893,0.00970206,0.0022031518,0.0077929497,0.011358142,0.0010343677,0.009809803],"genre_scores_gemma":[0.92448044,0.00050719286,0.061467316,0.0030626818,0.00030947683,0.004434535,0.0050780126,0.00020932224,0.0004510972],"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.57247424,0.38582605,0.0131941885,0.011249136,0.015931295,0.0013250976],"domain_scores_gemma":[0.11570775,0.6707475,0.041222323,0.15270741,0.018279117,0.0013357978],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.42361015,0.0014663641,0.0014345837,0.0023575423,0.0012813293,0.005941331,0.0048625004,0.0036850944,0.005029719],"category_scores_gemma":[0.7506392,0.0010151201,0.0035736046,0.0033967642,0.007642843,0.0050104456,0.00460442,0.0044516264,0.0011941321],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.021595173,0.0035938004,0.5904657,0.0071875593,0.016138176,0.0011335339,0.008186401,0.08355308,0.003412079,0.06980944,0.025271911,0.1696532],"study_design_scores_gemma":[0.010250257,0.018934706,0.2481439,0.0085761845,0.00585616,0.004315289,0.004319897,0.4037983,0.010827968,0.17276397,0.11135095,0.0008623995],"about_ca_topic_score_codex":0.001717948,"about_ca_topic_score_gemma":0.0008428556,"teacher_disagreement_score":0.57638985,"about_ca_system_score_codex":0.0020171038,"about_ca_system_score_gemma":0.004548281,"threshold_uncertainty_score":0.71079135},"labels":[],"label_agreement":null},{"id":"W3159065547","doi":"","title":"Overview of TAC-KBP 2019 Fine-grained Entity Extraction.","year":2019,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Extraction (chemistry); Chemistry; Chromatography","score_opus":0.06709713054902026,"score_gpt":0.39385835955841175,"score_spread":0.3267612290093915,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3159065547","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.002773716,0.012444486,0.8277251,0.0024401115,0.00064418634,0.0013468137,0.052928194,0.067926235,0.031771153],"genre_scores_gemma":[0.020556493,0.006960303,0.7237926,0.0011896896,0.00025116015,0.0009490937,0.23245883,0.0049241222,0.008917764],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9942967,0.0010303274,0.0010049627,0.0009177022,0.0024239912,0.00032615598],"domain_scores_gemma":[0.99060726,0.0022661483,0.00038924938,0.00303977,0.0033653446,0.00033231865],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006906693,0.0016257206,0.0016903895,0.015304766,0.0017530558,0.0070852456,0.004325608,0.0016013271,0.01505772],"category_scores_gemma":[0.019547261,0.0014104008,0.0023230198,0.014590009,0.0009273801,0.008221232,0.005712818,0.002866769,0.02105704],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021241115,0.00015181862,0.0019520974,0.0035205812,0.0004068289,0.0004339399,0.0005515041,0.006714096,0.00955421,0.05558479,0.35867256,0.56224513],"study_design_scores_gemma":[0.0000439909,0.000060353235,0.002304419,0.0008939962,0.00016564163,0.0008632461,0.00031246888,0.044057343,0.0100095,0.06656316,0.8745951,0.00013076019],"about_ca_topic_score_codex":0.017513143,"about_ca_topic_score_gemma":0.01778926,"teacher_disagreement_score":0.017513143,"about_ca_system_score_codex":0.0020074742,"about_ca_system_score_gemma":0.006521566,"threshold_uncertainty_score":0.050373077},"labels":[],"label_agreement":null},{"id":"W3159720274","doi":"10.18438/eblip29879","title":"A Pilot to Initiate Research Data Management Services Within Academic Libraries Helps Librarians to Learn About, Engage With, and Enhance Skills Within Their Research Communities","year":2021,"lang":"en","type":"article","venue":"Evidence Based Library and Information Practice","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"RDM; Phone; Medical education; Library science; Miller; Psychology; Sociology; Public relations; Medicine; Computer science; Political science; Pedagogy","score_opus":0.3451696637035892,"score_gpt":0.47323814499927713,"score_spread":0.12806848129568793,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3159720274","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.49018413,0.001566325,0.10632473,0.100862905,0.0027480854,0.12167701,0.00417899,0.01875744,0.15370043],"genre_scores_gemma":[0.48387206,0.0018265474,0.36204624,0.01673431,0.00131118,0.06172082,0.0026947048,0.0009699786,0.06882421],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.9754322,0.016388576,0.0013033139,0.0018433552,0.0022921301,0.00274041],"domain_scores_gemma":[0.88894147,0.03322895,0.0071899053,0.018372605,0.016708577,0.035558514],"candidate_categories":["metaresearch","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.047910076,0.0009505574,0.00052107725,0.002306558,0.007632344,0.00508151,0.0043284064,0.0030506586,0.049701508],"category_scores_gemma":[0.061723042,0.0013714299,0.0014250823,0.0015709492,0.0026791645,0.00862022,0.010844284,0.0040147905,0.015900891],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0018988342,0.019508744,0.057757653,0.002711231,0.0000727263,0.0034900885,0.04538692,0.00045157198,0.008999151,0.0063709496,0.18042544,0.6729267],"study_design_scores_gemma":[0.0032224606,0.018879859,0.07579316,0.0021064174,0.00021065307,0.0035570096,0.07337079,0.0033490378,0.014213736,0.0058301776,0.79897743,0.0004893016],"about_ca_topic_score_codex":0.0041872696,"about_ca_topic_score_gemma":0.011169164,"teacher_disagreement_score":0.99491847,"about_ca_system_score_codex":0.005080073,"about_ca_system_score_gemma":0.03510684,"threshold_uncertainty_score":0.25337577},"labels":[],"label_agreement":null},{"id":"W3160270149","doi":"10.48550/arxiv.2105.04021","title":"MS MARCO: Benchmarking Ranking Models in the Large-Data Regime","year":2021,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo; Microsoft (Canada)","funders":"","keywords":"Benchmarking; Clef; Computer science; Ranking (information retrieval); Field (mathematics); Data science; Best practice; Track (disk drive); Artificial intelligence; Information retrieval; Political science; Task (project management); Engineering","score_opus":0.4743132750901781,"score_gpt":0.3087619711037293,"score_spread":0.1655513039864488,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3160270149","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.24818918,0.017166449,0.46427566,0.031240594,0.009065277,0.0026211343,0.05296258,0.06815878,0.106320344],"genre_scores_gemma":[0.5758967,0.0017470536,0.30259115,0.003424333,0.001516202,0.0013319649,0.09412598,0.0058255037,0.0135411685],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9430641,0.038173027,0.002543136,0.004143544,0.010366014,0.0017102798],"domain_scores_gemma":[0.89045596,0.04934315,0.003880472,0.031699352,0.019950572,0.004670492],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08415675,0.0026181655,0.0018387011,0.005428941,0.0022732422,0.0066062803,0.0045247427,0.0034068034,0.0059429617],"category_scores_gemma":[0.18609208,0.0008100707,0.0013002142,0.007097111,0.0021566122,0.006944384,0.004832654,0.00457399,0.003905065],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002049316,0.0017619703,0.028269093,0.0016908132,0.0017320119,0.0002654913,0.0007450285,0.16109468,0.0027539716,0.045273587,0.5466376,0.2077264],"study_design_scores_gemma":[0.0011778639,0.0015137262,0.020091483,0.000509905,0.00025786617,0.0002730499,0.00070871244,0.7844341,0.008841296,0.06144595,0.120525375,0.00022068033],"about_ca_topic_score_codex":0.024644455,"about_ca_topic_score_gemma":0.045347348,"teacher_disagreement_score":0.08415675,"about_ca_system_score_codex":0.0041821846,"about_ca_system_score_gemma":0.005858833,"threshold_uncertainty_score":0.44506878},"labels":[],"label_agreement":null},{"id":"W3160528426","doi":"10.2172/1782589","title":"Next Generation Hydrogen Station Composite Data Products: Retail Stations; Summer 2020 (Q2 FY2020)","year":2021,"lang":"en","type":"report","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"National Renewable Energy Laboratory","keywords":"Software deployment; Reliability (semiconductor); Composite number; Quarter (Canadian coin); Hydrogen production; Environmental science; Data quality; Component (thermodynamics); Hydrogen; Environmental economics; Computer science; Business; Service (business); Marketing; Chemistry; Geography","score_opus":0.670532853712078,"score_gpt":0.48186204244176456,"score_spread":0.1886708112703135,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3160528426","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0037228575,0.00041877275,0.0036619885,0.0018806586,0.0014558085,0.00066233694,0.8406942,0.002018752,0.14548457],"genre_scores_gemma":[0.011231551,0.0008443907,0.009556123,0.00052570004,0.00023048215,0.0007108998,0.79902834,0.00080616,0.17706637],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99884605,0.000060469058,0.000033895136,0.000077082645,0.0008936914,0.00008878354],"domain_scores_gemma":[0.99669003,0.00020463331,0.00020959436,0.00012818222,0.0024652646,0.00030230472],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0022005874,0.0014147068,0.00044523284,0.0012613209,0.0005462739,0.0026378476,0.0009997422,0.00094747014,0.08953639],"category_scores_gemma":[0.004012608,0.00051531213,0.00033818005,0.002022312,0.00017797969,0.0013458111,0.0007599924,0.0010179068,0.07525569],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00011690409,0.00005295673,0.0008045431,0.00007506575,0.000005014724,0.000008104063,0.000009186226,0.0004921402,0.00028956702,0.00050009845,0.98244584,0.01520068],"study_design_scores_gemma":[0.000080044425,0.0000939759,0.0073321597,0.0000590058,0.000009083529,0.000011875436,0.000050789833,0.0013821496,0.0015484554,0.00045041973,0.98896563,0.000016389322],"about_ca_topic_score_codex":0.079510234,"about_ca_topic_score_gemma":0.070479564,"teacher_disagreement_score":0.08953639,"about_ca_system_score_codex":0.0024873023,"about_ca_system_score_gemma":0.007487672,"threshold_uncertainty_score":0.29952908},"labels":[],"label_agreement":null},{"id":"W3162028309","doi":"10.1145/3411764.3445227","title":"KTabulator: Interactive Ad hoc Table Creation using Knowledge Graphs","year":2021,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Table (database); Information retrieval; Knowledge graph; Testbed; Construct (python library); World Wide Web; Graph; Post hoc; Data mining; Theoretical computer science; Programming language","score_opus":0.21552636783225454,"score_gpt":0.46971911151106305,"score_spread":0.2541927436788085,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3162028309","genre_codex":"methods","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01697147,0.00056094356,0.57107496,0.0004092222,0.00018269166,0.00096054305,0.016108893,0.38668454,0.0070467475],"genre_scores_gemma":[0.08152619,0.0006335744,0.87170064,0.00034246052,0.00004670426,0.0010477139,0.02458579,0.014541594,0.005575274],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9986395,0.00037366193,0.00017640022,0.00034511165,0.00039853604,0.00006668684],"domain_scores_gemma":[0.9857329,0.009854268,0.0005195707,0.002598659,0.0007774735,0.0005171198],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0029166497,0.0017131502,0.00091238506,0.004085304,0.00075414183,0.0033689877,0.0029808516,0.0010425275,0.015456128],"category_scores_gemma":[0.014320652,0.0011852556,0.0013560234,0.0029629485,0.00075109274,0.005555707,0.0047022514,0.0014480554,0.0067036985],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019346906,0.00083347084,0.00942754,0.0039752848,0.0006139548,0.001825043,0.006286013,0.015249917,0.03619835,0.017841386,0.24325559,0.6625587],"study_design_scores_gemma":[0.0006820143,0.0005040583,0.007834048,0.00066519395,0.0003694454,0.0020538245,0.002536805,0.27273685,0.073335804,0.05916174,0.57956517,0.0005549879],"about_ca_topic_score_codex":0.0030786023,"about_ca_topic_score_gemma":0.006244202,"teacher_disagreement_score":0.015456128,"about_ca_system_score_codex":0.00064308377,"about_ca_system_score_gemma":0.0014709753,"threshold_uncertainty_score":0.051705956},"labels":[],"label_agreement":null},{"id":"W3164503825","doi":"","title":"Reflections on the Successes and Challenges of Research Data Centers in Canada and the U.S.","year":2021,"lang":"en","type":"article","venue":"DOAJ (DOAJ: Directory of Open Access Journals)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Political science; Library science; Public relations; Computer science","score_opus":0.8564487430690108,"score_gpt":0.6947039409183844,"score_spread":0.16174480215062637,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3164503825","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"evaluation","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"evaluation","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0043310625,0.0033017823,0.0002901953,0.9834139,0.0007537481,0.000023884535,0.00023808816,0.000032141044,0.0076152543],"genre_scores_gemma":[0.29908165,0.015521593,0.006394098,0.6593444,0.0021982607,0.00015506853,0.00059295277,0.00034756516,0.01636442],"study_design_codex":"not_applicable","study_design_gemma":"qualitative","domain_scores_codex":[0.91111743,0.023470376,0.0043595275,0.004349681,0.0344766,0.022226373],"domain_scores_gemma":[0.63092583,0.11950041,0.012654673,0.006835108,0.12272328,0.107360765],"candidate_categories":["metaresearch","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.116024464,0.00054807763,0.0010121062,0.0027904252,0.024111044,0.037445705,0.008310644,0.015210912,0.008840483],"category_scores_gemma":[0.17724244,0.0011867954,0.0010748836,0.00928067,0.029201739,0.014238647,0.011323375,0.026821021,0.0009829126],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":true,"study_design_scores_codex":[0.00017851155,0.00011548414,0.0148946345,0.0004537511,0.000086104,0.00046592907,0.019989457,0.001225661,0.00040780214,0.14999545,0.7664592,0.04572811],"study_design_scores_gemma":[0.0001226078,0.00009592397,0.030188497,0.0017433446,0.000047943668,0.00018593023,0.09061526,0.0009561477,0.0005558411,0.031681653,0.84346724,0.000339676],"about_ca_topic_score_codex":0.9657475,"about_ca_topic_score_gemma":0.97928303,"teacher_disagreement_score":0.9625543,"about_ca_system_score_codex":0.16882825,"about_ca_system_score_gemma":0.42405343,"threshold_uncertainty_score":0.9640414},"labels":[],"label_agreement":null},{"id":"W3165068300","doi":"10.1177/10497323211015960","title":"What Are Data?","year":2021,"lang":"en","type":"article","venue":"Qualitative Health Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":13,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta; University of British Columbia, Okanagan Campus; University of British Columbia","funders":"","keywords":"Psychology; Medicine","score_opus":0.9756802608194425,"score_gpt":0.7995023206113255,"score_spread":0.17617794020811695,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3165068300","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0037528235,0.022468038,0.06629388,0.8419674,0.012433138,0.0010845321,0.0036575114,0.00045697708,0.0478857],"genre_scores_gemma":[0.3417687,0.06620648,0.26061237,0.26754367,0.014609056,0.010673723,0.0068501183,0.002200874,0.029534996],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.63303196,0.26618943,0.029736686,0.012720203,0.054369543,0.003952156],"domain_scores_gemma":[0.36983973,0.46380264,0.020710753,0.06245711,0.0674582,0.015731618],"candidate_categories":["metaresearch","sts"],"consensus_categories":[],"category_scores_codex":[0.25784016,0.0015360233,0.0042436398,0.012355666,0.008092486,0.04303668,0.0051031727,0.008055851,0.019836387],"category_scores_gemma":[0.5277621,0.002353926,0.0024040043,0.010737072,0.041481312,0.057056125,0.012143868,0.015587562,0.008533137],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020593988,0.00015073192,0.007864759,0.013674837,0.00046521646,0.00038906286,0.042592116,0.00026340337,0.00080070115,0.44531476,0.17266686,0.31561163],"study_design_scores_gemma":[0.00006021471,0.00003838702,0.0015457855,0.018404745,0.00016148013,0.00032330814,0.03665295,0.0004019077,0.00079465413,0.37385055,0.5676558,0.00011022053],"about_ca_topic_score_codex":0.0072280676,"about_ca_topic_score_gemma":0.007562693,"teacher_disagreement_score":0.99190754,"about_ca_system_score_codex":0.015225268,"about_ca_system_score_gemma":0.047842734,"threshold_uncertainty_score":0.9152152},"labels":[],"label_agreement":null},{"id":"W3165615601","doi":"10.3233/shti210153","title":"Using Interactive Visual Analytics to Optimize in Real-Time Blood Products Inventory at a Blood Bank","year":2021,"lang":"en","type":"book-chapter","venue":"Studies in health technology and informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Nova Scotia Health Authority; Dalhousie University","funders":"Canadian Blood Services","keywords":"Dashboard; Analytics; Computer science; Product (mathematics); Visualization; Inventory management; Visual analytics; Blood product; Blood transfusion; Operations management; Database; Medicine; Engineering; Data mining; Surgery","score_opus":0.24235612779801405,"score_gpt":0.46475810056794437,"score_spread":0.22240197276993032,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3165615601","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017113382,0.0030334692,0.8760734,0.0011248076,0.0003981663,0.0001595642,0.0009965575,0.018190127,0.08291055],"genre_scores_gemma":[0.13417932,0.005654497,0.7675602,0.00062367355,0.00023997705,0.0003117336,0.0023167531,0.003074549,0.08603924],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9997656,0.000052603256,0.000010515314,0.000042111307,0.00010983636,0.000019310397],"domain_scores_gemma":[0.99914455,0.00057715055,0.00002946488,0.000052306976,0.00015629551,0.000040264193],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005701714,0.0009094372,0.00030970213,0.000847129,0.00022435455,0.0024168175,0.00091246027,0.00054976414,0.011129699],"category_scores_gemma":[0.0015437537,0.00027314996,0.00034959172,0.0009039338,0.00034667473,0.0015886326,0.0009301145,0.00080604525,0.0028064344],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002233123,0.00016171252,0.0012904151,0.00080711266,0.000045826844,0.00042434005,0.0013344847,0.050934833,0.042173892,0.03942439,0.11203957,0.7511401],"study_design_scores_gemma":[0.00008609693,0.00023565703,0.0030258757,0.000524586,0.000079686586,0.00065629056,0.0007361961,0.44719318,0.040492896,0.063138165,0.4436783,0.00015308792],"about_ca_topic_score_codex":0.0013579781,"about_ca_topic_score_gemma":0.0017386781,"teacher_disagreement_score":0.011129699,"about_ca_system_score_codex":0.00042457366,"about_ca_system_score_gemma":0.00036551038,"threshold_uncertainty_score":0.037232578},"labels":[],"label_agreement":null},{"id":"W3168854329","doi":"10.14778/3467861.3467872","title":"Data acquisition for improving machine learning models","year":2021,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":37,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto; York University","funders":"","keywords":"Data acquisition; Process (computing); Data modeling; Online machine learning; Knowledge acquisition; Training set; Annotation; Data integration; Supervised learning","score_opus":0.28485107715764413,"score_gpt":0.3865902747486838,"score_spread":0.10173919759103967,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3168854329","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.043047808,0.0012389788,0.947251,0.0018106578,0.00009071598,0.00024696297,0.0006264637,0.0032114547,0.0024758754],"genre_scores_gemma":[0.42367253,0.00078296015,0.569904,0.00088127604,0.00021215368,0.00054181594,0.0021677278,0.0004238983,0.0014136683],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99238425,0.003929856,0.0004917698,0.0011884773,0.0017009819,0.00030476355],"domain_scores_gemma":[0.95497715,0.032147747,0.0014539228,0.0082481885,0.0028064572,0.00036666953],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.012170153,0.0019846521,0.001995232,0.0020640495,0.0010006273,0.0026374136,0.0031444873,0.0022607816,0.004829378],"category_scores_gemma":[0.072211556,0.0010994332,0.0018313262,0.0028532327,0.0017169988,0.007616462,0.0042292792,0.00529235,0.0017943009],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011209685,0.0010026429,0.011551404,0.00045967265,0.0002915233,0.00019943861,0.00055250456,0.4463065,0.0072070523,0.049572986,0.009138313,0.47259694],"study_design_scores_gemma":[0.00006695604,0.00015168721,0.00060158176,0.000036100995,0.00003846759,0.00004951004,0.000079596095,0.9666936,0.005030031,0.02424877,0.0029832975,0.000020376201],"about_ca_topic_score_codex":0.004274661,"about_ca_topic_score_gemma":0.004387464,"teacher_disagreement_score":0.012170153,"about_ca_system_score_codex":0.0017089245,"about_ca_system_score_gemma":0.0029965218,"threshold_uncertainty_score":0.064362705},"labels":[],"label_agreement":null},{"id":"W3168932797","doi":"10.1186/s12911-021-01550-6","title":"Record linkage under suboptimal conditions for data-intensive evaluation of primary care in Rio de Janeiro, Brazil","year":2021,"lang":"en","type":"article","venue":"BMC Medical Informatics and Decision Making","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University; McGill University Health Centre","funders":"Medical Research Council; Fundação Carlos Chagas Filho de Amparo à Pesquisa do Estado do Rio de Janeiro; Conselho Nacional de Desenvolvimento Científico e Tecnológico","keywords":"Record linkage; Identifier; Linkage (software); Probabilistic logic; Quality (philosophy); Gold standard (test); Health informatics; Computer science; Database; Health care; Data quality; Data mining; Medicine; Public health; Artificial intelligence; Population; Environmental health; Nursing; Business; Service (business)","score_opus":0.32106487536970196,"score_gpt":0.5008400079838637,"score_spread":0.17977513261416178,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3168932797","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8057092,0.007062638,0.15342802,0.005388042,0.00027824676,0.0070717772,0.01000694,0.00073381455,0.010321395],"genre_scores_gemma":[0.8541775,0.0011612385,0.13384824,0.0005724818,0.00010094631,0.0042554634,0.0050818427,0.000075904674,0.0007264115],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.8209416,0.12077607,0.02061318,0.014227856,0.020882184,0.0025591524],"domain_scores_gemma":[0.6999772,0.18440978,0.045189478,0.03162016,0.037373908,0.0014294743],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1474412,0.00057014206,0.0016834859,0.0054891156,0.0024657757,0.005416309,0.0031394332,0.0013719734,0.00169204],"category_scores_gemma":[0.37183625,0.00076882396,0.0014620082,0.010049423,0.0012547732,0.0026726285,0.0059305266,0.0007272755,0.00035871047],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008226264,0.00032267612,0.75824934,0.0040785437,0.0015191141,0.00082515564,0.015700571,0.011776193,0.0016392716,0.011194618,0.0068559614,0.18701605],"study_design_scores_gemma":[0.00047362898,0.0010445697,0.7689885,0.0047911876,0.0022087237,0.0024588003,0.01808844,0.10547467,0.010817236,0.026202995,0.059126355,0.00032495128],"about_ca_topic_score_codex":0.034094058,"about_ca_topic_score_gemma":0.030741692,"teacher_disagreement_score":0.1474412,"about_ca_system_score_codex":0.0053720665,"about_ca_system_score_gemma":0.014485727,"threshold_uncertainty_score":0.77975285},"labels":[],"label_agreement":null},{"id":"W3174181760","doi":"10.1145/3448016.3450586","title":"Temporal Dependencies for Graphs","year":2021,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Computer science; Graph product; Product (mathematics); Knowledge graph; Relational database; Theoretical computer science; Information retrieval; Data mining; Graph; Chordal graph; Mathematics","score_opus":0.34115366956646953,"score_gpt":0.46325589940902506,"score_spread":0.12210222984255553,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3174181760","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0055391933,0.0025371306,0.9528466,0.0033006568,0.0005867249,0.00027151575,0.006964442,0.0022971397,0.025656607],"genre_scores_gemma":[0.18112864,0.0073451037,0.7579333,0.002840174,0.0017115745,0.001150571,0.02093254,0.0024533405,0.024504822],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9939784,0.0017232236,0.00071700255,0.0016912647,0.0014997957,0.00039039584],"domain_scores_gemma":[0.9776372,0.014219292,0.0016486828,0.0034550822,0.0026079135,0.00043175288],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005217655,0.001607922,0.000896953,0.0052235615,0.0026318142,0.0045071924,0.0022264577,0.0019950306,0.01827938],"category_scores_gemma":[0.026007095,0.0016187809,0.003425768,0.005746949,0.0032955504,0.0140330745,0.0041521643,0.0045262612,0.0039708703],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000042547,0.00002359157,0.0005583845,0.00033840744,0.00004670891,0.00028770007,0.00045664312,0.009892569,0.0005763038,0.9376124,0.013760975,0.03640379],"study_design_scores_gemma":[0.000014641526,0.000011474152,0.0001807214,0.000102173835,0.000037197922,0.00023778502,0.00008139307,0.0169021,0.0005367342,0.9083935,0.07347614,0.000026116308],"about_ca_topic_score_codex":0.018411374,"about_ca_topic_score_gemma":0.015256033,"teacher_disagreement_score":0.018411374,"about_ca_system_score_codex":0.003994558,"about_ca_system_score_gemma":0.0024451134,"threshold_uncertainty_score":0.06115061},"labels":[],"label_agreement":null},{"id":"W3175120204","doi":"10.1109/wiiat50758.2020.00087","title":"Analytics of Similar-Sounding Names from the Web with Phonetic Based Clustering","year":2020,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":16,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"University of Manitoba","keywords":"Computer science; Cluster analysis; Big data; Task (project management); Web intelligence; Web mining; World Wide Web; Semantic Web; Analytics; Data science; Focus (optics); Depth sounding; Data Web; Information retrieval; The Internet; Web page; Data mining; Artificial intelligence; Web modeling; Geography; Engineering","score_opus":0.25441121919444054,"score_gpt":0.3696189409535637,"score_spread":0.11520772175912314,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3175120204","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7098331,0.0019436073,0.25675175,0.0012139827,0.0002523528,0.00041008898,0.017294703,0.0036661236,0.008634322],"genre_scores_gemma":[0.8126808,0.000623399,0.16068487,0.00013670158,0.00019406417,0.0001847078,0.023377636,0.0001822261,0.0019356012],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99790764,0.0004498777,0.00026981145,0.00035586863,0.00079275115,0.00022404642],"domain_scores_gemma":[0.9959636,0.0014989192,0.0007527493,0.00055608415,0.0009921698,0.000236453],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011508589,0.0006991406,0.000852804,0.012348865,0.0010434858,0.0023809876,0.0009386565,0.0010330741,0.0012982943],"category_scores_gemma":[0.006568035,0.00021908582,0.0008652951,0.011049936,0.00068273547,0.0018573357,0.0014528455,0.0007281302,0.0015165305],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013773503,0.0011589292,0.30648974,0.0009569103,0.00047072416,0.0025794036,0.0031161045,0.07609717,0.022483073,0.01359879,0.023455992,0.54821587],"study_design_scores_gemma":[0.000051431223,0.00019207606,0.15739383,0.00011847215,0.00020157656,0.0015842514,0.006112346,0.77094996,0.012559339,0.032304496,0.018349087,0.0001831948],"about_ca_topic_score_codex":0.009309815,"about_ca_topic_score_gemma":0.011315226,"teacher_disagreement_score":0.012348865,"about_ca_system_score_codex":0.00068969734,"about_ca_system_score_gemma":0.0009342017,"threshold_uncertainty_score":0.018511295},"labels":[],"label_agreement":null},{"id":"W3176788992","doi":"10.1109/icde51399.2021.00116","title":"Automating Entity Matching Model Development","year":2021,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":13,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Pipeline (software); Bottleneck; Benchmark (surveying); Computer science; Process (computing); Artificial intelligence; Machine learning; Matching (statistics); Task (project management); Engineering; Systems engineering; Programming language","score_opus":0.3130788376251375,"score_gpt":0.44985236232381043,"score_spread":0.13677352469867293,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3176788992","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009527304,0.0003384913,0.97097677,0.00062755146,0.00005761081,0.00021067451,0.001057851,0.015543978,0.0016597769],"genre_scores_gemma":[0.115625285,0.0003404389,0.8712591,0.00060265453,0.000049507522,0.00023869387,0.007411773,0.0014213028,0.0030511743],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9939976,0.0025868088,0.00033503483,0.0016933179,0.0010891687,0.00029811094],"domain_scores_gemma":[0.9883195,0.005228576,0.00052644074,0.004307766,0.0014209956,0.00019670735],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009628436,0.0017144653,0.0016195641,0.0035349543,0.0014815207,0.0031987894,0.004584682,0.0021065632,0.0070659025],"category_scores_gemma":[0.02682208,0.0012688296,0.0029957711,0.0037650329,0.001181574,0.008584389,0.0055522122,0.0034498593,0.005044009],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027024403,0.00037128237,0.007345866,0.00065730617,0.00026644,0.00041835586,0.00057601667,0.11527426,0.008717493,0.042649973,0.042010423,0.78144234],"study_design_scores_gemma":[0.000049729922,0.0000693948,0.0009434025,0.00006430119,0.00007664898,0.00034886194,0.00025315752,0.8833266,0.017163886,0.06137499,0.036278684,0.00005039459],"about_ca_topic_score_codex":0.0058826134,"about_ca_topic_score_gemma":0.009301748,"teacher_disagreement_score":0.009628436,"about_ca_system_score_codex":0.0018771251,"about_ca_system_score_gemma":0.0038554426,"threshold_uncertainty_score":0.050920606},"labels":[],"label_agreement":null},{"id":"W3181069700","doi":"10.1109/seh52539.2021.00012","title":"Provenance-based Trust Model for Assessing Data Quality during Clinical Decision Making","year":2021,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria","funders":"","keywords":"Provenance; Computer science; Quality (philosophy); Data modeling; Data quality; Decision-making models; Data mining; Artificial intelligence; Database; Engineering; Geology; Operations management","score_opus":0.7061120359354508,"score_gpt":0.6196761781888325,"score_spread":0.08643585774661833,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3181069700","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.019119684,0.00011317758,0.97432786,0.001449805,0.000046129,0.00030043733,0.00019364,0.0003149974,0.0041343556],"genre_scores_gemma":[0.5626534,0.00016096131,0.43476516,0.0002038813,0.000049244696,0.0003271366,0.0003138623,0.00005894498,0.0014673659],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.983296,0.008296001,0.0020700037,0.0018296373,0.0038938015,0.00061474333],"domain_scores_gemma":[0.9401633,0.036189113,0.0057922825,0.005654657,0.010634377,0.0015662543],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.019361556,0.0007117901,0.0006135184,0.0030030864,0.0017529048,0.0044754874,0.0015636486,0.0014772852,0.0027578531],"category_scores_gemma":[0.07495389,0.0005859293,0.0014435992,0.0015891781,0.002351477,0.009301221,0.0030231937,0.0023335523,0.00045929977],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00097210036,0.0004697689,0.035818618,0.0007568108,0.00035075366,0.0012768869,0.011962987,0.1577911,0.0074220076,0.5749536,0.0059884936,0.20223685],"study_design_scores_gemma":[0.00008137369,0.00018701633,0.003033063,0.00021981588,0.00017732524,0.00040508324,0.0010448281,0.6977955,0.004356767,0.28249818,0.010074545,0.00012649018],"about_ca_topic_score_codex":0.009028501,"about_ca_topic_score_gemma":0.008822097,"teacher_disagreement_score":0.019361556,"about_ca_system_score_codex":0.0031468496,"about_ca_system_score_gemma":0.004400566,"threshold_uncertainty_score":0.10239494},"labels":[],"label_agreement":null},{"id":"W3184230022","doi":"10.2139/ssrn.3882450","title":"A Scoping Review on Data Governance","year":2021,"lang":"en","type":"review","venue":"SSRN Electronic Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Corporate governance; Political science; Data science; Business; Computer science; Finance","score_opus":0.4140001928615419,"score_gpt":0.539057422538472,"score_spread":0.12505722967693012,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3184230022","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00011946424,0.9926554,0.00030188315,0.003903785,0.001093066,0.00029259294,0.0002664056,0.000013011617,0.0013543406],"genre_scores_gemma":[0.0015814623,0.9931191,0.0011413458,0.0025249533,0.00043539703,0.0005624425,0.00026481732,0.000010673298,0.00035972742],"study_design_codex":"systematic_review","study_design_gemma":"not_applicable","domain_scores_codex":[0.95735043,0.016171813,0.014615728,0.0019198988,0.0087237265,0.0012183641],"domain_scores_gemma":[0.8216229,0.11395329,0.022267401,0.0053949514,0.03427531,0.0024861402],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.056633674,0.0023691119,0.0061880583,0.048153922,0.0021089532,0.009044958,0.002467653,0.0058673657,0.008692841],"category_scores_gemma":[0.18990992,0.0018915524,0.0048500565,0.037433267,0.004165239,0.0077276104,0.0063217557,0.004051474,0.0021523354],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022757358,0.000079100144,0.00067251344,0.47306883,0.0018477514,0.0001880271,0.0006242451,0.0002120692,0.00036382803,0.006308657,0.07823786,0.43816957],"study_design_scores_gemma":[0.000073362426,0.0000679632,0.0010305117,0.7826383,0.003286837,0.00014935849,0.0002878196,0.000039396364,0.00013128527,0.002720991,0.20954664,0.00002755053],"about_ca_topic_score_codex":0.013728253,"about_ca_topic_score_gemma":0.038050883,"teacher_disagreement_score":0.056633674,"about_ca_system_score_codex":0.012122213,"about_ca_system_score_gemma":0.06756889,"threshold_uncertainty_score":0.29951102},"labels":[],"label_agreement":null},{"id":"W3186833835","doi":"10.2196/29286","title":"Leveraging National Claims and Hospital Big Data: Cohort Study on a Statin-Drug Interaction Use Case","year":2021,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"Agence Nationale de la Recherche","keywords":"Medicine; Cohort; Blueprint; Big data; Linkage (software); Record linkage; Data sharing; Medical record; Data warehouse; Medical emergency; Computer science; Database; Data mining; Engineering; Surgery; Population","score_opus":0.2809144353763157,"score_gpt":0.46315693702203675,"score_spread":0.18224250164572103,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3186833835","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9986628,0.0000661438,0.00037979623,0.00013286574,0.000008146863,0.00007499265,0.0004759789,0.000005384979,0.00019394433],"genre_scores_gemma":[0.9970197,0.000120184624,0.0013406931,0.00009481689,0.000019959796,0.000097028016,0.0011070796,0.000009605234,0.00019088802],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9965964,0.0013878949,0.0003094027,0.0006148573,0.00060834986,0.00048311197],"domain_scores_gemma":[0.9922741,0.0028369352,0.0014967059,0.0014025002,0.0011003176,0.0008894678],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005733239,0.00037403856,0.0005568848,0.0020007382,0.002055351,0.0011353537,0.0010183792,0.00104683,0.0012209092],"category_scores_gemma":[0.011717656,0.0005344567,0.0010001032,0.0022748662,0.0006714826,0.00092506665,0.0016760613,0.0014479174,0.0002477187],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027212227,0.0008651752,0.9861136,0.00004153401,0.00018899127,0.004309198,0.00255244,0.00028985282,0.00024705473,0.00022891206,0.0011742408,0.003716898],"study_design_scores_gemma":[0.00011500899,0.0008778203,0.96849334,0.00009607547,0.00037848784,0.0065544965,0.01280055,0.0070087495,0.00066150166,0.00048573109,0.002425209,0.00010304876],"about_ca_topic_score_codex":0.047293533,"about_ca_topic_score_gemma":0.057922013,"teacher_disagreement_score":0.047293533,"about_ca_system_score_codex":0.0021115919,"about_ca_system_score_gemma":0.0024222662,"threshold_uncertainty_score":0.09403652},"labels":[],"label_agreement":null},{"id":"W3188912472","doi":"10.2196/27842","title":"Quality of Hospital Electronic Health Record (EHR) Data Based on the International Consortium for Health Outcomes Measurement (ICHOM) in Heart Failure: Pilot Data Quality Assessment Study","year":2021,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":31,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"Innovative Medicines Initiative; European Commission; European Federation of Pharmaceutical Industries and Associations","keywords":"Documentation; Electronic health record; Medicine; Quality (philosophy); Data collection; Data quality; Health care; Health records; Quality management; Medical emergency; Data science; Computer science; Operations management","score_opus":0.4831762659776266,"score_gpt":0.5421808990779007,"score_spread":0.059004633100274095,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3188912472","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9827104,0.0002570938,0.0095658,0.00036159233,0.000021971564,0.0049592014,0.0011973396,0.00007449213,0.0008520593],"genre_scores_gemma":[0.973119,0.00011213225,0.02087615,0.0001351793,0.00001803959,0.004196483,0.0014280593,0.0000242559,0.00009061093],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.8784929,0.08014558,0.017174136,0.005360055,0.016690033,0.0021373632],"domain_scores_gemma":[0.54334134,0.2876289,0.055936947,0.028409481,0.07983823,0.0048450455],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.17945002,0.0006659041,0.000975945,0.0036141411,0.0012100228,0.0020390016,0.0017557038,0.0010878791,0.0007446691],"category_scores_gemma":[0.25351867,0.00044318804,0.0021796229,0.0052959756,0.0022646894,0.0030938247,0.004975726,0.0011209272,0.00018734334],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002648671,0.003974399,0.88509583,0.0013309771,0.0007550072,0.00031138537,0.01733866,0.0019357624,0.0016977921,0.000667924,0.0015236344,0.08272002],"study_design_scores_gemma":[0.0008672,0.008763336,0.96168303,0.0006402399,0.0006014291,0.0003799139,0.0099631995,0.009073587,0.0044683143,0.00051558745,0.0029193184,0.0001248921],"about_ca_topic_score_codex":0.0046652798,"about_ca_topic_score_gemma":0.0057468507,"teacher_disagreement_score":0.82054996,"about_ca_system_score_codex":0.0034399652,"about_ca_system_score_gemma":0.0059131877,"threshold_uncertainty_score":0.94903374},"labels":[],"label_agreement":null},{"id":"W3193868442","doi":"10.21747/21836671/pag15a1","title":"Ontologias bibliográficas e Web Semântica: limitações e propostas de investigação","year":2021,"lang":"en","type":"article","venue":"Páginas a&b Arquivos & Bibliotecas","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Cascades (Canada)","funders":"","keywords":"Computer science; Ontology; Semantic Web; Semantic interoperability; Interoperability; Information retrieval; Semantic integration; Semantic Web Stack; World Wide Web; Knowledge management; Epistemology","score_opus":0.27646829760356306,"score_gpt":0.44263997899364266,"score_spread":0.1661716813900796,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3193868442","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.029306374,0.22020903,0.5813719,0.040585812,0.0010617112,0.00037673413,0.00044932857,0.0007154392,0.12592368],"genre_scores_gemma":[0.35645854,0.1982053,0.42458168,0.004218343,0.0024643326,0.0010938038,0.0008179947,0.0005041259,0.011655844],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9642844,0.015691949,0.0031881374,0.0042030048,0.011794377,0.00083810237],"domain_scores_gemma":[0.8445213,0.12125682,0.003795495,0.018079996,0.011215734,0.0011306391],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.04640527,0.0019172354,0.002886696,0.023129636,0.0039918325,0.034580145,0.0054804618,0.006252878,0.004108743],"category_scores_gemma":[0.08554533,0.0029535159,0.0026831871,0.022933302,0.020549372,0.06365132,0.011789571,0.010675663,0.0016482658],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000027259215,0.0000764153,0.0013557905,0.0014788416,0.000103408725,0.00023876788,0.004585904,0.0021413744,0.0003733585,0.8876793,0.0016761052,0.10026354],"study_design_scores_gemma":[0.0000127948715,0.000026478438,0.0006889741,0.0025552812,0.00008942995,0.0006140048,0.0046314863,0.014469256,0.0009605168,0.8933007,0.08259472,0.000056342175],"about_ca_topic_score_codex":0.007967556,"about_ca_topic_score_gemma":0.005859033,"teacher_disagreement_score":0.9654198,"about_ca_system_score_codex":0.010295898,"about_ca_system_score_gemma":0.008621427,"threshold_uncertainty_score":0.24541748},"labels":[],"label_agreement":null},{"id":"W3196867679","doi":"10.14778/3476311.3476364","title":"RONIN","year":2021,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":33,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ontario Tech University; University of Toronto","funders":"","keywords":"Computer science; Information retrieval; Set (abstract data type); Data mining; Focus (optics); Nearest neighbor search; Data set; Artificial intelligence","score_opus":0.1406382432299656,"score_gpt":0.3809184801512673,"score_spread":0.24028023692130168,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3196867679","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0066250614,0.005304344,0.15527174,0.008408885,0.003316893,0.0009021427,0.1276543,0.2559573,0.43655932],"genre_scores_gemma":[0.055321924,0.006303667,0.21683827,0.005851058,0.0014553231,0.001810399,0.3537599,0.044982698,0.31367674],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9959908,0.00061278517,0.0003666948,0.0011961563,0.001549198,0.0002844021],"domain_scores_gemma":[0.9940521,0.0014468682,0.00036231725,0.0023886822,0.0012171814,0.0005327756],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0041632364,0.0016841319,0.001563735,0.0043173786,0.0014235706,0.0070056696,0.0033953905,0.0016326372,0.2390095],"category_scores_gemma":[0.015003483,0.000985006,0.0014958412,0.0039336877,0.00086852576,0.006416695,0.005325831,0.002052159,0.19751386],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00053342275,0.00009758084,0.0018770734,0.0010351297,0.00008945593,0.0002897956,0.00028832752,0.0008264989,0.0028843232,0.029222308,0.7598981,0.20295797],"study_design_scores_gemma":[0.000058371217,0.00003684893,0.00073658064,0.00012631844,0.000021053254,0.00023215798,0.000065231856,0.0024476473,0.0018024186,0.011245233,0.98319525,0.00003292917],"about_ca_topic_score_codex":0.0027436686,"about_ca_topic_score_gemma":0.004540048,"teacher_disagreement_score":0.2390095,"about_ca_system_score_codex":0.0013118403,"about_ca_system_score_gemma":0.0024434612,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W3196877232","doi":"10.14778/3476311.3476317","title":"A demonstration of KGLac","year":2021,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Computer science; SPARQL; Metadata; Data science; Knowledge graph; Knowledge extraction; Data discovery; Information retrieval; Pipeline (software); Annotation; RDF; Graph; World Wide Web; Data mining; Semantic Web; Artificial intelligence; Theoretical computer science","score_opus":0.12604269999402856,"score_gpt":0.37172051449046417,"score_spread":0.2456778144964356,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3196877232","genre_codex":"methods","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.03298176,0.00062855985,0.718341,0.0061590355,0.0005996736,0.00049765117,0.013788659,0.1899128,0.037090816],"genre_scores_gemma":[0.16201124,0.0005391289,0.79509395,0.0026354634,0.00015355548,0.00035378756,0.02173735,0.0065852976,0.010890225],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9964064,0.0008294596,0.00026454675,0.0009199691,0.0013207182,0.00025886792],"domain_scores_gemma":[0.9848231,0.004744708,0.0006068921,0.0064322227,0.0027639319,0.0006291516],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00451425,0.00058818987,0.00050331565,0.0022224719,0.0015499907,0.00340523,0.002059994,0.0012652188,0.012383708],"category_scores_gemma":[0.016679376,0.0005324878,0.0009968437,0.004245347,0.001968003,0.0056165517,0.0051155756,0.001971572,0.010070193],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009640704,0.00078458304,0.02499083,0.0011635419,0.0001713883,0.0011842051,0.0035929775,0.0196317,0.019594625,0.15054314,0.3091299,0.46824902],"study_design_scores_gemma":[0.0001954815,0.0002713547,0.0060634436,0.0002491309,0.00009546252,0.0011036509,0.001124143,0.24025413,0.02697484,0.16858223,0.5549228,0.0001633281],"about_ca_topic_score_codex":0.013743342,"about_ca_topic_score_gemma":0.014902268,"teacher_disagreement_score":0.013743342,"about_ca_system_score_codex":0.0014199716,"about_ca_system_score_gemma":0.0040941276,"threshold_uncertainty_score":0.041427612},"labels":[],"label_agreement":null},{"id":"W3199853562","doi":"10.1111/ropr.12448","title":"Holding out the promise of Lasswell's dream: Big data analytics in public policy research and teaching","year":2021,"lang":"en","type":"article","venue":"Review of Policy Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":25,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University; Carleton University","funders":"","keywords":"Big data; Scope (computer science); Policy analysis; Public policy; Curriculum; Corporate governance; Analytics; Policy Sciences; Political science; Policy studies; Public relations; Education policy; Sociology; Data science; Public administration; Higher education; Pedagogy; Computer science; Economics; Management; Data mining","score_opus":0.9023683653060873,"score_gpt":0.6734491997677207,"score_spread":0.22891916553836666,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3199853562","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0036655043,0.05408391,0.026701702,0.89798754,0.005553368,0.00006425992,0.00016074935,0.00017527195,0.01160775],"genre_scores_gemma":[0.45247188,0.1951213,0.1630836,0.15034655,0.019892273,0.0007911303,0.0004162246,0.0006039813,0.01727306],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9429155,0.043852992,0.002129927,0.0018367441,0.007897121,0.0013677871],"domain_scores_gemma":[0.6311038,0.3124955,0.0068144836,0.015603709,0.024476158,0.009506322],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1256978,0.0006514694,0.0012442933,0.008263829,0.005014584,0.023333648,0.0019541013,0.005665219,0.007935419],"category_scores_gemma":[0.19440728,0.0009327689,0.0012120041,0.008345019,0.018461293,0.040486872,0.011650419,0.015023522,0.0017936083],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000067443056,0.000095713236,0.006766094,0.002167476,0.00014264535,0.00017855053,0.00631471,0.0011292051,0.0003441461,0.5344439,0.19912072,0.24922934],"study_design_scores_gemma":[0.00003949313,0.000066985915,0.0031342774,0.008914304,0.000051666873,0.00015738305,0.010365221,0.0029808804,0.00047322232,0.55104536,0.42263448,0.00013663445],"about_ca_topic_score_codex":0.009462748,"about_ca_topic_score_gemma":0.016269667,"teacher_disagreement_score":0.1256978,"about_ca_system_score_codex":0.006209249,"about_ca_system_score_gemma":0.024189027,"threshold_uncertainty_score":0.6647615},"labels":[],"label_agreement":null},{"id":"W3199898089","doi":"10.1016/j.acalib.2021.102449","title":"Love Data Week in the time of COVID-19: A content analysis of Love Data Week 2021 events","year":2021,"lang":"en","type":"article","venue":"The Journal of Academic Librarianship","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Cape Breton University; McGill University","funders":"","keywords":"Outreach; Context (archaeology); Tracking (education); Qualitative property; Content analysis; Pandemic; Coronavirus disease 2019 (COVID-19); World Wide Web; Psychology; Public relations; Medical education; Computer science; Sociology; Medicine; Political science; Social science; History; Pedagogy","score_opus":0.5707753550266078,"score_gpt":0.45022210471394514,"score_spread":0.12055325031266267,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3199898089","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.81242925,0.0011034188,0.0038289062,0.008341988,0.0012279275,0.0020330264,0.061391287,0.00052508496,0.109119095],"genre_scores_gemma":[0.8604208,0.0012990162,0.005970974,0.0029639762,0.0009679521,0.0028361706,0.06482683,0.0013108572,0.0594034],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.9951196,0.001474078,0.0004280039,0.00040772933,0.0019240836,0.0006464663],"domain_scores_gemma":[0.9490525,0.022821035,0.0064567784,0.0027981056,0.011790394,0.007081233],"candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.006597333,0.00019732214,0.0003236592,0.0052775578,0.004201699,0.0055028303,0.0007293108,0.0008150059,0.009620599],"category_scores_gemma":[0.047616668,0.00031904355,0.00032992274,0.007306948,0.00095466216,0.0032322095,0.0049544275,0.0018135174,0.0030410904],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013844607,0.0006123179,0.31063095,0.0012151913,0.000095809715,0.000694827,0.17440592,0.00028162065,0.0024200776,0.008995916,0.34821215,0.15105075],"study_design_scores_gemma":[0.000019868114,0.00009788293,0.5368015,0.0004329399,0.0000244122,0.00012555417,0.100165986,0.00029051994,0.0007853987,0.0005144055,0.3606723,0.00006925916],"about_ca_topic_score_codex":0.021454018,"about_ca_topic_score_gemma":0.045617852,"teacher_disagreement_score":0.9947224,"about_ca_system_score_codex":0.0036868074,"about_ca_system_score_gemma":0.003326724,"threshold_uncertainty_score":0.04265827},"labels":[],"label_agreement":null},{"id":"W3209614841","doi":"10.1007/s00799-021-00311-0","title":"Improving data quality in large-scale repositories through conflict resolution","year":2021,"lang":"en","type":"article","venue":"International Journal on Digital Libraries","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"Natural Sciences and Engineering Research Council of Canada; Technische Universität Wien; Vienna Science and Technology Fund; Technische Universität Wien Bibliothek; Ontario Research Foundation","keywords":"Metadata; Computer science; Data quality; Correctness; Scalability; Profiling (computer programming); Data mining; Data science; Conflict resolution; Quality (philosophy); Data collection; Database; Information retrieval; World Wide Web","score_opus":0.20670035911686424,"score_gpt":0.4259471446766152,"score_spread":0.21924678555975097,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3209614841","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.14949252,0.00041549522,0.8431202,0.0007962265,0.00004148295,0.00066181074,0.00034910595,0.0027897293,0.0023333915],"genre_scores_gemma":[0.4036821,0.00010877791,0.594833,0.00014993724,0.000022943963,0.00016981903,0.0004934384,0.0001351106,0.00040484816],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.94802,0.024063924,0.005376717,0.0041320524,0.017387621,0.0010198017],"domain_scores_gemma":[0.8085667,0.102792166,0.023457553,0.03435808,0.028304115,0.0025213123],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03979885,0.0009320941,0.0012730277,0.006338681,0.0018472343,0.006116795,0.003651687,0.00136996,0.00091559585],"category_scores_gemma":[0.1123047,0.0006170771,0.001128711,0.0047240984,0.0017953602,0.004853058,0.0049188565,0.0016483166,0.0003923188],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00069418445,0.001751097,0.09229024,0.0008942829,0.0005151966,0.0007510141,0.003358458,0.17381543,0.03832098,0.017893583,0.005231797,0.6644838],"study_design_scores_gemma":[0.00011579168,0.00042954614,0.011658328,0.00023651775,0.00018509582,0.0005642017,0.0013797169,0.85618764,0.092523515,0.0283066,0.0082621835,0.00015082264],"about_ca_topic_score_codex":0.0027592988,"about_ca_topic_score_gemma":0.0027058378,"teacher_disagreement_score":0.03979885,"about_ca_system_score_codex":0.0017207128,"about_ca_system_score_gemma":0.0032809696,"threshold_uncertainty_score":0.2104789},"labels":[],"label_agreement":null},{"id":"W3210057673","doi":"10.18438/eblip29674","title":"Making Job Postings More Equitable: Evidence Based Recommendations from an Analysis of Data Professionals Job Postings Between 2013-2018","year":2020,"lang":"en","type":"article","venue":"Evidence Based Library and Information Practice","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"University of Illinois at Urbana-Champaign; Florida Institute of Technology; Oregon State University; Georgia State University; University of Massachusetts Amherst; East Carolina University; Drexel University; DePaul University; Johns Hopkins University; Princeton University; University of Washington; Virginia Polytechnic Institute and State University; University of Minnesota; San José State University; University of Texas at Arlington; Harvard University; Georgia Southern University; George Washington University; Western Michigan University; Dartmouth College; York University; University of Miami; Northwestern University; Florida State University; Indiana University Bloomington; San Diego State University; Rice University; Ohio State University; Washington University in St. Louis; City University of New York; North Carolina State University; Reed College; Purdue University; Yale University","keywords":"Professional development; Job analysis; Coding (social sciences); Psychology; Equity (law); Public relations; Medical education; Computer science; Sociology; Medicine; Political science; Job satisfaction; Social psychology","score_opus":0.35045121973566534,"score_gpt":0.47785300365053895,"score_spread":0.1274017839148736,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3210057673","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"incentives","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"incentives","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.65353835,0.08144891,0.029294008,0.1512829,0.0046149804,0.041649994,0.012027144,0.00045890926,0.02568478],"genre_scores_gemma":[0.81255263,0.03709782,0.10661663,0.0112696625,0.0003610127,0.02561131,0.0049235085,0.00020700671,0.0013604313],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.7952052,0.12730251,0.038942333,0.007872959,0.024398297,0.006278824],"domain_scores_gemma":[0.44084978,0.3641534,0.062149886,0.016493512,0.10501257,0.011340852],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.315625,0.0011533375,0.0026610214,0.019015376,0.007643938,0.015222531,0.009257314,0.0038111631,0.00590044],"category_scores_gemma":[0.58252734,0.0022332994,0.0035358258,0.017539063,0.0054652635,0.019623844,0.017007863,0.0058543384,0.0014839727],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009086083,0.0015082578,0.2298377,0.07139805,0.001277055,0.00053469045,0.1504914,0.00057623495,0.00035707065,0.0039090444,0.03095615,0.5082457],"study_design_scores_gemma":[0.00073277595,0.0013510918,0.23126523,0.23171178,0.0022047535,0.00018156624,0.46581298,0.0019327571,0.00079181883,0.0042928862,0.05938964,0.00033269785],"about_ca_topic_score_codex":0.030441945,"about_ca_topic_score_gemma":0.06767905,"teacher_disagreement_score":0.684375,"about_ca_system_score_codex":0.020002227,"about_ca_system_score_gemma":0.08660506,"threshold_uncertainty_score":0.84395623},"labels":[],"label_agreement":null},{"id":"W3210155192","doi":"10.1145/3459637.3482087","title":"Discovery of Temporal Graph Functional Dependencies","year":2021,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Functional dependency; Computer science; Dependency graph; Dependency (UML); USable; Satisfiability; P; Graph; Dependency theory (database theory); Theoretical computer science; Bounded function; Boolean satisfiability problem; Data mining; Time complexity; Algorithm; Artificial intelligence; Mathematics; Relational database","score_opus":0.20662333450558584,"score_gpt":0.38059529019922994,"score_spread":0.1739719556936441,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3210155192","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.21811613,0.0008162466,0.7654964,0.0014268717,0.00007646819,0.00033711205,0.0068833423,0.0029098773,0.0039375667],"genre_scores_gemma":[0.59329766,0.0003751151,0.39705938,0.00023352055,0.00003294542,0.00016728607,0.007702655,0.00018756908,0.0009437455],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9962812,0.00086044124,0.00030731954,0.00074899435,0.0015346061,0.00026743047],"domain_scores_gemma":[0.9739637,0.017894575,0.0023451846,0.002170401,0.003248504,0.00037757785],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0028510387,0.0006302176,0.0007050383,0.0033346463,0.00072423543,0.0013494246,0.0012854413,0.00081720203,0.0014800867],"category_scores_gemma":[0.030795965,0.0005504539,0.001299813,0.0022668983,0.00073606503,0.0027344106,0.0013371552,0.0011883797,0.00023318763],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00074714684,0.00039026793,0.08725148,0.0017173148,0.00039562705,0.0029999858,0.0011109505,0.2368846,0.04305049,0.103528686,0.016893381,0.5050301],"study_design_scores_gemma":[0.000051250376,0.00010004906,0.0061945342,0.0001028333,0.00011190802,0.0007113585,0.00031405143,0.8840034,0.017674148,0.08049182,0.010208903,0.000035742443],"about_ca_topic_score_codex":0.008100953,"about_ca_topic_score_gemma":0.014332765,"teacher_disagreement_score":0.008100953,"about_ca_system_score_codex":0.0012196352,"about_ca_system_score_gemma":0.002998242,"threshold_uncertainty_score":0.016107619},"labels":[],"label_agreement":null},{"id":"W3210954531","doi":"10.5281/zenodo.3420179","title":"Time to Professionalise Data Stewardship","year":2019,"lang":"en","type":"article","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Impact","funders":"","keywords":"Stewardship (theology); Business; Computer science; Environmental resource management; Political science; Environmental science","score_opus":0.45715321693023697,"score_gpt":0.47055978914024654,"score_spread":0.01340657221000957,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3210954531","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.029508615,0.0052885297,0.045714103,0.4422704,0.06684127,0.0032830369,0.002030805,0.0032238895,0.40183935],"genre_scores_gemma":[0.26401415,0.0069988915,0.0505138,0.1015088,0.010745397,0.004801596,0.0032887028,0.0031125532,0.5550161],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98305285,0.006591773,0.0006755665,0.0015843967,0.0036062235,0.004489184],"domain_scores_gemma":[0.94972557,0.008179716,0.0018710408,0.0015885617,0.0045427955,0.034092322],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.019238757,0.0010910113,0.0008157775,0.0015130795,0.009541357,0.013216298,0.0027950052,0.0059285704,0.19812645],"category_scores_gemma":[0.034105074,0.0008971214,0.0010066542,0.0009274866,0.0042532557,0.011143084,0.026347939,0.010257351,0.05260327],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00024575053,0.0003973258,0.0006362653,0.0009456433,0.000009577341,0.0006844428,0.03291935,0.00029995356,0.002829587,0.020450614,0.8063813,0.13420017],"study_design_scores_gemma":[0.00002079838,0.000084995925,0.0007176513,0.00051551976,0.000002755515,0.00010398467,0.014870164,0.000061704544,0.00038983935,0.0049338313,0.97827303,0.000025734844],"about_ca_topic_score_codex":0.0025253873,"about_ca_topic_score_gemma":0.005985551,"teacher_disagreement_score":0.9867837,"about_ca_system_score_codex":0.006688323,"about_ca_system_score_gemma":0.02272204,"threshold_uncertainty_score":0.662799},"labels":[],"label_agreement":null},{"id":"W3211227609","doi":"10.5281/zenodo.4041661","title":"Can I Share My Data?","year":2020,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Portage College; Western University; University of Guelph; University of British Columbia; York University; University of Waterloo; Carleton University; University of Windsor; Council of Prairie and Pacific University Libraries; University of Ottawa","funders":"","keywords":"Computer science","score_opus":0.38430687311341544,"score_gpt":0.3793507665785343,"score_spread":0.004956106534881155,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3211227609","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0059740716,0.0019276197,0.23250951,0.4632127,0.009862284,0.008965971,0.023627432,0.007580811,0.24633946],"genre_scores_gemma":[0.13665351,0.005615915,0.4460458,0.23850057,0.0043861144,0.014674516,0.02009526,0.005773816,0.1282545],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.89901817,0.057067037,0.008522722,0.005289582,0.02548599,0.004616578],"domain_scores_gemma":[0.8496774,0.060894933,0.01415569,0.023029605,0.03718231,0.015060063],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.11650727,0.001105733,0.0014441335,0.004516704,0.006831657,0.010459038,0.004384118,0.0059415507,0.0953824],"category_scores_gemma":[0.27041942,0.0012807564,0.0029898197,0.00474021,0.00744759,0.017292809,0.015982525,0.008318524,0.056161232],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00032739792,0.0000739264,0.002500762,0.0010497471,0.000104588136,0.00013032276,0.0039316835,0.00024294082,0.00050809624,0.054995064,0.7786844,0.15745117],"study_design_scores_gemma":[0.00009147061,0.000072324845,0.0013632539,0.0021783602,0.00009770668,0.00024537116,0.004192337,0.00092770957,0.0008290717,0.054014802,0.9357962,0.00019141573],"about_ca_topic_score_codex":0.011541497,"about_ca_topic_score_gemma":0.01997169,"teacher_disagreement_score":0.9956159,"about_ca_system_score_codex":0.0067446386,"about_ca_system_score_gemma":0.040752515,"threshold_uncertainty_score":0.6161567},"labels":[],"label_agreement":null},{"id":"W3212670429","doi":"10.18280/ijsse.110504","title":"Coupling of Inference and Access Controls to Ensure Privacy Protection","year":2021,"lang":"en","type":"article","venue":"International Journal of Safety and Security Engineering","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Access control; Inference; Computer science; Computer security; Data access; Obligation; Data mining; Risk analysis (engineering); Database; Artificial intelligence","score_opus":0.07465132137388023,"score_gpt":0.38491490023599684,"score_spread":0.31026357886211664,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3212670429","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010037311,0.0002573258,0.9846661,0.000558823,0.000056325018,0.00034919128,0.0000455131,0.0011656594,0.0028637107],"genre_scores_gemma":[0.5402235,0.0004899389,0.4528242,0.0007856304,0.00028974967,0.00071337784,0.00024301639,0.00069699436,0.0037337192],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9301142,0.021648353,0.008512324,0.010781325,0.02519117,0.0037525464],"domain_scores_gemma":[0.90226465,0.030080575,0.007479885,0.046130918,0.0118224835,0.0022214763],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04607296,0.0014647035,0.001998229,0.0034593148,0.001975434,0.011097737,0.0038507604,0.002395582,0.0026215857],"category_scores_gemma":[0.072364606,0.0016371921,0.00256191,0.0019086266,0.0067609716,0.014353967,0.011548703,0.007656522,0.0010673404],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00045716364,0.0005811537,0.012114734,0.0005416424,0.0006339729,0.0006230566,0.004327911,0.062176295,0.023649432,0.6895804,0.0027128588,0.20260143],"study_design_scores_gemma":[0.00012249265,0.00046053046,0.0046167513,0.00045045622,0.0004733395,0.0008188004,0.0006976876,0.31690776,0.04270318,0.5907811,0.041699555,0.0002683573],"about_ca_topic_score_codex":0.003419482,"about_ca_topic_score_gemma":0.0010756529,"teacher_disagreement_score":0.04607296,"about_ca_system_score_codex":0.0028651555,"about_ca_system_score_gemma":0.006421792,"threshold_uncertainty_score":0.24366003},"labels":[],"label_agreement":null},{"id":"W3215282674","doi":"10.5281/zenodo.831805","title":"Replication Package For How The R Community Creates And Curates Knowledge: An Extended Study Of Stack Overflow And Mailing Lists","year":2017,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria","funders":"","keywords":"Replication (statistics); Stack (abstract data type); Computer science; R package; World Wide Web; Operating system; Biology; Programming language; Virology","score_opus":0.28101975437067334,"score_gpt":0.43084575850810003,"score_spread":0.1498260041374267,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3215282674","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0019210393,0.00013371898,0.0029358508,0.0004184622,0.00016214598,0.00027722702,0.9902056,0.0020501972,0.0018957483],"genre_scores_gemma":[0.006404662,0.00007623054,0.0069567515,0.00026685852,0.00005293813,0.002463249,0.9806903,0.0010469921,0.0020418745],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.98837644,0.0046538226,0.0016624222,0.0025330475,0.0019871898,0.00078705256],"domain_scores_gemma":[0.9331666,0.026786456,0.0035685466,0.027247204,0.007819781,0.0014114797],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.017368786,0.0019079219,0.0014588083,0.004285924,0.0021831277,0.003537945,0.005102432,0.002458282,0.042886015],"category_scores_gemma":[0.090564735,0.0011365841,0.0022309495,0.005985125,0.0014142017,0.0017744326,0.004031306,0.0044207033,0.039488062],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002678439,0.000083059356,0.004843558,0.00084727415,0.00020913745,0.000058620022,0.0002600076,0.0006336302,0.00016425988,0.0024985878,0.98325896,0.0068750954],"study_design_scores_gemma":[0.0015124282,0.00007908694,0.017290905,0.00056272617,0.00022029331,0.00022262197,0.000356801,0.0016419326,0.0009934285,0.010227011,0.96674144,0.0001513651],"about_ca_topic_score_codex":0.016658463,"about_ca_topic_score_gemma":0.03556524,"teacher_disagreement_score":0.99489754,"about_ca_system_score_codex":0.0018078035,"about_ca_system_score_gemma":0.0054024323,"threshold_uncertainty_score":0.14346802},"labels":[],"label_agreement":null},{"id":"W3215670116","doi":"10.1109/icde53745.2022.00169","title":"Efficiently Transforming Tables for Joinability","year":2022,"lang":"en","type":"article","venue":"2022 IEEE 38th International Conference on Data Engineering (ICDE)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Disk formatting; Computer science; Row; Transformation (genetics); Set (abstract data type); Representation (politics); State (computer science); Table (database); Theoretical computer science; Join (topology); Data mining; Data transformation; Algorithm; Programming language; Information retrieval; Data warehouse; Mathematics","score_opus":0.33510305283268205,"score_gpt":0.4249302990745663,"score_spread":0.08982724624188426,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3215670116","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009542082,0.00018190335,0.9751027,0.00026088898,0.00009391592,0.00030842016,0.0010535285,0.010771206,0.0026853401],"genre_scores_gemma":[0.08417935,0.00024160018,0.9061486,0.00013224338,0.000085507505,0.00024709382,0.004740347,0.0021796753,0.0020456635],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9946989,0.00079938024,0.0006921445,0.0010968918,0.0023212365,0.00039139276],"domain_scores_gemma":[0.98894686,0.0047341273,0.00058805174,0.003936573,0.0015705611,0.00022390219],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003262127,0.0015276363,0.0013022325,0.002710196,0.0015314113,0.0049329665,0.002308927,0.0013334227,0.012247318],"category_scores_gemma":[0.017101966,0.0010037032,0.0031180067,0.0038466654,0.0013492749,0.0068992367,0.005281261,0.0026997942,0.004971365],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00041485066,0.00024733055,0.0034396478,0.0006716592,0.00012474715,0.00043628324,0.0011135677,0.042868167,0.02897048,0.09857428,0.033486415,0.78965265],"study_design_scores_gemma":[0.00016264868,0.00028421986,0.0013012936,0.00017004147,0.00014137135,0.000870318,0.000970847,0.49233675,0.08543643,0.30671865,0.11149188,0.00011552079],"about_ca_topic_score_codex":0.001561625,"about_ca_topic_score_gemma":0.0015824776,"teacher_disagreement_score":0.012247318,"about_ca_system_score_codex":0.0009361597,"about_ca_system_score_gemma":0.0021458298,"threshold_uncertainty_score":0.0409714},"labels":[],"label_agreement":null},{"id":"W3216023068","doi":"10.1108/dta-05-2021-0108","title":"Data repair of density-based data cleaning approach using conditional functional dependencies","year":2021,"lang":"en","type":"article","venue":"Data Technologies and Applications","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Computer science; Data mining; Data quality; Functional dependency; Scalability; Set (abstract data type); Data set; Quality (philosophy); Data validation; Database; Artificial intelligence; Engineering; Relational database","score_opus":0.5594296950545075,"score_gpt":0.4357612867051186,"score_spread":0.12366840834938886,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3216023068","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.032843772,0.00032730412,0.9624413,0.00024832375,0.000045659854,0.00017197683,0.00036064725,0.0028625233,0.00069843786],"genre_scores_gemma":[0.35911134,0.0002984806,0.6362333,0.00023052412,0.00004507612,0.00027704067,0.0020868627,0.00036472993,0.0013526534],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9932724,0.0011540387,0.0005836463,0.0014084909,0.0032446107,0.0003367771],"domain_scores_gemma":[0.9809497,0.0070681158,0.0017159649,0.0039050693,0.0060854517,0.00027571793],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00478875,0.0010318161,0.0012298749,0.0037697451,0.0015772185,0.0013820727,0.0025402785,0.0009209772,0.001387923],"category_scores_gemma":[0.01976831,0.00066580035,0.0021207095,0.0025389062,0.0011491171,0.0023938161,0.0027910515,0.0015674022,0.0005881265],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005319115,0.0004751836,0.03510231,0.0009306985,0.00038887834,0.0009429512,0.0013444988,0.22360094,0.039778456,0.013232795,0.0091292085,0.6745422],"study_design_scores_gemma":[0.00003708039,0.00023890642,0.011246957,0.00010406119,0.0002113034,0.0010580355,0.0003641766,0.8978255,0.063842066,0.013963327,0.011008556,0.0001000721],"about_ca_topic_score_codex":0.011316901,"about_ca_topic_score_gemma":0.010563171,"teacher_disagreement_score":0.011316901,"about_ca_system_score_codex":0.001367598,"about_ca_system_score_gemma":0.003441386,"threshold_uncertainty_score":0.025325656},"labels":[],"label_agreement":null},{"id":"W3217093369","doi":"","title":"Environmental Decision Support Systems: Exactly What Are They?","year":2000,"lang":"en","type":"book-chapter","venue":"IFIP advances in information and communication technology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Decision support system; Management science; Computer science; Engineering; Artificial intelligence","score_opus":0.032767156516840985,"score_gpt":0.3210601548778049,"score_spread":0.28829299836096395,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3217093369","genre_codex":"commentary","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010441233,0.21812604,0.05657001,0.3749838,0.008976393,0.00016046713,0.00044137976,0.0005453783,0.3297553],"genre_scores_gemma":[0.28494704,0.37557814,0.1166712,0.068836845,0.011185562,0.00086060044,0.0008867696,0.0006853252,0.14034852],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9968851,0.0013381351,0.000148549,0.00028247456,0.001074828,0.00027090491],"domain_scores_gemma":[0.9937358,0.0035742973,0.00027944738,0.0004743106,0.0013199713,0.0006160734],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005154398,0.0008119212,0.00060462754,0.0015006042,0.0016321517,0.014400551,0.0015817379,0.0035933517,0.006011067],"category_scores_gemma":[0.010731912,0.0006134605,0.00047035402,0.003003803,0.009122606,0.0245622,0.0020270147,0.005872327,0.0030061416],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00001836731,0.000049288,0.0008953954,0.00073315646,0.000019871884,0.000080108446,0.003446575,0.0006948005,0.000258519,0.7035608,0.065998875,0.2242442],"study_design_scores_gemma":[0.000012193605,0.000024783172,0.0006695577,0.0012256738,0.000011879989,0.00013340703,0.0025688186,0.0008311598,0.00021007817,0.38528627,0.60900396,0.000022191522],"about_ca_topic_score_codex":0.0032335788,"about_ca_topic_score_gemma":0.003386935,"teacher_disagreement_score":0.014400551,"about_ca_system_score_codex":0.0027203464,"about_ca_system_score_gemma":0.0034919314,"threshold_uncertainty_score":0.02725941},"labels":[],"label_agreement":null},{"id":"W414933534","doi":"","title":"A FOUNDATION FOR OPEN INFORMATION ENVIRONMENTS","year":2014,"lang":"en","type":"article","venue":"Journal of the Association for Information Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia; Memorial University of Newfoundland","funders":"","keywords":"Flexibility (engineering); Computer science; Knowledge management; Diversity (politics); Information system; Set (abstract data type); Information quality; Data science; Information management; Information access; World Wide Web; Engineering","score_opus":0.08888593698032196,"score_gpt":0.37140951018263885,"score_spread":0.2825235732023169,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W414933534","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005414066,0.0040501016,0.7200491,0.0626761,0.0017942779,0.00043776908,0.00037921465,0.0014657099,0.20373367],"genre_scores_gemma":[0.29013833,0.008421929,0.636029,0.009721813,0.0047781644,0.0023467203,0.00092865585,0.0011109548,0.04652447],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9777142,0.009805204,0.0020324625,0.003162315,0.0058106743,0.0014751282],"domain_scores_gemma":[0.93351483,0.032363035,0.0033295683,0.017840361,0.008020996,0.0049312497],"candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.026951404,0.0010735737,0.001343742,0.0038104735,0.008142065,0.023620829,0.003984985,0.009156393,0.013947104],"category_scores_gemma":[0.04727685,0.0015780178,0.0024100647,0.0028675173,0.026989859,0.040862933,0.018523611,0.013769491,0.00490538],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000003681479,0.000013576802,0.00006675207,0.000035124813,0.0000038702624,0.000024481327,0.0002854883,0.0003427977,0.000054465403,0.9924164,0.0017003234,0.005052996],"study_design_scores_gemma":[0.000014304899,0.000014510616,0.000077354714,0.0001321913,0.0000048156144,0.000055529785,0.00022689915,0.0014940297,0.00013117785,0.88759726,0.1102332,0.000018684865],"about_ca_topic_score_codex":0.0033931518,"about_ca_topic_score_gemma":0.0017529525,"teacher_disagreement_score":0.996015,"about_ca_system_score_codex":0.004766356,"about_ca_system_score_gemma":0.010698536,"threshold_uncertainty_score":0.14253432},"labels":[],"label_agreement":null},{"id":"W41971205","doi":"10.18584/iipj.2014.5.4.1","title":"The Strategic Power of Data: A Key Aspect of Sovereignty","year":2014,"lang":"en","type":"article","venue":"International Indigenous Policy Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":17,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Sovereignty; Indigenous; Action (physics); Key (lock); Power (physics); Political science; Space (punctuation); Task (project management); Public relations; Law; Computer science; Politics; Computer security; Economics; Management; Ecology","score_opus":0.2381241877854981,"score_gpt":0.46309834965325014,"score_spread":0.22497416186775204,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W41971205","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.026555346,0.010325043,0.20579518,0.6363372,0.0020284492,0.0004005707,0.000807699,0.00021861137,0.117531925],"genre_scores_gemma":[0.87588006,0.004749452,0.06409234,0.042673875,0.0023706802,0.000911537,0.00060612743,0.00030696308,0.008408908],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8262728,0.123725556,0.009529288,0.010731389,0.025411166,0.004329735],"domain_scores_gemma":[0.41366363,0.4666423,0.018441385,0.06238993,0.029739698,0.009123059],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.23161387,0.00055985496,0.0016493457,0.0038592368,0.00786468,0.025333878,0.0036252146,0.0077838497,0.0048248856],"category_scores_gemma":[0.35781464,0.0012190806,0.00095265586,0.0064564296,0.059105765,0.04378274,0.020381512,0.014361234,0.0012517137],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00005628976,0.00002897068,0.0052597737,0.00036140552,0.00009804169,0.00016676052,0.012018192,0.00071546115,0.00024477055,0.9252247,0.017817667,0.038007915],"study_design_scores_gemma":[0.000038450646,0.000040171,0.0010933167,0.00083625043,0.000030440819,0.00025788596,0.006165733,0.0010702254,0.00035348322,0.8768818,0.113172285,0.000060029313],"about_ca_topic_score_codex":0.008438738,"about_ca_topic_score_gemma":0.005655675,"teacher_disagreement_score":0.23161387,"about_ca_system_score_codex":0.0056952615,"about_ca_system_score_gemma":0.028967971,"threshold_uncertainty_score":0.9475569},"labels":[],"label_agreement":null},{"id":"W4200253121","doi":"10.1007/978-3-030-74753-4_16","title":"Mapping CKC Model Through NLP Modelling for APT Groups Reports","year":2021,"lang":"en","type":"book-chapter","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Natural language processing; Artificial intelligence; Computer science; Information retrieval","score_opus":0.45666395393604914,"score_gpt":0.4044982961121337,"score_spread":0.05216565782391541,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4200253121","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008681587,0.00044805265,0.91739804,0.0009165483,0.00016076991,0.00019831391,0.005844322,0.005636992,0.060715336],"genre_scores_gemma":[0.18570521,0.0011875853,0.7438389,0.0002743489,0.00009345189,0.00041475828,0.013944395,0.0023869753,0.052154496],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99855167,0.00044296024,0.00009514316,0.00024200151,0.0006130775,0.000055251694],"domain_scores_gemma":[0.99612504,0.0027018567,0.0001754137,0.00047395707,0.00048479746,0.000038923714],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0016555295,0.0007479464,0.00046365955,0.0022270808,0.00060375314,0.004494563,0.0017420249,0.0012552537,0.016733723],"category_scores_gemma":[0.009935536,0.0005308345,0.0011537425,0.0029443353,0.0005905959,0.0035514357,0.0010482051,0.0012509848,0.007572825],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00010524572,0.00009750009,0.0036454932,0.0006360861,0.00007137553,0.00069723744,0.0010540378,0.38221702,0.0052628038,0.21511544,0.043902867,0.3471949],"study_design_scores_gemma":[0.000009056478,0.000017223061,0.0009877317,0.00015162965,0.000041226118,0.00025809288,0.0003915495,0.7833684,0.0053230366,0.103751354,0.10565308,0.000047667454],"about_ca_topic_score_codex":0.027629869,"about_ca_topic_score_gemma":0.018919617,"teacher_disagreement_score":0.027629869,"about_ca_system_score_codex":0.0023940292,"about_ca_system_score_gemma":0.0018425235,"threshold_uncertainty_score":0.055979908},"labels":[],"label_agreement":null},{"id":"W4200373115","doi":"10.23974/ijol.2021.vol6.2.204","title":"Virtualization of Research Data Services during the COVID-19 Pandemic as an Opportunity to Enhance Research Data Support","year":2021,"lang":"en","type":"article","venue":"International Journal of Librarianship","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Windsor","funders":"","keywords":"Service (business); Service delivery framework; Data as a service; World Wide Web; Computer science; Coronavirus disease 2019 (COVID-19); Business; Marketing; Medicine","score_opus":0.8286677096185385,"score_gpt":0.6533455342779906,"score_spread":0.17532217534054795,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4200373115","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.33720937,0.0042809127,0.018669445,0.52182543,0.002040917,0.00024872762,0.0002877088,0.0006583911,0.11477904],"genre_scores_gemma":[0.96888506,0.001679187,0.009017545,0.013082804,0.00036441418,0.00006111065,0.00009717757,0.00011645994,0.0066962587],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"observational","domain_scores_codex":[0.9737095,0.014616566,0.0011087573,0.0009314559,0.0040423363,0.005591324],"domain_scores_gemma":[0.96293145,0.011521432,0.0025580851,0.002405114,0.0058210506,0.014762841],"candidate_categories":["metaresearch","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.023163572,0.00024455437,0.00034821578,0.0013213187,0.013679336,0.020571772,0.0022133822,0.0028830734,0.004356595],"category_scores_gemma":[0.026731033,0.00049013225,0.0005934901,0.0028010642,0.011824504,0.012152492,0.01627459,0.0062426254,0.0009096659],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00036690573,0.00034044156,0.026134778,0.0006690057,0.00005098487,0.0045009186,0.27402353,0.0016966091,0.004108409,0.41019654,0.11850574,0.15940617],"study_design_scores_gemma":[0.00003487713,0.00014823677,0.006768627,0.00032029374,0.000019050349,0.0011810809,0.19716643,0.002019868,0.0014124134,0.021771377,0.76903653,0.00012123519],"about_ca_topic_score_codex":0.05446529,"about_ca_topic_score_gemma":0.07302429,"teacher_disagreement_score":0.97942823,"about_ca_system_score_codex":0.023189638,"about_ca_system_score_gemma":0.039901413,"threshold_uncertainty_score":0.16825336},"labels":[],"label_agreement":null},{"id":"W4200546404","doi":"10.29173/iq1025","title":"IASSIST gone glocal","year":2021,"lang":"en","type":"article","venue":"IASSIST Quarterly","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Glocalization; Acronym; Framing (construction); Documentation; Political science; Media studies; History; Law; Sociology; Linguistics; Globalization","score_opus":0.15653857254677414,"score_gpt":0.41942364759280903,"score_spread":0.26288507504603487,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4200546404","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0018291256,0.011354023,0.00048552957,0.1351014,0.26589486,0.00011626429,0.0012886483,0.0016067922,0.5823234],"genre_scores_gemma":[0.003791945,0.0015143425,0.00015616852,0.01632347,0.011328416,0.000043805245,0.00045556354,0.0004148709,0.9659714],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9986016,0.0001491745,0.00005353362,0.0002534704,0.00055111386,0.00039095856],"domain_scores_gemma":[0.996763,0.0002508611,0.00017866414,0.00019984928,0.0011212598,0.0014863362],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0014812802,0.001122693,0.0005665935,0.0011887635,0.004364744,0.010276621,0.0008183706,0.004454413,0.3258148],"category_scores_gemma":[0.0055484436,0.0005369469,0.0004983062,0.00077921833,0.0009983463,0.004042529,0.004625402,0.0056587276,0.2343317],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000010845064,0.0000055644464,0.000041645842,0.00002085113,5.1813515e-7,0.000033223518,0.00005286887,0.000003912711,0.000043061762,0.00074002426,0.9944693,0.004578261],"study_design_scores_gemma":[0.0000013728853,0.000004524216,0.00010299277,0.000022267399,3.0655892e-7,0.000015073113,0.00008281315,0.0000037001855,0.000022149788,0.000080127444,0.99966276,0.0000019061388],"about_ca_topic_score_codex":0.0042100707,"about_ca_topic_score_gemma":0.01008293,"teacher_disagreement_score":0.3258148,"about_ca_system_score_codex":0.0021068617,"about_ca_system_score_gemma":0.003348491,"threshold_uncertainty_score":0.96164334},"labels":[],"label_agreement":null},{"id":"W4200604891","doi":"10.1061/(asce)cp.1943-5487.0001001","title":"Automating Common Data Integration for Improved Data-Driven Decision-Support System in Industrial Construction","year":2021,"lang":"en","type":"article","venue":"Journal of Computing in Civil Engineering","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Data integration; Computer science; Data quality; Identification (biology); Data mining; Semantic integration; Data mapping; Key (lock); Decision support system; Information integration; Data science; Database; Information retrieval; Semantic Web; Engineering; Semantic computing","score_opus":0.18723894972623292,"score_gpt":0.39126347606754397,"score_spread":0.20402452634131105,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4200604891","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.046208948,0.00019338285,0.9439967,0.0002880742,0.000027406915,0.0004050667,0.0005600662,0.006656862,0.0016634205],"genre_scores_gemma":[0.29780236,0.00013643701,0.6994182,0.000071054,0.00000949581,0.00025315498,0.0014829822,0.00018649512,0.0006398518],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9937597,0.0017440681,0.0006445417,0.0012872155,0.0021590914,0.0004052677],"domain_scores_gemma":[0.9934453,0.0019133266,0.0006856007,0.0017913256,0.0018324787,0.00033205628],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00839884,0.0011356891,0.0014103223,0.0049838773,0.0016958686,0.0039262665,0.0023135187,0.0010687094,0.0017081805],"category_scores_gemma":[0.012334543,0.0007778232,0.001453813,0.0044057146,0.0010743268,0.0040920805,0.0047236774,0.0014418213,0.00063353946],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008802249,0.0010009034,0.029168826,0.00081513147,0.00030757565,0.0011589802,0.0050099995,0.18658058,0.030877607,0.03359468,0.008898082,0.70170736],"study_design_scores_gemma":[0.00006944042,0.00017869298,0.006733408,0.00016613216,0.00013202195,0.0002749331,0.0014364322,0.90568095,0.039673746,0.02439197,0.021130392,0.00013196253],"about_ca_topic_score_codex":0.012475687,"about_ca_topic_score_gemma":0.013035753,"teacher_disagreement_score":0.012475687,"about_ca_system_score_codex":0.0021063837,"about_ca_system_score_gemma":0.004661422,"threshold_uncertainty_score":0.044417858},"labels":[],"label_agreement":null},{"id":"W4210809982","doi":"10.2196/preprints.12465","title":"Improving Digital Hospital Transformation: Development of an Outcomes-Based Infrastructure Maturity Assessment Framework (Preprint)","year":2018,"lang":"en","type":"preprint","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Cisco Systems (Canada)","funders":"","keywords":"Capability Maturity Model; Preprint; Maturity (psychological); Health care; Analytics; Information technology; Digital transformation; Business; Process management; Quality (philosophy); Information system; Digital health; Knowledge management; Health information technology; Computer science; Data science; Engineering; World Wide Web","score_opus":0.05618803089164384,"score_gpt":0.3910087864215082,"score_spread":0.33482075552986434,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4210809982","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07799323,0.0015307011,0.79060173,0.017051002,0.00021987541,0.008351532,0.0043528667,0.0010458368,0.09885321],"genre_scores_gemma":[0.34069458,0.0008516103,0.6466695,0.00048002132,0.00004030477,0.004490336,0.0045570526,0.000066938424,0.002149633],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9903082,0.0049080877,0.00150136,0.0005227296,0.0021009503,0.0006585003],"domain_scores_gemma":[0.976591,0.0097954115,0.0031783734,0.0007414007,0.0087571675,0.0009366652],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02064619,0.00095943373,0.0005827192,0.010121465,0.001595843,0.0073618484,0.0016789249,0.0019503216,0.0034034683],"category_scores_gemma":[0.035749245,0.0003255674,0.0019131429,0.008737058,0.0017723992,0.0090414975,0.0052916827,0.0026789133,0.0007597147],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000056782515,0.000978162,0.070467934,0.0016728197,0.00017356983,0.00026717823,0.008478566,0.028202225,0.0011356849,0.5345795,0.020130066,0.33385754],"study_design_scores_gemma":[0.00010541127,0.0008210053,0.08077359,0.006679355,0.00037187134,0.00037294283,0.03453899,0.3276842,0.004924158,0.3734645,0.1699464,0.0003175992],"about_ca_topic_score_codex":0.015110682,"about_ca_topic_score_gemma":0.0135817155,"teacher_disagreement_score":0.02064619,"about_ca_system_score_codex":0.010002615,"about_ca_system_score_gemma":0.018066354,"threshold_uncertainty_score":0.109188795},"labels":[],"label_agreement":null},{"id":"W4210862833","doi":"10.1186/s40537-021-00468-0","title":"Big data quality framework: a holistic approach to continuous quality management","year":2021,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":141,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Big data; Computer science; Data quality; Profiling (computer programming); Data science; Data mining; Quality (philosophy); Data management; Exploratory data analysis; Engineering; Operations management","score_opus":0.7948772270531455,"score_gpt":0.5341265486844159,"score_spread":0.26075067836872956,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4210862833","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0032238683,0.0010459239,0.9877215,0.002229395,0.00011614661,0.00032573377,0.00020408505,0.0007506341,0.004382772],"genre_scores_gemma":[0.16086186,0.0013659871,0.834285,0.0005096621,0.00028606717,0.00052272703,0.0007481945,0.00016239168,0.0012581208],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9801129,0.0071782186,0.002191905,0.0023361307,0.0071777464,0.0010030885],"domain_scores_gemma":[0.9840884,0.0040163067,0.0023513925,0.0024618073,0.0056607393,0.0014212142],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.023199674,0.0016357228,0.0014600258,0.008474006,0.0017299454,0.012490123,0.0051376685,0.0022821692,0.0014913738],"category_scores_gemma":[0.017044382,0.0009524018,0.0026351681,0.0069205747,0.004829486,0.009860926,0.007141108,0.004336807,0.00044414282],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000109313274,0.00026213477,0.007876138,0.0010750912,0.00028378214,0.0005295757,0.0018074961,0.085427634,0.0028134235,0.7666662,0.008924868,0.1242244],"study_design_scores_gemma":[0.000048177077,0.00023702215,0.0030710134,0.0011476688,0.00023051696,0.0004890858,0.0016006741,0.5202304,0.003794894,0.40367115,0.06530437,0.00017502705],"about_ca_topic_score_codex":0.008350067,"about_ca_topic_score_gemma":0.0044308635,"teacher_disagreement_score":0.023199674,"about_ca_system_score_codex":0.0046137967,"about_ca_system_score_gemma":0.008362233,"threshold_uncertainty_score":0.12269306},"labels":[],"label_agreement":null},{"id":"W4210979382","doi":"10.2200/s00878ed1v01y201810dtm052","title":"Data Profiling","year":2018,"lang":"en","type":"article","venue":"Synthesis lectures on data management","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":16,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Profiling (computer programming); Metadata; Computer science; Data science; Research data; Information retrieval; World Wide Web; Data curation; Operating system","score_opus":0.484101918142008,"score_gpt":0.4815667505532124,"score_spread":0.0025351675887955727,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4210979382","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0029024365,0.002289245,0.8911287,0.0073628025,0.0028030123,0.0007016171,0.009618568,0.022889469,0.060304135],"genre_scores_gemma":[0.103436224,0.005104286,0.7193628,0.0056439573,0.0027004262,0.001014613,0.03162248,0.010361431,0.12075387],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9899368,0.0021179598,0.0011463797,0.0023055272,0.003883036,0.00061031774],"domain_scores_gemma":[0.9756566,0.00520239,0.00091430167,0.01209819,0.005087613,0.0010408014],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009461921,0.0017408535,0.0015151376,0.0053087114,0.00206126,0.010401932,0.0024981603,0.0012296219,0.04375417],"category_scores_gemma":[0.03965746,0.0013666918,0.0016061134,0.0060984953,0.0012000346,0.015124093,0.0073317895,0.0035954828,0.042071953],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00030634954,0.00009195699,0.0020900732,0.00053839467,0.000055521796,0.000117542004,0.00036781566,0.002311708,0.0052925902,0.15511604,0.20579448,0.6279175],"study_design_scores_gemma":[0.000023572515,0.00004593556,0.0009990203,0.00034167108,0.00004371092,0.0004281549,0.00029459127,0.01445712,0.016094366,0.13452704,0.83267146,0.00007339473],"about_ca_topic_score_codex":0.0013909492,"about_ca_topic_score_gemma":0.0011879932,"teacher_disagreement_score":0.04375417,"about_ca_system_score_codex":0.0018004255,"about_ca_system_score_gemma":0.0035821814,"threshold_uncertainty_score":0.14637226},"labels":[],"label_agreement":null},{"id":"W4211029301","doi":"10.2200/s00439ed1v01y201207dtm030","title":"Foundations of Data Quality Management","year":2012,"lang":"en","type":"article","venue":"Synthesis lectures on data management","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":131,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"National Key Research and Development Program of China; Engineering and Physical Sciences Research Council; Universiteit Antwerpen; University of Waterloo; National Natural Science Foundation of China","keywords":"Data quality; Data management; Computer science; Quality (philosophy); Data governance; Data science; Data administration; Database; Database design; Operations management; Engineering; Database model","score_opus":0.6066300196494542,"score_gpt":0.5319929733621165,"score_spread":0.0746370462873377,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4211029301","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.003627056,0.06882723,0.587062,0.16989338,0.005736002,0.00018102673,0.00058875437,0.00055973325,0.16352478],"genre_scores_gemma":[0.49033952,0.09489041,0.314238,0.02216477,0.02477989,0.0011261245,0.0011173257,0.0005817027,0.050762285],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9851488,0.0055410783,0.0011520652,0.0017333094,0.005690407,0.0007343169],"domain_scores_gemma":[0.9497948,0.030658731,0.002525893,0.008178499,0.0078449175,0.0009970932],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02355294,0.00094347046,0.0013835897,0.005842323,0.002762041,0.012444524,0.002807948,0.0043925783,0.013396668],"category_scores_gemma":[0.05046068,0.00087344885,0.0014298169,0.0065630837,0.01929618,0.015769605,0.004724659,0.0072127613,0.002494189],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000032437338,0.000008911575,0.00007655019,0.00007013923,0.0000065196114,0.0000064320147,0.00007708491,0.00059753563,0.000020378537,0.97910607,0.0054529454,0.01457427],"study_design_scores_gemma":[0.000005063985,0.000004365136,0.0000883085,0.00014279499,0.000004903649,0.000010462334,0.000047460195,0.0014872388,0.000070014576,0.96853536,0.029597063,0.0000068279905],"about_ca_topic_score_codex":0.007413502,"about_ca_topic_score_gemma":0.0026400567,"teacher_disagreement_score":0.02355294,"about_ca_system_score_codex":0.009723727,"about_ca_system_score_gemma":0.009183184,"threshold_uncertainty_score":0.12456131},"labels":[],"label_agreement":null},{"id":"W4214900227","doi":"10.23889/ijpds.v7i1.1689","title":"Describing the linkage between administrative social assistance and health care databases in Ontario, Canada","year":2022,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Ministry of Children, Community and Social Services; Hospital for Sick Children; Public Health Ontario; Trillium Health Centre; SickKids Foundation; University of Toronto; Institute for Clinical Evaluative Sciences; Centre for Addiction and Mental Health","funders":"","keywords":"Record linkage; Database; Linkage (software); Representativeness heuristic; Population; Service (business); Medicine; Christian ministry; Business; Computer science; Environmental health; Psychology; Political science","score_opus":0.658627486546011,"score_gpt":0.5247302681115205,"score_spread":0.13389721843449054,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4214900227","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.40028358,0.012180689,0.07545147,0.016390514,0.00032971826,0.0060101906,0.41076884,0.002115366,0.076469555],"genre_scores_gemma":[0.6779079,0.008421907,0.11783204,0.0012989478,0.000086833905,0.003179733,0.17593259,0.00030563085,0.015034396],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9811174,0.0032372025,0.002943273,0.0016090153,0.009338694,0.0017544273],"domain_scores_gemma":[0.94899917,0.010392255,0.006635185,0.0033774604,0.029576713,0.0010192547],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.018260509,0.0003631053,0.00051938876,0.009034894,0.0046799765,0.005529228,0.0023070385,0.0007038416,0.0025407318],"category_scores_gemma":[0.057827078,0.00055625295,0.0008324534,0.036781542,0.0010014623,0.0017703158,0.0034040003,0.0005643465,0.00057380553],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00032545018,0.0001022911,0.593022,0.0027458384,0.00061495946,0.0009155666,0.016058857,0.021418134,0.0013308463,0.03390935,0.115686364,0.21387038],"study_design_scores_gemma":[0.000104675215,0.00006673324,0.59189075,0.0026153373,0.0003415556,0.0003355651,0.013222418,0.029887153,0.0021600293,0.0054716254,0.3536498,0.00025427286],"about_ca_topic_score_codex":0.99206513,"about_ca_topic_score_gemma":0.99080545,"teacher_disagreement_score":0.08949792,"about_ca_system_score_codex":0.08949792,"about_ca_system_score_gemma":0.19412053,"threshold_uncertainty_score":0.6493559},"labels":[],"label_agreement":null},{"id":"W4220991771","doi":"10.1145/3506712","title":"Machine Learning and Data Cleaning: Which Serves the Other?","year":2022,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":51,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Data quality; Software deployment; Data science; Data integration; Quality (philosophy); Data mining; Software engineering; Engineering","score_opus":0.32207436291019614,"score_gpt":0.472009332225758,"score_spread":0.14993496931556188,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4220991771","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0016906194,0.20460662,0.067612715,0.71138215,0.0072690314,0.00008128655,0.0001302913,0.00032950187,0.0068977694],"genre_scores_gemma":[0.13988686,0.42845014,0.15017976,0.2071728,0.0614489,0.00052203616,0.00048012834,0.0009140194,0.010945456],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9439567,0.035698295,0.002692401,0.0053432463,0.010265056,0.0020443248],"domain_scores_gemma":[0.8591707,0.08854808,0.007952981,0.012922091,0.025582254,0.005823916],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.071521364,0.0017425218,0.005239761,0.006614832,0.005035177,0.017177643,0.005089624,0.012666713,0.007506047],"category_scores_gemma":[0.11200414,0.001193143,0.002486946,0.010439336,0.02308006,0.043616142,0.011897907,0.017412795,0.0050022583],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00029335718,0.00028506896,0.008499325,0.005815925,0.0006314433,0.0003063944,0.0038384392,0.0012312061,0.00065438147,0.23136419,0.15169899,0.59538126],"study_design_scores_gemma":[0.000102992766,0.0002075165,0.0040557766,0.008103324,0.0002461692,0.0010649174,0.00860488,0.0052751033,0.0010739992,0.59804726,0.37294182,0.00027619104],"about_ca_topic_score_codex":0.0076921415,"about_ca_topic_score_gemma":0.0051811086,"teacher_disagreement_score":0.071521364,"about_ca_system_score_codex":0.005777326,"about_ca_system_score_gemma":0.010805831,"threshold_uncertainty_score":0.37824565},"labels":[],"label_agreement":null},{"id":"W4224288101","doi":"10.1145/3524303","title":"Contextual Data Cleaning with Ontology Functional Dependencies","year":2022,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ontario Tech University; University of Waterloo; McMaster University","funders":"","keywords":"Ontology; Axiom; Computer science; Functional dependency; Inference; Dependency (UML); Set (abstract data type); Dependency theory (database theory); Relation (database); Data mining; Artificial intelligence; Relational database; Mathematics","score_opus":0.4677702605003999,"score_gpt":0.452390842963974,"score_spread":0.015379417536425855,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4224288101","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011894644,0.00024547975,0.9846015,0.00053851644,0.000038078542,0.00017200827,0.0005525779,0.001190898,0.00076630857],"genre_scores_gemma":[0.1265616,0.0002376093,0.87025815,0.00036035257,0.000051068866,0.00019640577,0.0014619327,0.00026121674,0.0006116922],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.97946143,0.0068277395,0.0019628187,0.004136915,0.0067373356,0.0008737772],"domain_scores_gemma":[0.9316756,0.036375906,0.005555235,0.018683234,0.0072117033,0.0004982552],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.012802386,0.0012437678,0.0013045153,0.0050878995,0.0026566212,0.0032634095,0.0034421827,0.0018360348,0.0015862626],"category_scores_gemma":[0.0736202,0.0011822922,0.0037400988,0.0054945354,0.0031349221,0.006782784,0.0076899366,0.0037395302,0.00048648415],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00046814868,0.00042899145,0.04186444,0.0020142382,0.00069587777,0.0016407233,0.0033851957,0.15200084,0.022772208,0.17074394,0.01503735,0.588948],"study_design_scores_gemma":[0.00007202521,0.00020598693,0.0075264047,0.00048245763,0.0004333254,0.0016478932,0.0014163143,0.5662795,0.05752672,0.3157865,0.048425913,0.00019699887],"about_ca_topic_score_codex":0.011212665,"about_ca_topic_score_gemma":0.016026959,"teacher_disagreement_score":0.012802386,"about_ca_system_score_codex":0.0021232814,"about_ca_system_score_gemma":0.006386623,"threshold_uncertainty_score":0.06770635},"labels":[],"label_agreement":null},{"id":"W4225009152","doi":"10.1080/10903127.2022.2044417","title":"Joint Statement on Lights &amp; Siren Vehicle Operations on Emergency Medical Services Responses","year":2022,"lang":"en","type":"article","venue":"Prehospital Emergency Care","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Niagara College","funders":"","keywords":"Siren (mythology); Medicine; Emergency medical services; Medical emergency; Statement (logic); Joint (building); Aeronautics; Engineering; Law","score_opus":0.11843764649449767,"score_gpt":0.4120196332112333,"score_spread":0.29358198671673563,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4225009152","genre_codex":"commentary","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0023946855,0.0046613393,0.0029784867,0.764073,0.15200096,0.0009963303,0.006434298,0.00033419416,0.066126764],"genre_scores_gemma":[0.022440333,0.007905501,0.011870242,0.5926687,0.09738686,0.0018263863,0.007902177,0.0007017541,0.257298],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.96313375,0.0053794514,0.0048974343,0.0015946169,0.019114682,0.005880055],"domain_scores_gemma":[0.8114155,0.055306636,0.013008555,0.007829074,0.07709473,0.035345495],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.038251095,0.0020291815,0.00232127,0.0022098918,0.004488342,0.010688165,0.004923947,0.038417436,0.01993544],"category_scores_gemma":[0.079390734,0.0016257223,0.003415589,0.0025016456,0.0026955532,0.003048806,0.0060615456,0.024838563,0.01284282],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00008157261,0.000083943334,0.0009186586,0.00014027744,0.00003157975,0.00011544069,0.00008459856,0.00019778988,0.00028634365,0.0020903142,0.9867051,0.009264383],"study_design_scores_gemma":[0.00007659712,0.000047684312,0.0051028407,0.00069157477,0.00008306692,0.000090428104,0.0002358903,0.00039016968,0.0005979943,0.0012417376,0.9913598,0.00008221411],"about_ca_topic_score_codex":0.051615696,"about_ca_topic_score_gemma":0.067608796,"teacher_disagreement_score":0.051615696,"about_ca_system_score_codex":0.005446792,"about_ca_system_score_gemma":0.07994474,"threshold_uncertainty_score":0.20229352},"labels":[],"label_agreement":null},{"id":"W4225143092","doi":"10.1145/3533021","title":"A Machine Learning Approach for Automated Filling of Categorical Fields in Data Entry Forms","year":2022,"lang":"en","type":"article","venue":"ACM Transactions on Software Engineering and Methodology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":13,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Categorical variable; Computer science; Field (mathematics); Machine learning; Data mining; Artificial intelligence; Set (abstract data type); Data field; Software; Mathematics","score_opus":0.3306833255399733,"score_gpt":0.4220707860804389,"score_spread":0.09138746054046559,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4225143092","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009367939,0.00026819407,0.969764,0.0005324262,0.00004230552,0.0002709133,0.00080955774,0.018035894,0.00090877654],"genre_scores_gemma":[0.07354237,0.00010322438,0.9230017,0.00020937284,0.000050832252,0.00027963688,0.0012183196,0.0001652905,0.0014291584],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9945523,0.0019081937,0.0004692055,0.0012210262,0.0016244167,0.00022480178],"domain_scores_gemma":[0.98129773,0.011816653,0.0015648723,0.002591624,0.0023294596,0.00039973794],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0049319393,0.0016865549,0.0012507794,0.0042731087,0.0011708468,0.0014742456,0.0032120978,0.0018803512,0.0044172565],"category_scores_gemma":[0.027385328,0.0007033753,0.0013876766,0.003322736,0.0010588937,0.004979424,0.001940931,0.0028037971,0.0030507066],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00026057553,0.0004191875,0.004663484,0.00028788365,0.00004684005,0.00022116318,0.00058200536,0.03144934,0.0048773787,0.004623132,0.017891267,0.9346777],"study_design_scores_gemma":[0.00006709532,0.00018116621,0.0017422028,0.00007590486,0.000022769202,0.0004358819,0.00022777378,0.9602975,0.007303168,0.016060345,0.013496632,0.00008952218],"about_ca_topic_score_codex":0.0070824954,"about_ca_topic_score_gemma":0.012130314,"teacher_disagreement_score":0.0070824954,"about_ca_system_score_codex":0.0014245762,"about_ca_system_score_gemma":0.0031740628,"threshold_uncertainty_score":0.026082933},"labels":[],"label_agreement":null},{"id":"W4225160911","doi":"10.1016/j.compeleceng.2022.107985","title":"An efficient framework for semantically-correlated term detection and sanitization in clinical documents","year":2022,"lang":"en","type":"article","venue":"Computers & Electrical Engineering","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Brandon University","funders":"","keywords":"Term (time); Computer science; Information retrieval; Data mining; Physics","score_opus":0.044887310654674134,"score_gpt":0.37684828744487653,"score_spread":0.3319609767902024,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4225160911","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0037063905,0.00019661123,0.9919309,0.00015990357,0.000034733945,0.0001386713,0.0004868893,0.0029432853,0.00040255574],"genre_scores_gemma":[0.08324284,0.00016400612,0.91374457,0.00010820281,0.0000726731,0.00016570296,0.0014230096,0.00016908966,0.0009098996],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9955776,0.0008693967,0.00047780172,0.0008355016,0.0018472328,0.00039249484],"domain_scores_gemma":[0.99588543,0.001597085,0.00045493335,0.0007784443,0.00106163,0.00022257015],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003445981,0.0012183975,0.0018169424,0.004536222,0.0013261245,0.004335825,0.0027895467,0.0018069175,0.0028993299],"category_scores_gemma":[0.009676991,0.00070120074,0.0023592936,0.0037764395,0.0009388976,0.002657813,0.003797992,0.0018602845,0.001501311],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008016973,0.0006300449,0.006055882,0.0006386455,0.00031548095,0.00065310847,0.0005938997,0.1301951,0.032373596,0.084530786,0.0199586,0.7232532],"study_design_scores_gemma":[0.000049416667,0.000082111284,0.00083565613,0.000040406438,0.00007771391,0.00026804072,0.00011872137,0.9448628,0.009345589,0.0390006,0.0052740905,0.000044910106],"about_ca_topic_score_codex":0.0114418045,"about_ca_topic_score_gemma":0.019824667,"teacher_disagreement_score":0.0114418045,"about_ca_system_score_codex":0.0015158945,"about_ca_system_score_gemma":0.006445234,"threshold_uncertainty_score":0.022750378},"labels":[],"label_agreement":null},{"id":"W4226372432","doi":"10.2196/36711","title":"Linking Biomedical Data Warehouse Records With the National Mortality Database in France: Large-scale Matching Algorithm","year":2022,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"Conseil Régional des Pays de la Loire; Agence Nationale de la Recherche","keywords":"Algorithm; Database; Matching (statistics); Computer science; Data mining; Identifier; Scale (ratio); Medicine; Statistics; Mathematics; Cartography; Geography","score_opus":0.12455254929085986,"score_gpt":0.4246629664904805,"score_spread":0.30011041719962067,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4226372432","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.25404295,0.0007012057,0.7382501,0.00073612144,0.000065233944,0.00070436543,0.00084412645,0.003466654,0.0011891808],"genre_scores_gemma":[0.39244452,0.00013554397,0.60409427,0.00018003404,0.000035092162,0.00045819517,0.0020165336,0.000083935134,0.00055190164],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9918514,0.0033749095,0.0011703381,0.0021361392,0.001129772,0.00033751767],"domain_scores_gemma":[0.9861442,0.009192499,0.0011891633,0.0013455441,0.0019361592,0.0001923544],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.014312302,0.00064394483,0.0011468257,0.0037095447,0.0010122446,0.0022097772,0.002135958,0.0016508963,0.0010846861],"category_scores_gemma":[0.03726062,0.00055952586,0.0014145209,0.0033912577,0.0004855109,0.0015571186,0.0024480356,0.0007992038,0.00051454885],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009367926,0.00081858295,0.1820307,0.0003426861,0.0007985944,0.00044026255,0.00045433894,0.21427967,0.005554573,0.0063590943,0.0049742158,0.5830105],"study_design_scores_gemma":[0.000246527,0.00021880171,0.025190188,0.00003862691,0.00013933757,0.0006379753,0.00016394806,0.9585945,0.0049763056,0.006664312,0.0030894973,0.000039908515],"about_ca_topic_score_codex":0.012092465,"about_ca_topic_score_gemma":0.0064048013,"teacher_disagreement_score":0.014312302,"about_ca_system_score_codex":0.00219876,"about_ca_system_score_gemma":0.0039820205,"threshold_uncertainty_score":0.07569158},"labels":[],"label_agreement":null},{"id":"W4229784727","doi":"10.4018/978-1-59904-951-9.ch077","title":"The Use of Smart Tokens in Cleaning Integrated Warehouse Data","year":2008,"lang":"en","type":"book-chapter","venue":"IGI Global eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"","keywords":"Data warehouse; Computer science; Security token; Database; Alphanumeric; Matching (statistics); Data mining","score_opus":0.3727475774821563,"score_gpt":0.38089613504841335,"score_spread":0.008148557566257042,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4229784727","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.049629368,0.0005188232,0.9429004,0.00017353459,0.00014092863,0.00021901353,0.0005592613,0.005003414,0.0008552823],"genre_scores_gemma":[0.1514124,0.00025979278,0.84476656,0.00009751943,0.000025911591,0.00013930314,0.0013733696,0.00044043572,0.0014846975],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9938956,0.0006992731,0.0010980136,0.0013727697,0.0026029982,0.00033131582],"domain_scores_gemma":[0.989056,0.0024477358,0.0023617097,0.0038794235,0.0018958458,0.00035928196],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0025751842,0.0007611071,0.0015786842,0.0034479515,0.0013652282,0.0031188636,0.0037442108,0.0010740433,0.0012429417],"category_scores_gemma":[0.012057822,0.0008173598,0.0014143506,0.006191608,0.0014550207,0.006390649,0.0034949507,0.0013657003,0.0019109097],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0018581644,0.00036409884,0.023472372,0.0008374796,0.0002505691,0.0009476087,0.002139027,0.028544856,0.07004926,0.03152947,0.0075022066,0.83250487],"study_design_scores_gemma":[0.00020407472,0.0013513474,0.011674156,0.00025481914,0.00042275063,0.004150433,0.0021796387,0.35194102,0.4796521,0.047291234,0.10031604,0.0005623276],"about_ca_topic_score_codex":0.0035320392,"about_ca_topic_score_gemma":0.0026551157,"teacher_disagreement_score":0.0037442108,"about_ca_system_score_codex":0.0011148677,"about_ca_system_score_gemma":0.0026616568,"threshold_uncertainty_score":0.013619065},"labels":[],"label_agreement":null},{"id":"W4230003669","doi":"10.1007/978-0-387-39940-9_2388","title":"Data Reconciliation","year":2009,"lang":"en","type":"book-chapter","venue":"Encyclopedia of Database Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Geology; Computer science","score_opus":0.24306039818885264,"score_gpt":0.3890158151243503,"score_spread":0.14595541693549766,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4230003669","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006473385,0.0047960053,0.77035147,0.0063966895,0.0048266235,0.0020285344,0.013951455,0.038459428,0.1527165],"genre_scores_gemma":[0.06517458,0.004576463,0.7261206,0.004591105,0.0013196312,0.001318968,0.05056993,0.012326407,0.13400236],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9882974,0.0027119596,0.0013474153,0.0023504428,0.0047083194,0.0005844864],"domain_scores_gemma":[0.97590655,0.0031272739,0.0006857946,0.014631702,0.005339001,0.00030968426],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010620417,0.0020929729,0.0019553031,0.011853568,0.0027078139,0.009831545,0.0064062215,0.0019718243,0.054759443],"category_scores_gemma":[0.03221087,0.0012493744,0.0026448546,0.0113055585,0.001499637,0.010354905,0.011363085,0.0033862556,0.037778042],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014283252,0.00010296095,0.0011635653,0.0007872881,0.000114707436,0.00026379916,0.0007197501,0.001309235,0.0025470105,0.075544894,0.17355286,0.74375105],"study_design_scores_gemma":[0.000033317552,0.000048272977,0.00073001365,0.00043924278,0.000112056536,0.0008672177,0.0003932808,0.0056062536,0.017097963,0.056415133,0.9181848,0.00007260655],"about_ca_topic_score_codex":0.001448096,"about_ca_topic_score_gemma":0.0012263282,"teacher_disagreement_score":0.054759443,"about_ca_system_score_codex":0.0014353306,"about_ca_system_score_gemma":0.0045817974,"threshold_uncertainty_score":0.18318856},"labels":[],"label_agreement":null},{"id":"W4230325026","doi":"10.32920/ryerson.14639367.v1","title":"ORCID IDs in the open knowledge era","year":2021,"lang":"en","type":"preprint","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Metadata; Identifier; World Wide Web; Computer science; Interoperability; Unique identifier; Outreach; Library science; Political science; Programming language","score_opus":0.530129337104347,"score_gpt":0.55318074981532,"score_spread":0.023051412710972996,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4230325026","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12502135,0.027662858,0.2657801,0.09272346,0.012992078,0.0009274067,0.045075856,0.01721682,0.4126001],"genre_scores_gemma":[0.49660483,0.0131937405,0.33641022,0.014393878,0.004140351,0.000713823,0.06145821,0.0040859175,0.06899908],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.96713114,0.007191903,0.003959214,0.003970733,0.01558393,0.00216317],"domain_scores_gemma":[0.8547505,0.044384293,0.014588852,0.04093299,0.038482316,0.0068610557],"candidate_categories":["metaresearch","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.026160154,0.0005120763,0.00103428,0.016380444,0.0037498053,0.019505112,0.0035130286,0.0033853482,0.01647838],"category_scores_gemma":[0.12689875,0.0004695023,0.00061608927,0.019517213,0.0039936304,0.02283989,0.01457666,0.003096688,0.008764204],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00042380163,0.0000982044,0.02560785,0.0013336458,0.000062249455,0.0004425556,0.0035872774,0.000962032,0.0014259191,0.40075356,0.13941354,0.4258893],"study_design_scores_gemma":[0.000011799057,0.00003289189,0.004534845,0.0007880379,0.000029684417,0.00037582262,0.0028845742,0.0018137184,0.0017398946,0.0788763,0.90884674,0.00006579874],"about_ca_topic_score_codex":0.0068249954,"about_ca_topic_score_gemma":0.005582733,"teacher_disagreement_score":0.9804949,"about_ca_system_score_codex":0.0064745625,"about_ca_system_score_gemma":0.008516882,"threshold_uncertainty_score":0.13834977},"labels":[],"label_agreement":null},{"id":"W4230742320","doi":"10.1007/978-0-387-39940-9_2353","title":"Data Flow Diagrams","year":2009,"lang":"en","type":"book-chapter","venue":"Encyclopedia of Database Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science","score_opus":0.19180635649045114,"score_gpt":0.3763419300888647,"score_spread":0.18453557359841355,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4230742320","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0021873962,0.0021338214,0.6939348,0.001444127,0.0005137936,0.0008821186,0.014584805,0.011230025,0.27308917],"genre_scores_gemma":[0.034643967,0.0049307155,0.61985326,0.0010349671,0.00020840293,0.0011157553,0.03293009,0.0037266263,0.3015562],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99872464,0.00023213886,0.00012234738,0.000263505,0.00058394304,0.000073316245],"domain_scores_gemma":[0.99792176,0.0010077488,0.00008480776,0.00028190154,0.00063370354,0.00007009025],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001161151,0.001076533,0.00044302313,0.004671661,0.0008865573,0.0045376453,0.0012744769,0.0011341214,0.078404695],"category_scores_gemma":[0.0056963246,0.00072418054,0.0008133658,0.0044136215,0.00052821526,0.0050801695,0.0013358212,0.0013420876,0.027284723],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000059940696,0.00006510927,0.00042308623,0.0006684002,0.000019363684,0.0001870306,0.00065807597,0.002376005,0.0030212887,0.35604578,0.15308237,0.48339358],"study_design_scores_gemma":[0.000010474589,0.000010570998,0.00016390407,0.00020926415,0.000012610065,0.00020613518,0.00008039556,0.0032673026,0.0022642426,0.06101743,0.93274474,0.000012963313],"about_ca_topic_score_codex":0.0046144887,"about_ca_topic_score_gemma":0.0040788334,"teacher_disagreement_score":0.078404695,"about_ca_system_score_codex":0.001223288,"about_ca_system_score_gemma":0.0019841762,"threshold_uncertainty_score":0.26228982},"labels":[],"label_agreement":null},{"id":"W4232185901","doi":"10.1109/icse.2001.919157","title":"2nd international workshop on living with inconsistency","year":2001,"lang":"en","type":"article","venue":"Proceedings of the 23rd International Conference on Software Engineering. ICSE 2001","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science","score_opus":0.10551223806098867,"score_gpt":0.3396156170632339,"score_spread":0.23410337900224523,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4232185901","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011447734,0.02121047,0.79540867,0.058712542,0.011986007,0.0005073213,0.0009116052,0.0036625883,0.096153066],"genre_scores_gemma":[0.1368874,0.016591089,0.6964288,0.009555195,0.0062036766,0.00077954744,0.0051384596,0.0030132881,0.12540251],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99091023,0.0036261422,0.0007633816,0.0015977141,0.0024677818,0.0006348768],"domain_scores_gemma":[0.9765202,0.008136968,0.00067768083,0.0074518314,0.005926134,0.0012872908],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.015008846,0.0017908385,0.0019962671,0.002867122,0.0028936933,0.009868802,0.0058094407,0.004677418,0.039316405],"category_scores_gemma":[0.030854521,0.0014097878,0.0030120655,0.002094833,0.003727691,0.019292815,0.010303145,0.0070640724,0.007828586],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00044303315,0.00040619003,0.001947187,0.001005846,0.00024037705,0.00081604003,0.00341466,0.0046280758,0.0033914975,0.21309032,0.18944705,0.5811697],"study_design_scores_gemma":[0.00011418225,0.00018648675,0.0010571645,0.0010753286,0.00021651521,0.0014196829,0.0015907891,0.021064054,0.0058234674,0.27448788,0.692861,0.00010347529],"about_ca_topic_score_codex":0.0027744425,"about_ca_topic_score_gemma":0.003799302,"teacher_disagreement_score":0.039316405,"about_ca_system_score_codex":0.0021169218,"about_ca_system_score_gemma":0.003844178,"threshold_uncertainty_score":0.13152653},"labels":[],"label_agreement":null},{"id":"W4232692662","doi":"10.21203/rs.2.22164/v2","title":"Innovative use of data sources: A Cross-sectional study of Data Linkage and Artificial Intelligence Practices across European Countries","year":2020,"lang":"en","type":"preprint","venue":"Research Square","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"National Research Council Canada; Institute of Health Economics","funders":"Norwegian Institute of Public Health; Public Health Agency; Helsedirektoratet; Institut National de la Santé et de la Recherche Médicale; Folkhälsomyndigheten; European Commission","keywords":"Linkage (software); Artificial intelligence; Cross-sectional study; Cross-sectional data; Data science; Computer science; Psychology; Econometrics; Statistics; Economics; Mathematics; Biology","score_opus":0.8831522603204187,"score_gpt":0.6579785674833427,"score_spread":0.225173692837076,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4232692662","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9973711,0.0009398343,0.0004756455,0.0002946147,0.000006820051,0.000034784898,0.00019804809,0.0000044832386,0.0006747194],"genre_scores_gemma":[0.9987029,0.00034586023,0.00047656937,0.00013521005,0.0000036586703,0.00003362372,0.00021601396,0.000004614533,0.00008153693],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9599311,0.02696318,0.005526611,0.0026855832,0.0039037312,0.0009897541],"domain_scores_gemma":[0.86777925,0.07045303,0.040229145,0.007326092,0.011754838,0.0024576383],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.052345697,0.00024384189,0.0006079838,0.0032758913,0.0012509288,0.0033789496,0.0010109012,0.0011106669,0.0011979829],"category_scores_gemma":[0.07056422,0.00049002457,0.000631517,0.008094518,0.0018291187,0.002979538,0.002931956,0.0009082231,0.00016008875],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006554404,0.000097938086,0.98485374,0.00010338297,0.00016065805,0.0001181458,0.0075280573,0.00012915862,0.000071617644,0.00033457344,0.0002629855,0.006274156],"study_design_scores_gemma":[0.000011680107,0.00019445507,0.971227,0.00032101065,0.00008272328,0.00049783534,0.023874799,0.00058305793,0.00026760023,0.00017355518,0.0027364355,0.000029735824],"about_ca_topic_score_codex":0.0054215565,"about_ca_topic_score_gemma":0.0030241911,"teacher_disagreement_score":0.9476543,"about_ca_system_score_codex":0.0014494557,"about_ca_system_score_gemma":0.0014870479,"threshold_uncertainty_score":0.27683377},"labels":[],"label_agreement":null},{"id":"W4235765738","doi":"10.1007/978-0-387-39940-9_2404","title":"Data Utility Measures","year":2009,"lang":"en","type":"book-chapter","venue":"Encyclopedia of Database Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science","score_opus":0.2837700046111019,"score_gpt":0.39175607703186327,"score_spread":0.10798607242076136,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4235765738","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009809571,0.012738648,0.703877,0.0034231537,0.0012308283,0.00086529175,0.011125936,0.0029822204,0.25394738],"genre_scores_gemma":[0.3704157,0.013422775,0.4568055,0.0017221704,0.0016191753,0.0023321908,0.02052095,0.0016878591,0.13147372],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9903776,0.0028142298,0.0008024012,0.0010914325,0.004644693,0.00026967272],"domain_scores_gemma":[0.98517215,0.006966668,0.0010168117,0.002810553,0.003712898,0.00032089578],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008031957,0.0013374813,0.0009487718,0.007535902,0.0006328346,0.005354111,0.0013999122,0.0007633494,0.023577],"category_scores_gemma":[0.040463336,0.00034458222,0.00086687924,0.009197391,0.0010251953,0.0058699977,0.0017412249,0.0016400963,0.008340112],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000083103725,0.00008419511,0.0021642507,0.00058326387,0.00007344314,0.000050481976,0.00017218474,0.0035505404,0.00082733604,0.45430058,0.058719255,0.47939137],"study_design_scores_gemma":[0.00002960991,0.00017379424,0.004818189,0.00076740293,0.00012959277,0.0005687787,0.00042114462,0.02426765,0.0058049215,0.4675199,0.4954247,0.00007448532],"about_ca_topic_score_codex":0.00078669493,"about_ca_topic_score_gemma":0.0006665088,"teacher_disagreement_score":0.023577,"about_ca_system_score_codex":0.0017384398,"about_ca_system_score_gemma":0.0012145743,"threshold_uncertainty_score":0.07887292},"labels":[],"label_agreement":null},{"id":"W4236290949","doi":"10.4018/9781609602000.ch023","title":"Do You Know Where Your Data Is?","year":2011,"lang":"en","type":"book-chapter","venue":"IGI Global eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Need to know; Computer science; Data science; Computer security","score_opus":0.28092519451972603,"score_gpt":0.40100844440042255,"score_spread":0.12008324988069652,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4236290949","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017774168,0.066263534,0.044301867,0.21588697,0.005030651,0.0003264072,0.026873369,0.0023546682,0.62118834],"genre_scores_gemma":[0.24451706,0.16953447,0.08062321,0.0500916,0.006049778,0.0003716283,0.038030565,0.0019877115,0.40879396],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9971846,0.00092807197,0.00022500718,0.0003942873,0.0011268054,0.00014123775],"domain_scores_gemma":[0.9923819,0.0042335843,0.0007225448,0.0011588112,0.0010866949,0.00041647043],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0034204568,0.0003851949,0.0005912999,0.0027109578,0.0012631111,0.006962958,0.0009774175,0.0019007763,0.040243797],"category_scores_gemma":[0.018205902,0.00034069884,0.00046700097,0.0056897337,0.0021695886,0.011315589,0.0022269716,0.0023330715,0.035070173],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00007639035,0.000057810135,0.008920879,0.0010872734,0.000042577725,0.00028315597,0.0034638762,0.00028132513,0.0011656099,0.06282049,0.41983908,0.5019616],"study_design_scores_gemma":[0.0000032899225,0.000011237577,0.002594425,0.0007324949,0.000012305396,0.00043052185,0.0017805145,0.00032564352,0.0004927722,0.018981878,0.97461265,0.000022154105],"about_ca_topic_score_codex":0.0036214618,"about_ca_topic_score_gemma":0.0048205927,"teacher_disagreement_score":0.040243797,"about_ca_system_score_codex":0.0013627971,"about_ca_system_score_gemma":0.0019103314,"threshold_uncertainty_score":0.13462895},"labels":[],"label_agreement":null},{"id":"W4237174812","doi":"10.2139/ssrn.3254297","title":"Entity Set Expansion with Semantic Features of Knowledge Graphs","year":2018,"lang":"en","type":"article","venue":"SSRN Electronic Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; Natural language processing; Information retrieval; Set (abstract data type); Artificial intelligence; Programming language","score_opus":0.04820797742969012,"score_gpt":0.3650064786949731,"score_spread":0.316798501265283,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4237174812","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10222854,0.0010506401,0.8689849,0.0009880031,0.00022958191,0.00056516775,0.009398193,0.005494528,0.011060473],"genre_scores_gemma":[0.44729415,0.00059522555,0.5337037,0.00020270195,0.00011730393,0.0002318391,0.014642775,0.0003312495,0.0028811079],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99903166,0.00022706376,0.00010079046,0.000293735,0.00027792747,0.000068879446],"domain_scores_gemma":[0.99756575,0.0014007698,0.00014035472,0.00050024525,0.00032792994,0.00006490286],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001045983,0.00056686,0.0006220609,0.005199175,0.00064766913,0.0014403674,0.0011377882,0.0008123496,0.0044903494],"category_scores_gemma":[0.0073681967,0.00033669465,0.0013995789,0.005685985,0.0004260598,0.0045435964,0.001786715,0.0010846122,0.00074494386],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00077964546,0.0007748431,0.008885471,0.0008913317,0.00038122982,0.0011398703,0.00086487323,0.08537904,0.016052289,0.079257295,0.026216386,0.7793777],"study_design_scores_gemma":[0.00009493516,0.0001558659,0.0061350446,0.00020699865,0.00038299063,0.0006766001,0.00050901587,0.7735994,0.014308667,0.17305882,0.030803556,0.00006813382],"about_ca_topic_score_codex":0.003939336,"about_ca_topic_score_gemma":0.0067310827,"teacher_disagreement_score":0.005199175,"about_ca_system_score_codex":0.000592033,"about_ca_system_score_gemma":0.0008140881,"threshold_uncertainty_score":0.015021682},"labels":[],"label_agreement":null},{"id":"W4237245205","doi":"10.21203/rs.2.22164/v1","title":"Innovative use of data sources: A Cross-sectional study of Data Linkage Practices across European Countries","year":2020,"lang":"en","type":"preprint","venue":"Research Square","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"National Research Council Canada; Institute of Health Economics","funders":"Norwegian Institute of Public Health; Helsedirektoratet; Institut National de la Santé et de la Recherche Médicale; European Commission","keywords":"Linkage (software); Cross-sectional study; Cross-sectional data; Geography; Statistics; Mathematics; Biology; Genetics","score_opus":0.8684068958353723,"score_gpt":0.6619126168745204,"score_spread":0.20649427896085193,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4237245205","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.996789,0.001263035,0.0007614519,0.0002573086,0.00000828309,0.000056456927,0.00022343016,0.0000055826945,0.0006354483],"genre_scores_gemma":[0.9984378,0.00039103965,0.0006835815,0.00012460967,0.000003840679,0.00004855154,0.0002331301,0.000005881096,0.00007152899],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9426134,0.039077837,0.008246112,0.0035512787,0.0053709894,0.0011403696],"domain_scores_gemma":[0.83970064,0.086897425,0.0473829,0.009732804,0.01428288,0.002003328],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.06955463,0.00026934687,0.0006738182,0.003398445,0.0011985609,0.0032917717,0.0011785643,0.0011844097,0.0011406896],"category_scores_gemma":[0.09244657,0.0005370142,0.0006590177,0.0079889735,0.0017398986,0.003078304,0.0028664568,0.00086994667,0.00015447587],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00008134627,0.00008053708,0.9852697,0.0001257214,0.00019566508,0.00010799975,0.006905471,0.000112075366,0.000087463195,0.00027878548,0.00020946184,0.006545811],"study_design_scores_gemma":[0.000015848902,0.00022709035,0.97348976,0.00039931972,0.0001264317,0.00061678566,0.021213971,0.00065094285,0.00034088833,0.00017337668,0.002711253,0.000034411427],"about_ca_topic_score_codex":0.0048294053,"about_ca_topic_score_gemma":0.0030437983,"teacher_disagreement_score":0.9304454,"about_ca_system_score_codex":0.001368845,"about_ca_system_score_gemma":0.0013644379,"threshold_uncertainty_score":0.3678444},"labels":[],"label_agreement":null},{"id":"W4237720795","doi":"10.1002/(sici)1097-4571(2000)51:8<774::aid-asi90>3.0.co;2-p","title":"Using clustering strategies for creating authority files","year":2000,"lang":"en","type":"article","venue":"Journal of the American Society for Information Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":29,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"National Research Council Canada; Smithsonian Astrophysical Observatory; National Aeronautics and Space Administration; National Radio Astronomy Observatory; National Science Foundation","keywords":"Computer science; String (physics); Matching (statistics); Word (group theory); Information retrieval; Cluster analysis; Categorization; Spelling; String searching algorithm; Quality (philosophy); Metadata; Data mining; Artificial intelligence; Pattern matching; World Wide Web","score_opus":0.19143348053855952,"score_gpt":0.45290997536841127,"score_spread":0.26147649482985175,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4237720795","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.03455909,0.00025574837,0.9537228,0.00031773082,0.00008519651,0.00064127287,0.0010910832,0.003843167,0.0054838103],"genre_scores_gemma":[0.12757549,0.00017738526,0.86537796,0.00007128308,0.00005275479,0.00048339405,0.003186995,0.00048395214,0.002590806],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9955101,0.0011924669,0.00054391654,0.0009486539,0.001505299,0.00029964652],"domain_scores_gemma":[0.98462164,0.005131258,0.0012641036,0.0042523807,0.004229154,0.0005013848],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0045228293,0.0009769519,0.001117329,0.009762617,0.0026717633,0.0034377284,0.0028547877,0.0015989298,0.00515474],"category_scores_gemma":[0.03074718,0.0006170854,0.0012217463,0.009790415,0.0010142593,0.00448939,0.0024768312,0.001082144,0.0032373278],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00030953396,0.00040681192,0.012805967,0.00036687797,0.00016244318,0.00035096845,0.002159715,0.072321996,0.0092701055,0.06271056,0.021354286,0.8177807],"study_design_scores_gemma":[0.00024296243,0.00028003982,0.007857788,0.00016919053,0.00022610613,0.0014435595,0.0033779298,0.73609155,0.031716235,0.14264068,0.07563309,0.00032093038],"about_ca_topic_score_codex":0.0073707425,"about_ca_topic_score_gemma":0.011248214,"teacher_disagreement_score":0.009762617,"about_ca_system_score_codex":0.0013657412,"about_ca_system_score_gemma":0.0026738313,"threshold_uncertainty_score":0.023919284},"labels":[],"label_agreement":null},{"id":"W4240833016","doi":"10.1007/bf03405034","title":"Development of a Computer Linkage System for a Blood Recipient Notification Program in Nova Scotia","year":2002,"lang":"en","type":"article","venue":"Canadian Journal of Public Health","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":true,"ca_institutions":"Health Canada","funders":"","keywords":"Nova scotia; Medical record; Record linkage; Data file; Medicine; Computer science; Nova (rocket); Linkage (software); Medical emergency; Database; Geography; Surgery; Environmental health; Engineering; Population; Biology","score_opus":0.38003217666380074,"score_gpt":0.4087639461078232,"score_spread":0.028731769444022448,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4240833016","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.87377685,0.0006332999,0.066113345,0.005087899,0.00042850684,0.010275267,0.0062179775,0.016097898,0.02136891],"genre_scores_gemma":[0.82808185,0.00046121195,0.14737895,0.0009255304,0.0000968907,0.0017461795,0.0056424616,0.0004352211,0.015231632],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99646604,0.0010455333,0.00044253067,0.0006042214,0.0009285838,0.00051318837],"domain_scores_gemma":[0.98185456,0.005403682,0.0011327537,0.00089403545,0.008174109,0.0025407686],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006836169,0.00042107864,0.00056202087,0.0027890692,0.0025455821,0.0022395188,0.0016456586,0.000798768,0.0056598145],"category_scores_gemma":[0.016126318,0.00054940145,0.00031509096,0.0026800842,0.00047261716,0.001102951,0.001375988,0.00072930736,0.0014947882],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0034740057,0.0028906222,0.29361126,0.0006110726,0.00020232433,0.0036870784,0.00987861,0.01973929,0.030613344,0.0023814533,0.062227756,0.5706832],"study_design_scores_gemma":[0.0023213713,0.0043814224,0.5555881,0.0007746288,0.0006924894,0.0015552123,0.010622033,0.24915555,0.031159647,0.0011585352,0.14205079,0.00054026],"about_ca_topic_score_codex":0.63276523,"about_ca_topic_score_gemma":0.5387512,"teacher_disagreement_score":0.36723477,"about_ca_system_score_codex":0.010130751,"about_ca_system_score_gemma":0.029446425,"threshold_uncertainty_score":0.7387949},"labels":[],"label_agreement":null},{"id":"W4241033854","doi":"10.1007/978-1-4939-7131-2_100333","title":"Entity Extraction","year":2018,"lang":"en","type":"book-chapter","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Extraction (chemistry); Computer science; Chromatography; Chemistry","score_opus":0.34082901758318324,"score_gpt":0.4610012396116445,"score_spread":0.12017222202846128,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4241033854","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0022223732,0.0036127283,0.762253,0.0022970906,0.0013248774,0.0008616711,0.028879467,0.02138808,0.17716065],"genre_scores_gemma":[0.02374925,0.0069015427,0.6204791,0.0014546965,0.0006585652,0.00060728623,0.11702925,0.006607267,0.22251298],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.998365,0.00026465705,0.00020907861,0.00051878,0.0005595639,0.000082904575],"domain_scores_gemma":[0.9970289,0.0007459873,0.00009823428,0.0013165831,0.000728423,0.00008185113],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0023429708,0.0017775816,0.0012078149,0.0061783367,0.0017851109,0.005786067,0.0025586614,0.0010477973,0.106497146],"category_scores_gemma":[0.008318182,0.00085784635,0.0018656738,0.008972844,0.00074316974,0.010359735,0.0051284246,0.0019745661,0.10802174],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000051772233,0.000045485373,0.00047787972,0.00070973806,0.000047776623,0.00015125585,0.00023286665,0.000828306,0.0033680743,0.07338018,0.28805208,0.63265455],"study_design_scores_gemma":[0.0000075849025,0.000012609591,0.00043019681,0.00022888342,0.000048455473,0.00050346606,0.00013259966,0.0035033042,0.0073776753,0.04939133,0.9383322,0.00003171999],"about_ca_topic_score_codex":0.0018948547,"about_ca_topic_score_gemma":0.0026978462,"teacher_disagreement_score":0.106497146,"about_ca_system_score_codex":0.00097557536,"about_ca_system_score_gemma":0.0017782476,"threshold_uncertainty_score":0.3562684},"labels":[],"label_agreement":null},{"id":"W4241632110","doi":"10.23889/ijpds.v4i2.1133","title":"Population Data BC: Supporting population data science in British Columbia","year":2020,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":30,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"The Quebec Population Health Research Network; University of British Columbia","funders":"","keywords":"Computer science; Data access; Linkage (software); Variety (cybernetics); Data quality; Identifier; Data science; Data management; Linked data; Record linkage; Population; Database; World Wide Web; Service (business); Business","score_opus":0.4131892460550775,"score_gpt":0.5216265395244426,"score_spread":0.10843729346936509,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4241632110","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01113146,0.007302576,0.07055425,0.053513978,0.001590674,0.002420526,0.491904,0.019068666,0.34251383],"genre_scores_gemma":[0.127944,0.017027725,0.2067878,0.01399359,0.0007170936,0.0070042512,0.4461188,0.00894581,0.171461],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9870029,0.00330497,0.0012627792,0.001388117,0.005990195,0.0010510132],"domain_scores_gemma":[0.8880356,0.024153296,0.0026668631,0.012066857,0.06430392,0.008773423],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.018212887,0.0008697411,0.0010783523,0.010898565,0.0058170664,0.009625025,0.0045170556,0.0016333674,0.065496236],"category_scores_gemma":[0.085860886,0.0011498503,0.0006682751,0.020996533,0.0020432216,0.0042369114,0.007882499,0.0038642648,0.018447546],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00010113252,0.00005987688,0.015194944,0.0010032947,0.00008793319,0.00031199888,0.0014416918,0.0019962892,0.0006846778,0.027486201,0.7596665,0.19196545],"study_design_scores_gemma":[0.00004732706,0.000008126411,0.019493049,0.0017054097,0.00003107392,0.000069125366,0.0007817095,0.0036002852,0.00050540915,0.012616782,0.96105355,0.00008818667],"about_ca_topic_score_codex":0.9522613,"about_ca_topic_score_gemma":0.93957067,"teacher_disagreement_score":0.95919627,"about_ca_system_score_codex":0.040803723,"about_ca_system_score_gemma":0.18444991,"threshold_uncertainty_score":0.2960531},"labels":[],"label_agreement":null},{"id":"W4242139153","doi":"10.1504/ijmso.2019.099839","title":"A data exchange solution for emergency response systems based on the EDXL-RESCUER ontology","year":2019,"lang":"en","type":"article","venue":"International Journal of Metadata Semantics and Ontologies","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"Conselho Nacional de Desenvolvimento Científico e Tecnológico; European Commission","keywords":"Interoperability; Computer science; Ontology; Semantic interoperability; Data exchange; Emergency response; Information exchange; Computer security; Database; World Wide Web; Medical emergency; Telecommunications; Medicine","score_opus":0.36351123738029595,"score_gpt":0.46071758606612306,"score_spread":0.09720634868582712,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4242139153","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0206073,0.00035097785,0.96175003,0.001765974,0.00013527581,0.0006408276,0.00088039465,0.0029941038,0.010875135],"genre_scores_gemma":[0.1487624,0.00062335975,0.8400836,0.0005861231,0.000044336717,0.0004011479,0.0040977183,0.00031978273,0.005081405],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9965963,0.00079129316,0.0007458627,0.00044128197,0.001186113,0.00023911156],"domain_scores_gemma":[0.99768126,0.00045670438,0.00029659682,0.00075856916,0.0006410195,0.00016572046],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005185414,0.00047286908,0.00057526026,0.0022463815,0.0016016061,0.0035868562,0.0017184942,0.001337936,0.0014020609],"category_scores_gemma":[0.004735084,0.0004083058,0.0017091737,0.002137055,0.0012503755,0.0065200464,0.00551258,0.0017742553,0.00052480964],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027664466,0.0007659383,0.007220435,0.0011937096,0.0002521671,0.001413274,0.0051377276,0.031660628,0.03076125,0.5886279,0.018136866,0.31455353],"study_design_scores_gemma":[0.00023394669,0.00029446342,0.0055816895,0.00080802146,0.00037598386,0.0018404562,0.0040363353,0.25373894,0.031932764,0.13310973,0.56777865,0.00026903677],"about_ca_topic_score_codex":0.010128423,"about_ca_topic_score_gemma":0.007984142,"teacher_disagreement_score":0.010128423,"about_ca_system_score_codex":0.0022107058,"about_ca_system_score_gemma":0.0054064947,"threshold_uncertainty_score":0.027423382},"labels":[],"label_agreement":null},{"id":"W4243007898","doi":"10.4018/978-1-4666-2044-5.ch011","title":"Data Management and Data Administration","year":2013,"lang":"en","type":"book-chapter","venue":"IGI Global eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Timeline; Quarter (Canadian coin); Perception; Subject matter; Set (abstract data type); Data management; Data science; Knowledge management; Political science; Public relations; Computer science; Psychology; Geography; Data mining","score_opus":0.2949578727367357,"score_gpt":0.4209749095604416,"score_spread":0.1260170368237059,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4243007898","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.003656598,0.026277268,0.17530979,0.037845924,0.006987233,0.001743705,0.013196823,0.0059361947,0.7290464],"genre_scores_gemma":[0.10477685,0.055196162,0.19892351,0.025716899,0.009242006,0.0031937878,0.030996388,0.0058824476,0.566072],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98154676,0.0063821073,0.002336038,0.002837201,0.0062252358,0.00067254127],"domain_scores_gemma":[0.95135856,0.017976144,0.0032267324,0.015761333,0.009541943,0.0021352991],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01659956,0.0008847399,0.0011341344,0.005644274,0.0023108632,0.01617796,0.0028682712,0.002523604,0.074823335],"category_scores_gemma":[0.052609425,0.0006127522,0.0008641721,0.015030779,0.004592802,0.009522945,0.0057788105,0.0037433947,0.07592292],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00004546081,0.00005634111,0.001329021,0.001158798,0.000033942233,0.00012942827,0.002107834,0.00045827107,0.00083283323,0.19389789,0.3033685,0.49658173],"study_design_scores_gemma":[0.0000037771456,0.000008929737,0.00038239887,0.00035868585,0.0000045012407,0.00012401833,0.00023999273,0.00016840696,0.00028896795,0.014859978,0.9835504,0.000009987146],"about_ca_topic_score_codex":0.0036160115,"about_ca_topic_score_gemma":0.00150075,"teacher_disagreement_score":0.074823335,"about_ca_system_score_codex":0.0050435956,"about_ca_system_score_gemma":0.011870514,"threshold_uncertainty_score":0.250309},"labels":[],"label_agreement":null},{"id":"W4243870196","doi":"10.1007/978-1-4939-7131-2_100039","title":"Aspect or Facet Mining","year":2018,"lang":"en","type":"book-chapter","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Facet (psychology); Geology; Computer science; Mining engineering; Psychology; Social psychology","score_opus":0.44505886852049,"score_gpt":0.44800967471884373,"score_spread":0.0029508061983537504,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4243870196","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0022305418,0.008356415,0.62884164,0.004000274,0.0018815646,0.00023524246,0.0026465547,0.0067660436,0.34504175],"genre_scores_gemma":[0.039824698,0.016772853,0.5756457,0.003919027,0.0021740068,0.00037524904,0.013327653,0.006520015,0.34144092],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99901843,0.00011853152,0.00006441552,0.00026765166,0.00047135,0.00005958979],"domain_scores_gemma":[0.99870634,0.00048727225,0.000057524398,0.00043133716,0.00024679443,0.000070762224],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001072673,0.0011193282,0.0007920767,0.0025421144,0.0009397052,0.0050970973,0.0016017678,0.00093872356,0.031136133],"category_scores_gemma":[0.0046444554,0.000556148,0.001452616,0.0043237377,0.0010750055,0.007836505,0.0026069428,0.002696075,0.018750671],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000035574056,0.000041329447,0.00058669184,0.00042355995,0.000026748146,0.00010210365,0.00041875293,0.0007596069,0.0015199014,0.22080828,0.18114157,0.5941359],"study_design_scores_gemma":[0.0000044840967,0.000011585044,0.00041857813,0.00026799028,0.000020530702,0.00044334668,0.00018605706,0.00410562,0.0011142747,0.24441087,0.74899936,0.000017222266],"about_ca_topic_score_codex":0.0019961302,"about_ca_topic_score_gemma":0.0032542509,"teacher_disagreement_score":0.031136133,"about_ca_system_score_codex":0.0007130964,"about_ca_system_score_gemma":0.0010566381,"threshold_uncertainty_score":0.104160726},"labels":[],"label_agreement":null},{"id":"W4244656168","doi":"10.1109/edocw.2019.00004","title":"Table of Contents","year":2019,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Table (database); Computer science; Database","score_opus":0.2766879689188622,"score_gpt":0.43200925537921075,"score_spread":0.15532128646034854,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4244656168","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00063926505,0.003960953,0.0050688614,0.0050748084,0.010416297,0.0014185759,0.15907794,0.0030614806,0.81128174],"genre_scores_gemma":[0.0036819037,0.004382116,0.005551172,0.0042956555,0.0033681744,0.0012438167,0.11363596,0.0017981261,0.86204314],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9990557,0.00016315642,0.00006720326,0.00013680209,0.0005126452,0.00006464514],"domain_scores_gemma":[0.99250984,0.0020554485,0.00031861875,0.00072271755,0.0037084725,0.000684859],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.001334143,0.0009779917,0.000966839,0.006363628,0.0013757843,0.0043540993,0.0015645288,0.0010223292,0.86379224],"category_scores_gemma":[0.0155641725,0.00036431194,0.00054847274,0.004789977,0.00040285662,0.0018058022,0.0017142573,0.0010836285,0.773647],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000016471948,0.000026646143,0.00017309938,0.0002464348,0.000003995978,0.0000152286,0.000011511617,0.000087799584,0.00009452177,0.0012130362,0.9539896,0.044121735],"study_design_scores_gemma":[0.000008098464,0.000012056311,0.00040734725,0.00028931702,0.0000059855556,0.000035011515,0.000028769271,0.000060664384,0.0001273662,0.0013457628,0.9976737,0.0000060118427],"about_ca_topic_score_codex":0.0044904137,"about_ca_topic_score_gemma":0.005275383,"teacher_disagreement_score":0.13620776,"about_ca_system_score_codex":0.0018285227,"about_ca_system_score_gemma":0.0035194012,"threshold_uncertainty_score":0.19428384},"labels":[],"label_agreement":null},{"id":"W4245895410","doi":"10.4018/9781599048574.ch055","title":"Statistical Data and Metadata Quality Assessment","year":2011,"lang":"en","type":"book-chapter","venue":"IGI Global eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Standardization; Quality (philosophy); Metadata; Product (mathematics); Data quality; Summary statistics; Computer science; Business; Statistics; Service (business); Marketing; World Wide Web; Mathematics","score_opus":0.4417883249660065,"score_gpt":0.4803543658407542,"score_spread":0.03856604087474769,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4245895410","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0027339645,0.069057554,0.4557675,0.04123089,0.005102061,0.0010681347,0.0153061235,0.0031992712,0.40653455],"genre_scores_gemma":[0.06413008,0.1275108,0.5596274,0.010303589,0.006412806,0.0023256855,0.026861537,0.0040532425,0.19877493],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.982851,0.006412245,0.0015866562,0.0012794224,0.0076548667,0.00021583913],"domain_scores_gemma":[0.9704691,0.019518118,0.001069009,0.002948016,0.0057134666,0.00028237744],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.016631566,0.00085670233,0.0010843622,0.012155229,0.0013411561,0.009551006,0.0019245518,0.0018955168,0.03176764],"category_scores_gemma":[0.044640627,0.00063818647,0.0008223754,0.024761263,0.003653738,0.007240917,0.0029605224,0.0028437858,0.01752043],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000012006702,0.000020222751,0.0005239476,0.0012696829,0.000029233843,0.00008330044,0.0016960212,0.000917121,0.0002641376,0.46062937,0.1562761,0.3782789],"study_design_scores_gemma":[0.0000034847747,0.000007932637,0.00043297003,0.0011219581,0.000010426282,0.00011096196,0.0005685113,0.0007409067,0.00027478067,0.15617254,0.8405336,0.000021913957],"about_ca_topic_score_codex":0.0040463014,"about_ca_topic_score_gemma":0.0039266953,"teacher_disagreement_score":0.03176764,"about_ca_system_score_codex":0.0044376566,"about_ca_system_score_gemma":0.006419082,"threshold_uncertainty_score":0.10627335},"labels":[],"label_agreement":null},{"id":"W4245953805","doi":"10.1007/978-0-387-39940-9_2382","title":"Data Quality Benchmarking","year":2009,"lang":"en","type":"book-chapter","venue":"Encyclopedia of Database Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Benchmarking; Quality (philosophy); Computer science; Business; Physics","score_opus":0.2811221040659851,"score_gpt":0.4236949266335831,"score_spread":0.142572822567598,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4245953805","genre_codex":"other","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0028945322,0.020784343,0.10575312,0.012717069,0.0034164537,0.00047056255,0.002867964,0.0029743232,0.8481217],"genre_scores_gemma":[0.07479169,0.030063113,0.1198331,0.006593674,0.001967904,0.00065297424,0.010816822,0.00250057,0.7527801],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9927867,0.0013172311,0.0004521846,0.0007285209,0.0044203615,0.00029491412],"domain_scores_gemma":[0.9916047,0.0019867735,0.00037253657,0.0015447679,0.0041450886,0.00034602213],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0070523764,0.00092335383,0.0009515093,0.0055067744,0.0011327788,0.0058868285,0.0022152564,0.0015476864,0.06540566],"category_scores_gemma":[0.01781863,0.00046063753,0.00066122593,0.0080106715,0.0009434206,0.005190038,0.0030767312,0.0020001973,0.020535862],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000025412388,0.000057510162,0.0005615579,0.0004289662,0.00001734416,0.000037876016,0.00017705321,0.00087760587,0.0005678388,0.12307507,0.26311967,0.611054],"study_design_scores_gemma":[0.0000079199035,0.000043861022,0.001285943,0.0007369923,0.000014598334,0.00019010689,0.00018565914,0.0019258551,0.0019232305,0.05599125,0.9376717,0.00002295469],"about_ca_topic_score_codex":0.0031053764,"about_ca_topic_score_gemma":0.0037035933,"teacher_disagreement_score":0.06540566,"about_ca_system_score_codex":0.002723463,"about_ca_system_score_gemma":0.0041511315,"threshold_uncertainty_score":0.21880376},"labels":[],"label_agreement":null},{"id":"W4246320142","doi":"10.4018/978-1-4666-0927-3.ch016","title":"Managing Demographic Data Inconsistencies in Healthcare Information Systems","year":2012,"lang":"en","type":"book-chapter","venue":"IGI Global eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Athabasca University","funders":"","keywords":"Computer science; Workflow; XML; Information system; Disparate system; RDF; Data exchange; DICOM; Database; Data science; Information retrieval; World Wide Web; Semantic Web; Engineering","score_opus":0.17316906449221955,"score_gpt":0.3654270627057529,"score_spread":0.19225799821353337,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4246320142","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05142321,0.01960824,0.8146053,0.029149625,0.0013801529,0.0005873724,0.0027106958,0.0024386726,0.078096755],"genre_scores_gemma":[0.399317,0.016105477,0.54909855,0.0043214476,0.001049543,0.00053521997,0.0068711713,0.0011710151,0.021530667],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.97278196,0.013042714,0.003144807,0.0018577813,0.00850673,0.00066598447],"domain_scores_gemma":[0.9645351,0.02363112,0.0027561774,0.0041010096,0.004610163,0.00036634778],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.029069282,0.00050443906,0.0011142254,0.0068367324,0.0024395916,0.010077768,0.0039858953,0.0021615145,0.0028981115],"category_scores_gemma":[0.05799843,0.0009547968,0.0008737273,0.013069211,0.0032305676,0.01870128,0.0069541144,0.0026645965,0.0010745468],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00007566404,0.000087558125,0.0078543555,0.00061273086,0.000077276476,0.0011021885,0.007650595,0.010239668,0.0006691349,0.62609726,0.024187533,0.3213461],"study_design_scores_gemma":[0.00003801202,0.00007002598,0.0030828551,0.0014958142,0.00014533788,0.0022382159,0.007528602,0.0422295,0.005938722,0.49288517,0.44421172,0.00013593245],"about_ca_topic_score_codex":0.0035600925,"about_ca_topic_score_gemma":0.0021516085,"teacher_disagreement_score":0.029069282,"about_ca_system_score_codex":0.0041625383,"about_ca_system_score_gemma":0.005051335,"threshold_uncertainty_score":0.15373492},"labels":[],"label_agreement":null},{"id":"W4247644046","doi":"10.1007/978-1-4939-7131-2_100238","title":"Data Mash-Ups","year":2018,"lang":"en","type":"book-chapter","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Computer science","score_opus":0.6487458488491252,"score_gpt":0.4840009790531912,"score_spread":0.164744869795934,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4247644046","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0029533163,0.017383695,0.5586406,0.021150308,0.009787201,0.00045969326,0.002450227,0.008815864,0.37835917],"genre_scores_gemma":[0.047107276,0.018751562,0.37211412,0.0070695067,0.0062309243,0.0006389472,0.0048555257,0.005630699,0.53760135],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99613744,0.0007524558,0.00026880778,0.00062365725,0.0020528438,0.00016473158],"domain_scores_gemma":[0.992331,0.0034305307,0.00023226546,0.0024273188,0.0012847773,0.00029408353],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005609539,0.0010142308,0.0009422173,0.0033309371,0.0015934403,0.005535842,0.002498183,0.0013728674,0.06654629],"category_scores_gemma":[0.017237542,0.0007189579,0.0013050715,0.004611281,0.0019513506,0.015426595,0.0065000746,0.0043968614,0.026873315],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000037447324,0.0000238002,0.00019359698,0.0003420566,0.000020903308,0.00009412084,0.00045710805,0.0010457214,0.00075200334,0.4638545,0.16580608,0.36737275],"study_design_scores_gemma":[0.000005669448,0.000009672775,0.00010185236,0.00025394157,0.000012344963,0.00015804113,0.0001377119,0.0021587133,0.0010479527,0.15777023,0.83832234,0.000021450947],"about_ca_topic_score_codex":0.0011179816,"about_ca_topic_score_gemma":0.0014589209,"teacher_disagreement_score":0.06654629,"about_ca_system_score_codex":0.0019613768,"about_ca_system_score_gemma":0.0017311324,"threshold_uncertainty_score":0.22261953},"labels":[],"label_agreement":null},{"id":"W4248646218","doi":"10.1007/978-981-10-7847-7_8","title":"Conclusion","year":2018,"lang":"en","type":"book-chapter","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Crowdsourcing; Analytics; Data science; Computer science; World Wide Web","score_opus":0.314498482960396,"score_gpt":0.43832979866986777,"score_spread":0.12383131570947176,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4248646218","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0022482818,0.0010333199,0.0054213493,0.024671143,0.0034183187,0.00008232859,0.001016646,0.00030637186,0.9618022],"genre_scores_gemma":[0.050531525,0.0017768464,0.0056622447,0.029384881,0.0011438555,0.0001570891,0.0021093974,0.00061470823,0.9086195],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.997776,0.00035971162,0.000059824626,0.00047840693,0.0010215947,0.000304495],"domain_scores_gemma":[0.99689543,0.00063373375,0.00010172089,0.00039925563,0.0015745384,0.0003953336],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.002531334,0.0004789631,0.00032728244,0.0010101598,0.00207253,0.0054212636,0.0014552798,0.0017768254,0.2651202],"category_scores_gemma":[0.010327636,0.00016097211,0.0005741376,0.00081261597,0.0013761524,0.0034940953,0.0024562085,0.002235196,0.08678145],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000119676835,0.00005859478,0.0017314474,0.00034963476,0.000022321792,0.00017827375,0.0013510741,0.00027784597,0.00070546503,0.27254748,0.56479186,0.15786642],"study_design_scores_gemma":[0.000010060181,0.000010359105,0.0010040668,0.0002472436,0.000010831265,0.000080817605,0.0012996142,0.00008425802,0.0005623094,0.031060195,0.9656234,0.0000068855584],"about_ca_topic_score_codex":0.0075339125,"about_ca_topic_score_gemma":0.0092314035,"teacher_disagreement_score":0.7348798,"about_ca_system_score_codex":0.0029451782,"about_ca_system_score_gemma":0.0037722364,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W4249269717","doi":"10.1007/978-0-387-39940-9_2384","title":"Data Quality Measurement","year":2009,"lang":"en","type":"book-chapter","venue":"Encyclopedia of Database Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Quality (philosophy); Physics","score_opus":0.414846341116501,"score_gpt":0.42206371298250933,"score_spread":0.007217371866008349,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4249269717","genre_codex":"other","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0033697537,0.022496656,0.22412029,0.014986013,0.0030716315,0.0011110744,0.008791878,0.0043920963,0.7176606],"genre_scores_gemma":[0.085073344,0.0352301,0.26199293,0.0072878296,0.0018585933,0.0013677432,0.019457843,0.0022435167,0.58548814],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99091923,0.0014614481,0.00060882064,0.0009093874,0.005892715,0.00020832059],"domain_scores_gemma":[0.9883385,0.0030206963,0.0006187928,0.00204118,0.005676841,0.00030394865],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00763841,0.00082676596,0.00080682634,0.0051579885,0.00093892217,0.0055210823,0.001858763,0.0011077963,0.053261474],"category_scores_gemma":[0.020816017,0.00046228684,0.00056399725,0.00726065,0.0009818691,0.0044096634,0.002276632,0.0016989108,0.025453918],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000023147793,0.000050764862,0.0010483048,0.0005665661,0.000022382055,0.00002290097,0.00025474356,0.00034020026,0.0011087988,0.10303825,0.2229314,0.6705925],"study_design_scores_gemma":[0.000007444405,0.00004721361,0.002481683,0.0007308018,0.000021713198,0.00016341046,0.00021800229,0.0011226372,0.0030801182,0.03805437,0.95404524,0.000027304199],"about_ca_topic_score_codex":0.0028024884,"about_ca_topic_score_gemma":0.0027240755,"teacher_disagreement_score":0.053261474,"about_ca_system_score_codex":0.002503655,"about_ca_system_score_gemma":0.0040626586,"threshold_uncertainty_score":0.17817736},"labels":[],"label_agreement":null},{"id":"W4249958738","doi":"10.1007/978-0-387-39940-9_2347","title":"Data Deduplication","year":2009,"lang":"en","type":"book-chapter","venue":"Encyclopedia of Database Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Data deduplication; Computer science; Database","score_opus":0.21490546097654822,"score_gpt":0.39464753395498214,"score_spread":0.17974207297843392,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4249958738","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.018414933,0.01431069,0.7351065,0.0035249202,0.0064544613,0.0019066464,0.016225569,0.034555268,0.16950098],"genre_scores_gemma":[0.13622737,0.013390051,0.44771788,0.0037056361,0.0019311109,0.0010967717,0.040746797,0.009098731,0.34608573],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99846435,0.00022108672,0.00021272391,0.0002995274,0.0006790255,0.0001233728],"domain_scores_gemma":[0.991915,0.0009228185,0.00021451099,0.005155641,0.0016579739,0.0001341188],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0023141757,0.0011114972,0.00097605184,0.003243823,0.0013577802,0.0037929327,0.0028305412,0.00070601725,0.040564373],"category_scores_gemma":[0.006559975,0.00067269255,0.0010583628,0.0047709206,0.0006724941,0.0043679713,0.0036542,0.0013846798,0.023328504],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002156941,0.000106174775,0.000960315,0.0010081223,0.000074380834,0.00036411767,0.00031089986,0.0020032185,0.008093862,0.036929324,0.22958583,0.720348],"study_design_scores_gemma":[0.000054821623,0.00009753812,0.0009261972,0.00038556368,0.00010912713,0.001952753,0.00019859707,0.011384032,0.056168754,0.039615642,0.889027,0.00008002367],"about_ca_topic_score_codex":0.00045413664,"about_ca_topic_score_gemma":0.00059766194,"teacher_disagreement_score":0.040564373,"about_ca_system_score_codex":0.0005243661,"about_ca_system_score_gemma":0.0013020472,"threshold_uncertainty_score":0.13570142},"labels":[],"label_agreement":null},{"id":"W4251706394","doi":"10.1007/978-1-4614-6170-8_100362","title":"Data Mash-ups","year":2014,"lang":"en","type":"book-chapter","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Mashup; Computer science; World Wide Web","score_opus":0.5876439455935591,"score_gpt":0.46426003717551917,"score_spread":0.12338390841803998,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4251706394","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0031739336,0.013638762,0.572138,0.016839482,0.0074483487,0.00047499777,0.0022288645,0.008808036,0.37524962],"genre_scores_gemma":[0.04523371,0.015001728,0.3904725,0.0058327513,0.0045499518,0.0005779696,0.0042669363,0.0048973816,0.52916706],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9963942,0.00068272685,0.00024565897,0.0005668501,0.0019559856,0.00015457757],"domain_scores_gemma":[0.9931734,0.0029476676,0.00020297903,0.0022494285,0.0011678553,0.00025868387],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0052242354,0.0009421792,0.00089522783,0.0033760495,0.0015476391,0.005056667,0.002444911,0.0012394005,0.062924564],"category_scores_gemma":[0.015169333,0.000707069,0.0012634209,0.00458584,0.0018611638,0.014106184,0.006074596,0.0039457628,0.024593353],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000039384544,0.000023807472,0.00020931911,0.00029554614,0.000020550075,0.0001003051,0.00045504808,0.0010307579,0.00089723873,0.42991936,0.15301053,0.4139982],"study_design_scores_gemma":[0.000005977061,0.000010901518,0.000121149475,0.0002323262,0.000012968239,0.00017942421,0.00014669017,0.002492267,0.0013500341,0.14303488,0.85238993,0.000023425455],"about_ca_topic_score_codex":0.001308116,"about_ca_topic_score_gemma":0.0017132905,"teacher_disagreement_score":0.062924564,"about_ca_system_score_codex":0.001904081,"about_ca_system_score_gemma":0.0016809299,"threshold_uncertainty_score":0.21050364},"labels":[],"label_agreement":null},{"id":"W4251836994","doi":"10.1007/978-1-4757-3283-2_6","title":"Experimental Analyses","year":2001,"lang":"en","type":"book-chapter","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Regina","funders":"","keywords":"Ranking (information retrieval); Variety (cybernetics); Computer science; Software; Data mining; Data science; Diversity (politics); Information retrieval; Artificial intelligence; Programming language","score_opus":0.5945501731855667,"score_gpt":0.5331326257667598,"score_spread":0.061417547418806895,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4251836994","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0819951,0.0013347808,0.54249364,0.0013866137,0.0024193423,0.01341846,0.03731875,0.010864046,0.3087692],"genre_scores_gemma":[0.27805418,0.0019652252,0.36017233,0.003991149,0.00064384425,0.05481601,0.042439185,0.0053199204,0.25259814],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9925476,0.0017214152,0.0005862324,0.002812974,0.001795028,0.00053668575],"domain_scores_gemma":[0.99175346,0.0023573027,0.00039004965,0.0036317275,0.0016384589,0.00022891164],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0049597784,0.0017658091,0.0010957692,0.001858036,0.0018571209,0.001454747,0.0019826028,0.0012290773,0.096644185],"category_scores_gemma":[0.009371003,0.00077294506,0.001141476,0.0016745278,0.002067911,0.0013288237,0.0013866791,0.0023585956,0.026722372],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00658853,0.0053892247,0.00398504,0.0033629453,0.00047813615,0.00034758748,0.0014430726,0.0030850763,0.35179952,0.15608224,0.10062602,0.3668126],"study_design_scores_gemma":[0.001513845,0.005674284,0.0122928005,0.00058989454,0.00096587685,0.00089374895,0.0006050015,0.0086709475,0.35103214,0.08393196,0.53353465,0.00029484692],"about_ca_topic_score_codex":0.0017131575,"about_ca_topic_score_gemma":0.002206218,"teacher_disagreement_score":0.096644185,"about_ca_system_score_codex":0.0012040592,"about_ca_system_score_gemma":0.0020604362,"threshold_uncertainty_score":0.32330704},"labels":[],"label_agreement":null},{"id":"W4251956775","doi":"10.1007/978-0-85729-277-3_3","title":"Specification Qualities","year":2011,"lang":"en","type":"book-chapter","venue":"Texts in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Computer science; Formal specification; Formal methods; Software engineering; Software requirements specification; Software development process; Programming language; Software development; Software; Software design","score_opus":0.3559857135491262,"score_gpt":0.4049652110917449,"score_spread":0.048979497542618655,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4251956775","genre_codex":"other","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0065041296,0.0024614967,0.39503938,0.006493497,0.00043397184,0.00021878195,0.0010304409,0.0010301922,0.5867881],"genre_scores_gemma":[0.45151928,0.0051587764,0.19059551,0.00350501,0.0009801772,0.00083713885,0.0043100663,0.0025438827,0.34055012],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9928758,0.0018523752,0.0006679052,0.0013637798,0.0027627936,0.0004773795],"domain_scores_gemma":[0.98796684,0.0060447673,0.00039882355,0.0033310647,0.0020120535,0.00024645225],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0058704093,0.0010908414,0.0008745531,0.002229083,0.0016254615,0.00854116,0.0015105947,0.0017278674,0.061816253],"category_scores_gemma":[0.02420494,0.0010037979,0.001251976,0.0027513234,0.0050900076,0.013810709,0.0033432771,0.00483786,0.012933664],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000007826853,0.000006624231,0.000084746425,0.00005606853,0.000004250373,0.00001753014,0.00022375605,0.0003460288,0.000154509,0.973409,0.0052796113,0.02041007],"study_design_scores_gemma":[0.000011531233,0.000013627198,0.00010335225,0.00008375477,0.000012037481,0.000105052815,0.0001886421,0.0013737046,0.0010050932,0.89302874,0.10406265,0.000011826796],"about_ca_topic_score_codex":0.002024783,"about_ca_topic_score_gemma":0.0009913774,"teacher_disagreement_score":0.061816253,"about_ca_system_score_codex":0.0028045373,"about_ca_system_score_gemma":0.0019656077,"threshold_uncertainty_score":0.20679593},"labels":[],"label_agreement":null},{"id":"W4255857053","doi":"10.32920/ryerson.14639367","title":"ORCID IDs in the open knowledge era","year":2021,"lang":"en","type":"preprint","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Metadata; Identifier; World Wide Web; Interoperability; Computer science; Unique identifier; Outreach; Political science; Programming language","score_opus":0.530129337104347,"score_gpt":0.55318074981532,"score_spread":0.023051412710972996,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4255857053","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12502135,0.027662858,0.2657801,0.09272346,0.012992078,0.0009274067,0.045075856,0.01721682,0.4126001],"genre_scores_gemma":[0.49660483,0.0131937405,0.33641022,0.014393878,0.004140351,0.000713823,0.06145821,0.0040859175,0.06899908],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.96713114,0.007191903,0.003959214,0.003970733,0.01558393,0.00216317],"domain_scores_gemma":[0.8547505,0.044384293,0.014588852,0.04093299,0.038482316,0.0068610557],"candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.026160154,0.0005120763,0.00103428,0.016380444,0.0037498053,0.019505112,0.0035130286,0.0033853482,0.01647838],"category_scores_gemma":[0.12689875,0.0004695023,0.00061608927,0.019517213,0.0039936304,0.02283989,0.01457666,0.003096688,0.008764204],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00042380163,0.0000982044,0.02560785,0.0013336458,0.000062249455,0.0004425556,0.0035872774,0.000962032,0.0014259191,0.40075356,0.13941354,0.4258893],"study_design_scores_gemma":[0.000011799057,0.00003289189,0.004534845,0.0007880379,0.000029684417,0.00037582262,0.0028845742,0.0018137184,0.0017398946,0.0788763,0.90884674,0.00006579874],"about_ca_topic_score_codex":0.0068249954,"about_ca_topic_score_gemma":0.005582733,"teacher_disagreement_score":0.99648696,"about_ca_system_score_codex":0.0064745625,"about_ca_system_score_gemma":0.008516882,"threshold_uncertainty_score":0.13834977},"labels":[],"label_agreement":null},{"id":"W4256290989","doi":"10.1002/essoar.10503497.2","title":"N/A","year":2020,"lang":"en","type":"preprint","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"World Wide Web; Email authentication; Electronic mail; Computer science","score_opus":0.6549000826400283,"score_gpt":0.5294346348873289,"score_spread":0.1254654477526994,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4256290989","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0006830816,0.0012308927,0.0015167118,0.003139981,0.0055199144,0.00032917203,0.0069027464,0.0041234028,0.97655416],"genre_scores_gemma":[0.0043247393,0.001439786,0.0015769826,0.004795483,0.0009102197,0.00033705396,0.0073840423,0.0018246465,0.9774071],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99768424,0.0003138333,0.00019910844,0.0006916003,0.0007621921,0.00034901954],"domain_scores_gemma":[0.9957015,0.00027929715,0.0002511701,0.0008646171,0.0017093824,0.0011940618],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0019964618,0.0011358773,0.0011099777,0.0018515959,0.002257915,0.007696379,0.0026517778,0.003081777,0.9136428],"category_scores_gemma":[0.0068453723,0.00045118784,0.00093791855,0.0014030715,0.0012870438,0.0035087818,0.0052608624,0.002051544,0.8932284],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017653007,0.000105434156,0.00053153094,0.0006559798,0.000018111534,0.00025088835,0.00007691132,0.0000969626,0.0014829718,0.0031837232,0.83372205,0.15969886],"study_design_scores_gemma":[0.000016992662,0.000015188447,0.0002879364,0.0001499864,0.0000029444511,0.00010180606,0.00004519353,0.0000517234,0.00015340841,0.0005295898,0.99863917,0.0000060420825],"about_ca_topic_score_codex":0.0047856146,"about_ca_topic_score_gemma":0.00492177,"teacher_disagreement_score":0.08635718,"about_ca_system_score_codex":0.0020130542,"about_ca_system_score_gemma":0.004683011,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W4280497177","doi":"10.1007/s00146-022-01456-5","title":"Indexing, enriching, and understanding Brazilian missing person cases from data of distributed repositories on the web","year":2022,"lang":"en","type":"article","venue":"AI & Society","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Cape Breton University","funders":"Coordenação de Aperfeiçoamento de Pessoal de Nível Superior","keywords":"Computer science; Linked data; Process (computing); World Wide Web; Government (linguistics); Data science; Semantic Web; Data quality; Missing data; Quality (philosophy); Data discovery; Search engine indexing; Publishing; Information retrieval; Domain (mathematical analysis); Knowledge management; Metadata; Engineering; Political science","score_opus":0.3405926389921211,"score_gpt":0.40482843763498494,"score_spread":0.06423579864286383,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4280497177","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8707245,0.0010616783,0.10506685,0.002284763,0.00006887878,0.00052022934,0.010335912,0.000701604,0.009235517],"genre_scores_gemma":[0.88738936,0.0006140557,0.09854889,0.000112651964,0.000027368345,0.0002170672,0.0120686535,0.0000739939,0.0009479867],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9929726,0.002553894,0.0011299257,0.000775422,0.002149814,0.0004182159],"domain_scores_gemma":[0.9751752,0.011292848,0.0032715057,0.004975015,0.004826974,0.00045849427],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007705496,0.00040875477,0.0005584759,0.015307834,0.0015147063,0.0033003434,0.0011101252,0.0009588576,0.0007648654],"category_scores_gemma":[0.027126314,0.00029911287,0.0007100462,0.013248617,0.001253335,0.0038894245,0.0032431693,0.00076921855,0.00033490633],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00040757374,0.00052517967,0.5392269,0.00213169,0.0002785618,0.008208477,0.049015068,0.009590324,0.013934157,0.02626997,0.010069491,0.3403427],"study_design_scores_gemma":[0.000063801344,0.00020531825,0.37294513,0.0031325168,0.00065555784,0.0064355326,0.14626445,0.14877681,0.052684173,0.05390215,0.21467344,0.00026104532],"about_ca_topic_score_codex":0.01707949,"about_ca_topic_score_gemma":0.023988958,"teacher_disagreement_score":0.01707949,"about_ca_system_score_codex":0.0015955415,"about_ca_system_score_gemma":0.0021612349,"threshold_uncertainty_score":0.04075104},"labels":[],"label_agreement":null},{"id":"W4282961702","doi":"10.18438/eblip30115","title":"Librarian-Lead Faculty Learning Communities Offer Opportunities for Collaboration","year":2022,"lang":"en","type":"article","venue":"Evidence Based Library and Information Practice","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Information literacy; Curriculum; Medical education; Literacy; Library science; Psychology; Sociology; Computer science; Pedagogy; Medicine","score_opus":0.2672568174698916,"score_gpt":0.39513025646328365,"score_spread":0.12787343899339204,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4282961702","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12191462,0.0073345113,0.11220897,0.06433418,0.0030953528,0.0025457013,0.00097078824,0.008550422,0.67904544],"genre_scores_gemma":[0.6988757,0.0027439645,0.08517731,0.014183832,0.0020814855,0.0028362246,0.0010300819,0.0016839158,0.19138743],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.97624785,0.015286581,0.00076071406,0.0019109226,0.002942478,0.0028513845],"domain_scores_gemma":[0.95605433,0.0116804,0.0032014675,0.0050598322,0.0042536664,0.019750284],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.012067818,0.0010064255,0.0007903602,0.0043009925,0.014522552,0.013948134,0.004063494,0.0044674277,0.08221345],"category_scores_gemma":[0.024292497,0.0011831467,0.0011932203,0.0031646113,0.0043146857,0.017234175,0.043542985,0.003124287,0.027518485],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025945433,0.0020678707,0.014959413,0.0012690951,0.00014477197,0.0038321926,0.0981017,0.00039293477,0.001561916,0.050166443,0.22504458,0.6021996],"study_design_scores_gemma":[0.00014582461,0.0002950664,0.0032890963,0.00053486216,0.000027548876,0.0011731246,0.045526627,0.00034843365,0.0004274178,0.026221398,0.921928,0.00008266724],"about_ca_topic_score_codex":0.0008254762,"about_ca_topic_score_gemma":0.0046184678,"teacher_disagreement_score":0.08221345,"about_ca_system_score_codex":0.0023723026,"about_ca_system_score_gemma":0.008334844,"threshold_uncertainty_score":0.2750314},"labels":[],"label_agreement":null},{"id":"W4283449126","doi":"10.1145/3530190.3534829","title":"Note: Leveraging Artificial Intelligence to build a Data Catalog and support research on the Sustainable Development Goals","year":2022,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University; Western University; Université de Montréal","funders":"","keywords":"Metadata; Computer science; Prosperity; Sustainable development; Data science; Sustainability; Big data; World Wide Web; Political science; Data mining","score_opus":0.6059346502404944,"score_gpt":0.5244392208282098,"score_spread":0.0814954294122846,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4283449126","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008109024,0.002503253,0.77203125,0.05028227,0.0032871612,0.0030260836,0.067710735,0.021875601,0.071174584],"genre_scores_gemma":[0.02288573,0.0014740524,0.9014318,0.0028920718,0.00062000507,0.00090010226,0.05823305,0.0018483207,0.009714961],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9857013,0.0039006379,0.003004995,0.0021525011,0.004693039,0.0005475749],"domain_scores_gemma":[0.89708453,0.031026464,0.0046489467,0.044792857,0.019316202,0.0031309829],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.028781228,0.00085552596,0.00089841604,0.020174608,0.003874743,0.01455043,0.0034971882,0.0021827049,0.023075126],"category_scores_gemma":[0.07603664,0.0012010885,0.0016207781,0.029107632,0.0034396725,0.025870671,0.012601486,0.0044473787,0.019334568],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00016380833,0.00015942745,0.013419454,0.0010754447,0.00010375556,0.00037148606,0.0019502076,0.0023065095,0.0029677066,0.20636891,0.41374725,0.35736606],"study_design_scores_gemma":[0.0000364575,0.00003263003,0.0029588554,0.0004002569,0.000035809644,0.00028285471,0.00065461954,0.0049091014,0.001976614,0.07474088,0.91389006,0.00008188323],"about_ca_topic_score_codex":0.012609237,"about_ca_topic_score_gemma":0.021254618,"teacher_disagreement_score":0.028781228,"about_ca_system_score_codex":0.0023470593,"about_ca_system_score_gemma":0.012071645,"threshold_uncertainty_score":0.15221149},"labels":[],"label_agreement":null},{"id":"W4283574083","doi":"10.1016/j.jclinepi.2022.06.006","title":"Record linkage and big data—enhancing information and improving design","year":2022,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba; Manitoba Health","funders":"Canadian Institutes of Health Research","keywords":"Linkage (software); Record linkage; Computer science; Data science; Observational study; Population; Value (mathematics); Data mining; Medicine; Statistics; Mathematics; Environmental health; Biology","score_opus":0.7736697826487204,"score_gpt":0.5786307282052613,"score_spread":0.19503905444345915,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4283574083","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.036934312,0.016206,0.8348786,0.09551904,0.0021612484,0.0018780156,0.0021359082,0.0036134366,0.0066734185],"genre_scores_gemma":[0.20507845,0.0054697385,0.7748575,0.008197725,0.0019123853,0.0015073107,0.0015457766,0.0004242794,0.0010068878],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.75467473,0.19677581,0.015594789,0.008849694,0.022683814,0.0014211657],"domain_scores_gemma":[0.21950422,0.646808,0.026992425,0.073332675,0.029694237,0.003668371],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.21135083,0.0015768327,0.003684016,0.0063355886,0.0020778608,0.017074943,0.006269911,0.0044703465,0.004695209],"category_scores_gemma":[0.56316185,0.0026092601,0.0028867302,0.009719012,0.0034549632,0.031824347,0.010208953,0.0067466195,0.0012518883],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019888128,0.0011212628,0.062850766,0.006435574,0.0029035718,0.0001521923,0.0035790424,0.012866213,0.0022211624,0.089578964,0.030357007,0.7859453],"study_design_scores_gemma":[0.002153742,0.0018524675,0.020724328,0.004806265,0.0039065713,0.00066367135,0.0031932965,0.13648799,0.015073862,0.71049714,0.09996305,0.00067765877],"about_ca_topic_score_codex":0.002391178,"about_ca_topic_score_gemma":0.002612312,"teacher_disagreement_score":0.7886492,"about_ca_system_score_codex":0.0033164744,"about_ca_system_score_gemma":0.0131299,"threshold_uncertainty_score":0.97254485},"labels":[],"label_agreement":null},{"id":"W4283831618","doi":"10.21083/partnership.v17i1.6779","title":"Practices Before Policy: Research Data Management Behaviours in Canada","year":2022,"lang":"en","type":"article","venue":"Partnership The Canadian Journal of Library and Information Practice and Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":true,"route_about_ca":true,"ca_institutions":"Okanagan University College; University of British Columbia, Okanagan Campus; Western University; University of Toronto; University of British Columbia; Queen's University; University of Ottawa","funders":"Social Sciences and Humanities Research Council of Canada; Canadian Institutes of Health Research","keywords":"RDM; Data management plan; Multidisciplinary approach; Agency (philosophy); Data management; Funding Agency; Knowledge management; Service (business); Survey data collection; Science policy; Data science; Public relations; Political science; Business; Computer science; Sociology; Marketing; Public administration; Social science; Database","score_opus":0.45755055852737964,"score_gpt":0.5160546254667507,"score_spread":0.0585040669393711,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4283831618","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9242525,0.0031475928,0.0014229561,0.04653868,0.000088376815,0.00050524826,0.0021416256,0.00012469145,0.021778412],"genre_scores_gemma":[0.98368734,0.0031495944,0.0021575156,0.0050780107,0.000022604292,0.0001881308,0.0005487639,0.0000444915,0.0051236544],"study_design_codex":"qualitative","study_design_gemma":"observational","domain_scores_codex":[0.9470722,0.014134491,0.006109138,0.004009538,0.020571096,0.008103464],"domain_scores_gemma":[0.83000714,0.069589294,0.022036565,0.007959591,0.042687263,0.027720233],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.045757405,0.00026835618,0.0008278645,0.005127539,0.02067045,0.012588617,0.0038231942,0.0018434101,0.0033703218],"category_scores_gemma":[0.11539704,0.00097560836,0.0006587872,0.020079007,0.010488195,0.004527166,0.007912032,0.0029265843,0.00030179892],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":true,"study_design_scores_codex":[0.00030671767,0.00033250594,0.41858155,0.001033317,0.00012004584,0.00083371776,0.43092346,0.0005143216,0.0013929938,0.013417685,0.014054634,0.11848911],"study_design_scores_gemma":[0.000049860657,0.00016563085,0.4001742,0.0008865212,0.000056445348,0.00022990245,0.4892641,0.0008874534,0.0010137869,0.0015911353,0.10541723,0.00026371735],"about_ca_topic_score_codex":0.98831046,"about_ca_topic_score_gemma":0.98767984,"teacher_disagreement_score":0.9961768,"about_ca_system_score_codex":0.1864961,"about_ca_system_score_gemma":0.411481,"threshold_uncertainty_score":0.9435492},"labels":[],"label_agreement":null},{"id":"W4285178284","doi":"10.18653/v1/2022.deelio-1","title":"Proceedings of Deep Learning Inside Out (DeeLIO 2022): The 3rd Workshop on Knowledge Extraction and Integration for Deep Learning Architectures","year":2022,"lang":"en","type":"paratext","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":20,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"Institute for Information and Communications Technology Promotion; Ministry of Science and ICT, South Korea; National Research Foundation of Korea; National Research Foundation","keywords":"Deep learning; Artificial intelligence; Computer science; Extraction (chemistry); Machine learning; Chemistry","score_opus":0.10579495292610251,"score_gpt":0.40898478142943545,"score_spread":0.3031898285033329,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4285178284","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.03409105,0.023805145,0.8576333,0.018360808,0.0103205135,0.0008206402,0.010257113,0.008208746,0.036502738],"genre_scores_gemma":[0.14512092,0.013571988,0.61800593,0.0045268703,0.0032549154,0.0016999245,0.0458881,0.0053140125,0.16261733],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9971071,0.0013322459,0.00017238651,0.00057194143,0.0005393281,0.0002771271],"domain_scores_gemma":[0.99332905,0.0032437486,0.00012956612,0.0013121429,0.0013147559,0.0006707308],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010774963,0.0025870206,0.002510237,0.0016043213,0.00093549816,0.0048389323,0.00391572,0.003171784,0.020608343],"category_scores_gemma":[0.011057592,0.0013084045,0.001528516,0.0014676466,0.0013974294,0.006249001,0.0055518355,0.0057753734,0.0069191125],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008071731,0.00097029866,0.0007930091,0.0005103063,0.00043952797,0.0003057201,0.00035442342,0.023532182,0.004101967,0.01352032,0.2715959,0.6830692],"study_design_scores_gemma":[0.00036157083,0.00056796666,0.003495601,0.00063027535,0.00027747525,0.0003338627,0.0004106742,0.42317507,0.019509926,0.10231938,0.44875637,0.00016184396],"about_ca_topic_score_codex":0.013346744,"about_ca_topic_score_gemma":0.023131125,"teacher_disagreement_score":0.020608343,"about_ca_system_score_codex":0.003527794,"about_ca_system_score_gemma":0.0042731087,"threshold_uncertainty_score":0.06894177},"labels":[],"label_agreement":null},{"id":"W4285325594","doi":"10.1109/hpcc-dss-smartcity-dependsys53884.2021.00025","title":"Message from the DIKW 2021 General Chairs","year":2021,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Regina","funders":"Zayed University; Southern Methodist University; Nihon University","keywords":"Computer science; Telecommunications; Library science; Computer security; Operations research; Engineering","score_opus":0.18359957351730186,"score_gpt":0.40852648183886836,"score_spread":0.2249269083215665,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4285325594","genre_codex":"commentary","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0006728785,0.0020804778,0.00066309253,0.71068084,0.26695743,0.0001335404,0.001262414,0.00027507535,0.017274236],"genre_scores_gemma":[0.00980524,0.0020671473,0.0012288912,0.63033074,0.06608209,0.00051520497,0.0016590435,0.0005041306,0.2878075],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99539006,0.0008839986,0.00019851708,0.0005924128,0.0021222704,0.00081278203],"domain_scores_gemma":[0.9811606,0.001324845,0.00048551438,0.0005667054,0.00873299,0.0077293976],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007752672,0.0010415695,0.00093084626,0.0007568417,0.0034576945,0.006662074,0.0014828701,0.008391172,0.061824284],"category_scores_gemma":[0.02131635,0.0005111093,0.0008074278,0.00070985913,0.00095564633,0.0031478729,0.0043554576,0.018266557,0.055988003],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000019886418,0.000006864623,0.000054025244,0.000014648803,0.0000010456041,0.000015568236,0.000015496882,0.000005431296,0.000038257283,0.0002773305,0.99808335,0.0014681418],"study_design_scores_gemma":[0.000017332844,0.000020047324,0.0006031401,0.000058180056,0.0000032732225,0.000049735758,0.00025049207,0.000042219857,0.00010995829,0.00046818075,0.9983606,0.00001678093],"about_ca_topic_score_codex":0.0062973276,"about_ca_topic_score_gemma":0.010162902,"teacher_disagreement_score":0.061824284,"about_ca_system_score_codex":0.003646219,"about_ca_system_score_gemma":0.008466781,"threshold_uncertainty_score":0.20682287},"labels":[],"label_agreement":null},{"id":"W4285335450","doi":"10.14778/3494124.3494149","title":"Ember","year":2021,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Joins; Schema (genetic algorithms); Context (archaeology); Code (set theory); Information retrieval; Theoretical computer science; Artificial intelligence; Programming language","score_opus":0.14569448175843022,"score_gpt":0.38625044455308555,"score_spread":0.24055596279465533,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4285335450","genre_codex":"software","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.004436628,0.0011767813,0.3334717,0.0023189273,0.0010292926,0.0007672585,0.059703633,0.48294666,0.11414911],"genre_scores_gemma":[0.05525114,0.0017935757,0.3960297,0.0034340778,0.000576931,0.0012961315,0.2602469,0.07820662,0.20316488],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9968394,0.0004563312,0.00028203416,0.00093134365,0.0012310536,0.00025986688],"domain_scores_gemma":[0.99337196,0.0012475577,0.0002680411,0.0036941748,0.0010322666,0.00038606662],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0034408106,0.0018048898,0.0011420785,0.002454439,0.0009337822,0.0047387206,0.004336457,0.0019047309,0.17387053],"category_scores_gemma":[0.014936291,0.0013457085,0.0015037619,0.0022514402,0.0008296848,0.0096372655,0.0075410786,0.002998531,0.1854739],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004884751,0.00016516085,0.001516293,0.00079568214,0.00009612227,0.00023641996,0.00037447797,0.0019327546,0.0057805404,0.033133537,0.67034644,0.28513417],"study_design_scores_gemma":[0.0000941572,0.000087527194,0.00097437965,0.00012576421,0.000031765343,0.00033528547,0.00009984496,0.014804937,0.009047331,0.030308118,0.944025,0.000065955486],"about_ca_topic_score_codex":0.0020466002,"about_ca_topic_score_gemma":0.0032870409,"teacher_disagreement_score":0.82612944,"about_ca_system_score_codex":0.00096914003,"about_ca_system_score_gemma":0.0019141985,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W4285582215","doi":"10.15868/socialsector.40379","title":"The Data Assembly: The Responsible Data Re-Use Framework","year":2020,"lang":"en","type":"report","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Mount Allison University","funders":"Henry Luce Foundation","keywords":"Computer science","score_opus":0.8301770159171185,"score_gpt":0.5768168267993399,"score_spread":0.2533601891177786,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4285582215","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0010564837,0.00048843416,0.9360727,0.009009538,0.00054210634,0.00164374,0.012271623,0.024570383,0.014344971],"genre_scores_gemma":[0.017764118,0.0005016516,0.9193107,0.0024434433,0.00033049146,0.0019550147,0.03408733,0.01284522,0.01076203],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.90132314,0.054658543,0.009040062,0.008329232,0.023107847,0.003541095],"domain_scores_gemma":[0.8293993,0.04061883,0.007217169,0.07733461,0.0392514,0.0061787437],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.13470998,0.0022866346,0.0023321374,0.009928208,0.0044477503,0.016554931,0.008931884,0.0051748673,0.015412261],"category_scores_gemma":[0.15707135,0.0027781297,0.0031773474,0.008461283,0.0049548526,0.015558891,0.017961608,0.008903099,0.022242611],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003164468,0.00021493636,0.0064031826,0.00072122354,0.00031273815,0.00031010222,0.0024531551,0.0066003553,0.003929987,0.28413087,0.44591618,0.24869087],"study_design_scores_gemma":[0.00009332759,0.000054328844,0.0027194454,0.0006871744,0.00008860786,0.00020815633,0.0005583815,0.020648131,0.0063033267,0.11731557,0.8511558,0.00016765276],"about_ca_topic_score_codex":0.037032127,"about_ca_topic_score_gemma":0.020874886,"teacher_disagreement_score":0.13470998,"about_ca_system_score_codex":0.0068276594,"about_ca_system_score_gemma":0.039635826,"threshold_uncertainty_score":0.71242297},"labels":[],"label_agreement":null},{"id":"W4287455910","doi":"10.1007/978-3-031-12670-3_17","title":"Discovery of Keys for Graphs","year":2022,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Computer science; Data deduplication; Theoretical computer science; Key (lock); Graph; Modular decomposition; Object (grammar); Pathwidth; Artificial intelligence; Computer security; Line graph","score_opus":0.09635541844843103,"score_gpt":0.35710321165896763,"score_spread":0.2607477932105366,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4287455910","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.037497666,0.0021487367,0.9031263,0.0036170464,0.00059600646,0.00047529285,0.0050178384,0.0046149306,0.042906243],"genre_scores_gemma":[0.29000372,0.0033015783,0.6479608,0.0010988093,0.0003971584,0.0005208951,0.0116479695,0.0030158642,0.042053204],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9973564,0.00045609483,0.0002156931,0.00091170473,0.00076068053,0.00029949078],"domain_scores_gemma":[0.9883266,0.006350291,0.00045367642,0.0036407681,0.0008352117,0.00039343495],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0014461261,0.0015394225,0.0016178349,0.003596585,0.001964137,0.0054479004,0.0029622654,0.002165211,0.017724473],"category_scores_gemma":[0.01744394,0.001626762,0.0030730169,0.004553392,0.0026843243,0.020209985,0.0068346504,0.004681129,0.0083591575],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017586886,0.000074640906,0.0011368021,0.00080927764,0.00009797347,0.00033839906,0.00090099795,0.004600849,0.006282797,0.77490324,0.04242071,0.16825856],"study_design_scores_gemma":[0.000015059856,0.000016165082,0.00016869836,0.00008392364,0.00003918707,0.00021330535,0.00017631735,0.011023005,0.0024689818,0.9655722,0.02020163,0.00002162399],"about_ca_topic_score_codex":0.0014147438,"about_ca_topic_score_gemma":0.002110508,"teacher_disagreement_score":0.017724473,"about_ca_system_score_codex":0.0018351785,"about_ca_system_score_gemma":0.0014264461,"threshold_uncertainty_score":0.059294283},"labels":[],"label_agreement":null},{"id":"W4287901858","doi":"10.5281/zenodo.3611327","title":"CESSDA ERIC Persistent Identifier Policy 2019","year":2020,"lang":"en","type":"report","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Identifier; Genealogy; Computer science; History; Programming language","score_opus":0.291310094241864,"score_gpt":0.3978849953402161,"score_spread":0.1065749010983521,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4287901858","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.001495785,0.0018440208,0.024780566,0.022113238,0.007368616,0.001705802,0.09928653,0.022390712,0.8190148],"genre_scores_gemma":[0.007623328,0.0022645225,0.01981801,0.010031346,0.00096086843,0.0022753952,0.110060096,0.00801865,0.8389478],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.97160184,0.0044223787,0.0027178507,0.0017032597,0.017432455,0.002122324],"domain_scores_gemma":[0.9488516,0.008193172,0.0021530488,0.009317951,0.029404176,0.0020800717],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.025726285,0.0009830071,0.0016698352,0.0056021176,0.0033417412,0.017275743,0.0047710636,0.010920029,0.2781619],"category_scores_gemma":[0.07245338,0.0014614377,0.0013007567,0.009344389,0.0020158966,0.012861041,0.0056328713,0.00592439,0.416774],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00007939025,0.000031804244,0.00022861546,0.00015299267,0.000004905884,0.000051734965,0.00010051864,0.00013910493,0.00020467391,0.03702471,0.9451396,0.016841983],"study_design_scores_gemma":[0.00001046484,0.0000066181183,0.00012283711,0.000082065446,0.000001965721,0.000022968688,0.000031128337,0.000062015286,0.0001390803,0.0016258066,0.9978849,0.000010033952],"about_ca_topic_score_codex":0.043926477,"about_ca_topic_score_gemma":0.02467347,"teacher_disagreement_score":0.98272425,"about_ca_system_score_codex":0.0118519645,"about_ca_system_score_gemma":0.03334371,"threshold_uncertainty_score":0.9305443},"labels":[],"label_agreement":null},{"id":"W4288088430","doi":"","title":"Data Interoperability Assessment Towards the Resilience of Data Exchange Systems","year":2019,"lang":"fr","type":"preprint","venue":"HAL (Le Centre pour la Communication Scientifique Directe)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Berger (Canada)","funders":"","keywords":"Interoperability; Computer science; Resilience (materials science); Data exchange; Semantic interoperability; Data science; Database; World Wide Web","score_opus":0.2178816663540311,"score_gpt":0.39189918402393886,"score_spread":0.17401751766990775,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4288088430","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.38255638,0.0011344845,0.5896346,0.0034390355,0.00015801316,0.00035741436,0.0006750854,0.00085385353,0.021191118],"genre_scores_gemma":[0.97072226,0.00023279994,0.027423164,0.00008466918,0.000047421057,0.000087620014,0.00030190285,0.00006664661,0.0010335105],"study_design_codex":"simulation_or_modeling","study_design_gemma":"not_applicable","domain_scores_codex":[0.9941043,0.0025206544,0.0003676283,0.0006529086,0.0017585881,0.0005958774],"domain_scores_gemma":[0.97102374,0.017116496,0.0024230904,0.0038907435,0.004750997,0.0007948345],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008360431,0.00078600587,0.0006246807,0.004422863,0.0009153312,0.004233796,0.0010419164,0.0015936004,0.004311348],"category_scores_gemma":[0.04174965,0.0003213563,0.00090795447,0.0026458902,0.0019553832,0.0053537856,0.0039078384,0.001461375,0.0003843749],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010552012,0.00026070443,0.03860161,0.00066532166,0.00034062294,0.000614683,0.0012876507,0.53248364,0.020238938,0.24763826,0.0025437817,0.15426955],"study_design_scores_gemma":[0.00002109982,0.00020795403,0.0064615156,0.0002024481,0.00017280273,0.00018957288,0.00086244097,0.8517075,0.017057365,0.118549705,0.0045306003,0.0000369147],"about_ca_topic_score_codex":0.0016997061,"about_ca_topic_score_gemma":0.0006193063,"teacher_disagreement_score":0.008360431,"about_ca_system_score_codex":0.001741341,"about_ca_system_score_gemma":0.0013658818,"threshold_uncertainty_score":0.044214725},"labels":[],"label_agreement":null},{"id":"W4288870185","doi":"10.1007/978-3-031-01865-7_7","title":"Profiling Non-Relational Data","year":2019,"lang":"en","type":"book-chapter","venue":"Synthesis lectures on data management","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Profiling (computer programming); Computer science; Relational database; XML; Big data; Data type; Data science; Data mining; World Wide Web; Programming language","score_opus":0.38729458902149144,"score_gpt":0.40962350864797265,"score_spread":0.022328919626481203,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4288870185","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0063062957,0.00558653,0.90279704,0.0027023123,0.0008379847,0.00012588048,0.00227132,0.0051701064,0.07420251],"genre_scores_gemma":[0.107387826,0.008717021,0.6827199,0.0014144671,0.00072993507,0.00023243483,0.009139308,0.0033187824,0.18634035],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9975483,0.0003479526,0.00013058561,0.0005075237,0.0013455538,0.00012007621],"domain_scores_gemma":[0.99654776,0.0014225207,0.0001275467,0.0012813051,0.0005111482,0.00010963696],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0027292129,0.00087807793,0.0007222851,0.0025989162,0.0007024418,0.006059555,0.0018190658,0.0007325292,0.018374551],"category_scores_gemma":[0.008541511,0.00081448036,0.00061101554,0.004484198,0.00088209356,0.010766768,0.0028118507,0.0017585761,0.011679797],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000059479724,0.000059219932,0.0012933076,0.00036400568,0.000034466007,0.00012365279,0.00052547397,0.0038804337,0.009500325,0.21993534,0.06769543,0.69652885],"study_design_scores_gemma":[0.0000074729314,0.000037122885,0.0017600163,0.00033764186,0.00003137909,0.0006459926,0.00040213682,0.040969193,0.02413295,0.39971173,0.5319034,0.00006098714],"about_ca_topic_score_codex":0.0008043583,"about_ca_topic_score_gemma":0.0016494179,"teacher_disagreement_score":0.018374551,"about_ca_system_score_codex":0.0010596799,"about_ca_system_score_gemma":0.00083838834,"threshold_uncertainty_score":0.06146902},"labels":[],"label_agreement":null},{"id":"W4288917651","doi":"10.1007/978-3-031-01865-7_8","title":"Data Profiling Tools","year":2019,"lang":"en","type":"book-chapter","venue":"Synthesis lectures on data management","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Profiling (computer programming); Computer science; Visualization; Data science; Data mining; Operating system","score_opus":0.4881953596693671,"score_gpt":0.4276409553592674,"score_spread":0.06055440431009973,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4288917651","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0012519144,0.0021737602,0.7588921,0.002243657,0.0012214902,0.00038224063,0.013113522,0.06314607,0.1575753],"genre_scores_gemma":[0.018824525,0.0040334994,0.5919562,0.0025969243,0.00066157116,0.000679554,0.03641801,0.019039378,0.32579035],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9981504,0.0002586443,0.00019342119,0.00037598534,0.0009087806,0.00011260734],"domain_scores_gemma":[0.99657,0.0012084905,0.00013665133,0.0011613199,0.00071984413,0.00020374898],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0026942792,0.00186947,0.00090748485,0.0054147243,0.0010826658,0.006754798,0.0022904626,0.0010414514,0.08913841],"category_scores_gemma":[0.008739182,0.0013527245,0.0012296746,0.005773783,0.0006760074,0.008732699,0.0044622687,0.002941071,0.084361866],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006058798,0.000054110533,0.00045169948,0.00040124942,0.000026078154,0.000110407585,0.00031117076,0.0009394155,0.0030475578,0.10063206,0.37175524,0.5222105],"study_design_scores_gemma":[0.000008365812,0.000009193096,0.000252378,0.0001932956,0.000013051677,0.00021683844,0.000078447745,0.0034961912,0.004085098,0.051969863,0.9396511,0.000026334204],"about_ca_topic_score_codex":0.0012196318,"about_ca_topic_score_gemma":0.0015880112,"teacher_disagreement_score":0.08913841,"about_ca_system_score_codex":0.00097611727,"about_ca_system_score_gemma":0.001477637,"threshold_uncertainty_score":0.29819775},"labels":[],"label_agreement":null},{"id":"W4289533864","doi":"10.1109/icde53745.2022.00248","title":"Effective Explanations for Entity Resolution Models","year":2022,"lang":"en","type":"article","venue":"2022 IEEE 38th International Conference on Data Engineering (ICDE)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":16,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"Science for Equity, Empowerment and Development Division","keywords":"Computer science; Counterfactual thinking; Trustworthiness; Probabilistic logic; Classifier (UML); Artificial intelligence; Machine learning; Task (project management); Resolution (logic); Matching (statistics); Data mining","score_opus":0.41086171946325595,"score_gpt":0.4345066269760401,"score_spread":0.02364490751278414,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4289533864","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.03685259,0.0010701391,0.95368373,0.0027254994,0.00008990629,0.00012890276,0.001580708,0.0024049159,0.0014635328],"genre_scores_gemma":[0.6712423,0.0006730957,0.3209539,0.0005646163,0.00020837557,0.0002197986,0.0044467426,0.00017253504,0.0015186814],"study_design_codex":"simulation_or_modeling","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9961817,0.0015148284,0.00032027214,0.0007872448,0.0010203525,0.00017560045],"domain_scores_gemma":[0.9759281,0.017492244,0.0019098241,0.0024660856,0.0018355025,0.0003681565],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0038520815,0.001227076,0.00087019574,0.0033432662,0.0007684335,0.0019646848,0.0025439505,0.0022617283,0.0043790443],"category_scores_gemma":[0.041900802,0.0005108441,0.001279252,0.0023572484,0.0012104132,0.005625619,0.002724182,0.0029501335,0.0006127456],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00052201946,0.0002442357,0.01563696,0.00078144355,0.00027662155,0.0007241177,0.0012410335,0.4515211,0.0024137911,0.19349942,0.018145896,0.31499335],"study_design_scores_gemma":[0.000033314536,0.000030265728,0.00069285126,0.00005211551,0.000039703802,0.00009830338,0.00009103324,0.87328774,0.0010180199,0.12181946,0.0028186466,0.000018581133],"about_ca_topic_score_codex":0.003759314,"about_ca_topic_score_gemma":0.0065759644,"teacher_disagreement_score":0.0043790443,"about_ca_system_score_codex":0.0019331549,"about_ca_system_score_gemma":0.0014306592,"threshold_uncertainty_score":0.020372033},"labels":[],"label_agreement":null},{"id":"W4292572073","doi":"10.48550/arxiv.1312.7373","title":"Extending Contexts with Ontologies for Multidimensional Data Quality\\n Assessment","year":2013,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"","keywords":"Computer science; Datalog; Context (archaeology); Quality (philosophy); Data quality; Quality assessment; Information retrieval; Database; Data mining; Data science; Evaluation methods; Engineering","score_opus":0.6327342795842864,"score_gpt":0.39462611012385806,"score_spread":0.23810816946042834,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4292572073","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006706195,0.00071635965,0.9875508,0.0011546,0.00007236949,0.00012652666,0.00021026356,0.0005969487,0.0028659129],"genre_scores_gemma":[0.15709849,0.0010662164,0.83933157,0.00048528225,0.00011908424,0.00024211053,0.000414223,0.00019222859,0.0010507428],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9798558,0.009067569,0.0028162843,0.0029242386,0.004528672,0.00080754486],"domain_scores_gemma":[0.97580314,0.010826374,0.0022550076,0.007296462,0.0029623343,0.0008567463],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.014065836,0.0011568355,0.0009774752,0.005694867,0.0020622096,0.0077671595,0.0025464273,0.0021294025,0.001696543],"category_scores_gemma":[0.031070502,0.0010867749,0.0030311432,0.005246327,0.004479815,0.019208781,0.011226237,0.0035109713,0.0004012182],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00007039957,0.00008453574,0.005058397,0.0004944556,0.00014829864,0.00064325845,0.00378306,0.016731488,0.0029348505,0.87190604,0.0026207266,0.09552451],"study_design_scores_gemma":[0.00003211362,0.000055836277,0.0014665446,0.00047257278,0.00017521266,0.00058748224,0.0014903626,0.0949835,0.0054839505,0.814389,0.08073599,0.0001275498],"about_ca_topic_score_codex":0.006726168,"about_ca_topic_score_gemma":0.007330106,"teacher_disagreement_score":0.014065836,"about_ca_system_score_codex":0.002039872,"about_ca_system_score_gemma":0.00254236,"threshold_uncertainty_score":0.07438815},"labels":[],"label_agreement":null},{"id":"W4292735752","doi":"10.5281/zenodo.6111560","title":"Research Data Canada's 2013 Infrastructure Report","year":2013,"lang":"en","type":"report","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"Université Laval","keywords":"Data science; Computer science; Business","score_opus":0.3393149948349254,"score_gpt":0.4226062867898235,"score_spread":0.0832912919548981,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4292735752","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0025492632,0.0046206163,0.0057713706,0.0370011,0.0042649414,0.0021468913,0.6230921,0.0060066474,0.31454706],"genre_scores_gemma":[0.016208006,0.009286298,0.026014194,0.011793218,0.0005490028,0.0019146389,0.5539854,0.0019946191,0.37825477],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.93203765,0.001914069,0.001862767,0.00197912,0.05659672,0.005609702],"domain_scores_gemma":[0.8799668,0.004526679,0.0019787631,0.0037260663,0.09968607,0.010115698],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.024601242,0.0015004756,0.0015053228,0.014857185,0.010753683,0.019190814,0.0056772064,0.0037249222,0.0383593],"category_scores_gemma":[0.05842223,0.0021983907,0.0020208545,0.026375497,0.0022328226,0.0040862337,0.005250865,0.005683269,0.024159206],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":true,"study_design_scores_codex":[0.000038136146,0.000028219738,0.0011670061,0.000217616,0.000018218643,0.00006364914,0.00015545862,0.00028898777,0.0001759485,0.014227488,0.9707502,0.012869072],"study_design_scores_gemma":[0.0000119460765,0.000007472955,0.0031914162,0.00013964974,0.0000122411775,0.000016757002,0.00020530353,0.0001575258,0.0003022634,0.00047785172,0.99543875,0.000038896895],"about_ca_topic_score_codex":0.9891072,"about_ca_topic_score_gemma":0.9852556,"teacher_disagreement_score":0.9943228,"about_ca_system_score_codex":0.17709395,"about_ca_system_score_gemma":0.5701597,"threshold_uncertainty_score":0.95445436},"labels":[],"label_agreement":null},{"id":"W4293162521","doi":"10.1007/978-3-031-01865-7","title":"Data Profiling","year":2019,"lang":"en","type":"book","venue":"Synthesis lectures on data management","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":31,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Profiling (computer programming); Metadata; Computer science; Data science; Research data; World Wide Web; Data curation; Operating system","score_opus":0.4345880521667448,"score_gpt":0.4454418407113966,"score_spread":0.010853788544651799,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4293162521","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0016718387,0.0042149797,0.54383636,0.005721062,0.0041552936,0.0005056391,0.00816022,0.020313011,0.4114216],"genre_scores_gemma":[0.021372955,0.0046740347,0.20286994,0.003094672,0.0014435337,0.00036206032,0.013134953,0.0064076157,0.74664026],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99833256,0.00022982007,0.00012126361,0.00041040327,0.0008071041,0.00009879679],"domain_scores_gemma":[0.99736017,0.0005840572,0.000091507354,0.0011097747,0.0006927178,0.00016180122],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019771568,0.0013939556,0.00087479356,0.0032153302,0.0012920315,0.005779337,0.0014327876,0.0008742923,0.10738497],"category_scores_gemma":[0.007005809,0.00093418884,0.0009055509,0.0041174833,0.0006849014,0.007572649,0.003806139,0.0022221177,0.10393819],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006758508,0.00002960635,0.0002584284,0.00020188527,0.000012433924,0.000057720994,0.0001284623,0.0008207094,0.0025139384,0.07984988,0.38066104,0.5353983],"study_design_scores_gemma":[0.0000043483,0.000010216455,0.00020970234,0.00010463435,0.000007887666,0.00019130817,0.000053747444,0.00239657,0.002767274,0.038976494,0.9552615,0.000016326703],"about_ca_topic_score_codex":0.0011866377,"about_ca_topic_score_gemma":0.0014982105,"teacher_disagreement_score":0.10738497,"about_ca_system_score_codex":0.0011474584,"about_ca_system_score_gemma":0.0015442468,"threshold_uncertainty_score":0.35923856},"labels":[],"label_agreement":null},{"id":"W4293242898","doi":"10.23889/ijpds.v7i3.2105","title":"Public Engagement and other Essential Requirements for Data Trusts, Data Repositories and Other Data Collaborations.","year":2022,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of New Brunswick; University of British Columbia; University of Toronto","funders":"","keywords":"Stakeholder engagement; Data governance; Documentation; Stewardship (theology); Stakeholder; Data management; Corporate governance; Directive; Public engagement; Public consultation; Test (biology); Computer science; Business; Political science; Engineering; Data quality; Public relations; Operations management; Database; Finance; Law","score_opus":0.6550036183699004,"score_gpt":0.5352410799770353,"score_spread":0.1197625383928651,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4293242898","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.19239517,0.0029560241,0.41582915,0.0704114,0.002161333,0.017946582,0.013777147,0.004079286,0.28044403],"genre_scores_gemma":[0.55783576,0.0010498948,0.36258873,0.013210551,0.00035260065,0.009711871,0.02191291,0.00097377045,0.032363977],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.74725217,0.09107266,0.037304506,0.008805134,0.09571259,0.019852895],"domain_scores_gemma":[0.566085,0.10478608,0.030697953,0.06473448,0.21924496,0.014451588],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.1483387,0.0014110855,0.0010623124,0.0045596943,0.0086025,0.012608025,0.005192828,0.0058219773,0.006853972],"category_scores_gemma":[0.20308845,0.0019988813,0.0026653681,0.0034017977,0.0076253153,0.011717512,0.009685481,0.006177356,0.0024935994],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005180916,0.0008922807,0.08170016,0.0050819414,0.00027561374,0.0017991987,0.033671103,0.010333691,0.022043444,0.4652245,0.15007077,0.22838934],"study_design_scores_gemma":[0.00019477554,0.0008474768,0.0458297,0.0046406863,0.00019839415,0.0016203488,0.025649797,0.0067984485,0.017125614,0.05970486,0.8369687,0.00042114474],"about_ca_topic_score_codex":0.14307207,"about_ca_topic_score_gemma":0.15499307,"teacher_disagreement_score":0.98739195,"about_ca_system_score_codex":0.022423241,"about_ca_system_score_gemma":0.11954378,"threshold_uncertainty_score":0.7844994},"labels":[],"label_agreement":null},{"id":"W4293243715","doi":"10.23889/ijpds.v7i3.2077","title":"Analysing Siamese Neural Network Architectures for Computing Name Similarity.","year":2022,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Similarity (geometry); Computer science; Classifier (UML); False positive paradox; Artificial intelligence; String metric; Artificial neural network; Random forest; Similitude; False positives and false negatives; Set (abstract data type); Machine learning; Pattern recognition (psychology); Data mining; String searching algorithm; Pattern matching","score_opus":0.2782177487324201,"score_gpt":0.5106037761682547,"score_spread":0.23238602743583459,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4293243715","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5511438,0.0018632137,0.4357111,0.002026601,0.00024217414,0.00021566935,0.0005263764,0.0013384429,0.0069326474],"genre_scores_gemma":[0.9144423,0.00037206567,0.0800181,0.0002050795,0.00009136471,0.00011773176,0.0008782903,0.000049842212,0.0038251665],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99933344,0.00020271585,0.00004249569,0.00013676028,0.00020249558,0.00008205707],"domain_scores_gemma":[0.99466467,0.0030563348,0.00040678965,0.00035649328,0.0013516778,0.00016399182],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0036466173,0.00068670424,0.0004978708,0.0015710987,0.0005392871,0.0010447367,0.0011265428,0.0009835815,0.0023680269],"category_scores_gemma":[0.010913331,0.00027844956,0.00059828063,0.0009518068,0.0005225866,0.0016947194,0.00068696967,0.001192555,0.00048714963],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018980098,0.00013316346,0.01367384,0.00006390252,0.0001065717,0.000109783236,0.0000842105,0.86013055,0.0018183877,0.010306201,0.0024109303,0.1109727],"study_design_scores_gemma":[0.000001837637,0.000012454421,0.00039482163,0.0000025063728,0.0000034442587,0.00000847992,0.0000066407174,0.99702734,0.00025474114,0.0021991108,0.000086213375,0.0000023601192],"about_ca_topic_score_codex":0.017878404,"about_ca_topic_score_gemma":0.018637132,"teacher_disagreement_score":0.017878404,"about_ca_system_score_codex":0.0019410887,"about_ca_system_score_gemma":0.001084261,"threshold_uncertainty_score":0.035548687},"labels":[],"label_agreement":null},{"id":"W4294243313","doi":"10.23889/ijpds.v7i3.1962","title":"A proposed approach for standardized reporting of data linkage processes and results.","year":2022,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Linkage (software); Record linkage; Computer science; Linked data; Population; Data science; Information retrieval; Data mining; Readability; Medicine","score_opus":0.5125041464715098,"score_gpt":0.5428579715218413,"score_spread":0.030353825050331573,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4294243313","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"reporting","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"reporting","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00096105813,0.00057558983,0.9526222,0.008163597,0.0016465138,0.016014429,0.004399814,0.004901782,0.010714985],"genre_scores_gemma":[0.0038148728,0.0003545756,0.97387457,0.0010208827,0.00022560486,0.01581821,0.0024181085,0.00040992806,0.002063188],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.47866,0.33109435,0.11389742,0.019212784,0.053690545,0.0034449613],"domain_scores_gemma":[0.44961953,0.17455024,0.04936336,0.11653949,0.20464663,0.0052807922],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3980136,0.0033771326,0.002345962,0.022424202,0.005690772,0.020603174,0.009862919,0.0068067033,0.015198923],"category_scores_gemma":[0.49723646,0.0043089353,0.0071721273,0.022188665,0.0056291413,0.016523613,0.018701565,0.010032998,0.015386696],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002677872,0.00038116466,0.005720827,0.006471943,0.0004827903,0.00053892855,0.01338379,0.00337268,0.0021918272,0.25026017,0.15993893,0.556989],"study_design_scores_gemma":[0.00030833954,0.000533744,0.0047877687,0.008702867,0.00040867605,0.0012459856,0.0038391782,0.013978021,0.0058018393,0.12209689,0.83787787,0.0004187407],"about_ca_topic_score_codex":0.009733943,"about_ca_topic_score_gemma":0.008504823,"teacher_disagreement_score":0.6019864,"about_ca_system_score_codex":0.01291607,"about_ca_system_score_gemma":0.06541384,"threshold_uncertainty_score":0.7423564},"labels":[],"label_agreement":null},{"id":"W4294243567","doi":"10.23889/ijpds.v7i3.1782","title":"Data on Patient Record Trajectory for Linkage (DataPRinT Linkage).","year":2022,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Linkage (software); Computer science; Data mining; Table (database); Key (lock); Medical diagnosis; Process (computing); Medical record; Health care; Record linkage; Information retrieval; Data science; Computer security; Medicine; Political science","score_opus":0.4308056502261164,"score_gpt":0.5122798057911399,"score_spread":0.08147415556502347,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4294243567","genre_codex":"dataset","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.019355811,0.0019983998,0.23602563,0.0054675457,0.0014486407,0.00796577,0.6859449,0.0074289935,0.034364335],"genre_scores_gemma":[0.08380283,0.0016570301,0.2850526,0.0018180979,0.00043047263,0.016730532,0.59462506,0.0014292534,0.014454176],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9591243,0.013496421,0.0075973473,0.0058372524,0.012232,0.0017127065],"domain_scores_gemma":[0.87856585,0.029080063,0.021785911,0.04287229,0.024834773,0.0028612255],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.044582713,0.001061447,0.0015840146,0.012109087,0.002451248,0.0040451274,0.0025102932,0.0018398287,0.047435243],"category_scores_gemma":[0.14712803,0.00093334226,0.0026116737,0.019611178,0.00061988534,0.004735452,0.009239126,0.0025874109,0.01800519],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012947624,0.00035167727,0.115312,0.0046473565,0.0015699515,0.00029717505,0.002747497,0.0031462489,0.0024577235,0.04546516,0.38377544,0.438935],"study_design_scores_gemma":[0.00044557717,0.00032944456,0.1239532,0.0020992858,0.00058326736,0.0006979032,0.0015010799,0.0056930003,0.00636062,0.027622817,0.8304513,0.0002624678],"about_ca_topic_score_codex":0.018491356,"about_ca_topic_score_gemma":0.0157285,"teacher_disagreement_score":0.047435243,"about_ca_system_score_codex":0.0039778636,"about_ca_system_score_gemma":0.023176216,"threshold_uncertainty_score":0.23577875},"labels":[],"label_agreement":null},{"id":"W4294834616","doi":"10.31219/osf.io/pa5fx","title":"Understanding the Challenges Associated with Finding and Accessing Restricted Data in Canada: A Mixed Methods Study","year":2022,"lang":"en","type":"preprint","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"National Research Council Canada; University of Saskatchewan; McMaster University Medical Centre; McMaster University; University of Toronto","funders":"Natural Sciences and Engineering Research Council of Canada; Canadian Institutes of Health Research","keywords":"Discoverability; Custodians; Metadata; Data access; Computer science; Documentation; Consistency (knowledge bases); Information retrieval; Data element; Data management; Data discovery; Data collection; Rubric; Data science; Data mining; World Wide Web; Database; Geography; Statistics; Mathematics","score_opus":0.7837340661535428,"score_gpt":0.5285062507486068,"score_spread":0.255227815404936,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4294834616","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9655827,0.006081881,0.0038188132,0.007851419,0.00009079983,0.0018543737,0.004920368,0.000042099222,0.009757407],"genre_scores_gemma":[0.9805526,0.0040797,0.00716459,0.0023552435,0.00003351695,0.0012909725,0.0019726492,0.00004500587,0.0025056913],"study_design_codex":"observational","study_design_gemma":"qualitative","domain_scores_codex":[0.9708828,0.0075427825,0.0026116662,0.0024310823,0.012288795,0.0042430134],"domain_scores_gemma":[0.9287448,0.026419073,0.009632664,0.003063224,0.027814591,0.0043256385],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.03992523,0.0006707269,0.0016943928,0.0070858463,0.01629539,0.010297021,0.004237666,0.001302155,0.004064177],"category_scores_gemma":[0.078421146,0.0010344317,0.0014400368,0.0155817745,0.0043678824,0.0032372861,0.0058137993,0.002042788,0.0002652781],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00033291095,0.00035662745,0.6715675,0.0026644398,0.0005122781,0.0010401711,0.24021733,0.00035754452,0.00047109948,0.0054354025,0.008271673,0.068772994],"study_design_scores_gemma":[0.000070849805,0.00018299618,0.54981756,0.00466703,0.0004618129,0.0004414378,0.40073988,0.0018913916,0.00063667784,0.0018379416,0.03894792,0.0003044222],"about_ca_topic_score_codex":0.9881463,"about_ca_topic_score_gemma":0.99132204,"teacher_disagreement_score":0.99576235,"about_ca_system_score_codex":0.09595979,"about_ca_system_score_gemma":0.20413259,"threshold_uncertainty_score":0.6962403},"labels":[],"label_agreement":null},{"id":"W4295878695","doi":"10.1162/qss_a_00211","title":"Assessing the quality of bibliographic data sources for measuring international research collaboration","year":2022,"lang":"en","type":"article","venue":"Quantitative Science Studies","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Computer science; Data science; Quality (philosophy); Digital library; Data quality; Information retrieval; Conceptual framework; Metric (unit); Engineering","score_opus":0.9238412134420332,"score_gpt":0.7257074572657539,"score_spread":0.19813375617627926,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4295878695","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"evaluation","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"evaluation","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.4856026,0.010572758,0.4297014,0.010621748,0.00055240706,0.004984461,0.011774017,0.00088147155,0.04530913],"genre_scores_gemma":[0.7792274,0.0013210233,0.21365996,0.00028347428,0.000117206895,0.0023948739,0.0024400053,0.00012621851,0.00042979597],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.6222311,0.22795218,0.057135627,0.0080725625,0.08214864,0.0024598415],"domain_scores_gemma":[0.15285233,0.58059454,0.101243846,0.05624374,0.10617943,0.0028860632],"candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.24914871,0.00083189795,0.0018517211,0.04592167,0.0037256677,0.01731058,0.0028223898,0.0019697384,0.002298253],"category_scores_gemma":[0.66936564,0.0009177523,0.0019448875,0.07601613,0.004433288,0.013006404,0.009909271,0.0021391516,0.00045805585],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000775507,0.0004930596,0.48340476,0.007956148,0.0018955374,0.00016615444,0.01532057,0.0073227594,0.002525569,0.09677021,0.006529708,0.37684005],"study_design_scores_gemma":[0.0006451096,0.0015396156,0.47494292,0.019930435,0.0034801615,0.0008036497,0.046249628,0.07936544,0.040561,0.22945334,0.10193083,0.0010978326],"about_ca_topic_score_codex":0.0053881393,"about_ca_topic_score_gemma":0.006136108,"teacher_disagreement_score":0.9540783,"about_ca_system_score_codex":0.007927168,"about_ca_system_score_gemma":0.0126116,"threshold_uncertainty_score":0.9259333},"labels":[],"label_agreement":null},{"id":"W4301135710","doi":"10.1145/3487553.3524263","title":"VisPaD: Visualization and Pattern Discovery for Fighting Human Trafficking","year":2022,"lang":"en","type":"article","venue":"Companion Proceedings of the Web Conference 2022","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Computer science; Visualization; Identification (biology); Cluster (spacecraft); Domain (mathematical analysis); Data science; Space (punctuation); Task (project management); Data visualization; Data mining; Human–computer interaction; Engineering","score_opus":0.12123217389918489,"score_gpt":0.3699951522064527,"score_spread":0.2487629783072678,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4301135710","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.03903843,0.0024905072,0.5742741,0.0027282555,0.0005439516,0.00043574473,0.06147524,0.30719197,0.011821737],"genre_scores_gemma":[0.14800154,0.0019564813,0.7869462,0.000655482,0.00017464306,0.00081406906,0.044237114,0.0097201,0.0074943397],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99914634,0.0002305771,0.0000815687,0.00018551879,0.00028313446,0.00007280278],"domain_scores_gemma":[0.9946286,0.0035380302,0.00033645504,0.0007599817,0.0004518234,0.0002850532],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019302636,0.0020733816,0.0009893483,0.0062032673,0.00070320704,0.0042767646,0.0016808185,0.0011853176,0.021676982],"category_scores_gemma":[0.008264509,0.00069334905,0.0013082761,0.0037806197,0.0005435883,0.0030575958,0.003954342,0.0019344572,0.004625705],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0023184996,0.0004967904,0.014793948,0.003033078,0.00072104874,0.0011007438,0.0030866885,0.0150390975,0.023228506,0.019367749,0.36379752,0.55301636],"study_design_scores_gemma":[0.00063399004,0.00061469997,0.019219458,0.0011302332,0.00031888904,0.0018163661,0.002721664,0.43489337,0.042908106,0.08734248,0.4080733,0.00032738253],"about_ca_topic_score_codex":0.003954919,"about_ca_topic_score_gemma":0.007436745,"teacher_disagreement_score":0.021676982,"about_ca_system_score_codex":0.00063634705,"about_ca_system_score_gemma":0.0010362773,"threshold_uncertainty_score":0.07251674},"labels":[],"label_agreement":null},{"id":"W4301605997","doi":"10.23889/ijpds.v7i1.1757","title":"A scoping review of preprocessing methods for unstructured text data to assess data quality","year":2022,"lang":"en","type":"review","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":30,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba; George & Fay Yee Centre for Healthcare Innovation; Manitoba Health","funders":"Canada Research Chairs","keywords":"Computer science; Preprocessor; Punctuation; Data quality; Data pre-processing; Stop words; Information retrieval; Lexical analysis; Natural language processing; Artificial intelligence; Data mining","score_opus":0.9239911994930267,"score_gpt":0.7624971008446532,"score_spread":0.1614940986483735,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4301605997","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0021552488,0.93272066,0.0225668,0.0065297517,0.0021906958,0.026314732,0.0032541486,0.0002257357,0.004042217],"genre_scores_gemma":[0.019363163,0.81265545,0.06903563,0.0035241796,0.0007787148,0.09007607,0.0033702052,0.00022777487,0.0009689345],"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","domain_scores_codex":[0.6298958,0.1525816,0.15514605,0.010226235,0.05021289,0.0019373863],"domain_scores_gemma":[0.24554455,0.5672291,0.07037822,0.01741115,0.09772573,0.0017113085],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.30473876,0.0043134736,0.012584142,0.06724623,0.0051492387,0.014353623,0.0071989656,0.0064424626,0.008895167],"category_scores_gemma":[0.6163544,0.0039485805,0.015598922,0.05063309,0.007084679,0.01285067,0.0089373505,0.0045047114,0.0022266484],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022453415,0.00004398415,0.0013373826,0.8101359,0.0032087772,0.00019578986,0.0028382477,0.00034930708,0.00039240497,0.0028750005,0.0068830387,0.17151569],"study_design_scores_gemma":[0.00006915846,0.00007684782,0.00090317905,0.964733,0.004128648,0.00012944441,0.00080003345,0.0001521069,0.00036258652,0.0014734885,0.027119279,0.00005221091],"about_ca_topic_score_codex":0.00921451,"about_ca_topic_score_gemma":0.015708037,"teacher_disagreement_score":0.69526124,"about_ca_system_score_codex":0.018930286,"about_ca_system_score_gemma":0.07112107,"threshold_uncertainty_score":0.85738087},"labels":[],"label_agreement":null},{"id":"W4302335021","doi":"","title":"A Big Step Forward: It’s Time for a Database of Evidence Summaries in Library and","year":2016,"lang":"en","type":"article","venue":"DOAJ (DOAJ: Directory of Open Access Journals)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Memorial University of Newfoundland; Concordia University; University of Alberta","funders":"","keywords":"Database; Computer science; Data science; Information retrieval","score_opus":0.683002680968158,"score_gpt":0.6234343031518965,"score_spread":0.05956837781626145,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4302335021","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"evaluation","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"evaluation","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0016317654,0.03990106,0.0121177845,0.91403437,0.01962661,0.0004711857,0.0055501033,0.0019318196,0.004735354],"genre_scores_gemma":[0.03778632,0.048419558,0.3712527,0.4461645,0.055741325,0.0023109273,0.026009042,0.0044390145,0.007876513],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8474863,0.06710553,0.042170312,0.0073709525,0.031333555,0.004533309],"domain_scores_gemma":[0.2557859,0.28825113,0.053334218,0.11887495,0.20816685,0.075586975],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.18383239,0.00231398,0.007427216,0.019112734,0.007067519,0.056342557,0.00994111,0.0172596,0.032536134],"category_scores_gemma":[0.5310848,0.004199517,0.006092383,0.018893644,0.0065996717,0.09105027,0.020489492,0.035832595,0.017030926],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000677463,0.0002545629,0.005183529,0.004355758,0.000902921,0.00020592565,0.0010742048,0.00031231518,0.00067489233,0.024557712,0.75439334,0.2074074],"study_design_scores_gemma":[0.0005381231,0.0002917427,0.005693939,0.014506231,0.0007749918,0.0005042804,0.002891418,0.0009723793,0.00053684163,0.09028169,0.8825177,0.00049064466],"about_ca_topic_score_codex":0.012864776,"about_ca_topic_score_gemma":0.025076833,"teacher_disagreement_score":0.8161676,"about_ca_system_score_codex":0.013605034,"about_ca_system_score_gemma":0.054143123,"threshold_uncertainty_score":0.9722102},"labels":[],"label_agreement":null},{"id":"W4306317280","doi":"10.1145/3511808.3557673","title":"Probing the Robustness of Pre-trained Language Models for Entity Matching","year":2022,"lang":"en","type":"article","venue":"Proceedings of the 31st ACM International Conference on Information &amp; Knowledge Management","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Robustness (evolution); Computer science; Spurious relationship; Machine learning; Software deployment; Artificial intelligence; Training set; Data modeling; Data mining; Database; Software engineering","score_opus":0.15254733957015623,"score_gpt":0.3846648573911663,"score_spread":0.23211751782101006,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4306317280","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.41967475,0.0033566107,0.561591,0.0028925985,0.00044620666,0.00029848333,0.0015921601,0.005446408,0.0047018155],"genre_scores_gemma":[0.9158394,0.00054127915,0.077345036,0.00073882594,0.00014998755,0.00016881785,0.0031043796,0.0003184832,0.0017937187],"study_design_codex":"simulation_or_modeling","study_design_gemma":"not_applicable","domain_scores_codex":[0.9945226,0.0030375163,0.00034812657,0.0012880863,0.00043560044,0.00036816392],"domain_scores_gemma":[0.9729321,0.020540765,0.00082783407,0.00400708,0.0013593073,0.00033279296],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.014512142,0.001844272,0.0013421068,0.0014121595,0.0007871662,0.0020516152,0.0033867592,0.002768425,0.0016314144],"category_scores_gemma":[0.056601558,0.0009723156,0.0013802744,0.0012049995,0.0014272722,0.005574816,0.0028732328,0.004939722,0.0014562169],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00058122666,0.00025351808,0.008761658,0.00021393932,0.00039990424,0.00014354389,0.00020106636,0.8857884,0.00315513,0.0034775278,0.00369897,0.09332519],"study_design_scores_gemma":[0.000014514611,0.000054884873,0.00055414345,0.000017437711,0.000023300168,0.00003685615,0.000038165857,0.99412316,0.002288756,0.002405498,0.00043033276,0.000013030036],"about_ca_topic_score_codex":0.011774336,"about_ca_topic_score_gemma":0.0101235425,"teacher_disagreement_score":0.014512142,"about_ca_system_score_codex":0.0018861423,"about_ca_system_score_gemma":0.0015940367,"threshold_uncertainty_score":0.07674843},"labels":[],"label_agreement":null},{"id":"W4307174368","doi":"10.5281/zenodo.7243921","title":"Deliverable 1.6 Data Governance Framework","year":2020,"lang":"en","type":"report","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"Horizon 2020 Framework Programme","keywords":"Deliverable; Corporate governance; Data governance; Process management; Computer science; Business; Systems engineering; Engineering; Finance; Marketing; Data quality","score_opus":0.4122397577623883,"score_gpt":0.41663312835974364,"score_spread":0.004393370597355339,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4307174368","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0020449588,0.0016081634,0.19509786,0.015607902,0.002267846,0.0049133496,0.31306744,0.05972362,0.40566877],"genre_scores_gemma":[0.016412072,0.0022875303,0.17635931,0.005517272,0.0006156308,0.009456442,0.5800095,0.024736522,0.18460566],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9794939,0.005615378,0.002451279,0.0024148384,0.0081790695,0.0018455798],"domain_scores_gemma":[0.9773154,0.0047159973,0.0010825278,0.005308957,0.009975187,0.0016018845],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.025990075,0.0015621873,0.0011228037,0.0059603173,0.0023963796,0.013638831,0.0046762265,0.0032066049,0.14425988],"category_scores_gemma":[0.054474548,0.001284135,0.0015589292,0.007702733,0.0013290902,0.0110057155,0.00985952,0.0040625236,0.14202398],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00011703088,0.000080536316,0.0009588533,0.00089814997,0.000033588607,0.00015747777,0.0010087775,0.002152344,0.0008395912,0.1023531,0.7959411,0.0954594],"study_design_scores_gemma":[0.000018349583,0.000011151875,0.0002921694,0.0003762608,0.0000054250627,0.000042704767,0.0002383253,0.00041519426,0.0002722012,0.010594761,0.98770344,0.0000299897],"about_ca_topic_score_codex":0.033177353,"about_ca_topic_score_gemma":0.015888928,"teacher_disagreement_score":0.14425988,"about_ca_system_score_codex":0.0063380715,"about_ca_system_score_gemma":0.014740902,"threshold_uncertainty_score":0.4825974},"labels":[],"label_agreement":null},{"id":"W4308752211","doi":"10.1002/bdm.2307","title":"Meta‐informational cue inconsistency and judgment of information accuracy: Spotlight on intelligence analysis","year":2022,"lang":"en","type":"article","venue":"Journal of Behavioral Decision Making","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Government of Ontario; Government of Canada; Defence Research and Development Canada","funders":"","keywords":"Credibility; Reliability (semiconductor); Psychology; Computer science; Social psychology; Information quality; Quality (philosophy); Cognitive psychology; Natural language processing; Information system","score_opus":0.25537479457183065,"score_gpt":0.45268452003447074,"score_spread":0.19730972546264008,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4308752211","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.93519,0.0021190965,0.047465265,0.001693901,0.000079160345,0.000110412664,0.00009774774,0.0002047241,0.013039672],"genre_scores_gemma":[0.99423087,0.00012798564,0.0052934163,0.000102036414,0.00003913215,0.000025022633,0.000026306956,0.00003782487,0.000117414085],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9593492,0.025190728,0.0018541381,0.0028487167,0.010143594,0.00061355694],"domain_scores_gemma":[0.5374678,0.3667196,0.036366172,0.036902484,0.019917917,0.0026260815],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.038970124,0.000692038,0.0011439746,0.003938154,0.0009177445,0.0055752415,0.0015637163,0.0014616158,0.0020077177],"category_scores_gemma":[0.32401663,0.00085695664,0.00077234936,0.0023858708,0.0044357674,0.007837624,0.0033504174,0.0028593878,0.00017116647],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0088532055,0.0012834313,0.4764299,0.0021366393,0.0025701437,0.00044397768,0.0313784,0.014696938,0.039249334,0.072847925,0.002748813,0.34736133],"study_design_scores_gemma":[0.00043026387,0.0028964079,0.6590626,0.0009376091,0.0014240176,0.0009661384,0.009953573,0.08302068,0.03330317,0.2025114,0.004693738,0.0008003636],"about_ca_topic_score_codex":0.0020382612,"about_ca_topic_score_gemma":0.0011200684,"teacher_disagreement_score":0.038970124,"about_ca_system_score_codex":0.0015120317,"about_ca_system_score_gemma":0.0012395545,"threshold_uncertainty_score":0.20609617},"labels":[],"label_agreement":null},{"id":"W4309421654","doi":"10.31223/x5h07q","title":"Community recommendations for geochemical data, services and analytical capabilities in the 21st century","year":2022,"lang":"en","type":"preprint","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"HORIZON EUROPE Framework Programme; Cambridge Trust; Eidgenössische Technische Hochschule Zürich; Gates Cambridge Trust; Nuclear Safety and Security Commission; Deutsche Forschungsgemeinschaft; Bill and Melinda Gates Foundation; European Commission; Geochemical Society; National Aeronautics and Space Administration; Natural Environment Research Council; Science Foundation Ireland; National Science Foundation","keywords":"Data science; Variety (cybernetics); Computer science; Data sharing; Data quality; Earth science; Outreach; Data curation; Quality (philosophy); Political science; Service (business); Business; Artificial intelligence","score_opus":0.3850553958374082,"score_gpt":0.47515712563240603,"score_spread":0.09010172979499781,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4309421654","genre_codex":"commentary","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00069657096,0.015426909,0.02229262,0.7695217,0.050832815,0.0020714435,0.014471572,0.0056826253,0.11900368],"genre_scores_gemma":[0.0072137,0.030300055,0.16822343,0.58768773,0.009346771,0.0063518374,0.028637964,0.00388463,0.1583539],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9353811,0.017174715,0.0073131756,0.0031666383,0.03047697,0.0064874487],"domain_scores_gemma":[0.7131605,0.050119083,0.008766804,0.017860064,0.17427371,0.03581984],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0738604,0.0023528433,0.002405749,0.011370507,0.005089556,0.020653194,0.01572901,0.036282446,0.09968195],"category_scores_gemma":[0.1865616,0.0022809491,0.004756554,0.017980501,0.005452077,0.02421918,0.020648949,0.024837881,0.070329644],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000027180102,0.00006148106,0.000263805,0.0005839699,0.000015273898,0.000079027544,0.00027704512,0.00013146378,0.0002472527,0.0049044006,0.95406467,0.039344393],"study_design_scores_gemma":[0.000025513793,0.000012975874,0.00034613864,0.0013711222,0.000015820782,0.000038135375,0.0004020279,0.000086354776,0.00012159779,0.0053674793,0.9921704,0.000042386644],"about_ca_topic_score_codex":0.07624083,"about_ca_topic_score_gemma":0.088739574,"teacher_disagreement_score":0.9261396,"about_ca_system_score_codex":0.010199711,"about_ca_system_score_gemma":0.090779245,"threshold_uncertainty_score":0.39061582},"labels":[],"label_agreement":null},{"id":"W4309617049","doi":"10.1145/3571281","title":"Efficiently Cleaning Structured Event Logs: A Graph Repair Approach","year":2022,"lang":"en","type":"article","venue":"ACM Transactions on Database Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"Beijing National Research Center For Information Science And Technology; National Natural Science Foundation of China","keywords":"Computer science; Workflow; Event (particle physics); Pruning; Data mining; Graph; Profiling (computer programming); Information retrieval; Theoretical computer science; Database; Programming language","score_opus":0.11679595709416458,"score_gpt":0.35897822892552084,"score_spread":0.24218227183135627,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4309617049","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012943939,0.00031629167,0.97890705,0.0004995849,0.00006408377,0.00028503343,0.0008466721,0.005584656,0.0005527845],"genre_scores_gemma":[0.10936054,0.00029419205,0.8830175,0.00024385795,0.0000641066,0.00021932139,0.0043263333,0.00066884054,0.0018052582],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99689853,0.0008022708,0.0002484814,0.0007986059,0.0010448595,0.00020732453],"domain_scores_gemma":[0.98578984,0.0066987714,0.0013627224,0.0039883745,0.0018717967,0.0002885988],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0024219966,0.0018039519,0.0014773315,0.0037636007,0.0017017073,0.0014181735,0.0031884552,0.0016762712,0.001925949],"category_scores_gemma":[0.014458164,0.00086086453,0.0020587426,0.0033862463,0.0014028577,0.0035262823,0.0023803408,0.0022102916,0.0010711302],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004402264,0.00050727284,0.007456467,0.0011124125,0.00023219992,0.0010510787,0.0010649452,0.28516725,0.028561326,0.01839515,0.026071884,0.62993985],"study_design_scores_gemma":[0.000065524284,0.00015794206,0.0013293488,0.0000515255,0.000122218,0.0005202333,0.0004784882,0.9183147,0.015754899,0.0504079,0.012744082,0.000053291296],"about_ca_topic_score_codex":0.008777151,"about_ca_topic_score_gemma":0.013025486,"teacher_disagreement_score":0.008777151,"about_ca_system_score_codex":0.0010566204,"about_ca_system_score_gemma":0.0027838952,"threshold_uncertainty_score":0.01745212},"labels":[],"label_agreement":null},{"id":"W4309836268","doi":"10.23889/ijpds.v7i4.1755","title":"Validating a novel deterministic privacy-preserving record linkage between administrative &amp; clinical data: applications in stroke research","year":2022,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ted Rogers Centre for Heart Research; Indoc Research; University Health Network; University of Toronto; Health Sciences Centre; Ontario Brain Institute; Heart and Stroke Foundation; Sunnybrook Health Science Centre","funders":"Canadian Institutes of Health Research; University of Toronto; Ontario Ministry of Health and Long-Term Care; Government of Ontario; Department of Medicine, University of Toronto; Ontario Brain Institute; Heart and Stroke Foundation of Canada","keywords":"Record linkage; Linkage (software); Computer science; Medical record; Stroke (engine); Data science; Medicine; Engineering; Genetics; Gene; Biology; Environmental health; Internal medicine","score_opus":0.8808373577486144,"score_gpt":0.6882838280011057,"score_spread":0.19255352974750872,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4309836268","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.21623044,0.0006964736,0.7643634,0.005533131,0.00032398885,0.0027538186,0.0027877374,0.002028272,0.0052828],"genre_scores_gemma":[0.50410986,0.00032067546,0.49063152,0.0006193437,0.000120126184,0.0015450949,0.0015934203,0.00006191727,0.0009980759],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9041965,0.057047512,0.009993367,0.0096968,0.01764131,0.0014244547],"domain_scores_gemma":[0.84110653,0.075151086,0.026086321,0.034396842,0.021704908,0.001554188],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.080467746,0.0005455589,0.0009263354,0.0019142231,0.002138485,0.0058011897,0.0035523844,0.0032696803,0.0033655502],"category_scores_gemma":[0.1784712,0.00068193855,0.0012516744,0.0033297625,0.002417114,0.005900649,0.0071738926,0.0014621698,0.0016067817],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0039690295,0.0018399738,0.22263524,0.002396549,0.0010511929,0.0014525399,0.0054384163,0.06549404,0.024202852,0.07303518,0.010431159,0.5880538],"study_design_scores_gemma":[0.0013961855,0.0049256934,0.061757885,0.0015372988,0.00076982134,0.007675254,0.005037634,0.65888625,0.09439538,0.112853445,0.0502066,0.0005585309],"about_ca_topic_score_codex":0.0019028137,"about_ca_topic_score_gemma":0.0012729992,"teacher_disagreement_score":0.080467746,"about_ca_system_score_codex":0.002137193,"about_ca_system_score_gemma":0.008390798,"threshold_uncertainty_score":0.42555922},"labels":[],"label_agreement":null},{"id":"W4310153872","doi":"10.1007/s13042-022-01686-5","title":"MORE: Toward Improving Author Name Disambiguation in Academic Knowledge Graphs","year":2022,"lang":"en","type":"article","venue":"International Journal of Machine Learning and Cybernetics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"International Science and Technology Cooperation Programme; National Key Research and Development Program of China","keywords":"Computer science; Embedding; Cluster analysis; Artificial intelligence; Graph; Graph embedding; Representation (politics); Similarity (geometry); Hierarchical clustering; Feature learning; Machine learning; Task (project management); Data mining; Theoretical computer science; Image (mathematics)","score_opus":0.08535776253208069,"score_gpt":0.42558615324482046,"score_spread":0.3402283907127398,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4310153872","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10856411,0.012882893,0.7251192,0.0112849,0.005326803,0.0007482213,0.036046054,0.07403465,0.02599317],"genre_scores_gemma":[0.2741241,0.0037018473,0.6565786,0.003281307,0.0021808494,0.0002034318,0.041160423,0.0035286811,0.015240778],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9944277,0.0018727215,0.00039570706,0.0014314533,0.0014974528,0.0003750107],"domain_scores_gemma":[0.98288167,0.0058747265,0.00086440094,0.0059508868,0.0037837469,0.0006446954],"candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.0045652906,0.0020608343,0.0025062773,0.017453242,0.0029488853,0.0053986264,0.0029635306,0.0030741931,0.010193753],"category_scores_gemma":[0.02525377,0.00089348777,0.002022544,0.011313418,0.0012289311,0.013799524,0.005689151,0.002594918,0.007814558],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006589007,0.00094302284,0.015707716,0.0015433122,0.0007453674,0.00029866246,0.0009398741,0.026474891,0.011776045,0.026024712,0.19448863,0.72039884],"study_design_scores_gemma":[0.00034155734,0.00037435506,0.00975294,0.0005962322,0.0011820167,0.0008189457,0.00207015,0.44892144,0.0316309,0.2766425,0.22740857,0.0002604696],"about_ca_topic_score_codex":0.0075162556,"about_ca_topic_score_gemma":0.021349277,"teacher_disagreement_score":0.98254675,"about_ca_system_score_codex":0.0011132323,"about_ca_system_score_gemma":0.0032832716,"threshold_uncertainty_score":0.034101546},"labels":[],"label_agreement":null},{"id":"W4312036666","doi":"10.2196/preprints.44331","title":"Optimizing Patient Record Linkage in a Master Patient Index Using Machine Learning: Algorithm Development and Validation (Preprint)","year":2022,"lang":"en","type":"preprint","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Hamilton Health Sciences; McMaster University; Population Health Research Institute; University of Toronto","funders":"","keywords":"Computer science; Matching (statistics); Record linkage; Population; Software; Machine learning; Linkage (software); Interface (matter); Artificial intelligence; Set (abstract data type); Data mining; Programming language; Medicine; Operating system","score_opus":0.16978250935429592,"score_gpt":0.35992108858677824,"score_spread":0.1901385792324823,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4312036666","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.14563799,0.0007507162,0.79886246,0.0014382772,0.00029161203,0.00091538014,0.0038925942,0.04466179,0.0035491232],"genre_scores_gemma":[0.18667905,0.00016319231,0.8024894,0.0004110524,0.000061524115,0.00086984487,0.006390419,0.0012483079,0.0016871238],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9952304,0.0024003903,0.00036673996,0.000891488,0.0008897693,0.00022123186],"domain_scores_gemma":[0.9775978,0.01625292,0.0009949305,0.002148339,0.0026302151,0.00037587658],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013846422,0.0011708294,0.0012590819,0.00197562,0.00093675393,0.0019854854,0.002315752,0.0015160367,0.0052209357],"category_scores_gemma":[0.03529662,0.00072526006,0.0013470883,0.0018216504,0.00072026014,0.0012512804,0.0020062325,0.0015584307,0.0016674687],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006811324,0.000682647,0.018735046,0.0005786487,0.00045509837,0.00021214024,0.00031877274,0.6143572,0.0031344043,0.004405964,0.026531434,0.32990757],"study_design_scores_gemma":[0.0001286357,0.00009836277,0.0022524893,0.000037395122,0.000028889795,0.000057159974,0.000037821315,0.98796755,0.0045474228,0.0023222517,0.0024971343,0.000024906603],"about_ca_topic_score_codex":0.010524908,"about_ca_topic_score_gemma":0.008093401,"teacher_disagreement_score":0.013846422,"about_ca_system_score_codex":0.0021372917,"about_ca_system_score_gemma":0.0038309384,"threshold_uncertainty_score":0.07322776},"labels":[],"label_agreement":null},{"id":"W4312333616","doi":"10.1115/ipc2022-87872","title":"Structured, Systematic Threat Based Approach to Evaluate and Improve Data Quality to Facilitate Digital Transformation","year":2022,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dynamic Systems Analysis (Canada)","funders":"","keywords":"Computer science; Data quality; Data governance; Pipeline (software); Asset (computer security); Quality (philosophy); Data science; Risk analysis (engineering); Cloud computing; Data mining; Process management; Computer security; Engineering; Operations management","score_opus":0.4426005142575988,"score_gpt":0.43085171282932977,"score_spread":0.011748801428269007,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4312333616","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10112965,0.0075305705,0.6587094,0.054080624,0.0015052381,0.041050736,0.0039232965,0.004370136,0.12770036],"genre_scores_gemma":[0.32828817,0.002104175,0.64992416,0.0030661647,0.00023411025,0.0077065467,0.0019252399,0.00025398374,0.006497524],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.8024547,0.098549165,0.024626356,0.008233808,0.061808415,0.004327558],"domain_scores_gemma":[0.53048277,0.1516831,0.05256746,0.033137057,0.21976222,0.012367367],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.19746566,0.0018446074,0.001628331,0.031257074,0.00559024,0.016747128,0.0060761455,0.0036487803,0.006306841],"category_scores_gemma":[0.25467438,0.0010788676,0.0021782916,0.011369515,0.00723249,0.018819,0.015406856,0.007071733,0.00254824],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00040334303,0.0016042256,0.06394242,0.010461458,0.00042374057,0.0021678817,0.046800103,0.009971708,0.012010392,0.15860328,0.039877485,0.653734],"study_design_scores_gemma":[0.00031195272,0.0033217128,0.07611731,0.033720866,0.0007150107,0.0021496501,0.100900784,0.06377647,0.036980674,0.2379391,0.44296795,0.0010985973],"about_ca_topic_score_codex":0.0075399196,"about_ca_topic_score_gemma":0.010537396,"teacher_disagreement_score":0.19746566,"about_ca_system_score_codex":0.019743826,"about_ca_system_score_gemma":0.072521515,"threshold_uncertainty_score":0.9896677},"labels":[],"label_agreement":null},{"id":"W4312347912","doi":"10.2196/39967","title":"Optimizing the Quality of Clinical Data in an Australian Aged Care and Disability Service to Improve Care Delivery and Clinical Outcomes: Protocol for an Agile Lean Six Sigma Study","year":2022,"lang":"en","type":"article","venue":"JMIR Research Protocols","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Documentation; Service delivery framework; Medicine; Agile software development; Health care; Quality (philosophy); Quality management; Process management; Service (business); Operations management; Business; Computer science; Engineering","score_opus":0.8856366775879874,"score_gpt":0.7578436878248014,"score_spread":0.12779298976318598,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4312347912","genre_codex":"protocol","genre_gemma":"protocol","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"protocol","genre_consensus":"protocol","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0022416941,0.00013721333,0.0017104779,0.00014318322,0.000061890794,0.99381244,0.0008098131,0.00002098579,0.0010622792],"genre_scores_gemma":[0.0012454413,0.000112058595,0.004227428,0.00007710015,0.000008134756,0.99382544,0.0002404845,0.0000030575557,0.00026082646],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.96689224,0.01656366,0.0062337476,0.0023678918,0.005639587,0.0023029346],"domain_scores_gemma":[0.93747723,0.010117229,0.008471839,0.005182462,0.034953892,0.0037973071],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.06430357,0.0027847718,0.0043114424,0.0036776247,0.0047597922,0.005469806,0.004391838,0.0038929454,0.027409354],"category_scores_gemma":[0.05716409,0.002015769,0.007268769,0.0053909197,0.0039408766,0.0029976862,0.0045297,0.006689523,0.006062321],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.12921424,0.07004139,0.030990636,0.15482795,0.0035720365,0.0033474993,0.033944227,0.028820956,0.012162576,0.04097667,0.09387484,0.398227],"study_design_scores_gemma":[0.109570906,0.10044838,0.070961446,0.08412451,0.0030204647,0.00062443805,0.02217388,0.010166662,0.01482896,0.018106421,0.5648685,0.0011055141],"about_ca_topic_score_codex":0.009057644,"about_ca_topic_score_gemma":0.016531331,"teacher_disagreement_score":0.9356964,"about_ca_system_score_codex":0.01402905,"about_ca_system_score_gemma":0.056198597,"threshold_uncertainty_score":0.34007382},"labels":[],"label_agreement":null},{"id":"W4312438866","doi":"10.1007/978-3-031-16990-8_4","title":"Data Preprocessing","year":2022,"lang":"en","type":"book-chapter","venue":"International series in management science/operations research/International series in operations research & management science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":16,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Public Health Ontario; York University","funders":"","keywords":"Preprocessor; Software portability; Computer science; Raw data; Data pre-processing; Context (archaeology); Usability; Data quality; Task (project management); Data mining; Precondition; Data processing; Database; Artificial intelligence; Human–computer interaction; Engineering; Programming language","score_opus":0.4274617544225517,"score_gpt":0.5633610717969169,"score_spread":0.13589931737436517,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4312438866","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0118085705,0.0015297356,0.28258976,0.0017137135,0.0027784528,0.0057934863,0.40537715,0.20906676,0.07934241],"genre_scores_gemma":[0.034757394,0.001470303,0.3771279,0.0020010045,0.00070017413,0.007844126,0.44459057,0.02087293,0.11063557],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99821293,0.0001272064,0.00026840754,0.0006581526,0.00052752905,0.00020575558],"domain_scores_gemma":[0.995216,0.000980365,0.00020254865,0.0017981039,0.0016341442,0.00016888005],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001792701,0.0026364732,0.0013776073,0.005773802,0.0012341106,0.0037470756,0.0015751657,0.0006861616,0.17237192],"category_scores_gemma":[0.010902019,0.00089076505,0.0016799466,0.0047355015,0.0005981683,0.0016301172,0.0028077958,0.0016922607,0.15896511],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007323536,0.00019057891,0.0028183647,0.0011979666,0.00010410551,0.00021969927,0.00024980985,0.0007648173,0.018752096,0.0067343893,0.5671775,0.4010583],"study_design_scores_gemma":[0.00014082092,0.00018006118,0.0047306684,0.00024367547,0.00012571183,0.0003640348,0.00027774237,0.005553995,0.060200527,0.008497643,0.919596,0.00008911329],"about_ca_topic_score_codex":0.0029627134,"about_ca_topic_score_gemma":0.0030150125,"teacher_disagreement_score":0.17237192,"about_ca_system_score_codex":0.0007772816,"about_ca_system_score_gemma":0.0030209094,"threshold_uncertainty_score":0.57664156},"labels":[],"label_agreement":null},{"id":"W4312989454","doi":"10.14778/3554821.3554864","title":"CERTEM","year":2022,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Counterfactual thinking; Computer science; Debugging; Order (exchange); Matching (statistics); State (computer science); Artificial intelligence; Programming language; Epistemology; Mathematics; Philosophy","score_opus":0.15111650697305168,"score_gpt":0.36334862928504613,"score_spread":0.21223212231199445,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4312989454","genre_codex":"software","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012177982,0.0022617765,0.2782329,0.0034081156,0.00087933923,0.00083597074,0.11865297,0.523381,0.06016994],"genre_scores_gemma":[0.09316325,0.0014297562,0.36437622,0.0023793583,0.00025980631,0.00083809457,0.46933094,0.03258862,0.035633955],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99774325,0.0003675203,0.00020631627,0.0007727333,0.00071601465,0.00019419621],"domain_scores_gemma":[0.9949058,0.001396849,0.00029951747,0.002214908,0.0010252248,0.0001577395],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0028172347,0.0015493998,0.00086932804,0.0029349239,0.00082093594,0.0031938353,0.004591544,0.00193911,0.062384203],"category_scores_gemma":[0.015980268,0.0006948407,0.0017017907,0.0023861318,0.0007594683,0.005256001,0.0043635503,0.0020845989,0.032430563],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00056020875,0.00019193601,0.0046607507,0.0017814105,0.00020134586,0.00042047305,0.0003416282,0.0104452185,0.0030405608,0.043619007,0.72656506,0.20817235],"study_design_scores_gemma":[0.0002302288,0.00012386474,0.0024836378,0.00024653043,0.000076137985,0.0007067747,0.00019868344,0.11907602,0.012604092,0.045551736,0.8186055,0.00009685053],"about_ca_topic_score_codex":0.005388842,"about_ca_topic_score_gemma":0.008337027,"teacher_disagreement_score":0.9376158,"about_ca_system_score_codex":0.0014439869,"about_ca_system_score_gemma":0.0026848135,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W4313347193","doi":"10.1007/978-3-031-18223-5_6","title":"Recommendations for Data Discovery, Sensemaking and Reuse","year":2022,"lang":"en","type":"book-chapter","venue":"Synthesis lectures on information concepts, retrieval, and services","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Metadata; Sensemaking; Variety (cybernetics); Documentation; Data science; Reuse; Computer science; Data discovery; Work (physics); World Wide Web; Knowledge management; Engineering","score_opus":0.15843408841646722,"score_gpt":0.3893312965759483,"score_spread":0.23089720815948106,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4313347193","genre_codex":"commentary","genre_gemma":"methods","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0006509257,0.08024513,0.19129354,0.5972408,0.02901393,0.00081203703,0.0023657926,0.0022474967,0.096130334],"genre_scores_gemma":[0.0205608,0.14852515,0.537924,0.07533421,0.021663351,0.003265587,0.0064527574,0.001473558,0.18480058],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98682785,0.006408279,0.0012457533,0.0010957561,0.003864541,0.0005577661],"domain_scores_gemma":[0.94275683,0.02894455,0.0017587407,0.007224338,0.016675547,0.0026399838],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.021430966,0.0021053455,0.0019944657,0.00855865,0.003278115,0.017026944,0.005402381,0.0097855255,0.053734947],"category_scores_gemma":[0.08555695,0.0013120583,0.0019746122,0.013237774,0.0072276467,0.035697486,0.004934598,0.010051112,0.020521414],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000028456327,0.000059825128,0.00014683006,0.00088911643,0.000034329594,0.000054082564,0.000412419,0.00084547175,0.00018933245,0.30757537,0.55328685,0.13647793],"study_design_scores_gemma":[0.000023189863,0.000010789967,0.000106813044,0.0013979471,0.000021242298,0.0000524486,0.0006335963,0.00092583365,0.00017040993,0.38256553,0.6140618,0.000030454665],"about_ca_topic_score_codex":0.019551659,"about_ca_topic_score_gemma":0.032630045,"teacher_disagreement_score":0.97856903,"about_ca_system_score_codex":0.008103363,"about_ca_system_score_gemma":0.012433987,"threshold_uncertainty_score":0.17976129},"labels":[],"label_agreement":null},{"id":"W4313347268","doi":"10.1007/978-3-031-18223-5_3","title":"Data Needs","year":2022,"lang":"en","type":"book-chapter","venue":"Synthesis lectures on information concepts, retrieval, and services","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Geography","score_opus":0.11148555734705928,"score_gpt":0.3599012098088728,"score_spread":0.24841565246181352,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4313347268","genre_codex":"other","genre_gemma":"methods","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0025324142,0.004036129,0.022351699,0.024977826,0.0013532953,0.00023405872,0.008278132,0.00093438046,0.935302],"genre_scores_gemma":[0.044864822,0.009175085,0.0331431,0.010697111,0.0016922705,0.000530529,0.023230923,0.001352308,0.8753139],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9971106,0.000462247,0.00022255766,0.0004244512,0.0015464661,0.00023374836],"domain_scores_gemma":[0.993089,0.0023405447,0.00022590884,0.001592255,0.0021899564,0.00056226534],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0035660467,0.0006233399,0.0005731756,0.0034610939,0.0014416168,0.007278193,0.001787228,0.001721436,0.18647575],"category_scores_gemma":[0.017368859,0.0005534437,0.0006123559,0.0041827406,0.0012094842,0.0136752175,0.004517114,0.0020632038,0.095750965],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00005180591,0.00003279326,0.00060625724,0.0004092254,0.000008733813,0.00012326668,0.00081814284,0.00025585174,0.00096439186,0.41178286,0.39859745,0.18634932],"study_design_scores_gemma":[0.0000026831578,0.0000033311585,0.00013537932,0.00007438542,0.0000022623042,0.00007820575,0.00018856565,0.00010480806,0.00023228482,0.025318712,0.97385466,0.000004828394],"about_ca_topic_score_codex":0.0029799102,"about_ca_topic_score_gemma":0.002407488,"teacher_disagreement_score":0.996434,"about_ca_system_score_codex":0.0020438014,"about_ca_system_score_gemma":0.003125245,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W4313424566","doi":"10.2196/38922","title":"A Privacy-Preserving Distributed Medical Data Integration Security System for Accuracy Assessment of Cancer Screening: Development Study of Novel Data Integration System","year":2022,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"Japan Society for the Promotion of Science; Ministry of Education, Culture, Sports, Science and Technology","keywords":"Computer science; System integration; Cancer; Information privacy; Data integration; Data mining; Computer security; Medicine; Database","score_opus":0.31563900577634946,"score_gpt":0.505430718105667,"score_spread":0.18979171232931752,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4313424566","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.16407312,0.001043626,0.8246057,0.0008090434,0.0001868556,0.0010028264,0.00021840297,0.0052634925,0.0027969528],"genre_scores_gemma":[0.7436082,0.00048062278,0.25310302,0.00031322028,0.00008465021,0.00040094546,0.00045764676,0.000050955732,0.0015007285],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9976864,0.00044969778,0.00028383703,0.0006149484,0.0007755696,0.00018951164],"domain_scores_gemma":[0.9967686,0.00057742745,0.00031070109,0.0008900467,0.0012571568,0.00019607414],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0032945857,0.00050635205,0.00087163807,0.0009476719,0.00066939805,0.0016623677,0.002007645,0.0008949617,0.0014624073],"category_scores_gemma":[0.0050596697,0.00030900136,0.00056337996,0.0011120299,0.0005254158,0.003495947,0.001753574,0.0007767355,0.00044524623],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0022646277,0.0016187426,0.040645164,0.0008300432,0.00044590505,0.0012963725,0.00091652194,0.057714917,0.121154174,0.030357594,0.011359686,0.73139626],"study_design_scores_gemma":[0.00019688063,0.00096218754,0.006865237,0.00005122887,0.00016710922,0.001010449,0.00015665827,0.93184155,0.045972362,0.0040025883,0.008697778,0.000075914955],"about_ca_topic_score_codex":0.0015435537,"about_ca_topic_score_gemma":0.000561269,"teacher_disagreement_score":0.0032945857,"about_ca_system_score_codex":0.0011335857,"about_ca_system_score_gemma":0.0019747484,"threshold_uncertainty_score":0.01742363},"labels":[],"label_agreement":null},{"id":"W4315630458","doi":"10.1109/globecom48099.2022.10001041","title":"Efficient Information Sharing in ICT Supply Chain Social Network via Table Structure Recognition","year":2022,"lang":"en","type":"article","venue":"GLOBECOM 2022 - 2022 IEEE Global Communications Conference","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"Mitacs","keywords":"Computer science; Table (database); Supply chain; Information sharing; Representation (politics); Structuring; Process (computing); Data mining; Artificial intelligence; World Wide Web","score_opus":0.11417516000948796,"score_gpt":0.3601949135115256,"score_spread":0.24601975350203764,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4315630458","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1599367,0.0009646874,0.8234101,0.0008045455,0.00016610988,0.00028241234,0.0015797232,0.006297227,0.00655851],"genre_scores_gemma":[0.75574577,0.00039774002,0.23540425,0.00022090621,0.00008797498,0.00017132479,0.0032961152,0.00011340931,0.0045624063],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.9987149,0.0002303389,0.000098417106,0.00041233972,0.00040335488,0.00014059093],"domain_scores_gemma":[0.9987765,0.00040533135,0.00021007359,0.00022584209,0.00031426467,0.00006814311],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007588193,0.0007634654,0.0010951415,0.0023828652,0.0008003676,0.0014103121,0.0013135931,0.0009443266,0.0018579733],"category_scores_gemma":[0.0034330937,0.0003490201,0.00096879294,0.0025416273,0.00038648248,0.002841176,0.001344119,0.0007244867,0.0007951641],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00048646564,0.0003275555,0.008280455,0.00022842146,0.00015005512,0.0003784774,0.0004879006,0.16771373,0.015190009,0.008323363,0.011839868,0.7865938],"study_design_scores_gemma":[0.000009744993,0.00003517553,0.0012255573,0.000007937318,0.000024418461,0.00006898242,0.00010977598,0.9862599,0.0052810595,0.0053474754,0.0016157815,0.000014195144],"about_ca_topic_score_codex":0.010160428,"about_ca_topic_score_gemma":0.006896411,"teacher_disagreement_score":0.010160428,"about_ca_system_score_codex":0.0011750578,"about_ca_system_score_gemma":0.0012004211,"threshold_uncertainty_score":0.020202577},"labels":[],"label_agreement":null},{"id":"W4318185132","doi":"10.1109/bigdata55660.2022.10020719","title":"From Data Warehouse to Lakehouse: A Comparative Review","year":2022,"lang":"en","type":"review","venue":"2022 IEEE International Conference on Big Data (Big Data)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":65,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University","funders":"","keywords":"Data warehouse; Computer science; Big data; Data science; Unstructured data; Data management; Data extraction; Analytics; Strengths and weaknesses; Data transformation; Data virtualization; Database; Data mining; Cloud computing","score_opus":0.9445247924110595,"score_gpt":0.5941263284283097,"score_spread":0.35039846398274976,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4318185132","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00010721733,0.9978928,0.00030703153,0.00048495387,0.00010704181,0.000010201019,0.000029078241,0.000008015,0.0010536273],"genre_scores_gemma":[0.0007362419,0.99817336,0.000569218,0.00025261138,0.000090505775,0.000012099252,0.000043313183,0.0000040381738,0.0001185109],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9984487,0.0003991753,0.00029800634,0.00020314187,0.00056065846,0.000090239984],"domain_scores_gemma":[0.9920392,0.005211985,0.0005698972,0.00016442945,0.0017865688,0.00022792224],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004710013,0.0008632672,0.0016209617,0.008820729,0.00055671204,0.0029137474,0.0021023443,0.0013763786,0.003942612],"category_scores_gemma":[0.007918675,0.0007103677,0.001130129,0.01868758,0.001201794,0.005366818,0.0014910166,0.0017421477,0.0016465914],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00009266986,0.000077797624,0.00053986185,0.04937923,0.00017405619,0.00011664714,0.00028627395,0.00041383723,0.0003335404,0.014120505,0.03354496,0.9009205],"study_design_scores_gemma":[0.000017727021,0.00011718158,0.0012627111,0.024655776,0.00025683423,0.0005879574,0.00041804864,0.00017196625,0.0003118061,0.004335397,0.96782255,0.000042080053],"about_ca_topic_score_codex":0.0041878875,"about_ca_topic_score_gemma":0.0065397513,"teacher_disagreement_score":0.008820729,"about_ca_system_score_codex":0.0018406397,"about_ca_system_score_gemma":0.004729199,"threshold_uncertainty_score":0.024909258},"labels":[],"label_agreement":null},{"id":"W4318187137","doi":"10.1109/bigdata55660.2022.10020293","title":"Entity Matching with AUC-Based Fairness","year":2022,"lang":"en","type":"article","venue":"2022 IEEE International Conference on Big Data (Big Data)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Computer science; Matching (statistics); Statistics; Mathematics","score_opus":0.6664563814827509,"score_gpt":0.4557380255016488,"score_spread":0.21071835598110206,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4318187137","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.037132047,0.00081251364,0.95734555,0.00075394026,0.000096234144,0.00014863956,0.00026444523,0.0010550558,0.0023916317],"genre_scores_gemma":[0.70722693,0.0003566648,0.2873195,0.00051867403,0.00020464674,0.00022845065,0.0007127209,0.00037595312,0.003056445],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9803161,0.009162597,0.0012787895,0.005053448,0.0032304153,0.0009585649],"domain_scores_gemma":[0.93071944,0.04092634,0.004897801,0.016207794,0.005929904,0.001318798],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.026785351,0.0012453592,0.002721226,0.0031801276,0.002043812,0.0050036134,0.0039262758,0.0031943105,0.002434625],"category_scores_gemma":[0.13645114,0.0006941913,0.0014895217,0.004596928,0.003615809,0.008819884,0.0066427207,0.0030064373,0.0008215393],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00089988665,0.00024368936,0.021934552,0.00023818508,0.0002861011,0.0002996953,0.000722184,0.57170427,0.0023005242,0.13289781,0.0054176617,0.2630554],"study_design_scores_gemma":[0.00002857802,0.00008540067,0.0013470734,0.000029211482,0.000032515436,0.00016792584,0.00006326329,0.8687935,0.0031717373,0.12376944,0.002472335,0.00003892709],"about_ca_topic_score_codex":0.0037303858,"about_ca_topic_score_gemma":0.0020426258,"teacher_disagreement_score":0.026785351,"about_ca_system_score_codex":0.0030007774,"about_ca_system_score_gemma":0.0032368263,"threshold_uncertainty_score":0.14165622},"labels":[],"label_agreement":null},{"id":"W4319163363","doi":"10.1016/j.infoandorg.2023.100450","title":"Data governance and digital innovation: A translational account of practitioner issues for IS research","year":2023,"lang":"en","type":"article","venue":"Information and Organization","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":39,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"HEC Montréal","funders":"","keywords":"Data governance; Corporate governance; Leverage (statistics); Scholarship; Process (computing); Knowledge management; Translational research; Public relations; Political science; Service (business); Sociology; Business; Data quality; Computer science; Marketing; Medicine","score_opus":0.3347722549072698,"score_gpt":0.48715743105209824,"score_spread":0.15238517614482844,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4319163363","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.018807817,0.029037993,0.057398435,0.81546825,0.0024330723,0.000096864445,0.00008423557,0.00010114277,0.076572254],"genre_scores_gemma":[0.86342967,0.041031316,0.026062096,0.05691861,0.0057889633,0.00026728763,0.000080599224,0.00015740356,0.006264032],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9794288,0.014978543,0.0008619132,0.000926091,0.0027424716,0.0010621605],"domain_scores_gemma":[0.83862,0.13708337,0.00429114,0.007935042,0.009235518,0.0028348006],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.054058667,0.00062515575,0.0010003386,0.007609109,0.0076412736,0.02430928,0.002403419,0.011084421,0.0070992014],"category_scores_gemma":[0.06611624,0.0004769751,0.00072241324,0.010339198,0.059700403,0.0352441,0.008421458,0.01081043,0.00057877204],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000016830034,0.000033128632,0.0012163962,0.00019787037,0.000008990274,0.00012227839,0.010586704,0.00022243132,0.000101779195,0.967455,0.0055342256,0.014504366],"study_design_scores_gemma":[0.000024442339,0.000050686147,0.0010632392,0.0013424191,0.00001886986,0.00031378464,0.029436637,0.0017516329,0.0003031743,0.8636753,0.10199207,0.000027727456],"about_ca_topic_score_codex":0.00523953,"about_ca_topic_score_gemma":0.0066027544,"teacher_disagreement_score":0.054058667,"about_ca_system_score_codex":0.010150562,"about_ca_system_score_gemma":0.018067293,"threshold_uncertainty_score":0.28589302},"labels":[],"label_agreement":null},{"id":"W4320024352","doi":"10.1109/bigdata55660.2022.10020258","title":"Review of Publically Available Health Big Data Sets","year":2022,"lang":"en","type":"article","venue":"2022 IEEE International Conference on Big Data (Big Data)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Victoria","funders":"University of Victoria","keywords":"Health informatics; Public health informatics; Computer science; Informatics; Usability; Data science; Dashboard; Data mining; Information retrieval; World Wide Web; Public health; Medicine; Health policy; International health; Engineering","score_opus":0.8077064389291911,"score_gpt":0.5061207953285485,"score_spread":0.30158564360064266,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4320024352","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013967888,0.7586977,0.015162415,0.036163013,0.0034144418,0.00093259965,0.14679027,0.0012141824,0.023657572],"genre_scores_gemma":[0.069992855,0.674496,0.033676088,0.011588323,0.0028793397,0.0018150486,0.20275864,0.00088221836,0.0019116073],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9697468,0.008623609,0.006593123,0.0025926472,0.01149096,0.0009527735],"domain_scores_gemma":[0.6788823,0.23960556,0.017606607,0.017650329,0.043102138,0.003153044],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.031556513,0.0010528865,0.0022519093,0.051593013,0.0017359986,0.005988922,0.004058817,0.0016072616,0.0057794875],"category_scores_gemma":[0.17177486,0.0014325803,0.002924943,0.055131003,0.002227793,0.007366271,0.005693455,0.0025081665,0.0015409369],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00034140688,0.000120888064,0.023355603,0.10689879,0.0016826637,0.0005018684,0.002406664,0.002688971,0.0012067872,0.03216124,0.26721948,0.5614157],"study_design_scores_gemma":[0.000032624925,0.000066475746,0.027799856,0.062882505,0.0006769891,0.0005831387,0.0020372183,0.0009506827,0.0010901388,0.007728277,0.89600104,0.00015104616],"about_ca_topic_score_codex":0.015418398,"about_ca_topic_score_gemma":0.025956936,"teacher_disagreement_score":0.051593013,"about_ca_system_score_codex":0.0043702116,"about_ca_system_score_gemma":0.018358639,"threshold_uncertainty_score":0.16688883},"labels":[],"label_agreement":null},{"id":"W4320924434","doi":"10.1007/978-3-031-25448-2_54","title":"Improving Maintenance Data Quality: Application of Natural Language Processing to Asset Management","year":2023,"lang":"en","type":"book-chapter","venue":"Lecture notes in mechanical engineering","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Hydro-Québec; Université du Québec à Trois-Rivières","funders":"","keywords":"Computer science; Asset (computer security); Asset management; Quality (philosophy); Data quality; Business; Computer security; Finance; Marketing","score_opus":0.07670199170063244,"score_gpt":0.3735223383615675,"score_spread":0.29682034666093504,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4320924434","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.026519056,0.0014636822,0.95075744,0.0014577797,0.0001759933,0.00018332635,0.0017689363,0.008969959,0.008703888],"genre_scores_gemma":[0.123117685,0.001008574,0.86824507,0.00028602598,0.000111450514,0.0001346594,0.0030802116,0.00050662394,0.0035096128],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.998869,0.0003148641,0.00011633186,0.00017733415,0.0004832801,0.000039106824],"domain_scores_gemma":[0.99398077,0.004461406,0.0003401479,0.00038827534,0.00077098195,0.000058376012],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0020342448,0.00055233546,0.00045182245,0.001438438,0.0003170747,0.0017057128,0.0010800987,0.00060538814,0.0024558322],"category_scores_gemma":[0.008054795,0.00028411,0.00063854904,0.0016753154,0.00046547697,0.0023341165,0.000673384,0.0010765191,0.0009385716],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013223436,0.00023246856,0.0018108118,0.00053337624,0.000049790415,0.00018739667,0.00044692794,0.01716116,0.019589588,0.012352109,0.020639513,0.92686474],"study_design_scores_gemma":[0.00007268599,0.00020523532,0.0053180493,0.00015895274,0.00011737913,0.00041678498,0.000469045,0.8045001,0.045484543,0.08988187,0.05329205,0.00008334499],"about_ca_topic_score_codex":0.0043476713,"about_ca_topic_score_gemma":0.0054760664,"teacher_disagreement_score":0.0043476713,"about_ca_system_score_codex":0.00067607826,"about_ca_system_score_gemma":0.0009728919,"threshold_uncertainty_score":0.010758281},"labels":[],"label_agreement":null},{"id":"W4322500097","doi":"10.36713/epra12492","title":"IMPORTANCE OF DATA INTEGRITY IN PHARMACEUTICAL INDUSTRY","year":2023,"lang":"en","type":"article","venue":"EPRA International Journal of Economics Business and Management Studies","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Data integrity; Metadata; Scientific integrity; Business; Computer science; Data science; Data retention; Personal Integrity; Computer security; Risk analysis (engineering); Engineering; World Wide Web","score_opus":0.532101745288129,"score_gpt":0.5177898149369912,"score_spread":0.01431193035113787,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4322500097","genre_codex":"commentary","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015555718,0.100852475,0.1574225,0.54493177,0.009604619,0.0006670778,0.00056924584,0.00039905426,0.16999754],"genre_scores_gemma":[0.56447154,0.14650464,0.14394392,0.09542075,0.017413994,0.00066637364,0.00064799754,0.000382078,0.030548858],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.8675841,0.07201685,0.012233169,0.00784217,0.037216846,0.0031068842],"domain_scores_gemma":[0.5877181,0.25375283,0.02739567,0.03171912,0.09482914,0.004585159],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.081745595,0.00060453935,0.001099164,0.005394117,0.007844061,0.028147431,0.0029665104,0.008259965,0.00365387],"category_scores_gemma":[0.17126788,0.00079511746,0.0013379488,0.012439098,0.021800518,0.029033868,0.0071906317,0.0134259425,0.0014923321],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000053227763,0.00006568265,0.005163329,0.0012583497,0.000058515092,0.00058833405,0.005507047,0.0011663254,0.00051666715,0.8428,0.023896279,0.118926145],"study_design_scores_gemma":[0.000019188443,0.00013308233,0.0027397382,0.0039302353,0.00008705557,0.0012064232,0.007014635,0.00262702,0.0023408446,0.330273,0.64949286,0.00013603628],"about_ca_topic_score_codex":0.012020617,"about_ca_topic_score_gemma":0.006223943,"teacher_disagreement_score":0.081745595,"about_ca_system_score_codex":0.014042829,"about_ca_system_score_gemma":0.03633405,"threshold_uncertainty_score":0.4323172},"labels":[],"label_agreement":null},{"id":"W4327523276","doi":"10.2139/ssrn.4385455","title":"Next-Generation Data Governance","year":2023,"lang":"en","type":"article","venue":"SSRN Electronic Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute on Governance","funders":"","keywords":"Corporate governance; Business; Accounting; Finance","score_opus":0.3451412591577748,"score_gpt":0.42382953442411975,"score_spread":0.07868827526634492,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4327523276","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.028884647,0.0050013186,0.61690307,0.0696385,0.003918984,0.00061474845,0.0014183816,0.0050833113,0.26853704],"genre_scores_gemma":[0.6324072,0.0041754413,0.24829969,0.020130724,0.0025124464,0.0008429786,0.0045730816,0.0008745472,0.08618388],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98711514,0.005677825,0.0008059764,0.0022089272,0.0031610853,0.0010311132],"domain_scores_gemma":[0.97522837,0.0047427495,0.0012623309,0.011800746,0.00481334,0.002152435],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.023153692,0.0004563503,0.00057450053,0.0015520015,0.001479821,0.008814746,0.0024228988,0.0029030778,0.017485153],"category_scores_gemma":[0.031106796,0.0004724816,0.0008502403,0.0018292015,0.002295519,0.012970723,0.008062582,0.0031746062,0.0052898726],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000058356418,0.00009703061,0.0043780985,0.00011593324,0.000054659366,0.00015842736,0.00061216817,0.0017873573,0.0013872356,0.810375,0.052538674,0.12843706],"study_design_scores_gemma":[0.00003707679,0.000091649956,0.0017324573,0.00029003434,0.00004418507,0.00031694153,0.00043306043,0.018309137,0.002367931,0.5161554,0.46017876,0.000043357573],"about_ca_topic_score_codex":0.0014686342,"about_ca_topic_score_gemma":0.0018378944,"teacher_disagreement_score":0.023153692,"about_ca_system_score_codex":0.0019546899,"about_ca_system_score_gemma":0.0051983334,"threshold_uncertainty_score":0.122449875},"labels":[],"label_agreement":null},{"id":"W4366549947","doi":"10.1145/3544548.3580868","title":"Governor: Turning Open Government Data Portals into Interactive Databases","year":2023,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Upload; Governor; Computer science; World Wide Web; Open data; Government (linguistics); Database; TRACE (psycholinguistics); Engineering","score_opus":0.5390147190723072,"score_gpt":0.5428906721109037,"score_spread":0.003875953038596447,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4366549947","genre_codex":"software","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05243037,0.0009501716,0.3262237,0.0035767022,0.0004334018,0.0022735086,0.02027268,0.5473707,0.046468765],"genre_scores_gemma":[0.23621559,0.0011809733,0.6567346,0.0020926935,0.00023131276,0.0015812562,0.0488719,0.026151098,0.026940644],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99436235,0.0016875896,0.0005440028,0.00084691995,0.002208474,0.00035066428],"domain_scores_gemma":[0.9856068,0.0045059794,0.0006319618,0.006366945,0.0015669174,0.0013213594],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008769537,0.0008177134,0.00084935286,0.0027902606,0.0014391259,0.0056720325,0.0029274737,0.0014685876,0.013181672],"category_scores_gemma":[0.023581468,0.0010789293,0.0010978663,0.0036643194,0.0014092461,0.009824083,0.011374217,0.0018417543,0.005902655],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002829167,0.0011462105,0.025927098,0.0014465863,0.00027085535,0.0014480534,0.008429489,0.005642185,0.018777855,0.054628037,0.4336577,0.4457968],"study_design_scores_gemma":[0.00055506796,0.0003433643,0.009556818,0.0004073826,0.00007767993,0.00069538236,0.002213764,0.051162563,0.013691404,0.03032339,0.8907035,0.00026968573],"about_ca_topic_score_codex":0.012039597,"about_ca_topic_score_gemma":0.014375665,"teacher_disagreement_score":0.013181672,"about_ca_system_score_codex":0.0014107763,"about_ca_system_score_gemma":0.002194641,"threshold_uncertainty_score":0.046378314},"labels":[],"label_agreement":null},{"id":"W4366683629","doi":"10.1145/3592534","title":"A Method to Classify Data Quality for Decision Making Under Uncertainty","year":2023,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval","funders":"Fonds de recherche du Québec – Nature et technologies; Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Data quality; Quality (philosophy); Context (archaeology); Process (computing); Data mining; Decision support system; Risk analysis (engineering); Data science","score_opus":0.6503576233917492,"score_gpt":0.6216140905973337,"score_spread":0.02874353279441544,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4366683629","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0033353672,0.00019916597,0.99320614,0.0004902125,0.00007266102,0.00033528375,0.0001735676,0.00039255054,0.0017950641],"genre_scores_gemma":[0.063798465,0.00014098501,0.9344884,0.00011728667,0.00006812442,0.0005521444,0.00022077364,0.000054009703,0.000559727],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9731752,0.010102546,0.0035936828,0.0031786463,0.009102407,0.0008475213],"domain_scores_gemma":[0.92610276,0.04548399,0.00754509,0.005876682,0.014014659,0.0009768547],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.023677204,0.0017291509,0.00196136,0.011814406,0.0023620091,0.007844283,0.0028095492,0.0026900647,0.0029185116],"category_scores_gemma":[0.07481039,0.0007125044,0.002684148,0.007943411,0.003243072,0.0068492605,0.0033002682,0.004078655,0.0007741687],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00040439027,0.00037104197,0.01369917,0.0011500852,0.0004142151,0.00030114967,0.0025693006,0.059808187,0.0065120915,0.1879009,0.0071943454,0.7196752],"study_design_scores_gemma":[0.00014527499,0.00038967986,0.0053758873,0.00091433886,0.00028963038,0.0006131352,0.0013689237,0.7195312,0.010372562,0.22873354,0.031952642,0.0003131651],"about_ca_topic_score_codex":0.004378161,"about_ca_topic_score_gemma":0.003098162,"teacher_disagreement_score":0.023677204,"about_ca_system_score_codex":0.0038981652,"about_ca_system_score_gemma":0.0044295914,"threshold_uncertainty_score":0.12521851},"labels":[],"label_agreement":null},{"id":"W4366959045","doi":"10.1109/wi-iat55865.2022.00014","title":"SMAT: String Matching in Action Theory","year":2022,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Lakehead University","funders":"","keywords":"String metric; String searching algorithm; Computer science; Heuristics; Edit distance; Approximate string matching; Commentz-Walter algorithm; Matching (statistics); Levenshtein distance; Formalism (music); String (physics); Pattern matching; Artificial intelligence; Theoretical computer science; Mathematics; Theoretical physics; Physics","score_opus":0.33880310067949526,"score_gpt":0.46709783886259926,"score_spread":0.128294738183104,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4366959045","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0010564105,0.00012447439,0.99376124,0.00019623492,0.00007484802,0.00008156218,0.00017503084,0.0012480597,0.0032821258],"genre_scores_gemma":[0.08168665,0.0004078607,0.91040677,0.00036537982,0.0002208044,0.0006647462,0.00086703757,0.0006114382,0.0047693276],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9964714,0.0012685504,0.00038134767,0.00074654026,0.00090095086,0.00023127456],"domain_scores_gemma":[0.9981085,0.0010431255,0.00017216399,0.00033005385,0.0002361834,0.00010998537],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0035761455,0.0010347866,0.0011048638,0.0028845144,0.0015619731,0.0035879028,0.0031720044,0.0023474323,0.01269481],"category_scores_gemma":[0.007979453,0.00075811136,0.003449671,0.0028629997,0.004810775,0.0064748754,0.003570611,0.0033650466,0.0037058562],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000054480784,0.00003333623,0.00020637154,0.00014787045,0.000027564372,0.00010528712,0.0002632069,0.01671219,0.0009095653,0.9281453,0.003413511,0.049981214],"study_design_scores_gemma":[0.000020634341,0.00003797307,0.00007901425,0.00004890485,0.000017088552,0.000076762015,0.000052758114,0.1177812,0.0013065065,0.85907274,0.021485405,0.000020946378],"about_ca_topic_score_codex":0.0034113177,"about_ca_topic_score_gemma":0.0022710834,"teacher_disagreement_score":0.01269481,"about_ca_system_score_codex":0.002198512,"about_ca_system_score_gemma":0.002308445,"threshold_uncertainty_score":0.04246837},"labels":[],"label_agreement":null},{"id":"W4367551721","doi":"10.1155/2023/8707205","title":"Mapping Relationship Discovery of Multidimensional Architectures in Autonomous Transportation System Based on Text-Matching Model","year":2023,"lang":"en","type":"article","venue":"Journal of Advanced Transportation","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"Innovation-Driven Project of Central South University; National Key Research and Development Program of China; Central South University","keywords":"Computer science; Matching (statistics); Data mining; Artificial intelligence; Similarity (geometry); Masking (illustration); Word (group theory); Similitude; Information retrieval; Natural language processing; Image (mathematics)","score_opus":0.07180389518918914,"score_gpt":0.3482732900291737,"score_spread":0.27646939483998456,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4367551721","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12792186,0.0006270512,0.86319727,0.0005777055,0.0000832827,0.00020219976,0.0013509811,0.0016724825,0.0043671564],"genre_scores_gemma":[0.7918157,0.00047027902,0.19821693,0.00016287676,0.00005434201,0.00027353963,0.0028548425,0.00007830251,0.0060732006],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9992545,0.0001221761,0.000082715254,0.00030425077,0.00017697069,0.000059373142],"domain_scores_gemma":[0.9993019,0.00028821157,0.00010095569,0.00007204238,0.00020628946,0.000030597406],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00070016144,0.000655137,0.00046303152,0.0022440974,0.0005169681,0.0008716755,0.001154253,0.0008909297,0.0020757862],"category_scores_gemma":[0.003217247,0.0002117026,0.0007923862,0.0023290839,0.00036683722,0.0030687833,0.0007597694,0.0005635483,0.00049094117],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00035031824,0.00029973508,0.01766828,0.0006001134,0.00018320515,0.0009808156,0.00080752047,0.32080814,0.014145132,0.028242419,0.009427407,0.6064869],"study_design_scores_gemma":[0.000011785347,0.00003172372,0.0014255818,0.000010960204,0.000027455062,0.00010222598,0.000080917634,0.98356956,0.0022011914,0.010876681,0.0016499028,0.00001198195],"about_ca_topic_score_codex":0.011056018,"about_ca_topic_score_gemma":0.0077975066,"teacher_disagreement_score":0.011056018,"about_ca_system_score_codex":0.000814648,"about_ca_system_score_gemma":0.0011305888,"threshold_uncertainty_score":0.021983325},"labels":[],"label_agreement":null},{"id":"W4368249689","doi":"10.1007/978-3-031-21147-8_24","title":"Sailing the Data Sea to Advance Research on the Sustainable Development Goals","year":2023,"lang":"en","type":"book-chapter","venue":"Philosophical studies series","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University; Western University; Université de Montréal","funders":"","keywords":"Metadata; Prosperity; Data science; Sustainable development; Sustainability; Computer science; Open data; Work (physics); World Wide Web; Political science; Engineering","score_opus":0.7781077524468246,"score_gpt":0.5436658511501645,"score_spread":0.2344419012966601,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4368249689","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0027127354,0.07034034,0.11591032,0.28183347,0.010580429,0.00009026589,0.00056178874,0.00025596668,0.5177147],"genre_scores_gemma":[0.12219836,0.14601557,0.14800286,0.057153057,0.010069296,0.00032189928,0.0010960603,0.001292138,0.51385087],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.99691725,0.0014571331,0.000115018345,0.00015818523,0.0012332096,0.00011917683],"domain_scores_gemma":[0.98514867,0.011087382,0.00037856007,0.0012217984,0.0017640165,0.00039953573],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.011624482,0.0004892724,0.00048529828,0.0023842745,0.0015249882,0.009603799,0.0010849661,0.002376121,0.01236233],"category_scores_gemma":[0.015792586,0.0003695706,0.00040649285,0.0047523957,0.009546807,0.020658527,0.004137682,0.007911146,0.0032299627],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000006194921,0.000009569897,0.00006932324,0.00008367612,0.0000040326577,0.000013491136,0.0007751284,0.00028369614,0.00012031242,0.8770823,0.08085638,0.04069585],"study_design_scores_gemma":[0.0000026797236,0.0000056257036,0.0001034708,0.00027644442,0.0000026121088,0.000031510077,0.000658028,0.0004303027,0.0002282108,0.42047194,0.5777816,0.0000075404178],"about_ca_topic_score_codex":0.004983854,"about_ca_topic_score_gemma":0.008676302,"teacher_disagreement_score":0.98837554,"about_ca_system_score_codex":0.003980088,"about_ca_system_score_gemma":0.0062892823,"threshold_uncertainty_score":0.061476886},"labels":[],"label_agreement":null},{"id":"W4376869324","doi":"10.18280/isi.280207","title":"A Schema Integration Approach for Big Data Analysis","year":2023,"lang":"en","type":"article","venue":"Ingénierie des systèmes d information","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Schema matching; NoSQL; Computer science; Data integration; Star schema; Schema (genetic algorithms); Conceptual schema; Database schema; Information schema; Schema evolution; Data mining; Schema migration; Information retrieval; Data science; Big data; Semi-structured model; Database design","score_opus":0.29287249228606804,"score_gpt":0.39120524986390676,"score_spread":0.09833275757783871,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4376869324","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0017139332,0.00044144507,0.9928548,0.00026207473,0.00005729435,0.00023405373,0.0004988299,0.002379077,0.001558569],"genre_scores_gemma":[0.022532696,0.00047448053,0.9717264,0.00022936917,0.000031847412,0.00024102483,0.0033113812,0.00035278543,0.0011000112],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99321425,0.0019686609,0.0010061382,0.0010274703,0.0025770601,0.0002064041],"domain_scores_gemma":[0.99466264,0.0012837246,0.00042670537,0.0020036965,0.0014028373,0.00022030919],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0073653515,0.0010975045,0.0010139737,0.005808887,0.001333906,0.005024896,0.0025840066,0.0015727534,0.0035356425],"category_scores_gemma":[0.010503275,0.0009421549,0.0031857088,0.00748526,0.0009832582,0.006526474,0.0046050386,0.002576435,0.0015179096],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00035413672,0.00059103756,0.01011721,0.0014058275,0.0010224404,0.0013696348,0.0030274931,0.036173258,0.020923309,0.28997782,0.027691614,0.60734624],"study_design_scores_gemma":[0.00007537718,0.00017815006,0.0036519056,0.0005546567,0.000426125,0.0018571897,0.0018273456,0.47542566,0.026239851,0.26023227,0.22938341,0.00014806038],"about_ca_topic_score_codex":0.003822097,"about_ca_topic_score_gemma":0.0052978,"teacher_disagreement_score":0.0073653515,"about_ca_system_score_codex":0.0011458249,"about_ca_system_score_gemma":0.0028302558,"threshold_uncertainty_score":0.038952112},"labels":[],"label_agreement":null},{"id":"W4378349663","doi":"10.1093/eurpub/ckab164.515","title":"Country experiences with data linkage initiatives","year":2021,"lang":"en","type":"article","venue":"European Journal of Public Health","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Microdata (statistics); Identifier; Government (linguistics); Record linkage; Health care; Linkage (software); Medicine; Census; Environmental health; Political science; Computer science; Population","score_opus":0.5558074311327259,"score_gpt":0.4778533447731891,"score_spread":0.07795408635953682,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4378349663","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.13372408,0.033694185,0.030053822,0.59250504,0.007940976,0.001811239,0.0070023653,0.0024768158,0.19079156],"genre_scores_gemma":[0.64855576,0.039928846,0.059082072,0.13390201,0.001741226,0.0025611166,0.012764375,0.0035549377,0.09790969],"study_design_codex":"not_applicable","study_design_gemma":"qualitative","domain_scores_codex":[0.7401298,0.15492794,0.014555913,0.013285301,0.047488477,0.029612502],"domain_scores_gemma":[0.583256,0.18456323,0.014078371,0.0377439,0.11599961,0.06435894],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.27098846,0.0008729188,0.0016528668,0.006697801,0.031503018,0.045181174,0.011453028,0.008368166,0.021874126],"category_scores_gemma":[0.2565024,0.002168569,0.0022532803,0.03315324,0.01474907,0.020224484,0.05290228,0.013670273,0.0027156349],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004262178,0.00040207052,0.049317848,0.0027733094,0.0003552962,0.003643406,0.2837024,0.0013449156,0.000626571,0.1289581,0.2977916,0.23065831],"study_design_scores_gemma":[0.000044752196,0.000072810326,0.0069303913,0.0014873563,0.0000627975,0.00048771952,0.09189099,0.00023966384,0.0002925692,0.0026118022,0.89573795,0.00014128642],"about_ca_topic_score_codex":0.45420542,"about_ca_topic_score_gemma":0.36995545,"teacher_disagreement_score":0.72901154,"about_ca_system_score_codex":0.057973944,"about_ca_system_score_gemma":0.15807408,"threshold_uncertainty_score":0.9031233},"labels":[],"label_agreement":null},{"id":"W4378782364","doi":"10.2196/44567","title":"Migrating a Well-Established Longitudinal Cohort Database From Oracle SQL to Research Electronic Data Entry (REDCap): Data Management Research and Design Study","year":2023,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"Schweizerischer Nationalfonds zur Förderung der Wissenschaftlichen Forschung; National Science Foundation","keywords":"Electronic data capture; Computer science; Data quality; Database; Data management; Electronic data; SQL; Information retrieval; Data collection; Data mining; Metric (unit); Engineering; Statistics","score_opus":0.6685705021262548,"score_gpt":0.6015098240105905,"score_spread":0.0670606781156643,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4378782364","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05026771,0.0032810138,0.7388311,0.0104114795,0.0026746618,0.059288904,0.088990726,0.026523167,0.019731186],"genre_scores_gemma":[0.07418605,0.0014121726,0.7774725,0.0066228462,0.0008253966,0.10237875,0.028672284,0.0038209525,0.004609087],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.8364484,0.1236038,0.019204348,0.007336062,0.011973527,0.0014338753],"domain_scores_gemma":[0.75576925,0.12722185,0.015935736,0.06559745,0.029068846,0.0064068083],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.18061551,0.0010162697,0.0015854132,0.00361221,0.0010418588,0.004838009,0.0041326256,0.0012653032,0.026421968],"category_scores_gemma":[0.16813579,0.0015206807,0.0024112747,0.006179721,0.0011981004,0.0031251812,0.0056296727,0.0025188997,0.0072959643],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.012352243,0.0015172971,0.063383535,0.011725016,0.0021615443,0.0007105307,0.005109463,0.0026140998,0.008351742,0.033832554,0.18294634,0.6752956],"study_design_scores_gemma":[0.008302292,0.006281909,0.089146264,0.0068804095,0.0023218372,0.0014200371,0.0021524446,0.013143433,0.030278496,0.025982404,0.81357163,0.0005187856],"about_ca_topic_score_codex":0.0025263785,"about_ca_topic_score_gemma":0.002408435,"teacher_disagreement_score":0.81938446,"about_ca_system_score_codex":0.0022882202,"about_ca_system_score_gemma":0.01435728,"threshold_uncertainty_score":0.9551976},"labels":[],"label_agreement":null},{"id":"W4381572165","doi":"10.2196/44331","title":"Optimizing Patient Record Linkage in a Master Patient Index Using Machine Learning: Algorithm Development and Validation","year":2023,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"Hamilton Health Sciences; McMaster University; Population Health Research Institute; University of Toronto","funders":"Strong; Bill and Melinda Gates Foundation; United States Agency for International Development","keywords":"Computer science; Matching (statistics); Machine learning; Population; Software; Linkage (software); Record linkage; Artificial intelligence; Interface (matter); Bayesian optimization; Set (abstract data type); Data mining; Programming language; Medicine; Operating system","score_opus":0.33027613605812656,"score_gpt":0.4740721920281339,"score_spread":0.14379605597000733,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4381572165","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.22284694,0.0006873513,0.7535523,0.00091075833,0.00009005723,0.0009584618,0.0010967429,0.01781921,0.002038107],"genre_scores_gemma":[0.31949982,0.00014980203,0.6757693,0.00028961708,0.00003687633,0.00096173165,0.0020237088,0.00046442522,0.00080465764],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9949857,0.002312803,0.00039169498,0.0012173676,0.0008403846,0.0002520901],"domain_scores_gemma":[0.98005176,0.014511725,0.0011163125,0.0017998148,0.0021737432,0.0003466094],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.012437542,0.0015281389,0.0012781243,0.0023235693,0.0010192227,0.001530141,0.002903967,0.0017369252,0.0022761002],"category_scores_gemma":[0.03694769,0.00090001395,0.0011682237,0.0021298532,0.0009377457,0.0014231625,0.001965604,0.0019701284,0.0008585815],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006099157,0.00066250184,0.020180253,0.00030593295,0.00035127773,0.00016716089,0.00025416186,0.7175884,0.0031022395,0.0021292432,0.0056235427,0.24902526],"study_design_scores_gemma":[0.000099200406,0.00010116381,0.0018385187,0.000024413355,0.000027885791,0.000063630825,0.000030837244,0.9910143,0.0039878236,0.0019226412,0.0008707125,0.000018913943],"about_ca_topic_score_codex":0.010062486,"about_ca_topic_score_gemma":0.0069417898,"teacher_disagreement_score":0.012437542,"about_ca_system_score_codex":0.002447515,"about_ca_system_score_gemma":0.004264635,"threshold_uncertainty_score":0.065776765},"labels":[],"label_agreement":null},{"id":"W4381938374","doi":"10.2196/44310","title":"Normal Workflow and Key Strategies for Data Cleaning Toward Real-World Data: Viewpoint","year":2023,"lang":"en","type":"article","venue":"Interactive Journal of Medical Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":29,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Workflow; Data quality; Computer science; Data science; Data governance; Data mining; Process (computing); Data virtualization; Data set; Data management; Key (lock); Quality (philosophy); Data cleansing; Database; Engineering; Computer security; Artificial intelligence","score_opus":0.7111703779494515,"score_gpt":0.6382519355459901,"score_spread":0.07291844240346135,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4381938374","genre_codex":"methods","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.003040413,0.00088556146,0.9879771,0.0049765115,0.00018056486,0.00024041784,0.0001117745,0.0005378168,0.002049898],"genre_scores_gemma":[0.111012235,0.0022806106,0.8817626,0.001016664,0.00038342617,0.0005225279,0.000501318,0.00023988936,0.002280725],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9677614,0.011877041,0.0035306467,0.00594394,0.009470595,0.0014162773],"domain_scores_gemma":[0.94934416,0.012608229,0.0035179034,0.013269846,0.019327538,0.0019323172],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.039062474,0.0013874454,0.0015844202,0.006544611,0.0034338913,0.0113084,0.0068890965,0.0030711167,0.0023678513],"category_scores_gemma":[0.060476158,0.001096224,0.002288339,0.0059490753,0.0078408625,0.015262354,0.0050104554,0.004408066,0.0015698158],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00026698748,0.00024413271,0.0060324306,0.0010335854,0.00013351259,0.00052175776,0.0026637663,0.0273294,0.0029439041,0.7142825,0.01701924,0.22752872],"study_design_scores_gemma":[0.0000693087,0.00015378596,0.0015750927,0.00041043296,0.00007102868,0.0009246128,0.0016799464,0.17009747,0.006236986,0.76289046,0.055749167,0.0001416451],"about_ca_topic_score_codex":0.010062234,"about_ca_topic_score_gemma":0.0042404733,"teacher_disagreement_score":0.9609375,"about_ca_system_score_codex":0.00439495,"about_ca_system_score_gemma":0.014925055,"threshold_uncertainty_score":0.20658457},"labels":[],"label_agreement":null},{"id":"W4383175845","doi":"10.5281/zenodo.8107872","title":"Data Remediation as Collaborative Process","year":2023,"lang":"en","type":"paratext","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Guelph","funders":"","keywords":"Process (computing); Computer science; Environmental remediation; Process management; Process engineering; Engineering; Operating system; Contamination","score_opus":0.28152297107503876,"score_gpt":0.4339006903726039,"score_spread":0.15237771929756516,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4383175845","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0056905663,0.0008583023,0.9448277,0.009008625,0.0003087482,0.0005442772,0.000110500085,0.0013284908,0.037322924],"genre_scores_gemma":[0.27352822,0.001491838,0.6909738,0.001842021,0.0005260452,0.0014190704,0.00073116657,0.0008356573,0.028652135],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.8727633,0.06531159,0.008770292,0.013922622,0.03592498,0.0033071681],"domain_scores_gemma":[0.78106976,0.113123804,0.012036968,0.07030837,0.020685729,0.0027753438],"candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.07709505,0.0015756089,0.0016256155,0.0077681844,0.0054582674,0.021160003,0.008091235,0.0063789296,0.0069657383],"category_scores_gemma":[0.15208401,0.00096179865,0.0019841366,0.007824395,0.027632974,0.031123497,0.026733538,0.0073153023,0.0026957456],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00002972703,0.000057120684,0.0005681777,0.00021131703,0.000024162722,0.00016775404,0.0069408063,0.0015131652,0.0005625365,0.9283461,0.0026067074,0.058972396],"study_design_scores_gemma":[0.00006529654,0.0000777885,0.00031575872,0.0004630293,0.000055143264,0.0004168868,0.002608239,0.009158936,0.003114635,0.7204808,0.26315752,0.00008587105],"about_ca_topic_score_codex":0.005055619,"about_ca_topic_score_gemma":0.001731678,"teacher_disagreement_score":0.9919088,"about_ca_system_score_codex":0.0047209454,"about_ca_system_score_gemma":0.014137352,"threshold_uncertainty_score":0.40772247},"labels":[],"label_agreement":null},{"id":"W4384524480","doi":"10.51964/hlcs15759","title":"Introduction: Content, Design and Structure of Major Databases with Historical Longitudinal Population Data","year":2023,"lang":"en","type":"article","venue":"Historical Life Course Studies","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Chicoutimi","funders":"","keywords":"Linkage (software); Data science; Crowdsourcing; Computer science; Database; Population; Information retrieval; World Wide Web; Sociology","score_opus":0.5645442949893535,"score_gpt":0.43977901725878454,"score_spread":0.124765277730569,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4384524480","genre_codex":"methods","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.033033602,0.006038769,0.8027377,0.02555218,0.0051197805,0.0065102126,0.068957694,0.010076385,0.0419737],"genre_scores_gemma":[0.099867746,0.004615055,0.810987,0.003880607,0.0034496044,0.006774627,0.048227403,0.002684768,0.019513123],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.98718494,0.0062297937,0.001618894,0.0017841281,0.0028709406,0.00031124838],"domain_scores_gemma":[0.9475303,0.024313793,0.0029735481,0.009499061,0.01451161,0.0011717795],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.019912511,0.0005195294,0.0006430697,0.004586717,0.0019090981,0.007745533,0.0021890283,0.0011254364,0.018177299],"category_scores_gemma":[0.065433875,0.0009283216,0.00090029015,0.0076970127,0.0016343739,0.00503217,0.0030690695,0.0014994136,0.00791329],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00062898936,0.00029281576,0.014267286,0.0019825948,0.00013100209,0.00017517316,0.0023878084,0.004460858,0.005098068,0.09478725,0.39793515,0.47785306],"study_design_scores_gemma":[0.0001682744,0.00036678943,0.012822487,0.001233557,0.00015258012,0.0005449019,0.0013061124,0.016024662,0.013978966,0.04945958,0.90379375,0.00014825656],"about_ca_topic_score_codex":0.0022147347,"about_ca_topic_score_gemma":0.0014044484,"teacher_disagreement_score":0.019912511,"about_ca_system_score_codex":0.0019401985,"about_ca_system_score_gemma":0.0031186948,"threshold_uncertainty_score":0.10530871},"labels":[],"label_agreement":null},{"id":"W4384525924","doi":"10.3390/s23146443","title":"Empowering Patient Similarity Networks through Innovative Data-Quality-Aware Federated Profiling","year":2023,"lang":"en","type":"article","venue":"Sensors","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Humber Polytechnic","funders":"","keywords":"Computer science; Data mining; Data quality; Quality assurance; Profiling (computer programming); Outlier; Classifier (UML); Data integrity; Metadata; Machine learning; Artificial intelligence; Database; Engineering","score_opus":0.36624541897583285,"score_gpt":0.49565355172024805,"score_spread":0.1294081327444152,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4384525924","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.048072625,0.00036940022,0.94821,0.00077768957,0.00006461433,0.00014693136,0.00026629568,0.000936846,0.0011555934],"genre_scores_gemma":[0.83851224,0.00027572102,0.15911117,0.000371672,0.00005716661,0.00012672861,0.0006385244,0.000044513847,0.0008622728],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9961498,0.0015599827,0.00028458805,0.00080745504,0.000925216,0.00027292507],"domain_scores_gemma":[0.9948827,0.0019068435,0.00089959684,0.0009662842,0.0010256352,0.0003189647],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004711057,0.00076230627,0.0010699002,0.0017026407,0.0006853907,0.0019102314,0.001723545,0.0010983021,0.0006321236],"category_scores_gemma":[0.013847757,0.0002848211,0.00064575236,0.0018363302,0.00066676777,0.003596701,0.0033921166,0.0012681524,0.00023808295],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00073540705,0.0005158082,0.036846187,0.0002979565,0.0002335,0.00063330756,0.0009221841,0.34853584,0.0083317235,0.023942897,0.0048441277,0.5741611],"study_design_scores_gemma":[0.000015602518,0.00015197275,0.0023424346,0.000035206518,0.00003821664,0.00035074496,0.00020673084,0.96677196,0.004391476,0.023054283,0.0026179687,0.000023471996],"about_ca_topic_score_codex":0.0017148041,"about_ca_topic_score_gemma":0.0018705487,"teacher_disagreement_score":0.004711057,"about_ca_system_score_codex":0.0012476209,"about_ca_system_score_gemma":0.0012648219,"threshold_uncertainty_score":0.024914801},"labels":[],"label_agreement":null},{"id":"W4385269654","doi":"10.1109/wimob58348.2023.10187831","title":"UbiSecE: UbiLab’s Secure Cloud Environment for Public Health Research in Microsoft Azure","year":2023,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Cloud computing; Corporate governance; Computer security; Public health; Computer science; Business; Medicine","score_opus":0.8048605200246887,"score_gpt":0.5722741108240867,"score_spread":0.23258640920060192,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4385269654","genre_codex":"software","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08634112,0.00624737,0.30149832,0.01175035,0.0011766767,0.0038095287,0.02047236,0.37113455,0.19756974],"genre_scores_gemma":[0.4959695,0.0048641735,0.32810855,0.0046124184,0.0008961993,0.004075592,0.035973854,0.01994114,0.10555844],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9968014,0.0005396499,0.00021917887,0.00065288553,0.0011787071,0.0006082127],"domain_scores_gemma":[0.99456763,0.0009159755,0.0004864714,0.002061348,0.0006663603,0.0013022318],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0056880154,0.0010765765,0.0009570523,0.001427135,0.0015454743,0.0066994834,0.0029855913,0.0014197303,0.036314312],"category_scores_gemma":[0.00864737,0.0010463643,0.0008207917,0.0013882125,0.0015343247,0.0072571277,0.007851661,0.0027103364,0.020204665],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0067413044,0.0005579069,0.007165731,0.00083093974,0.00020881703,0.0025897855,0.0032504508,0.0050786114,0.0443877,0.09056256,0.6066692,0.23195702],"study_design_scores_gemma":[0.0017193747,0.0005312203,0.022331353,0.0008102255,0.00012853202,0.0016311641,0.001005523,0.046396937,0.031228354,0.04058742,0.85324097,0.00038889342],"about_ca_topic_score_codex":0.0062600225,"about_ca_topic_score_gemma":0.00418253,"teacher_disagreement_score":0.036314312,"about_ca_system_score_codex":0.00202644,"about_ca_system_score_gemma":0.003393234,"threshold_uncertainty_score":0.121483445},"labels":[],"label_agreement":null},{"id":"W4385571965","doi":"10.18653/v1/2023.findings-acl.604","title":"AnaMeta: A Table Understanding Dataset of Field Metadata Knowledge Shared by Multi-dimensional Data Analysis Tasks","year":2023,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Metadata; Computer science; Field (mathematics); Metadata repository; Table (database); Information retrieval; Dimension (graph theory); Data element; Data type; Data mining; World Wide Web","score_opus":0.6644636814897413,"score_gpt":0.5129623906594967,"score_spread":0.15150129083024466,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4385571965","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.088391125,0.001634736,0.021177392,0.0013061598,0.00029016403,0.00057872006,0.86597216,0.014733926,0.0059156073],"genre_scores_gemma":[0.07394949,0.00039697497,0.05785045,0.00030796952,0.000073482544,0.0006027638,0.8651701,0.00030845276,0.0013403703],"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9979171,0.0003594182,0.0003685009,0.00062866474,0.000602273,0.00012396391],"domain_scores_gemma":[0.9927598,0.0022669635,0.0008136519,0.0020449022,0.0015579504,0.00055672624],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0015866916,0.0012655214,0.00082553946,0.004331646,0.0011577157,0.002027831,0.002445639,0.0016292568,0.0037332117],"category_scores_gemma":[0.010986995,0.00046595,0.00163228,0.005191008,0.0006740148,0.0027845083,0.0020295128,0.0016312606,0.003116934],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015751396,0.0014654496,0.08483682,0.0042094905,0.0007922995,0.0011253428,0.0011917577,0.018591585,0.013827999,0.009785661,0.7028996,0.1596989],"study_design_scores_gemma":[0.0010886752,0.00072032254,0.18003102,0.00074877695,0.00036600415,0.0019545956,0.0029306747,0.13392259,0.01659161,0.028882232,0.6323398,0.0004238125],"about_ca_topic_score_codex":0.0238582,"about_ca_topic_score_gemma":0.053362753,"teacher_disagreement_score":0.0238582,"about_ca_system_score_codex":0.0016584228,"about_ca_system_score_gemma":0.0029800606,"threshold_uncertainty_score":0.04743862},"labels":[],"label_agreement":null},{"id":"W4385796912","doi":"10.5281/zenodo.8213503","title":"ARDC survey on cloud services usage in research","year":2023,"lang":"en","type":"report","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Cloud computing; Computer science; Survey research; Data science; World Wide Web; Business; Operating system","score_opus":0.6484422039557307,"score_gpt":0.49571621073802463,"score_spread":0.15272599321770608,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4385796912","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.713887,0.005197111,0.0038251826,0.022415346,0.00055663136,0.003744872,0.12426286,0.0006528582,0.12545818],"genre_scores_gemma":[0.8572621,0.011258806,0.0085767,0.014174742,0.00029495722,0.0071370807,0.05008539,0.00023719203,0.050973058],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.98675704,0.005234198,0.0017682122,0.0006835792,0.004327104,0.001229836],"domain_scores_gemma":[0.9603557,0.0120204715,0.0062600267,0.0016095833,0.015518425,0.0042357137],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01447133,0.00016092161,0.0003294902,0.0022978724,0.00085019134,0.0013050671,0.00078791066,0.0006748819,0.009527046],"category_scores_gemma":[0.024243703,0.00031502396,0.00030520544,0.0064684027,0.00033582412,0.001504465,0.0016235659,0.0009764434,0.0042452766],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00023838892,0.00049667864,0.40362298,0.0024056504,0.000057126865,0.00018822323,0.018467363,0.00038263237,0.0012407603,0.0030227462,0.4155288,0.15434864],"study_design_scores_gemma":[0.00001997098,0.00023622888,0.67975754,0.0007752449,0.0000114381355,0.00015544362,0.020781893,0.00041480362,0.00038315915,0.00019823095,0.2972157,0.00005031939],"about_ca_topic_score_codex":0.04733711,"about_ca_topic_score_gemma":0.043101132,"teacher_disagreement_score":0.98552865,"about_ca_system_score_codex":0.0033544446,"about_ca_system_score_gemma":0.005003602,"threshold_uncertainty_score":0.094123185},"labels":[],"label_agreement":null},{"id":"W4385816875","doi":"10.1007/978-3-031-24498-8","title":"Data Governance and Policy in Africa","year":2023,"lang":"en","type":"book","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Consortium pour la recherche économique en Afrique; University of Cape Town; National Research Foundation; Göteborgs Universitet; European Commission; Department of Science and Technology, Ministry of Science and Technology, India; University of Oxford; Japan International Cooperation Agency; International Development Research Centre; University of Fort Hare; African Union; International Fine Particle Research Institute; Government of the Republic of Kenya","keywords":"Corporate governance; Political science; Public administration; Data governance; Business; Economics; Economy; Finance; Data quality","score_opus":0.4414745369931295,"score_gpt":0.46369257914321055,"score_spread":0.022218042150081052,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4385816875","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.003458016,0.15275562,0.0083630495,0.10319008,0.005699356,0.00010470759,0.00035097863,0.000148945,0.7259292],"genre_scores_gemma":[0.076699086,0.2017272,0.007415499,0.0117509905,0.0031558515,0.000223198,0.00044576023,0.00026181198,0.69832057],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9988519,0.00049552607,0.00004573346,0.00008895145,0.00034006216,0.00017778866],"domain_scores_gemma":[0.9973884,0.0019635207,0.00011275427,0.00011226692,0.00028698344,0.00013602733],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002148756,0.00045153932,0.00037372668,0.0012578586,0.0024101234,0.008722406,0.0005277319,0.001563502,0.01367689],"category_scores_gemma":[0.006131745,0.00031732934,0.00020110194,0.0047931285,0.0032391285,0.007983983,0.002071152,0.0021658156,0.0028279312],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000007683262,0.000012032195,0.00014559893,0.00022035075,0.0000033963904,0.00009002836,0.0014396716,0.00073591527,0.00014042243,0.68967277,0.23129293,0.07623919],"study_design_scores_gemma":[0.0000020162986,0.000004475394,0.00017258196,0.0003869147,0.0000015233645,0.000046306148,0.00077956216,0.00016569685,0.000077358374,0.05624143,0.94211745,0.000004705822],"about_ca_topic_score_codex":0.008728985,"about_ca_topic_score_gemma":0.009539767,"teacher_disagreement_score":0.01367689,"about_ca_system_score_codex":0.0041659893,"about_ca_system_score_gemma":0.005270223,"threshold_uncertainty_score":0.045753717},"labels":[],"label_agreement":null},{"id":"W4386399195","doi":"10.2307/jj.6445824.13","title":"An Overview of the BALSAC Population Database.","year":2023,"lang":"en","type":"book-chapter","venue":"Radboud University Press eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Université du Québec à Chicoutimi","funders":"Université de Montréal; Université du Québec à Chicoutimi; McGill University; Université Laval","keywords":"Database; Computer science","score_opus":0.4115540489772465,"score_gpt":0.39047241864154,"score_spread":0.021081630335706536,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4386399195","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.003864812,0.015715566,0.015299236,0.0031583924,0.00041893168,0.00060331775,0.90767086,0.00814956,0.045119256],"genre_scores_gemma":[0.018439645,0.010899033,0.03810984,0.0011679543,0.0002462398,0.00062430056,0.90933156,0.0012391001,0.019942423],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9972561,0.00037581992,0.0003407502,0.00044985503,0.0013266789,0.00025085406],"domain_scores_gemma":[0.9879353,0.0014867042,0.0007272842,0.0014364881,0.0073340447,0.0010802401],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003784456,0.00085713336,0.0009609968,0.015416474,0.0017299743,0.004275061,0.0024163637,0.0009284605,0.03306072],"category_scores_gemma":[0.012477227,0.000500389,0.0005123204,0.028970733,0.0005334798,0.0026915297,0.0019164418,0.0013412168,0.019571234],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001204517,0.00003538863,0.009816059,0.0009576885,0.00007102613,0.00010798467,0.00023447466,0.0009812262,0.00048154272,0.007096168,0.80244505,0.17765296],"study_design_scores_gemma":[0.000011371785,0.000006363178,0.009002702,0.0002945646,0.000015547523,0.00010461219,0.000079781275,0.00064755196,0.00019315458,0.0006901229,0.9889233,0.000030903462],"about_ca_topic_score_codex":0.7349519,"about_ca_topic_score_gemma":0.7327468,"teacher_disagreement_score":0.7349519,"about_ca_system_score_codex":0.011605247,"about_ca_system_score_gemma":0.024719756,"threshold_uncertainty_score":0.533218},"labels":[],"label_agreement":null},{"id":"W4386399277","doi":"10.2307/jj.6445824.4","title":"Introduction:","year":2023,"lang":"en","type":"book-chapter","venue":"Radboud University Press eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Chicoutimi","funders":"","keywords":"Computer science","score_opus":0.19240006459690023,"score_gpt":0.3137238721674182,"score_spread":0.12132380757051797,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4386399277","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0007261092,0.007406384,0.0029937841,0.011893888,0.011002741,0.00015067178,0.0034780125,0.0009083942,0.9614401],"genre_scores_gemma":[0.0031408563,0.0029542698,0.0015624927,0.0033840034,0.0014656802,0.000068043846,0.0019118754,0.0003253672,0.9851874],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9988475,0.00015349223,0.00006274947,0.0002928136,0.00053034973,0.00011303623],"domain_scores_gemma":[0.9988237,0.00020907237,0.000055059467,0.00016740887,0.00053185783,0.00021294218],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.001060166,0.0009753602,0.00065477024,0.0016438093,0.0021339098,0.0068212664,0.0017882856,0.0029837338,0.48564854],"category_scores_gemma":[0.003124764,0.00030691858,0.00063199166,0.0019364301,0.0011818615,0.0051730685,0.003466924,0.0025141716,0.37334174],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000030406653,0.000023612849,0.00015262017,0.00018371764,0.000002487879,0.00006546402,0.00026508223,0.000049223167,0.00016511463,0.03586995,0.8617575,0.10143487],"study_design_scores_gemma":[0.0000014704605,0.00000456292,0.00008178946,0.00006652062,6.5007555e-7,0.000054325796,0.000049929706,0.000012990469,0.0000365412,0.0022031628,0.997486,0.0000020820835],"about_ca_topic_score_codex":0.0034648294,"about_ca_topic_score_gemma":0.0052733766,"teacher_disagreement_score":0.5143515,"about_ca_system_score_codex":0.002139969,"about_ca_system_score_gemma":0.001978401,"threshold_uncertainty_score":0.7336599},"labels":[],"label_agreement":null},{"id":"W43864256","doi":"","title":"ptafflist - Utilisation des données du site du Gouvernement du Canada","year":2005,"lang":"fr","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Political science","score_opus":0.108488946171131,"score_gpt":0.31258719403150376,"score_spread":0.20409824786037276,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W43864256","genre_codex":"empirical","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.51225775,0.011566809,0.041495703,0.0060836514,0.0006024113,0.0012754007,0.302705,0.011651044,0.11236223],"genre_scores_gemma":[0.7499656,0.004551333,0.06732907,0.00063758343,0.00007504906,0.00046484132,0.10166138,0.0011556413,0.07415957],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9865601,0.0012432602,0.0006952234,0.0014356793,0.009113643,0.00095221767],"domain_scores_gemma":[0.9685582,0.006566705,0.0011061686,0.0017241781,0.020585332,0.001459516],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006520343,0.0008090344,0.0010328867,0.01030264,0.0037184146,0.006826625,0.0019247697,0.0009930615,0.0105032055],"category_scores_gemma":[0.029003128,0.0006059758,0.0013292815,0.011757015,0.0011014747,0.0017229855,0.00169092,0.0010242567,0.002697514],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000981544,0.00025242392,0.28355774,0.002737514,0.000722198,0.0007368867,0.0051238616,0.0216182,0.010569618,0.009917574,0.113238305,0.55054414],"study_design_scores_gemma":[0.0002616062,0.0002685474,0.5311616,0.0011370692,0.0003768646,0.0004436499,0.006834864,0.03979923,0.01584132,0.0021011662,0.4013563,0.00041769687],"about_ca_topic_score_codex":0.98786944,"about_ca_topic_score_gemma":0.9887332,"teacher_disagreement_score":0.9570681,"about_ca_system_score_codex":0.042931937,"about_ca_system_score_gemma":0.07405433,"threshold_uncertainty_score":0.31149447},"labels":[],"label_agreement":null},{"id":"W4386528130","doi":"10.5281/zenodo.8322584","title":"Tracing data: A survey investigating disciplinary differences in data citation","year":2023,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal; University of Ottawa","funders":"","keywords":"Citation; Tracing; Discipline; Computer science; Survey data collection; Data science; Library science; Statistics; Programming language; Sociology; Mathematics; Social science","score_opus":0.6841979718495724,"score_gpt":0.4488876378466068,"score_spread":0.23531033400296564,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4386528130","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.98656553,0.0041655237,0.0021801381,0.0018024818,0.000029154473,0.00008201878,0.0016513725,0.00003254511,0.0034911644],"genre_scores_gemma":[0.99054104,0.004104063,0.002336619,0.00047335334,0.000042742176,0.00016021768,0.0015163386,0.000040523748,0.0007850644],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.967993,0.0137469685,0.0068474542,0.0025199903,0.0078122793,0.0010802948],"domain_scores_gemma":[0.66739124,0.23065509,0.052509826,0.011441172,0.032970067,0.005032633],"candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.04061208,0.00019899709,0.0007455816,0.013998471,0.0012763651,0.0033631008,0.00093358284,0.001037262,0.0013779149],"category_scores_gemma":[0.16449372,0.000381263,0.0005371768,0.027179481,0.0013921711,0.0046401676,0.0027016632,0.00086110417,0.0005831834],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000094413306,0.0000870851,0.87484175,0.0011108752,0.00013550896,0.00014277645,0.03854747,0.00013953369,0.00072186685,0.0013983375,0.0020060954,0.0807743],"study_design_scores_gemma":[0.000018565544,0.00019643967,0.8697653,0.0011358225,0.000104477374,0.00095330755,0.088297844,0.0007889379,0.00096892327,0.0022057036,0.035475418,0.000089223126],"about_ca_topic_score_codex":0.0032039161,"about_ca_topic_score_gemma":0.0037230242,"teacher_disagreement_score":0.98600155,"about_ca_system_score_codex":0.0016666292,"about_ca_system_score_gemma":0.0023939996,"threshold_uncertainty_score":0.2147798},"labels":[],"label_agreement":null},{"id":"W4386733095","doi":"10.2139/ssrn.4563380","title":"Using Network Science to Provide Insights into the Structure of Event Knowledge","year":2023,"lang":"en","type":"preprint","venue":"SSRN Electronic Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University; Western University","funders":"","keywords":"Event (particle physics); Data science; Computer science; Knowledge management; Physics","score_opus":0.12326988137027868,"score_gpt":0.4293816548885598,"score_spread":0.3061117735182811,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4386733095","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.06896855,0.0019201356,0.90520334,0.005867264,0.00009969026,0.000087955545,0.0017141236,0.00026777782,0.015871221],"genre_scores_gemma":[0.7742924,0.002976179,0.21676286,0.0003301705,0.00025478125,0.00018020475,0.0017946771,0.000106597676,0.00330211],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.997396,0.0012983897,0.00016917706,0.00055526145,0.0004499207,0.00013123931],"domain_scores_gemma":[0.9397139,0.050622772,0.003603698,0.0035871759,0.0016856818,0.00078683026],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005236596,0.0005770007,0.00082182547,0.0075666057,0.0012700877,0.0058988202,0.0013072721,0.0016031722,0.007292063],"category_scores_gemma":[0.051597133,0.0006234813,0.0008696951,0.008326449,0.003395044,0.01730175,0.002648656,0.0023176684,0.0005677216],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000090307374,0.00006842577,0.012569814,0.0002465317,0.00016117466,0.0001657867,0.0013519598,0.039431933,0.000873929,0.893851,0.0020588883,0.049130328],"study_design_scores_gemma":[0.000008994917,0.00001131982,0.0018226681,0.00005764402,0.000026081103,0.00004042688,0.00025237302,0.06949342,0.00023454241,0.92513186,0.00290636,0.0000143431635],"about_ca_topic_score_codex":0.0062599634,"about_ca_topic_score_gemma":0.005658749,"teacher_disagreement_score":0.0075666057,"about_ca_system_score_codex":0.0022182686,"about_ca_system_score_gemma":0.0017667842,"threshold_uncertainty_score":0.027694106},"labels":[],"label_agreement":null},{"id":"W4386942653","doi":"10.48550/arxiv.2309.10880","title":"Classifying Organizations for Food System Ontologies using Natural Language Processing","year":2023,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Canadian Institutes of Health Research; National Science Foundation","keywords":"Computer science; Artificial intelligence; Natural language processing; Government (linguistics); Information retrieval; Data science","score_opus":0.48326968158249645,"score_gpt":0.3328273787771146,"score_spread":0.15044230280538184,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4386942653","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.19303839,0.0005926312,0.740149,0.005687548,0.0001530128,0.0017567935,0.030781815,0.006693515,0.021147242],"genre_scores_gemma":[0.3841487,0.00037180085,0.57588726,0.0005059016,0.00004076865,0.0006910692,0.035901494,0.00028791075,0.002165118],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99745375,0.0007645415,0.00027223147,0.00059838395,0.0008057671,0.0001052854],"domain_scores_gemma":[0.9916956,0.005121859,0.00096623076,0.0009114344,0.0011444602,0.00016050373],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0025033026,0.00056254555,0.00035086664,0.0068222554,0.0010184015,0.0027745017,0.0009079744,0.000897557,0.0028524813],"category_scores_gemma":[0.014048184,0.00026020504,0.0013293055,0.004694013,0.0008297944,0.004183307,0.00132936,0.0011168959,0.0009815613],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00029585054,0.0009894873,0.07979369,0.0014390689,0.00027377022,0.0011653885,0.004447632,0.11092387,0.013469624,0.13327743,0.051326267,0.60259795],"study_design_scores_gemma":[0.000068488516,0.00007939127,0.020788526,0.0002800594,0.00010697282,0.00030635876,0.003384918,0.6925463,0.010002092,0.18228975,0.09006468,0.00008241973],"about_ca_topic_score_codex":0.021030547,"about_ca_topic_score_gemma":0.0359545,"teacher_disagreement_score":0.021030547,"about_ca_system_score_codex":0.0033863378,"about_ca_system_score_gemma":0.0029267124,"threshold_uncertainty_score":0.041816294},"labels":[],"label_agreement":null},{"id":"W4387012786","doi":"10.18438/eblip30382","title":"Continuing Education and Data Training Initiatives are Needed to Positively Impact Academic Librarians Providing Data Services","year":2023,"lang":"en","type":"article","venue":"Evidence Based Library and Information Practice","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Medical education; Government (linguistics); Likert scale; Computer science; Psychology; Medicine","score_opus":0.23970072358886668,"score_gpt":0.4603316262883908,"score_spread":0.22063090269952412,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4387012786","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01796031,0.027375367,0.004579024,0.8677483,0.011500038,0.0011758067,0.000621648,0.0014355,0.06760395],"genre_scores_gemma":[0.19292492,0.087076195,0.106062375,0.45653522,0.0142670525,0.005382932,0.0035172869,0.0005215339,0.13371249],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9897069,0.0041571953,0.0004552529,0.00054700597,0.0031234948,0.0020101417],"domain_scores_gemma":[0.85630214,0.037540853,0.005942418,0.0043652705,0.02097132,0.07487797],"candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.020711325,0.0007805281,0.0009033917,0.002727892,0.0037569338,0.013486465,0.0029421046,0.008055904,0.07110604],"category_scores_gemma":[0.07315221,0.0005036497,0.0012547033,0.0028625585,0.0016546588,0.01004385,0.010284044,0.006859024,0.013888084],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00004718578,0.0013938671,0.0039107087,0.0019123972,0.000035725672,0.00013113463,0.0010348244,0.00012938963,0.00026452434,0.004746382,0.38075894,0.6056349],"study_design_scores_gemma":[0.00028943273,0.0004545238,0.034612067,0.0077480045,0.00007309371,0.00029684682,0.010544035,0.00020830086,0.0004155175,0.010734585,0.9345424,0.00008111348],"about_ca_topic_score_codex":0.008184975,"about_ca_topic_score_gemma":0.021215199,"teacher_disagreement_score":0.98651356,"about_ca_system_score_codex":0.0045896657,"about_ca_system_score_gemma":0.052014887,"threshold_uncertainty_score":0.23787344},"labels":[],"label_agreement":null},{"id":"W4387267360","doi":"10.21900/j.alise.2023.1266","title":"Data Literacy Proficiency and Its Importance","year":2023,"lang":"en","type":"article","venue":"Proceedings of the ALISE Annual Conference","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Information literacy; Literacy; Perception; Psychology; Rank (graph theory); Association (psychology); Library science; Survey data collection; Medical education; Computer science; Medicine; Mathematics; Pedagogy; Statistics","score_opus":0.2659070268639109,"score_gpt":0.4312554664129052,"score_spread":0.1653484395489943,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4387267360","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.984814,0.0003894247,0.00044182487,0.0008448479,0.000017064116,0.00003135463,0.00014770334,0.000012020094,0.013301779],"genre_scores_gemma":[0.9989876,0.00012937651,0.00018024509,0.000083062274,0.000010785813,0.000008119181,0.000055078537,0.0000026125676,0.0005431009],"study_design_codex":"observational","study_design_gemma":"not_applicable","domain_scores_codex":[0.9940718,0.002026228,0.00069133163,0.00035231808,0.002230668,0.00062764436],"domain_scores_gemma":[0.9433007,0.027500646,0.012662538,0.0017467571,0.009950562,0.0048387116],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004032704,0.00014853026,0.00023040742,0.0022629478,0.000862727,0.0028094212,0.00050738914,0.00035890526,0.0048599904],"category_scores_gemma":[0.038486216,0.00019700686,0.00037827983,0.0019038283,0.0018318021,0.0010871948,0.0019208117,0.0010088735,0.0004056018],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00007467686,0.000112335045,0.9562336,0.000103686456,0.000043580938,0.00015064265,0.011064458,0.000063656495,0.0005101395,0.00046335493,0.0004949103,0.030684875],"study_design_scores_gemma":[0.0000043693904,0.00013645053,0.981128,0.000058478025,0.00001883537,0.00032872675,0.014115399,0.00019871334,0.00028892828,0.00033645876,0.0033699828,0.000015671627],"about_ca_topic_score_codex":0.013802321,"about_ca_topic_score_gemma":0.014888791,"teacher_disagreement_score":0.013802321,"about_ca_system_score_codex":0.001146349,"about_ca_system_score_gemma":0.0017100094,"threshold_uncertainty_score":0.027443945},"labels":[],"label_agreement":null},{"id":"W4387846857","doi":"10.1145/3583780.3615046","title":"SAND: Semantic Annotation of Numeric Data in Web Tables","year":2023,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Information retrieval; Semantic Web; Annotation; Semantic Web Stack; Semantic annotation; Graph; Margin (machine learning); Knowledge graph; Social Semantic Web; Schema (genetic algorithms); Natural language processing; Artificial intelligence; Machine learning; Theoretical computer science","score_opus":0.32976674592286453,"score_gpt":0.4672587250817268,"score_spread":0.13749197915886224,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4387846857","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.027728053,0.00076243014,0.87491626,0.00085685507,0.00028864839,0.00044143855,0.044883195,0.037758864,0.0123641975],"genre_scores_gemma":[0.2009404,0.00081150985,0.7384462,0.00046296723,0.00009557977,0.00042936543,0.05107197,0.001766284,0.0059758024],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9974981,0.0004889703,0.00029253605,0.0005762072,0.0010202592,0.00012396989],"domain_scores_gemma":[0.9945083,0.0020092078,0.0007010821,0.0014836985,0.0011212035,0.00017650895],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0016672466,0.00089938473,0.0006836584,0.0075942166,0.0009883944,0.0028426666,0.0013994117,0.0011501065,0.0051263156],"category_scores_gemma":[0.009161503,0.000485559,0.0010285239,0.0062937564,0.00091899483,0.005075597,0.0028056416,0.0011530997,0.0025310281],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009177626,0.00032570498,0.034099985,0.0028918674,0.00027268665,0.0016645293,0.004266237,0.04582574,0.033730328,0.13205278,0.13934164,0.60461074],"study_design_scores_gemma":[0.00006404888,0.00010610683,0.014633398,0.0006824444,0.00016336827,0.0011338447,0.0026391447,0.27425745,0.057874773,0.13185292,0.5163843,0.00020819037],"about_ca_topic_score_codex":0.010629249,"about_ca_topic_score_gemma":0.018882126,"teacher_disagreement_score":0.010629249,"about_ca_system_score_codex":0.001244439,"about_ca_system_score_gemma":0.0021251936,"threshold_uncertainty_score":0.021134734},"labels":[],"label_agreement":null},{"id":"W4387846873","doi":"10.1145/3583780.3615172","title":"Product Entity Matching via Tabular Data","year":2023,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Serialization; ENCODE; Transformer; Data mining; Matching (statistics); Benchmark (surveying); Entity linking; Task (project management); Product (mathematics); Artificial intelligence; Information retrieval; Natural language processing; Machine learning; Knowledge base; Programming language","score_opus":0.48078262262889726,"score_gpt":0.492133428387495,"score_spread":0.01135080575859776,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4387846873","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.072971664,0.005481836,0.763299,0.0021625808,0.00047221393,0.0008358103,0.07870391,0.06721416,0.0088587385],"genre_scores_gemma":[0.21895055,0.0011271251,0.59214544,0.0011321334,0.00014059152,0.0004794726,0.17662172,0.0008794554,0.008523518],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99710697,0.0006162824,0.0002525582,0.0012564687,0.00060646667,0.00016126833],"domain_scores_gemma":[0.9943658,0.0019050634,0.0004883831,0.0024386158,0.000662289,0.0001399125],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0028494163,0.0014944297,0.0015869886,0.0055504222,0.0010266707,0.0030124134,0.0041071605,0.0024222706,0.0077741113],"category_scores_gemma":[0.014592112,0.0007735272,0.0020862848,0.009952033,0.0008076017,0.011756899,0.0033949567,0.0023395768,0.00660895],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009884211,0.000994813,0.012299323,0.0016144182,0.0003865395,0.0005565758,0.00042116304,0.10633639,0.007741526,0.025774665,0.12577046,0.7171157],"study_design_scores_gemma":[0.00012026518,0.00019547046,0.0020010525,0.00011293191,0.0001008915,0.0004989314,0.0003232616,0.86324745,0.013489089,0.06385812,0.055973433,0.00007906794],"about_ca_topic_score_codex":0.011297541,"about_ca_topic_score_gemma":0.018418984,"teacher_disagreement_score":0.011297541,"about_ca_system_score_codex":0.0019544854,"about_ca_system_score_gemma":0.0024329813,"threshold_uncertainty_score":0.026006997},"labels":[],"label_agreement":null},{"id":"W4387860452","doi":"10.1002/pra2.868","title":"(Talking About) Failing Better in Research: The First Rule of Failure Club Is…You Don’t Talk about Failure Club","year":2023,"lang":"en","type":"article","venue":"Proceedings of the Association for Information Science and Technology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia; McGill University","funders":"","keywords":"Journal club; Mentorship; Publishing; Club; Public relations; Research integrity; Psychology; Engineering ethics; Sociology; Political science; Medical education; Engineering; Medicine","score_opus":0.08120058587441907,"score_gpt":0.37832501646006544,"score_spread":0.29712443058564636,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4387860452","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":"evaluation","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"evaluation","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.030102128,0.0024479823,0.01810242,0.8660357,0.029665729,0.00023787956,0.0001289587,0.0005098558,0.052769244],"genre_scores_gemma":[0.615787,0.0023079154,0.009063514,0.31243148,0.012275053,0.00082125043,0.00014888996,0.0009640509,0.046200793],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9133668,0.06496908,0.0026797045,0.0038945954,0.010521541,0.0045683295],"domain_scores_gemma":[0.8201668,0.086552925,0.017822992,0.014601948,0.03291198,0.0279434],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.05228962,0.0009535576,0.0014123383,0.0014081723,0.01754928,0.014081352,0.0023347859,0.009974766,0.010317815],"category_scores_gemma":[0.17039947,0.00072387356,0.0011106462,0.0010292669,0.02803851,0.015521928,0.016097413,0.030684715,0.005550193],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018104487,0.00019383032,0.0060187504,0.000525714,0.00007975853,0.0008006229,0.29376343,0.00015454828,0.0011995878,0.05874596,0.59707683,0.041259985],"study_design_scores_gemma":[0.000047734648,0.00020445217,0.002928913,0.0013065967,0.000046111832,0.0012332078,0.24619976,0.0005641817,0.00089401414,0.049487934,0.696844,0.00024308606],"about_ca_topic_score_codex":0.002154035,"about_ca_topic_score_gemma":0.0020090262,"teacher_disagreement_score":0.9477104,"about_ca_system_score_codex":0.0042115105,"about_ca_system_score_gemma":0.0045679193,"threshold_uncertainty_score":0.27653724},"labels":[],"label_agreement":null},{"id":"W4388095942","doi":"10.5267/j.ijdns.2023.9.022","title":"Web-based information system framework for the digitization of historical databases and endowments","year":2023,"lang":"en","type":"article","venue":"International Journal of Data and Network Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Digitization; Computer science; World Wide Web; Inheritance (genetic algorithm); Web application; Population; Graph; Data science; Database","score_opus":0.21510516184672646,"score_gpt":0.43539972690260986,"score_spread":0.2202945650558834,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4388095942","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0011398112,0.0006808707,0.9559054,0.0019661346,0.00022299473,0.0006855024,0.0021486187,0.004789021,0.032461703],"genre_scores_gemma":[0.022364493,0.001337898,0.9565161,0.0005013802,0.00012503643,0.0010643316,0.00550058,0.0008148514,0.01177532],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9929395,0.0024027827,0.0013168385,0.0006999866,0.0022984478,0.00034248419],"domain_scores_gemma":[0.9928402,0.002335757,0.0005370115,0.0019690383,0.0016713896,0.00064664043],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011224936,0.0010280797,0.0012219942,0.011229949,0.0028657943,0.014628277,0.0044371258,0.002704958,0.009671184],"category_scores_gemma":[0.010923924,0.0012647194,0.0024794987,0.012531689,0.0039304756,0.017988464,0.00588229,0.00537618,0.0051441453],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000019502137,0.00005608247,0.00031823132,0.00026715396,0.000033903973,0.00054091634,0.0018202043,0.004897078,0.0012257303,0.93943775,0.01585949,0.035523977],"study_design_scores_gemma":[0.000018213166,0.000032834985,0.0005402308,0.0006263602,0.00003726188,0.00064060296,0.0011775309,0.02400099,0.0012576671,0.269081,0.70250887,0.00007838755],"about_ca_topic_score_codex":0.016332934,"about_ca_topic_score_gemma":0.016596345,"teacher_disagreement_score":0.016332934,"about_ca_system_score_codex":0.004711021,"about_ca_system_score_gemma":0.008289164,"threshold_uncertainty_score":0.059363842},"labels":[],"label_agreement":null},{"id":"W4388494637","doi":"10.1049/pbpc063e_ch7","title":"Visualization tools for personal knowledge graphs","year":2023,"lang":"en","type":"book-chapter","venue":"Institution of Engineering and Technology eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Cape Breton University","funders":"","keywords":"Computer science; Visualization; Information visualization; Graph drawing; Focus (optics); Knowledge graph; Data science; Human–computer interaction; Knowledge management; Information retrieval; Data mining","score_opus":0.12444921563194548,"score_gpt":0.3504058782548951,"score_spread":0.2259566626229496,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4388494637","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.002422454,0.0029808234,0.8773051,0.0011325745,0.00036647325,0.00023162275,0.005602219,0.040721476,0.06923735],"genre_scores_gemma":[0.029138576,0.0061860573,0.88914156,0.00047867678,0.0002271377,0.0005253782,0.013406725,0.009656083,0.05123985],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99929607,0.00017235207,0.00007402618,0.00011602763,0.0002978204,0.000043699823],"domain_scores_gemma":[0.99760205,0.0014440429,0.0001065856,0.00035947846,0.00038513922,0.00010271315],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0010728263,0.001602484,0.0007255497,0.00644238,0.00087066554,0.005651979,0.0015935609,0.0011666236,0.060572103],"category_scores_gemma":[0.0053490167,0.00078446744,0.0012503922,0.0070797126,0.0005982957,0.0057244115,0.0026218924,0.0019178679,0.013467016],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00007834676,0.00008304278,0.0004796946,0.0014694845,0.000064975226,0.0005470855,0.0020924562,0.0070219575,0.004044292,0.22140457,0.224921,0.5377931],"study_design_scores_gemma":[0.000031328764,0.000016923019,0.00039828234,0.00043063107,0.00003146128,0.0007529308,0.00044194065,0.025260711,0.0035404598,0.16913547,0.7999029,0.000057004076],"about_ca_topic_score_codex":0.002219757,"about_ca_topic_score_gemma":0.0031216906,"teacher_disagreement_score":0.060572103,"about_ca_system_score_codex":0.001179356,"about_ca_system_score_gemma":0.0007020085,"threshold_uncertainty_score":0.20263386},"labels":[],"label_agreement":null},{"id":"W4388963821","doi":"10.48550/arxiv.2311.13517","title":"Learning-Based Relaxation of Completeness Requirements for Data Entry Forms","year":2023,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"BNP Paribas Cardif","keywords":"Completeness (order theory); Computer science; Field (mathematics); Lacquer; Data mining; Artificial intelligence; Machine learning; Mathematics","score_opus":0.649970621585224,"score_gpt":0.3571455270505782,"score_spread":0.2928250945346458,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4388963821","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.11518558,0.0006735679,0.85297203,0.0019918757,0.00012326492,0.001093614,0.0046063033,0.020736767,0.0026169168],"genre_scores_gemma":[0.4155401,0.00037799965,0.56106174,0.0016799166,0.00014257846,0.0009055482,0.015733238,0.0014206315,0.0031381862],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.96261054,0.010486483,0.005758368,0.0081712045,0.011447607,0.0015258032],"domain_scores_gemma":[0.83203,0.10961291,0.015584196,0.022299595,0.01875958,0.0017137239],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02096196,0.0020564417,0.0025210825,0.0030701696,0.001555567,0.0040272586,0.0041331905,0.00266048,0.0027462428],"category_scores_gemma":[0.16906689,0.0019024886,0.0026515322,0.002655017,0.0028328516,0.011150752,0.005081515,0.006435376,0.0018860238],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002104097,0.0010887514,0.055511244,0.0021392659,0.0003356391,0.0010749095,0.0031311365,0.19167861,0.019153908,0.023440061,0.035469893,0.66487247],"study_design_scores_gemma":[0.00019728778,0.00027905236,0.0032854767,0.00020989182,0.00009435283,0.00054147484,0.0004883395,0.94224083,0.018533701,0.02064367,0.013405153,0.000080778176],"about_ca_topic_score_codex":0.0077749793,"about_ca_topic_score_gemma":0.012501432,"teacher_disagreement_score":0.02096196,"about_ca_system_score_codex":0.0027010182,"about_ca_system_score_gemma":0.009921479,"threshold_uncertainty_score":0.11085874},"labels":[],"label_agreement":null},{"id":"W4389205106","doi":"10.51224/srxiv.353","title":"PubMed search filter for efficiently retrieving exercise training studies","year":2023,"lang":"en","type":"preprint","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Training (meteorology); Computer science; Filter (signal processing); Information retrieval; Computer vision; Geography","score_opus":0.8329623756291038,"score_gpt":0.5367704814240526,"score_spread":0.2961918942050512,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4389205106","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08004445,0.035986535,0.28695554,0.0058172024,0.0016483369,0.0072477004,0.50407135,0.056204773,0.02202411],"genre_scores_gemma":[0.14525877,0.007472208,0.5927634,0.0011280879,0.00069495535,0.004821963,0.2369524,0.0027600029,0.008148335],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9944765,0.0013129021,0.002029125,0.0006936561,0.0012074807,0.00028040155],"domain_scores_gemma":[0.96056956,0.026659058,0.0027207828,0.0032801381,0.0057992623,0.000971196],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.009381763,0.0015904617,0.0031006048,0.025466178,0.0015411606,0.0050057005,0.0013581727,0.0017857059,0.026245039],"category_scores_gemma":[0.06986855,0.0007212362,0.002502587,0.016758997,0.0005012765,0.0026842235,0.0024833146,0.0007444382,0.008524846],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.004570057,0.00040147544,0.02016847,0.031783473,0.0029404326,0.0011783876,0.00086647645,0.0039593684,0.016856058,0.012314403,0.3020321,0.6029293],"study_design_scores_gemma":[0.005218395,0.0021782673,0.07855018,0.013382981,0.011974201,0.004501812,0.0022218304,0.09392065,0.039036125,0.06917484,0.67916316,0.000677452],"about_ca_topic_score_codex":0.008354491,"about_ca_topic_score_gemma":0.017825106,"teacher_disagreement_score":0.9906182,"about_ca_system_score_codex":0.0011518428,"about_ca_system_score_gemma":0.009605446,"threshold_uncertainty_score":0.08779836},"labels":[],"label_agreement":null},{"id":"W4389327349","doi":"10.1130/abs/2023am-393822","title":"CORRELATING MULTI-PROXY DATA ACROSS MULTIPLE BASINS IN WALDEN POND (MA, USA): EVIDENCE OF SUDDEN ONSET EVENTS AND HUMAN IMPACT","year":2023,"lang":"en","type":"article","venue":"Abstracts with programs - Geological Society of America","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Brock University; McMaster University","funders":"","keywords":"Proxy (statistics); Geology; Physical geography; Climatology; Geography; Computer science; Machine learning","score_opus":0.30149014474322877,"score_gpt":0.47146020407533373,"score_spread":0.16997005933210496,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4389327349","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99819046,0.00006408316,0.00023961216,0.00016387024,0.0000054400907,0.0000069168764,0.0006623277,0.000020351654,0.00064682297],"genre_scores_gemma":[0.99871266,0.000053693275,0.00044605974,0.00004036568,0.000004182464,0.000009430831,0.00056444824,0.0000053498,0.00016377938],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99943835,0.00016704494,0.000060674625,0.00011148177,0.00014443856,0.000078018995],"domain_scores_gemma":[0.9971257,0.0009367351,0.0008080411,0.00022607276,0.00057176425,0.00033168014],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00083710114,0.00017929293,0.0003512609,0.0013656652,0.00065598823,0.0011194891,0.00076736405,0.0005805887,0.00070409453],"category_scores_gemma":[0.005447758,0.00026548633,0.00021534676,0.003064617,0.0009096755,0.0008714632,0.0013170236,0.00049601705,0.000096226395],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000059278733,0.000035288955,0.9915835,0.000017664976,0.00011338522,0.000173289,0.00050449645,0.00088061346,0.0007296727,0.000087151966,0.00061604433,0.005199478],"study_design_scores_gemma":[0.000005680628,0.000008985673,0.9967434,0.000008430775,0.000030318752,0.000027858823,0.0006397494,0.0019259535,0.00013831575,0.00007174584,0.0003945575,0.0000050300173],"about_ca_topic_score_codex":0.22559375,"about_ca_topic_score_gemma":0.5318636,"teacher_disagreement_score":0.22559375,"about_ca_system_score_codex":0.0011310381,"about_ca_system_score_gemma":0.0017325553,"threshold_uncertainty_score":0.4485613},"labels":[],"label_agreement":null},{"id":"W4389386408","doi":"10.1145/3635708","title":"Learning-based Relaxation of Completeness Requirements for Data Entry Forms","year":2023,"lang":"en","type":"article","venue":"ACM Transactions on Software Engineering and Methodology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"BNP Paribas Cardif; Université du Luxembourg","keywords":"Completeness (order theory); Computer science; Field (mathematics); Artificial intelligence; Machine learning; Data mining","score_opus":0.5502892581731978,"score_gpt":0.47503419077972964,"score_spread":0.07525506739346821,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4389386408","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.18134321,0.00063507305,0.777308,0.0019168056,0.00016510877,0.0012316514,0.0042996733,0.029850356,0.0032501074],"genre_scores_gemma":[0.49688146,0.0002552138,0.47969428,0.0013666741,0.00010385746,0.0007601255,0.015705628,0.0013805901,0.003852285],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9790354,0.0062759197,0.0025814825,0.0054315943,0.005629085,0.0010465705],"domain_scores_gemma":[0.90381,0.06414021,0.007609151,0.012053724,0.010815058,0.0015718148],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013536688,0.0022080936,0.0019629193,0.002065706,0.0014128105,0.0030613933,0.0039165383,0.0025861703,0.0032131027],"category_scores_gemma":[0.10164584,0.0014947476,0.0025013075,0.001669324,0.0021525463,0.008897182,0.0041716825,0.0065281037,0.0018857501],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0020235053,0.0016330323,0.044955622,0.0014941749,0.00025186012,0.0009229907,0.0021186303,0.26462212,0.018730724,0.013402298,0.029704507,0.62014055],"study_design_scores_gemma":[0.00012672279,0.00022957368,0.001966941,0.00008412722,0.00005380559,0.00026921966,0.00029791662,0.9671108,0.012275387,0.0093077505,0.008226271,0.000051501174],"about_ca_topic_score_codex":0.00979409,"about_ca_topic_score_gemma":0.01609866,"teacher_disagreement_score":0.013536688,"about_ca_system_score_codex":0.0026269373,"about_ca_system_score_gemma":0.008229097,"threshold_uncertainty_score":0.07158971},"labels":[],"label_agreement":null},{"id":"W4389519304","doi":"10.18653/v1/2023.crac-sharedtask.5","title":"McGill at CRAC 2023: Multilingual Generalization of Entity-Ranking Coreference Resolution Models","year":2023,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"McGill University","funders":"Canadian Institute for Advanced Research; Nvidia","keywords":"Coreference; Computer science; Task (project management); Ranking (information retrieval); Generalization; Preprocessor; Natural language processing; Artificial intelligence; F1 score; Encoder; Resolution (logic); Machine learning; Information retrieval","score_opus":0.4044293887468424,"score_gpt":0.44015659461111,"score_spread":0.035727205864267586,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4389519304","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.11770342,0.013539134,0.3385423,0.009660493,0.010533983,0.0040087285,0.26007482,0.19949403,0.046443082],"genre_scores_gemma":[0.1897508,0.00125093,0.24847928,0.0032004695,0.0008169151,0.0027729748,0.50253654,0.010178355,0.041013747],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9901337,0.0044013783,0.00030973752,0.0029388533,0.0013718118,0.00084454496],"domain_scores_gemma":[0.98706853,0.003805466,0.0002574265,0.0055787796,0.0023639596,0.00092577207],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.015404881,0.0068246243,0.0032745665,0.0030101906,0.0030949647,0.0042268666,0.009665418,0.0065539866,0.030011892],"category_scores_gemma":[0.026354264,0.0021391932,0.0039465763,0.003621006,0.0013948486,0.0051446776,0.007665102,0.00856001,0.022046499],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012358553,0.0006646479,0.0014794538,0.0008694773,0.0008497255,0.00046455514,0.00016879941,0.03254237,0.007621952,0.0025779777,0.7826648,0.16886044],"study_design_scores_gemma":[0.002751403,0.0015316702,0.0075960695,0.0004684094,0.00068730884,0.001162146,0.00048567393,0.6700093,0.03651227,0.022222307,0.25574523,0.0008281691],"about_ca_topic_score_codex":0.11146744,"about_ca_topic_score_gemma":0.18955946,"teacher_disagreement_score":0.11146744,"about_ca_system_score_codex":0.0041453224,"about_ca_system_score_gemma":0.0065773786,"threshold_uncertainty_score":0.22163725},"labels":[],"label_agreement":null},{"id":"W4389615820","doi":"10.23889/ijpds.v8i1.2153","title":"De-identification of Free Text Data containing Personal Health Information: A Scoping Review of Reviews","year":2023,"lang":"en","type":"review","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba; George & Fay Yee Centre for Healthcare Innovation; Manitoba Health","funders":"Canadian Institutes of Health Research","keywords":"Health Insurance Portability and Accountability Act; Identification (biology); Computer science; Protected health information; Information retrieval; MEDLINE; Personally identifiable information; Digital library; Data science; World Wide Web; Medicine; Confidentiality; Public health; Nursing; Health education","score_opus":0.7026193400916434,"score_gpt":0.6308973187983484,"score_spread":0.07172202129329497,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4389615820","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00074250024,0.9848749,0.003739962,0.0038286636,0.0012244119,0.003013481,0.0009383156,0.00005717646,0.001580695],"genre_scores_gemma":[0.009515936,0.964971,0.010546484,0.0030454013,0.00072241866,0.009390373,0.0011131362,0.00006251783,0.00063261675],"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","domain_scores_codex":[0.8518749,0.06363352,0.053236336,0.0070086904,0.022676947,0.0015697121],"domain_scores_gemma":[0.44285065,0.4358991,0.05691919,0.01069229,0.051828858,0.0018098748],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.11793157,0.0029121214,0.010146859,0.047579024,0.0027295775,0.008884093,0.00529525,0.005956098,0.008141364],"category_scores_gemma":[0.39557457,0.0027501134,0.0084604025,0.03916986,0.004727517,0.013337128,0.006639732,0.0045786276,0.0020654583],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00009494887,0.000023805816,0.00048645193,0.87366223,0.0011989307,0.00016214438,0.0015180364,0.00017237791,0.00031060798,0.002326585,0.0077491025,0.11229477],"study_design_scores_gemma":[0.00003167249,0.000042633204,0.0005628764,0.95713556,0.002185999,0.00016603492,0.0005560673,0.00007186697,0.0002106478,0.0012354907,0.03776786,0.000033344935],"about_ca_topic_score_codex":0.0066118403,"about_ca_topic_score_gemma":0.012965522,"teacher_disagreement_score":0.11793157,"about_ca_system_score_codex":0.009899961,"about_ca_system_score_gemma":0.046208523,"threshold_uncertainty_score":0.6236892},"labels":[],"label_agreement":null},{"id":"W4389986082","doi":"10.51952/9781529233551.ch006","title":"Experiments in Practice: New Directions in Municipal Data Policy and Governance","year":2023,"lang":"en","type":"book-chapter","venue":"Bristol University Press eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Corporate governance; Public administration; Political science; Business; Environmental planning; Geography; Finance","score_opus":0.3036909657686982,"score_gpt":0.41267996682332714,"score_spread":0.10898900105462894,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4389986082","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01942736,0.03425239,0.09154266,0.47891828,0.0023224638,0.00047981995,0.00022537446,0.00056525663,0.37226635],"genre_scores_gemma":[0.8170103,0.022211032,0.06975177,0.035823535,0.0019788616,0.002774124,0.000285673,0.0005378172,0.049626876],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"qualitative","domain_scores_codex":[0.91159755,0.07534215,0.0015341789,0.0034034618,0.0060620573,0.0020605216],"domain_scores_gemma":[0.8163331,0.15420696,0.003440844,0.019000875,0.0044446727,0.0025735535],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.10308662,0.00087685854,0.0016236771,0.0020183213,0.007265405,0.028594261,0.005128393,0.01054305,0.014990459],"category_scores_gemma":[0.10962339,0.0011425018,0.0009314505,0.0056650657,0.079952314,0.053817585,0.014320705,0.010772233,0.0015011815],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000010201332,0.000022184035,0.000113181355,0.0000884822,0.000004994643,0.000014001359,0.002232597,0.00037205743,0.000038734717,0.98293465,0.0045877313,0.009581232],"study_design_scores_gemma":[0.000044599663,0.0000310831,0.00018371544,0.00031580072,0.000004756825,0.000012457031,0.0037665132,0.00059554697,0.00015708742,0.88650954,0.108362414,0.000016524304],"about_ca_topic_score_codex":0.010267687,"about_ca_topic_score_gemma":0.009781007,"teacher_disagreement_score":0.10308662,"about_ca_system_score_codex":0.02388526,"about_ca_system_score_gemma":0.02635062,"threshold_uncertainty_score":0.5451807},"labels":[],"label_agreement":null},{"id":"W4390245620","doi":"10.1016/j.datak.2023.102274","title":"Mining Keys for Graphs","year":2023,"lang":"en","type":"article","venue":"Data & Knowledge Engineering","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Graph; Data deduplication; Theoretical computer science; Identification (biology); Data mining; Pruning; Database","score_opus":0.3915863678661295,"score_gpt":0.45612684361496436,"score_spread":0.06454047574883487,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4390245620","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09354493,0.0030094627,0.83772933,0.0040127584,0.0005295525,0.0011661778,0.037019804,0.008719591,0.0142684085],"genre_scores_gemma":[0.44767943,0.0031447937,0.49160752,0.00062716956,0.00035862147,0.0008765376,0.042828046,0.0013494783,0.011528304],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99655247,0.00044452306,0.00040673272,0.0013027628,0.0009276579,0.0003657693],"domain_scores_gemma":[0.9858899,0.007058039,0.0012451652,0.0034759147,0.0018204562,0.0005104181],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0018084558,0.0013885954,0.0010672362,0.008389687,0.001729383,0.0043906854,0.0018696488,0.0014154318,0.009535979],"category_scores_gemma":[0.025124095,0.0010563949,0.002478394,0.00659231,0.0013871203,0.01894497,0.003869871,0.0022894377,0.004343549],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00074778585,0.0003087108,0.019171566,0.0023731734,0.00041084783,0.0010839801,0.0017954289,0.016518196,0.016705157,0.34317178,0.074952275,0.5227611],"study_design_scores_gemma":[0.00007423409,0.0001504275,0.0030830756,0.00044079366,0.00031734933,0.0012657889,0.00095772726,0.05755316,0.012168627,0.8686191,0.055295654,0.00007416354],"about_ca_topic_score_codex":0.002070138,"about_ca_topic_score_gemma":0.0035402486,"teacher_disagreement_score":0.009535979,"about_ca_system_score_codex":0.0013043737,"about_ca_system_score_gemma":0.0021736678,"threshold_uncertainty_score":0.031901002},"labels":[],"label_agreement":null},{"id":"W4390690778","doi":"10.3138/jmvfh-2022-0071","title":"Studying military and Veteran health using a life-course approach: Lessons learned from a Canadian record linkage study","year":2024,"lang":"en","type":"article","venue":"Journal of Military Veteran and Family Health","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":true,"ca_institutions":"Veterans Affairs Canada; Public Health Agency of Canada","funders":"","keywords":"Stakeholder; Life course approach; Linkage (software); Public relations; Resource (disambiguation); Political science; Psychology; Computer science","score_opus":0.4195636312155331,"score_gpt":0.4607801025808845,"score_spread":0.04121647136535139,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4390690778","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.34506264,0.101309314,0.103980914,0.3455651,0.003266656,0.0076310895,0.01758666,0.0004647027,0.07513294],"genre_scores_gemma":[0.7192768,0.050171338,0.19012836,0.021778395,0.0007586668,0.0054770955,0.005559168,0.00040782144,0.006442349],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.87485844,0.08047553,0.010275342,0.003910092,0.026321162,0.0041595316],"domain_scores_gemma":[0.5847329,0.22186127,0.010766857,0.024772217,0.14740372,0.010463036],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.21310464,0.00061975623,0.0017895645,0.0064974143,0.008210874,0.008308134,0.0059158565,0.0017751185,0.0031894632],"category_scores_gemma":[0.32247812,0.00080712157,0.0013046843,0.017942425,0.0030038687,0.005889371,0.0073444736,0.0036817994,0.00037720488],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00034465594,0.00035367682,0.26484865,0.005629931,0.0011477553,0.00097427715,0.17728181,0.0015497358,0.0004580691,0.01991549,0.05185497,0.47564092],"study_design_scores_gemma":[0.00029268634,0.00047739677,0.40399373,0.034965657,0.0018526462,0.0008499543,0.20867497,0.005199315,0.0013714435,0.019275164,0.32230765,0.00073934946],"about_ca_topic_score_codex":0.95134455,"about_ca_topic_score_gemma":0.97655404,"teacher_disagreement_score":0.21310464,"about_ca_system_score_codex":0.053791467,"about_ca_system_score_gemma":0.17705247,"threshold_uncertainty_score":0.9703821},"labels":[],"label_agreement":null},{"id":"W4391018115","doi":"10.1145/3593579","title":"Record Fusion via Inference and Data Augmentation","year":2024,"lang":"en","type":"article","venue":"ACM / IMS Journal of Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Inference; Probabilistic logic; Sensor fusion; Data mining; Fusion; Data source; Artificial intelligence; Machine learning","score_opus":0.5120775299749007,"score_gpt":0.5555716160536497,"score_spread":0.04349408607874894,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4391018115","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005955284,0.00040993094,0.9877331,0.0005256424,0.000092340466,0.00013256929,0.0008212654,0.003461639,0.0008682154],"genre_scores_gemma":[0.1695445,0.00041053945,0.82180923,0.00051505293,0.00026429587,0.00030050808,0.005018301,0.00027170166,0.0018658794],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98988545,0.002585058,0.0008387254,0.0029329164,0.0033084294,0.00044929885],"domain_scores_gemma":[0.97610384,0.010086962,0.00211629,0.0083159,0.0030178358,0.00035922084],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011360215,0.0020458165,0.002861806,0.0058405725,0.0014012527,0.004045477,0.006431152,0.002550175,0.0031214992],"category_scores_gemma":[0.043948773,0.0013505425,0.0030288096,0.008386554,0.0020649158,0.011724715,0.0082588205,0.0058411346,0.0021046023],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00076441304,0.00062487286,0.01398272,0.00062332867,0.0006596883,0.00038341107,0.0010343213,0.19618787,0.007492799,0.036237206,0.019794794,0.72221464],"study_design_scores_gemma":[0.000049928953,0.00009711823,0.0013256987,0.000083930194,0.00014598665,0.00023602646,0.00014640855,0.9185882,0.009345485,0.05918368,0.0107311765,0.00006645304],"about_ca_topic_score_codex":0.0067208214,"about_ca_topic_score_gemma":0.007839037,"teacher_disagreement_score":0.011360215,"about_ca_system_score_codex":0.0017536016,"about_ca_system_score_gemma":0.004067641,"threshold_uncertainty_score":0.060079277},"labels":[],"label_agreement":null},{"id":"W4391054937","doi":"10.14778/3632093.3632096","title":"Blocker and Matcher Can Mutually Benefit: A Co-Learning Framework for Low-Resource Entity Resolution","year":2023,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Vector Institute; University of Toronto","funders":"","keywords":"Benchmark (surveying); Computer science; Resource (disambiguation); Noise (video); Selection (genetic algorithm); Machine learning; Artificial intelligence; Resolution (logic); Data mining","score_opus":0.07733140174241149,"score_gpt":0.3638194075327134,"score_spread":0.2864880057903019,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4391054937","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013516396,0.0004946823,0.9809168,0.00055108406,0.00003366843,0.00009979177,0.00007368843,0.0022963623,0.0020175646],"genre_scores_gemma":[0.5547828,0.00038778156,0.43276218,0.0008577046,0.000121366735,0.0002491354,0.00060998026,0.00034678783,0.009882308],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9966414,0.0012700416,0.00012334183,0.0010025357,0.00061055634,0.00035216153],"domain_scores_gemma":[0.9957962,0.0018860537,0.00038072816,0.0009946006,0.00065556896,0.0002868274],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006412088,0.001559198,0.0016711736,0.0012831985,0.0012527114,0.0019623104,0.0054007596,0.0034559353,0.003134022],"category_scores_gemma":[0.0105550205,0.0009331186,0.00092440227,0.0013747398,0.0018281848,0.006155999,0.005761973,0.004021928,0.0018645943],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006967189,0.0008197749,0.006063588,0.00018873381,0.00025956865,0.00045000936,0.00092825416,0.41153347,0.007687685,0.038313862,0.011719022,0.52133924],"study_design_scores_gemma":[0.000023457274,0.00007619999,0.00023786884,0.000013077759,0.000034395227,0.00007893422,0.000055702494,0.9795758,0.003080169,0.014192465,0.0026124795,0.00001954139],"about_ca_topic_score_codex":0.004745875,"about_ca_topic_score_gemma":0.007418619,"teacher_disagreement_score":0.006412088,"about_ca_system_score_codex":0.0011113496,"about_ca_system_score_gemma":0.0021587845,"threshold_uncertainty_score":0.03391075},"labels":[],"label_agreement":null},{"id":"W4391092916","doi":"10.1109/bigdata59044.2023.10386157","title":"Leveraging Knowledge Graphs for Matching Heterogeneous Entities and Explanation","year":2023,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Computer science; Knowledge graph; Matching (statistics); Data science; Information retrieval; Mathematics","score_opus":0.27236666365209145,"score_gpt":0.43350352874008075,"score_spread":0.1611368650879893,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4391092916","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013822498,0.0004994332,0.97560775,0.00079957675,0.000048561917,0.00021594987,0.0016109413,0.0050208983,0.002374445],"genre_scores_gemma":[0.16007602,0.0007235355,0.8303763,0.00044418464,0.000048840535,0.00017891024,0.005586306,0.00047994434,0.0020859246],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99563026,0.0013787966,0.00041325338,0.00109257,0.0013286745,0.0001563707],"domain_scores_gemma":[0.9864245,0.00808394,0.0010845903,0.0032724289,0.00095545227,0.00017923179],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003469754,0.0012847258,0.00077456573,0.007229854,0.001053216,0.002382586,0.0024245335,0.0018422892,0.0047170166],"category_scores_gemma":[0.02616263,0.00055235386,0.001675593,0.007583199,0.0010321145,0.008025998,0.0046979976,0.001882314,0.0014717466],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021445875,0.00038563798,0.007920407,0.000969172,0.0003251643,0.0010635536,0.0016890526,0.05154084,0.006018412,0.06683226,0.014760319,0.8482807],"study_design_scores_gemma":[0.00006515571,0.0001872822,0.0033000624,0.0004176797,0.00037022762,0.0010997313,0.0016427975,0.5442049,0.022461068,0.35604036,0.07007463,0.00013607735],"about_ca_topic_score_codex":0.0049093664,"about_ca_topic_score_gemma":0.010022031,"teacher_disagreement_score":0.007229854,"about_ca_system_score_codex":0.0010943376,"about_ca_system_score_gemma":0.0022739505,"threshold_uncertainty_score":0.018350005},"labels":[],"label_agreement":null},{"id":"W4391093649","doi":"10.1109/bigdata59044.2023.10386776","title":"Unstructured Transportation Safety Board Findings Categorization Using the Knowledge Graph Pipeline","year":2023,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Carleton University","funders":"","keywords":"Categorization; Computer science; Pipeline (software); Graph; Knowledge graph; Data science; Information retrieval; Artificial intelligence; Theoretical computer science; Programming language","score_opus":0.14575456692883001,"score_gpt":0.40316707886037756,"score_spread":0.25741251193154757,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4391093649","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.37323597,0.002365836,0.5303646,0.003377448,0.00030215352,0.0018483641,0.05709791,0.013709947,0.017697698],"genre_scores_gemma":[0.6506711,0.00085047336,0.28119105,0.00031219493,0.000068015805,0.00039195118,0.06338374,0.00022320119,0.0029083714],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.99877375,0.0002732536,0.000121574085,0.00039427323,0.00031920266,0.000117942924],"domain_scores_gemma":[0.9947101,0.0032585717,0.00048548199,0.00063882745,0.0007367631,0.00017027033],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0014741122,0.0009110915,0.0003254464,0.01212484,0.0007427294,0.00206435,0.0010785197,0.0010272181,0.0020278746],"category_scores_gemma":[0.009276318,0.00027589343,0.001185609,0.006376769,0.0005946276,0.0037646696,0.0016114633,0.0013230703,0.00089968165],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00063182594,0.0008681875,0.116388515,0.0013823952,0.00044798385,0.0022772246,0.002809989,0.10742693,0.012888413,0.025143417,0.03969394,0.6900412],"study_design_scores_gemma":[0.000068029534,0.00021584841,0.045209713,0.00037644993,0.00028865098,0.0007229373,0.0036600847,0.8245491,0.010116627,0.05781229,0.056884382,0.00009599954],"about_ca_topic_score_codex":0.027564934,"about_ca_topic_score_gemma":0.03852771,"teacher_disagreement_score":0.027564934,"about_ca_system_score_codex":0.0019983049,"about_ca_system_score_gemma":0.0021941054,"threshold_uncertainty_score":0.054808974},"labels":[],"label_agreement":null},{"id":"W4391358403","doi":"10.1002/joom.1294","title":"Vendor selection in the wake of data breaches: A longitudinal study","year":2024,"lang":"en","type":"article","venue":"Journal of Operations Management","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Wake; Vendor; Selection (genetic algorithm); Business; Longitudinal data; Computer science; Operations management; Operations research; Marketing; Data mining; Economics; Artificial intelligence; Mathematics","score_opus":0.4863857178479917,"score_gpt":0.523023495877093,"score_spread":0.03663777802910123,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4391358403","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99851173,0.00013021927,0.00020366158,0.0003484699,0.0000111620375,0.000027736973,0.00034238378,0.0000029844607,0.0004216323],"genre_scores_gemma":[0.9982881,0.000121940204,0.00021026302,0.00019106054,0.000016456323,0.00005069905,0.0005104551,0.000004761243,0.0006062807],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9958877,0.0018868811,0.00033727987,0.0004512716,0.00064784696,0.00078900025],"domain_scores_gemma":[0.96911174,0.0085424185,0.012797722,0.002494904,0.0031908057,0.0038623298],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009533001,0.00024468405,0.00049041474,0.0014455072,0.0029616726,0.0029877906,0.0011638192,0.0015761295,0.0041997447],"category_scores_gemma":[0.026172793,0.00065319863,0.0008096629,0.0020475832,0.0009750605,0.003200099,0.002280581,0.0048849606,0.0011390797],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00009746095,0.0006676165,0.9921163,0.000012137247,0.000044716853,0.00010518804,0.0034805236,0.000060432412,0.00005124339,0.00024815218,0.000650345,0.0024659433],"study_design_scores_gemma":[0.000022891798,0.0007206612,0.9742939,0.00008848983,0.000055674118,0.00026563753,0.020699922,0.0010317772,0.00014492201,0.0004913545,0.0021338093,0.000050995786],"about_ca_topic_score_codex":0.015020355,"about_ca_topic_score_gemma":0.017997717,"teacher_disagreement_score":0.015020355,"about_ca_system_score_codex":0.0012711273,"about_ca_system_score_gemma":0.0022961511,"threshold_uncertainty_score":0.050415933},"labels":[],"label_agreement":null},{"id":"W4391491066","doi":"10.2196/51560","title":"Frameworks, Dimensions, Definitions of Aspects, and Assessment Methods for the Appraisal of Quality of Health Data for Secondary Use: Comprehensive Overview of Reviews","year":2024,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Terminology; Quality (philosophy); Data quality; Computer science; Ambiguity; Data science; Health care; Preprint; Systematic review; Management science; Knowledge management; MEDLINE; Engineering; World Wide Web","score_opus":0.6628416497360395,"score_gpt":0.6389503575125496,"score_spread":0.023891292223489957,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4391491066","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00049838214,0.98667973,0.006318414,0.0031145262,0.0004902911,0.0008662297,0.0003375559,0.00004636936,0.0016485361],"genre_scores_gemma":[0.013813264,0.93848586,0.038882278,0.0025919524,0.00039431165,0.0049301703,0.0005474261,0.00005833223,0.00029646468],"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","domain_scores_codex":[0.81911266,0.08865389,0.0522716,0.007038299,0.031078016,0.0018455607],"domain_scores_gemma":[0.62032366,0.2980181,0.035236888,0.0069809435,0.038198188,0.0012422241],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.13091935,0.0034916888,0.006959299,0.044455875,0.0026687966,0.012698408,0.0050282446,0.0045668897,0.0023648366],"category_scores_gemma":[0.28098658,0.0022808134,0.009233148,0.030405708,0.006248556,0.012565102,0.006741863,0.005165785,0.000708577],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00016156888,0.00008030792,0.0023554196,0.52069724,0.0014458894,0.00014901353,0.005037165,0.0009023916,0.0005111286,0.04177096,0.013503158,0.41338575],"study_design_scores_gemma":[0.00007400245,0.00011344277,0.003097302,0.8099354,0.0037066177,0.00048695743,0.0030583958,0.00063362066,0.00056976854,0.014943896,0.16321468,0.00016599419],"about_ca_topic_score_codex":0.0130373165,"about_ca_topic_score_gemma":0.016864644,"teacher_disagreement_score":0.86908066,"about_ca_system_score_codex":0.017322987,"about_ca_system_score_gemma":0.04375897,"threshold_uncertainty_score":0.692376},"labels":[],"label_agreement":null},{"id":"W4391725330","doi":"10.14722/ndss.2024.23014","title":"Overconfidence is a Dangerous Thing: Mitigating Membership Inference Attacks by Enforcing Less Confident Prediction","year":2024,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Overconfidence effect; Inference; Computer security; Computer science; Artificial intelligence; Psychology; Social psychology","score_opus":0.2179136209609521,"score_gpt":0.4373605369772627,"score_spread":0.21944691601631058,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4391725330","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.18343496,0.0011852523,0.8019205,0.00376569,0.00016582946,0.00018210181,0.00025555165,0.002992886,0.0060972623],"genre_scores_gemma":[0.94744277,0.00018969961,0.050280463,0.00059672596,0.00011737875,0.000066835964,0.00015727835,0.000077642806,0.001071292],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9865611,0.0055056633,0.00063429435,0.00200515,0.0043815672,0.0009122535],"domain_scores_gemma":[0.96849906,0.011965456,0.0033304412,0.013873715,0.0016539973,0.00067737617],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008794163,0.0011075938,0.0012994275,0.00075653807,0.0015878214,0.002520223,0.002717914,0.0023260964,0.0009958968],"category_scores_gemma":[0.037102528,0.0006237502,0.0010144936,0.00084530906,0.0024323887,0.006354056,0.00682379,0.005949405,0.00059210806],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0018080926,0.0007065324,0.028995426,0.00038327803,0.00042161706,0.0009304072,0.0018550346,0.29142842,0.038364172,0.11900513,0.015854701,0.50024724],"study_design_scores_gemma":[0.000072152565,0.00027346317,0.002430056,0.00006493356,0.00007125275,0.0006736955,0.00017644241,0.91969407,0.026266,0.045091778,0.005120579,0.00006550778],"about_ca_topic_score_codex":0.0009945466,"about_ca_topic_score_gemma":0.0010253233,"teacher_disagreement_score":0.008794163,"about_ca_system_score_codex":0.0013228795,"about_ca_system_score_gemma":0.001895275,"threshold_uncertainty_score":0.04650849},"labels":[],"label_agreement":null},{"id":"W4391826396","doi":"10.14283/jfa.2024.18","title":"Identifying Frailty in Administrative Databases: A Narrative Review","year":2024,"lang":"en","type":"review","venue":"The Journal of Frailty & Aging","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval","funders":"","keywords":"Narrative; Database; Computer science; Data science; Art; Literature","score_opus":0.6798674861213438,"score_gpt":0.6021681501844243,"score_spread":0.07769933593691958,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4391826396","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00021811442,0.99814093,0.00021812024,0.0004976113,0.00012381919,0.00016029629,0.00029463833,0.000006722306,0.00033973568],"genre_scores_gemma":[0.0021659392,0.9964675,0.00040173414,0.0003980395,0.000079231395,0.00024680444,0.00017140932,0.0000032418238,0.0000660712],"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","domain_scores_codex":[0.9885485,0.0037520598,0.0046791025,0.0006370325,0.0021431583,0.0002402114],"domain_scores_gemma":[0.9171944,0.06742581,0.008363479,0.0010840681,0.0055394582,0.00039265378],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013110786,0.0011785356,0.0040876116,0.0105375545,0.000645261,0.0034239942,0.002235549,0.0018524006,0.005378496],"category_scores_gemma":[0.09825211,0.00079995627,0.0046619996,0.013218337,0.000760609,0.0031801776,0.0021475211,0.0015453596,0.00075943646],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013310167,0.000026160154,0.00056205125,0.8129495,0.0022371965,0.00011302032,0.0002922668,0.0001704851,0.00009970318,0.0012854259,0.0070203193,0.17511076],"study_design_scores_gemma":[0.00006143884,0.00009550344,0.0013961981,0.9083399,0.009022015,0.000375608,0.00022573619,0.00008215742,0.00012677176,0.000746367,0.0794971,0.000031148516],"about_ca_topic_score_codex":0.0051585804,"about_ca_topic_score_gemma":0.010239749,"teacher_disagreement_score":0.013110786,"about_ca_system_score_codex":0.003343247,"about_ca_system_score_gemma":0.014982455,"threshold_uncertainty_score":0.06933731},"labels":[],"label_agreement":null},{"id":"W4392144211","doi":"10.1007/s42081-023-00228-9","title":"Making statistical inferences about linkage errors","year":2024,"lang":"en","type":"article","venue":"Japanese Journal of Statistics and Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Statistics Canada","funders":"","keywords":"Linkage (software); Computer science; Statistics; Psychology; Mathematics; Biology; Genetics","score_opus":0.3100787365167909,"score_gpt":0.507185537428243,"score_spread":0.1971068009114521,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4392144211","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.047040805,0.001310042,0.940572,0.0036406617,0.000754496,0.00031601457,0.0006818345,0.00087678584,0.0048073167],"genre_scores_gemma":[0.5111644,0.0009976127,0.48077726,0.0019023945,0.001199399,0.0008738522,0.0013389275,0.0003283396,0.0014178583],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.89307004,0.07688318,0.008461421,0.010367115,0.01007207,0.0011461914],"domain_scores_gemma":[0.44441047,0.49501136,0.02076681,0.026271619,0.012138434,0.0014012791],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.11608613,0.0011766443,0.0022474013,0.007824725,0.002354998,0.0066251643,0.0031949647,0.0027972548,0.0044112275],"category_scores_gemma":[0.49919206,0.0012010793,0.002830019,0.007107831,0.0029670845,0.008849328,0.004830549,0.0054852227,0.0008463338],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015466991,0.000419465,0.10259851,0.0022229657,0.0072726486,0.0019118922,0.005849503,0.026335739,0.0023678404,0.21312128,0.016151372,0.6202021],"study_design_scores_gemma":[0.00044035527,0.0003737732,0.019877031,0.00076906924,0.0029400885,0.00073376176,0.0023947323,0.12804726,0.005830704,0.8237171,0.014728557,0.00014764791],"about_ca_topic_score_codex":0.0017061651,"about_ca_topic_score_gemma":0.001117112,"teacher_disagreement_score":0.11608613,"about_ca_system_score_codex":0.0012738487,"about_ca_system_score_gemma":0.004162137,"threshold_uncertainty_score":0.6139295},"labels":[],"label_agreement":null},{"id":"W4392869771","doi":"10.1007/978-3-031-56060-6_18","title":"LaQuE: Enabling Entity Search at Scale","year":2024,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University; University of Waterloo","funders":"","keywords":"Computer science; Scale (ratio); Information retrieval; Data science; Cartography","score_opus":0.11652703004926346,"score_gpt":0.38104999362034464,"score_spread":0.2645229635710812,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4392869771","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009716553,0.005384049,0.785458,0.00437776,0.001565084,0.0004766381,0.0092936335,0.08785965,0.0958686],"genre_scores_gemma":[0.15172449,0.006256936,0.6811534,0.0031611144,0.00088902237,0.0007169943,0.03133543,0.012936319,0.11182627],"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99790573,0.0005483063,0.00014557762,0.00028700443,0.0009167804,0.00019655745],"domain_scores_gemma":[0.99578816,0.0015545742,0.00011726963,0.0017654586,0.00055175053,0.00022281727],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0031558897,0.0009992127,0.0011477892,0.002598742,0.0012754824,0.0067337826,0.0032122948,0.0018230174,0.029888967],"category_scores_gemma":[0.013420689,0.0009300046,0.0012405248,0.004005894,0.0012731756,0.016092248,0.007937326,0.0032762073,0.018456895],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00039197865,0.00014374696,0.001286752,0.00071878487,0.00010871543,0.0002814528,0.00070454227,0.0066511203,0.0049972134,0.26464677,0.37820548,0.3418635],"study_design_scores_gemma":[0.000109849636,0.00006285752,0.0006741535,0.0002608395,0.00008667467,0.00038589895,0.00037154404,0.10430416,0.008598569,0.2628073,0.622246,0.00009214792],"about_ca_topic_score_codex":0.008584033,"about_ca_topic_score_gemma":0.009027512,"teacher_disagreement_score":0.029888967,"about_ca_system_score_codex":0.0012357961,"about_ca_system_score_gemma":0.0016904017,"threshold_uncertainty_score":0.09998852},"labels":[],"label_agreement":null},{"id":"W4393327679","doi":"10.1016/j.knosys.2024.111678","title":"Better entity matching with transformers through ensembles","year":2024,"lang":"en","type":"article","venue":"Knowledge-Based Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"National Research Council Canada; McGill University","funders":"Natural Sciences and Engineering Research Council of Canada; Canada Research Chairs","keywords":"Transformer; Computer science; Matching (statistics); Artificial intelligence; Data mining; Engineering; Mathematics; Electrical engineering; Statistics; Voltage","score_opus":0.12214234167731597,"score_gpt":0.3903886435702951,"score_spread":0.26824630189297916,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393327679","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.030191565,0.0003478447,0.9649071,0.00032423122,0.00008206352,0.00007849749,0.0003604502,0.0020914886,0.0016167412],"genre_scores_gemma":[0.63430214,0.00059121224,0.36006105,0.00023496151,0.000121540754,0.000072098745,0.0016724108,0.00039585395,0.0025488406],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9956363,0.0014487504,0.00041016075,0.0010057305,0.0011542891,0.0003448183],"domain_scores_gemma":[0.9891873,0.004662211,0.00044864832,0.004111233,0.0013319863,0.00025850855],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0046684053,0.0008203154,0.0016083722,0.0030024182,0.0009831013,0.0033877557,0.0016177817,0.0011839048,0.0041341526],"category_scores_gemma":[0.022684334,0.00071053393,0.0016710081,0.0042442908,0.00091977534,0.0112710465,0.0038561784,0.0019148781,0.0013412634],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007704294,0.00042274827,0.009874784,0.0002947068,0.0005143831,0.00031567228,0.00045947442,0.17448573,0.011986021,0.10891816,0.009344106,0.68261385],"study_design_scores_gemma":[0.0000340373,0.00007485404,0.000894268,0.000045298424,0.00016607427,0.00014744239,0.0001088961,0.8247283,0.0120030325,0.15714277,0.0046248524,0.000030102909],"about_ca_topic_score_codex":0.005668989,"about_ca_topic_score_gemma":0.008642,"teacher_disagreement_score":0.005668989,"about_ca_system_score_codex":0.000948277,"about_ca_system_score_gemma":0.0020507846,"threshold_uncertainty_score":0.024689138},"labels":[],"label_agreement":null},{"id":"W4393370844","doi":"10.29173/jchla29751","title":"Review of 'Data-Driven Decisions: A Practical Toolkit for Librarians and Information Professionals'","year":2024,"lang":"en","type":"article","venue":"Journal of the Canadian Health Libraries Association / Journal de l Association de bilbiothèques de la santé du Canada","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Computer science; Data science; Knowledge management; World Wide Web","score_opus":0.05294237714436072,"score_gpt":0.39841301689478775,"score_spread":0.345470639750427,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393370844","genre_codex":"commentary","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0032508576,0.07826967,0.30488208,0.53716844,0.022603262,0.0069705546,0.0024481388,0.0057739886,0.038632948],"genre_scores_gemma":[0.04362073,0.052404124,0.8053778,0.06540735,0.00832512,0.0062567666,0.0025010586,0.001633772,0.01447335],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.68106157,0.2146903,0.03302477,0.007068684,0.06072995,0.0034247262],"domain_scores_gemma":[0.31497127,0.46444532,0.01840779,0.039625727,0.15170658,0.01084336],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.30644715,0.00213284,0.004461371,0.014255924,0.005660402,0.021609385,0.011745386,0.0079269055,0.013024633],"category_scores_gemma":[0.503168,0.0022788339,0.0032936384,0.011773775,0.009582122,0.016968034,0.015269522,0.011458184,0.0052073617],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00011712231,0.00009655108,0.00077878707,0.010850537,0.00020374454,0.00036506655,0.0074122343,0.0007961694,0.00055259914,0.017480101,0.3799958,0.5813513],"study_design_scores_gemma":[0.0001440721,0.00013034511,0.0010075485,0.017364694,0.00024834808,0.00046790738,0.0046644406,0.0014110822,0.0010180057,0.035451513,0.9378976,0.00019433853],"about_ca_topic_score_codex":0.021635327,"about_ca_topic_score_gemma":0.057399906,"teacher_disagreement_score":0.30644715,"about_ca_system_score_codex":0.014350648,"about_ca_system_score_gemma":0.0985928,"threshold_uncertainty_score":0.85527414},"labels":[],"label_agreement":null},{"id":"W4393476016","doi":"10.5281/zenodo.10247175","title":"StreamMapper Membership Tables for GD-1 and Pal 5","year":2023,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science","score_opus":0.23191240980410538,"score_gpt":0.3766317142646174,"score_spread":0.144719304460512,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393476016","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00013830808,0.000017270077,0.00019900546,0.000040243725,0.000018245482,0.000014667271,0.9977609,0.0011250186,0.00068640715],"genre_scores_gemma":[0.00045522148,0.000023655224,0.00081423717,0.00003923579,0.0000054365833,0.00011154257,0.99735093,0.0004802543,0.0007195352],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9988852,0.00014210254,0.00013549809,0.00042692784,0.00025842254,0.00015183954],"domain_scores_gemma":[0.99750525,0.00063441566,0.00022338696,0.0007744798,0.0006072522,0.00025518623],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0013953588,0.0017445119,0.001231678,0.0035408477,0.00082884525,0.0025455784,0.0026680797,0.0013754063,0.11244246],"category_scores_gemma":[0.0071416055,0.0008472061,0.001203326,0.0066038053,0.00047116625,0.0018930978,0.0022656098,0.0022463708,0.14576039],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00003577611,0.000012230051,0.0007585401,0.00023160655,0.00001460814,0.0000108441245,0.000030066001,0.00027234308,0.000116708354,0.0008138513,0.9959319,0.0017715696],"study_design_scores_gemma":[0.00015881282,0.0000084939475,0.0027760835,0.0001080213,0.000013859702,0.000033394794,0.00007115911,0.00069201924,0.00057717215,0.0030834284,0.99245113,0.000026353871],"about_ca_topic_score_codex":0.014850172,"about_ca_topic_score_gemma":0.025628041,"teacher_disagreement_score":0.11244246,"about_ca_system_score_codex":0.0017922419,"about_ca_system_score_gemma":0.0025757307,"threshold_uncertainty_score":0.37615752},"labels":[],"label_agreement":null},{"id":"W4393482895","doi":"10.5281/zenodo.831804","title":"Replication Package For How The R Community Creates And Curates Knowledge: An Extended Study Of Stack Overflow And Mailing Lists","year":2017,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria","funders":"","keywords":"Replication (statistics); Stack (abstract data type); Computer science; World Wide Web; Data science; Biology; Operating system; Virology","score_opus":0.28101975437067334,"score_gpt":0.43084575850810003,"score_spread":0.1498260041374267,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393482895","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0019210393,0.00013371898,0.0029358508,0.0004184622,0.00016214598,0.00027722702,0.9902056,0.0020501972,0.0018957483],"genre_scores_gemma":[0.006404662,0.00007623054,0.0069567515,0.00026685852,0.00005293813,0.002463249,0.9806903,0.0010469921,0.0020418745],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.98837644,0.0046538226,0.0016624222,0.0025330475,0.0019871898,0.00078705256],"domain_scores_gemma":[0.9331666,0.026786456,0.0035685466,0.027247204,0.007819781,0.0014114797],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.017368786,0.0019079219,0.0014588083,0.004285924,0.0021831277,0.003537945,0.005102432,0.002458282,0.042886015],"category_scores_gemma":[0.090564735,0.0011365841,0.0022309495,0.005985125,0.0014142017,0.0017744326,0.004031306,0.0044207033,0.039488062],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002678439,0.000083059356,0.004843558,0.00084727415,0.00020913745,0.000058620022,0.0002600076,0.0006336302,0.00016425988,0.0024985878,0.98325896,0.0068750954],"study_design_scores_gemma":[0.0015124282,0.00007908694,0.017290905,0.00056272617,0.00022029331,0.00022262197,0.000356801,0.0016419326,0.0009934285,0.010227011,0.96674144,0.0001513651],"about_ca_topic_score_codex":0.016658463,"about_ca_topic_score_gemma":0.03556524,"teacher_disagreement_score":0.99489754,"about_ca_system_score_codex":0.0018078035,"about_ca_system_score_gemma":0.0054024323,"threshold_uncertainty_score":0.14346802},"labels":[],"label_agreement":null},{"id":"W4393496653","doi":"10.5281/zenodo.1303406","title":"Assisting The Appraisal Of E-Mail Records With Automatic Classification","year":2018,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Computer science; Data mining","score_opus":0.18887021048498925,"score_gpt":0.38195591701409737,"score_spread":0.19308570652910811,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393496653","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.25748757,0.0024220727,0.027822005,0.0016991361,0.0009785658,0.0014342548,0.6687609,0.02483509,0.014560486],"genre_scores_gemma":[0.099226944,0.00046202794,0.05070841,0.00020957581,0.00016182831,0.000698354,0.84141076,0.00021903389,0.006903081],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99759585,0.0005718593,0.00037112998,0.0005470571,0.0006757068,0.00023836594],"domain_scores_gemma":[0.99336445,0.002374748,0.00058014004,0.0014895336,0.0019118201,0.00027923295],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0035724977,0.0013053027,0.0006971921,0.005533627,0.000568496,0.00156071,0.0012846959,0.0012196731,0.0045222817],"category_scores_gemma":[0.009673761,0.00022809701,0.00059478,0.0036029594,0.00031247933,0.001092318,0.0010731432,0.0012501653,0.009725963],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001005391,0.0014191612,0.043610673,0.0013217445,0.00013209655,0.00040913353,0.00032105343,0.0074112467,0.0058893296,0.001977456,0.66612136,0.27038145],"study_design_scores_gemma":[0.0007241386,0.00092056213,0.11707148,0.0004807541,0.00020645134,0.00089656824,0.0013834729,0.24062236,0.045206614,0.007941147,0.5843495,0.00019702618],"about_ca_topic_score_codex":0.0073607373,"about_ca_topic_score_gemma":0.01435753,"teacher_disagreement_score":0.0073607373,"about_ca_system_score_codex":0.0011900449,"about_ca_system_score_gemma":0.0011993073,"threshold_uncertainty_score":0.018893361},"labels":[],"label_agreement":null},{"id":"W4393520745","doi":"10.5281/zenodo.8200678","title":"OpenAlex Author Name Disambiguation V3 Data - Disambiguation Model","year":2023,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"OpenAlex","funders":"","keywords":"Computer science; Natural language processing; Artificial intelligence; Information retrieval","score_opus":0.4820321125774946,"score_gpt":0.44476936927281047,"score_spread":0.037262743304684154,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393520745","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0014945887,0.00021552887,0.0027744204,0.0002271663,0.00017638241,0.0001777151,0.9775429,0.014813273,0.0025781544],"genre_scores_gemma":[0.001904805,0.000051849933,0.006161306,0.00014101385,0.000015001051,0.0003009558,0.989223,0.00063880475,0.0015632631],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9979557,0.000315068,0.00023704527,0.0008312962,0.00041708152,0.00024373516],"domain_scores_gemma":[0.99747086,0.00057774637,0.00016789616,0.00096771296,0.0006588595,0.00015696697],"candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.002440143,0.003319819,0.0014032325,0.003666662,0.0013833948,0.0023466595,0.0037848782,0.002501348,0.05002132],"category_scores_gemma":[0.00707018,0.0009885521,0.0025711628,0.0038084665,0.0008538109,0.0020320911,0.003269677,0.002826814,0.107500985],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00019522775,0.00006908865,0.0015429354,0.00058236736,0.000049222537,0.00006888667,0.00005930309,0.0014127477,0.00060240744,0.0009949112,0.9835693,0.0108535765],"study_design_scores_gemma":[0.00028702087,0.000056770736,0.0028728037,0.00019048968,0.000051912106,0.00020792626,0.00016631673,0.004997231,0.0036315764,0.0035690977,0.983889,0.00008000882],"about_ca_topic_score_codex":0.013646127,"about_ca_topic_score_gemma":0.02981425,"teacher_disagreement_score":0.99755985,"about_ca_system_score_codex":0.0024232124,"about_ca_system_score_gemma":0.003366083,"threshold_uncertainty_score":0.16733801},"labels":[],"label_agreement":null},{"id":"W4393556446","doi":"10.5281/zenodo.1303407","title":"Assisting The Appraisal Of E-Mail Records With Automatic Classification","year":2018,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Computer science; Data mining; Information retrieval","score_opus":0.18887021048498925,"score_gpt":0.38195591701409737,"score_spread":0.19308570652910811,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393556446","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.25748757,0.0024220727,0.027822005,0.0016991361,0.0009785658,0.0014342548,0.6687609,0.02483509,0.014560486],"genre_scores_gemma":[0.099226944,0.00046202794,0.05070841,0.00020957581,0.00016182831,0.000698354,0.84141076,0.00021903389,0.006903081],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99759585,0.0005718593,0.00037112998,0.0005470571,0.0006757068,0.00023836594],"domain_scores_gemma":[0.99336445,0.002374748,0.00058014004,0.0014895336,0.0019118201,0.00027923295],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0035724977,0.0013053027,0.0006971921,0.005533627,0.000568496,0.00156071,0.0012846959,0.0012196731,0.0045222817],"category_scores_gemma":[0.009673761,0.00022809701,0.00059478,0.0036029594,0.00031247933,0.001092318,0.0010731432,0.0012501653,0.009725963],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001005391,0.0014191612,0.043610673,0.0013217445,0.00013209655,0.00040913353,0.00032105343,0.0074112467,0.0058893296,0.001977456,0.66612136,0.27038145],"study_design_scores_gemma":[0.0007241386,0.00092056213,0.11707148,0.0004807541,0.00020645134,0.00089656824,0.0013834729,0.24062236,0.045206614,0.007941147,0.5843495,0.00019702618],"about_ca_topic_score_codex":0.0073607373,"about_ca_topic_score_gemma":0.01435753,"teacher_disagreement_score":0.0073607373,"about_ca_system_score_codex":0.0011900449,"about_ca_system_score_gemma":0.0011993073,"threshold_uncertainty_score":0.018893361},"labels":[],"label_agreement":null},{"id":"W4393677160","doi":"10.5281/zenodo.1324412","title":"Dataset for: Exploring the experiences of academic libraries with research data management: a meta-ethnographic analysis of qualitative studies","year":2018,"lang":"en","type":"dataset","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University; University of Toronto","funders":"","keywords":"Ethnography; Qualitative research; Meta-analysis; Qualitative property; Data management; Qualitative analysis; Sociology; Data science; Library science; World Wide Web; Computer science; Database; Social science; Medicine; Anthropology","score_opus":0.9542500389912101,"score_gpt":0.654501081881029,"score_spread":0.2997489571101811,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393677160","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00035453108,0.00011539916,0.0009040473,0.00046234758,0.000066206645,0.0011046296,0.99455655,0.0002598951,0.0021764655],"genre_scores_gemma":[0.0050846147,0.00046259357,0.014349279,0.00075774844,0.000041235584,0.060587306,0.9120866,0.00062934234,0.0060012736],"study_design_codex":"not_applicable","study_design_gemma":"qualitative","domain_scores_codex":[0.9941063,0.0022358473,0.0015910097,0.00054587837,0.0011744321,0.00034660636],"domain_scores_gemma":[0.94816285,0.032022074,0.0036446478,0.0059127877,0.009184914,0.001072771],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.011486348,0.00091125385,0.0010777387,0.005545287,0.0016431567,0.0030066993,0.0023680767,0.0012653725,0.21659909],"category_scores_gemma":[0.06915359,0.0008691604,0.0012343652,0.01149166,0.00063535594,0.0025424166,0.004474659,0.0019766733,0.04134828],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00008062229,0.000027139336,0.0007081266,0.0060197874,0.000043741875,0.00002720521,0.00084724743,0.00018061041,0.00014712637,0.002010422,0.97828203,0.011625931],"study_design_scores_gemma":[0.0004924172,0.000026359266,0.00503866,0.004185291,0.00007044586,0.00003996989,0.001691791,0.00014862785,0.00031499765,0.0033208397,0.9846064,0.000064273954],"about_ca_topic_score_codex":0.011563822,"about_ca_topic_score_gemma":0.023442842,"teacher_disagreement_score":0.98851365,"about_ca_system_score_codex":0.0037687868,"about_ca_system_score_gemma":0.008279875,"threshold_uncertainty_score":0.72459614},"labels":[],"label_agreement":null},{"id":"W4393689549","doi":"10.5281/zenodo.8189450","title":"OpenAlex Authors and Affiliations, V2","year":2023,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"OpenAlex","funders":"","keywords":"Geology","score_opus":0.22124788760444838,"score_gpt":0.3903120854090305,"score_spread":0.16906419780458212,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393689549","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":"evaluation","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":"evaluation","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00018628742,0.00006421622,0.00016944426,0.000079124744,0.00004855632,0.0000142496065,0.9963302,0.0011052852,0.0020025969],"genre_scores_gemma":[0.00030761806,0.000036885605,0.0004006299,0.000050209554,0.000009882804,0.000049168735,0.99787104,0.00034428365,0.00093016535],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9979709,0.0002940369,0.00022801202,0.0006431439,0.00055811036,0.00030579895],"domain_scores_gemma":[0.9968335,0.00063096714,0.0002843242,0.0011374991,0.0007902204,0.0003234826],"candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.0014934608,0.0018652057,0.0012518544,0.004146775,0.0014191214,0.004743351,0.0021412107,0.0017835958,0.09250908],"category_scores_gemma":[0.0075132623,0.00087784836,0.0012970861,0.0070371665,0.00068783644,0.0023680506,0.0030214752,0.002315992,0.18233551],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000043388434,0.000011122379,0.0005322411,0.00024833175,0.000013801794,0.000020433788,0.0000375593,0.000109023495,0.00013065363,0.0010726572,0.9960977,0.001683085],"study_design_scores_gemma":[0.000064059364,0.000006777406,0.0013493561,0.00009322103,0.000010439548,0.000053952965,0.00006481225,0.00011354788,0.0002499482,0.001211857,0.99676514,0.000016962731],"about_ca_topic_score_codex":0.015319627,"about_ca_topic_score_gemma":0.03642158,"teacher_disagreement_score":0.99850655,"about_ca_system_score_codex":0.0015335009,"about_ca_system_score_gemma":0.0037114804,"threshold_uncertainty_score":0.30947375},"labels":[],"label_agreement":null},{"id":"W4393717180","doi":"10.5281/zenodo.7555363","title":"A dataset from a survey investigating disciplinary differences in data citation","year":2023,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa; Université de Montréal","funders":"","keywords":"Citation; Discipline; Data science; Information retrieval; Computer science; Library science; Sociology; Social science","score_opus":0.5749845184576483,"score_gpt":0.43616563722372576,"score_spread":0.13881888123392255,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393717180","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.007294412,0.0002444345,0.00031395233,0.000690248,0.000045818906,0.00015639853,0.9883879,0.00015668233,0.0027101806],"genre_scores_gemma":[0.011501838,0.00021955892,0.0013352192,0.00026875793,0.000034176945,0.0009284797,0.98406583,0.00006170483,0.0015845547],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.9898363,0.0024366274,0.0023486826,0.0010726718,0.0036143153,0.0006915447],"domain_scores_gemma":[0.9251993,0.029835604,0.012750268,0.0068271095,0.022006644,0.0033811454],"candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.0067232344,0.0005567587,0.0007424173,0.009979367,0.000946076,0.001980235,0.0016693264,0.0015310899,0.026602542],"category_scores_gemma":[0.057610855,0.0005225701,0.0009309492,0.02836686,0.00036272922,0.0017006326,0.0024340148,0.0014119443,0.019579442],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001826561,0.00011915134,0.034822788,0.0017878241,0.00010139977,0.000051185638,0.0005687792,0.00035131734,0.00023747222,0.0011075542,0.94630355,0.01436642],"study_design_scores_gemma":[0.000263905,0.00010924687,0.300583,0.0010221881,0.00007718836,0.000143459,0.0017585256,0.00050713395,0.00043015668,0.00093572,0.6940852,0.00008439151],"about_ca_topic_score_codex":0.03296649,"about_ca_topic_score_gemma":0.0479333,"teacher_disagreement_score":0.9932768,"about_ca_system_score_codex":0.0034721931,"about_ca_system_score_gemma":0.0046814093,"threshold_uncertainty_score":0.088994324},"labels":[],"label_agreement":null},{"id":"W4393735424","doi":"10.5281/zenodo.8189449","title":"OpenAlex Authors and Affiliations, V2","year":2023,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"OpenAlex","funders":"","keywords":"Geography; Geology","score_opus":0.22124788760444838,"score_gpt":0.3903120854090305,"score_spread":0.16906419780458212,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393735424","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00018628742,0.00006421622,0.00016944426,0.000079124744,0.00004855632,0.0000142496065,0.9963302,0.0011052852,0.0020025969],"genre_scores_gemma":[0.00030761806,0.000036885605,0.0004006299,0.000050209554,0.000009882804,0.000049168735,0.99787104,0.00034428365,0.00093016535],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9979709,0.0002940369,0.00022801202,0.0006431439,0.00055811036,0.00030579895],"domain_scores_gemma":[0.9968335,0.00063096714,0.0002843242,0.0011374991,0.0007902204,0.0003234826],"candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.0014934608,0.0018652057,0.0012518544,0.004146775,0.0014191214,0.004743351,0.0021412107,0.0017835958,0.09250908],"category_scores_gemma":[0.0075132623,0.00087784836,0.0012970861,0.0070371665,0.00068783644,0.0023680506,0.0030214752,0.002315992,0.18233551],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000043388434,0.000011122379,0.0005322411,0.00024833175,0.000013801794,0.000020433788,0.0000375593,0.000109023495,0.00013065363,0.0010726572,0.9960977,0.001683085],"study_design_scores_gemma":[0.000064059364,0.000006777406,0.0013493561,0.00009322103,0.000010439548,0.000053952965,0.00006481225,0.00011354788,0.0002499482,0.001211857,0.99676514,0.000016962731],"about_ca_topic_score_codex":0.015319627,"about_ca_topic_score_gemma":0.03642158,"teacher_disagreement_score":0.99585325,"about_ca_system_score_codex":0.0015335009,"about_ca_system_score_gemma":0.0037114804,"threshold_uncertainty_score":0.30947375},"labels":[],"label_agreement":null},{"id":"W4393777015","doi":"10.5281/zenodo.4096182","title":"Data Literacies &amp; Practices in Higher Education: Educators' Perspectives","year":2020,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"","keywords":"Mathematics education; Sociology; Pedagogy; Computer science; Psychology","score_opus":0.43746757453122126,"score_gpt":0.4565183782044062,"score_spread":0.019050803673184957,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393777015","genre_codex":"empirical","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9176836,0.0010403342,0.00076287036,0.00944588,0.000033068853,0.00007592627,0.054305602,0.00004816291,0.016604586],"genre_scores_gemma":[0.96709365,0.0006137725,0.0013255676,0.0008673315,0.000017700817,0.00016310124,0.027645713,0.000019456924,0.0022536411],"study_design_codex":"observational","study_design_gemma":"not_applicable","domain_scores_codex":[0.99367046,0.0026944678,0.00082625175,0.00068430573,0.0013803465,0.0007441459],"domain_scores_gemma":[0.9622474,0.021325251,0.0055509782,0.002415181,0.0056583514,0.0028028975],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011621135,0.00009643657,0.00017729538,0.0022825643,0.00089276995,0.003006679,0.00047920286,0.00046464975,0.0034856463],"category_scores_gemma":[0.03326368,0.00015647395,0.00015227924,0.0053473655,0.00071968214,0.00258816,0.002793618,0.00088305253,0.00074110815],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00016957473,0.00023528015,0.81647587,0.00060108025,0.00002434541,0.00013760726,0.060527027,0.00032916182,0.00038177756,0.005831412,0.03715673,0.078130096],"study_design_scores_gemma":[0.000014459814,0.000051107458,0.79055405,0.0005216191,0.000008644328,0.00014617007,0.08451459,0.00041592433,0.0005028036,0.0010975733,0.122143775,0.000029339588],"about_ca_topic_score_codex":0.03553255,"about_ca_topic_score_gemma":0.051821765,"teacher_disagreement_score":0.03553255,"about_ca_system_score_codex":0.0026225557,"about_ca_system_score_gemma":0.0028528436,"threshold_uncertainty_score":0.07065141},"labels":[],"label_agreement":null},{"id":"W4393829228","doi":"10.5281/zenodo.8200679","title":"OpenAlex Author Name Disambiguation V3 Data - Disambiguation Model","year":2023,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"OpenAlex","funders":"","keywords":"Computer science; Natural language processing; Artificial intelligence; Information retrieval; Linguistics; Philosophy","score_opus":0.4820321125774946,"score_gpt":0.44476936927281047,"score_spread":0.037262743304684154,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393829228","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0014945887,0.00021552887,0.0027744204,0.0002271663,0.00017638241,0.0001777151,0.9775429,0.014813273,0.0025781544],"genre_scores_gemma":[0.001904805,0.000051849933,0.006161306,0.00014101385,0.000015001051,0.0003009558,0.989223,0.00063880475,0.0015632631],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9979557,0.000315068,0.00023704527,0.0008312962,0.00041708152,0.00024373516],"domain_scores_gemma":[0.99747086,0.00057774637,0.00016789616,0.00096771296,0.0006588595,0.00015696697],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.002440143,0.003319819,0.0014032325,0.003666662,0.0013833948,0.0023466595,0.0037848782,0.002501348,0.05002132],"category_scores_gemma":[0.00707018,0.0009885521,0.0025711628,0.0038084665,0.0008538109,0.0020320911,0.003269677,0.002826814,0.107500985],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00019522775,0.00006908865,0.0015429354,0.00058236736,0.000049222537,0.00006888667,0.00005930309,0.0014127477,0.00060240744,0.0009949112,0.9835693,0.0108535765],"study_design_scores_gemma":[0.00028702087,0.000056770736,0.0028728037,0.00019048968,0.000051912106,0.00020792626,0.00016631673,0.004997231,0.0036315764,0.0035690977,0.983889,0.00008000882],"about_ca_topic_score_codex":0.013646127,"about_ca_topic_score_gemma":0.02981425,"teacher_disagreement_score":0.99755985,"about_ca_system_score_codex":0.0024232124,"about_ca_system_score_gemma":0.003366083,"threshold_uncertainty_score":0.16733801},"labels":[],"label_agreement":null},{"id":"W4394049725","doi":"10.5281/zenodo.4096183","title":"Data Literacies &amp; Practices in Higher Education: Educators' Perspectives","year":2020,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"","keywords":"Sociology; Mathematics education; Pedagogy; Psychology","score_opus":0.43746757453122126,"score_gpt":0.4565183782044062,"score_spread":0.019050803673184957,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4394049725","genre_codex":"empirical","genre_gemma":"dataset","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9176836,0.0010403342,0.00076287036,0.00944588,0.000033068853,0.00007592627,0.054305602,0.00004816291,0.016604586],"genre_scores_gemma":[0.96709365,0.0006137725,0.0013255676,0.0008673315,0.000017700817,0.00016310124,0.027645713,0.000019456924,0.0022536411],"study_design_codex":"observational","study_design_gemma":"qualitative","domain_scores_codex":[0.99367046,0.0026944678,0.00082625175,0.00068430573,0.0013803465,0.0007441459],"domain_scores_gemma":[0.9622474,0.021325251,0.0055509782,0.002415181,0.0056583514,0.0028028975],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.011621135,0.00009643657,0.00017729538,0.0022825643,0.00089276995,0.003006679,0.00047920286,0.00046464975,0.0034856463],"category_scores_gemma":[0.03326368,0.00015647395,0.00015227924,0.0053473655,0.00071968214,0.00258816,0.002793618,0.00088305253,0.00074110815],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00016957473,0.00023528015,0.81647587,0.00060108025,0.00002434541,0.00013760726,0.060527027,0.00032916182,0.00038177756,0.005831412,0.03715673,0.078130096],"study_design_scores_gemma":[0.000014459814,0.000051107458,0.79055405,0.0005216191,0.000008644328,0.00014617007,0.08451459,0.00041592433,0.0005028036,0.0010975733,0.122143775,0.000029339588],"about_ca_topic_score_codex":0.03553255,"about_ca_topic_score_gemma":0.051821765,"teacher_disagreement_score":0.9883789,"about_ca_system_score_codex":0.0026225557,"about_ca_system_score_gemma":0.0028528436,"threshold_uncertainty_score":0.07065141},"labels":[],"label_agreement":null},{"id":"W4394081635","doi":"10.6084/m9.figshare.23878644","title":"Data Canada Study 1","year":2023,"lang":"en","type":"dataset","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Computer science","score_opus":0.65019135127114,"score_gpt":0.5022475106843322,"score_spread":0.14794384058680787,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4394081635","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0010343842,0.000042146487,0.00010459167,0.00016914008,0.000027550177,0.00036311397,0.9950368,0.00005896268,0.0031631805],"genre_scores_gemma":[0.00613928,0.00017704579,0.0017254743,0.00033533748,0.000019672765,0.0049585816,0.9700561,0.00015782454,0.016430708],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99564457,0.00036697867,0.00041409055,0.0006511198,0.0019128061,0.0010104871],"domain_scores_gemma":[0.9778502,0.0020665193,0.0009877979,0.0014256653,0.016179025,0.0014907611],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002568805,0.0013589666,0.0013856204,0.0077601066,0.004665592,0.003429883,0.003552644,0.0012570544,0.16299383],"category_scores_gemma":[0.020217616,0.0011403413,0.0011201894,0.01860063,0.00089058734,0.0012626318,0.0023592028,0.002404465,0.04175082],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000089918314,0.00004120571,0.004761567,0.0004373574,0.000022971639,0.00003724415,0.00035507247,0.00011970823,0.000069157235,0.0016786294,0.98754275,0.0048443824],"study_design_scores_gemma":[0.00017151237,0.000022606502,0.039407007,0.0005625411,0.00003090181,0.000036627756,0.0018932085,0.00015495691,0.00019632901,0.00091813406,0.95654035,0.00006579429],"about_ca_topic_score_codex":0.95405567,"about_ca_topic_score_gemma":0.96856415,"teacher_disagreement_score":0.16299383,"about_ca_system_score_codex":0.026793042,"about_ca_system_score_gemma":0.11010981,"threshold_uncertainty_score":0.54526865},"labels":[],"label_agreement":null},{"id":"W4394433341","doi":"10.6084/m9.figshare.13229081","title":"DATA Cognition and Social Information Use Morinay et al. 2020 FrontiersEcoEvol","year":2020,"lang":"en","type":"dataset","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; Uppsala Universitet; Université de Lyon; Ministère de l'Enseignement Supérieur et de la Recherche; Agence Nationale de la Recherche","keywords":"Cognition; Psychology; Cognitive psychology; Cognitive science; Computer science; Data science; Neuroscience","score_opus":0.410437204575108,"score_gpt":0.43221580861264414,"score_spread":0.02177860403753612,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4394433341","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0006665104,0.00010592529,0.000064370695,0.00018925701,0.000035264427,0.000016846845,0.9982318,0.00013098263,0.00055903516],"genre_scores_gemma":[0.0030598633,0.00009996175,0.0005570375,0.00009880074,0.0000149571915,0.0002498599,0.9947884,0.000119715914,0.0010113427],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99873585,0.00031471616,0.00017900854,0.0002895317,0.000288875,0.00019206863],"domain_scores_gemma":[0.992875,0.0041492116,0.00057497306,0.0011009398,0.0009641089,0.0003357196],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0025893976,0.0012348155,0.0009600789,0.0037584868,0.00073605916,0.002374214,0.0016511834,0.0016046299,0.08172548],"category_scores_gemma":[0.02052034,0.00047317543,0.0013050361,0.0045377463,0.00052403734,0.0011627355,0.002094838,0.0013510939,0.03472194],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018582038,0.000049570084,0.006753751,0.0024453492,0.00016221304,0.000038331433,0.00014155854,0.00044697864,0.0001986602,0.0012627027,0.9820693,0.006245794],"study_design_scores_gemma":[0.00052838516,0.000039798255,0.033545222,0.0009635937,0.00013308141,0.000086404696,0.0002680636,0.00055998337,0.00027915277,0.0020898825,0.96144736,0.000059086127],"about_ca_topic_score_codex":0.025985103,"about_ca_topic_score_gemma":0.047739305,"teacher_disagreement_score":0.08172548,"about_ca_system_score_codex":0.000992501,"about_ca_system_score_gemma":0.001737385,"threshold_uncertainty_score":0.27339894},"labels":[],"label_agreement":null},{"id":"W4394936107","doi":"10.5465/amj.2024.4002","title":"Mobilizing New Sources of Data: Opportunities and Recommendations","year":2024,"lang":"en","type":"article","venue":"Academy of Management Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":17,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"HEC Montréal","funders":"","keywords":"Business; Data science; Environmental science; Computer science","score_opus":0.5236404761192961,"score_gpt":0.4822428565995527,"score_spread":0.04139761951974341,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4394936107","genre_codex":"commentary","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0028668,0.06824638,0.010496509,0.90223193,0.007932132,0.0003568986,0.0008174191,0.00035098914,0.0067009465],"genre_scores_gemma":[0.1101026,0.326486,0.26520237,0.2501813,0.022304902,0.0045268773,0.007886025,0.0005917614,0.01271816],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9167596,0.05321778,0.006007963,0.00482189,0.014544637,0.004648027],"domain_scores_gemma":[0.5018663,0.3385821,0.012240442,0.024642803,0.09083887,0.031829473],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.12016983,0.0022075453,0.0026082576,0.009309163,0.0066053043,0.023065802,0.010317347,0.02259809,0.021407368],"category_scores_gemma":[0.24869354,0.0017555426,0.0034809771,0.0092431335,0.01059115,0.072772756,0.015171889,0.018851694,0.0067959283],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00041513558,0.0006360133,0.013489766,0.009527834,0.00031650063,0.0012594498,0.00918297,0.0016307657,0.0006953303,0.092828505,0.51111764,0.3589],"study_design_scores_gemma":[0.00023618409,0.00015602064,0.0036665364,0.03325209,0.00020458594,0.0009345298,0.05871256,0.003030698,0.000698341,0.14344902,0.7552917,0.00036781284],"about_ca_topic_score_codex":0.016542694,"about_ca_topic_score_gemma":0.03119941,"teacher_disagreement_score":0.8798302,"about_ca_system_score_codex":0.0068031256,"about_ca_system_score_gemma":0.05247701,"threshold_uncertainty_score":0.6355264},"labels":[],"label_agreement":null},{"id":"W4395098146","doi":"10.1007/978-981-97-2242-6_16","title":"Class Ratio and Its Implications for Reproducibility and Performance in Record Linkage","year":2024,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Computer science; Record linkage; Pairwise comparison; Matching (statistics); Linkage (software); Classifier (UML); Data mining; Class (philosophy); Test data; Artificial intelligence; Information retrieval; Statistics; Mathematics","score_opus":0.13093958025310867,"score_gpt":0.3785712184593527,"score_spread":0.24763163820624404,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4395098146","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.101354115,0.008004916,0.85156775,0.009026157,0.0013188091,0.00026337913,0.0012429244,0.0034101077,0.023811858],"genre_scores_gemma":[0.6854679,0.0022598854,0.29867795,0.00079491886,0.0016771611,0.00042702275,0.00087015156,0.0016322642,0.008192775],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.896337,0.056456894,0.0058617163,0.010744406,0.028997976,0.0016021435],"domain_scores_gemma":[0.22371614,0.6977351,0.012439395,0.046804458,0.017905314,0.0013995762],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.10575862,0.00079631666,0.002278552,0.0057924455,0.00218289,0.009570444,0.0059206313,0.0039361045,0.0057589416],"category_scores_gemma":[0.5551079,0.0010189891,0.0014076688,0.010496583,0.0057876282,0.016218621,0.003937359,0.00409094,0.0020145243],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017868102,0.00045851176,0.090132214,0.00060828327,0.00051320234,0.0003526149,0.0025831203,0.038529515,0.0042297747,0.29695553,0.019271854,0.5445786],"study_design_scores_gemma":[0.00023827703,0.00061109924,0.0278029,0.0002477101,0.00046714663,0.002568934,0.0011358307,0.3090359,0.018058773,0.6271628,0.012334697,0.00033594485],"about_ca_topic_score_codex":0.0018729379,"about_ca_topic_score_gemma":0.001041824,"teacher_disagreement_score":0.10575862,"about_ca_system_score_codex":0.00300211,"about_ca_system_score_gemma":0.0027767746,"threshold_uncertainty_score":0.55931175},"labels":[],"label_agreement":null},{"id":"W4396561978","doi":"10.1201/9781003258254","title":"The Data Preparation Journey","year":2024,"lang":"en","type":"book","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria","funders":"","keywords":"Computer science","score_opus":0.5389770882399062,"score_gpt":0.532252402529568,"score_spread":0.006724685710338241,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4396561978","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0031466747,0.01879496,0.36586198,0.17967887,0.02919972,0.0026266528,0.01197315,0.016357172,0.3723609],"genre_scores_gemma":[0.010724323,0.019630041,0.39289072,0.052377127,0.006934996,0.0029340493,0.013343826,0.0149357505,0.48622927],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9733483,0.00897971,0.0016601584,0.0027939002,0.012469221,0.0007486868],"domain_scores_gemma":[0.9308346,0.031009356,0.0018238745,0.0105785625,0.020700485,0.005053097],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.026751777,0.0013466624,0.001560942,0.003264036,0.0048498656,0.022402339,0.0042603402,0.004777827,0.08475397],"category_scores_gemma":[0.100095145,0.002030041,0.0019815455,0.0049576066,0.004336218,0.016999185,0.012299476,0.014308299,0.118437864],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000041682975,0.000045213397,0.00024779802,0.0005137438,0.00002054301,0.00016030719,0.0020282662,0.00033894047,0.00051924324,0.05152305,0.7159216,0.2286396],"study_design_scores_gemma":[0.0000041209732,0.000013760558,0.00009220328,0.0002471303,0.000003337234,0.000118736905,0.00029700212,0.00009260229,0.00017053721,0.012514629,0.98642737,0.000018461276],"about_ca_topic_score_codex":0.0030482335,"about_ca_topic_score_gemma":0.003488309,"teacher_disagreement_score":0.08475397,"about_ca_system_score_codex":0.004464178,"about_ca_system_score_gemma":0.015122835,"threshold_uncertainty_score":0.28353024},"labels":[],"label_agreement":null},{"id":"W4396577082","doi":"10.61737/gdbg7853","title":"Définitions et usages de l’IA en santé - Fiche 1","year":2022,"lang":"fr","type":"report","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Political science; Humanities; Art","score_opus":0.37945299070058497,"score_gpt":0.5254114740594544,"score_spread":0.14595848335886946,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4396577082","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01024736,0.07430701,0.3702453,0.059373032,0.005413827,0.0007591364,0.0034965463,0.00082851294,0.47532925],"genre_scores_gemma":[0.40210542,0.065740295,0.4181594,0.02389479,0.0048306957,0.0048665428,0.0056431275,0.0010799682,0.07367969],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9576289,0.024998548,0.0052549145,0.0039624358,0.0063733575,0.0017817958],"domain_scores_gemma":[0.9415814,0.036904138,0.004591361,0.005311686,0.010207535,0.0014037798],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02154285,0.0017302897,0.0015110313,0.014285814,0.0062834616,0.018840617,0.0041284496,0.0063301907,0.009758915],"category_scores_gemma":[0.039048612,0.00095582573,0.0022286728,0.021011328,0.029223705,0.016083289,0.007046692,0.007923287,0.003307568],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000018600322,0.000014103884,0.00080430054,0.00050290773,0.000022446286,0.000121715624,0.0069830716,0.00038337545,0.00018472485,0.95893896,0.010037141,0.021988733],"study_design_scores_gemma":[0.000008809967,0.000038445218,0.0016291123,0.0023769613,0.00003071165,0.00069868175,0.004917352,0.0011074756,0.0004030706,0.19799745,0.7907278,0.00006415121],"about_ca_topic_score_codex":0.04230143,"about_ca_topic_score_gemma":0.020018568,"teacher_disagreement_score":0.04230143,"about_ca_system_score_codex":0.016284334,"about_ca_system_score_gemma":0.010590471,"threshold_uncertainty_score":0.118151665},"labels":[],"label_agreement":null},{"id":"W4396767755","doi":"10.23977/acss.2024.080307","title":"Research on an Automatic Table Generation Model Based on Entity Attribute Relations","year":2024,"lang":"en","type":"article","venue":"Advances in Computer Signals and Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Table (database); Computer science; Natural language processing; Information retrieval; Data mining; Artificial intelligence","score_opus":0.3452929619656378,"score_gpt":0.4932424078717301,"score_spread":0.14794944590609233,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4396767755","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0065595205,0.00036532443,0.9888236,0.00018367512,0.000054230768,0.0001234466,0.00023038549,0.0017332154,0.0019266251],"genre_scores_gemma":[0.21186963,0.001353501,0.7783957,0.00026705078,0.00009747702,0.0004563659,0.0023249672,0.00033253996,0.0049027717],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9983333,0.00028650922,0.00015920625,0.0004289269,0.00067468086,0.00011740711],"domain_scores_gemma":[0.99819857,0.0006381673,0.00014589279,0.0004083387,0.00052246713,0.000086561544],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0014847798,0.0006969858,0.0007700352,0.0016646873,0.00086354284,0.002773804,0.0023835532,0.00081004953,0.0032216327],"category_scores_gemma":[0.0043126564,0.00050499424,0.0014089321,0.0026734294,0.00088465225,0.0058237906,0.0010341086,0.0009706106,0.000983485],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00029569975,0.00024223825,0.0063638613,0.00070463656,0.00014124083,0.0005140126,0.0011101862,0.22047235,0.019001558,0.22307853,0.016500128,0.5115756],"study_design_scores_gemma":[0.000051511397,0.00012492079,0.0008154175,0.0000695517,0.00012762514,0.00044931122,0.00014406528,0.9267448,0.009349838,0.03549125,0.026556307,0.00007525849],"about_ca_topic_score_codex":0.009260616,"about_ca_topic_score_gemma":0.005519124,"teacher_disagreement_score":0.009260616,"about_ca_system_score_codex":0.001399673,"about_ca_system_score_gemma":0.0026272258,"threshold_uncertainty_score":0.018413424},"labels":[],"label_agreement":null},{"id":"W4398141288","doi":"10.23889/ijpds.v9i1.2378","title":"Semantically Interoperable Census Data: Unlocking the Semantics of Census Data Using Ontologies and Linked Data","year":2024,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; Tata Consultancy Services","keywords":"Census; Computer science; Ontology; Data science; Population; Data mining; American Community Survey; Interoperability; Geography; Information retrieval; World Wide Web","score_opus":0.68581780609668,"score_gpt":0.5772460683615351,"score_spread":0.10857173773514484,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4398141288","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012153676,0.0004193888,0.97182786,0.0031247875,0.00013330873,0.00043537578,0.0036980729,0.0020860115,0.0061214627],"genre_scores_gemma":[0.123685315,0.00092659926,0.8588483,0.00070974947,0.000073032475,0.00049783144,0.012492247,0.00065395073,0.002113129],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9875772,0.004367477,0.0020127299,0.0013644904,0.0041679204,0.00051023933],"domain_scores_gemma":[0.97501284,0.008681301,0.002321582,0.007619063,0.005415771,0.00094946916],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01555811,0.0007929455,0.0008125629,0.010285558,0.002944432,0.008517748,0.0027394188,0.0013281767,0.0013031096],"category_scores_gemma":[0.04474295,0.00079813803,0.0023170444,0.01267108,0.003826735,0.017840916,0.010679506,0.0034469918,0.0005170706],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00016962709,0.00023200737,0.011947028,0.00085876504,0.00023831085,0.00092335587,0.017000781,0.022762813,0.0041260603,0.72846013,0.016540065,0.19674097],"study_design_scores_gemma":[0.00004843527,0.000049118647,0.0043847794,0.0010923699,0.00022322548,0.00042947484,0.00866858,0.11887452,0.008910492,0.502993,0.35412458,0.00020147565],"about_ca_topic_score_codex":0.11654584,"about_ca_topic_score_gemma":0.12588671,"teacher_disagreement_score":0.11654584,"about_ca_system_score_codex":0.0053267786,"about_ca_system_score_gemma":0.01261198,"threshold_uncertainty_score":0.23173499},"labels":[],"label_agreement":null},{"id":"W4398180243","doi":"10.1007/s00778-024-00847-y","title":"Discovering approximate implicit domain orders through order dependencies","year":2024,"lang":"en","type":"article","venue":"The VLDB Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University; York University; University of Waterloo","funders":"","keywords":"Computer science; Domain (mathematical analysis); Order (exchange); Data mining; Theoretical computer science; Mathematics; Business","score_opus":0.13203993517966403,"score_gpt":0.4151772800383418,"score_spread":0.2831373448586778,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4398180243","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.24866703,0.0016607725,0.7358601,0.000901895,0.00010654081,0.0001728431,0.004804878,0.0022374974,0.0055884677],"genre_scores_gemma":[0.7728777,0.0011580726,0.21538155,0.00015815087,0.00010121596,0.00010442044,0.0072640725,0.00025765877,0.0026971048],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9985202,0.0003166295,0.00013425169,0.0003549543,0.0005086923,0.00016523305],"domain_scores_gemma":[0.9920551,0.0053108977,0.0006354673,0.0010629761,0.00073390437,0.00020159788],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0010530535,0.00095862884,0.0011350423,0.0037570372,0.00068131293,0.0023335323,0.0013545983,0.0008527173,0.0031835577],"category_scores_gemma":[0.010416735,0.0009427475,0.0009817961,0.0036917024,0.00082366867,0.00617337,0.0014043461,0.0021052493,0.0010898209],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014350989,0.0008503844,0.05019819,0.00071248534,0.00032101388,0.0011838427,0.00101366,0.40680793,0.008253225,0.072117224,0.016358668,0.4407483],"study_design_scores_gemma":[0.000037889404,0.000073600444,0.0020754663,0.000061949475,0.000056598816,0.00012355282,0.00021022113,0.91937333,0.0020760235,0.07235458,0.0035361664,0.000020654976],"about_ca_topic_score_codex":0.009516074,"about_ca_topic_score_gemma":0.020215727,"teacher_disagreement_score":0.009516074,"about_ca_system_score_codex":0.0009365803,"about_ca_system_score_gemma":0.0023302233,"threshold_uncertainty_score":0.018921316},"labels":[],"label_agreement":null},{"id":"W4398370825","doi":"10.7910/dvn/krogfv","title":"Replication Data for: Service Representation in a Federal System: A Field Experiment","year":2018,"lang":"en","type":"dataset","venue":"Harvard Dataverse","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Replication (statistics); Representation (politics); Field (mathematics); Service (business); Computer science; Business; Political science; Mathematics; Statistics","score_opus":0.2563692904441717,"score_gpt":0.45251321404726,"score_spread":0.1961439236030883,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4398370825","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0014836929,0.000049510694,0.0012083431,0.0007566826,0.00040768573,0.0006725737,0.9904819,0.00089251896,0.0040470315],"genre_scores_gemma":[0.008332937,0.00006565517,0.0044841836,0.00068008853,0.00014256408,0.0072747776,0.9693421,0.0010384719,0.00863918],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9883189,0.0042687287,0.0017338877,0.0019588235,0.0030568752,0.00066276244],"domain_scores_gemma":[0.9123522,0.025228186,0.0048364257,0.03454943,0.020567397,0.0024663312],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.017080562,0.0012977349,0.0013568302,0.0028710437,0.0022623902,0.002667369,0.0032573163,0.0020451078,0.12733711],"category_scores_gemma":[0.10789777,0.0010065588,0.0017024948,0.005904256,0.0012966007,0.0025636407,0.0024265342,0.0037166874,0.063360654],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00023839157,0.00007234891,0.0010976925,0.00020926347,0.000037710244,0.000017660268,0.0000622893,0.00011744495,0.000073828014,0.00093899254,0.99506146,0.0020728644],"study_design_scores_gemma":[0.0028373476,0.00013633173,0.01786962,0.00046366887,0.00014092991,0.00009294338,0.0004188244,0.00051050074,0.0009040889,0.0061229076,0.9703836,0.00011919948],"about_ca_topic_score_codex":0.019207578,"about_ca_topic_score_gemma":0.034833547,"teacher_disagreement_score":0.12733711,"about_ca_system_score_codex":0.0025870365,"about_ca_system_score_gemma":0.0072533945,"threshold_uncertainty_score":0.4259851},"labels":[],"label_agreement":null},{"id":"W4398613456","doi":"10.7910/dvn/gl5ccd/5igdeu","title":"iolinks_exec","year":2018,"lang":"en","type":"dataset","venue":"Harvard Dataverse","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Statistics Canada; Université du Québec à Montréal","funders":"","keywords":"Replication (statistics); Computer science; Database; Biology; Virology","score_opus":0.11876681155733702,"score_gpt":0.3832193626359284,"score_spread":0.26445255107859134,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4398613456","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0003228715,0.000037512895,0.0018866357,0.0001573334,0.00009045519,0.00009021715,0.9513124,0.039042104,0.0070605306],"genre_scores_gemma":[0.0017877731,0.00007594326,0.003466133,0.0002126494,0.000054305572,0.00045640802,0.97379273,0.0139429765,0.0062110364],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9987638,0.00019077768,0.00013962133,0.00042332825,0.00030090637,0.00018158896],"domain_scores_gemma":[0.9942965,0.0019828556,0.00034446135,0.0018393317,0.00094900484,0.00058797485],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.002622723,0.0027801595,0.001367925,0.005002282,0.0008892044,0.0031274192,0.0021159702,0.00087312266,0.33502972],"category_scores_gemma":[0.013518827,0.0013941574,0.0012825064,0.004742919,0.0007423444,0.0026621772,0.0029496779,0.0020294008,0.32970873],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00007550243,0.000022200806,0.0003949587,0.00016991483,0.000013873208,0.000009290966,0.000028901348,0.00012500877,0.00016089236,0.00066755293,0.99447423,0.0038576222],"study_design_scores_gemma":[0.00039273468,0.000033699693,0.0023564147,0.00017178658,0.000032309275,0.000037605372,0.00006294436,0.0013165784,0.0024968223,0.005771359,0.9872837,0.000043974105],"about_ca_topic_score_codex":0.009660805,"about_ca_topic_score_gemma":0.009921424,"teacher_disagreement_score":0.6649703,"about_ca_system_score_codex":0.0012771063,"about_ca_system_score_gemma":0.002739002,"threshold_uncertainty_score":0.9484994},"labels":[],"label_agreement":null},{"id":"W4398749752","doi":"10.7910/dvn/gl5ccd/p3ylfa","title":"main_iolinks.cpp","year":2018,"lang":"en","type":"dataset","venue":"Harvard Dataverse","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Statistics Canada; Université du Québec à Montréal","funders":"","keywords":"Replication (statistics); Computer science; Biology; Virology","score_opus":0.11743043908432159,"score_gpt":0.38104419894002906,"score_spread":0.26361375985570745,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4398749752","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00003679682,0.000023963017,0.00019474821,0.000055350632,0.000026949052,0.000034573648,0.9938651,0.0040704263,0.0016921519],"genre_scores_gemma":[0.00030592553,0.000051945153,0.0008873358,0.00014791588,0.000020150688,0.00042601256,0.9919966,0.004412341,0.0017517186],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99750036,0.0003875282,0.0003147354,0.0008627628,0.0004504508,0.00048417013],"domain_scores_gemma":[0.99248576,0.0024707417,0.00052966364,0.00224693,0.0013994074,0.00086743926],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0034513038,0.003856741,0.0029350412,0.006528692,0.0015088933,0.0058380784,0.005329862,0.0022381481,0.52560645],"category_scores_gemma":[0.016496366,0.0022873865,0.002620916,0.010294747,0.0011282585,0.004942085,0.0066448795,0.0030472917,0.64415777],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000046433932,0.000010851442,0.0002213083,0.0006262917,0.000016567124,0.000006380049,0.000031431147,0.00005633674,0.00009105779,0.00037446723,0.99661535,0.0019033881],"study_design_scores_gemma":[0.00020419975,0.00001411006,0.0012028383,0.00036108788,0.000022593034,0.00002016402,0.000052768628,0.00014673002,0.000619902,0.0024933435,0.99482214,0.0000400558],"about_ca_topic_score_codex":0.010445342,"about_ca_topic_score_gemma":0.015469333,"teacher_disagreement_score":0.47439355,"about_ca_system_score_codex":0.0020668113,"about_ca_system_score_gemma":0.00285728,"threshold_uncertainty_score":0.6766648},"labels":[],"label_agreement":null},{"id":"W4399419098","doi":"10.1177/14604582241259336","title":"Building ontology-based temporal databases for data reuse: An applied example on hospital organizational structures","year":2024,"lang":"en","type":"article","venue":"Health Informatics Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Sherbrooke","funders":"","keywords":"Computer science; Ontology; Interoperability; Database; Data modeling; Temporal database; Data quality; Information retrieval; Data warehouse; Relational database; Data model (GIS); Data science; Data mining; World Wide Web; Artificial intelligence","score_opus":0.3993119407378315,"score_gpt":0.5042411380466737,"score_spread":0.1049291973088422,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4399419098","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07726356,0.00041098654,0.90734285,0.0021512487,0.000053761196,0.0003733299,0.0006215884,0.00094878493,0.010833791],"genre_scores_gemma":[0.32025114,0.00070296694,0.67530453,0.00016009388,0.000021423348,0.00020377923,0.0010304024,0.00021735983,0.0021082654],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9942238,0.0028609661,0.0006257903,0.0005103449,0.001526288,0.00025284995],"domain_scores_gemma":[0.99045384,0.0045776255,0.0004650409,0.0028304283,0.0014594361,0.00021351302],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0075051985,0.00038765534,0.0004961799,0.0025172506,0.0017638534,0.0049032345,0.0017426892,0.0014704935,0.0018127961],"category_scores_gemma":[0.016753325,0.00039233433,0.0019907989,0.005299328,0.0015924188,0.0070008244,0.0033845662,0.001318229,0.00039782794],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002446007,0.0004967855,0.011347151,0.0006182726,0.00017633074,0.0021994098,0.012469152,0.10746645,0.008959315,0.56842446,0.0056799976,0.28191817],"study_design_scores_gemma":[0.00013368898,0.00020934296,0.00475002,0.0005228573,0.00024778658,0.001985835,0.009687527,0.55150145,0.01695988,0.22448967,0.18933275,0.00017913347],"about_ca_topic_score_codex":0.027606709,"about_ca_topic_score_gemma":0.017014809,"teacher_disagreement_score":0.027606709,"about_ca_system_score_codex":0.0032401062,"about_ca_system_score_gemma":0.0032736761,"threshold_uncertainty_score":0.054892004},"labels":[],"label_agreement":null},{"id":"W4399496685","doi":"10.2139/ssrn.4821693","title":"An Introduction to International Data Governance Design","year":2024,"lang":"en","type":"article","venue":"SSRN Electronic Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Centre for International Governance Innovation","funders":"","keywords":"Corporate governance; Business; Accounting; Political science; Computer science; Finance","score_opus":0.13604214927573285,"score_gpt":0.4327472587361949,"score_spread":0.296705109460462,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4399496685","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0020207786,0.007641685,0.7038502,0.03091819,0.0064472267,0.00035732763,0.00078178605,0.00082989945,0.2471529],"genre_scores_gemma":[0.14078304,0.021036483,0.63934,0.011656033,0.009962163,0.002218359,0.0017513535,0.0018667881,0.17138577],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9926723,0.0039083664,0.000832159,0.0007675441,0.0014044512,0.000415199],"domain_scores_gemma":[0.992326,0.0042704847,0.0003941322,0.0015647794,0.0010758823,0.00036863628],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008426788,0.0009976821,0.00091528846,0.0035183276,0.0034195695,0.0141167585,0.0016497626,0.0029865438,0.03265894],"category_scores_gemma":[0.015937518,0.0010904502,0.0018617228,0.006158978,0.0077564353,0.015379299,0.005546578,0.006583981,0.008265388],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000044813014,0.00000884104,0.00011228379,0.000048063433,0.0000039178,0.000022233622,0.00019120511,0.00039722357,0.00005485584,0.97093695,0.01177355,0.016446436],"study_design_scores_gemma":[0.000006341319,0.000019317544,0.00013331622,0.0002095841,0.000007594546,0.0000982715,0.00028057717,0.001607534,0.0001981173,0.6266028,0.37081692,0.000019530271],"about_ca_topic_score_codex":0.0031086893,"about_ca_topic_score_gemma":0.0025927792,"teacher_disagreement_score":0.03265894,"about_ca_system_score_codex":0.0044156816,"about_ca_system_score_gemma":0.0036236783,"threshold_uncertainty_score":0.109255016},"labels":[],"label_agreement":null},{"id":"W4399828472","doi":"10.32920/26060791","title":"Data Governance. Enablers, Inhibitors, Practices, and Outcomes","year":2024,"lang":"en","type":"preprint","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Corporate governance; Business; Data governance; Process management; Knowledge management; Computer science; Finance; Data quality; Marketing","score_opus":0.39699396160423256,"score_gpt":0.4907735664996202,"score_spread":0.09377960489538761,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4399828472","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5347298,0.006272693,0.083271794,0.028392883,0.00030624575,0.0018323804,0.0022686902,0.0005895451,0.34233594],"genre_scores_gemma":[0.98721516,0.0009636755,0.007859295,0.00045439438,0.00004355811,0.00042353527,0.00027729062,0.000035896788,0.0027271688],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"qualitative","domain_scores_codex":[0.97628796,0.013029187,0.0017200552,0.0019821583,0.005250304,0.001730424],"domain_scores_gemma":[0.92663836,0.036465608,0.019844433,0.006461868,0.006136635,0.0044531645],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.025125422,0.0006166088,0.0004238971,0.0040364056,0.0023164582,0.008918761,0.0006773598,0.0010038276,0.004648769],"category_scores_gemma":[0.064851515,0.0003564532,0.00052229105,0.0059145475,0.008048168,0.008242138,0.0063392366,0.0012843002,0.0007111236],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015075863,0.0004430367,0.21950264,0.0011214073,0.00012389908,0.00027954977,0.012694646,0.002424382,0.0011456704,0.5780722,0.005967839,0.178074],"study_design_scores_gemma":[0.00014590945,0.0006950669,0.18595462,0.003718609,0.00029932195,0.00064304826,0.052270327,0.008458315,0.006343004,0.5522889,0.18902625,0.00015668348],"about_ca_topic_score_codex":0.0036296009,"about_ca_topic_score_gemma":0.0027399203,"teacher_disagreement_score":0.025125422,"about_ca_system_score_codex":0.0043136375,"about_ca_system_score_gemma":0.008632132,"threshold_uncertainty_score":0.13287753},"labels":[],"label_agreement":null},{"id":"W4399828482","doi":"10.32920/26060791.v1","title":"Data Governance. Enablers, Inhibitors, Practices, and Outcomes","year":2024,"lang":"en","type":"preprint","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Corporate governance; Business; Data governance; Knowledge management; Process management; Computer science; Finance; Marketing; Data quality","score_opus":0.39699396160423256,"score_gpt":0.4907735664996202,"score_spread":0.09377960489538761,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4399828482","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5347298,0.006272693,0.083271794,0.028392883,0.00030624575,0.0018323804,0.0022686902,0.0005895451,0.34233594],"genre_scores_gemma":[0.98721516,0.0009636755,0.007859295,0.00045439438,0.00004355811,0.00042353527,0.00027729062,0.000035896788,0.0027271688],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"qualitative","domain_scores_codex":[0.97628796,0.013029187,0.0017200552,0.0019821583,0.005250304,0.001730424],"domain_scores_gemma":[0.92663836,0.036465608,0.019844433,0.006461868,0.006136635,0.0044531645],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.025125422,0.0006166088,0.0004238971,0.0040364056,0.0023164582,0.008918761,0.0006773598,0.0010038276,0.004648769],"category_scores_gemma":[0.064851515,0.0003564532,0.00052229105,0.0059145475,0.008048168,0.008242138,0.0063392366,0.0012843002,0.0007111236],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015075863,0.0004430367,0.21950264,0.0011214073,0.00012389908,0.00027954977,0.012694646,0.002424382,0.0011456704,0.5780722,0.005967839,0.178074],"study_design_scores_gemma":[0.00014590945,0.0006950669,0.18595462,0.003718609,0.00029932195,0.00064304826,0.052270327,0.008458315,0.006343004,0.5522889,0.18902625,0.00015668348],"about_ca_topic_score_codex":0.0036296009,"about_ca_topic_score_gemma":0.0027399203,"teacher_disagreement_score":0.025125422,"about_ca_system_score_codex":0.0043136375,"about_ca_system_score_gemma":0.008632132,"threshold_uncertainty_score":0.13287753},"labels":[],"label_agreement":null},{"id":"W4400015021","doi":"10.14236/ewic/eva2024.44","title":"Your Data Body","year":2024,"lang":"en","type":"article","venue":"Electronic workshops in computing","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science","score_opus":0.22665943554396764,"score_gpt":0.4733566933482829,"score_spread":0.24669725780431526,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4400015021","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.001478082,0.001162544,0.06399629,0.032528028,0.00781871,0.0010100737,0.02828187,0.020584144,0.84314024],"genre_scores_gemma":[0.019415969,0.0023808186,0.027929777,0.017625377,0.0035072248,0.0012528027,0.03811767,0.019995194,0.8697751],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99153566,0.0025202038,0.00096533215,0.0011186552,0.003230257,0.0006297791],"domain_scores_gemma":[0.9633959,0.009175077,0.0013402937,0.013321698,0.010360118,0.002406919],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.007639556,0.0010428284,0.0009909463,0.0032993946,0.0036611874,0.014615683,0.003081346,0.0052362457,0.48332417],"category_scores_gemma":[0.055877097,0.0011162221,0.0010113708,0.0038946802,0.0024373957,0.019340899,0.014912366,0.003732178,0.46244785],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006612746,0.000025601856,0.0003414437,0.00020969078,0.000006530518,0.00012738188,0.0009719866,0.00007778556,0.0005696666,0.04406439,0.880025,0.07351429],"study_design_scores_gemma":[0.0000031381908,0.0000033440992,0.000057823992,0.000057166784,0.0000011589478,0.000074322495,0.00012768224,0.000033676173,0.0001537471,0.0019375171,0.997544,0.000006364192],"about_ca_topic_score_codex":0.0029561652,"about_ca_topic_score_gemma":0.0016709898,"teacher_disagreement_score":0.48332417,"about_ca_system_score_codex":0.00197571,"about_ca_system_score_gemma":0.0035511944,"threshold_uncertainty_score":0.7369753},"labels":[],"label_agreement":null},{"id":"W4400242142","doi":"10.1145/3643991.3644924","title":"The Impact of Code Ownership of DevOps Artefacts on the Outcome of DevOps CI Builds","year":2024,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"DevOps; Computer science; Outcome (game theory); Code (set theory); Software engineering; Computer security; Programming language; Software deployment","score_opus":0.38824144749168743,"score_gpt":0.5046893514482588,"score_spread":0.11644790395657134,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4400242142","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.941044,0.00032040817,0.0183897,0.001079734,0.00007284747,0.00011961365,0.00024349021,0.00022683038,0.038503498],"genre_scores_gemma":[0.99617213,0.00006861375,0.002195058,0.000042382755,0.000010788782,0.000034077915,0.0000978451,0.00010166162,0.001277451],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.97451425,0.0112334,0.0014150316,0.0014771343,0.008923961,0.0024362653],"domain_scores_gemma":[0.7546426,0.15015298,0.030868324,0.031159395,0.02735049,0.0058262222],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.022133643,0.0004861896,0.0002965918,0.0017659764,0.0014995278,0.007092888,0.000972549,0.00074586546,0.005263556],"category_scores_gemma":[0.17057194,0.00035480043,0.00034524265,0.0013736652,0.0039326306,0.0044525503,0.0044854265,0.0016314912,0.00078478444],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002224172,0.00069312745,0.47323057,0.00081386237,0.00041930395,0.002307692,0.028764647,0.0530425,0.024103679,0.07059795,0.0052300603,0.33857244],"study_design_scores_gemma":[0.00020121054,0.0022939455,0.7431435,0.0013201027,0.00045089851,0.0015397812,0.034382846,0.07814562,0.03448414,0.06424709,0.039458714,0.00033216208],"about_ca_topic_score_codex":0.0060586273,"about_ca_topic_score_gemma":0.007953428,"teacher_disagreement_score":0.022133643,"about_ca_system_score_codex":0.0026258493,"about_ca_system_score_gemma":0.0029666866,"threshold_uncertainty_score":0.1170553},"labels":[],"label_agreement":null},{"id":"W4400321996","doi":"10.22215/rcin/m.24c1","title":"CICP Data Literacy 1.0 - Module 1: Data in the Nonprofit Sector","year":2024,"lang":"en","type":"report","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"Carleton University","keywords":"Nonprofit sector; Business; Computer science; Literacy; Data science; Public relations; Psychology; Political science; Pedagogy","score_opus":0.6647299006353016,"score_gpt":0.5554889791904332,"score_spread":0.10924092144486841,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4400321996","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08290575,0.0005811017,0.013126413,0.051368736,0.0019361967,0.017043553,0.022960516,0.0039833854,0.80609435],"genre_scores_gemma":[0.117949635,0.0011149183,0.040161647,0.014709476,0.00051273423,0.0087903105,0.021418937,0.000806982,0.7945354],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9969631,0.0005825938,0.00008185103,0.00019590805,0.0013461014,0.0008304741],"domain_scores_gemma":[0.9855779,0.0014362523,0.0005594151,0.00050729123,0.0053048604,0.006614269],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005375818,0.00046490273,0.00036804858,0.0011611604,0.0030449892,0.0034340154,0.0016558085,0.0015476266,0.07140775],"category_scores_gemma":[0.010026994,0.00046747306,0.0002810243,0.0010870856,0.0010276766,0.0011276272,0.0038500912,0.0018110935,0.026058676],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006605654,0.00089947274,0.0059116757,0.00026122757,0.000003937777,0.000069803296,0.001814506,0.0003731302,0.0011841119,0.003777043,0.8784217,0.107217275],"study_design_scores_gemma":[0.00003551344,0.00019230103,0.022223813,0.0002627862,0.0000026940927,0.00007389724,0.0017357838,0.0003690555,0.0016042212,0.0020483646,0.97142684,0.000024728337],"about_ca_topic_score_codex":0.0797232,"about_ca_topic_score_gemma":0.25441673,"teacher_disagreement_score":0.0797232,"about_ca_system_score_codex":0.010299805,"about_ca_system_score_gemma":0.05204258,"threshold_uncertainty_score":0.23888272},"labels":[],"label_agreement":null},{"id":"W4400685466","doi":"10.1145/3676961","title":"SimClone: Detecting Tabular Data Clones Using Value Similarity","year":2024,"lang":"en","type":"article","venue":"ACM Transactions on Software Engineering and Methodology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University; Huawei Technologies (Canada); University of Manitoba","funders":"","keywords":"Computer science; Data mining; Header; Software; Visualization; clone (Java method); Similarity (geometry); Margin (machine learning); Artificial intelligence; Image (mathematics); Machine learning","score_opus":0.549696504884526,"score_gpt":0.4849508565192975,"score_spread":0.06474564836522856,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4400685466","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.3299357,0.003010132,0.5207184,0.0008367124,0.00040275865,0.00090408133,0.022390163,0.11718436,0.004617651],"genre_scores_gemma":[0.51656324,0.0004744499,0.4413514,0.00047263128,0.00012564083,0.0006241468,0.03522575,0.0025737733,0.0025889562],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9939301,0.0009319231,0.0008229218,0.0016868454,0.0023824333,0.0002458499],"domain_scores_gemma":[0.9758462,0.009042843,0.004354957,0.0050080908,0.0052155126,0.0005323804],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0043531405,0.0017555577,0.0015723298,0.008597459,0.0011067379,0.0029619262,0.0023047633,0.0018765712,0.00181507],"category_scores_gemma":[0.030685188,0.0005044657,0.001615589,0.0069058393,0.00072235777,0.004066015,0.0024766217,0.0012936408,0.0022421074],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012138094,0.0007249763,0.22193466,0.001390245,0.000863576,0.0011566597,0.001816645,0.017426169,0.048588645,0.005800591,0.061494347,0.6375897],"study_design_scores_gemma":[0.00017664158,0.00078537746,0.05326982,0.00023602882,0.00025288435,0.002438635,0.0010891164,0.77217156,0.114143975,0.015497264,0.039686743,0.00025190492],"about_ca_topic_score_codex":0.0029698575,"about_ca_topic_score_gemma":0.004724973,"teacher_disagreement_score":0.008597459,"about_ca_system_score_codex":0.00083599874,"about_ca_system_score_gemma":0.00158952,"threshold_uncertainty_score":0.023021877},"labels":[],"label_agreement":null},{"id":"W4400875444","doi":"10.3390/computers13070183","title":"Data Lakes: A Survey of Concepts and Architectures","year":2024,"lang":"en","type":"article","venue":"Computers","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":25,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"Ministry of Higher Education and Scientific Research","keywords":"Data science; Survey data collection; Computer science; Geography; Mathematics; Statistics","score_opus":0.3904131326033246,"score_gpt":0.48886319191730615,"score_spread":0.09845005931398154,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4400875444","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012464859,0.6303055,0.29286066,0.014997096,0.0010101177,0.00032207576,0.002426732,0.0017805704,0.04383236],"genre_scores_gemma":[0.06411577,0.6800381,0.24096264,0.003198333,0.0008768348,0.00052932225,0.0036331022,0.0006120085,0.006033948],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9939016,0.001690231,0.0012201861,0.00078178156,0.002103926,0.00030234456],"domain_scores_gemma":[0.9888853,0.007456791,0.0008521093,0.0007449786,0.0017721214,0.00028870793],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0077647925,0.0012512011,0.0011109927,0.016178831,0.0015616697,0.0077924905,0.0027154866,0.0018085059,0.004548352],"category_scores_gemma":[0.012829617,0.0014060624,0.0013701532,0.028540634,0.003751261,0.024213,0.0043794643,0.0030267239,0.0013977329],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00008607782,0.000060323284,0.0028289822,0.010019221,0.00010760578,0.0002739373,0.0035340132,0.00402706,0.0016195677,0.48200816,0.029798055,0.46563697],"study_design_scores_gemma":[0.00001029441,0.000051265757,0.001372855,0.005628515,0.0000602614,0.00086000713,0.0020875495,0.0029087092,0.0010252277,0.101517126,0.8844087,0.00006949864],"about_ca_topic_score_codex":0.005504338,"about_ca_topic_score_gemma":0.004119903,"teacher_disagreement_score":0.016178831,"about_ca_system_score_codex":0.00415775,"about_ca_system_score_gemma":0.005514023,"threshold_uncertainty_score":0.04106462},"labels":[],"label_agreement":null},{"id":"W4400884871","doi":"10.2196/54590","title":"Data Lake, Data Warehouse, Datamart, and Feature Store: Their Contributions to the Complete Data Reuse Pipeline","year":2024,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Data warehouse; Metadata; Identifier; Data science; Pipeline (software); Software; USable; Database; Reuse; Data transformation; Feature (linguistics); Adaptation (eye); World Wide Web","score_opus":0.27843646919616866,"score_gpt":0.4669328239810727,"score_spread":0.18849635478490406,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4400884871","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009451209,0.008959663,0.8969205,0.03590042,0.0007743526,0.0011874426,0.0043168217,0.030579753,0.011909787],"genre_scores_gemma":[0.027287072,0.0050619063,0.9491917,0.0027945624,0.00045015835,0.0005145163,0.007255026,0.0041710394,0.0032739816],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.97050405,0.008632648,0.0040387367,0.0027022187,0.0130964,0.0010259928],"domain_scores_gemma":[0.8568682,0.054653503,0.008835169,0.042671777,0.030539311,0.0064320443],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.07587135,0.0022884498,0.0023050979,0.014335596,0.002342254,0.019248184,0.0066977283,0.0028059806,0.007855919],"category_scores_gemma":[0.12566456,0.0032986167,0.0034338036,0.018144663,0.004696522,0.044433497,0.025113054,0.010962705,0.0058743875],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00063034805,0.0003693541,0.018407807,0.00215155,0.00043601185,0.0003711188,0.0042995554,0.0029092527,0.0028326302,0.097459145,0.08916258,0.7809707],"study_design_scores_gemma":[0.00021124695,0.0004208751,0.010169338,0.004204031,0.00043917462,0.0013267042,0.0035874757,0.052046243,0.012181799,0.23143171,0.6833436,0.0006378184],"about_ca_topic_score_codex":0.009252587,"about_ca_topic_score_gemma":0.008356311,"teacher_disagreement_score":0.92412865,"about_ca_system_score_codex":0.003620519,"about_ca_system_score_gemma":0.015657658,"threshold_uncertainty_score":0.40125084},"labels":[],"label_agreement":null},{"id":"W4400910536","doi":"10.1109/icde60146.2024.00268","title":"Fairness-Aware Data Preparation for Entity Matching","year":2024,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; Matching (statistics); Mathematics; Statistics","score_opus":0.47250982684582465,"score_gpt":0.5520579657671183,"score_spread":0.07954813892129364,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4400910536","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010617614,0.00027892197,0.9850529,0.0005894735,0.00008977136,0.00027945396,0.00052852486,0.0014929675,0.0010703241],"genre_scores_gemma":[0.21235536,0.00023716726,0.7820187,0.0004028799,0.0001284015,0.00035848125,0.0025460292,0.0002840137,0.00166891],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.985013,0.006090003,0.0013141949,0.0035332593,0.0032411476,0.00080844446],"domain_scores_gemma":[0.9629346,0.013517449,0.00279065,0.016745495,0.0028985655,0.0011131727],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02178624,0.0009808607,0.0018769518,0.0030081917,0.003050463,0.004392891,0.0045477045,0.0023557206,0.0036065236],"category_scores_gemma":[0.06288999,0.00077766343,0.0017104335,0.0046265307,0.0016458147,0.009574092,0.008781712,0.0032174522,0.0023595395],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0016121443,0.00074925064,0.023311337,0.00060305896,0.00034667275,0.0005772528,0.0015053881,0.10972939,0.02827488,0.16841283,0.024727939,0.64014983],"study_design_scores_gemma":[0.00020127413,0.00032233665,0.004532018,0.00013179425,0.000120329736,0.0009291257,0.0009885815,0.58819526,0.046458527,0.31566918,0.042305466,0.0001460763],"about_ca_topic_score_codex":0.0015501952,"about_ca_topic_score_gemma":0.0021987255,"teacher_disagreement_score":0.02178624,"about_ca_system_score_codex":0.0015176154,"about_ca_system_score_gemma":0.005348527,"threshold_uncertainty_score":0.11521804},"labels":[],"label_agreement":null},{"id":"W4400992667","doi":"10.69554/rpfg8859","title":"Engineering risk-based anonymisation solutions for complex data environments","year":2020,"lang":"en","type":"article","venue":"Journal of data protection & privacy.","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Privacy Analytics (Canada)","funders":"","keywords":"Computer science; Data science; Data mining; Risk analysis (engineering); Medicine","score_opus":0.677103680939665,"score_gpt":0.43018124554949594,"score_spread":0.24692243539016906,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4400992667","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005235545,0.0004965206,0.98310673,0.0029266176,0.0001349179,0.00027360365,0.000062074636,0.00022141974,0.0075424355],"genre_scores_gemma":[0.21311523,0.0017852242,0.776061,0.0008893527,0.00022251539,0.00056086754,0.00029113595,0.0001857525,0.0068889568],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9775174,0.011959431,0.001704665,0.0016352873,0.0060533048,0.001129791],"domain_scores_gemma":[0.9690718,0.015307467,0.0033470362,0.008079522,0.003560914,0.00063333847],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.018092012,0.0008750883,0.0006564757,0.0017290661,0.002679102,0.007022577,0.0029876388,0.0035784729,0.0024990742],"category_scores_gemma":[0.043561026,0.0008154557,0.0015540599,0.0013987288,0.004510313,0.010542418,0.012499643,0.0044073863,0.001039277],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006922932,0.000080893435,0.0019427501,0.00045751562,0.000103133076,0.00075561466,0.00346087,0.08589518,0.0031237327,0.79041564,0.0054127565,0.1082827],"study_design_scores_gemma":[0.000022590699,0.00007894033,0.000443408,0.0005242894,0.00006409399,0.001282824,0.0021179924,0.17126675,0.0071348785,0.72436416,0.09262413,0.000075921096],"about_ca_topic_score_codex":0.0010337604,"about_ca_topic_score_gemma":0.0011703449,"teacher_disagreement_score":0.018092012,"about_ca_system_score_codex":0.0021216634,"about_ca_system_score_gemma":0.004155454,"threshold_uncertainty_score":0.09568083},"labels":[],"label_agreement":null},{"id":"W4401043414","doi":"10.18653/v1/2024.naacl-short.11","title":"Unified Examination of Entity Linking in Absence of Candidate Sets","year":2024,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science","score_opus":0.13637319101570985,"score_gpt":0.41448734796991704,"score_spread":0.27811415695420716,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4401043414","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.38554662,0.014703878,0.5247452,0.009280915,0.00074203534,0.0004353749,0.010200676,0.004284859,0.050060395],"genre_scores_gemma":[0.8950648,0.0015566237,0.091433644,0.00030969342,0.00030594761,0.000156579,0.0071270247,0.0005322523,0.0035134938],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9736796,0.014016907,0.001984688,0.0036352389,0.0055473554,0.0011361097],"domain_scores_gemma":[0.7611201,0.19651505,0.007952812,0.019355185,0.012454096,0.0026027395],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.028326524,0.0010376464,0.0024243663,0.020192558,0.0035685468,0.012151605,0.0038608687,0.003635653,0.009618928],"category_scores_gemma":[0.19966704,0.0012225943,0.0016017808,0.016628034,0.0033952019,0.019174177,0.010445465,0.0040627588,0.0021785176],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0049704625,0.0006582542,0.16499634,0.0022299818,0.0018342877,0.0077423854,0.0042671394,0.048577163,0.007467585,0.3525779,0.040929,0.36374953],"study_design_scores_gemma":[0.00014785942,0.00031779948,0.028950328,0.00054968195,0.0009791374,0.0047728424,0.0032688014,0.53281105,0.010328771,0.3814469,0.036195263,0.00023164104],"about_ca_topic_score_codex":0.004788611,"about_ca_topic_score_gemma":0.0063918387,"teacher_disagreement_score":0.028326524,"about_ca_system_score_codex":0.0014369048,"about_ca_system_score_gemma":0.0027160044,"threshold_uncertainty_score":0.1498068},"labels":[],"label_agreement":null},{"id":"W4401108396","doi":"10.1007/978-3-031-66431-1_33","title":"DataAssist: A Machine Learning Approach to Data Cleaning and Preparation","year":2024,"lang":"en","type":"book-chapter","venue":"Lecture notes in networks and systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":19,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Artificial intelligence","score_opus":0.1569908050652264,"score_gpt":0.3670280918147778,"score_spread":0.2100372867495514,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4401108396","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0003072309,0.00020100959,0.9792738,0.0002299276,0.0001174725,0.00011675634,0.0010484126,0.017246537,0.001458911],"genre_scores_gemma":[0.0035292546,0.00037249402,0.9841622,0.0002478533,0.000090495596,0.00021882282,0.002852758,0.0028815253,0.005644514],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99696785,0.0006470388,0.0002809574,0.00060156937,0.0013725455,0.00012998682],"domain_scores_gemma":[0.99501836,0.0024900162,0.00017591602,0.0013087521,0.00085174106,0.00015514427],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0049050404,0.002054731,0.0017432087,0.004225355,0.0014240517,0.0049399,0.0050915508,0.0016890969,0.02386197],"category_scores_gemma":[0.010168982,0.0019005717,0.0022889574,0.0046252133,0.0011286013,0.0038796563,0.0048418357,0.004126305,0.020756485],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001382015,0.00013710704,0.00067824934,0.00056142255,0.00015710153,0.0001670719,0.00030785927,0.007922652,0.006863553,0.02282161,0.12159152,0.8386536],"study_design_scores_gemma":[0.000092083195,0.00012522729,0.0016675179,0.00031807707,0.0001683381,0.0010031974,0.00024159817,0.27081016,0.0565712,0.15825684,0.5105139,0.00023183959],"about_ca_topic_score_codex":0.002277245,"about_ca_topic_score_gemma":0.003984164,"teacher_disagreement_score":0.02386197,"about_ca_system_score_codex":0.00061367016,"about_ca_system_score_gemma":0.002257696,"threshold_uncertainty_score":0.079826236},"labels":[],"label_agreement":null},{"id":"W4401334154","doi":"10.33965/celda2023_202306l014","title":"THREE FRAMEWORKS FOR DATA LITERACY","year":2023,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"National Research Council Canada","funders":"","keywords":"Computer science; Literacy; Data science; Psychology; Pedagogy","score_opus":0.5491912103233049,"score_gpt":0.5529128637733244,"score_spread":0.003721653450019513,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4401334154","genre_codex":"other","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01291571,0.00609201,0.3468542,0.14676717,0.0010464444,0.0009078194,0.0007640466,0.0006606152,0.48399198],"genre_scores_gemma":[0.51803815,0.007439507,0.3994425,0.029621886,0.0017394219,0.0051181233,0.0013612784,0.00048135765,0.036757722],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9544521,0.026179083,0.0033556393,0.0038846678,0.0087571945,0.0033714324],"domain_scores_gemma":[0.88673353,0.077886745,0.005754148,0.01060341,0.013999906,0.005022257],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.046028245,0.0016270175,0.0012670193,0.012090011,0.007710146,0.023995778,0.0044886405,0.007696735,0.011936621],"category_scores_gemma":[0.11296987,0.0011834933,0.0022032808,0.010507998,0.05462436,0.034668826,0.020711353,0.010735011,0.0027223637],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000065430136,0.00001389542,0.00047083898,0.000046687535,0.0000036361066,0.00003267024,0.0018754607,0.00007552622,0.000018744986,0.99113244,0.0017735197,0.004549928],"study_design_scores_gemma":[0.0000238788,0.000020765323,0.00060778647,0.0004953291,0.0000105107465,0.0001695517,0.0031198245,0.0007069063,0.00013157172,0.94649166,0.04819089,0.000031230586],"about_ca_topic_score_codex":0.010303802,"about_ca_topic_score_gemma":0.0057595996,"teacher_disagreement_score":0.046028245,"about_ca_system_score_codex":0.010945987,"about_ca_system_score_gemma":0.016467875,"threshold_uncertainty_score":0.24342352},"labels":[],"label_agreement":null},{"id":"W4401544215","doi":"10.1145/3643991.3644931","title":"On the Executability of R Markdown Files","year":2024,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba; University of Windsor; Lakehead University","funders":"","keywords":"Computer science; Parallel computing","score_opus":0.21765323021123933,"score_gpt":0.4362016895950086,"score_spread":0.21854845938376927,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4401544215","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9656633,0.0010806506,0.017397659,0.00079247484,0.000059203896,0.0003021987,0.005767756,0.005041564,0.0038953207],"genre_scores_gemma":[0.92712873,0.0008000054,0.04567342,0.0003595166,0.00010287836,0.00031591422,0.020749453,0.0018359816,0.003034094],"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9829784,0.0040555703,0.0025024563,0.0027615791,0.006895065,0.00080682844],"domain_scores_gemma":[0.6629299,0.25412244,0.037756555,0.020376276,0.02264768,0.0021672111],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.01856129,0.0006704192,0.00054560235,0.008774911,0.0014827515,0.0033506702,0.0011156019,0.0011208091,0.0012066219],"category_scores_gemma":[0.14940637,0.00054115936,0.000848455,0.004084181,0.0015347587,0.0038531553,0.0015576637,0.0018281675,0.0012637983],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0016714945,0.0006111469,0.69698304,0.0013013056,0.00023072527,0.0027367878,0.011778667,0.008089802,0.023459742,0.0029295087,0.015450949,0.23475692],"study_design_scores_gemma":[0.00013467662,0.0013076786,0.73377055,0.001153925,0.00032595103,0.0070509776,0.0073775244,0.104061104,0.08102054,0.007087477,0.056269445,0.00044018714],"about_ca_topic_score_codex":0.0063848286,"about_ca_topic_score_gemma":0.007970693,"teacher_disagreement_score":0.9988844,"about_ca_system_score_codex":0.0011997033,"about_ca_system_score_gemma":0.0018092737,"threshold_uncertainty_score":0.09816265},"labels":[],"label_agreement":null},{"id":"W4401666276","doi":"10.1007/s10618-024-01054-7","title":"Bayesian network Motifs for reasoning over heterogeneous unlinked datasets","year":2024,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Canada Research Chairs; University of Toronto; University of New Brunswick","funders":"","keywords":"Computer science; Probabilistic logic; Bayesian network; Python (programming language); Data mining; Aggregate (composite); Real world data; Bayesian probability; Machine learning; Set (abstract data type); Artificial intelligence; Data science","score_opus":0.1674946705782729,"score_gpt":0.43586677779388994,"score_spread":0.26837210721561705,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4401666276","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012657426,0.00058271654,0.98256564,0.00077794696,0.000046457833,0.00013195197,0.0010381691,0.001276814,0.0009229041],"genre_scores_gemma":[0.270836,0.000897358,0.7210087,0.00040826417,0.00014314237,0.00044691467,0.003841622,0.0002950105,0.0021228385],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9952177,0.0016256484,0.00042655075,0.0010371234,0.0014628819,0.00023009206],"domain_scores_gemma":[0.96053725,0.03230933,0.0023915828,0.0023926334,0.001678909,0.0006903972],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0063038836,0.0009469164,0.0017246775,0.005379261,0.0013706028,0.0033775177,0.003754775,0.0031063743,0.005181895],"category_scores_gemma":[0.06944677,0.0012022932,0.0022096806,0.004837027,0.0015093818,0.010090972,0.0034635505,0.003721661,0.00094795635],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00063420215,0.00046322483,0.010364865,0.0010277127,0.0007022623,0.0010060051,0.0008345693,0.3029706,0.0032867668,0.3915555,0.00920718,0.27794722],"study_design_scores_gemma":[0.000036020225,0.000024290035,0.0003302174,0.00007642182,0.00007483584,0.00012933595,0.000062953106,0.60058373,0.000652386,0.3958277,0.002185132,0.000017020073],"about_ca_topic_score_codex":0.009635517,"about_ca_topic_score_gemma":0.014506013,"teacher_disagreement_score":0.009635517,"about_ca_system_score_codex":0.0021188527,"about_ca_system_score_gemma":0.0023747177,"threshold_uncertainty_score":0.033338487},"labels":[],"label_agreement":null},{"id":"W4402078687","doi":"10.47674/9781529238327","title":"Dialogues in Data Power","year":2024,"lang":"en","type":"book","venue":"Bristol University Press eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Social Sciences and Humanities Research Council of Canada; Universiteit van Tilburg; Karlstads universitet","keywords":"Power (physics); Computer science; Physics","score_opus":0.3263759557675474,"score_gpt":0.357813835672532,"score_spread":0.03143787990498459,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402078687","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0010795468,0.021830985,0.018416045,0.042459425,0.001954145,0.00006716333,0.00033587814,0.00024809694,0.91360873],"genre_scores_gemma":[0.08707099,0.02299678,0.015484592,0.016469704,0.002175073,0.0004280412,0.0008173522,0.0012648791,0.8532925],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9875564,0.007067634,0.0004290786,0.0008498179,0.0036737877,0.0004232685],"domain_scores_gemma":[0.9876374,0.009904642,0.00018749801,0.0010576432,0.00091111875,0.00030160023],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011219904,0.00069316535,0.00085913844,0.0018811487,0.0040957355,0.019646157,0.0014874253,0.0031560578,0.0380477],"category_scores_gemma":[0.0219181,0.0006205465,0.0004357097,0.00446457,0.017574215,0.022071969,0.009027968,0.005351595,0.011441076],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000103599405,0.000006559231,0.000040541745,0.00011805395,0.000004083667,0.00005268563,0.0056333714,0.000117413845,0.000060005448,0.8487707,0.11112397,0.034062136],"study_design_scores_gemma":[0.0000031831612,0.0000028830536,0.000051784595,0.00017120718,0.0000014510099,0.000055073284,0.0016963516,0.0000991201,0.000049767146,0.13901769,0.858847,0.000004514233],"about_ca_topic_score_codex":0.0038340222,"about_ca_topic_score_gemma":0.0046987603,"teacher_disagreement_score":0.0380477,"about_ca_system_score_codex":0.0068136468,"about_ca_system_score_gemma":0.004603245,"threshold_uncertainty_score":0.12728226},"labels":[],"label_agreement":null},{"id":"W4402112538","doi":"10.1007/978-3-031-70626-4_9","title":"GXJoin: Generalized Cell Transformations for Explainable Joinability","year":2024,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science","score_opus":0.0933103195086047,"score_gpt":0.35450553264650664,"score_spread":0.26119521313790195,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402112538","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0034841544,0.000077778655,0.9853999,0.00015208642,0.000078376426,0.000057558602,0.0003223043,0.004677137,0.005750585],"genre_scores_gemma":[0.20092414,0.00051923364,0.7555401,0.0004374857,0.00019928582,0.0005524552,0.0037608854,0.007182361,0.03088419],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9989214,0.00020430647,0.00007221095,0.00025013016,0.00043357053,0.00011842645],"domain_scores_gemma":[0.998689,0.0006366401,0.000047773334,0.00044256257,0.00013550119,0.000048562877],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009900338,0.0008652634,0.00055660243,0.00078088115,0.0006772798,0.0017162054,0.001824039,0.0009508922,0.022419589],"category_scores_gemma":[0.0033267874,0.00048282972,0.0016721953,0.0010222854,0.0015294745,0.0038865914,0.0035330816,0.0034962443,0.0054300763],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001714822,0.00007659247,0.00033036948,0.00029631445,0.000043656477,0.00021833235,0.0007034646,0.012884664,0.012088626,0.7448547,0.01777913,0.21055262],"study_design_scores_gemma":[0.000051861556,0.000046006993,0.0001907328,0.000060133614,0.00004355535,0.00014928501,0.00011674639,0.07178327,0.013920575,0.8295584,0.08404289,0.00003653913],"about_ca_topic_score_codex":0.0011940632,"about_ca_topic_score_gemma":0.0013233193,"teacher_disagreement_score":0.022419589,"about_ca_system_score_codex":0.0006764157,"about_ca_system_score_gemma":0.0006187724,"threshold_uncertainty_score":0.07500106},"labels":[],"label_agreement":null},{"id":"W4402118981","doi":"10.1007/978-3-031-68034-2_4","title":"Data and Information Security","year":2024,"lang":"en","type":"book-chapter","venue":"Progress in IS","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary; York University; University of Toronto","funders":"","keywords":"Information security; Computer science; Computer security","score_opus":0.19680858132879125,"score_gpt":0.43660748731482996,"score_spread":0.2397989059860387,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402118981","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00032492098,0.02846026,0.005021302,0.005754256,0.0016943809,0.000029546607,0.00013586905,0.00010523725,0.95847416],"genre_scores_gemma":[0.008349236,0.019534936,0.002347261,0.002398856,0.0009815509,0.000053129686,0.00017209965,0.0001395465,0.9660235],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.999328,0.0001931608,0.00002215008,0.0000752279,0.00033244342,0.00004899984],"domain_scores_gemma":[0.99938977,0.00030396334,0.000026610956,0.00011075197,0.00012872838,0.000040152463],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00080016255,0.0008712274,0.00056363316,0.002062339,0.001612239,0.006641317,0.0007057932,0.0016647427,0.050526157],"category_scores_gemma":[0.0018544835,0.00036577808,0.00022514077,0.00289945,0.0034810614,0.0068255966,0.0018285739,0.0035499595,0.024461815],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000045428715,0.000013121325,0.000031149073,0.0000869941,0.0000024449037,0.000018019467,0.00038311185,0.00013514898,0.00011428475,0.64962435,0.28419012,0.06539677],"study_design_scores_gemma":[9.904694e-7,0.0000033691458,0.000047468526,0.00009843665,0.0000011503078,0.00002891461,0.00010875845,0.00010691302,0.000050359104,0.09308554,0.9064658,0.0000022911904],"about_ca_topic_score_codex":0.0041722488,"about_ca_topic_score_gemma":0.0067791706,"teacher_disagreement_score":0.050526157,"about_ca_system_score_codex":0.0028914749,"about_ca_system_score_gemma":0.0019628156,"threshold_uncertainty_score":0.16902685},"labels":[],"label_agreement":null},{"id":"W4402390590","doi":"10.23889/ijpds.v9i5.2514","title":"Improving Cardiac Insights: Harnessing Privacy-Preserving Record Linkage (PPRL) to Obtain, Link, and Enhance Data for a Healthier Australia","year":2024,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Victoria Park","funders":"","keywords":"Record linkage; Link (geometry); Linkage (software); Computer science; Data mining; Computer network; Medicine; Environmental health; Genetics; Biology; Gene","score_opus":0.35526995340542455,"score_gpt":0.5394998433459082,"score_spread":0.18422988994048362,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402390590","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09862402,0.0046321684,0.83846396,0.031642463,0.0005411026,0.0021091173,0.0021524262,0.0057748966,0.016059997],"genre_scores_gemma":[0.29073724,0.0024526177,0.6964091,0.0035215619,0.0003024275,0.00074531836,0.0019525583,0.0003496423,0.0035294665],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9357501,0.04369623,0.0033280454,0.0043157306,0.011442896,0.0014669286],"domain_scores_gemma":[0.88331795,0.05169427,0.010059504,0.037769344,0.014814212,0.002344786],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.057887007,0.00070006,0.0007544829,0.0042756074,0.001958971,0.0076851156,0.0030585567,0.0018238358,0.0026783654],"category_scores_gemma":[0.142945,0.00065130705,0.0013841907,0.0048721363,0.0023313076,0.011851869,0.01707555,0.0028886786,0.0016080429],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00047190813,0.00041278428,0.025506387,0.0011196327,0.00028732236,0.00057142315,0.011371159,0.0063360743,0.006273139,0.03633117,0.015545614,0.8957734],"study_design_scores_gemma":[0.00044489736,0.0028716805,0.03197921,0.003591073,0.00080786773,0.0047076805,0.0201684,0.124665216,0.056499436,0.35137123,0.40215775,0.0007355481],"about_ca_topic_score_codex":0.003133194,"about_ca_topic_score_gemma":0.0034746772,"teacher_disagreement_score":0.057887007,"about_ca_system_score_codex":0.0015220721,"about_ca_system_score_gemma":0.0068169488,"threshold_uncertainty_score":0.3061394},"labels":[],"label_agreement":null},{"id":"W4402391115","doi":"10.23889/ijpds.v9i5.2502","title":"Development of a dictionary of information items inspired by common data models to support health research data access requests","year":2024,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Université de Sherbrooke; Canadian Institute for Health Information","funders":"","keywords":"Computer science; Data access; Data science; Data mining; Information retrieval; Database","score_opus":0.8228812729718443,"score_gpt":0.6533858271484233,"score_spread":0.16949544582342102,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402391115","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008131071,0.0004756874,0.9075029,0.006104096,0.0005081265,0.0048905797,0.026237978,0.0139472,0.032202415],"genre_scores_gemma":[0.017046204,0.00045829557,0.93406177,0.0010560383,0.0000538072,0.0015862474,0.036836468,0.002379665,0.0065214946],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9695274,0.008581515,0.008085244,0.004150458,0.008499454,0.0011558676],"domain_scores_gemma":[0.87691516,0.019240657,0.0048624575,0.048727006,0.04509398,0.0051607937],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.031766664,0.0012656709,0.0017750055,0.010529752,0.0037755514,0.013360471,0.0059877983,0.0021603124,0.008116102],"category_scores_gemma":[0.08547985,0.0022004189,0.0026534619,0.016817296,0.0029490076,0.01655462,0.009554448,0.006760091,0.007337226],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006603847,0.0004978116,0.014313862,0.0022582498,0.00025489595,0.00078189856,0.011123421,0.010011079,0.013333036,0.29468724,0.21301717,0.43906096],"study_design_scores_gemma":[0.00011535565,0.000084672916,0.002358445,0.0011322533,0.00009946185,0.00036503255,0.002397049,0.020989984,0.009271253,0.033580977,0.92939883,0.00020667331],"about_ca_topic_score_codex":0.1289844,"about_ca_topic_score_gemma":0.12835424,"teacher_disagreement_score":0.1289844,"about_ca_system_score_codex":0.011643706,"about_ca_system_score_gemma":0.044671264,"threshold_uncertainty_score":0.25646722},"labels":[],"label_agreement":null},{"id":"W4402391230","doi":"10.23889/ijpds.v9i5.2890","title":"Providing data analytic services for national knowledge users in a federated system: learnings from two Canadian use cases","year":2024,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Nova Scotia Health Authority; Dalhousie University; Government of Newfoundland and Labrador; University of New Brunswick; Alberta Health; Manitoba Health; Canadian Institute for Health Information; Newfoundland and Labrador Centre for Applied Health Research; Alberta Health Services","funders":"","keywords":"Knowledge management; Computer science; Data science","score_opus":0.4809236346985375,"score_gpt":0.5410040609025777,"score_spread":0.060080426204040194,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402391230","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.73136216,0.0031303468,0.053208522,0.14167087,0.0005984413,0.0033034906,0.003943525,0.0009477751,0.06183488],"genre_scores_gemma":[0.88211507,0.0021402985,0.087815866,0.015057258,0.00012863296,0.001669289,0.0018793503,0.0006321189,0.00856221],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.8548249,0.06974485,0.008326975,0.0066418387,0.040465917,0.019995483],"domain_scores_gemma":[0.71035326,0.11123211,0.0072554173,0.030840205,0.12470764,0.015611288],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.13841341,0.00092914636,0.00092556304,0.0039779316,0.02579959,0.01647088,0.0065683895,0.0043891096,0.0027225346],"category_scores_gemma":[0.19853507,0.0013423894,0.0013104348,0.010022641,0.010702624,0.009443464,0.012740443,0.0053881723,0.0005678537],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":true,"study_design_scores_codex":[0.0010004147,0.0013149845,0.23206912,0.0013753617,0.000271927,0.0074582314,0.3767322,0.0055349325,0.002763891,0.055942457,0.07714194,0.23839451],"study_design_scores_gemma":[0.00032364752,0.0006431161,0.10133338,0.0034450635,0.00027842613,0.0023732714,0.4170507,0.020567996,0.0056542372,0.022145106,0.42540863,0.0007764995],"about_ca_topic_score_codex":0.95970625,"about_ca_topic_score_gemma":0.9726848,"teacher_disagreement_score":0.8615866,"about_ca_system_score_codex":0.14164622,"about_ca_system_score_gemma":0.2440733,"threshold_uncertainty_score":0.9955687},"labels":[],"label_agreement":null},{"id":"W4402404963","doi":"10.23889/ijpds.v9i5.2624","title":"From Probabilistic to Fuzzy Matching Record Linkage: A promising Transition","year":2024,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Probabilistic logic; Matching (statistics); Transition (genetics); Linkage (software); Computer science; Record linkage; Fuzzy logic; Data mining; Artificial intelligence; Mathematics; Biology; Genetics; Statistics; Sociology","score_opus":0.24547470867080023,"score_gpt":0.5016516879164926,"score_spread":0.2561769792456924,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402404963","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012795491,0.019828783,0.91367686,0.039895173,0.0009290103,0.00060120004,0.00041375865,0.0010313155,0.010828364],"genre_scores_gemma":[0.110596776,0.015469639,0.8626225,0.005397036,0.001480926,0.0006738607,0.00041695195,0.00024527698,0.0030969465],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9491433,0.030617567,0.0018352767,0.0049359524,0.012856563,0.0006114862],"domain_scores_gemma":[0.9136325,0.06239684,0.0033201058,0.008634875,0.011084977,0.000930642],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0819646,0.0010013866,0.0019424963,0.0052640825,0.0014915897,0.007599174,0.006293289,0.0033389966,0.007754576],"category_scores_gemma":[0.09508996,0.0009659974,0.0020942201,0.0069381385,0.0048096934,0.0106977485,0.004686818,0.0048497044,0.0016168692],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003459169,0.0004705372,0.007499819,0.0016104475,0.00036237988,0.000093367074,0.0010958585,0.005562918,0.00092195,0.20271531,0.007166369,0.7721551],"study_design_scores_gemma":[0.0005169807,0.0024567707,0.012620214,0.002942987,0.0003344096,0.0011199064,0.002233807,0.10513252,0.004656287,0.67160386,0.19589339,0.0004888615],"about_ca_topic_score_codex":0.0077827675,"about_ca_topic_score_gemma":0.0045341165,"teacher_disagreement_score":0.0819646,"about_ca_system_score_codex":0.003922365,"about_ca_system_score_gemma":0.0058977604,"threshold_uncertainty_score":0.43347538},"labels":[],"label_agreement":null},{"id":"W4402405604","doi":"10.23889/ijpds.v9i5.2820","title":"Expanding data resources beyond “health care”: exploring options and implications","year":2024,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Health care; Data science; Business; Computer science; Risk analysis (engineering); Economics; Economic growth","score_opus":0.5693426971422808,"score_gpt":0.5715981845222683,"score_spread":0.0022554873799874864,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402405604","genre_codex":"commentary","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.024459494,0.015402553,0.017468208,0.84164983,0.00070383685,0.00036204184,0.00064136065,0.000086611355,0.09922601],"genre_scores_gemma":[0.7749995,0.032416783,0.063621245,0.112574875,0.0015532222,0.0016426635,0.00081049517,0.00032864974,0.012052572],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8508302,0.116960086,0.0036488501,0.0047892476,0.011860371,0.011911266],"domain_scores_gemma":[0.555204,0.37882307,0.005123116,0.013830224,0.030851869,0.016167767],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.19001836,0.0009156404,0.0010325124,0.006678095,0.017355176,0.03179478,0.010629685,0.009234068,0.01573604],"category_scores_gemma":[0.20786771,0.0010038543,0.0015279046,0.01519589,0.047011167,0.05428781,0.02650726,0.011806215,0.0010265211],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006498896,0.00007159436,0.0068703094,0.0008276008,0.000027709455,0.00075093494,0.021960149,0.0012914218,0.00015321856,0.866625,0.030224636,0.07113235],"study_design_scores_gemma":[0.000060298917,0.00006060736,0.0046575977,0.00840245,0.000045897104,0.0006598128,0.13399266,0.0019500208,0.0004585596,0.48000008,0.36959162,0.00012036751],"about_ca_topic_score_codex":0.13928197,"about_ca_topic_score_gemma":0.1645328,"teacher_disagreement_score":0.80998164,"about_ca_system_score_codex":0.038234502,"about_ca_system_score_gemma":0.101906806,"threshold_uncertainty_score":0.9988516},"labels":[],"label_agreement":null},{"id":"W4402405672","doi":"10.23889/ijpds.v9i5.2758","title":"Data Quality Implications in Research when Transitioning to a New Electronic Medical Record","year":2024,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Alberta; Alberta Health","funders":"","keywords":"Quality (philosophy); Electronic medical record; Data quality; Computer science; Data science; Business; Internet privacy; Marketing","score_opus":0.7950921562511286,"score_gpt":0.6891429991574641,"score_spread":0.10594915709366448,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402405672","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":"methods","domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09889956,0.025518976,0.13336888,0.6898082,0.00822328,0.008695862,0.0072726663,0.0004417229,0.027770821],"genre_scores_gemma":[0.62570983,0.00950875,0.2502796,0.09196039,0.003470021,0.013261905,0.0028649527,0.00040657446,0.002537924],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.1679717,0.67114115,0.07822464,0.012412485,0.06520496,0.0050451304],"domain_scores_gemma":[0.06097527,0.78539056,0.050327223,0.03699711,0.06188966,0.004420192],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.7053168,0.0007072523,0.001936481,0.0072003365,0.0060158893,0.020796157,0.0064499904,0.0060629905,0.0040266146],"category_scores_gemma":[0.86682904,0.001649542,0.0028586728,0.019366423,0.01544838,0.01429507,0.008471037,0.007906129,0.0005512136],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001887823,0.0005999303,0.3759107,0.0135649275,0.001903762,0.0013697232,0.052448783,0.006299943,0.0010575699,0.14645492,0.057083894,0.341418],"study_design_scores_gemma":[0.00097059977,0.0021115416,0.25052962,0.057537604,0.0023341984,0.0022928568,0.08101694,0.016963134,0.006145356,0.2269311,0.35240275,0.0007642998],"about_ca_topic_score_codex":0.06882455,"about_ca_topic_score_gemma":0.07338436,"teacher_disagreement_score":0.7053168,"about_ca_system_score_codex":0.026201071,"about_ca_system_score_gemma":0.07400344,"threshold_uncertainty_score":0.36339694},"labels":[],"label_agreement":null},{"id":"W4402405684","doi":"10.23889/ijpds.v9i5.2760","title":"Reporting on the establishment of a Privacy Preserving Record Linkage to Facilitate an Ongoing Crosswalk Between Research and Health Administrative Databases","year":2024,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Indoc Research; Ontario Brain Institute","funders":"","keywords":"Schema crosswalk; Record linkage; Linkage (software); Database; Data science; Computer science; Internet privacy; Data mining; Business; Medicine; Engineering; Environmental health; Transport engineering","score_opus":0.9109178340257105,"score_gpt":0.6727323830946649,"score_spread":0.2381854509310456,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402405684","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.039934207,0.0026179373,0.67508614,0.07353607,0.007190322,0.05455412,0.050132684,0.0065189046,0.09042959],"genre_scores_gemma":[0.14429523,0.0034424667,0.70019317,0.013658494,0.0025480404,0.06772459,0.0389197,0.0013518094,0.027866555],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.5684075,0.24310388,0.07261993,0.016671479,0.0900703,0.009126974],"domain_scores_gemma":[0.35872948,0.1729114,0.080279484,0.18306412,0.19524477,0.009770704],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.3317976,0.0015544588,0.0014566428,0.008349538,0.0068214675,0.010093454,0.0059978957,0.004587407,0.022584239],"category_scores_gemma":[0.48387277,0.0019682467,0.0033112972,0.00983963,0.0036478043,0.008550133,0.017600654,0.0055532446,0.010249922],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015713605,0.0007277385,0.05017734,0.0071273674,0.00075110793,0.0010468216,0.015602211,0.003450872,0.006395472,0.09431692,0.2901109,0.52872187],"study_design_scores_gemma":[0.00045373262,0.0010495315,0.029580407,0.007381015,0.00048429723,0.0009450627,0.006405848,0.0051781163,0.021301517,0.031294484,0.8955286,0.00039733053],"about_ca_topic_score_codex":0.01306514,"about_ca_topic_score_gemma":0.0125695225,"teacher_disagreement_score":0.3317976,"about_ca_system_score_codex":0.009969041,"about_ca_system_score_gemma":0.068288974,"threshold_uncertainty_score":0.8240125},"labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"not_applicable","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":[],"domain":null,"study_design":"design_other","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"low"}],"label_agreement":"split"},{"id":"W4402406136","doi":"10.23889/ijpds.v9i5.2657","title":"Navigating Data Acquisition and Data Quality Validation of Large Databases: Practical Lessons","year":2024,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Saskatchewan Health Quality Council","funders":"","keywords":"Database; Computer science; Data quality; Quality (philosophy); Data mining; Data science; Engineering; Operations management","score_opus":0.6281295486631037,"score_gpt":0.6648589747416125,"score_spread":0.03672942607850882,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402406136","genre_codex":"commentary","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0067787357,0.02171862,0.12780303,0.81925386,0.006402792,0.0007922314,0.000781035,0.002620332,0.013849419],"genre_scores_gemma":[0.0956626,0.02767973,0.7456494,0.10839403,0.008048229,0.0019024928,0.0023595465,0.0020287172,0.008275204],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.8143449,0.12485577,0.012077374,0.0096825985,0.03279702,0.0062422976],"domain_scores_gemma":[0.49121022,0.30313802,0.017874204,0.05231761,0.107861,0.027598975],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2234102,0.002998229,0.0020917302,0.0060182223,0.008685321,0.023448186,0.011033784,0.0105422195,0.010878839],"category_scores_gemma":[0.38908875,0.0021224571,0.0030563648,0.0055530285,0.017186975,0.039944977,0.017358478,0.026156044,0.00627428],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018969353,0.00066227134,0.013365231,0.0032229715,0.0002506265,0.0012503605,0.02512227,0.005055044,0.00093015947,0.04305983,0.47291267,0.4339789],"study_design_scores_gemma":[0.00021214009,0.00032726824,0.0072682654,0.011102757,0.00013397203,0.002004086,0.043192167,0.0063928054,0.0015241667,0.37748682,0.54977727,0.0005783115],"about_ca_topic_score_codex":0.03295751,"about_ca_topic_score_gemma":0.032461714,"teacher_disagreement_score":0.7765898,"about_ca_system_score_codex":0.011873764,"about_ca_system_score_gemma":0.047564838,"threshold_uncertainty_score":0.9576735},"labels":[],"label_agreement":null},{"id":"W4402406137","doi":"10.23889/ijpds.v9i5.2666","title":"Conceptualizing community data governance for race-related, population data: a scoping review and key informant interviews","year":2024,"lang":"en","type":"review","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University; Sunnybrook Health Science Centre; SickKids Foundation","funders":"","keywords":"Race (biology); Key (lock); Population; Corporate governance; Psychology; Business; Computer science; Sociology; Demography; Computer security; Finance; Gender studies","score_opus":0.6948268504810855,"score_gpt":0.6210748162597212,"score_spread":0.07375203422136434,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402406137","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10952838,0.54989606,0.14740446,0.107154496,0.0034010978,0.035463125,0.0017883915,0.00022251456,0.04514155],"genre_scores_gemma":[0.4637837,0.30239406,0.16887079,0.009035937,0.00038352495,0.049078733,0.0017281773,0.00018617407,0.0045389985],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.7089563,0.23696624,0.029088153,0.0059426217,0.014700576,0.004346059],"domain_scores_gemma":[0.59975845,0.340083,0.014603742,0.006915521,0.0361659,0.0024733334],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.31870306,0.0019147889,0.0026697067,0.030750867,0.011305202,0.016209455,0.0057818717,0.0071331575,0.0025526383],"category_scores_gemma":[0.30728793,0.0025948281,0.002699784,0.025902385,0.0151923075,0.023873154,0.01520302,0.006006271,0.0005538833],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00009759521,0.00012448155,0.0072688567,0.059067905,0.00031154166,0.0024032462,0.67257047,0.0019100928,0.0011456528,0.0700939,0.014155878,0.1708504],"study_design_scores_gemma":[0.00003623652,0.0001276213,0.0037810367,0.2665268,0.00033100176,0.00090395147,0.52247626,0.0013980521,0.00078285334,0.03733975,0.16615205,0.00014432827],"about_ca_topic_score_codex":0.022237085,"about_ca_topic_score_gemma":0.029611282,"teacher_disagreement_score":0.9942181,"about_ca_system_score_codex":0.021631176,"about_ca_system_score_gemma":0.08274825,"threshold_uncertainty_score":0.8401604},"labels":[],"label_agreement":null},{"id":"W4402406476","doi":"10.23889/ijpds.v9i5.2872","title":"Addressing data gaps on long-term care in Canada through data linkage","year":2024,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Statistics Canada","funders":"","keywords":"Term (time); Linkage (software); Record linkage; Computer science; Data science; Business; Medicine; Environmental health; Biology; Genetics","score_opus":0.5619007749469208,"score_gpt":0.5650601188922989,"score_spread":0.0031593439453780903,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402406476","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.18096252,0.04036235,0.2399116,0.22831583,0.0012430944,0.008643042,0.13732196,0.0019946857,0.1612449],"genre_scores_gemma":[0.5781923,0.024027133,0.31199694,0.018063204,0.0003446306,0.0069315173,0.0519484,0.0003231607,0.008172766],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.86163324,0.05490875,0.013667852,0.006852709,0.054669872,0.008267568],"domain_scores_gemma":[0.6494439,0.15256791,0.023083773,0.024216412,0.14287305,0.007814943],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.14928558,0.00079818745,0.002068098,0.016922256,0.009606103,0.014398065,0.0068546343,0.002086952,0.0048556062],"category_scores_gemma":[0.29485762,0.0008982281,0.0013332341,0.047618363,0.0034974257,0.0060655233,0.018369062,0.0040189875,0.0004835784],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00041344072,0.0003176639,0.21823648,0.008111689,0.0013466991,0.00055225694,0.023818847,0.0130407605,0.0005854418,0.15897284,0.10597226,0.46863165],"study_design_scores_gemma":[0.00028750676,0.00018655224,0.17589276,0.024592042,0.0011581492,0.00028377862,0.035642155,0.025875999,0.0027123224,0.08725382,0.6456648,0.00045025445],"about_ca_topic_score_codex":0.9572776,"about_ca_topic_score_gemma":0.93880713,"teacher_disagreement_score":0.14928558,"about_ca_system_score_codex":0.10792929,"about_ca_system_score_gemma":0.40045854,"threshold_uncertainty_score":0.7895071},"labels":[],"label_agreement":null},{"id":"W4402406479","doi":"10.23889/ijpds.v9i5.2865","title":"Efficiency gains from the implementation of Research IDs for data linkage: A case study from Population Data BC and the Data Innovation Program in British Columbia, Canada","year":2024,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Linkage (software); Record linkage; Linked data; Population; Computer science; Data science; Research data; World Wide Web; Demography; Biology; Sociology; Genetics; Data curation","score_opus":0.4921450913277475,"score_gpt":0.6045446402558524,"score_spread":0.11239954892810494,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402406479","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9365861,0.0015303115,0.0050273165,0.021816762,0.00008824999,0.002377818,0.00075433374,0.00018007479,0.031639032],"genre_scores_gemma":[0.974766,0.0011849579,0.012324964,0.002726195,0.00003363795,0.00085841224,0.00042677735,0.00011414723,0.0075649065],"study_design_codex":"observational","study_design_gemma":"case_report","domain_scores_codex":[0.8786376,0.07467704,0.0047852993,0.004033848,0.020492107,0.01737411],"domain_scores_gemma":[0.8100283,0.093166195,0.009465598,0.014903097,0.0557835,0.01665332],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.08256084,0.0006186957,0.00085731474,0.002819404,0.017678663,0.010170858,0.005766498,0.0023392776,0.0032917997],"category_scores_gemma":[0.12711239,0.00097506744,0.00074139563,0.008894714,0.005322119,0.00399987,0.008231238,0.0044817547,0.00036552816],"study_design_candidate":"case_report","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001172839,0.003263116,0.39926338,0.0022166758,0.00043357583,0.006702139,0.15502521,0.006896277,0.0014109714,0.021755729,0.030358294,0.3715018],"study_design_scores_gemma":[0.0005674765,0.001324884,0.50659496,0.0022803966,0.0005299061,0.0017960767,0.3484974,0.010879849,0.002350536,0.0051083993,0.11970993,0.0003601432],"about_ca_topic_score_codex":0.9496703,"about_ca_topic_score_gemma":0.96741706,"teacher_disagreement_score":0.91743916,"about_ca_system_score_codex":0.14162125,"about_ca_system_score_gemma":0.29294896,"threshold_uncertainty_score":0.99559766},"labels":[],"label_agreement":null},{"id":"W4402406486","doi":"10.23889/ijpds.v9i5.2867","title":"Creating a Data Cleaning and Pre-Processing Module for Generalisable Data Linkage","year":2024,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Alberta; University of Calgary; Alberta Health; Alberta Health Services","funders":"","keywords":"Linkage (software); Database; Data processing; Computer science; Process engineering; Engineering; Chemistry","score_opus":0.4833771817173695,"score_gpt":0.5563532414405485,"score_spread":0.07297605972317905,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402406486","genre_codex":"methods","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015963944,0.0005738831,0.66052896,0.0057010506,0.0012848453,0.01835436,0.11115397,0.17176436,0.014674703],"genre_scores_gemma":[0.035840563,0.00037605697,0.87073237,0.0017157062,0.00035154802,0.016235102,0.05587554,0.009828344,0.009044849],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.95646626,0.014079322,0.009680259,0.008301893,0.009901893,0.0015703614],"domain_scores_gemma":[0.838615,0.057473835,0.011238411,0.048333697,0.0415733,0.0027657934],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06358904,0.0019216054,0.0019057149,0.00963151,0.0020786389,0.005158338,0.0036048857,0.0014187369,0.051398],"category_scores_gemma":[0.15859142,0.0018224336,0.0024161944,0.008724262,0.0009658433,0.0048012375,0.007463998,0.003450256,0.02089828],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00084225624,0.00062888,0.032216422,0.0034779187,0.00060988084,0.0005721591,0.005112878,0.0017506012,0.009562937,0.0072793253,0.3016278,0.6363189],"study_design_scores_gemma":[0.00061585574,0.00040402866,0.05380026,0.0023568617,0.0004670346,0.00051664724,0.0026057945,0.02572304,0.040733088,0.019452488,0.8529499,0.0003748365],"about_ca_topic_score_codex":0.009294347,"about_ca_topic_score_gemma":0.007928578,"teacher_disagreement_score":0.06358904,"about_ca_system_score_codex":0.0022760774,"about_ca_system_score_gemma":0.014205181,"threshold_uncertainty_score":0.336295},"labels":[],"label_agreement":null},{"id":"W4402453836","doi":"10.29173/cais1844","title":"Measuring Data Re-Use In OpenAlex by Researchers, Institutions, and Countries","year":2024,"lang":"en","type":"article","venue":"Proceedings of the Annual Conference of CAIS / Actes du congrès annuel de l ACSI","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Political science; Regional science; Geography","score_opus":0.42138363346943747,"score_gpt":0.4117599338071687,"score_spread":0.009623699662268781,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402453836","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9012179,0.0030353926,0.02529672,0.004607929,0.00019501997,0.00050246285,0.013501626,0.000524976,0.051118083],"genre_scores_gemma":[0.9751041,0.00083636324,0.01158976,0.00028434777,0.00011424324,0.00030566897,0.008369414,0.00021006017,0.0031860431],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.85865396,0.056797575,0.016584031,0.01126724,0.05181706,0.0048801736],"domain_scores_gemma":[0.44418088,0.29951608,0.09273711,0.068263724,0.08766224,0.007639995],"candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.0997734,0.00056518737,0.0015466316,0.043984313,0.003200735,0.017276317,0.0024632483,0.0018671661,0.0033267555],"category_scores_gemma":[0.30633646,0.0004438038,0.0010680966,0.08819612,0.0056650685,0.020884246,0.014605462,0.0018517122,0.0009574741],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014336326,0.00012635147,0.8598922,0.00072687474,0.0005173715,0.00018437405,0.026959473,0.0015732158,0.0007996503,0.029730923,0.0044019544,0.07494413],"study_design_scores_gemma":[0.00004147773,0.00023944481,0.811576,0.00089977944,0.00032279224,0.0005622922,0.0553562,0.003979391,0.005893646,0.022357322,0.09855498,0.0002166453],"about_ca_topic_score_codex":0.011932437,"about_ca_topic_score_gemma":0.013355676,"teacher_disagreement_score":0.9560157,"about_ca_system_score_codex":0.005912924,"about_ca_system_score_gemma":0.005668,"threshold_uncertainty_score":0.52765846},"labels":[],"label_agreement":null},{"id":"W4402554712","doi":"10.1177/18333583241277952","title":"System interoperability and data linkage in the era of health information management: A bibliometric analysis","year":2024,"lang":"en","type":"article","venue":"Health Information Management Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"Fundação para a Ciência e a Tecnologia; Universidade de Lisboa; Universidade dos Açores","keywords":"Interoperability; Health informatics; Computer science; Linkage (software); Data science; Sample (material); Stakeholder; Knowledge management; World Wide Web; Medicine; Public health; Political science","score_opus":0.17824280409310886,"score_gpt":0.45076212203237365,"score_spread":0.27251931793926476,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402554712","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.68321264,0.14982678,0.048776865,0.011346177,0.0005226092,0.0063916296,0.037804104,0.0007681635,0.061350953],"genre_scores_gemma":[0.9104528,0.033574704,0.04140943,0.00027521644,0.00028913352,0.003353459,0.009579387,0.00010481064,0.00096104696],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.90357554,0.03174683,0.02087306,0.004784529,0.03723253,0.001787598],"domain_scores_gemma":[0.6992543,0.24066216,0.023791142,0.00980537,0.025256976,0.0012300971],"candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.07018676,0.0009713947,0.0042818054,0.22525658,0.0030859387,0.0135719525,0.001838555,0.0014398325,0.0038348855],"category_scores_gemma":[0.2416297,0.0006434994,0.004656473,0.32490474,0.003309422,0.010495274,0.007346835,0.0010001936,0.0004714017],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00052798516,0.00028072414,0.40962878,0.08230886,0.009707837,0.0009252295,0.022419376,0.006008255,0.0014152611,0.031235883,0.010903392,0.4246385],"study_design_scores_gemma":[0.00022599797,0.0006649212,0.70236087,0.033337787,0.01716902,0.0023687119,0.04913393,0.025949297,0.0033392517,0.05252067,0.11238111,0.00054832705],"about_ca_topic_score_codex":0.007976803,"about_ca_topic_score_gemma":0.00646172,"teacher_disagreement_score":0.77474344,"about_ca_system_score_codex":0.008165782,"about_ca_system_score_gemma":0.012857651,"threshold_uncertainty_score":0.3711875},"labels":[],"label_agreement":null},{"id":"W4402594319","doi":"10.1109/sse62657.2024.00025","title":"Efficient Incident Summarization in ITOps: Leveraging Entity-Based Grouping","year":2024,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"IBM (Canada)","funders":"","keywords":"Automatic summarization; Computer science; Information retrieval; Artificial intelligence","score_opus":0.14597231352848483,"score_gpt":0.4072017318811585,"score_spread":0.26122941835267366,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402594319","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.019306969,0.0007468633,0.9634601,0.00078232883,0.00017979299,0.0005256288,0.0021293452,0.01070897,0.002160043],"genre_scores_gemma":[0.19085184,0.0006445359,0.7941481,0.00032650642,0.0002549687,0.00035118317,0.009241977,0.0007176034,0.00346323],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9973483,0.0008208548,0.000349452,0.000661555,0.0006742827,0.00014565264],"domain_scores_gemma":[0.9930434,0.0026914503,0.0009994345,0.0015103924,0.0014933456,0.00026191713],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0021741476,0.0019143568,0.001306121,0.004412222,0.001184782,0.0031108416,0.0018495049,0.0011026773,0.0021742086],"category_scores_gemma":[0.0114559,0.0005250093,0.0011535496,0.0038855835,0.00049744267,0.003964456,0.0032195677,0.0015940404,0.001530369],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005955194,0.00038440787,0.0059947367,0.0013338258,0.00024242012,0.0011807799,0.005082781,0.045250583,0.033183824,0.010202284,0.035542212,0.8610067],"study_design_scores_gemma":[0.000106809246,0.00058567367,0.005406633,0.00027292155,0.0005942379,0.0009453236,0.0051497943,0.79651517,0.052192092,0.04637074,0.09162557,0.00023494326],"about_ca_topic_score_codex":0.0040439367,"about_ca_topic_score_gemma":0.0061958786,"teacher_disagreement_score":0.004412222,"about_ca_system_score_codex":0.0007478035,"about_ca_system_score_gemma":0.0014054466,"threshold_uncertainty_score":0.011498153},"labels":[],"label_agreement":null},{"id":"W4402647595","doi":"10.54501/jots.v2i4.215","title":"A Multi-Stakeholder Approach for Leveraging Data Portability to Support Research on the Digital Information Environment","year":2024,"lang":"en","type":"article","venue":"Journal of Online Trust and Safety","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Charles Koch Foundation; Craig Newmark Philanthropies; York University; John S. and James L. Knight Foundation; Bill and Melinda Gates Foundation","keywords":"Software portability; Computer science; Stakeholder; Data science; Human–computer interaction; Knowledge management; World Wide Web; Political science; Operating system; Public relations","score_opus":0.6331715962950767,"score_gpt":0.4901302457559833,"score_spread":0.1430413505390934,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402647595","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.020462632,0.0011483509,0.7264353,0.10520281,0.0006930014,0.0027173494,0.0002882119,0.00043110907,0.14262134],"genre_scores_gemma":[0.5498808,0.0010935569,0.4229889,0.010332251,0.00039146017,0.0040017683,0.0002807564,0.00025122883,0.010779327],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.74722016,0.21591304,0.006535643,0.009206324,0.016735418,0.004389426],"domain_scores_gemma":[0.67231625,0.22972442,0.011272059,0.048736103,0.026812889,0.011138297],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.27893925,0.0012883947,0.0010999134,0.011264916,0.010762516,0.021536605,0.006167317,0.009235264,0.008479324],"category_scores_gemma":[0.19599344,0.0013024799,0.0021886025,0.006921531,0.02354348,0.03710454,0.039894935,0.010176764,0.0012996757],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000072930976,0.00018229886,0.004422697,0.00054758287,0.00012999566,0.0008387107,0.033641785,0.0018840027,0.0021012397,0.89397156,0.005218643,0.056988455],"study_design_scores_gemma":[0.000052713192,0.00019177284,0.001588591,0.0017340546,0.00009314432,0.0005820344,0.026751518,0.00686929,0.0021315024,0.7905978,0.1692653,0.00014212923],"about_ca_topic_score_codex":0.0029679579,"about_ca_topic_score_gemma":0.0045289136,"teacher_disagreement_score":0.27893925,"about_ca_system_score_codex":0.011574352,"about_ca_system_score_gemma":0.032491375,"threshold_uncertainty_score":0.8891963},"labels":[],"label_agreement":null},{"id":"W4402898151","doi":"10.1016/j.is.2024.102460","title":"Data Lakehouse: A survey and experimental study","year":2024,"lang":"en","type":"article","venue":"Information Systems","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":25,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University","funders":"Natural Sciences and Engineering Research Council of Canada; Canada Foundation for Innovation","keywords":"Computer science; Survey research; Data science; Psychology","score_opus":0.4319128260972868,"score_gpt":0.47713784578125534,"score_spread":0.045225019683968526,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402898151","genre_codex":"empirical","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.4089218,0.2644023,0.15921085,0.021239622,0.001244673,0.005716439,0.029760333,0.008961598,0.10054245],"genre_scores_gemma":[0.62993306,0.17420807,0.13936244,0.004572374,0.00063256576,0.0022101533,0.040444203,0.001238525,0.0073985937],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9803728,0.0068332125,0.0023730653,0.0022824386,0.007389127,0.0007494502],"domain_scores_gemma":[0.8812131,0.07062358,0.0054689203,0.013527876,0.026854841,0.0023115408],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.024325911,0.0007034467,0.0010172572,0.008929013,0.0017807633,0.005276291,0.003119546,0.0009976042,0.0057779863],"category_scores_gemma":[0.06229267,0.00084043114,0.0011433265,0.025462897,0.0021141183,0.016224952,0.0027685105,0.0017537595,0.0016114272],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012942891,0.0013865127,0.06040701,0.013000318,0.00040429126,0.00015039167,0.0026239117,0.0030824735,0.0050958744,0.029222582,0.059825815,0.8235066],"study_design_scores_gemma":[0.00031512915,0.0035753467,0.07353875,0.0076500294,0.00082907145,0.0014654153,0.01302443,0.01833558,0.029217247,0.008969134,0.84271604,0.0003639748],"about_ca_topic_score_codex":0.008941846,"about_ca_topic_score_gemma":0.007000997,"teacher_disagreement_score":0.024325911,"about_ca_system_score_codex":0.0033815582,"about_ca_system_score_gemma":0.005379243,"threshold_uncertainty_score":0.12864923},"labels":[],"label_agreement":null},{"id":"W4403054350","doi":"10.2196/64726","title":"Strengthening the Backbone: Government-Academic Data Collaborations for Crisis Response","year":2024,"lang":"en","type":"article","venue":"JMIR Public Health and Surveillance","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Preprint; Government (linguistics); Political science; Computer science; World Wide Web","score_opus":0.30457572968655755,"score_gpt":0.47526680444772557,"score_spread":0.17069107476116802,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4403054350","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00011398719,0.0012295006,0.0003673377,0.96344525,0.034187272,0.000011133876,0.00002316519,0.00002971682,0.0005926204],"genre_scores_gemma":[0.0026871427,0.0018364573,0.0006725472,0.9441998,0.04887823,0.000043870976,0.000021417432,0.00007164982,0.0015887842],"study_design_codex":"not_applicable","study_design_gemma":"qualitative","domain_scores_codex":[0.9517654,0.024228688,0.0046336195,0.0052302503,0.009700004,0.0044421167],"domain_scores_gemma":[0.7874347,0.15257527,0.010749835,0.005481762,0.02863269,0.0151258325],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03626416,0.0009428109,0.0015639993,0.0016119573,0.00888589,0.021352684,0.0072259125,0.042585235,0.010085501],"category_scores_gemma":[0.17532466,0.0010565898,0.0025494837,0.0018369972,0.013679605,0.024490815,0.010527988,0.04717448,0.00672799],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000045543835,0.000020742027,0.00017928923,0.00029808347,0.000018614819,0.0004863599,0.001399878,0.00006711066,0.0000882519,0.00844706,0.9757936,0.013155504],"study_design_scores_gemma":[0.000028664952,0.000026555002,0.00022814005,0.00083004974,0.00001607357,0.00045807142,0.001530834,0.0001825439,0.00015333874,0.016272383,0.98021483,0.000058583893],"about_ca_topic_score_codex":0.003893413,"about_ca_topic_score_gemma":0.0050315927,"teacher_disagreement_score":0.042585235,"about_ca_system_score_codex":0.0067380136,"about_ca_system_score_gemma":0.022797553,"threshold_uncertainty_score":0.19178551},"labels":[],"label_agreement":null},{"id":"W4403509127","doi":"10.2196/67286","title":"Correction: Data Integrity Issues With Web-Based Studies: An Institutional Example of a Widespread Challenge","year":2024,"lang":"en","type":"erratum","venue":"JMIR Mental Health","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"Economic and Social Research Council","keywords":"Research integrity; Computer science; Data science; World Wide Web; Engineering ethics; Engineering","score_opus":0.4180722274788815,"score_gpt":0.5205633684969673,"score_spread":0.10249114101808576,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4403509127","genre_codex":"editorial","genre_gemma":"other","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00012563074,0.00047249463,0.0012826667,0.16634867,0.8280383,0.000078673744,0.0010535102,0.0007570884,0.00184305],"genre_scores_gemma":[0.012694345,0.00621782,0.01084398,0.39789793,0.48064324,0.0007678506,0.0019254974,0.0033724797,0.08563683],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9565916,0.0095143905,0.010328424,0.0034007858,0.017789995,0.002374858],"domain_scores_gemma":[0.72971845,0.10367489,0.013252729,0.015861407,0.13024484,0.007247678],"candidate_categories":["metaresearch","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.026401317,0.0030230943,0.0034798572,0.0061171083,0.007698404,0.011160931,0.006674351,0.021651667,0.04464258],"category_scores_gemma":[0.34014326,0.0026547923,0.0033532113,0.005987506,0.007434264,0.0048384108,0.004972726,0.035026316,0.031030884],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00002300114,0.0000066512443,0.000061019502,0.00013790146,0.000019838455,0.00023308219,0.000086167325,0.000027247665,0.000026112642,0.0007037399,0.9955289,0.003146353],"study_design_scores_gemma":[0.00008762668,0.00003213997,0.0005549337,0.0012482675,0.00007733616,0.00071626314,0.00032159334,0.0004580096,0.00033844443,0.00322812,0.99283916,0.000098144796],"about_ca_topic_score_codex":0.029806893,"about_ca_topic_score_gemma":0.0336182,"teacher_disagreement_score":0.9783483,"about_ca_system_score_codex":0.008563713,"about_ca_system_score_gemma":0.020765474,"threshold_uncertainty_score":0.14934427},"labels":[],"label_agreement":null},{"id":"W4403536522","doi":"10.1145/3691620.3695061","title":"What Makes a High-Quality Training Dataset for Large Language Models: A Practitioners' Perspective","year":2024,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"Natural Science Foundation of Chongqing","keywords":"Perspective (graphical); Computer science; Training (meteorology); Quality (philosophy); Language model; Artificial intelligence; Natural language processing; Data science; Machine learning","score_opus":0.33202770851424385,"score_gpt":0.5121126675199051,"score_spread":0.1800849590056613,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4403536522","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.3336805,0.008628826,0.33962372,0.2888948,0.0010920991,0.0024481849,0.005026028,0.0025703572,0.01803548],"genre_scores_gemma":[0.6000823,0.002156091,0.38291642,0.007662991,0.00048101324,0.0011731533,0.004235824,0.00050621916,0.0007859267],"study_design_codex":"design_other","study_design_gemma":"qualitative","domain_scores_codex":[0.7924526,0.14541559,0.016937507,0.008386473,0.033129472,0.0036784061],"domain_scores_gemma":[0.33069202,0.47732463,0.032977693,0.05170763,0.09641886,0.010879188],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.23569585,0.0007753474,0.0016536542,0.0051036715,0.0029895368,0.012107707,0.004156417,0.004489942,0.003083591],"category_scores_gemma":[0.55731845,0.0011142531,0.0011178827,0.006314619,0.0056993077,0.021121046,0.0062555573,0.005191939,0.0013067295],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014332866,0.0015609452,0.2228888,0.009849685,0.0005509255,0.0012942178,0.049525164,0.017149134,0.016755573,0.073534966,0.07496366,0.53049374],"study_design_scores_gemma":[0.0007607878,0.0023831283,0.16196081,0.022426507,0.00055906683,0.0026372562,0.16994084,0.12497132,0.03686956,0.2304234,0.2461163,0.0009510905],"about_ca_topic_score_codex":0.008041882,"about_ca_topic_score_gemma":0.009401197,"teacher_disagreement_score":0.23569585,"about_ca_system_score_codex":0.0044437554,"about_ca_system_score_gemma":0.01551607,"threshold_uncertainty_score":0.94252306},"labels":[],"label_agreement":null},{"id":"W4403557110","doi":"10.1007/978-3-031-68146-2_7","title":"Improving Information Interoperability for Safety and Security Organizations Using Information Mesh","year":2024,"lang":"en","type":"book-chapter","venue":"Advanced sciences and technologies for security applications","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Defence Research and Development Canada","funders":"","keywords":"Interoperability; Computer security; Information security; Business; Computer science; Knowledge management; World Wide Web","score_opus":0.03880117234383387,"score_gpt":0.34338798377593094,"score_spread":0.3045868114320971,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4403557110","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.038713045,0.004747098,0.4958771,0.00521355,0.0006409113,0.00020224247,0.0002512176,0.0023057298,0.45204914],"genre_scores_gemma":[0.34239122,0.009490802,0.431649,0.0012344008,0.00043422385,0.00023869378,0.0013951568,0.001188892,0.21197765],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9987954,0.00034108938,0.000057718516,0.00008251302,0.0006357675,0.00008737164],"domain_scores_gemma":[0.9983417,0.0008366013,0.00006627455,0.00038422857,0.00032700656,0.000044194036],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0017129203,0.00047231003,0.00028487595,0.0015511875,0.00053782825,0.003095792,0.0008944072,0.0008928402,0.009354282],"category_scores_gemma":[0.0035674027,0.0002273512,0.00058868533,0.0018620233,0.00067805604,0.007189569,0.0019032186,0.0010855094,0.0020643128],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00004330587,0.00013875758,0.0013790516,0.00020338528,0.000033218017,0.00009909495,0.00075270544,0.010861061,0.009882891,0.25540614,0.023336882,0.69786346],"study_design_scores_gemma":[0.000027611088,0.00025050758,0.005010735,0.00071711413,0.00018262307,0.0004535371,0.0016582564,0.09067579,0.044020787,0.33633044,0.52061284,0.000059731705],"about_ca_topic_score_codex":0.0019491869,"about_ca_topic_score_gemma":0.0018461436,"teacher_disagreement_score":0.009354282,"about_ca_system_score_codex":0.0010707664,"about_ca_system_score_gemma":0.000953,"threshold_uncertainty_score":0.031293213},"labels":[],"label_agreement":null},{"id":"W4403557122","doi":"10.1007/978-3-031-68146-2_4","title":"Information Management Standards in Canadian Public Safety and Security: Enhancing Interoperability, Collaboration and Resilience","year":2024,"lang":"en","type":"book-chapter","venue":"Advanced sciences and technologies for security applications","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Defence Research and Development Canada","funders":"","keywords":"Interoperability; Resilience (materials science); Business; Computer security; Standard of Good Practice; Information security; Knowledge management; Computer science; World Wide Web; Security service","score_opus":0.026241686489295955,"score_gpt":0.34927696369378647,"score_spread":0.3230352772044905,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4403557122","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.007566094,0.018278886,0.007968713,0.037514295,0.0016946227,0.00011712193,0.00049316755,0.00020516074,0.92616194],"genre_scores_gemma":[0.17415349,0.030591547,0.017805576,0.0034510442,0.00049668836,0.00009785322,0.00079394603,0.0002626711,0.7723471],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.99641246,0.0003749799,0.0000950601,0.0001901152,0.0022533904,0.00067405036],"domain_scores_gemma":[0.9974842,0.0004068972,0.000083026855,0.0001282851,0.0016445275,0.00025309436],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0032566586,0.0008333419,0.00036169987,0.0049658013,0.007870173,0.012093256,0.0022454935,0.002243059,0.011790226],"category_scores_gemma":[0.0057693147,0.0004462611,0.0004684752,0.012438811,0.006787891,0.0052142455,0.0018701962,0.0025823996,0.0011626098],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":true,"study_design_scores_codex":[0.0000088706565,0.0000127851035,0.0003126117,0.000072576855,0.0000037170314,0.00006104454,0.0031668963,0.0008701647,0.00013028276,0.8084583,0.11101729,0.075885445],"study_design_scores_gemma":[0.0000025678796,0.000004653156,0.0010497416,0.00017709407,0.00000623229,0.000037447808,0.0016496195,0.0005723063,0.00023160815,0.038396005,0.9578489,0.000023853292],"about_ca_topic_score_codex":0.9868727,"about_ca_topic_score_gemma":0.9911634,"teacher_disagreement_score":0.84117675,"about_ca_system_score_codex":0.15882327,"about_ca_system_score_gemma":0.1785059,"threshold_uncertainty_score":0.9756458},"labels":[],"label_agreement":null},{"id":"W4403659932","doi":"10.2196/59844","title":"The University of California Study of Outcomes in Mothers and Infants (a Population-Based Research Resource): Retrospective Cohort Study","year":2024,"lang":"en","type":"article","venue":"JMIR Public Health and Surveillance","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":16,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"Eunice Kennedy Shriver National Institute of Child Health and Human Development; National Institute on Drug Abuse","keywords":"Preprint; Retrospective cohort study; Cohort study; Medicine; Resource (disambiguation); Population; Environmental health; Computer science; World Wide Web","score_opus":0.153319479851705,"score_gpt":0.44182126216866263,"score_spread":0.28850178231695767,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4403659932","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.93214005,0.004705248,0.0015428265,0.0007508116,0.00013951317,0.0012544175,0.0521558,0.000061998515,0.0072492496],"genre_scores_gemma":[0.96046245,0.005232646,0.0026786202,0.0004237532,0.00015619336,0.002582617,0.025558634,0.000028422934,0.0028767248],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.998395,0.0003406569,0.00015444061,0.00045289338,0.0004992702,0.00015761364],"domain_scores_gemma":[0.99759525,0.00027905602,0.00073894236,0.0003571728,0.00070926215,0.0003202907],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0017463845,0.00036956547,0.0005180459,0.001621776,0.0011007887,0.0008915297,0.000950092,0.0004422025,0.0022459305],"category_scores_gemma":[0.004925987,0.000634617,0.00039269353,0.0030630047,0.00018077694,0.00047823958,0.0008062188,0.0008132577,0.00048531403],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018565315,0.000096145624,0.9838569,0.00011249978,0.0002509342,0.00012705778,0.00036524291,0.000054012282,0.00012567431,0.00019382076,0.010261683,0.004370393],"study_design_scores_gemma":[0.00005093109,0.00006395188,0.9938729,0.0001336336,0.00013687323,0.00016498212,0.00035913748,0.00011858547,0.000044372417,0.000033745742,0.0050118053,0.0000091577085],"about_ca_topic_score_codex":0.07796154,"about_ca_topic_score_gemma":0.09601849,"teacher_disagreement_score":0.07796154,"about_ca_system_score_codex":0.0014276671,"about_ca_system_score_gemma":0.0023661712,"threshold_uncertainty_score":0.15501547},"labels":[],"label_agreement":null},{"id":"W4403950719","doi":"10.23889/ijpds.v9i5.2932","title":"Leveraging Full Count Census Data through Record Linkage","year":2024,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Canadiana.org","funders":"","keywords":"Census; Record linkage; Computer science; Linkage (software); Count data; Data science; Statistics; Medicine; Population; Biology; Environmental health; Mathematics; Genetics","score_opus":0.5370824940918127,"score_gpt":0.5509539962253384,"score_spread":0.013871502133525615,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4403950719","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013927502,0.01233701,0.82921785,0.057172198,0.0033824225,0.0029543638,0.018367026,0.0053898212,0.057251938],"genre_scores_gemma":[0.06565481,0.021250801,0.8630447,0.008592328,0.0027382637,0.003710344,0.020161558,0.0021865617,0.012660721],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.90687823,0.053982873,0.004967794,0.0070892978,0.025107533,0.001974369],"domain_scores_gemma":[0.8555277,0.07667145,0.0052755596,0.025702704,0.034741446,0.0020811697],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.09699666,0.001108795,0.0016492272,0.01633536,0.004061727,0.015528968,0.005240385,0.0027604643,0.009683423],"category_scores_gemma":[0.23745573,0.0019433543,0.0021201486,0.026539523,0.0019852868,0.018673027,0.016638547,0.004496115,0.006163872],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00008703401,0.000099586185,0.012563844,0.001346789,0.00037378762,0.00018540534,0.006238254,0.0050813667,0.00056906405,0.06547791,0.18099888,0.72697806],"study_design_scores_gemma":[0.00010778354,0.00009052157,0.007650192,0.0025777828,0.00024607865,0.0002625691,0.005081887,0.016708335,0.0015177326,0.13838127,0.8270872,0.00028867598],"about_ca_topic_score_codex":0.05431979,"about_ca_topic_score_gemma":0.05091891,"teacher_disagreement_score":0.09699666,"about_ca_system_score_codex":0.0050699874,"about_ca_system_score_gemma":0.018000832,"threshold_uncertainty_score":0.5129735},"labels":[],"label_agreement":null},{"id":"W4404049985","doi":"10.2196/60244","title":"Building a Foundation for High-Quality Health Data: Multihospital Case Study in Belgium","year":2024,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Preprint; Medicine; Quality (philosophy); Foundation (evidence); Computer science; Data science; World Wide Web; Geography","score_opus":0.2941413349360141,"score_gpt":0.5625659524406184,"score_spread":0.2684246175046043,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4404049985","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9825112,0.00065657997,0.0035120675,0.006865554,0.000048527687,0.00025162092,0.0005076101,0.000053907497,0.0055929124],"genre_scores_gemma":[0.9925687,0.00039435114,0.005397003,0.00044672802,0.00002625639,0.000093033545,0.0002230395,0.000024528463,0.0008264217],"study_design_codex":"observational","study_design_gemma":"qualitative","domain_scores_codex":[0.98953855,0.0064580366,0.0007384941,0.0005954809,0.0011093824,0.0015600269],"domain_scores_gemma":[0.9784362,0.009603201,0.003626207,0.0015634714,0.0028492773,0.00392173],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008226346,0.0004103577,0.00033890884,0.0020610236,0.005048515,0.0034020436,0.0013881624,0.0025812734,0.0021807079],"category_scores_gemma":[0.025161173,0.00044328396,0.00056157267,0.00408714,0.0019834153,0.0013825485,0.0027419222,0.0015426693,0.00027093315],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006187883,0.0025664233,0.5073404,0.0013554974,0.00032283543,0.20360401,0.10852079,0.012821713,0.0022416362,0.022734184,0.019134523,0.11873921],"study_design_scores_gemma":[0.00015874974,0.0011142023,0.3794851,0.0020174128,0.00019075566,0.101036854,0.38451353,0.015329666,0.0027008376,0.007028118,0.106142014,0.0002828152],"about_ca_topic_score_codex":0.089378215,"about_ca_topic_score_gemma":0.0922754,"teacher_disagreement_score":0.089378215,"about_ca_system_score_codex":0.010160628,"about_ca_system_score_gemma":0.01158637,"threshold_uncertainty_score":0.17771596},"labels":[],"label_agreement":null},{"id":"W4404818404","doi":"10.1007/978-981-96-0579-8_16","title":"RePair My Queries: Personalized Query Reformulation via Conditional Transformers","year":2024,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"","keywords":"Computer science; Query optimization; Information retrieval; Transformer; Sargable; Web search query; Database; Search engine","score_opus":0.06617546119587851,"score_gpt":0.35038473437706585,"score_spread":0.2842092731811873,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4404818404","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009946094,0.00023108706,0.9729868,0.00070939184,0.00009834725,0.0001229119,0.00058565004,0.012625581,0.0026940724],"genre_scores_gemma":[0.33220384,0.0003830172,0.6524263,0.00079354085,0.000255775,0.00020973745,0.0029662396,0.003688244,0.007073238],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9941554,0.0018647026,0.0004648959,0.0010055513,0.001985043,0.00052434264],"domain_scores_gemma":[0.9862918,0.007905413,0.0003569202,0.00417444,0.0010907736,0.0001805962],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004915124,0.0012354885,0.0015465631,0.0015502586,0.00081362703,0.003202331,0.0036973152,0.0014443019,0.014833774],"category_scores_gemma":[0.023711791,0.0010519786,0.0021167698,0.0019392938,0.0019172938,0.009091819,0.005090017,0.0036103996,0.0035013983],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014479865,0.00042741536,0.0013832827,0.0006308028,0.00017924338,0.0004731639,0.001211652,0.06263567,0.019364553,0.1965523,0.063478485,0.6522154],"study_design_scores_gemma":[0.00018894635,0.00010975338,0.00028709887,0.00006264226,0.00017725406,0.0003417644,0.000283692,0.6529302,0.026794357,0.29890805,0.019836167,0.000080088816],"about_ca_topic_score_codex":0.0030396986,"about_ca_topic_score_gemma":0.0036655278,"teacher_disagreement_score":0.014833774,"about_ca_system_score_codex":0.0012448089,"about_ca_system_score_gemma":0.0018078458,"threshold_uncertainty_score":0.049623907},"labels":[],"label_agreement":null},{"id":"W4405035632","doi":"10.48550/arxiv.2412.01953","title":"The Landscape of Causal Discovery Data: Grounding Causal Discovery in Real-World Applications","year":2024,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"National Institute of Mental Health; Bundesministerium für Bildung und Forschung; Natural Sciences and Engineering Research Council of Canada; Canadian Institute for Advanced Research","keywords":"Data science; Data discovery; Computer science; Geography; World Wide Web","score_opus":0.281484289759273,"score_gpt":0.3330710474130075,"score_spread":0.05158675765373455,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4405035632","genre_codex":"methods","genre_gemma":"review","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014720556,0.109598756,0.78201264,0.07925016,0.0007239272,0.0004571836,0.0038396807,0.0008532977,0.008543816],"genre_scores_gemma":[0.41565993,0.050887566,0.5108366,0.012566326,0.0023360404,0.0015599304,0.0048832744,0.00053028046,0.0007400459],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"observational","domain_scores_codex":[0.7947943,0.15718709,0.009669592,0.012313658,0.025120044,0.00091534836],"domain_scores_gemma":[0.14988934,0.79773086,0.013826431,0.023856718,0.0134944515,0.0012023556],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2246197,0.0018044378,0.0033227499,0.01790327,0.0034692974,0.015310719,0.006759512,0.0065288986,0.0039504357],"category_scores_gemma":[0.6141172,0.0017002361,0.0029124815,0.018670505,0.019443203,0.02527962,0.008126573,0.010154899,0.0007205994],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003626914,0.00013787657,0.027129825,0.01350225,0.0018768271,0.00037532244,0.0017321779,0.034907784,0.0005098143,0.58768016,0.018222807,0.3135624],"study_design_scores_gemma":[0.00006198779,0.000084689775,0.0025892,0.0037986215,0.0002796716,0.00021772974,0.00039120723,0.032877903,0.0006891481,0.93140924,0.027528044,0.00007251884],"about_ca_topic_score_codex":0.0048464327,"about_ca_topic_score_gemma":0.0043068593,"teacher_disagreement_score":0.7753803,"about_ca_system_score_codex":0.007908661,"about_ca_system_score_gemma":0.010915303,"threshold_uncertainty_score":0.95618194},"labels":[],"label_agreement":null},{"id":"W4405688611","doi":"10.1017/s1049096524000945","title":"Data Sovereignty and Development: How do Native Americans View Data Sharing by Tribal Governments?","year":2024,"lang":"en","type":"article","venue":"PS Political Science & Politics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria","funders":"","keywords":"Indigenous; Sovereignty; Political science; Data sharing; Survey data collection; Native american; Data collection; Economic growth; Public relations; Public administration; Sociology; Law; Ethnology; Economics; Medicine; Social science; Politics","score_opus":0.3863989094866279,"score_gpt":0.4780098752387215,"score_spread":0.0916109657520936,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4405688611","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.94060576,0.0008866632,0.0012483414,0.0332422,0.00007685511,0.000027121414,0.00006708346,0.0000072789217,0.023838863],"genre_scores_gemma":[0.9978422,0.00024514334,0.00017771788,0.0013430344,0.000014367561,0.000010213995,0.000015862193,0.0000032293995,0.0003483151],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.9779735,0.016656239,0.00062013103,0.0008482501,0.0020710875,0.0018307881],"domain_scores_gemma":[0.95288634,0.027049838,0.00690739,0.0021863272,0.0053442335,0.0056259227],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0272659,0.00012118071,0.000287206,0.0015146075,0.0070981896,0.009220475,0.000813107,0.0010999842,0.0033170634],"category_scores_gemma":[0.062075906,0.00020989068,0.0002758316,0.0020100265,0.009557282,0.0058351094,0.0052848393,0.0035070595,0.00019890547],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00007668621,0.000087768116,0.18176445,0.00010670937,0.00007198419,0.00037839753,0.76051944,0.00010237615,0.0003828017,0.01991889,0.0035147464,0.033075724],"study_design_scores_gemma":[0.0000065874306,0.00003264769,0.053600162,0.00022308393,0.000017428483,0.0001435162,0.92192554,0.00022290784,0.00011921479,0.006959901,0.016716806,0.000032175947],"about_ca_topic_score_codex":0.037520207,"about_ca_topic_score_gemma":0.03883564,"teacher_disagreement_score":0.037520207,"about_ca_system_score_codex":0.0037757452,"about_ca_system_score_gemma":0.0052938215,"threshold_uncertainty_score":0.14419764},"labels":[],"label_agreement":null},{"id":"W4406143719","doi":"10.2139/ssrn.5075185","title":"An Observation-Driven State-Space Model for Claims Size Modeling","year":2025,"lang":"en","type":"preprint","venue":"SSRN Electronic Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"State space; Space (punctuation); State (computer science); State-space representation; Econometrics; Computer science; Statistical physics; Mathematics; Physics; Statistics; Algorithm","score_opus":0.17088413144311337,"score_gpt":0.42279479117673335,"score_spread":0.25191065973362,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4406143719","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.073160246,0.0005228165,0.91791874,0.0020793388,0.00010949082,0.00011978013,0.0020826778,0.00057813746,0.0034288354],"genre_scores_gemma":[0.96105194,0.00055852794,0.027073855,0.0001829562,0.00014276609,0.00025560946,0.0012251984,0.00008479214,0.009424464],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9978619,0.0008598501,0.000111573536,0.00056100637,0.0002855495,0.00032015276],"domain_scores_gemma":[0.9819042,0.015097934,0.0011968499,0.0005478232,0.0008920804,0.00036109518],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005672398,0.0012517084,0.0025307455,0.0014167354,0.0006628218,0.00326574,0.003588317,0.003796412,0.006365353],"category_scores_gemma":[0.018437004,0.0013416226,0.0016421808,0.0019424297,0.0017924502,0.0035590408,0.0019327677,0.0037924894,0.0008933325],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015085112,0.00006951155,0.0014851316,0.000064955406,0.000057729634,0.00008564724,0.00010498405,0.9404126,0.0004178166,0.051731467,0.0007760934,0.0046433234],"study_design_scores_gemma":[0.000011401661,0.000011701512,0.00016313687,0.0000046915384,0.000010205423,0.000007188051,0.000005388671,0.98997843,0.000056817255,0.009616396,0.00012584786,0.000008788534],"about_ca_topic_score_codex":0.020500788,"about_ca_topic_score_gemma":0.013113117,"teacher_disagreement_score":0.020500788,"about_ca_system_score_codex":0.0023251437,"about_ca_system_score_gemma":0.0021485435,"threshold_uncertainty_score":0.0407629},"labels":[],"label_agreement":null},{"id":"W4406235423","doi":"10.51594/gjabr.v3i1.66","title":"A collaborative model for data governance: enhancing integration across multi-line businesses","year":2025,"lang":"en","type":"article","venue":"Gulf Journal of Advance Business Research","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"TD Bank Group","funders":"Cisco Systems","keywords":"Corporate governance; Business; Line (geometry); Collaborative governance; Process management; Knowledge management; Computer science; Finance","score_opus":0.417733298033663,"score_gpt":0.5943428410539254,"score_spread":0.17660954302026244,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4406235423","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.025547694,0.042862795,0.7578549,0.03340108,0.0012579665,0.0018171695,0.00028401523,0.0010190033,0.13595536],"genre_scores_gemma":[0.4311144,0.051006004,0.4933065,0.006554141,0.00065473287,0.002334092,0.00091138104,0.00023403062,0.013884661],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9743764,0.015896982,0.0019785576,0.0023060536,0.0045354767,0.0009064511],"domain_scores_gemma":[0.9848394,0.0065436102,0.0019741692,0.0030035183,0.0025678633,0.0010715463],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.021146668,0.00085933984,0.00081794255,0.0038478624,0.0026632713,0.010532768,0.0037028803,0.0035032108,0.0026344638],"category_scores_gemma":[0.022711,0.00063417596,0.0018245226,0.005469555,0.007157294,0.015663598,0.008858179,0.002897511,0.00093024917],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000033630018,0.00012430802,0.0025730252,0.0034421296,0.00018719076,0.0004351141,0.0054201465,0.0074674813,0.0015688125,0.82436603,0.010796965,0.1435851],"study_design_scores_gemma":[0.00008952252,0.00021746372,0.0029516665,0.005612487,0.00028196847,0.00095178926,0.004965767,0.014520214,0.001988132,0.3641868,0.6041187,0.00011555392],"about_ca_topic_score_codex":0.004451244,"about_ca_topic_score_gemma":0.004474797,"teacher_disagreement_score":0.021146668,"about_ca_system_score_codex":0.0060046543,"about_ca_system_score_gemma":0.013955074,"threshold_uncertainty_score":0.1118356},"labels":[],"label_agreement":null},{"id":"W4406435392","doi":"10.1162/99608f92.6f5dfc6f","title":"Data Literacy in Industry: High Time to Focus on Operationalization Through Middle Managers","year":2025,"lang":"en","type":"article","venue":"Harvard Data Science Review","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Dalhousie University","keywords":"Operationalization; Focus (optics); Middle management; Business; Literacy; Psychology; Marketing; Pedagogy","score_opus":0.33414786909287836,"score_gpt":0.49253170853835254,"score_spread":0.15838383944547418,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4406435392","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005490908,0.19239122,0.0057593086,0.7749096,0.005844197,0.00004683624,0.00005870078,0.00006918951,0.015430074],"genre_scores_gemma":[0.2669588,0.24958594,0.012729875,0.43465132,0.016925208,0.00041577063,0.00024145274,0.00030971706,0.018181968],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9768754,0.011960746,0.0014273878,0.0017089332,0.005608947,0.0024186184],"domain_scores_gemma":[0.86007667,0.08586016,0.006521391,0.005824016,0.027848974,0.013868895],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.060479324,0.00038687413,0.0009838102,0.0034603951,0.0030875395,0.012727686,0.002321777,0.005479942,0.006899583],"category_scores_gemma":[0.08397029,0.00050374906,0.0005988291,0.0026679453,0.008284007,0.02298473,0.00886511,0.013044515,0.00184855],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013949943,0.00015616896,0.0041244472,0.004344674,0.000068962516,0.00023252734,0.009593167,0.00025368747,0.0007260648,0.2454442,0.19530165,0.539615],"study_design_scores_gemma":[0.00004230674,0.00015946507,0.005649219,0.008376099,0.000033912624,0.00017616246,0.008478012,0.00025659418,0.00046784364,0.07408214,0.9022263,0.00005179878],"about_ca_topic_score_codex":0.007448986,"about_ca_topic_score_gemma":0.00908864,"teacher_disagreement_score":0.060479324,"about_ca_system_score_codex":0.007583472,"about_ca_system_score_gemma":0.024309337,"threshold_uncertainty_score":0.31984907},"labels":[],"label_agreement":null},{"id":"W4406458491","doi":"10.1109/bigdata62323.2024.10825531","title":"Evaluating Blocking Biases in Entity Matching","year":2024,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Blocking (statistics); Computer science; Matching (statistics); Computer network; Statistics; Mathematics","score_opus":0.6492312296609014,"score_gpt":0.5953427079241184,"score_spread":0.053888521736783046,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4406458491","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.4832194,0.0052720364,0.49869493,0.0015095421,0.00045142375,0.0007248933,0.00080414297,0.0011011979,0.008222488],"genre_scores_gemma":[0.8557535,0.0007116932,0.14082001,0.00039624274,0.00017674675,0.00021413417,0.0007467032,0.00016545491,0.0010154034],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.94729084,0.035224114,0.0028251722,0.005178986,0.007892674,0.0015881988],"domain_scores_gemma":[0.6489184,0.294636,0.016801333,0.025977552,0.011172916,0.0024937943],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0737232,0.0012430204,0.0015364907,0.0023595395,0.0024726512,0.0033442085,0.0023057351,0.0023236764,0.0019996995],"category_scores_gemma":[0.24811584,0.0005018129,0.0009599339,0.0036853992,0.0027799031,0.0075126854,0.005129999,0.0018048674,0.00061299],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.006057251,0.0009370347,0.1308698,0.0014616069,0.001571724,0.00030595192,0.0032804026,0.30889052,0.010069805,0.11417237,0.008839906,0.41354364],"study_design_scores_gemma":[0.0003652179,0.0009885401,0.01673856,0.00030237975,0.0005219599,0.00050666474,0.0011269813,0.80883116,0.022167053,0.13825126,0.010046544,0.0001536479],"about_ca_topic_score_codex":0.0049052895,"about_ca_topic_score_gemma":0.004061609,"teacher_disagreement_score":0.0737232,"about_ca_system_score_codex":0.0027564976,"about_ca_system_score_gemma":0.003994353,"threshold_uncertainty_score":0.3898902},"labels":[],"label_agreement":null},{"id":"W4406521103","doi":"10.1016/s0029-7437(06)71612-3","title":"10.1016/s0029-7437(06)71612-3","year":2000,"lang":"en","type":"article","venue":"Time to knit","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Health records; Psychology; Medicine; Health care; Political science","score_opus":0.06377578750155208,"score_gpt":0.3041293908618411,"score_spread":0.24035360336028902,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4406521103","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00050189457,0.00045172576,0.0013183628,0.000511077,0.00032275982,0.00012790653,0.0010004266,0.0010457548,0.99472],"genre_scores_gemma":[0.00071296893,0.00018957039,0.0006265989,0.00019416756,0.000068901,0.00006569953,0.0005363882,0.0002245914,0.99738103],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99893755,0.00010572981,0.00009480578,0.00033067912,0.00032126807,0.00020995563],"domain_scores_gemma":[0.9960775,0.001247942,0.00025380426,0.0005047819,0.00077017443,0.0011458636],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0019650327,0.0026618468,0.0019622291,0.0032715406,0.002156452,0.0048443633,0.0036377301,0.0055137514,0.98865193],"category_scores_gemma":[0.0027673696,0.0011151928,0.0015392378,0.0038011686,0.0024220773,0.006000802,0.003305137,0.003007521,0.99244225],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002754733,0.00021647113,0.0009921859,0.00062891067,0.000046682664,0.00019929973,0.00012996909,0.0004922814,0.001934761,0.0069235493,0.3075958,0.6805646],"study_design_scores_gemma":[0.00004897609,0.00011498132,0.00081811874,0.0003641693,0.000016687894,0.00025854792,0.00012628829,0.00035240917,0.00042802692,0.00078722707,0.99665904,0.000025539257],"about_ca_topic_score_codex":0.0042478107,"about_ca_topic_score_gemma":0.0031349491,"teacher_disagreement_score":0.011348069,"about_ca_system_score_codex":0.0013067562,"about_ca_system_score_gemma":0.0016728131,"threshold_uncertainty_score":0.016186655},"labels":[],"label_agreement":null},{"id":"W4406547244","doi":"10.1016/s1541-9800(06)70944-9","title":"10.1016/s1541-9800(06)70944-9","year":2000,"lang":"en","type":"article","venue":"Time to knit","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Key (lock); Sense of control; Sense (electronics); Control (management); Computer science; Psychology; Engineering; Computer security; Electrical engineering; Artificial intelligence; Social psychology","score_opus":0.06211475748195413,"score_gpt":0.3016894417369277,"score_spread":0.23957468425497355,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4406547244","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0004947564,0.00041414026,0.0010504774,0.000545961,0.00030265347,0.0001273596,0.0009861491,0.0012127892,0.9948657],"genre_scores_gemma":[0.00063331414,0.00017993842,0.0005789807,0.0002639589,0.00006766714,0.00006272229,0.0005161818,0.00021519735,0.9974821],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9990049,0.000089968096,0.00009267628,0.00031536285,0.00030148836,0.00019565849],"domain_scores_gemma":[0.99631786,0.0010704378,0.0002463437,0.00048191778,0.0007609073,0.0011224288],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0017919298,0.0025986887,0.0016942589,0.002866071,0.002133378,0.0041007004,0.00313442,0.005458951,0.98952484],"category_scores_gemma":[0.0027270634,0.0009789215,0.0014181783,0.0031241118,0.0018031758,0.0060644764,0.0035147704,0.002686388,0.99268544],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027449513,0.00019808946,0.0008864462,0.0004940827,0.000033966957,0.0001812678,0.000101331396,0.00038131356,0.0015743045,0.0045055314,0.31609762,0.6752716],"study_design_scores_gemma":[0.000055508168,0.00011412837,0.00083877804,0.00033887124,0.000016604288,0.00026977382,0.00011707175,0.00027991214,0.0004082482,0.00066852523,0.99686676,0.000025856196],"about_ca_topic_score_codex":0.0039173085,"about_ca_topic_score_gemma":0.0031775301,"teacher_disagreement_score":0.010475159,"about_ca_system_score_codex":0.0011519393,"about_ca_system_score_gemma":0.0013611724,"threshold_uncertainty_score":0.014941454},"labels":[],"label_agreement":null},{"id":"W4406764237","doi":"10.9734/jerr/2025/v27i21391","title":"Continuous Data Quality Improvement in Enterprise Data Governance: A Model for Best Practices and Implementation","year":2025,"lang":"en","type":"article","venue":"Journal of Engineering Research and Reports","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"TD Bank Group","funders":"","keywords":"Data governance; Data quality; Process management; Computer science; Enterprise data management; Best practice; Quality (philosophy); Corporate governance; Quality management; Knowledge management; Business; Enterprise information system; Engineering; Management system; Operations management","score_opus":0.44797708373746586,"score_gpt":0.5894965732693396,"score_spread":0.1415194895318737,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4406764237","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0072229127,0.0060326937,0.65826905,0.25297156,0.0007904091,0.001873942,0.00023898661,0.0006956283,0.0719048],"genre_scores_gemma":[0.24419542,0.0076929266,0.72018754,0.014735202,0.0005693504,0.0047177114,0.00044900502,0.00026864294,0.007184142],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9015213,0.06561561,0.005652955,0.0079695275,0.015585723,0.0036550001],"domain_scores_gemma":[0.9266064,0.036464248,0.006164607,0.010291988,0.015536096,0.0049367067],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.08909798,0.002575728,0.0021225258,0.0072692027,0.0066051413,0.02936769,0.007829905,0.014183155,0.0034446581],"category_scores_gemma":[0.0643578,0.0020327903,0.0032080624,0.0071385764,0.035767052,0.033936422,0.016086044,0.0146489935,0.001694609],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000018460929,0.00013923382,0.0009679091,0.0004378048,0.0000593631,0.00009578686,0.0029684822,0.00567768,0.00022702706,0.96135193,0.0040177167,0.024038564],"study_design_scores_gemma":[0.000075687894,0.00019166822,0.0005277946,0.0017549677,0.000053903117,0.00010032765,0.002303855,0.016342444,0.00042512504,0.9052352,0.07289094,0.00009808724],"about_ca_topic_score_codex":0.015431433,"about_ca_topic_score_gemma":0.009443491,"teacher_disagreement_score":0.08909798,"about_ca_system_score_codex":0.033077184,"about_ca_system_score_gemma":0.049866695,"threshold_uncertainty_score":0.47120076},"labels":[],"label_agreement":null},{"id":"W4407186971","doi":"10.48550/arxiv.2502.02495","title":"The Causal-Effect Score in Data Management","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Econometrics; Psychology; Business; Computer science; Economics","score_opus":0.4129349039886431,"score_gpt":0.4731542193109673,"score_spread":0.06021931532232422,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4407186971","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.019870155,0.0072519104,0.960604,0.0048075905,0.00033696563,0.00024008856,0.000766449,0.000518902,0.005603992],"genre_scores_gemma":[0.6887376,0.005972988,0.29876342,0.0009540143,0.0017479348,0.00065536465,0.0010151033,0.00014431085,0.00200921],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9354187,0.0363049,0.004206669,0.006723097,0.016052473,0.0012941738],"domain_scores_gemma":[0.79718447,0.16247292,0.0129309865,0.014353924,0.010085122,0.0029725616],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.048722744,0.0017603993,0.0020228953,0.012533407,0.0018553046,0.0068450873,0.003178547,0.0041424436,0.004502524],"category_scores_gemma":[0.16466293,0.00079944875,0.0018205323,0.014477241,0.010520411,0.014195255,0.0059454837,0.004468206,0.0006115451],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00019202096,0.00013330099,0.017555222,0.0009875682,0.00052168564,0.00019693244,0.00043709247,0.047887754,0.0006370493,0.81800604,0.003138036,0.11030721],"study_design_scores_gemma":[0.000049641945,0.00014226379,0.0042667356,0.00019009005,0.0001956435,0.00021393709,0.00014214026,0.10024884,0.0013508443,0.88482004,0.008286082,0.000093743205],"about_ca_topic_score_codex":0.0023968266,"about_ca_topic_score_gemma":0.0012303722,"teacher_disagreement_score":0.048722744,"about_ca_system_score_codex":0.004376166,"about_ca_system_score_gemma":0.004063955,"threshold_uncertainty_score":0.25767356},"labels":[],"label_agreement":null},{"id":"W4407189694","doi":"10.23977/jeis.2024.090325","title":"Full-Link Metadata Capability Construction and Practice in Data Governance Platforms","year":2024,"lang":"en","type":"article","venue":"Journal of Electronics and Information Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Metadata; Link (geometry); Corporate governance; Computer science; World Wide Web; Database; Business; Data science; Computer network; Finance","score_opus":0.08966162636159357,"score_gpt":0.40991070344795144,"score_spread":0.32024907708635786,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4407189694","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.13563585,0.0013736276,0.70388484,0.013161804,0.00018678402,0.00060832984,0.00039684752,0.0014373064,0.14331475],"genre_scores_gemma":[0.6999723,0.0008240223,0.2847323,0.0007107852,0.000051814022,0.00042405986,0.0005598386,0.00031043027,0.012414417],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9881272,0.0054703886,0.0011326754,0.0014128062,0.002984029,0.0008727811],"domain_scores_gemma":[0.98073167,0.0078071025,0.0016242904,0.0058184443,0.0027203562,0.0012982418],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.017583398,0.0004967393,0.00032985385,0.0046289754,0.0031850303,0.016336918,0.0021971746,0.0022044363,0.005490496],"category_scores_gemma":[0.028858978,0.00082703785,0.0007454551,0.004209319,0.011601839,0.032372553,0.017077673,0.0028700912,0.0012021626],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00004163533,0.000056867364,0.0031131518,0.00015662085,0.000015121701,0.00028440787,0.0066984724,0.0029344545,0.001397247,0.9294696,0.0019032519,0.053929225],"study_design_scores_gemma":[0.000053349453,0.00015060474,0.0023720616,0.0010915116,0.000031876014,0.0007959131,0.013419508,0.026168691,0.00824823,0.7137783,0.23376009,0.00012988526],"about_ca_topic_score_codex":0.0040678694,"about_ca_topic_score_gemma":0.0035450985,"teacher_disagreement_score":0.017583398,"about_ca_system_score_codex":0.0045470614,"about_ca_system_score_gemma":0.0057629347,"threshold_uncertainty_score":0.092990994},"labels":[],"label_agreement":null},{"id":"W4407328480","doi":"10.2139/ssrn.5129284","title":"Data Portability in financial services: A research note on the progress &amp;amp; debates around Canadian open banking regulation","year":2025,"lang":"en","type":"article","venue":"SSRN Electronic Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Software portability; Business; Financial services; Financial system; Economics; Finance; Computer science; Operating system","score_opus":0.24610564274127691,"score_gpt":0.4883171585682954,"score_spread":0.24221151582701847,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4407328480","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.021855399,0.017848762,0.004874154,0.78705657,0.00174155,0.000060040315,0.00069119956,0.00012533003,0.1657469],"genre_scores_gemma":[0.7500107,0.021630222,0.008467449,0.16025996,0.0036958365,0.00012363297,0.00047006295,0.00033365624,0.05500843],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.8978815,0.017115388,0.0034704567,0.007804597,0.059888538,0.0138395075],"domain_scores_gemma":[0.70235866,0.15512685,0.008520686,0.013575964,0.108366325,0.012051492],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07497351,0.0008595142,0.0016017365,0.010728116,0.026933467,0.05851452,0.0077982927,0.023750678,0.017028851],"category_scores_gemma":[0.17247203,0.0012645936,0.001933259,0.022967432,0.06613085,0.033503752,0.0116006695,0.024252277,0.0010271961],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00004733242,0.000025243331,0.0011749387,0.00015469964,0.00001588534,0.000088653214,0.0048276535,0.00046852528,0.00014236195,0.93231046,0.043112904,0.017631335],"study_design_scores_gemma":[0.00009148563,0.00005796311,0.015645886,0.0022832463,0.00009833771,0.00014853265,0.01665283,0.0029136862,0.0010276343,0.27629715,0.68435735,0.00042588773],"about_ca_topic_score_codex":0.97672176,"about_ca_topic_score_gemma":0.9613918,"teacher_disagreement_score":0.21325243,"about_ca_system_score_codex":0.21325243,"about_ca_system_score_gemma":0.3002671,"threshold_uncertainty_score":0.91251564},"labels":[],"label_agreement":null},{"id":"W4407873161","doi":"10.2139/ssrn.5152241","title":"Context-Aware Entity-Relation Extraction Pipeline for Threat Intelligence Knowledge Graphs","year":2025,"lang":"en","type":"preprint","venue":"SSRN Electronic Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"","keywords":"Pipeline (software); Context (archaeology); Computer science; Relation (database); Knowledge graph; Relationship extraction; Extraction (chemistry); Entity linking; Artificial intelligence; Data science; Knowledge management; Data mining; Knowledge base; Programming language; Geography; Chemistry; Chromatography","score_opus":0.12341697991583002,"score_gpt":0.4437445261267874,"score_spread":0.3203275462109574,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4407873161","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.020750828,0.0022134618,0.84186345,0.0016905455,0.00021976263,0.00080794253,0.03493766,0.089120135,0.008396295],"genre_scores_gemma":[0.15046075,0.0017488562,0.7741491,0.000584588,0.00012624462,0.00031313454,0.06448417,0.002145955,0.005987225],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99912184,0.00010360725,0.000089882924,0.00031297066,0.00029209573,0.00007958023],"domain_scores_gemma":[0.9976439,0.0010419909,0.00018713188,0.00060455495,0.00041128183,0.00011124256],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0010147652,0.0014528967,0.0011885682,0.007154641,0.0012631387,0.0032732126,0.0016639092,0.0015398322,0.010664785],"category_scores_gemma":[0.00697675,0.0007528792,0.0019184576,0.0055692545,0.0003866579,0.003817525,0.002668869,0.0020765578,0.0076254667],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004018477,0.00046822728,0.008266366,0.0019447732,0.00038506347,0.0012215703,0.0010069088,0.015230679,0.02947177,0.026031042,0.11358897,0.8019828],"study_design_scores_gemma":[0.00010412382,0.00026019997,0.015584545,0.000716093,0.0006736521,0.0019556526,0.0012944443,0.5000578,0.0698338,0.16267335,0.2466466,0.00019978496],"about_ca_topic_score_codex":0.007631676,"about_ca_topic_score_gemma":0.015985368,"teacher_disagreement_score":0.010664785,"about_ca_system_score_codex":0.00074907084,"about_ca_system_score_gemma":0.0019976583,"threshold_uncertainty_score":0.035677254},"labels":[],"label_agreement":null},{"id":"W4408326934","doi":"10.1007/s42822-025-00200-0","title":"The Data Resistance: Preserving Data Set Integrity During Federal Purges","year":2025,"lang":"en","type":"article","venue":"Behavior and Social Issues","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Research integrity; Resistance (ecology); Set (abstract data type); Data integrity; Data set; Psychology; Computer science; Computer security; Political science; Public relations; Artificial intelligence; Programming language","score_opus":0.41652782713431913,"score_gpt":0.5290144536975795,"score_spread":0.11248662656326036,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4408326934","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.16874312,0.0019165407,0.41792136,0.33160716,0.0021653895,0.001546472,0.0008823123,0.0037586703,0.071458966],"genre_scores_gemma":[0.8369843,0.0004787609,0.11417745,0.037748706,0.00091836223,0.00076100527,0.00034059587,0.00088500185,0.0077058626],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"qualitative","domain_scores_codex":[0.7455773,0.15116248,0.017589951,0.014657734,0.06133562,0.009676914],"domain_scores_gemma":[0.34475815,0.39633554,0.04219867,0.16787007,0.04127302,0.0075645414],"candidate_categories":["metaresearch","research_integrity"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.19358657,0.0005613872,0.0016205142,0.00407077,0.010466251,0.020984318,0.0058791507,0.0090274215,0.003855067],"category_scores_gemma":[0.50995606,0.0017313913,0.0017655285,0.003666099,0.017838577,0.019779481,0.012103309,0.01881,0.0012554755],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012470146,0.00055305706,0.04523311,0.0008381883,0.0006227615,0.0016025421,0.033865757,0.009950691,0.0060656755,0.5219919,0.089743175,0.28828612],"study_design_scores_gemma":[0.00043919488,0.00064701197,0.025012707,0.0033831887,0.0006915695,0.0023595565,0.017811893,0.059102573,0.0323702,0.55617934,0.30147564,0.00052707654],"about_ca_topic_score_codex":0.016624393,"about_ca_topic_score_gemma":0.010011311,"teacher_disagreement_score":0.9909726,"about_ca_system_score_codex":0.0064739953,"about_ca_system_score_gemma":0.036445156,"threshold_uncertainty_score":0.99445134},"labels":[],"label_agreement":null},{"id":"W4408440538","doi":"10.5194/egusphere-egu25-4596","title":"ContrailBench: evaluating the performance of contrail models","year":2025,"lang":"en","type":"preprint","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Environmental science","score_opus":0.5004050430154415,"score_gpt":0.5058007409941256,"score_spread":0.005395697978684111,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4408440538","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8417223,0.006087169,0.060769178,0.002702109,0.0014190375,0.0009766169,0.04464331,0.031865768,0.009814533],"genre_scores_gemma":[0.7970989,0.0008418988,0.10102487,0.0011712185,0.0003533552,0.0004263196,0.09511131,0.0011665768,0.0028056337],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9960751,0.0010868454,0.00047645546,0.0013127247,0.0007619431,0.00028681173],"domain_scores_gemma":[0.9888931,0.0062904395,0.000961274,0.001790547,0.0015269851,0.0005377089],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009798397,0.0044484665,0.0013048428,0.0035183593,0.0010051285,0.0023973796,0.004184262,0.0036214774,0.0020809576],"category_scores_gemma":[0.01385377,0.0007265564,0.0024456182,0.0015049988,0.0012795165,0.0035033438,0.002026415,0.0027187169,0.001402111],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011337472,0.001008898,0.05680461,0.0005936271,0.0012096805,0.0001868963,0.00015682512,0.86096823,0.0024207537,0.0013772941,0.021184646,0.052954864],"study_design_scores_gemma":[0.00008290666,0.0003738949,0.004653559,0.000039271872,0.00006285258,0.000065569555,0.00007718403,0.98879516,0.002607709,0.0009594246,0.0022335963,0.00004882381],"about_ca_topic_score_codex":0.044608843,"about_ca_topic_score_gemma":0.03461586,"teacher_disagreement_score":0.044608843,"about_ca_system_score_codex":0.0024319885,"about_ca_system_score_gemma":0.0018591655,"threshold_uncertainty_score":0.08869839},"labels":[],"label_agreement":null},{"id":"W4408609818","doi":"10.63485/9qejk-7xc91","title":"Data management in Canada: new toolkit","year":2010,"lang":"en","type":"preprint","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Computer science; Data science","score_opus":0.4513939880500616,"score_gpt":0.4526671682149107,"score_spread":0.0012731801648491192,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4408609818","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010989553,0.017381772,0.24820712,0.18992004,0.0022824833,0.004354333,0.13055979,0.076816015,0.31948885],"genre_scores_gemma":[0.06393989,0.02927431,0.61906147,0.015017968,0.00086454273,0.0035877607,0.08496178,0.011001747,0.17229053],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.97443795,0.003539126,0.0029819687,0.0015738953,0.0150785055,0.0023884613],"domain_scores_gemma":[0.8827521,0.01352213,0.0025816942,0.012436398,0.07313518,0.015572498],"candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.027287371,0.0012138317,0.0011737372,0.011179486,0.008053264,0.01280883,0.0049865455,0.0031259866,0.020315006],"category_scores_gemma":[0.05084443,0.002038785,0.0013453022,0.02567598,0.0039356183,0.0096138455,0.009643388,0.00433309,0.009640411],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000089936766,0.00008410752,0.003965864,0.00063158415,0.000036703965,0.00019911163,0.0019814093,0.0013206115,0.0009326983,0.029428037,0.78716516,0.17416485],"study_design_scores_gemma":[0.00003372407,0.000010151677,0.0051145293,0.00047902347,0.000020377076,0.00008320029,0.00073473,0.0014117414,0.0004882164,0.0053632027,0.98617077,0.00009043942],"about_ca_topic_score_codex":0.9691794,"about_ca_topic_score_gemma":0.97083503,"teacher_disagreement_score":0.9950135,"about_ca_system_score_codex":0.06893814,"about_ca_system_score_gemma":0.35195962,"threshold_uncertainty_score":0.5001836},"labels":[],"label_agreement":null},{"id":"W4408662976","doi":"10.31581/jbs-35.1-2.588(2025)","title":"Identity Trap","year":2025,"lang":"en","type":"article","venue":"The Journal of Bahá’í Studies","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Trap (plumbing); Identity (music); Art; Physics; Aesthetics","score_opus":0.4131826001841808,"score_gpt":0.5609315567244447,"score_spread":0.14774895654026393,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4408662976","genre_codex":"review","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0008220833,0.78895676,0.0027379913,0.15593691,0.015794246,0.00002641071,0.00016383566,0.00006398348,0.035497777],"genre_scores_gemma":[0.05907802,0.7515521,0.0033866882,0.08635013,0.023516743,0.00013284461,0.0005656527,0.00032048684,0.075097345],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99526155,0.0022836323,0.00027866245,0.0004773306,0.001347617,0.00035115852],"domain_scores_gemma":[0.9904745,0.0043189917,0.00049947656,0.00055330066,0.003645312,0.00050841743],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00814426,0.0005852632,0.0008391724,0.0030855748,0.0027840077,0.0066285636,0.0016665063,0.0028274497,0.011641834],"category_scores_gemma":[0.020240491,0.00033270163,0.0005353193,0.0033644869,0.007049115,0.010697583,0.0034065961,0.0052536307,0.0057345624],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000033874683,0.000012808229,0.00020726887,0.0011007194,0.000018137656,0.00011694687,0.0028783677,0.00008964277,0.00011231343,0.17621619,0.66261464,0.15659907],"study_design_scores_gemma":[0.0000023221016,0.0000056150375,0.00018384919,0.00080938323,0.0000042970732,0.00012544364,0.000793193,0.00002774469,0.00005848962,0.0110080475,0.9869745,0.0000071040527],"about_ca_topic_score_codex":0.013224982,"about_ca_topic_score_gemma":0.012521239,"teacher_disagreement_score":0.013224982,"about_ca_system_score_codex":0.005785351,"about_ca_system_score_gemma":0.00798784,"threshold_uncertainty_score":0.04307145},"labels":[],"label_agreement":null},{"id":"W4408721644","doi":"10.63485/damx6-p4264","title":"Update on Canada&amp;#39;s Data Liberation Initiative","year":2009,"lang":"en","type":"preprint","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Liberation; Political science; Public administration; Chemistry; Biochemistry","score_opus":0.5931167707934143,"score_gpt":0.48504576277155675,"score_spread":0.10807100802185754,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4408721644","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0025741206,0.035263043,0.004497743,0.21868737,0.037300985,0.0011848998,0.3721347,0.0092836255,0.3190735],"genre_scores_gemma":[0.023531022,0.03661067,0.02590966,0.12296316,0.0071712197,0.0015876669,0.3079754,0.0042635654,0.46998763],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.974327,0.000922691,0.0015692809,0.0009976306,0.01955844,0.0026249199],"domain_scores_gemma":[0.87983847,0.007691598,0.002787874,0.004631844,0.09438134,0.010668882],"candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.021474304,0.0019426505,0.0018867644,0.015704984,0.0052415533,0.01532552,0.0076225153,0.008769823,0.05033922],"category_scores_gemma":[0.05145339,0.0013523645,0.0017527004,0.024420556,0.0031623575,0.007940071,0.005540743,0.00848274,0.026280226],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000013238096,0.0000122352185,0.00019600018,0.00006914873,0.0000037365592,0.000017157678,0.000038922288,0.000054260352,0.000028941004,0.0017531324,0.9919791,0.0058341855],"study_design_scores_gemma":[0.0000091826305,0.000003854169,0.0017309944,0.00017344106,0.000006135728,0.000013577481,0.000062212974,0.000031836276,0.00005550323,0.00027981543,0.997614,0.000019412912],"about_ca_topic_score_codex":0.9443706,"about_ca_topic_score_gemma":0.95581794,"teacher_disagreement_score":0.99237746,"about_ca_system_score_codex":0.056455202,"about_ca_system_score_gemma":0.20095809,"threshold_uncertainty_score":0.40961307},"labels":[],"label_agreement":null},{"id":"W4408795074","doi":"10.1109/swc62898.2024.00311","title":"Overcoming the Data Availability Paradox with Managed Digital Twin Instances","year":2024,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Saskatchewan","funders":"","keywords":"Computer science","score_opus":0.22848979999639593,"score_gpt":0.40554132399452325,"score_spread":0.17705152399812732,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4408795074","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.47986656,0.00047090853,0.5024738,0.0025855117,0.0002231412,0.0005951391,0.00027568982,0.0019738725,0.011535285],"genre_scores_gemma":[0.82865703,0.0001459369,0.16943257,0.00014957461,0.00005919478,0.00011326721,0.00022902394,0.00008793591,0.0011255839],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9948777,0.0017389072,0.00051419134,0.0006713816,0.0015974246,0.00060030096],"domain_scores_gemma":[0.9838864,0.0035794727,0.0015418439,0.008045216,0.0013883577,0.0015586102],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008752853,0.00034215316,0.0006158498,0.0007700352,0.0014886601,0.004963835,0.0034997,0.00090915215,0.0013705114],"category_scores_gemma":[0.017529666,0.0003938836,0.0005017471,0.0014732154,0.0019188832,0.008825263,0.0075822626,0.0019283877,0.00022187857],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017795534,0.0011716988,0.03705731,0.000327435,0.0002539954,0.0014055164,0.0032039552,0.20272896,0.029892558,0.37111267,0.011200877,0.3398655],"study_design_scores_gemma":[0.00021580773,0.0005672528,0.0038810123,0.000059617316,0.000080725324,0.00094402995,0.0015010386,0.8507338,0.014391807,0.09269672,0.034851883,0.00007630605],"about_ca_topic_score_codex":0.0031766393,"about_ca_topic_score_gemma":0.0023743142,"teacher_disagreement_score":0.008752853,"about_ca_system_score_codex":0.001424275,"about_ca_system_score_gemma":0.0024739795,"threshold_uncertainty_score":0.04629004},"labels":[],"label_agreement":null},{"id":"W4409166166","doi":"10.1007/978-3-031-88720-8_38","title":"Advancing Query Performance Prediction: Challenges and Adaptive Solutions","year":2025,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Computer science; Query optimization; Information retrieval; Artificial intelligence","score_opus":0.10141723586476338,"score_gpt":0.3252785790447352,"score_spread":0.22386134317997186,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4409166166","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.029083276,0.025558282,0.8948225,0.029091239,0.0009850104,0.00015627022,0.0011305078,0.005493079,0.013679877],"genre_scores_gemma":[0.581592,0.016698401,0.38409555,0.003357375,0.003893472,0.00019511186,0.002017637,0.000805511,0.007344905],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9954586,0.0012272961,0.00026373763,0.00092398433,0.0017565113,0.00036988413],"domain_scores_gemma":[0.975276,0.015165573,0.0011809816,0.003461832,0.0042850324,0.00063056545],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009969394,0.0017184697,0.002808875,0.001656481,0.0007191251,0.006181658,0.00517833,0.0024180894,0.0031064395],"category_scores_gemma":[0.032983165,0.0007781947,0.0006656151,0.0038746842,0.0011018898,0.008483799,0.002636937,0.005816418,0.002407521],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022894255,0.00045212844,0.009068567,0.000417579,0.00012664491,0.00006305149,0.0002476791,0.06428298,0.0039457707,0.029562997,0.049261615,0.84234196],"study_design_scores_gemma":[0.000031624,0.00011637521,0.002298284,0.000155037,0.0000592586,0.00010102824,0.00028726744,0.8597494,0.0027987699,0.12101665,0.013323577,0.000062857776],"about_ca_topic_score_codex":0.0067784614,"about_ca_topic_score_gemma":0.004713989,"teacher_disagreement_score":0.009969394,"about_ca_system_score_codex":0.0013144015,"about_ca_system_score_gemma":0.0018262637,"threshold_uncertainty_score":0.052723825},"labels":[],"label_agreement":null},{"id":"W4409203171","doi":"10.1002/cem.70025","title":"Data Quality: Importance of the ‘before analysis’ domain (Theory of Sampling, TOS)","year":2025,"lang":"en","type":"article","venue":"Journal of Chemometrics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Sampling (signal processing); Quality (philosophy); Domain (mathematical analysis); Statistics; Mathematics; Computer science; Philosophy; Mathematical analysis; Epistemology","score_opus":0.3448048197220179,"score_gpt":0.4975400213069517,"score_spread":0.1527352015849338,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4409203171","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012160005,0.010782294,0.9068371,0.054910347,0.0027462419,0.0008135345,0.0007243565,0.00060785096,0.010418123],"genre_scores_gemma":[0.27224666,0.009349802,0.689455,0.018617496,0.005108481,0.0019132457,0.00084724283,0.0006156298,0.0018465644],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.7478144,0.15624568,0.019040266,0.016053392,0.059077892,0.0017683975],"domain_scores_gemma":[0.32289982,0.55772847,0.02418469,0.04972361,0.043400012,0.0020634013],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.22074713,0.0011305565,0.00337881,0.004208704,0.0027167238,0.0138277095,0.0042661577,0.0047253314,0.0025292966],"category_scores_gemma":[0.48716143,0.0012249314,0.0019449345,0.004565561,0.024928864,0.014521454,0.008052277,0.011782817,0.0008524907],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00038122892,0.00013319496,0.017245576,0.0048120874,0.0006517734,0.00034198407,0.005091732,0.014550251,0.0022231191,0.6647265,0.014585188,0.2752573],"study_design_scores_gemma":[0.00012767708,0.00044537205,0.008602646,0.0036050514,0.00020726427,0.0007849085,0.0020729126,0.029682428,0.004956972,0.8706357,0.07861673,0.00026236713],"about_ca_topic_score_codex":0.0055764653,"about_ca_topic_score_gemma":0.002778682,"teacher_disagreement_score":0.22074713,"about_ca_system_score_codex":0.008628158,"about_ca_system_score_gemma":0.014216157,"threshold_uncertainty_score":0.9609575},"labels":[],"label_agreement":null},{"id":"W4409229080","doi":"10.1007/s12599-025-00939-1","title":"Mapping Uncharted Territory","year":2025,"lang":"en","type":"article","venue":"Business & Information Systems Engineering","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Geography; Computer science","score_opus":0.046976017032913334,"score_gpt":0.2987515658446621,"score_spread":0.2517755488117488,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4409229080","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.22666647,0.0064906417,0.34050056,0.007149749,0.0006248433,0.00023145149,0.0037646864,0.0015554085,0.41301617],"genre_scores_gemma":[0.8979284,0.0023258934,0.074233495,0.0003829383,0.00009910121,0.00016851253,0.0015125182,0.0006838023,0.022665227],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9982987,0.0005019131,0.000056877427,0.000500693,0.00039756653,0.00024427674],"domain_scores_gemma":[0.9975804,0.00081930816,0.00011205745,0.0009952127,0.0002794135,0.00021356264],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012726948,0.00048430267,0.0007001971,0.005555691,0.003576127,0.0076700333,0.0017909084,0.0011979059,0.022132313],"category_scores_gemma":[0.0060725412,0.00045778765,0.0006349479,0.0066710357,0.007914555,0.011110644,0.0064805555,0.0012859673,0.0028320234],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002222905,0.000065050524,0.012234399,0.00053201744,0.000211585,0.0007717478,0.007013625,0.01086563,0.0046387212,0.751315,0.00904352,0.2030865],"study_design_scores_gemma":[0.00001853868,0.00005922462,0.012000646,0.00048442138,0.000098322926,0.00062557904,0.014694378,0.01508647,0.0020826838,0.6895883,0.26518816,0.00007335834],"about_ca_topic_score_codex":0.014170261,"about_ca_topic_score_gemma":0.027488,"teacher_disagreement_score":0.022132313,"about_ca_system_score_codex":0.0018474199,"about_ca_system_score_gemma":0.0028677734,"threshold_uncertainty_score":0.074039936},"labels":[],"label_agreement":null},{"id":"W4409568128","doi":"10.63485/s8mt9-9h186","title":"Praise for Manitoba&amp;#39;s open data policy","year":2006,"lang":"en","type":"preprint","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Praise; Economics; Political science; Psychology; Social psychology","score_opus":0.767664678275732,"score_gpt":0.5955268116328487,"score_spread":0.17213786664288333,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4409568128","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0014165738,0.0015598295,0.00067901023,0.9665646,0.005391526,0.000043316733,0.0007945357,0.00021164522,0.023338998],"genre_scores_gemma":[0.032060314,0.0023910666,0.0058348305,0.7228848,0.0024576155,0.00017018056,0.0011383683,0.0004151694,0.2326476],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.975545,0.0034908177,0.0010268164,0.0028247999,0.013139597,0.0039730207],"domain_scores_gemma":[0.8723981,0.033646993,0.0025933099,0.013659418,0.05114412,0.026558165],"candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.035919726,0.0007770134,0.0011532728,0.0019246049,0.016683804,0.021054685,0.005465287,0.02467071,0.03677075],"category_scores_gemma":[0.08742802,0.0010217091,0.0011656116,0.0045099705,0.015805036,0.011558225,0.008048698,0.0264196,0.00907676],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000046436686,0.000041208714,0.0010500904,0.00005076537,0.000017855673,0.00016105424,0.0014711563,0.00011262349,0.00029717255,0.06583721,0.9235269,0.0073876115],"study_design_scores_gemma":[0.00002470076,0.000012982491,0.0017861171,0.00019448748,0.000010545817,0.000044053275,0.0012910696,0.00020653821,0.00021681815,0.008439258,0.9877225,0.000050938517],"about_ca_topic_score_codex":0.81974775,"about_ca_topic_score_gemma":0.8642221,"teacher_disagreement_score":0.99453473,"about_ca_system_score_codex":0.041154176,"about_ca_system_score_gemma":0.21711567,"threshold_uncertainty_score":0.36262757},"labels":[],"label_agreement":null},{"id":"W4409625226","doi":"10.1007/978-3-031-85908-3_42","title":"A Health Records Kiosk, Using an Ontology-Based Information Architecture","year":2025,"lang":"en","type":"book-chapter","venue":"Communications in computer and information science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria","funders":"","keywords":"Interactive kiosk; Ontology; Computer science; Information retrieval; Architecture; World Wide Web; Geography; Archaeology; Philosophy","score_opus":0.20991404066395322,"score_gpt":0.44267862084468507,"score_spread":0.23276458018073184,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4409625226","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006526012,0.0006187369,0.92082983,0.004983789,0.00046690283,0.00043881376,0.0013864237,0.011726004,0.053023405],"genre_scores_gemma":[0.05583803,0.0017717312,0.8579909,0.0013523388,0.00015277932,0.00027727944,0.004133333,0.0025191023,0.075964496],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9985814,0.00025792522,0.000192994,0.00022557865,0.00064425427,0.00009787609],"domain_scores_gemma":[0.99849844,0.00058354274,0.000067264875,0.0003290273,0.00032696998,0.00019477497],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0033742432,0.00051979267,0.00054905907,0.0025265024,0.0019372487,0.008117623,0.001703732,0.0015300127,0.010782817],"category_scores_gemma":[0.004133697,0.00078802253,0.0010983585,0.0029533429,0.0014431216,0.010035528,0.0036041185,0.0027970138,0.004331837],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021521297,0.00025648883,0.0018339078,0.0006772917,0.00013820657,0.00079103076,0.004493362,0.0060415505,0.016703887,0.44840196,0.088470034,0.43197706],"study_design_scores_gemma":[0.000066119894,0.000109526816,0.0017388089,0.00044814992,0.00017568089,0.001154555,0.0014264093,0.05449347,0.012561917,0.1491031,0.7785897,0.00013256259],"about_ca_topic_score_codex":0.010866946,"about_ca_topic_score_gemma":0.012990517,"teacher_disagreement_score":0.010866946,"about_ca_system_score_codex":0.0017636141,"about_ca_system_score_gemma":0.003979912,"threshold_uncertainty_score":0.036072075},"labels":[],"label_agreement":null},{"id":"W4409671330","doi":"10.1145/3696410.3714701","title":"MixedSAND: Semantic Annotation of Mixed-unit Numeric Data","year":2025,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Annotation; Natural language processing; Unit (ring theory); Information retrieval; Semantic annotation; Artificial intelligence; Mathematics","score_opus":0.3282300458693544,"score_gpt":0.491568531296563,"score_spread":0.16333848542720864,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4409671330","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.030565923,0.0008577437,0.8550687,0.0014093188,0.0003372441,0.0005734303,0.047734313,0.05269708,0.010756142],"genre_scores_gemma":[0.10823135,0.0005147113,0.8094949,0.00066131476,0.00007790331,0.0004403151,0.07304957,0.0030289905,0.00450093],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9965237,0.00072408974,0.0004047526,0.0010446091,0.0011431993,0.00015969841],"domain_scores_gemma":[0.99050796,0.0037574843,0.00076226005,0.0031695778,0.0015253192,0.00027729874],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0032295773,0.0015406257,0.0009628843,0.0061073545,0.0014217346,0.0035825812,0.0026089994,0.0017399191,0.006472299],"category_scores_gemma":[0.016552463,0.0006867766,0.0014758251,0.006890098,0.001240965,0.007344471,0.0053116158,0.0020028222,0.0031332774],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011316392,0.00044443217,0.021495908,0.0039469684,0.00038270123,0.0015635956,0.0057212287,0.02271555,0.034849454,0.08706314,0.20510612,0.61557925],"study_design_scores_gemma":[0.00010424117,0.00019323759,0.009738905,0.0008874597,0.00025198702,0.0015084324,0.0038431403,0.28110796,0.06037303,0.122276835,0.5194798,0.00023491199],"about_ca_topic_score_codex":0.009156284,"about_ca_topic_score_gemma":0.018940693,"teacher_disagreement_score":0.009156284,"about_ca_system_score_codex":0.0014950038,"about_ca_system_score_gemma":0.0029474124,"threshold_uncertainty_score":0.021651983},"labels":[],"label_agreement":null},{"id":"W4410049805","doi":"10.1177/0282423x251329407","title":"Linking Trade Data from Different National Statistical Offices Through a Private Set Intersection","year":2025,"lang":"en","type":"article","venue":"Journal of Official Statistics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Statistics Canada","funders":"","keywords":"Intersection (aeronautics); Set (abstract data type); Data set; Statistics; Probability and statistics; Geography; Computer science; Business; Mathematics; Cartography","score_opus":0.31712642016439646,"score_gpt":0.4808368688614867,"score_spread":0.16371044869709023,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4410049805","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1275072,0.00034156657,0.7905199,0.0040178713,0.00032579456,0.0028294257,0.04425477,0.0043154457,0.02588803],"genre_scores_gemma":[0.4689258,0.0003287531,0.462646,0.0007911277,0.00029843408,0.004550614,0.054575164,0.00055505475,0.0073290644],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.92651963,0.03465412,0.010879645,0.009170667,0.0163324,0.00244347],"domain_scores_gemma":[0.7532022,0.085626625,0.035927914,0.100229934,0.0226385,0.002374739],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06381571,0.00076423737,0.0012626788,0.008144453,0.0021921897,0.006489262,0.003635693,0.00233268,0.008032682],"category_scores_gemma":[0.16493948,0.0014663517,0.0014912338,0.019893257,0.0021859726,0.007227041,0.010444579,0.0031928942,0.0028620346],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0018593332,0.00095531275,0.27501145,0.0009601526,0.0012505386,0.00041308237,0.006129081,0.040639374,0.0039997315,0.2138402,0.044000756,0.41094097],"study_design_scores_gemma":[0.00092836557,0.0013308823,0.11571549,0.00083903037,0.001036591,0.0009913385,0.0045548887,0.24059267,0.045785107,0.2891346,0.29858708,0.0005039483],"about_ca_topic_score_codex":0.0056917896,"about_ca_topic_score_gemma":0.0037364566,"teacher_disagreement_score":0.06381571,"about_ca_system_score_codex":0.0032446678,"about_ca_system_score_gemma":0.010714572,"threshold_uncertainty_score":0.33749378},"labels":[],"label_agreement":null},{"id":"W4410115952","doi":"10.1109/emr.2025.3567192","title":"Understanding and Deobfuscating Textual Data: Managerial Insights and Computational Challenges","year":2025,"lang":"en","type":"article","venue":"IEEE Engineering Management Review","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Lethbridge","funders":"","keywords":"Business; Data science; Computer science; Industrial organization; Knowledge management; Management science; Process management; Econometrics; Economics","score_opus":0.35076183764403557,"score_gpt":0.3984480790666918,"score_spread":0.047686241422656206,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4410115952","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.032342996,0.008790903,0.89201605,0.05779238,0.00026763682,0.00029298686,0.0003737926,0.0006988768,0.007424511],"genre_scores_gemma":[0.27788585,0.008269833,0.70819145,0.0024881794,0.00070437795,0.00030301753,0.00045442465,0.00020050432,0.0015023397],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9599808,0.02660686,0.001743521,0.0023327284,0.0086244065,0.00071173045],"domain_scores_gemma":[0.72593856,0.22256206,0.011312228,0.025057001,0.014111981,0.0010181656],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04737583,0.0009288489,0.0011314992,0.0047165044,0.0017757169,0.008894827,0.0028885496,0.0023019635,0.0020972807],"category_scores_gemma":[0.16224784,0.0007797668,0.00086514064,0.0037370175,0.007107541,0.018578194,0.0042070635,0.0041776192,0.0011221819],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022197576,0.00014351556,0.008114102,0.0015593709,0.00015302363,0.0002447158,0.0027846433,0.029529149,0.0056892545,0.17855978,0.008969009,0.76403147],"study_design_scores_gemma":[0.000057874684,0.00022437457,0.0055034086,0.0015899511,0.00011375642,0.001012931,0.006405976,0.18382159,0.018569447,0.6938006,0.08871799,0.00018206397],"about_ca_topic_score_codex":0.002511382,"about_ca_topic_score_gemma":0.003035944,"teacher_disagreement_score":0.04737583,"about_ca_system_score_codex":0.0022633367,"about_ca_system_score_gemma":0.0039720964,"threshold_uncertainty_score":0.25055033},"labels":[],"label_agreement":null},{"id":"W4410337211","doi":"10.64000/86zpj-dma63","title":"Event Data as Underlying Altmetrics Infrastructure at the 4:AM Altmetrics Conference","year":2017,"lang":"en","type":"preprint","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Altmetrics; Event (particle physics); Data science; Event data; Computer science; Social media; World Wide Web; Physics","score_opus":0.6714085820491087,"score_gpt":0.5432828328911826,"score_spread":0.12812574915792607,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4410337211","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":"evaluation","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":"evaluation","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.040993914,0.0055775116,0.40760624,0.17790698,0.02065619,0.0010595795,0.09826593,0.056464747,0.19146898],"genre_scores_gemma":[0.40077776,0.005077718,0.30353343,0.00902825,0.007936466,0.0006748058,0.12800762,0.019176133,0.12578781],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9859081,0.0033987395,0.0004999953,0.0012443549,0.008102297,0.00084662094],"domain_scores_gemma":[0.9622147,0.00670059,0.0012469033,0.009286197,0.015843658,0.0047079143],"candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.027700454,0.0010215592,0.0008861505,0.003515495,0.002175612,0.014909066,0.0021737309,0.0025111206,0.029412953],"category_scores_gemma":[0.039659813,0.0010293404,0.0010037577,0.0072079515,0.0022318498,0.009137934,0.0063338988,0.0062717297,0.0124136275],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00040308345,0.00011678816,0.009604713,0.00018328345,0.000106906045,0.00013104363,0.0010371809,0.0073938225,0.0023055607,0.06664249,0.797647,0.1144281],"study_design_scores_gemma":[0.00005310221,0.00006114335,0.006597711,0.00019552854,0.000030516841,0.000045812736,0.00062380946,0.017044077,0.002813516,0.03555641,0.93689036,0.00008798818],"about_ca_topic_score_codex":0.032073125,"about_ca_topic_score_gemma":0.041706346,"teacher_disagreement_score":0.9964845,"about_ca_system_score_codex":0.0053621233,"about_ca_system_score_gemma":0.0074355137,"threshold_uncertainty_score":0.14649576},"labels":[],"label_agreement":null},{"id":"W4410414373","doi":"10.1038/s41597-025-05052-2","title":"A collection of FAIR Dutch Freedom of Information Act documents","year":2025,"lang":"en","type":"article","venue":"Scientific Data","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Nederlandse Organisatie voor Wetenschappelijk Onderzoek; Canadian Institute of Steel Construction","keywords":"Metadata; Computer science; World Wide Web; Standardization; Information retrieval; Publishing; Quality (philosophy); Process (computing); Metadata repository; Political science","score_opus":0.1328692685136867,"score_gpt":0.42210031862309055,"score_spread":0.28923105010940386,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4410414373","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0043773693,0.00023770038,0.0011635562,0.00026483854,0.000101741025,0.00018340125,0.9843998,0.0004049011,0.008866701],"genre_scores_gemma":[0.00531531,0.00018458356,0.0022532218,0.000054641325,0.000021764188,0.0004984001,0.9857837,0.00025624203,0.0056322254],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99171364,0.0012396637,0.0013635041,0.0010170628,0.0041375146,0.00052864477],"domain_scores_gemma":[0.9771513,0.00662474,0.0031258056,0.0052089435,0.0067623826,0.0011270202],"candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.004790827,0.000829575,0.00093473855,0.012307914,0.0018993159,0.0050106766,0.0013811587,0.0011919831,0.032767683],"category_scores_gemma":[0.028553205,0.00083104626,0.00069099374,0.024245428,0.0011976041,0.0027672101,0.0023464833,0.0017044093,0.027644433],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017979724,0.00014193864,0.0052599935,0.0012054639,0.00003604432,0.00021658378,0.0010879757,0.0008530551,0.0010038447,0.0062648635,0.9512949,0.032455597],"study_design_scores_gemma":[0.00004421579,0.000015692842,0.012837346,0.0003618097,0.000011580163,0.00008491986,0.000656674,0.0005364601,0.0010652464,0.0020030942,0.9823278,0.00005513423],"about_ca_topic_score_codex":0.07337004,"about_ca_topic_score_gemma":0.07836478,"teacher_disagreement_score":0.99861884,"about_ca_system_score_codex":0.0043734577,"about_ca_system_score_gemma":0.0098669985,"threshold_uncertainty_score":0.14588594},"labels":[],"label_agreement":null},{"id":"W4410447735","doi":"10.3233/shti250479","title":"Applying AI to Support Categorization of Heterogeneous Epidemiological Datasets","year":2025,"lang":"en","type":"article","venue":"Studies in health technology and informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University Health Centre","funders":"Deutsche Forschungsgemeinschaft","keywords":"Computer science; Metadata; Annotation; Interoperability; World Wide Web; Information retrieval; Controlled vocabulary; Categorization; Data curation; Context (archaeology); Data science; Artificial intelligence","score_opus":0.24803698980544267,"score_gpt":0.5283460737041448,"score_spread":0.2803090838987021,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4410447735","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02716581,0.0012761868,0.93748957,0.0020769776,0.00031595657,0.0013014182,0.005598301,0.019606037,0.0051697297],"genre_scores_gemma":[0.11729729,0.0005163137,0.8570922,0.00064316305,0.00021912988,0.001016638,0.019986419,0.0005128941,0.0027159175],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98912907,0.0034501823,0.0021494436,0.0023810652,0.0025378088,0.00035233816],"domain_scores_gemma":[0.96026224,0.027191108,0.0018968248,0.0037343695,0.0062261787,0.00068930496],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013026136,0.0017552016,0.0013813792,0.018298304,0.0022042885,0.0048896032,0.0031581752,0.0018313237,0.002752013],"category_scores_gemma":[0.039409112,0.0004717422,0.0023913486,0.0109920995,0.0011149978,0.0054595307,0.003357831,0.0020161988,0.0022534858],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00046335143,0.00057164184,0.018803746,0.0018316209,0.00048216144,0.00071542646,0.0027919603,0.020167612,0.016809626,0.015850905,0.021190226,0.9003217],"study_design_scores_gemma":[0.00011694203,0.00021330883,0.01150389,0.0005601853,0.00041785793,0.00055183214,0.0028924872,0.7473791,0.028535835,0.1175321,0.09014,0.0001564999],"about_ca_topic_score_codex":0.017290061,"about_ca_topic_score_gemma":0.01678904,"teacher_disagreement_score":0.018298304,"about_ca_system_score_codex":0.0032932735,"about_ca_system_score_gemma":0.0040000575,"threshold_uncertainty_score":0.06888962},"labels":[],"label_agreement":null},{"id":"W4410491654","doi":"10.2139/ssrn.5260351","title":"Toward Sustainable Data Governance in Refugee and Immigrant Serving Sector in Canada","year":2025,"lang":"en","type":"article","venue":"SSRN Electronic Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Refugee; Immigration; Corporate governance; Political science; Economic growth; Public administration; Business; Economics; Law; Finance","score_opus":0.04917905298851862,"score_gpt":0.3308357864920949,"score_spread":0.2816567335035763,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4410491654","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7747081,0.001803034,0.004825369,0.15361427,0.00016410548,0.0004759576,0.0009910102,0.00014048659,0.06327775],"genre_scores_gemma":[0.97580075,0.00074832456,0.003960219,0.003954053,0.000016673757,0.000055334687,0.00027310426,0.000030824336,0.015160758],"study_design_codex":"observational","study_design_gemma":"not_applicable","domain_scores_codex":[0.9907218,0.0018131282,0.00033473657,0.00051646266,0.002073084,0.0045408686],"domain_scores_gemma":[0.9614053,0.0044523207,0.0023176195,0.0012439543,0.014807939,0.015772907],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010809186,0.00015049908,0.00023903871,0.0019346129,0.012634439,0.016052358,0.0021959601,0.0017787718,0.004358368],"category_scores_gemma":[0.024036476,0.0003142917,0.00031874076,0.0050709858,0.005466363,0.002981227,0.006821086,0.002950891,0.00039255506],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022471944,0.00043814405,0.45035672,0.00038220963,0.00009579666,0.0018094286,0.06617793,0.0057887575,0.0026012717,0.2276389,0.06982332,0.17466281],"study_design_scores_gemma":[0.00006213322,0.000131318,0.30277595,0.0009887257,0.000055622182,0.0002783626,0.37458897,0.008969258,0.0014324753,0.02312147,0.2874322,0.00016353415],"about_ca_topic_score_codex":0.982588,"about_ca_topic_score_gemma":0.9916162,"teacher_disagreement_score":0.099936716,"about_ca_system_score_codex":0.099936716,"about_ca_system_score_gemma":0.39876708,"threshold_uncertainty_score":0.72509503},"labels":[],"label_agreement":null},{"id":"W4410636879","doi":"10.1145/3701716.3715600","title":"WebTableX: Efficiently Discovering Web Table Transformations Through Sampling","year":2025,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Natural Sciences and Engineering Research Council of Canada; Universitas Brawijaya","keywords":"Computer science; Table (database); Information retrieval; Sampling (signal processing); Data mining; World Wide Web; Data science","score_opus":0.17787192899621215,"score_gpt":0.4464159695996306,"score_spread":0.2685440406034184,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4410636879","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10802923,0.0018718238,0.779433,0.0008013234,0.0002384041,0.0008979575,0.035520278,0.07057532,0.0026326652],"genre_scores_gemma":[0.18304317,0.00038998402,0.7391594,0.00019804105,0.00009739192,0.0005343561,0.07344598,0.0013556334,0.0017760289],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99800724,0.00032904235,0.0001866517,0.00066621776,0.00068387284,0.00012705279],"domain_scores_gemma":[0.9951969,0.0024762722,0.00033300676,0.0013639053,0.00045552108,0.00017442375],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0017732836,0.0014498885,0.0011503728,0.003147641,0.0007448501,0.0024383038,0.0023703848,0.0010035043,0.0028513898],"category_scores_gemma":[0.009907882,0.00062100444,0.0016381588,0.0038592971,0.0005729625,0.0031050486,0.0020151217,0.0012099423,0.0022142606],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009490824,0.0006356273,0.05696341,0.0013773306,0.00062800304,0.0006897396,0.0011509476,0.06930581,0.027026,0.010136412,0.086794615,0.744343],"study_design_scores_gemma":[0.00020370878,0.00015058307,0.0070558535,0.000062519655,0.00008484107,0.00060353463,0.0006070099,0.92982996,0.019470219,0.018926844,0.02294966,0.00005520156],"about_ca_topic_score_codex":0.0070486744,"about_ca_topic_score_gemma":0.0161723,"teacher_disagreement_score":0.0070486744,"about_ca_system_score_codex":0.000634816,"about_ca_system_score_gemma":0.0021452315,"threshold_uncertainty_score":0.014015257},"labels":[],"label_agreement":null},{"id":"W4411089189","doi":"10.1067/j.cpradiol.2025.06.004","title":"Data governance in radiology Part I: Overview of data management approaches to radiology","year":2025,"lang":"en","type":"review","venue":"Current Problems in Diagnostic Radiology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Medicine; Radiology; Interventional radiology; Medical physics; Corporate governance; Management","score_opus":0.7829499519654881,"score_gpt":0.5159219243327299,"score_spread":0.26702802763275824,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4411089189","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000034332596,0.99769175,0.00030485692,0.0012603177,0.00021894366,0.00000748081,0.000010588914,0.0000044278518,0.0004673396],"genre_scores_gemma":[0.00043398785,0.9975223,0.00064750883,0.00076941925,0.00048246564,0.000011899384,0.000016454602,0.0000019307543,0.00011399157],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99668294,0.0012620119,0.00063984946,0.00034938243,0.00088926265,0.00017653107],"domain_scores_gemma":[0.98386127,0.011940389,0.0016931964,0.00031168142,0.0018176956,0.0003757484],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.007710189,0.0011306319,0.002212101,0.007659312,0.0006347371,0.0045189667,0.0017157675,0.0028494152,0.0032839272],"category_scores_gemma":[0.0116036935,0.00073997304,0.0012347719,0.013276705,0.0027775564,0.006486745,0.0019846465,0.0038985612,0.0011067073],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000058834044,0.0001086706,0.00050899026,0.06646525,0.00021047652,0.00011034076,0.00024315134,0.0009859893,0.00043325216,0.039340053,0.04450471,0.8470302],"study_design_scores_gemma":[0.000024774006,0.00010402729,0.0019676115,0.06639677,0.0002600671,0.00051569636,0.00028809655,0.00047930924,0.00027177867,0.016981147,0.91265875,0.00005202776],"about_ca_topic_score_codex":0.0065151094,"about_ca_topic_score_gemma":0.00938088,"teacher_disagreement_score":0.9922898,"about_ca_system_score_codex":0.0050921207,"about_ca_system_score_gemma":0.009963423,"threshold_uncertainty_score":0.040775836},"labels":[],"label_agreement":null},{"id":"W4411112895","doi":"10.18653/v1/2025.findings-naacl.104","title":"Can’t Hide Behind the API: Stealing Black-Box Commercial Embedding Models","year":2025,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada; Compute Canada","keywords":"Computer science; Embedding; Black box; Computer security; Artificial intelligence","score_opus":0.21380671454932942,"score_gpt":0.4509011484647079,"score_spread":0.2370944339153785,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4411112895","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.21738876,0.0016619904,0.75375706,0.0032503007,0.0004087362,0.0003240253,0.0016825297,0.015374594,0.0061520254],"genre_scores_gemma":[0.7017302,0.0005880794,0.28320408,0.0011976045,0.00018003117,0.00029255767,0.0048958017,0.0013670264,0.0065447656],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99682486,0.0017479083,0.00021916689,0.0005064853,0.00050237513,0.00019927796],"domain_scores_gemma":[0.97920644,0.012338238,0.00072602235,0.0062634484,0.0011477855,0.00031801107],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007435059,0.0015266655,0.0009939423,0.0011749795,0.0004999311,0.0024184207,0.0024063773,0.001753358,0.004476562],"category_scores_gemma":[0.03773772,0.00066657236,0.001287539,0.0011182432,0.001198298,0.007972261,0.003317338,0.0033917364,0.0038110656],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0016168836,0.00091595965,0.012139932,0.0007142089,0.00043036457,0.00043232163,0.001002287,0.2906479,0.008822011,0.024307907,0.037294142,0.62167615],"study_design_scores_gemma":[0.0000621263,0.00019939546,0.00040608665,0.00004602745,0.000031604108,0.00010022725,0.00012456032,0.9749219,0.0043937946,0.015612715,0.0040701465,0.000031477262],"about_ca_topic_score_codex":0.0043798154,"about_ca_topic_score_gemma":0.0064868247,"teacher_disagreement_score":0.007435059,"about_ca_system_score_codex":0.00089279213,"about_ca_system_score_gemma":0.0009910072,"threshold_uncertainty_score":0.039320767},"labels":[],"label_agreement":null},{"id":"W4411141791","doi":"10.1145/3725253","title":"Towards Practical FPRAS for #NFA: Exploiting the Power of Dependence","year":2025,"lang":"en","type":"article","venue":"Proceedings of the ACM on Management of Data","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Power (physics); Physics; Thermodynamics","score_opus":0.3512875317024356,"score_gpt":0.4853916397535502,"score_spread":0.1341041080511146,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4411141791","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.026570925,0.00043647786,0.95760036,0.001382251,0.00007257985,0.00024057632,0.00025032254,0.0100359805,0.003410481],"genre_scores_gemma":[0.23455168,0.0003020953,0.7591935,0.0007360288,0.00012444258,0.00033326994,0.00061633927,0.0008630748,0.0032796308],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98931575,0.0034018399,0.0008179074,0.002321109,0.0030241096,0.0011192975],"domain_scores_gemma":[0.9381166,0.03765275,0.0031706544,0.016504332,0.0036855254,0.00087008387],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0076191407,0.0018040496,0.0021235207,0.0019464114,0.0015433759,0.0040607317,0.0049127336,0.002449607,0.005085383],"category_scores_gemma":[0.034828827,0.0014146798,0.003339996,0.0022316107,0.0038487858,0.012280659,0.004895981,0.005551391,0.0024395601],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011749472,0.0005070941,0.0064784354,0.00089874497,0.0002158488,0.0002841472,0.000770773,0.13623938,0.020528832,0.1559456,0.017653495,0.65930265],"study_design_scores_gemma":[0.00009375368,0.00015197885,0.00038278304,0.00010595313,0.00007005306,0.0002331257,0.00011957294,0.82470614,0.011158048,0.15550104,0.0074143703,0.00006310589],"about_ca_topic_score_codex":0.007882884,"about_ca_topic_score_gemma":0.01059101,"teacher_disagreement_score":0.007882884,"about_ca_system_score_codex":0.004026576,"about_ca_system_score_gemma":0.0066928673,"threshold_uncertainty_score":0.04029435},"labels":[],"label_agreement":null},{"id":"W4411293798","doi":"10.12927/cjnl.2025.27614","title":"Data, Advocacy and Policy: A Powerful Trio for Change","year":2025,"lang":"en","type":"article","venue":"Nursing leadership","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"Nova Scotia Health Authority","funders":"","keywords":"Nursing; Political science; Psychology; Politics; Public relations; Sociology; Medicine; Law","score_opus":0.7680123390100543,"score_gpt":0.5207524097233138,"score_spread":0.24725992928674045,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4411293798","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00015510808,0.002217353,0.0020215288,0.9883277,0.0048621884,0.000017903936,0.000011880164,0.000033414588,0.0023529099],"genre_scores_gemma":[0.054320775,0.009498859,0.01631209,0.88193005,0.030428974,0.00036148468,0.00007076341,0.0003582395,0.0067188772],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.80995595,0.11290903,0.010082112,0.012402131,0.041460507,0.013190256],"domain_scores_gemma":[0.5124156,0.3683099,0.010481777,0.021470167,0.03506082,0.05226176],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.24693738,0.0017952644,0.0044896207,0.0075998898,0.027918078,0.06837897,0.010616588,0.0785194,0.01741038],"category_scores_gemma":[0.2529497,0.0023800896,0.0033367136,0.0053939275,0.09242485,0.09424284,0.044707015,0.10580772,0.0044926247],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00005694092,0.00013479349,0.00071798556,0.0006228461,0.00011631,0.00052098697,0.0069683124,0.00028901093,0.00020599726,0.54338807,0.40245458,0.044524126],"study_design_scores_gemma":[0.00005996929,0.00006548596,0.00033026296,0.0018599913,0.00003699558,0.00044084497,0.013866658,0.0005740232,0.000120040364,0.43439943,0.54810214,0.00014416347],"about_ca_topic_score_codex":0.004723386,"about_ca_topic_score_gemma":0.005676568,"teacher_disagreement_score":0.24693738,"about_ca_system_score_codex":0.018970475,"about_ca_system_score_gemma":0.06905123,"threshold_uncertainty_score":0.9286603},"labels":[],"label_agreement":null},{"id":"W4411374296","doi":"10.1145/3722212.3724424","title":"The Case for Collaboration","year":2025,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Computer science","score_opus":0.18128650685032327,"score_gpt":0.5089256116388177,"score_spread":0.3276391047884944,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4411374296","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000897533,0.0045174677,0.0032050144,0.9115699,0.0095249405,0.000030885316,0.00015964528,0.00018646703,0.06990815],"genre_scores_gemma":[0.110843524,0.009051414,0.007428985,0.7245111,0.015911506,0.00032973074,0.000636284,0.0008767908,0.13041061],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9354827,0.033685666,0.0019135975,0.0073796194,0.010182995,0.011355381],"domain_scores_gemma":[0.8063866,0.04762933,0.0076449397,0.02628902,0.023500822,0.08854941],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.061691944,0.0009836452,0.0012186407,0.0017944939,0.009631532,0.027547127,0.0048799794,0.020370672,0.11870727],"category_scores_gemma":[0.11983539,0.00057548593,0.0013609353,0.002535151,0.0146411015,0.04733526,0.030644296,0.032078195,0.033443213],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000059461574,0.000053298874,0.000784705,0.00016862915,0.000027459648,0.00027491723,0.0019601083,0.000078334335,0.000074152085,0.32520294,0.6312051,0.04011091],"study_design_scores_gemma":[0.000020211068,0.00001975318,0.00028418945,0.00059476617,0.0000060692905,0.00023454096,0.0028532294,0.000063137704,0.000038067774,0.08193762,0.9139217,0.000026622516],"about_ca_topic_score_codex":0.0073898686,"about_ca_topic_score_gemma":0.006738186,"teacher_disagreement_score":0.11870727,"about_ca_system_score_codex":0.00707402,"about_ca_system_score_gemma":0.031111676,"threshold_uncertainty_score":0.39711535},"labels":[],"label_agreement":null},{"id":"W4411382438","doi":"10.33424/futurum590","title":"What are the effects of data portability?","year":2025,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Software portability; Computer science; Programming language","score_opus":0.21319316130303845,"score_gpt":0.47206465608300674,"score_spread":0.2588714947799683,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4411382438","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1320198,0.048826814,0.0129896505,0.6279966,0.0038019365,0.0003887847,0.0015693185,0.0003862526,0.1720208],"genre_scores_gemma":[0.9082366,0.024626406,0.0070346445,0.042522825,0.003929524,0.00023411296,0.00040920524,0.00028877848,0.0127177825],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.95430154,0.030200742,0.0017501333,0.002005648,0.009265863,0.0024760852],"domain_scores_gemma":[0.64961195,0.2630993,0.027541116,0.011520769,0.03575676,0.012470028],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.034594815,0.00079803687,0.0008245611,0.0032600516,0.0028442985,0.012766451,0.0021192844,0.0043157637,0.021284318],"category_scores_gemma":[0.15841648,0.000572255,0.002161895,0.0046322257,0.009475741,0.022475222,0.0041659595,0.005924427,0.0031446947],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009837912,0.0017069294,0.26034755,0.0026231292,0.0010634884,0.0012689385,0.0048800227,0.0054031303,0.0016296973,0.15793078,0.074781574,0.48738095],"study_design_scores_gemma":[0.00030064397,0.0012673294,0.34465575,0.006984538,0.0009539314,0.0027651428,0.03785937,0.005397629,0.006402973,0.32858106,0.2642551,0.0005764748],"about_ca_topic_score_codex":0.011486623,"about_ca_topic_score_gemma":0.0077395067,"teacher_disagreement_score":0.034594815,"about_ca_system_score_codex":0.005061888,"about_ca_system_score_gemma":0.0049168915,"threshold_uncertainty_score":0.18295705},"labels":[],"label_agreement":null},{"id":"W4411404655","doi":"10.1017/9781009403092.005","title":"Data Handling","year":2025,"lang":"en","type":"book-chapter","venue":"Cambridge University Press eBooks","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Business","score_opus":0.24372387040875457,"score_gpt":0.34079947961563667,"score_spread":0.0970756092068821,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4411404655","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005338777,0.0032014016,0.5319536,0.017393237,0.0060979114,0.032743387,0.12733404,0.032881018,0.24305663],"genre_scores_gemma":[0.01770731,0.0041379076,0.6244612,0.007953238,0.0016511986,0.041622836,0.0790068,0.01884067,0.20461892],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9670699,0.013024471,0.0058672028,0.0041917493,0.009047221,0.00079939776],"domain_scores_gemma":[0.84596294,0.06812477,0.0055199172,0.037113387,0.0406657,0.002613282],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05247503,0.0014042732,0.0026454472,0.006956759,0.0025339515,0.008335388,0.0040062726,0.0014845817,0.15769576],"category_scores_gemma":[0.17638524,0.0011863692,0.0012666561,0.008666312,0.0018818384,0.004653687,0.004937988,0.0042778915,0.10286854],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00028981722,0.00007768225,0.0010222787,0.002359432,0.00004244823,0.00026776807,0.0036576805,0.00036367364,0.0020060402,0.028991163,0.620784,0.3401381],"study_design_scores_gemma":[0.000030302235,0.00003106435,0.0006487467,0.001045617,0.00001663713,0.00014922082,0.00068469247,0.00047247583,0.0013747353,0.009254603,0.986254,0.0000378623],"about_ca_topic_score_codex":0.0024089988,"about_ca_topic_score_gemma":0.0018282519,"teacher_disagreement_score":0.15769576,"about_ca_system_score_codex":0.0025871966,"about_ca_system_score_gemma":0.009879734,"threshold_uncertainty_score":0.52754486},"labels":[],"label_agreement":null},{"id":"W4411992116","doi":"10.1016/j.socscimed.2025.118370","title":"Challenges in data documentation and retrieval in the ASHA diary from a usability perspective","year":2025,"lang":"en","type":"article","venue":"Social Science & Medicine","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Providence Health Care","keywords":"Usability; Asha; Documentation; Perspective (graphical); Computer science; World Wide Web; Library science; Linguistics; Human–computer interaction; Artificial intelligence","score_opus":0.30746827408695215,"score_gpt":0.5199861204509014,"score_spread":0.21251784636394927,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4411992116","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.16822788,0.027119594,0.54971254,0.18649313,0.0024715746,0.0028178496,0.0024278483,0.0042720432,0.056457564],"genre_scores_gemma":[0.53030473,0.008537434,0.43819654,0.008162754,0.0012978452,0.0015208399,0.0018763299,0.0013305991,0.008772899],"study_design_codex":"design_other","study_design_gemma":"qualitative","domain_scores_codex":[0.8228433,0.116676524,0.019333255,0.004799735,0.03314165,0.0032054917],"domain_scores_gemma":[0.40342858,0.44468033,0.014669846,0.053446572,0.07901782,0.0047568325],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.17072071,0.00077344757,0.0022797058,0.0070132166,0.004186039,0.027972896,0.0053541134,0.0042129788,0.0035892888],"category_scores_gemma":[0.4002961,0.001410351,0.0013610162,0.0068757306,0.0058762445,0.02205603,0.0067494954,0.004762707,0.0024164177],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007037118,0.0011596462,0.025966862,0.007968942,0.00033861978,0.00094813603,0.061076872,0.0040581166,0.0076490897,0.06757161,0.06098229,0.7615761],"study_design_scores_gemma":[0.00033404987,0.0015772366,0.027346509,0.013636983,0.0005689754,0.0048751943,0.16837369,0.054224882,0.023260403,0.18896179,0.5159673,0.000873027],"about_ca_topic_score_codex":0.0128499735,"about_ca_topic_score_gemma":0.009890403,"teacher_disagreement_score":0.8292793,"about_ca_system_score_codex":0.0043988284,"about_ca_system_score_gemma":0.013005939,"threshold_uncertainty_score":0.9028682},"labels":[],"label_agreement":null},{"id":"W4412017881","doi":"10.1177/23328584251352814","title":"Data Deidentification for Data Sharing in Education and Psychological Research: Importance, Barriers, and Techniques","year":2025,"lang":"en","type":"article","venue":"AERA Open","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"Canada Excellence Research Chairs, Government of Canada; Eunice Kennedy Shriver National Institute of Child Health and Human Development; Office of Special Education Programs, Office of Special Education and Rehabilitative Services","keywords":"Psychology; Data sharing; Applied psychology; Medicine","score_opus":0.8329394390274139,"score_gpt":0.6719423566313527,"score_spread":0.16099708239606114,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4412017881","genre_codex":"methods","genre_gemma":"methods","domain_codex":"methods","domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01638436,0.008975896,0.8341309,0.10852883,0.0038505662,0.005265143,0.00090368435,0.0009960423,0.0209647],"genre_scores_gemma":[0.21747704,0.0054123146,0.73760116,0.0149982255,0.003048864,0.01599152,0.0007123672,0.00092889287,0.0038296634],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.19016519,0.6991874,0.043120164,0.01641452,0.048230305,0.0028824178],"domain_scores_gemma":[0.07625436,0.6893801,0.037756667,0.15864141,0.03501413,0.0029533384],"candidate_categories":["metaresearch","open_science"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.61360174,0.0017812134,0.0032739968,0.010962555,0.012813032,0.024748608,0.0091692805,0.005932034,0.008165064],"category_scores_gemma":[0.82450736,0.0025147984,0.0036996223,0.016895385,0.0319167,0.030935403,0.031362925,0.014299505,0.0030423976],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00065174943,0.00023467198,0.0140251145,0.0065695834,0.0007381627,0.0005767375,0.085118555,0.0016825085,0.0016032584,0.41185346,0.026833367,0.45011288],"study_design_scores_gemma":[0.00025781535,0.0002645628,0.005460276,0.012998787,0.0003628393,0.0015219713,0.032298997,0.006756328,0.0047217812,0.7153331,0.21957226,0.0004513147],"about_ca_topic_score_codex":0.0034960667,"about_ca_topic_score_gemma":0.0028510129,"teacher_disagreement_score":0.9908307,"about_ca_system_score_codex":0.008998806,"about_ca_system_score_gemma":0.03322365,"threshold_uncertainty_score":0.4764979},"labels":[],"label_agreement":null},{"id":"W4412402624","doi":"10.1145/3749116.3749124","title":"Reminiscences on Influential Papers","year":2025,"lang":"en","type":"article","venue":"ACM SIGMOD Record","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Library science; Computer science","score_opus":0.12901287901589728,"score_gpt":0.439895915516474,"score_spread":0.3108830365005767,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4412402624","genre_codex":"editorial","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0005165441,0.027086008,0.0005240776,0.26941237,0.68992203,0.000024578112,0.00034772418,0.00015776634,0.012008882],"genre_scores_gemma":[0.010675368,0.028647874,0.000665988,0.20398211,0.6858434,0.00010590806,0.0005440365,0.00074754684,0.06878771],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9866274,0.0028050735,0.00089343486,0.001874378,0.006215362,0.0015843437],"domain_scores_gemma":[0.9427771,0.014986353,0.003229316,0.0035339943,0.02289605,0.0125771165],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.014682682,0.002185228,0.0015420105,0.0074329693,0.0071141804,0.020329736,0.0036204983,0.009311438,0.028519727],"category_scores_gemma":[0.07773223,0.0007191594,0.0024038178,0.008096801,0.0030637705,0.011638043,0.0070827105,0.020955391,0.023077236],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00001775556,0.000012773846,0.000089454814,0.00011065427,0.000016844617,0.0001281919,0.00027884988,0.000019810459,0.00005320147,0.0024559407,0.98920166,0.0076147295],"study_design_scores_gemma":[0.0000076681345,0.000007810088,0.00012856002,0.00021145913,0.00001362817,0.000116782605,0.00032607635,0.000017444981,0.000070746435,0.0015700468,0.99751544,0.0000143580755],"about_ca_topic_score_codex":0.0018161469,"about_ca_topic_score_gemma":0.003478072,"teacher_disagreement_score":0.028519727,"about_ca_system_score_codex":0.0056923,"about_ca_system_score_gemma":0.004240258,"threshold_uncertainty_score":0.09540796},"labels":[],"label_agreement":null},{"id":"W4412805152","doi":"10.1016/j.ijmedinf.2025.106045","title":"Privacy-by-design: Case studies in interactive record linkage using a hybrid human-computer system","year":2025,"lang":"en","type":"article","venue":"International Journal of Medical Informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Alberta Health Services","funders":"National Center for Advancing Translational Sciences; National Institute of Arthritis and Musculoskeletal and Skin Diseases; National Institutes of Health; Patient-Centered Outcomes Research Institute","keywords":"Computer science; Record linkage; Linkage (software); Human–computer interaction; Gene; Medicine; Genetics; Biology","score_opus":0.24725292966649737,"score_gpt":0.5161682721501035,"score_spread":0.26891534248360616,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4412805152","genre_codex":"methods","genre_gemma":"empirical","domain_codex":"methods","domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.26983005,0.0033288214,0.6913452,0.010309061,0.00037722735,0.01191879,0.0003553598,0.000816353,0.011719055],"genre_scores_gemma":[0.54277956,0.0005759406,0.44783956,0.0015443314,0.0001339485,0.0061718496,0.00011397447,0.00012377005,0.000717],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.24236436,0.720323,0.011244854,0.008752542,0.015536629,0.0017785835],"domain_scores_gemma":[0.24775612,0.6679304,0.030275723,0.040268373,0.01194191,0.0018274285],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.4216024,0.001109372,0.001220626,0.0040926947,0.0050887205,0.008777038,0.005528153,0.006986208,0.0030812407],"category_scores_gemma":[0.4857252,0.0017238936,0.0018022482,0.004074236,0.010080247,0.009833393,0.009855662,0.002345587,0.000724173],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00646762,0.0028665669,0.20009618,0.01364701,0.001726368,0.016751943,0.16464365,0.021247065,0.0076356973,0.091852546,0.0116429655,0.4614224],"study_design_scores_gemma":[0.0065462324,0.024678536,0.08071729,0.01610653,0.0023482293,0.0578168,0.11298021,0.18935803,0.07118934,0.2573386,0.17959301,0.0013271616],"about_ca_topic_score_codex":0.0015522165,"about_ca_topic_score_gemma":0.0023705775,"teacher_disagreement_score":0.4216024,"about_ca_system_score_codex":0.0056542167,"about_ca_system_score_gemma":0.0077232136,"threshold_uncertainty_score":0.7132672},"labels":[],"label_agreement":null},{"id":"W4412984254","doi":"10.1016/j.jss.2025.112584","title":"Data catalog tools: A systematic multivocal literature review","year":2025,"lang":"en","type":"article","venue":"Journal of Systems and Software","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Technische Universiteit Eindhoven; Government of Canada; NXP Semiconductors","keywords":"Computer science; Library science; Information retrieval; Data science","score_opus":0.19432335379260254,"score_gpt":0.42949110579059563,"score_spread":0.23516775199799309,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4412984254","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0030016124,0.9871449,0.0023570834,0.0026841243,0.00047843464,0.00071579585,0.0011766236,0.00006719235,0.0023742805],"genre_scores_gemma":[0.020201053,0.9663073,0.007765174,0.0023472332,0.00022228359,0.0011140561,0.0015214625,0.000052824984,0.00046874443],"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","domain_scores_codex":[0.98250544,0.005233296,0.006275633,0.0012234631,0.004222701,0.00053949584],"domain_scores_gemma":[0.85055155,0.107648134,0.010709896,0.0031632225,0.026314005,0.0016131996],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.025115887,0.0013443455,0.0032851633,0.07447744,0.002179711,0.005669083,0.0030400627,0.0027885523,0.0055517964],"category_scores_gemma":[0.1037743,0.0013749852,0.003446191,0.049120586,0.0020631626,0.010379748,0.0045844405,0.0020443616,0.0011872184],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017388871,0.00010612,0.0031948143,0.6120951,0.0014346881,0.00044750044,0.0028938632,0.00032686203,0.0008527316,0.00533467,0.01885104,0.35428867],"study_design_scores_gemma":[0.00004162128,0.0001263519,0.0033547776,0.85079104,0.004204164,0.00059702777,0.0027687107,0.0001994201,0.00039421668,0.0023308515,0.13513157,0.000060370967],"about_ca_topic_score_codex":0.00775717,"about_ca_topic_score_gemma":0.025440073,"teacher_disagreement_score":0.9748841,"about_ca_system_score_codex":0.006289216,"about_ca_system_score_gemma":0.035900418,"threshold_uncertainty_score":0.1328271},"labels":[],"label_agreement":null},{"id":"W4413392074","doi":"10.2196/63544","title":"Medical Science Data Value Evaluation Model: Mixed Methods Study","year":2025,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Weighting; Computer science; Data mining; Entropy (arrow of time); Data set; Data science; Information retrieval; Medicine; Artificial intelligence","score_opus":0.3897749305494763,"score_gpt":0.6237581904605167,"score_spread":0.2339832599110404,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4413392074","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"evaluation","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"evaluation","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.45332432,0.005874865,0.48793405,0.0018243953,0.00077273895,0.036068168,0.0031997233,0.0005322477,0.010469546],"genre_scores_gemma":[0.6720063,0.0018135855,0.26160303,0.0006683411,0.0002555716,0.05839615,0.0012089105,0.000093153896,0.0039549572],"study_design_codex":"observational","study_design_gemma":"qualitative","domain_scores_codex":[0.85268086,0.12659742,0.0047697043,0.0064434777,0.0072397892,0.0022688396],"domain_scores_gemma":[0.73004544,0.2420112,0.011159467,0.005417171,0.00999773,0.001369068],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.11483005,0.003476144,0.0051888414,0.008010664,0.0023715622,0.0068125925,0.0055223317,0.0033699519,0.015665589],"category_scores_gemma":[0.1522691,0.0016558801,0.011903979,0.0073821214,0.0024068684,0.005474763,0.0032549424,0.0035783842,0.0013967183],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.012575003,0.011588118,0.37062055,0.018631143,0.03141695,0.0020378104,0.014660428,0.09927087,0.0016772763,0.11560466,0.009279855,0.31263727],"study_design_scores_gemma":[0.001978078,0.012360647,0.045263708,0.0040004426,0.008486381,0.000644065,0.010031144,0.87085634,0.0020954034,0.03508386,0.008759638,0.0004403132],"about_ca_topic_score_codex":0.0055852463,"about_ca_topic_score_gemma":0.0025373986,"teacher_disagreement_score":0.88517,"about_ca_system_score_codex":0.005693803,"about_ca_system_score_gemma":0.0055733044,"threshold_uncertainty_score":0.6072866},"labels":[],"label_agreement":null},{"id":"W4413443076","doi":"10.1109/mitp.2025.3561079","title":"Data-as-an-Asset: Challenges and Future Directions","year":2025,"lang":"en","type":"article","venue":"IT Professional","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université TÉLUQ","funders":"","keywords":"Computer science; Asset (computer security); Asset management; Business; Knowledge management; Data science; Risk analysis (engineering); Computer security; Finance","score_opus":0.3049530404859407,"score_gpt":0.5156489578308201,"score_spread":0.2106959173448794,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4413443076","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0071526854,0.08819272,0.051379737,0.81792337,0.0030823313,0.00009897136,0.00023925924,0.00020783317,0.031723052],"genre_scores_gemma":[0.32058948,0.3115094,0.2675626,0.07230204,0.008867165,0.00041733685,0.00071958004,0.00028687614,0.017745554],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.98856944,0.005977272,0.0006327419,0.0008831856,0.003224592,0.00071268145],"domain_scores_gemma":[0.94031125,0.037456498,0.0023055647,0.002896322,0.011162946,0.0058674384],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.029102394,0.0006948291,0.0009328439,0.0022905313,0.0032154846,0.015711693,0.0033757123,0.008270808,0.007794485],"category_scores_gemma":[0.024197998,0.00052031263,0.0006714602,0.0046214527,0.008951528,0.032703567,0.006042958,0.008606153,0.0026876812],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000048651207,0.00020545958,0.0023697878,0.0011924186,0.000023273351,0.0001941031,0.00094248814,0.0029102347,0.0004621135,0.667735,0.05350387,0.27041265],"study_design_scores_gemma":[0.00001624828,0.00012602488,0.0007884695,0.0023447322,0.000016468759,0.00041711805,0.011553794,0.010184992,0.0005047694,0.5232589,0.45070454,0.00008389168],"about_ca_topic_score_codex":0.005737736,"about_ca_topic_score_gemma":0.0058249226,"teacher_disagreement_score":0.029102394,"about_ca_system_score_codex":0.00460927,"about_ca_system_score_gemma":0.013398584,"threshold_uncertainty_score":0.15391004},"labels":[],"label_agreement":null},{"id":"W4414004064","doi":"10.14778/3749646.3749702","title":"ThriftLLM: On Cost-Effective Selection of Large Language Models for Classification Queries","year":2025,"lang":"en","type":"article","venue":"Proceedings of the VLDB Endowment","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Selection (genetic algorithm); Computer science; Natural language processing; Artificial intelligence; Information retrieval","score_opus":0.09834815259862227,"score_gpt":0.4145340017749151,"score_spread":0.31618584917629283,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4414004064","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.061506424,0.0015982151,0.9186172,0.002612154,0.0001478318,0.0006784962,0.0010196805,0.010402101,0.0034179704],"genre_scores_gemma":[0.47299284,0.0005788163,0.5124458,0.0020082432,0.00037877177,0.0008683321,0.0048030014,0.0012832688,0.0046408447],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9942926,0.0018681596,0.00036383167,0.0010866482,0.0015834753,0.0008052532],"domain_scores_gemma":[0.9835699,0.012198033,0.00073612906,0.0018809317,0.0010425373,0.0005724457],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0065317727,0.0030163815,0.003507783,0.0019121425,0.0016166731,0.003047073,0.004863843,0.0030646943,0.004626693],"category_scores_gemma":[0.023223119,0.0010981101,0.0027608671,0.0028073138,0.0012318897,0.0053878557,0.0050296877,0.0042795637,0.0019465078],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00090184726,0.0008895669,0.0063492768,0.00037846432,0.00025222727,0.00045609602,0.00052074966,0.54396915,0.0044403602,0.018705614,0.034252908,0.38888365],"study_design_scores_gemma":[0.00004192943,0.000049267932,0.00011997075,0.000006909867,0.00001790088,0.000055114666,0.000048889793,0.98972356,0.0004979025,0.008776002,0.00065439934,0.000008099775],"about_ca_topic_score_codex":0.012571327,"about_ca_topic_score_gemma":0.016893066,"teacher_disagreement_score":0.012571327,"about_ca_system_score_codex":0.0036158192,"about_ca_system_score_gemma":0.004265406,"threshold_uncertainty_score":0.034543753},"labels":[],"label_agreement":null},{"id":"W4414227274","doi":"10.18438/eblip30802","title":"Why Are Data so Important to Library Development Today? Implications for Practice","year":2025,"lang":"en","type":"article","venue":"Evidence Based Library and Information Practice","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Collection development; Development (topology); Information system; Academic library","score_opus":0.13139444587271806,"score_gpt":0.41559967024133077,"score_spread":0.28420522436861273,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4414227274","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0007450881,0.038981475,0.0016015673,0.9512087,0.0037622857,0.00007439212,0.00019435823,0.00003515322,0.0033968776],"genre_scores_gemma":[0.11557736,0.29685664,0.0425195,0.5285642,0.01035965,0.001471262,0.0006408878,0.00029601293,0.003714433],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.7810869,0.13725993,0.03024651,0.0067496616,0.041083,0.0035740267],"domain_scores_gemma":[0.18045677,0.68424374,0.027354619,0.012852243,0.08358553,0.011507164],"candidate_categories":["metaresearch","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.19866392,0.0009736991,0.002466042,0.00574529,0.0050233775,0.018400976,0.004734443,0.012484865,0.01447086],"category_scores_gemma":[0.6463606,0.0011021185,0.0016483574,0.011465543,0.01939287,0.031491607,0.009285679,0.01807868,0.0044906866],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00032824345,0.00015658131,0.006403291,0.019924955,0.0002425482,0.0005487793,0.015321985,0.00054229953,0.0002372484,0.042780153,0.35828608,0.5552279],"study_design_scores_gemma":[0.00024130508,0.00019779582,0.0076314844,0.1480014,0.0003626919,0.0011909376,0.052647706,0.00076600024,0.00058454974,0.28661498,0.5013784,0.00038278283],"about_ca_topic_score_codex":0.018841118,"about_ca_topic_score_gemma":0.037845597,"teacher_disagreement_score":0.98159903,"about_ca_system_score_codex":0.01836049,"about_ca_system_score_gemma":0.07195599,"threshold_uncertainty_score":0.98819005},"labels":[],"label_agreement":null},{"id":"W4414244142","doi":"10.2218/ijdc.v19i1.906","title":"A Maturity Model for Urban Dataset Metadata","year":2025,"lang":"en","type":"article","venue":"International Journal of Digital Curation","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Metadata; Documentation; Maturity (psychological); Capability Maturity Model; Relevance (law); Graph; Plug-in; Software","score_opus":0.2141903317703833,"score_gpt":0.4785366575588719,"score_spread":0.2643463257884886,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4414244142","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017438417,0.0007568238,0.9599884,0.0042834855,0.0000644489,0.00059152464,0.0013116717,0.0019380363,0.013627175],"genre_scores_gemma":[0.19511037,0.001021553,0.79428893,0.00047816982,0.00006879315,0.0007883452,0.003855264,0.0004341861,0.0039544124],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.982928,0.005135658,0.00299552,0.0021499717,0.0057992884,0.0009915336],"domain_scores_gemma":[0.94434124,0.020838825,0.0050009456,0.007562802,0.020177975,0.002078222],"candidate_categories":["metaresearch","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.028517082,0.00081159873,0.0006909743,0.010577598,0.002313699,0.01020194,0.0027783914,0.0026092762,0.0025282863],"category_scores_gemma":[0.06403367,0.0011665424,0.0018511553,0.0074308305,0.0023575511,0.0210342,0.006388663,0.0033672475,0.0016577803],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013786304,0.0001681555,0.01403142,0.00062073854,0.000078739504,0.0003941592,0.0041475394,0.02038023,0.0035959438,0.8237921,0.008001392,0.12465174],"study_design_scores_gemma":[0.000050798306,0.00026940482,0.0054978495,0.0012713464,0.00013430354,0.0011714291,0.00305983,0.20907888,0.007819428,0.6039662,0.16743112,0.0002494773],"about_ca_topic_score_codex":0.011070807,"about_ca_topic_score_gemma":0.009774327,"teacher_disagreement_score":0.98979807,"about_ca_system_score_codex":0.007207024,"about_ca_system_score_gemma":0.008259223,"threshold_uncertainty_score":0.15081453},"labels":[],"label_agreement":null},{"id":"W4414313280","doi":"10.25300/misq/2025/18361","title":"Understanding and Improving Data Repurposing","year":2025,"lang":"en","type":"article","venue":"MIS Quarterly","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Repurposing; Scope (computer science); Drug repositioning; Big data; Data modeling; Reuse; Frontier","score_opus":0.5739900091310471,"score_gpt":0.45580669865034407,"score_spread":0.11818331048070307,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4414313280","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.033947863,0.016894763,0.75181395,0.16927266,0.0009904716,0.001559744,0.00084629323,0.0015272029,0.023147015],"genre_scores_gemma":[0.19321658,0.012298261,0.7779141,0.009420717,0.0010169776,0.0012494384,0.0016299519,0.0008715717,0.0023822824],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.72029054,0.19106737,0.025072074,0.015380262,0.043626603,0.004563114],"domain_scores_gemma":[0.42421702,0.3471781,0.023442008,0.14051895,0.06005108,0.0045928564],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.25711548,0.0014423885,0.0023904606,0.014181702,0.007086745,0.028197162,0.009238017,0.0044390955,0.0027245174],"category_scores_gemma":[0.4358423,0.0016579286,0.0034337332,0.01960413,0.025859432,0.05107942,0.021935135,0.011092855,0.0012601267],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00011225581,0.00016165421,0.013889095,0.0041116844,0.00023491005,0.00057241996,0.06945206,0.0052686553,0.0021937569,0.39455798,0.028347678,0.4810979],"study_design_scores_gemma":[0.00004793046,0.0001225157,0.0044035465,0.0046298387,0.000121572826,0.0008610386,0.03963935,0.010443781,0.0045642257,0.6019699,0.3330054,0.00019089808],"about_ca_topic_score_codex":0.008662946,"about_ca_topic_score_gemma":0.004949775,"teacher_disagreement_score":0.7428845,"about_ca_system_score_codex":0.008251192,"about_ca_system_score_gemma":0.024780137,"threshold_uncertainty_score":0.91610885},"labels":[],"label_agreement":null},{"id":"W4414509393","doi":"10.29173/iq1138","title":"Adventures in data literacy: When the gap you were trying to identify turns out to be a chasm.","year":2025,"lang":"en","type":"article","venue":"IASSIST Quarterly","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Manitoba","funders":"","keywords":"Adventure; Knowledge production; The Internet; Data collection; Qualitative research","score_opus":0.2517956435020109,"score_gpt":0.4942851364603817,"score_spread":0.2424894929583708,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4414509393","genre_codex":"empirical","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5795166,0.008333037,0.021616412,0.27220017,0.00344114,0.00018817456,0.00032444173,0.0003977756,0.11398224],"genre_scores_gemma":[0.94488686,0.0027401855,0.009748118,0.024057249,0.00048025636,0.00009436584,0.00018053499,0.00019108034,0.0176213],"study_design_codex":"qualitative","study_design_gemma":"not_applicable","domain_scores_codex":[0.9866275,0.008290914,0.00056879886,0.0010444566,0.0022248616,0.0012434721],"domain_scores_gemma":[0.95478487,0.02490288,0.0044559203,0.0019580822,0.0042537325,0.009644451],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.015079007,0.00029978922,0.0004368817,0.0017786844,0.01375647,0.015362622,0.0013273048,0.0029461207,0.007950576],"category_scores_gemma":[0.059234876,0.00060896535,0.00036217447,0.0017533863,0.014179556,0.021095335,0.017131671,0.008291496,0.0017391895],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006484576,0.00010290765,0.025915736,0.00045156345,0.000033685163,0.001588144,0.8398688,0.000046250676,0.001330555,0.025120363,0.03486902,0.070608065],"study_design_scores_gemma":[0.000005188309,0.00005334186,0.0063098464,0.00045266983,0.000010348438,0.0011945608,0.73827904,0.00008311014,0.0003083136,0.009554759,0.24370734,0.000041518088],"about_ca_topic_score_codex":0.004921303,"about_ca_topic_score_gemma":0.011313109,"teacher_disagreement_score":0.015362622,"about_ca_system_score_codex":0.0034211918,"about_ca_system_score_gemma":0.0053585214,"threshold_uncertainty_score":0.079746366},"labels":[],"label_agreement":null},{"id":"W4414929510","doi":"10.56830/ijsie202407","title":"&lt;b&gt;Data Quality as a Service (DQaaS): A Paradigm Shift in &lt;/b&gt; &lt;b&gt;Enterprise Data Management &lt;/b&gt;","year":2025,"lang":"en","type":"article","venue":"International Journal of Sustainability and Innovation in Engineering","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"EVERSANA (Canada)","funders":"","keywords":"Counterfactual thinking; Paradigm shift; Data quality; Schema (genetic algorithms); Enterprise data management; Anomaly detection; Quality of service; Service (business); Quality (philosophy)","score_opus":0.06432688146556595,"score_gpt":0.3927846794780049,"score_spread":0.3284577980124389,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4414929510","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.007559228,0.005387142,0.8303266,0.087212645,0.0030094236,0.00043760973,0.0008841911,0.0063244277,0.05885868],"genre_scores_gemma":[0.16714056,0.010535044,0.75000584,0.022967473,0.003088148,0.0007331529,0.00264053,0.0048916056,0.037997615],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9769025,0.0061709336,0.0021416128,0.004053579,0.009142363,0.0015889539],"domain_scores_gemma":[0.95392495,0.008821289,0.0026503485,0.017920373,0.012513588,0.0041693603],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03018107,0.00088556187,0.0009905862,0.0032452957,0.00226878,0.019829609,0.005045929,0.006234877,0.008551516],"category_scores_gemma":[0.035068244,0.0009949139,0.0012912123,0.008624064,0.009804163,0.028932244,0.011120744,0.009352567,0.005907803],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00009426427,0.00008061005,0.0013511281,0.00025232995,0.0000348453,0.00011965794,0.0009429183,0.002729308,0.0038012424,0.787498,0.05468892,0.14840665],"study_design_scores_gemma":[0.000037429287,0.00011756489,0.0010029741,0.00047930234,0.000019677873,0.00026796167,0.0007297988,0.03487478,0.0030760218,0.28765506,0.6716347,0.00010484447],"about_ca_topic_score_codex":0.020843605,"about_ca_topic_score_gemma":0.0081222765,"teacher_disagreement_score":0.03018107,"about_ca_system_score_codex":0.010425243,"about_ca_system_score_gemma":0.013056123,"threshold_uncertainty_score":0.15961462},"labels":[],"label_agreement":null},{"id":"W4415124422","doi":"10.1109/icisc65841.2025.11187811","title":"Stacked Neural Computing Model - Based Data Quality Analysis and Classification","year":2025,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Data pre-processing; Artificial neural network; Principal component analysis; Preprocessor; Linear discriminant analysis; Feature extraction; Pattern recognition (psychology); Outlier; Missing data; Data quality","score_opus":0.5657591235788999,"score_gpt":0.5444405596649767,"score_spread":0.021318563913923172,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4415124422","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.033687852,0.00020887061,0.96300614,0.00023326569,0.000042432534,0.00007181441,0.00014154488,0.0015456589,0.0010624089],"genre_scores_gemma":[0.7618149,0.00030078107,0.23486605,0.0001829914,0.000055065153,0.00016575419,0.0005769711,0.00008176962,0.0019557858],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9984994,0.00028388225,0.00014498126,0.0003339153,0.0005652488,0.00017258328],"domain_scores_gemma":[0.99719584,0.00060631137,0.00041964412,0.00037586264,0.0012986065,0.00010380295],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002187653,0.0011051128,0.0011823081,0.0014690345,0.00055967865,0.0019952054,0.0016648924,0.0007863187,0.0011131942],"category_scores_gemma":[0.006821871,0.00043210064,0.0011567418,0.0015105114,0.00060803076,0.0018958938,0.001411373,0.0013226281,0.00039109963],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00019301784,0.00015632492,0.0069931108,0.00007093028,0.00019174567,0.00009666473,0.0000896258,0.7555201,0.0039245253,0.00597514,0.0016399476,0.22514883],"study_design_scores_gemma":[9.4070657e-7,0.000013104829,0.00021416807,0.0000024356482,0.0000062787776,0.0000060143902,0.0000037497657,0.9977035,0.00075778604,0.0012000841,0.000088500674,0.0000035181067],"about_ca_topic_score_codex":0.020334063,"about_ca_topic_score_gemma":0.015760718,"teacher_disagreement_score":0.020334063,"about_ca_system_score_codex":0.0020698179,"about_ca_system_score_gemma":0.0023353102,"threshold_uncertainty_score":0.04043144},"labels":[],"label_agreement":null},{"id":"W4415231396","doi":"10.1609/aies.v8i3.36712","title":"A Principled Approach for Data Bias Mitigation","year":2025,"lang":"en","type":"article","venue":"Proceedings of the AAAI/ACM Conference on AI Ethics and Society","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"Canada Excellence Research Chairs, Government of Canada; National Science Foundation","keywords":"Measure (data warehouse); Table (database); Tuple; Key (lock); Work (physics); Data collection","score_opus":0.5508003255245804,"score_gpt":0.4892577970435352,"score_spread":0.06154252848104513,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4415231396","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0006902806,0.00018797156,0.99632746,0.0012822178,0.00008619468,0.00013587433,0.00009595467,0.00026837594,0.00092569576],"genre_scores_gemma":[0.054175466,0.00037402572,0.9401846,0.0017443779,0.00059273874,0.0010292066,0.0003748883,0.00018889303,0.001335881],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.91510975,0.039571077,0.0039832057,0.010401452,0.029352626,0.0015819134],"domain_scores_gemma":[0.84707737,0.087951906,0.0061718044,0.042358294,0.014785495,0.0016551872],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.067738384,0.0019299282,0.0030210987,0.0058723884,0.0027702292,0.0076426403,0.008625802,0.004703133,0.0042469436],"category_scores_gemma":[0.15686585,0.0017915248,0.0052706758,0.0060015502,0.008458903,0.009903845,0.019761138,0.010360424,0.0020370677],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025218618,0.0002134764,0.003933004,0.00067106914,0.0006053455,0.00025484638,0.0011005086,0.03185279,0.0032500955,0.67636955,0.011012593,0.27048445],"study_design_scores_gemma":[0.00010006333,0.00011180365,0.00041965552,0.00019573388,0.00011242013,0.00036694785,0.000111574955,0.107423514,0.003102645,0.869004,0.01898374,0.000067883],"about_ca_topic_score_codex":0.00087472016,"about_ca_topic_score_gemma":0.00084462384,"teacher_disagreement_score":0.067738384,"about_ca_system_score_codex":0.0022293727,"about_ca_system_score_gemma":0.008800176,"threshold_uncertainty_score":0.3582391},"labels":[],"label_agreement":null},{"id":"W4416034664","doi":"10.18653/v1/2025.findings-emnlp.481","title":"Hard Negatives, Hard Lessons: Revisiting Training Data Quality for Robust Information Retrieval with LLMs","year":2025,"lang":"","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Training (meteorology); Quality (philosophy); Data quality; Data retrieval; Training set; Information system","score_opus":0.5712677946581087,"score_gpt":0.48605393596481217,"score_spread":0.08521385869329656,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4416034664","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08060459,0.0029731782,0.893328,0.013665798,0.000385778,0.00055676984,0.0011222722,0.0034729156,0.0038907242],"genre_scores_gemma":[0.76027817,0.000462948,0.23428696,0.0019078722,0.0004807007,0.00027891726,0.0009942782,0.00038881396,0.00092136546],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.95043516,0.032078896,0.0044474085,0.004503147,0.0071835504,0.0013518579],"domain_scores_gemma":[0.6626006,0.2671399,0.010708756,0.03248243,0.024909517,0.0021587939],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06862291,0.0013907858,0.0027807239,0.0039401953,0.0017264803,0.007832369,0.0053340974,0.0027922648,0.0038534817],"category_scores_gemma":[0.37457424,0.0009828892,0.0012075664,0.0027778363,0.005075014,0.015276399,0.006909281,0.006484017,0.00076220237],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0034626052,0.00086014636,0.03984739,0.0028905969,0.0010272973,0.00027018358,0.00236048,0.10721294,0.00778361,0.05198139,0.020011662,0.7622918],"study_design_scores_gemma":[0.0003036904,0.00079052825,0.008094249,0.0006143602,0.00036015632,0.00020295245,0.0007010044,0.83255005,0.011537253,0.13930921,0.005398279,0.00013820291],"about_ca_topic_score_codex":0.007857079,"about_ca_topic_score_gemma":0.008101701,"teacher_disagreement_score":0.06862291,"about_ca_system_score_codex":0.0034296776,"about_ca_system_score_gemma":0.0059271147,"threshold_uncertainty_score":0.36291695},"labels":[],"label_agreement":null},{"id":"W4417070120","doi":"10.1145/3769829","title":"ST-Raptor: LLM-Powered Semi-Structured Table Question Answering","year":2025,"lang":"en","type":"article","venue":"Proceedings of the ACM on Management of Data","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"National Key Research and Development Program of China; National Natural Science Foundation of China","keywords":"Table (database); Correctness; Tree (set theory); Set (abstract data type); Benchmark (surveying); Pipeline (software); Question answering","score_opus":0.13736906533177068,"score_gpt":0.41139771770102107,"score_spread":0.2740286523692504,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4417070120","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005129872,0.00013125273,0.93378687,0.00047949055,0.00008264359,0.00052328134,0.0016995209,0.055211026,0.0029559266],"genre_scores_gemma":[0.09696149,0.00014422945,0.8896387,0.000618017,0.00007187905,0.0007174174,0.005927822,0.002885153,0.003035236],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9913845,0.003823354,0.0005900752,0.0014294168,0.0023502158,0.0004224913],"domain_scores_gemma":[0.9803193,0.011658198,0.0006564366,0.0042458647,0.002703304,0.00041698443],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007122713,0.0017083603,0.0012093979,0.002025845,0.0009965374,0.003233228,0.0049992334,0.0025711847,0.018189942],"category_scores_gemma":[0.036045633,0.0011824083,0.0025987593,0.0012706327,0.0022425468,0.008227798,0.0070294533,0.0032784736,0.010599013],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013155829,0.0005915498,0.004868027,0.0022853522,0.00020060148,0.0010362555,0.005028586,0.04882607,0.049198322,0.14773639,0.11733877,0.6215744],"study_design_scores_gemma":[0.00014345092,0.00021854679,0.00065769977,0.0001336518,0.00005046182,0.0004660384,0.00048506976,0.8496262,0.031208577,0.06915355,0.047736388,0.00012046911],"about_ca_topic_score_codex":0.005198085,"about_ca_topic_score_gemma":0.006700838,"teacher_disagreement_score":0.018189942,"about_ca_system_score_codex":0.001343792,"about_ca_system_score_gemma":0.0043568206,"threshold_uncertainty_score":0.060851395},"labels":[],"label_agreement":null},{"id":"W4417510432","doi":"10.1109/eecsi67060.2025.11290640","title":"A Novel Approach to Responding to Key Data Anomalies Using Unsupervised Learning: Work In Progress","year":2025,"lang":"","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"","keywords":"Key (lock); Data pre-processing; Preprocessor; Confusion; Data quality; Anomaly detection; Hyperparameter; Data modeling","score_opus":0.36765431070543214,"score_gpt":0.4582932247787897,"score_spread":0.09063891407335756,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4417510432","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.028407842,0.0010329352,0.9665087,0.0010685675,0.00013972193,0.00018601639,0.00019397803,0.0016168986,0.00084525335],"genre_scores_gemma":[0.36039317,0.001021123,0.63478583,0.00047092474,0.0003260924,0.00026850105,0.0009660693,0.00016728729,0.0016010499],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9966156,0.0011434094,0.00028058692,0.00094253453,0.00084000983,0.00017785764],"domain_scores_gemma":[0.99153906,0.0034561716,0.00073432754,0.0014798288,0.0025473011,0.00024316336],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004874152,0.0012158575,0.0012891067,0.0019210615,0.0006465717,0.0018347026,0.0024408486,0.0010392952,0.0006172739],"category_scores_gemma":[0.009577683,0.00038358732,0.0013320385,0.0021371676,0.00077464915,0.002700376,0.001142054,0.0018955087,0.00040149942],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00012761849,0.0006712211,0.020307796,0.0003373144,0.0004498619,0.00013915621,0.00045793035,0.10453421,0.0075114616,0.0040109386,0.005821812,0.85563076],"study_design_scores_gemma":[0.0000108166505,0.0000975761,0.0030119012,0.00002917306,0.00003756588,0.000074953736,0.00016278752,0.9853415,0.0034329824,0.0048839236,0.0028840469,0.00003278414],"about_ca_topic_score_codex":0.0067653116,"about_ca_topic_score_gemma":0.0062980466,"teacher_disagreement_score":0.0067653116,"about_ca_system_score_codex":0.0006759343,"about_ca_system_score_gemma":0.0019486675,"threshold_uncertainty_score":0.02577728},"labels":[],"label_agreement":null},{"id":"W44195261","doi":"10.1007/978-3-319-11851-2_1","title":"Integrating Trust and Economic Theories with Knowledge Science for Dependable Service Automation","year":2014,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Computer science; Service (business); Knowledge management; Automation; Computational trust; Domain (mathematical analysis); Domain knowledge; Service design; Service provider; Computer security; Reputation; Business; Engineering; Marketing","score_opus":0.04662471210549109,"score_gpt":0.3351982024288138,"score_spread":0.28857349032332275,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W44195261","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.018594451,0.0110137435,0.7721194,0.024993572,0.00078902306,0.00006873857,0.00015277059,0.0001336545,0.17213467],"genre_scores_gemma":[0.8500307,0.011959519,0.1103577,0.0012466919,0.0011825091,0.00015235522,0.00016944161,0.00008756362,0.024813512],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9985428,0.00056560873,0.000116618496,0.00011801984,0.0005411466,0.00011582777],"domain_scores_gemma":[0.9933814,0.004964486,0.00035679096,0.00061344163,0.00052423525,0.00015967319],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0030126225,0.0006399015,0.0008172301,0.00184175,0.0009389843,0.0049355538,0.0016095901,0.002593941,0.0054056128],"category_scores_gemma":[0.0087299915,0.0004560185,0.001063283,0.002278191,0.006772615,0.011687616,0.0024170235,0.003995943,0.0007472218],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000030435094,0.000009741097,0.00006447058,0.00003662897,0.000009006026,0.000024433382,0.00007698118,0.0034542766,0.000041967458,0.9877769,0.00076594163,0.0077366335],"study_design_scores_gemma":[0.0000014679658,0.0000035166145,0.000036033078,0.000024934665,0.0000033007225,0.000012922469,0.000034712077,0.008209276,0.0000624307,0.98821986,0.0033868838,0.0000046170126],"about_ca_topic_score_codex":0.0036671632,"about_ca_topic_score_gemma":0.002708583,"teacher_disagreement_score":0.0054056128,"about_ca_system_score_codex":0.004254474,"about_ca_system_score_gemma":0.0018673072,"threshold_uncertainty_score":0.03086853},"labels":[],"label_agreement":null},{"id":"W44227490","doi":"10.1007/978-3-642-29461-7_31","title":"Reliability in the Thresholded Dempster-Shafer Algorithm for ESM Data Fusion","year":2012,"lang":"en","type":"book-chapter","venue":"Advances in intelligent and soft computing","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Defence Research and Development Canada; Université de Montréal","funders":"","keywords":"Reliability (semiconductor); Information fusion; Fusion; Dempster–Shafer theory; Computer science; Data mining; Sensor fusion; Process (computing); Quality (philosophy); Measure (data warehouse); Algorithm; Artificial intelligence; Machine learning; Pattern recognition (psychology)","score_opus":0.21533567593208625,"score_gpt":0.4279537358832521,"score_spread":0.21261805995116584,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W44227490","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.004567167,0.0028218357,0.98956394,0.00030707003,0.00012790698,0.000022497228,0.000066112945,0.00020786593,0.0023156325],"genre_scores_gemma":[0.25792795,0.0049406616,0.7302738,0.00018121475,0.0004333811,0.00017113831,0.00034881127,0.0002423107,0.005480723],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9971724,0.0011049818,0.00020487004,0.0003063158,0.0011144642,0.0000970825],"domain_scores_gemma":[0.9923315,0.005190467,0.00030289328,0.00074953545,0.0013714122,0.000054191594],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006031772,0.0008954309,0.0014151488,0.0020426773,0.0007398197,0.0021878767,0.0018318081,0.0018807147,0.0020893656],"category_scores_gemma":[0.023084598,0.0007017429,0.0008392108,0.0033614314,0.0017560625,0.003942964,0.0020659892,0.002332872,0.0011014884],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002536717,0.00003551931,0.0008910367,0.00041559385,0.00011162858,0.00013088994,0.000294274,0.30309123,0.004005723,0.2669253,0.007672296,0.4161728],"study_design_scores_gemma":[0.0000081338885,0.00003181999,0.00042951357,0.000055344364,0.000020450485,0.00013434842,0.000036230806,0.86524594,0.0033582307,0.12678403,0.0038579174,0.000038003178],"about_ca_topic_score_codex":0.00271099,"about_ca_topic_score_gemma":0.0014333992,"teacher_disagreement_score":0.006031772,"about_ca_system_score_codex":0.0014035793,"about_ca_system_score_gemma":0.0012246176,"threshold_uncertainty_score":0.031899393},"labels":[],"label_agreement":null},{"id":"W656573153","doi":"","title":"A pre and post data warehouse cleaning technique.","year":2002,"lang":"en","type":"article","venue":"Scholarship at UWindsor (University of Windsor)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Data warehouse; Computer science; Warehouse; Database; Business; Marketing","score_opus":0.18775769131166392,"score_gpt":0.3325709532629921,"score_spread":0.14481326195132815,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W656573153","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010050517,0.0006420869,0.97450733,0.0004879422,0.0003624174,0.0007496469,0.0008648332,0.006847859,0.005487307],"genre_scores_gemma":[0.03726058,0.00037941127,0.9444705,0.0004478018,0.00012313706,0.0003107544,0.0029188404,0.0007560978,0.0133327525],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.995063,0.0006347976,0.0003218437,0.0010444548,0.0026790923,0.0002569086],"domain_scores_gemma":[0.9925645,0.0011094302,0.00052838784,0.0030562973,0.0025936652,0.00014773602],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0026041623,0.0012056762,0.0010578054,0.0029944216,0.0018589771,0.0022944699,0.0021222066,0.0009954044,0.0066922614],"category_scores_gemma":[0.0061326516,0.00088775926,0.0017755943,0.0029297306,0.0008671771,0.0028830557,0.0022006575,0.0020886024,0.007912152],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00037076115,0.00049277814,0.0031577423,0.00061941677,0.00022567353,0.00025877942,0.0004945853,0.0027470991,0.053954728,0.0082268845,0.03544905,0.89400244],"study_design_scores_gemma":[0.00024271364,0.0012314894,0.01749946,0.00025730825,0.0005337854,0.0045071985,0.0011038256,0.08440088,0.39062747,0.025838627,0.47346437,0.00029284836],"about_ca_topic_score_codex":0.0018291823,"about_ca_topic_score_gemma":0.0030187354,"teacher_disagreement_score":0.0066922614,"about_ca_system_score_codex":0.00053334143,"about_ca_system_score_gemma":0.0026758537,"threshold_uncertainty_score":0.022387862},"labels":[],"label_agreement":null},{"id":"W6886023238","doi":"10.14288/1.0398457","title":"Prospective data linkage to facilitate COVID-19 trials : A call to action","year":2021,"lang":"en","type":"article","venue":"Open Collections","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Bespoke; Observational study; Record linkage; Clinical trial; Linkage (software); Data collection; Medical record; Call to action; Health care; Cohort","score_opus":0.8115006908315471,"score_gpt":0.5764589460544908,"score_spread":0.2350417447770563,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6886023238","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":"methods","domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":"methods","domain_consensus":"methods","prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00064584083,0.012115332,0.034306794,0.9307789,0.013717432,0.0018243856,0.0012848525,0.0018215415,0.003504872],"genre_scores_gemma":[0.011734495,0.016941622,0.3773208,0.5428226,0.031236878,0.009458879,0.0059700287,0.0017174957,0.0027971396],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.2713752,0.59504926,0.048652142,0.013205436,0.0625926,0.009125379],"domain_scores_gemma":[0.058231667,0.72148573,0.032111164,0.07725894,0.07336737,0.03754507],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.7279982,0.0054084724,0.013820201,0.014808513,0.008482444,0.04590425,0.030037666,0.06317304,0.038526297],"category_scores_gemma":[0.78394455,0.0054748566,0.0147383325,0.018679166,0.025458343,0.08561619,0.047691107,0.08320229,0.023805656],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014406848,0.00052185607,0.0043747034,0.004601768,0.00076595845,0.00043935637,0.0040581604,0.0012292061,0.0003423258,0.038334817,0.7416375,0.20225361],"study_design_scores_gemma":[0.001998836,0.0010741118,0.004229476,0.024517583,0.00044706414,0.00073998776,0.0040386515,0.0037800123,0.00046839766,0.12613043,0.8317325,0.00084290555],"about_ca_topic_score_codex":0.010518659,"about_ca_topic_score_gemma":0.0081690075,"teacher_disagreement_score":0.2720018,"about_ca_system_score_codex":0.015124299,"about_ca_system_score_gemma":0.09008253,"threshold_uncertainty_score":0.3354267},"labels":[],"label_agreement":null},{"id":"W6886994811","doi":"10.15468/dl.nydmw7","title":"Occurrence Download","year":2025,"lang":"en","type":"dataset","venue":"Global Biodiversity Information Facility","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Download; Matching (statistics); Range (aeronautics); Set (abstract data type); Data set","score_opus":0.06370320266780717,"score_gpt":0.32470061285242874,"score_spread":0.2609974101846216,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6886994811","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000051824532,0.000024888031,0.000058512964,0.00004456112,0.000012437544,0.000006543726,0.99860805,0.00055765535,0.0006354655],"genre_scores_gemma":[0.00017295552,0.000028430484,0.00023009343,0.000045149955,0.0000031768066,0.00004454566,0.9989235,0.00016185759,0.00039029526],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9990276,0.00013075232,0.00012765198,0.00033834233,0.00022249125,0.00015317828],"domain_scores_gemma":[0.9976775,0.0006695559,0.00019747586,0.00062019256,0.00057906925,0.00025624927],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0009709293,0.0019134869,0.0014482829,0.004285971,0.000986792,0.002419431,0.0029117132,0.0019775003,0.13405107],"category_scores_gemma":[0.0062186983,0.0008627628,0.0012688024,0.008114712,0.00045609416,0.0021656035,0.0024244643,0.0020563125,0.19216388],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000307118,0.000012691278,0.0003855173,0.0004637668,0.000014741417,0.000015636107,0.00002382385,0.00013788194,0.00010980993,0.0003887181,0.99702686,0.0013899046],"study_design_scores_gemma":[0.00009559826,0.000009977902,0.0021222099,0.00019258798,0.000016508646,0.000045113688,0.00008773,0.0002591683,0.00023096192,0.0010261796,0.99589336,0.000020500012],"about_ca_topic_score_codex":0.02312743,"about_ca_topic_score_gemma":0.037085094,"teacher_disagreement_score":0.8659489,"about_ca_system_score_codex":0.0015639963,"about_ca_system_score_gemma":0.002357272,"threshold_uncertainty_score":0.4484455},"labels":[],"label_agreement":null},{"id":"W6892677843","doi":"10.5281/zenodo.11395625","title":"Canadian Urban Data Catalogue","year":2024,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Metadata; Data element; Metadata repository; Open data; Meta Data Services; Data management plan; Upload; Data management","score_opus":0.2547176194894219,"score_gpt":0.37294990165352887,"score_spread":0.11823228216410697,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6892677843","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0026379186,0.00084127445,0.0132627385,0.0025418634,0.00029838042,0.00057109055,0.7335303,0.00585947,0.24045698],"genre_scores_gemma":[0.0154702915,0.002193769,0.040835906,0.0007952461,0.000106632004,0.00050113496,0.8360518,0.0020747925,0.101970464],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99469674,0.00026641224,0.00044342267,0.00057359686,0.0033975595,0.0006221242],"domain_scores_gemma":[0.97278124,0.0010451428,0.0006476853,0.002717439,0.021213595,0.0015948162],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0031570166,0.0012269696,0.00090511836,0.023086032,0.0064599137,0.009070419,0.0041416,0.0014058949,0.094710775],"category_scores_gemma":[0.01558639,0.00075620617,0.0010909302,0.048563488,0.0013585654,0.0051302547,0.004788668,0.0017748043,0.055353437],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00005537434,0.000018214258,0.0029737845,0.00044366386,0.000015102785,0.000099204684,0.00072601927,0.00080807164,0.0003919014,0.051142063,0.8738919,0.06943472],"study_design_scores_gemma":[0.0000035532398,0.0000020145671,0.0014895764,0.00010382842,0.000005267604,0.000035602156,0.00028926096,0.0002923716,0.00018208557,0.0014165302,0.99615425,0.000025609763],"about_ca_topic_score_codex":0.9494297,"about_ca_topic_score_gemma":0.9550827,"teacher_disagreement_score":0.094710775,"about_ca_system_score_codex":0.050195776,"about_ca_system_score_gemma":0.099362455,"threshold_uncertainty_score":0.36419755},"labels":[],"label_agreement":null},{"id":"W6902080693","doi":"10.6084/m9.figshare.16909630","title":"Additional file 2 of Assessing the suitability of general practice electronic health records for clinical prediction model development: a data quality assessment","year":2021,"lang":"en","type":"article","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Data quality; Record linkage; Health records; General practice; Quality (philosophy); Health data; Data collection; Quality assessment","score_opus":0.6515578119347073,"score_gpt":0.5949122324697573,"score_spread":0.05664557946494997,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6902080693","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00048507057,0.000011766661,0.0007766552,0.00021112362,0.000026806105,0.0005884139,0.99608946,0.00026449386,0.0015461366],"genre_scores_gemma":[0.024678605,0.00014257213,0.018923005,0.0010046506,0.00019741188,0.019186093,0.91869617,0.0013090424,0.01586253],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.99518555,0.001493166,0.0013472713,0.0006069715,0.0010925372,0.00027454243],"domain_scores_gemma":[0.8188555,0.14963517,0.007976958,0.0068619912,0.015478785,0.0011917156],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.00945932,0.00087367644,0.0009665074,0.0039145746,0.0010546669,0.002020817,0.0019568112,0.0012190841,0.83336574],"category_scores_gemma":[0.14577512,0.00056864956,0.0011564454,0.0055268295,0.0003332454,0.0019333793,0.0015166431,0.0009920374,0.08028209],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004945148,0.00013169818,0.003528955,0.0030758218,0.000099184486,0.00005163694,0.00012932395,0.0005332869,0.00006791563,0.0012296959,0.97685915,0.013798719],"study_design_scores_gemma":[0.013097803,0.0006984775,0.069303595,0.009208524,0.0007238686,0.000651638,0.0013669053,0.006871786,0.0018282946,0.018613739,0.8773255,0.00030987672],"about_ca_topic_score_codex":0.00834058,"about_ca_topic_score_gemma":0.010801281,"teacher_disagreement_score":0.83336574,"about_ca_system_score_codex":0.0019088492,"about_ca_system_score_gemma":0.003943256,"threshold_uncertainty_score":0.23768353},"labels":[],"label_agreement":null},{"id":"W6902186868","doi":"10.6084/m9.figshare.16909630.v1","title":"Additional file 2 of Assessing the suitability of general practice electronic health records for clinical prediction model development: a data quality assessment","year":2021,"lang":"en","type":"article","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Data quality; Record linkage; Health records; General practice; Quality (philosophy); Health data; Data collection; Quality assessment","score_opus":0.6515578119347073,"score_gpt":0.5949122324697573,"score_spread":0.05664557946494997,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6902186868","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00048507057,0.000011766661,0.0007766552,0.00021112362,0.000026806105,0.0005884139,0.99608946,0.00026449386,0.0015461366],"genre_scores_gemma":[0.024678605,0.00014257213,0.018923005,0.0010046506,0.00019741188,0.019186093,0.91869617,0.0013090424,0.01586253],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.99518555,0.001493166,0.0013472713,0.0006069715,0.0010925372,0.00027454243],"domain_scores_gemma":[0.8188555,0.14963517,0.007976958,0.0068619912,0.015478785,0.0011917156],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.00945932,0.00087367644,0.0009665074,0.0039145746,0.0010546669,0.002020817,0.0019568112,0.0012190841,0.83336574],"category_scores_gemma":[0.14577512,0.00056864956,0.0011564454,0.0055268295,0.0003332454,0.0019333793,0.0015166431,0.0009920374,0.08028209],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004945148,0.00013169818,0.003528955,0.0030758218,0.000099184486,0.00005163694,0.00012932395,0.0005332869,0.00006791563,0.0012296959,0.97685915,0.013798719],"study_design_scores_gemma":[0.013097803,0.0006984775,0.069303595,0.009208524,0.0007238686,0.000651638,0.0013669053,0.006871786,0.0018282946,0.018613739,0.8773255,0.00030987672],"about_ca_topic_score_codex":0.00834058,"about_ca_topic_score_gemma":0.010801281,"teacher_disagreement_score":0.83336574,"about_ca_system_score_codex":0.0019088492,"about_ca_system_score_gemma":0.003943256,"threshold_uncertainty_score":0.23768353},"labels":[],"label_agreement":null},{"id":"W6905913842","doi":"10.15468/dl.929c6n","title":"Occurrence Download","year":2025,"lang":"en","type":"dataset","venue":"Global Biodiversity Information Facility","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Download; Matching (statistics); Range (aeronautics); Set (abstract data type)","score_opus":0.06370320266780717,"score_gpt":0.32470061285242874,"score_spread":0.2609974101846216,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6905913842","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00005127197,0.000028380711,0.00006101025,0.000047766993,0.000013028938,0.0000067083733,0.9985869,0.000532546,0.0006722835],"genre_scores_gemma":[0.0001672395,0.000030094283,0.00022674294,0.000047307538,0.0000031251602,0.00004368282,0.9989158,0.00015426762,0.00041176283],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99896955,0.00014414739,0.00013356854,0.00035224555,0.00024142976,0.00015910274],"domain_scores_gemma":[0.9976839,0.0006746235,0.0001939559,0.0006136181,0.00058069994,0.0002531006],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0009954732,0.001996937,0.0015027119,0.00446542,0.0010280062,0.0024849877,0.0029685604,0.0020348276,0.13781868],"category_scores_gemma":[0.0063479985,0.0008783143,0.0012906546,0.008706189,0.00046783144,0.0021550693,0.0024331512,0.0021046444,0.19710797],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00002955491,0.000012483845,0.0003510511,0.00044830522,0.000014593897,0.000015132445,0.000023199109,0.00014463537,0.00010335215,0.0003927943,0.9970534,0.0014115177],"study_design_scores_gemma":[0.000092788796,0.000009234946,0.0019255251,0.0001874471,0.000015754287,0.000042952164,0.00008400344,0.00024569136,0.00020780881,0.0009954234,0.9961739,0.000019434903],"about_ca_topic_score_codex":0.024709575,"about_ca_topic_score_gemma":0.039531562,"teacher_disagreement_score":0.8621813,"about_ca_system_score_codex":0.0016366794,"about_ca_system_score_gemma":0.0024869756,"threshold_uncertainty_score":0.46104944},"labels":[],"label_agreement":null},{"id":"W6906122283","doi":"10.15468/dl.ypxg32","title":"Occurrence Download","year":2025,"lang":"en","type":"dataset","venue":"Global Biodiversity Information Facility","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Download; Matching (statistics); Range (aeronautics); Set (abstract data type)","score_opus":0.06370320266780717,"score_gpt":0.32470061285242874,"score_spread":0.2609974101846216,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6906122283","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00004565312,0.000026328757,0.00005746782,0.000046263303,0.000012840485,0.000006674707,0.9986312,0.00054139947,0.0006321198],"genre_scores_gemma":[0.00016036542,0.000029523224,0.0002218903,0.00004789246,0.000003146766,0.000043930824,0.99894756,0.00015803253,0.00038773142],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9989429,0.00014246911,0.00014096085,0.00036043432,0.0002477973,0.00016542853],"domain_scores_gemma":[0.9976261,0.000682057,0.00020142605,0.0006293205,0.0006008134,0.0002602052],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0010296636,0.0020331822,0.0015437823,0.0045069247,0.0010421849,0.0025525205,0.0029847538,0.002104323,0.14214332],"category_scores_gemma":[0.0065537067,0.0008922925,0.0013121351,0.008828863,0.0004654557,0.0022551324,0.0025015336,0.002091196,0.20286486],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000029191384,0.0000120668865,0.0003397669,0.00045998264,0.000014323661,0.000015358768,0.00002238971,0.00013715909,0.00009923154,0.00038913958,0.99714607,0.0013354056],"study_design_scores_gemma":[0.00009388295,0.000009292533,0.0019151737,0.00019289486,0.000015839756,0.000043348045,0.000083453924,0.00025616077,0.00021528194,0.0010374398,0.9961171,0.000020111975],"about_ca_topic_score_codex":0.024770182,"about_ca_topic_score_gemma":0.038104635,"teacher_disagreement_score":0.8578567,"about_ca_system_score_codex":0.0017020426,"about_ca_system_score_gemma":0.0025116487,"threshold_uncertainty_score":0.4755168},"labels":[],"label_agreement":null},{"id":"W6912622565","doi":"10.5281/zenodo.5181064","title":"Mathematics, Risk, and Messy Survey Data","year":2021,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Government (linguistics); Workflow; Session (web analytics); Population; Work (physics); Publication; Survey data collection","score_opus":0.3731738872220772,"score_gpt":0.39507498187539863,"score_spread":0.021901094653321407,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6912622565","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014097991,0.007474445,0.9077374,0.052133787,0.0010779096,0.00026336126,0.0013358884,0.00061239925,0.015266863],"genre_scores_gemma":[0.3789696,0.010930247,0.58437073,0.008993803,0.002465905,0.0008996904,0.0018299563,0.0005074491,0.011032581],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9428537,0.035700683,0.00348774,0.005177035,0.011911093,0.0008697931],"domain_scores_gemma":[0.80359995,0.14440681,0.012852087,0.029416109,0.007817616,0.0019074386],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.06209918,0.00073625444,0.0016795412,0.0047376975,0.0036395213,0.013071592,0.0023881644,0.0027571386,0.00473743],"category_scores_gemma":[0.17380963,0.0009006423,0.0014369853,0.00787307,0.011123964,0.018434884,0.008234762,0.006806429,0.001231868],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00011297366,0.000024583489,0.0028658465,0.00044665104,0.00010873983,0.00012423762,0.0014592382,0.0055411425,0.0003610821,0.8887014,0.013192911,0.08706111],"study_design_scores_gemma":[0.000009808142,0.00001679079,0.00074159296,0.00022352349,0.000016248649,0.0001981404,0.000498818,0.005867401,0.00047698562,0.9664038,0.025511397,0.00003553329],"about_ca_topic_score_codex":0.0013747083,"about_ca_topic_score_gemma":0.0013986856,"teacher_disagreement_score":0.93790084,"about_ca_system_score_codex":0.005009331,"about_ca_system_score_gemma":0.003532897,"threshold_uncertainty_score":0.32841575},"labels":[],"label_agreement":null},{"id":"W6912667207","doi":"10.5281/zenodo.3596718","title":"DDI 4 Core: Describing and managing data for traditional and modern data platforms","year":2019,"lang":"en","type":"article","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Statistics Canada","funders":"","keywords":"Interoperability; XML; Scope (computer science); Data management; Data model (GIS); Data system; Metadata; Core (optical fiber)","score_opus":0.8478209347699858,"score_gpt":0.4379830149435481,"score_spread":0.4098379198264377,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6912667207","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0031312057,0.0016692191,0.9177442,0.0042500757,0.0010556839,0.0017820097,0.010686151,0.029308746,0.03037272],"genre_scores_gemma":[0.02892343,0.003655917,0.85569453,0.004221726,0.00047966884,0.0025091479,0.05994393,0.015210124,0.029361485],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.965225,0.008708366,0.0074559413,0.002190465,0.014677805,0.0017425462],"domain_scores_gemma":[0.9424317,0.013776539,0.0026591793,0.019869259,0.018939717,0.0023236473],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.05101318,0.0017637559,0.0017165706,0.006966484,0.0022305355,0.018068029,0.0071935025,0.0038523523,0.011865833],"category_scores_gemma":[0.07794584,0.0026059204,0.0031478384,0.0067554116,0.0034387182,0.015835326,0.0112709245,0.0057071573,0.011618824],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00049214286,0.00022814519,0.0046201013,0.0032059934,0.00019777063,0.00049116364,0.003461423,0.009734946,0.0102173155,0.36381438,0.29004386,0.31349272],"study_design_scores_gemma":[0.000058029374,0.00009122183,0.0009696526,0.0010723183,0.000047190504,0.0004661535,0.0004415722,0.007832759,0.0070165847,0.032903876,0.9489643,0.00013647124],"about_ca_topic_score_codex":0.009610097,"about_ca_topic_score_gemma":0.006996583,"teacher_disagreement_score":0.9489868,"about_ca_system_score_codex":0.005585484,"about_ca_system_score_gemma":0.013161177,"threshold_uncertainty_score":0.26978672},"labels":[],"label_agreement":null},{"id":"W6920969057","doi":"10.6084/m9.figshare.15063757.v1","title":"Additional file 2 of Assessing record linkage between health care and Vital Statistics databases using deterministic methods","year":2021,"lang":"en","type":"article","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute of Health Economics; University of Calgary","funders":"","keywords":"Record linkage; Linkage (software); Health care; Data collection; MEDLINE; Data source; Health data","score_opus":0.5070898105060758,"score_gpt":0.552299466771692,"score_spread":0.04520965626561613,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6920969057","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00028203803,0.000012010011,0.00083963934,0.00016191063,0.00006422555,0.0002027892,0.99547946,0.0006544233,0.0023034855],"genre_scores_gemma":[0.016685948,0.00016891,0.023398727,0.0010249302,0.00021071106,0.006287441,0.9245379,0.004121753,0.023563558],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9978672,0.00053835456,0.0004132724,0.0004164514,0.0005152281,0.00024953825],"domain_scores_gemma":[0.904527,0.07773745,0.0030277492,0.00473209,0.008955773,0.0010199882],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0042503364,0.0012162935,0.0011708512,0.005289908,0.0012872277,0.002656279,0.002071968,0.001674514,0.9056344],"category_scores_gemma":[0.07544519,0.001080116,0.0019128915,0.0060984003,0.00046498116,0.0021224744,0.0014958448,0.0011835998,0.23540992],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021861398,0.000093288014,0.0019107261,0.0013427287,0.000059460785,0.000045749748,0.000060362723,0.00072113454,0.000043791904,0.0010189684,0.9866702,0.007814989],"study_design_scores_gemma":[0.008991016,0.00025323962,0.026337,0.004795226,0.00040430235,0.00047953243,0.00069348025,0.007294963,0.001236547,0.020183671,0.9290889,0.00024206896],"about_ca_topic_score_codex":0.016768768,"about_ca_topic_score_gemma":0.020712644,"teacher_disagreement_score":0.9056344,"about_ca_system_score_codex":0.0019024714,"about_ca_system_score_gemma":0.0038254918,"threshold_uncertainty_score":0.134601},"labels":[],"label_agreement":null},{"id":"W6920990162","doi":"10.6084/m9.figshare.22729174.v1","title":"Additional file 2 of Identifying dementia using medical data linkage in a longitudinal cohort study: Lothian Birth Cohort 1936","year":2023,"lang":"en","type":"article","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Cohort; Record linkage; Linkage (software); Longitudinal data; Cohort study; Dementia; Data file; Cohort effect","score_opus":0.4652379535492501,"score_gpt":0.46450192286259634,"score_spread":0.000736030686653788,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6920990162","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00020005087,0.000009249649,0.00016363872,0.000053202275,0.00001125249,0.00009736887,0.9983576,0.00007193107,0.0010356727],"genre_scores_gemma":[0.009429741,0.00013057078,0.0025964342,0.00044623553,0.000082033366,0.0030391018,0.97235876,0.00028460755,0.011632532],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9990221,0.00023733593,0.00020767286,0.00020889744,0.00019118022,0.0001327757],"domain_scores_gemma":[0.98313415,0.011444977,0.0016480883,0.0010213801,0.002254417,0.0004969823],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0019701358,0.00067292334,0.00089826284,0.0024299049,0.0010251015,0.0010493867,0.0014499893,0.00084208813,0.7971852],"category_scores_gemma":[0.025293935,0.0004328008,0.0006996185,0.004827428,0.00019921827,0.0009438786,0.00077132706,0.0005923846,0.086376354],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00024065452,0.00005427121,0.0037834013,0.0010710066,0.000044414202,0.000054482996,0.00005673451,0.00025066553,0.000053666667,0.0006361637,0.9878572,0.0058972593],"study_design_scores_gemma":[0.008479636,0.00045530894,0.100215994,0.0054113124,0.00046598449,0.00081534876,0.00079131394,0.0028837044,0.000903058,0.008974042,0.8704447,0.00015953655],"about_ca_topic_score_codex":0.021013701,"about_ca_topic_score_gemma":0.028351968,"teacher_disagreement_score":0.7971852,"about_ca_system_score_codex":0.0012542678,"about_ca_system_score_gemma":0.0021235815,"threshold_uncertainty_score":0.28929067},"labels":[],"label_agreement":null},{"id":"W6923691801","doi":"10.14288/1.0177589","title":"Daily Building Record","year":2016,"lang":"en","type":"article","venue":"Open Collections","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Publishing; Historical record; Project commissioning; Architecture; Record keeping","score_opus":0.2122230395360295,"score_gpt":0.4337421082766022,"score_spread":0.2215190687405727,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6923691801","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0021492303,0.004301239,0.0012145191,0.004732834,0.005929249,0.00039269982,0.16264617,0.0023173038,0.8163167],"genre_scores_gemma":[0.0078858035,0.0042337463,0.0013581538,0.001031566,0.0009958489,0.00020538522,0.12721898,0.0014687399,0.8556018],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9940738,0.00033401343,0.00037843053,0.00048271703,0.0042621815,0.00046895156],"domain_scores_gemma":[0.95873576,0.0022695349,0.0010573182,0.004572003,0.029771402,0.0035939459],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0030752865,0.0007238721,0.0013206461,0.010942854,0.0067509986,0.01601642,0.0018419779,0.0011942323,0.38866577],"category_scores_gemma":[0.022494946,0.00063325244,0.00047734348,0.022106454,0.0011549992,0.0025905618,0.002443675,0.0021922116,0.34357902],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000022466767,0.0000090171525,0.00039173177,0.00012715367,0.0000028708575,0.000023359515,0.00008328746,0.000024906467,0.000047180765,0.0012402915,0.9637038,0.03432397],"study_design_scores_gemma":[0.000001976814,0.0000019708543,0.0006751471,0.000055059925,0.0000014870603,0.000011726704,0.00006617395,0.000010351741,0.000033419783,0.00011626611,0.99902165,0.0000046805217],"about_ca_topic_score_codex":0.22616178,"about_ca_topic_score_gemma":0.38200358,"teacher_disagreement_score":0.6113342,"about_ca_system_score_codex":0.0072976598,"about_ca_system_score_gemma":0.024943048,"threshold_uncertainty_score":0.8719941},"labels":[],"label_agreement":null},{"id":"W6931726075","doi":"10.5281/zenodo.6710583","title":"Phenacomys ungava Merriam 1889","year":2017,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Vole; Subspecies; Boreal; Dorsum; Snout; Bay","score_opus":0.2581520943643967,"score_gpt":0.3944198436953972,"score_spread":0.1362677493310005,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931726075","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.24541944,0.025622228,0.002024017,0.0016049185,0.00089165964,0.00036221358,0.008792227,0.00053192524,0.7147513],"genre_scores_gemma":[0.9093075,0.006093929,0.0022775973,0.0007142195,0.00027547934,0.00020210451,0.0054203034,0.000041593223,0.0756674],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9999149,0.00000830105,0.0000059526915,0.000025076519,0.000026109097,0.000019708086],"domain_scores_gemma":[0.99994314,0.0000070357287,0.000023845572,0.000004852711,0.000013620488,0.000007537502],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.000061419814,0.00050919264,0.00018169751,0.0009629013,0.0011053617,0.00024534515,0.00037251908,0.00025989884,0.009035355],"category_scores_gemma":[0.00014224116,0.0001821176,0.00013384408,0.0006461359,0.00042267446,0.00039484823,0.0005508329,0.0003203065,0.0027466777],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001795247,0.00008326601,0.06317052,0.00040899514,0.00005022356,0.0029342454,0.0026369719,0.0007852744,0.010625562,0.006488766,0.13397041,0.77866614],"study_design_scores_gemma":[0.000025237534,0.00007190307,0.42512283,0.00029466272,0.000032953798,0.0020386735,0.00097385707,0.00028449096,0.000781072,0.00069544493,0.5696645,0.000014381328],"about_ca_topic_score_codex":0.044641536,"about_ca_topic_score_gemma":0.12799557,"teacher_disagreement_score":0.044641536,"about_ca_system_score_codex":0.00079610344,"about_ca_system_score_gemma":0.00031828284,"threshold_uncertainty_score":0.088763356},"labels":[],"label_agreement":null},{"id":"W6939481667","doi":"10.6084/m9.figshare.15063754","title":"Additional file 1 of Assessing record linkage between health care and Vital Statistics databases using deterministic methods","year":2021,"lang":"en","type":"article","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute of Health Economics; University of Calgary","funders":"","keywords":"Record linkage; Linkage (software); Health care; Data collection; MEDLINE; Data source; Health data","score_opus":0.5172368392236222,"score_gpt":0.5531341020742365,"score_spread":0.03589726285061434,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6939481667","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0002788326,0.000012163642,0.0008447551,0.00015155385,0.000053291904,0.00020662944,0.995833,0.000552793,0.0020670325],"genre_scores_gemma":[0.018553767,0.00018812736,0.026081083,0.0009891917,0.00020033197,0.0072383485,0.9218274,0.0037083498,0.021213498],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99755186,0.0006822342,0.00047644522,0.0004735366,0.00055733277,0.00025851384],"domain_scores_gemma":[0.8854127,0.09437277,0.0036430527,0.0054504536,0.01000658,0.0011144269],"candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.00500825,0.0011374457,0.0011240387,0.0052965363,0.0013107386,0.0026017248,0.00206271,0.0015931005,0.8977102],"category_scores_gemma":[0.08939799,0.0010682483,0.0017667615,0.0066477945,0.0004827471,0.0021929867,0.0015229812,0.001178425,0.22526792],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002097701,0.00009870321,0.002131717,0.0014512826,0.00006216768,0.000038402148,0.00006341547,0.00077422993,0.000038790356,0.0010798504,0.9855386,0.008512949],"study_design_scores_gemma":[0.00888317,0.00029265406,0.02914053,0.0052586133,0.00044518066,0.00045914794,0.00076854584,0.007775007,0.0011878391,0.020086836,0.92545867,0.0002437454],"about_ca_topic_score_codex":0.0156047065,"about_ca_topic_score_gemma":0.019462893,"teacher_disagreement_score":0.9949918,"about_ca_system_score_codex":0.0019865525,"about_ca_system_score_gemma":0.004006111,"threshold_uncertainty_score":0.14590389},"labels":[],"label_agreement":null},{"id":"W6939837085","doi":"10.6084/m9.figshare.16909645","title":"Additional file 7 of Assessing the suitability of general practice electronic health records for clinical prediction model development: a data quality assessment","year":2021,"lang":"en","type":"article","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Data quality; Record linkage; Quality (philosophy); Health records; General practice; Health data; Quality assessment; Data collection","score_opus":0.6550559088450293,"score_gpt":0.5950021434766101,"score_spread":0.06005376536841922,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6939837085","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0005729655,0.000014322087,0.00081059104,0.00028687232,0.000032686436,0.0007634286,0.9950133,0.00045195615,0.0020538613],"genre_scores_gemma":[0.025885673,0.00017165339,0.019364342,0.0011160687,0.00024010084,0.018100256,0.9168882,0.0017494076,0.016484307],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.9929946,0.002227692,0.0020568585,0.0006643145,0.0016948276,0.00036158835],"domain_scores_gemma":[0.7191227,0.23363043,0.011156092,0.009040029,0.025463164,0.0015876498],"candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.012977269,0.00097308145,0.0010636314,0.004310036,0.0011263818,0.0022475007,0.0022090676,0.0013647751,0.8468087],"category_scores_gemma":[0.1879137,0.0006517429,0.0013354886,0.0058417525,0.00038525127,0.0023918971,0.0018056261,0.0010769361,0.09595143],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006988187,0.00016473682,0.003568458,0.0036116668,0.00010855189,0.00005749932,0.00013827851,0.0005004361,0.00007485799,0.0010058614,0.9740456,0.016025284],"study_design_scores_gemma":[0.017735925,0.00091534446,0.08570341,0.012349953,0.0008057574,0.00068330223,0.0015466235,0.008109708,0.00228783,0.019123567,0.8503596,0.00037901857],"about_ca_topic_score_codex":0.008502331,"about_ca_topic_score_gemma":0.011659032,"teacher_disagreement_score":0.98702276,"about_ca_system_score_codex":0.0021353543,"about_ca_system_score_gemma":0.0041163596,"threshold_uncertainty_score":0.21850878},"labels":[],"label_agreement":null},{"id":"W6943470697","doi":"10.15468/dl.sgpwu4","title":"Occurrence Download","year":2025,"lang":"en","type":"dataset","venue":"Global Biodiversity Information Facility","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Download; Matching (statistics); Range (aeronautics); Set (abstract data type)","score_opus":0.06370320266780717,"score_gpt":0.32470061285242874,"score_spread":0.2609974101846216,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6943470697","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000046711717,0.000027070117,0.000055165136,0.000046083136,0.000013283733,0.0000065103304,0.99869835,0.00048278968,0.00062412804],"genre_scores_gemma":[0.00016314935,0.000030924937,0.00022483904,0.000048369784,0.000003310841,0.00004584628,0.9989285,0.00015023732,0.00040474348],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99896157,0.00014196127,0.00013726854,0.0003579628,0.00023928349,0.00016191659],"domain_scores_gemma":[0.99765223,0.00068821973,0.00019842495,0.0006164771,0.00058856054,0.00025616263],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0010061825,0.0019318296,0.0015028127,0.0043936856,0.0010234397,0.002509874,0.0030048145,0.0020626062,0.13630822],"category_scores_gemma":[0.0064958385,0.0008742232,0.0013097647,0.00857423,0.0004627952,0.0021214667,0.002417526,0.0021425702,0.19322775],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000029532755,0.0000123306945,0.00034908162,0.00045659093,0.000015076808,0.000014956413,0.00002271982,0.00014284738,0.00010294122,0.00040111318,0.9970939,0.0013589129],"study_design_scores_gemma":[0.00009538997,0.000009435172,0.0019145287,0.00018982052,0.000016391876,0.000043021715,0.00008068133,0.00024393018,0.0002066993,0.0010073859,0.99617344,0.000019376452],"about_ca_topic_score_codex":0.02371342,"about_ca_topic_score_gemma":0.037632294,"teacher_disagreement_score":0.8636918,"about_ca_system_score_codex":0.0016521536,"about_ca_system_score_gemma":0.0024268483,"threshold_uncertainty_score":0.45599645},"labels":[],"label_agreement":null},{"id":"W6943651574","doi":"10.15468/dl.vyqka7","title":"Occurrence Download","year":2025,"lang":"en","type":"dataset","venue":"Global Biodiversity Information Facility","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Download; Matching (statistics); Range (aeronautics); Set (abstract data type)","score_opus":0.06370320266780717,"score_gpt":0.32470061285242874,"score_spread":0.2609974101846216,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6943651574","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0000460292,0.000026906779,0.000058324807,0.000044902084,0.00001257947,0.0000064314454,0.99859065,0.0005472466,0.0006669581],"genre_scores_gemma":[0.00016753454,0.000031135576,0.00022285414,0.000046843743,0.0000033297606,0.000043988417,0.99887794,0.00017169309,0.00043466905],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99896765,0.00014129558,0.00013387526,0.0003496844,0.00024249886,0.00016504465],"domain_scores_gemma":[0.9976301,0.00067405653,0.00019877587,0.0006335184,0.000604779,0.00025885188],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.001009622,0.0019707717,0.0015105975,0.0047276085,0.0010418796,0.0025711067,0.0029598835,0.0019861828,0.14669064],"category_scores_gemma":[0.0063774185,0.00087414443,0.0012937807,0.009106509,0.00047730844,0.002191716,0.0025119437,0.0020556794,0.20594595],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000027757998,0.000010950431,0.00034100033,0.0004382976,0.000013604502,0.000014785359,0.000023246508,0.00012865511,0.0000934557,0.00039024974,0.9971629,0.0013550507],"study_design_scores_gemma":[0.000081636565,0.000008426346,0.0018593292,0.00018804714,0.000014727025,0.000040793082,0.00008461976,0.00022204898,0.00019493872,0.00097091356,0.99631566,0.000018905544],"about_ca_topic_score_codex":0.026899282,"about_ca_topic_score_gemma":0.041013665,"teacher_disagreement_score":0.8533094,"about_ca_system_score_codex":0.0016730218,"about_ca_system_score_gemma":0.002509676,"threshold_uncertainty_score":0.4907291},"labels":[],"label_agreement":null},{"id":"W6945376458","doi":"10.25384/sage.7275083","title":"804276_App_4_online_supp – Supplemental material for Health care providers’ roles and responsibilities in management of polypharmacy: Results of a modified Delphi","year":2018,"lang":"en","type":"article","venue":"Sage Journals Data","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Health care; Delphi method; Delphi; Work (physics)","score_opus":0.20773870226602564,"score_gpt":0.4874709574046067,"score_spread":0.2797322551385811,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6945376458","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.06434144,0.0004456253,0.011988789,0.018322313,0.0015527344,0.021264365,0.48505774,0.0060153683,0.39101163],"genre_scores_gemma":[0.18914375,0.0014847001,0.06032093,0.008254621,0.0006789121,0.059213888,0.17846723,0.0033940265,0.49904191],"study_design_codex":"not_applicable","study_design_gemma":"qualitative","domain_scores_codex":[0.9945651,0.0023904708,0.00042110943,0.00019918643,0.0020212946,0.00040275042],"domain_scores_gemma":[0.9312264,0.053695377,0.0010810297,0.0018690163,0.010502159,0.0016260827],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.009975782,0.0005436139,0.0003820247,0.003286302,0.0012383802,0.0014841139,0.0011795571,0.0009256358,0.5984626],"category_scores_gemma":[0.050096557,0.0005641295,0.00052433443,0.0026835238,0.00047988878,0.0016851401,0.0027553441,0.0014908761,0.16063212],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021513017,0.00041869056,0.0022461172,0.0003493483,0.000006531934,0.000060433482,0.00089203933,0.0001154688,0.00024596136,0.00057512196,0.92374617,0.07112892],"study_design_scores_gemma":[0.0006640402,0.00065214053,0.084390864,0.0014248128,0.00005726249,0.0002880436,0.013248287,0.002155312,0.0024083073,0.0039770687,0.8905434,0.00019054557],"about_ca_topic_score_codex":0.010380439,"about_ca_topic_score_gemma":0.01741242,"teacher_disagreement_score":0.5984626,"about_ca_system_score_codex":0.002080728,"about_ca_system_score_gemma":0.004216697,"threshold_uncertainty_score":0.57274437},"labels":[],"label_agreement":null},{"id":"W6945405604","doi":"10.25384/sage.25817337","title":"sj-docx-1-cjk-10.1177_20543581241249365 – Supplemental material for Development and Validation of a Treatment Algorithm for Osteoarthritis Pain Management in Patients With End-Stage Kidney Disease Undergoing Hemodialysis","year":2024,"lang":"en","type":"article","venue":"Sage Journals Data","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Kidney disease; Osteoarthritis; Hemodialysis; Disease; Pain management","score_opus":0.07973810082204656,"score_gpt":0.36019133820789767,"score_spread":0.2804532373858511,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6945405604","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0006023715,0.00008530694,0.0010508667,0.0015350961,0.0005958325,0.0007222356,0.98394126,0.0025195822,0.008947466],"genre_scores_gemma":[0.009793707,0.0003159494,0.012562051,0.0031263144,0.00080245873,0.005151949,0.92798835,0.003581402,0.036677927],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99594337,0.0006679566,0.0012070162,0.0004713655,0.0012832284,0.00042712974],"domain_scores_gemma":[0.92660123,0.03793883,0.004410681,0.004207014,0.023470972,0.0033712632],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0052329754,0.001158195,0.001519012,0.0058563338,0.001463218,0.0047802967,0.0029982603,0.002848349,0.856976],"category_scores_gemma":[0.080419704,0.0014216122,0.0016472834,0.004783231,0.0006841218,0.0028290811,0.0025006987,0.0023543953,0.41478777],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018408346,0.000053672084,0.00090902555,0.00067100447,0.00002093527,0.00001993501,0.000023632896,0.00010502222,0.00008760202,0.00028306287,0.99053156,0.0071104574],"study_design_scores_gemma":[0.005055423,0.00025919,0.030086774,0.0047921995,0.0001839,0.0003672268,0.0005649887,0.0024752007,0.0023837886,0.0065135784,0.94705075,0.00026696603],"about_ca_topic_score_codex":0.016276406,"about_ca_topic_score_gemma":0.029636439,"teacher_disagreement_score":0.856976,"about_ca_system_score_codex":0.0025955057,"about_ca_system_score_gemma":0.006191878,"threshold_uncertainty_score":0.20400643},"labels":[],"label_agreement":null},{"id":"W6945450956","doi":"10.24435/materialscloud:x1-d9","title":"Computational optimization of a drafter for spunbonding polymeric filaments","year":2025,"lang":"en","type":"dataset","venue":"NCCR MARVEL","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computational fluid dynamics; Solver; Airflow; Drag; Breakage; Flow (mathematics); Set (abstract data type); Energy consumption; Finite element method","score_opus":0.10265269435027939,"score_gpt":0.428189467569574,"score_spread":0.3255367732192946,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6945450956","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08019965,0.0015462006,0.016398039,0.002274033,0.00031414063,0.0004852651,0.88374746,0.0060006506,0.0090344725],"genre_scores_gemma":[0.07447535,0.0003706682,0.039998118,0.00030110235,0.000038099453,0.0008138599,0.8807058,0.00028125066,0.0030157669],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99932647,0.00019067666,0.000058911748,0.00021865983,0.00012810316,0.0000772436],"domain_scores_gemma":[0.99881077,0.00057685317,0.00008424789,0.0002086301,0.00026197964,0.00005753711],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0013050068,0.0013592351,0.0007477568,0.0014644489,0.00061230594,0.0012467133,0.0025167167,0.001983487,0.0073428056],"category_scores_gemma":[0.0047313906,0.0004884404,0.0018134423,0.0018678157,0.00043696916,0.0008367299,0.0007034835,0.0010270126,0.004499503],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011284467,0.00080851716,0.02125179,0.0029417886,0.00039711135,0.00046215198,0.00014308217,0.42415708,0.0016151409,0.007177976,0.48003194,0.059884906],"study_design_scores_gemma":[0.0012337164,0.0003329402,0.013198928,0.00041080365,0.00013787812,0.00023493145,0.00037301332,0.71689224,0.0041056145,0.010098246,0.25286996,0.00011173444],"about_ca_topic_score_codex":0.02680606,"about_ca_topic_score_gemma":0.048542023,"teacher_disagreement_score":0.02680606,"about_ca_system_score_codex":0.0015627146,"about_ca_system_score_gemma":0.0018754364,"threshold_uncertainty_score":0.053300083},"labels":[],"label_agreement":null},{"id":"W6945541623","doi":"10.25384/sage.c.7264408.v1","title":"Representational Style Across National and Constituency Contexts: Members of Parliament in Australia, Canada, New Zealand and the United Kingdom","year":2024,"lang":"en","type":"other","venue":"Sage Journals Data","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Parliament; Style (visual arts); Variation (astronomy); Sample (material); Kingdom; Focus (optics)","score_opus":0.2704352597502669,"score_gpt":0.4756283452452875,"score_spread":0.20519308549502063,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6945541623","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9948789,0.00013450005,0.000057623547,0.00032735997,0.000009345249,0.000013794034,0.000080115286,0.0000024052001,0.0044959257],"genre_scores_gemma":[0.99813926,0.00010797871,0.00007148074,0.0000843852,0.0000027432925,0.000008677819,0.000045675828,0.0000048977195,0.0015348591],"study_design_codex":"qualitative","study_design_gemma":"observational","domain_scores_codex":[0.9961671,0.0013056801,0.000176486,0.0002869058,0.00093093654,0.0011329307],"domain_scores_gemma":[0.9941058,0.0014074792,0.0011491191,0.00020479255,0.0016169578,0.001515812],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0027679815,0.00014581515,0.0003734042,0.0015932893,0.006939683,0.002911889,0.0006715626,0.0004859679,0.0033147503],"category_scores_gemma":[0.0096792625,0.00021895008,0.00016199175,0.0032414203,0.003887557,0.0010419239,0.002876344,0.0008244511,0.00028414468],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018546822,0.000036689227,0.27066782,0.00012396439,0.000032121443,0.00064690766,0.69842327,0.000089592875,0.0009052902,0.0022924284,0.0021251033,0.024471356],"study_design_scores_gemma":[0.000004030024,0.000028391789,0.49788398,0.00008261115,0.000011124568,0.00014541441,0.48875293,0.00010680507,0.00019489735,0.00015190517,0.012605064,0.000032805994],"about_ca_topic_score_codex":0.8595919,"about_ca_topic_score_gemma":0.93884873,"teacher_disagreement_score":0.1404081,"about_ca_system_score_codex":0.012886522,"about_ca_system_score_gemma":0.01302912,"threshold_uncertainty_score":0.28246993},"labels":[],"label_agreement":null},{"id":"W6946174898","doi":"10.25740/2zme-3q44","title":"2013 Machine Learning Data Set for NASA's Solar Dynamics Observatory - Atmospheric Imaging Assembly","year":2019,"lang":"en","type":"dataset","venue":"Stanford Digital Repository","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Lockheed Martin (Canada)","funders":"","keywords":"Deliverable; Observatory; Data set; Set (abstract data type); Solar observatory; Scientific instrument; Data processing","score_opus":0.12196196066090455,"score_gpt":0.37230123974075524,"score_spread":0.2503392790798507,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6946174898","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0010501903,0.00013034858,0.00042126884,0.00022231309,0.000081749946,0.000051812403,0.9965593,0.0005694508,0.000913523],"genre_scores_gemma":[0.0009111065,0.00004286266,0.0006344061,0.000050003633,0.000010851246,0.00012892399,0.9977785,0.000038445334,0.00040482788],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99821764,0.00031176495,0.00026099043,0.00041649354,0.0005980258,0.00019499056],"domain_scores_gemma":[0.9965228,0.0009111243,0.00027882197,0.00070423324,0.0012991906,0.00028394404],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002104945,0.0021768867,0.0015322347,0.0034672618,0.0010831506,0.0014152136,0.0041137543,0.0018361458,0.02006008],"category_scores_gemma":[0.008219514,0.000453824,0.0013787512,0.005607677,0.0005405168,0.0012216199,0.0017134064,0.0031218703,0.04118903],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000049171973,0.000068821944,0.0015251883,0.00024230916,0.000037855305,0.000029833984,0.0000135632745,0.00077075016,0.00010688302,0.00030074097,0.9920026,0.0048522577],"study_design_scores_gemma":[0.0005266573,0.000088463436,0.021593671,0.00035492444,0.00009312084,0.00019137282,0.00019029579,0.0073243016,0.0017281354,0.003716316,0.9640964,0.00009620407],"about_ca_topic_score_codex":0.03339249,"about_ca_topic_score_gemma":0.04716744,"teacher_disagreement_score":0.03339249,"about_ca_system_score_codex":0.0019266962,"about_ca_system_score_gemma":0.0032399353,"threshold_uncertainty_score":0.06710768},"labels":[],"label_agreement":null},{"id":"W6946232968","doi":"10.3389/fnagi.2021.646807.s003","title":"Table_1_Mind-Body Exercise Modulates Locus Coeruleus and Ventral Tegmental Area Functional Connectivity in Individuals With Mild Cognitive Impairment.doc","year":2021,"lang":"en","type":"dataset","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Locus coeruleus; Ventral tegmental area; Insula; Montreal Cognitive Assessment; Dopamine; Functional magnetic resonance imaging; Amygdala; Cognition; Norepinephrine","score_opus":0.10382324318799008,"score_gpt":0.33725385093992155,"score_spread":0.23343060775193147,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6946232968","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01055277,0.004332416,0.0007241886,0.0027582143,0.0037703626,0.0015603406,0.91697323,0.001787582,0.05754086],"genre_scores_gemma":[0.06792383,0.010381843,0.008607925,0.008222447,0.0032372295,0.0043522404,0.5784078,0.0010194622,0.3178472],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99990165,0.000013287047,0.000009432284,0.000019162055,0.000030928244,0.000025563188],"domain_scores_gemma":[0.9993243,0.0002583518,0.00006121862,0.00003736378,0.00020439844,0.000114365655],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.00016389531,0.0007185647,0.0014965236,0.00095913897,0.0005835938,0.00077256694,0.00093502755,0.0007936096,0.67526895],"category_scores_gemma":[0.0010398349,0.0002912087,0.0008985817,0.0010522633,0.0001576613,0.00063350634,0.0003868524,0.00062124745,0.07631021],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.006042303,0.0006574163,0.0033262537,0.008025673,0.00021444501,0.0002401416,0.000053487922,0.00019270027,0.0046089645,0.000775705,0.8896044,0.086258665],"study_design_scores_gemma":[0.007949373,0.0042183218,0.2511037,0.0036676165,0.00041122249,0.000839053,0.00034886276,0.000993952,0.0067535387,0.0035083392,0.7200386,0.00016740916],"about_ca_topic_score_codex":0.0074506924,"about_ca_topic_score_gemma":0.020015316,"teacher_disagreement_score":0.67526895,"about_ca_system_score_codex":0.0005557765,"about_ca_system_score_gemma":0.00087873207,"threshold_uncertainty_score":0.46318942},"labels":[],"label_agreement":null},{"id":"W6946567227","doi":"10.34944/dspace/668","title":"Ultrasound induced destruction of emerging contaminants","year":2011,"lang":"en","type":"other","venue":"TUScholarShare (Temple University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Contamination; Groundwater; Surface water; Estrogen; Wastewater; Water treatment; Water pollution","score_opus":0.1919183951531109,"score_gpt":0.3472472640216878,"score_spread":0.1553288688685769,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6946567227","genre_codex":"empirical","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.94300896,0.015308675,0.026863083,0.0003581216,0.00019766678,0.00016196082,0.00037158118,0.0003995375,0.013330485],"genre_scores_gemma":[0.9686067,0.0064869486,0.0089200735,0.00024672932,0.00003669802,0.00011797415,0.0003331977,0.000043971988,0.01520763],"study_design_codex":"bench_or_experimental","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99968255,0.000033878845,0.00001955696,0.000058389192,0.00014205572,0.00006360952],"domain_scores_gemma":[0.99972886,0.000068771966,0.00006997525,0.00002062128,0.00009129592,0.000020473337],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00018887199,0.00030283854,0.00019099156,0.00047416516,0.00020110788,0.0003087655,0.0002777933,0.0006345463,0.0036057148],"category_scores_gemma":[0.00040114456,0.00017838232,0.00034828437,0.0003153981,0.00028236015,0.00034384994,0.0003982852,0.0004335168,0.0006862784],"study_design_candidate":"bench_or_experimental","study_design_consensus":"bench_or_experimental","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00004856484,0.000018026269,0.00041962985,0.00023232448,0.000007999643,0.00018585818,0.000082217346,0.00022297516,0.9885881,0.00016730865,0.00018990038,0.009837116],"study_design_scores_gemma":[0.0000057578304,0.0004229714,0.001701064,0.000017361212,0.000015279978,0.00026729176,0.00007181344,0.00097002985,0.98945427,0.000060267907,0.0070046675,0.000009217287],"about_ca_topic_score_codex":0.0008145533,"about_ca_topic_score_gemma":0.00094196235,"teacher_disagreement_score":0.0036057148,"about_ca_system_score_codex":0.00020898727,"about_ca_system_score_gemma":0.00024378636,"threshold_uncertainty_score":0.012062371},"labels":[],"label_agreement":null},{"id":"W6947568337","doi":"10.3886/icpsr36744","title":"Health Reform Monitoring Survey, United States, First Quarter 2016","year":2016,"lang":"en","type":"dataset","venue":"ICPSR Data Holdings","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"Robert Wood Johnson Foundation","keywords":"Quarter (Canadian coin); Health care; Respondent; Government (linguistics); Health insurance; Mental health; Medicaid; Health policy","score_opus":0.28556330728028534,"score_gpt":0.44662288177941817,"score_spread":0.16105957449913283,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6947568337","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0007258536,0.000073723626,0.00009805674,0.00013374652,0.000034885707,0.00007939341,0.9979195,0.0000761037,0.0008587704],"genre_scores_gemma":[0.0021467826,0.00014318648,0.0003787963,0.0001562535,0.00003158182,0.0006521536,0.9950053,0.000030910953,0.0014550703],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9962333,0.0007432554,0.0007899849,0.00075957,0.0011203055,0.00035366954],"domain_scores_gemma":[0.9917542,0.00091012585,0.001873246,0.0009975773,0.0037681365,0.0006966826],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0037274435,0.0013349488,0.0015151593,0.0034147988,0.00072936533,0.00201251,0.0021887878,0.00094632973,0.014892631],"category_scores_gemma":[0.018000685,0.0008124251,0.00082857365,0.011067103,0.00036324034,0.0013503876,0.001905701,0.0018245095,0.01944483],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022976204,0.00008320715,0.01839338,0.00058287755,0.00007960122,0.000024421435,0.000057454807,0.0003514551,0.000061481616,0.0005964435,0.9749116,0.0046283635],"study_design_scores_gemma":[0.001161863,0.00012363534,0.22230881,0.00077164866,0.00014171765,0.00017104327,0.00036642633,0.0010930647,0.0006112726,0.0011045511,0.7720658,0.00008016966],"about_ca_topic_score_codex":0.0787357,"about_ca_topic_score_gemma":0.067980744,"teacher_disagreement_score":0.0787357,"about_ca_system_score_codex":0.0028191442,"about_ca_system_score_gemma":0.0050656474,"threshold_uncertainty_score":0.15655482},"labels":[],"label_agreement":null},{"id":"W6947633835","doi":"10.3897/zookeys.186.2655.map23","title":"Map 23 from: Webster R, Klimaszewski J, Sweeney J, DeMerchant I (2012) New Staphylinidae (Coleoptera) records with new collection data from New Brunswick, and an addition to the fauna of Quebec, Canada: Aleocharinae. ZooKeys 186: 83-118. https://doi.org/10.3897/zookeys.186.2655","year":2012,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Fauna; Data collection; Biogeography; Projectile point","score_opus":0.13906613123295825,"score_gpt":0.3168371816246145,"score_spread":0.17777105039165625,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6947633835","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000869056,0.00068083545,0.0012665442,0.00082920474,0.0005000242,0.00041997875,0.6510072,0.0031790943,0.34124812],"genre_scores_gemma":[0.008366575,0.0022171647,0.005997248,0.00037061304,0.00019822168,0.0007891485,0.5036823,0.003235635,0.47514302],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9996747,0.000022617898,0.00001680733,0.000042902728,0.00016106264,0.00008187657],"domain_scores_gemma":[0.99831796,0.00014582595,0.00007466922,0.000096349955,0.0011218294,0.00024351574],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0003587833,0.0012245284,0.0007456505,0.0040220045,0.000891698,0.0025386768,0.0013581222,0.0008082519,0.71470743],"category_scores_gemma":[0.0031788338,0.00046446512,0.0006922827,0.0077253547,0.0005255009,0.0013840635,0.0011801083,0.0012985417,0.5190417],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000020661344,0.0000092612245,0.00029931474,0.00025783948,0.0000047164767,0.000039918526,0.000058993337,0.000048639,0.00007184094,0.00017705353,0.98537827,0.013633537],"study_design_scores_gemma":[0.00003212706,0.000006018165,0.0044774227,0.0002586952,0.0000069529283,0.000051245464,0.00012710437,0.00010253301,0.000121434176,0.00022035683,0.99458355,0.000012520799],"about_ca_topic_score_codex":0.37446707,"about_ca_topic_score_gemma":0.51528883,"teacher_disagreement_score":0.71470743,"about_ca_system_score_codex":0.0022073153,"about_ca_system_score_gemma":0.005342929,"threshold_uncertainty_score":0.7445749},"labels":[],"label_agreement":null},{"id":"W6947722435","doi":"10.48448/axzg-7v02","title":"One Wug, Two Wug+s Transformer Inflection Models Hallucinate Affixes","year":2022,"lang":"en","type":"other","venue":"Underline Science Inc.","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Inflection; Transformer; Hallucinating; Reduplication; Hidden Markov model; Feature (linguistics); Pattern recognition (psychology); Inflection point","score_opus":0.21900728770946534,"score_gpt":0.4263552269300338,"score_spread":0.20734793922056846,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6947722435","genre_codex":"empirical","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.57146317,0.0005273599,0.37698805,0.0013538152,0.00020720721,0.0003772658,0.0035374593,0.018378738,0.027166903],"genre_scores_gemma":[0.8782865,0.00017232227,0.10466607,0.00024587274,0.000016529035,0.000105933366,0.0039039433,0.00063286506,0.011969946],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9995989,0.000074041345,0.000023902263,0.00013873476,0.000096855605,0.000067480316],"domain_scores_gemma":[0.99898475,0.00030615868,0.000041181713,0.00036418528,0.0002428564,0.00006081714],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012452174,0.0009814589,0.0004265369,0.00068292674,0.00047456985,0.001492875,0.0014031456,0.0007054479,0.00539631],"category_scores_gemma":[0.0034832524,0.0003169242,0.0009529854,0.00075110415,0.0008011635,0.0016441224,0.0014725757,0.0012025584,0.002198393],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00089236884,0.0002434223,0.038826827,0.00028511352,0.00033211082,0.000445244,0.0011103656,0.21615954,0.030360838,0.01240523,0.013018031,0.685921],"study_design_scores_gemma":[0.00004177501,0.00023874125,0.0106581,0.000041834694,0.0001257212,0.00024797526,0.000516757,0.93255395,0.030412959,0.010143741,0.014952926,0.00006559884],"about_ca_topic_score_codex":0.037619304,"about_ca_topic_score_gemma":0.083560705,"teacher_disagreement_score":0.037619304,"about_ca_system_score_codex":0.0012126525,"about_ca_system_score_gemma":0.0018990708,"threshold_uncertainty_score":0.07480067},"labels":[],"label_agreement":null},{"id":"W6947781523","doi":"10.4224/40001251","title":"Code national de la plomberie : Canada : 2005","year":2008,"lang":"fr","type":"standard","venue":"NPARC","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"National library; Economic shortage","score_opus":0.08290995639327349,"score_gpt":0.38325158651255614,"score_spread":0.30034163011928267,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6947781523","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0038046169,0.004657631,0.011221609,0.009470563,0.003076745,0.00074181944,0.06607201,0.005321294,0.89563376],"genre_scores_gemma":[0.011830481,0.0044102445,0.009810019,0.0027361328,0.00012729922,0.00034719027,0.028922228,0.002072413,0.9397439],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9932854,0.00023967652,0.00029020009,0.0004475653,0.004964213,0.0007729633],"domain_scores_gemma":[0.97884655,0.0007805338,0.00039967927,0.0008302439,0.01839499,0.0007480833],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002506374,0.0011852996,0.00075221114,0.004407181,0.0049123093,0.0074083135,0.0024668528,0.0032588616,0.12521963],"category_scores_gemma":[0.010882451,0.00093420385,0.0006472597,0.007907598,0.0021845137,0.0024802845,0.0016226141,0.0031634609,0.07196608],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00007640022,0.000053947264,0.0015590483,0.00034460213,0.000010960364,0.000106348125,0.00034325666,0.000814727,0.0011495275,0.030177912,0.8922064,0.07315701],"study_design_scores_gemma":[0.0000071782715,0.000005302818,0.0013959872,0.00010475122,0.0000037831198,0.00002896841,0.00007268773,0.0001408222,0.00030580364,0.0005096102,0.9973999,0.000025219657],"about_ca_topic_score_codex":0.954993,"about_ca_topic_score_gemma":0.9553862,"teacher_disagreement_score":0.954993,"about_ca_system_score_codex":0.05444097,"about_ca_system_score_gemma":0.12824035,"threshold_uncertainty_score":0.41890138},"labels":[],"label_agreement":null},{"id":"W6947916432","doi":"10.3897/zookeys.186.2491.map4","title":"Map 4 from: Webster R, Sweeney J, DeMerchant I (2012) New Staphylinidae (Coleoptera) records with new collection data from New Brunswick and eastern Canada: Tachyporinae. ZooKeys 186: 55-82. https://doi.org/10.3897/zookeys.186.2491","year":2012,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Data collection; Topographic map (neuroanatomy); Aerial photography; Projectile point","score_opus":0.16529916422116495,"score_gpt":0.31402023718519045,"score_spread":0.1487210729640255,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6947916432","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000435657,0.00040730648,0.0015604825,0.0004767893,0.00035769757,0.0002737381,0.86801326,0.0039109457,0.124564104],"genre_scores_gemma":[0.0063916505,0.0020650562,0.009906284,0.00023400699,0.00021528723,0.0011672013,0.8480687,0.0049599716,0.12699196],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.9994137,0.00006041239,0.000045341298,0.00009825416,0.00023659895,0.00014559462],"domain_scores_gemma":[0.9972344,0.00051604304,0.00018179083,0.00021866972,0.0015429558,0.0003061593],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.00064698065,0.001930962,0.0012518436,0.0067011556,0.000871668,0.0033293306,0.0021345578,0.001170341,0.7416119],"category_scores_gemma":[0.0065625953,0.000751451,0.0011441469,0.012591628,0.00069611985,0.002309115,0.0017367897,0.0016752062,0.48834684],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000353995,0.000017110717,0.0003548251,0.00080900773,0.000013177739,0.000052860312,0.000081409715,0.00013230546,0.000096548734,0.00035894263,0.9853454,0.012702935],"study_design_scores_gemma":[0.00008985511,0.000009684678,0.0042793467,0.0006857491,0.00002362217,0.00008499502,0.00023470765,0.0003052774,0.00026816418,0.00090526266,0.9930825,0.000030633444],"about_ca_topic_score_codex":0.12287193,"about_ca_topic_score_gemma":0.143684,"teacher_disagreement_score":0.87712806,"about_ca_system_score_codex":0.0014609192,"about_ca_system_score_gemma":0.004304378,"threshold_uncertainty_score":0.36855924},"labels":[],"label_agreement":null},{"id":"W6948106637","doi":"10.48550/arxiv.1607.02187","title":"Cosmological constraints on dark matter annihilation and decay: Cross-correlation analysis of the extragalactic $γ$-ray background and cosmic shear","year":2016,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Dark matter; Annihilation; Cosmology; Weak gravitational lensing; Galaxy; COSMIC cancer database; Dark energy; Observational cosmology","score_opus":0.21804777028805916,"score_gpt":0.3104967252092525,"score_spread":0.09244895492119332,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6948106637","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.94204324,0.00016980953,0.05226282,0.00011637916,0.0000058663363,0.000015337593,0.0014424905,0.00020297545,0.0037411412],"genre_scores_gemma":[0.98820376,0.00013403907,0.009219626,0.00003174926,0.000009709767,0.000018969364,0.0019335883,0.000064960805,0.00038362262],"study_design_codex":"simulation_or_modeling","study_design_gemma":"observational","domain_scores_codex":[0.99961346,0.0001382523,0.000022832099,0.00010162229,0.00007095739,0.00005286131],"domain_scores_gemma":[0.9974172,0.0012415075,0.00054666115,0.0004270858,0.00020862192,0.00015875978],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0013146406,0.00057730655,0.00038966272,0.0009793441,0.00028323263,0.00068725814,0.0007499022,0.000304896,0.0013919325],"category_scores_gemma":[0.0052128807,0.0004119622,0.00063625275,0.00096627587,0.00031902076,0.0006484168,0.00072860805,0.0003716507,0.00029060434],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001599666,0.00008938994,0.36741123,0.00008078004,0.00040834723,0.00025281828,0.00016348326,0.5623739,0.0082391165,0.0325286,0.0015027248,0.026789736],"study_design_scores_gemma":[0.000020044401,0.000022630127,0.112458,0.00001873182,0.00005494458,0.000074644,0.000022844732,0.87426716,0.0040335604,0.0076446207,0.0013502336,0.000032557156],"about_ca_topic_score_codex":0.023237785,"about_ca_topic_score_gemma":0.025019651,"teacher_disagreement_score":0.023237785,"about_ca_system_score_codex":0.0009379918,"about_ca_system_score_gemma":0.0006826063,"threshold_uncertainty_score":0.046205044},"labels":[],"label_agreement":null},{"id":"W6948428539","doi":"10.48550/arxiv.2408.02877","title":"First Indication of Solar $^8$B Neutrinos via Coherent Elastic Neutrino-Nucleus Scattering with XENONnT","year":2024,"lang":"en","type":"preprint","venue":"White Rose Research Online (University of Leeds, The University of Sheffield, University of York)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Neutrino; Solar neutrino; Elastic scattering; Dark matter; Neutrino detector; Time projection chamber; Solar neutrino problem; Standard solar model; Scattering","score_opus":0.11327971253805466,"score_gpt":0.3253196217973527,"score_spread":0.21203990925929803,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6948428539","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.97187185,0.0005782977,0.019367939,0.00013324422,0.00004798302,0.000028405286,0.00028722678,0.00009357279,0.0075915502],"genre_scores_gemma":[0.98784375,0.00026791389,0.009115843,0.000092392926,0.000017585335,0.000018060517,0.0003759324,0.000030927396,0.002237525],"study_design_codex":"bench_or_experimental","study_design_gemma":"observational","domain_scores_codex":[0.9996655,0.00005749876,0.000011048641,0.00009335,0.00012789597,0.00004471504],"domain_scores_gemma":[0.9996929,0.0000855138,0.00007876946,0.00005253777,0.000056034914,0.000034254306],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00042328594,0.00033422216,0.00016353767,0.0003914754,0.00033444914,0.0006463785,0.00039902682,0.00043273685,0.0018052548],"category_scores_gemma":[0.00052042474,0.00027929107,0.0002074811,0.00035344297,0.00042462043,0.0003939213,0.0009647925,0.0004106641,0.00035595812],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000942816,0.00012779958,0.062055808,0.00012277691,0.00012222992,0.0008694118,0.00034710503,0.00058818486,0.9098721,0.00516938,0.0009362274,0.018846126],"study_design_scores_gemma":[0.00005463536,0.00072688016,0.06420203,0.000027729366,0.000090034846,0.0013870489,0.00018869404,0.0054481896,0.91709834,0.001388712,0.009336171,0.000051365714],"about_ca_topic_score_codex":0.0008297283,"about_ca_topic_score_gemma":0.002488773,"teacher_disagreement_score":0.0018052548,"about_ca_system_score_codex":0.0002532795,"about_ca_system_score_gemma":0.0001933381,"threshold_uncertainty_score":0.0060391426},"labels":[],"label_agreement":null},{"id":"W6948502869","doi":"10.5281/zenodo.10492961","title":"The Relationship Between Electron Precipitation and the Population of Trapped Electrons in LEO: New Evidence Supporting a Natural Limit to the Flux of Energetic Electrons","year":2024,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Electron; Adiabatic invariant; Flux (metallurgy); Electron precipitation; Population; Adiabatic process; Energy flux; Momentum (technical analysis); Magnetosphere","score_opus":0.14089040277308085,"score_gpt":0.38362487861749023,"score_spread":0.24273447584440938,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6948502869","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9800208,0.00041680937,0.005736343,0.00043961641,0.000024044535,0.000020022098,0.0044603334,0.00021771467,0.008664148],"genre_scores_gemma":[0.9963176,0.00008748675,0.00105299,0.000049267273,0.000017076252,0.000009661517,0.0018759962,0.000042120322,0.000547804],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99963534,0.00005170118,0.000037450514,0.0001395695,0.00007889806,0.000057071564],"domain_scores_gemma":[0.9968387,0.0014013778,0.0007889655,0.0003624077,0.0003964658,0.00021221073],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008639111,0.00016065178,0.00027332504,0.00065054704,0.00040317702,0.0008168474,0.00042869977,0.00036702125,0.0044410853],"category_scores_gemma":[0.0063543115,0.00015898829,0.0001378911,0.0008650186,0.0004281264,0.0006644584,0.0005335959,0.00047527248,0.00061714655],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00055677537,0.00006706632,0.9518749,0.00016962206,0.00010737526,0.00028995468,0.0003214681,0.0040580723,0.01985967,0.0032460555,0.0027223998,0.016726518],"study_design_scores_gemma":[0.00003647399,0.000070731025,0.965138,0.000028103079,0.000027877466,0.0004151107,0.00021810783,0.01601693,0.009136862,0.0035586643,0.00532861,0.000024519939],"about_ca_topic_score_codex":0.0028243635,"about_ca_topic_score_gemma":0.0037986415,"teacher_disagreement_score":0.0044410853,"about_ca_system_score_codex":0.00052012765,"about_ca_system_score_gemma":0.0002078173,"threshold_uncertainty_score":0.014856875},"labels":[],"label_agreement":null},{"id":"W6948828368","doi":"10.5281/zenodo.10167355","title":"Oxypoda pseudolacustris Klimaszewski","year":2023,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Natural Resources Canada; Agriculture and Agri-Food Canada; Canadian Forest Service","funders":"","keywords":"Sphagnum; Litter; Plant litter; Alder; Beech; Epiphyte; Habitat","score_opus":0.25279138494398545,"score_gpt":0.37728972088856466,"score_spread":0.12449833594457921,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6948828368","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.65563273,0.02655501,0.007653774,0.00056081155,0.0005386518,0.00070023834,0.017386641,0.0010015139,0.28997058],"genre_scores_gemma":[0.9035062,0.0073647876,0.007608117,0.0003936613,0.00011684445,0.00026162522,0.010755637,0.000056574805,0.06993651],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.9999198,0.0000041523326,0.0000121839885,0.0000312027,0.000018943016,0.000013736057],"domain_scores_gemma":[0.9999474,0.0000040151526,0.00002150736,0.0000044639255,0.000014896932,0.000007744621],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00009356594,0.0007840145,0.0001918847,0.002356013,0.00072065124,0.00040552448,0.00031637354,0.00021964636,0.010590396],"category_scores_gemma":[0.00011239475,0.0002353168,0.00027157142,0.0009193969,0.0003019972,0.0008552518,0.00060718524,0.0003145387,0.004248067],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00067097996,0.00027445436,0.06706518,0.0019046622,0.00012760989,0.0012394688,0.00181129,0.0011280258,0.110446855,0.0060289227,0.021422997,0.78787965],"study_design_scores_gemma":[0.000058640195,0.0002693598,0.658666,0.00044789258,0.00015607855,0.0026860498,0.0012984567,0.0005282799,0.0043345233,0.00110078,0.33040825,0.000045688153],"about_ca_topic_score_codex":0.010468172,"about_ca_topic_score_gemma":0.023171531,"teacher_disagreement_score":0.010590396,"about_ca_system_score_codex":0.000579014,"about_ca_system_score_gemma":0.0003026397,"threshold_uncertainty_score":0.035428405},"labels":[],"label_agreement":null},{"id":"W6948865110","doi":"10.5281/zenodo.12086753","title":"Candide bernstein pdf","year":2024,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Musical; Lyrics; Comics; George (robot); Subject (documents); Novella; Symphony; Elegance; Highbrow; Style (visual arts)","score_opus":0.12548051046160175,"score_gpt":0.3517303639041754,"score_spread":0.22624985344257365,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6948865110","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00023625893,0.0015583471,0.0022144944,0.002432462,0.005063564,0.00016293759,0.003296167,0.0041950126,0.9808406],"genre_scores_gemma":[0.0010688582,0.0011421107,0.0007152072,0.00082058285,0.00058831315,0.00005352763,0.001193558,0.0014981983,0.99291974],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9987159,0.000095441275,0.000055633143,0.00017116223,0.0008205216,0.0001414603],"domain_scores_gemma":[0.99750155,0.00036317392,0.0000868317,0.0003184181,0.0011820969,0.0005479215],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0008761244,0.0014519964,0.0010537428,0.0024825954,0.0018747216,0.010210529,0.00201224,0.0024216694,0.87894636],"category_scores_gemma":[0.0060085515,0.0007085213,0.00094939535,0.0020452675,0.00081517565,0.0070068636,0.004250894,0.0032289787,0.83312285],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000019539295,0.000018293886,0.00002859202,0.00010112285,0.0000012988132,0.000057153702,0.00003101406,0.000049580474,0.00025929871,0.002633704,0.948371,0.048429407],"study_design_scores_gemma":[0.000003443136,0.0000053228946,0.000059019825,0.000044238728,8.187904e-7,0.00006550548,0.000026180624,0.000027425756,0.000106427746,0.00046093218,0.9991959,0.0000049085365],"about_ca_topic_score_codex":0.00309371,"about_ca_topic_score_gemma":0.005596595,"teacher_disagreement_score":0.121053636,"about_ca_system_score_codex":0.0016971576,"about_ca_system_score_gemma":0.0018752125,"threshold_uncertainty_score":0.17266834},"labels":[],"label_agreement":null},{"id":"W6948976783","doi":"10.5281/zenodo.11863378","title":"liebeslied rachmaninoff pdf","year":2024,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Piano; MIDI; Musical; Cadenza; Sheet music; Singing","score_opus":0.13724015622244878,"score_gpt":0.3544642453132534,"score_spread":0.2172240890908046,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6948976783","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00030057706,0.00083282054,0.00072085846,0.0013286286,0.0021174112,0.0000888482,0.0011690522,0.0024195167,0.99102235],"genre_scores_gemma":[0.00078470976,0.00039756575,0.00025426305,0.00038567052,0.00021170147,0.000020334885,0.00044717875,0.0006174731,0.9968811],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9993376,0.000039968327,0.000022549224,0.000091806476,0.00042496575,0.00008316938],"domain_scores_gemma":[0.9983941,0.00018115994,0.00005194291,0.00018163222,0.00078121095,0.00041004553],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.00057501934,0.001077504,0.00086376467,0.0019474057,0.0021595757,0.006195259,0.0014164142,0.0020216685,0.9130738],"category_scores_gemma":[0.0029139095,0.00069824996,0.0006105853,0.0013618312,0.0006269615,0.0050334856,0.0029154047,0.0023274026,0.8691414],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000025457799,0.000022153943,0.000036887108,0.00008277183,0.0000010099152,0.000042634154,0.00003719706,0.00002538606,0.00029207964,0.0014786037,0.9504512,0.047504656],"study_design_scores_gemma":[0.0000032946039,0.00000789633,0.00010073142,0.000033932767,8.503267e-7,0.00005064765,0.00003074793,0.00002032665,0.00014043953,0.00027944177,0.99932766,0.0000039551273],"about_ca_topic_score_codex":0.00342576,"about_ca_topic_score_gemma":0.008634577,"teacher_disagreement_score":0.08692622,"about_ca_system_score_codex":0.0013416397,"about_ca_system_score_gemma":0.0012703569,"threshold_uncertainty_score":0.12398964},"labels":[],"label_agreement":null},{"id":"W6948989222","doi":"10.5281/zenodo.12636746","title":"Dataset for the Synaptotagmin-1 antibody screening study","year":2024,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University; Montreal Neurological Institute and Hospital","funders":"","keywords":"Immunofluorescence; Antibody; Immunoprecipitation; Western blot; Raw data","score_opus":0.21869895440489648,"score_gpt":0.4276522099314848,"score_spread":0.2089532555265883,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6948989222","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00016012523,0.00012777599,0.00021192057,0.00011176368,0.00003158883,0.0000357439,0.9987097,0.00018773474,0.0004236926],"genre_scores_gemma":[0.0005577165,0.000091499605,0.0009170945,0.00010346919,0.000008510424,0.00031030204,0.99752873,0.00006733279,0.00041543756],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99780756,0.00050267763,0.00041717652,0.00067427673,0.0004103228,0.00018795479],"domain_scores_gemma":[0.9934795,0.0031846748,0.0006483262,0.0009795988,0.0012750986,0.00043279736],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003043195,0.0015127949,0.0015842378,0.0036728529,0.0008188132,0.0024009242,0.0027028082,0.002789929,0.080553934],"category_scores_gemma":[0.016694846,0.0005510243,0.001465643,0.00471937,0.00047723704,0.000962937,0.0021651646,0.0019759377,0.05961936],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017502515,0.000044599987,0.0018043704,0.0025888055,0.00010475357,0.000053766053,0.0000379537,0.0006745077,0.00035078498,0.0008734623,0.9870804,0.006211495],"study_design_scores_gemma":[0.0005057724,0.000042444415,0.005020151,0.0010263319,0.0001414501,0.00014631145,0.0000836803,0.00074681273,0.00057361915,0.0025819547,0.98908234,0.000049136845],"about_ca_topic_score_codex":0.0076132654,"about_ca_topic_score_gemma":0.017706584,"teacher_disagreement_score":0.080553934,"about_ca_system_score_codex":0.0015566894,"about_ca_system_score_gemma":0.0034475275,"threshold_uncertainty_score":0.26947975},"labels":[],"label_agreement":null},{"id":"W6949522698","doi":"10.5281/zenodo.12752219","title":"Report on the observed climate, projected climate, and projected biodiversity changes for Riding Mountain National Park of Canada under differing levels of warming","year":2024,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"National park; Biodiversity; Climate change; Precipitation; Global warming; Ecosystem; Air temperature","score_opus":0.28875004947777655,"score_gpt":0.34342703711877737,"score_spread":0.05467698764100082,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6949522698","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8689158,0.0010482753,0.0010285917,0.00092179986,0.00006945606,0.00008518394,0.10785882,0.00022402224,0.019848067],"genre_scores_gemma":[0.95364916,0.0010554206,0.0014659646,0.0001878904,0.000017920549,0.000051915595,0.037031583,0.00001876024,0.0065213633],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9997304,0.000013290069,0.000013415576,0.000028155313,0.00014362996,0.00007111616],"domain_scores_gemma":[0.999033,0.000034878532,0.000083214625,0.000014331892,0.0007209498,0.000113556656],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00024015145,0.00031053263,0.00014280461,0.0008154009,0.0012809731,0.0010218171,0.0004446954,0.00024244611,0.0030082217],"category_scores_gemma":[0.00083042914,0.00013301733,0.00043553716,0.0016601811,0.00018119613,0.0003635835,0.00042701024,0.00045115687,0.00041979333],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00010236478,0.000036519268,0.96116346,0.00014453504,0.0001745565,0.00022002905,0.00042763978,0.0053308206,0.00094323,0.00042658646,0.017250607,0.0137796085],"study_design_scores_gemma":[0.000015574786,0.000024606927,0.97946703,0.00003448682,0.000048204216,0.00016392238,0.0013677393,0.0031318704,0.00034219958,0.00011920081,0.015256389,0.000028701928],"about_ca_topic_score_codex":0.97305864,"about_ca_topic_score_gemma":0.9892782,"teacher_disagreement_score":0.026941359,"about_ca_system_score_codex":0.010236353,"about_ca_system_score_gemma":0.010116311,"threshold_uncertainty_score":0.07427031},"labels":[],"label_agreement":null},{"id":"W6949727091","doi":"10.5281/zenodo.3596717","title":"DDI 4 Core: Describing and managing data for traditional and modern data platforms","year":2019,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Statistics Canada","funders":"","keywords":"Interoperability; XML; Scope (computer science); Data management; Data model (GIS); Data system; Metadata; Core (optical fiber)","score_opus":0.6154124851776948,"score_gpt":0.3743942424592931,"score_spread":0.24101824271840167,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6949727091","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0039674197,0.0016989997,0.92640996,0.002973284,0.0009191623,0.0017375171,0.008930808,0.02818347,0.025179405],"genre_scores_gemma":[0.033092424,0.0038860573,0.8402567,0.00364802,0.00050848664,0.002786507,0.06497204,0.017986841,0.032862876],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9697955,0.0064853197,0.0066412613,0.0020717685,0.01311138,0.001894784],"domain_scores_gemma":[0.96214265,0.0077049024,0.0019332855,0.013778875,0.012477187,0.0019630522],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.040234968,0.0020914497,0.0018465926,0.0061705587,0.002203698,0.017472075,0.0071517965,0.003825352,0.009186326],"category_scores_gemma":[0.051908746,0.002860311,0.0030178258,0.005608502,0.003535458,0.015190346,0.010867367,0.0061436794,0.009774378],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006566335,0.00031139576,0.0049301176,0.0035025312,0.00020518937,0.00061973464,0.0039000441,0.010986055,0.018127345,0.38278222,0.2500005,0.32397833],"study_design_scores_gemma":[0.00007345804,0.00012011754,0.000949175,0.0010589071,0.000057704634,0.0005616708,0.00044885118,0.009885115,0.0118630715,0.030689169,0.94413626,0.00015654064],"about_ca_topic_score_codex":0.009301989,"about_ca_topic_score_gemma":0.006065911,"teacher_disagreement_score":0.959765,"about_ca_system_score_codex":0.0053949486,"about_ca_system_score_gemma":0.013848559,"threshold_uncertainty_score":0.21278536},"labels":[],"label_agreement":null},{"id":"W6958119743","doi":"10.6084/m9.figshare.15063754.v1","title":"Additional file 1 of Assessing record linkage between health care and Vital Statistics databases using deterministic methods","year":2021,"lang":"en","type":"article","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute of Health Economics; University of Calgary","funders":"","keywords":"Record linkage; Linkage (software); Health care; Data collection; MEDLINE; Data source; Health data","score_opus":0.5172368392236222,"score_gpt":0.5531341020742365,"score_spread":0.03589726285061434,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6958119743","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0002788326,0.000012163642,0.0008447551,0.00015155385,0.000053291904,0.00020662944,0.995833,0.000552793,0.0020670325],"genre_scores_gemma":[0.018553767,0.00018812736,0.026081083,0.0009891917,0.00020033197,0.0072383485,0.9218274,0.0037083498,0.021213498],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99755186,0.0006822342,0.00047644522,0.0004735366,0.00055733277,0.00025851384],"domain_scores_gemma":[0.8854127,0.09437277,0.0036430527,0.0054504536,0.01000658,0.0011144269],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.00500825,0.0011374457,0.0011240387,0.0052965363,0.0013107386,0.0026017248,0.00206271,0.0015931005,0.8977102],"category_scores_gemma":[0.08939799,0.0010682483,0.0017667615,0.0066477945,0.0004827471,0.0021929867,0.0015229812,0.001178425,0.22526792],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002097701,0.00009870321,0.002131717,0.0014512826,0.00006216768,0.000038402148,0.00006341547,0.00077422993,0.000038790356,0.0010798504,0.9855386,0.008512949],"study_design_scores_gemma":[0.00888317,0.00029265406,0.02914053,0.0052586133,0.00044518066,0.00045914794,0.00076854584,0.007775007,0.0011878391,0.020086836,0.92545867,0.0002437454],"about_ca_topic_score_codex":0.0156047065,"about_ca_topic_score_gemma":0.019462893,"teacher_disagreement_score":0.8977102,"about_ca_system_score_codex":0.0019865525,"about_ca_system_score_gemma":0.004006111,"threshold_uncertainty_score":0.14590389},"labels":[],"label_agreement":null},{"id":"W6958213133","doi":"10.6084/m9.figshare.15063757","title":"Additional file 2 of Assessing record linkage between health care and Vital Statistics databases using deterministic methods","year":2021,"lang":"en","type":"article","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute of Health Economics; University of Calgary","funders":"","keywords":"Record linkage; Linkage (software); Health care; Data collection; MEDLINE; Data source; Health data","score_opus":0.5070898105060758,"score_gpt":0.552299466771692,"score_spread":0.04520965626561613,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6958213133","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00028203803,0.000012010011,0.00083963934,0.00016191063,0.00006422555,0.0002027892,0.99547946,0.0006544233,0.0023034855],"genre_scores_gemma":[0.016685948,0.00016891,0.023398727,0.0010249302,0.00021071106,0.006287441,0.9245379,0.004121753,0.023563558],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.9978672,0.00053835456,0.0004132724,0.0004164514,0.0005152281,0.00024953825],"domain_scores_gemma":[0.904527,0.07773745,0.0030277492,0.00473209,0.008955773,0.0010199882],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0042503364,0.0012162935,0.0011708512,0.005289908,0.0012872277,0.002656279,0.002071968,0.001674514,0.9056344],"category_scores_gemma":[0.07544519,0.001080116,0.0019128915,0.0060984003,0.00046498116,0.0021224744,0.0014958448,0.0011835998,0.23540992],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021861398,0.000093288014,0.0019107261,0.0013427287,0.000059460785,0.000045749748,0.000060362723,0.00072113454,0.000043791904,0.0010189684,0.9866702,0.007814989],"study_design_scores_gemma":[0.008991016,0.00025323962,0.026337,0.004795226,0.00040430235,0.00047953243,0.00069348025,0.007294963,0.001236547,0.020183671,0.9290889,0.00024206896],"about_ca_topic_score_codex":0.016768768,"about_ca_topic_score_gemma":0.020712644,"teacher_disagreement_score":0.9056344,"about_ca_system_score_codex":0.0019024714,"about_ca_system_score_gemma":0.0038254918,"threshold_uncertainty_score":0.134601},"labels":[],"label_agreement":null},{"id":"W6958319911","doi":"10.6084/m9.figshare.26558063","title":"Additional file 7 of Molecular machineries of ciliogenesis, cell survival, and vasculogenesis are differentially expressed during regeneration in explants of the demosponge Halichondria panicea","year":2024,"lang":"en","type":"article","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Regeneration (biology); Explant culture; Vasculogenesis; Cell; Cell culture; Stem cell","score_opus":0.06700869981059077,"score_gpt":0.28772446760745163,"score_spread":0.22071576779686086,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6958319911","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00017429444,0.000016488424,0.00031952656,0.0000621431,0.000029097093,0.000044069628,0.99806374,0.0007244266,0.0005661462],"genre_scores_gemma":[0.005052353,0.00011294075,0.005443067,0.00030645775,0.000055934146,0.0011606831,0.9805055,0.0014693533,0.0058936398],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.9990415,0.00010673308,0.00015818341,0.00024346526,0.00029486706,0.00015527499],"domain_scores_gemma":[0.98085165,0.0140975285,0.0007813082,0.0011892488,0.002512006,0.00056826824],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0018644106,0.0013142726,0.0018288402,0.00326023,0.0014251589,0.002264627,0.0026511753,0.001748453,0.85575545],"category_scores_gemma":[0.015850225,0.00086965243,0.0015472479,0.0042193066,0.000491108,0.0023942788,0.0013352901,0.0014297441,0.21679951],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00063893467,0.0001545031,0.0023975198,0.0046090363,0.00008917921,0.00015803512,0.00014395767,0.0007410998,0.001452864,0.0011305182,0.97848433,0.009999955],"study_design_scores_gemma":[0.005728991,0.0004332281,0.040336702,0.003598981,0.00038280405,0.00066464016,0.0006927787,0.0037796632,0.0066976994,0.014644119,0.92269695,0.0003435025],"about_ca_topic_score_codex":0.0063689095,"about_ca_topic_score_gemma":0.011769887,"teacher_disagreement_score":0.85575545,"about_ca_system_score_codex":0.0012405041,"about_ca_system_score_gemma":0.0022107058,"threshold_uncertainty_score":0.20574725},"labels":[],"label_agreement":null},{"id":"W6958411204","doi":"10.6084/m9.figshare.12875673.v3","title":"Additional file of Sequencing and characterization of the guppy (Poecilia reticulata) transcriptome","year":2020,"lang":"en","type":"article","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Transcriptome; DNA sequencing; Guppy; Selection (genetic algorithm); De novo transcriptome assembly","score_opus":0.2049489606917039,"score_gpt":0.316554761196525,"score_spread":0.11160580050482108,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6958411204","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00020720762,0.000014779135,0.00044214763,0.000048376172,0.000033415945,0.000045760295,0.99795204,0.0006860052,0.0005702097],"genre_scores_gemma":[0.0023933377,0.000053744126,0.0032251137,0.00026682604,0.000038285292,0.00045319478,0.99024206,0.0012953458,0.0020320779],"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.999278,0.00007973429,0.00012882306,0.00024763163,0.00015073153,0.000115147],"domain_scores_gemma":[0.9916997,0.0052230274,0.0005318961,0.00079474575,0.001316306,0.00043446655],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0014183148,0.0014139223,0.0017119469,0.0024287978,0.0013553385,0.0018436532,0.0021013091,0.0018806017,0.6991101],"category_scores_gemma":[0.010289699,0.0009828878,0.001269642,0.0040952647,0.00042511514,0.0019768781,0.001377892,0.0018190276,0.16066909],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010908187,0.00020097713,0.002065174,0.003197534,0.00008530807,0.00020496901,0.00013950943,0.00078569655,0.0034676674,0.0010684188,0.9785985,0.009095411],"study_design_scores_gemma":[0.0037465647,0.00027944156,0.022449907,0.0017993922,0.00025815176,0.000659484,0.0003634475,0.002278755,0.006658723,0.007438646,0.9538355,0.00023201121],"about_ca_topic_score_codex":0.0061398116,"about_ca_topic_score_gemma":0.008420089,"teacher_disagreement_score":0.6991101,"about_ca_system_score_codex":0.0011035259,"about_ca_system_score_gemma":0.0018020022,"threshold_uncertainty_score":0.4291829},"labels":[],"label_agreement":null},{"id":"W6958856114","doi":"10.6084/m9.figshare.c.5328121.v1","title":"simATAC: a single-cell ATAC-seq simulation framework","year":2021,"lang":"en","type":"other","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Vector Institute; University of Toronto; University Health Network","funders":"","keywords":"Chromatin; R package; In silico; ChIA-PET; Statistical model","score_opus":0.3902381974541558,"score_gpt":0.4439022374497102,"score_spread":0.05366403999555441,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6958856114","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014266462,0.00036921122,0.897145,0.0006423947,0.00024925277,0.00039176125,0.024757637,0.053173594,0.009004745],"genre_scores_gemma":[0.13807482,0.0008231912,0.7826954,0.00097237085,0.00014229023,0.0041683284,0.039194826,0.026370954,0.007557771],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99920064,0.00024926596,0.000049177466,0.00018321026,0.00023901183,0.00007861295],"domain_scores_gemma":[0.9978465,0.0012872117,0.000115927505,0.00020632797,0.00037064552,0.0001732915],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002947624,0.0013926399,0.0014187801,0.0008860632,0.0009773541,0.0019965598,0.0044868467,0.0017194885,0.026327422],"category_scores_gemma":[0.006860908,0.0010047872,0.0022041595,0.0010138762,0.0008370402,0.0009795878,0.0019118212,0.0027156828,0.007953793],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00033292666,0.00014400095,0.0036920626,0.0007689087,0.0003814596,0.00024578997,0.00025378886,0.8631045,0.006989526,0.04783566,0.05373053,0.02252091],"study_design_scores_gemma":[0.000071513874,0.000023267381,0.00020551604,0.000028611155,0.000023992397,0.000023335471,0.000017107392,0.9659501,0.0020287884,0.014661959,0.016935367,0.000030450114],"about_ca_topic_score_codex":0.012880682,"about_ca_topic_score_gemma":0.012927225,"teacher_disagreement_score":0.026327422,"about_ca_system_score_codex":0.001395681,"about_ca_system_score_gemma":0.0037628547,"threshold_uncertainty_score":0.08807403},"labels":[],"label_agreement":null},{"id":"W6961817835","doi":"10.15468/dl.mr5nx7","title":"Occurrence Download","year":2025,"lang":"en","type":"dataset","venue":"Global Biodiversity Information Facility","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Matching (statistics); Download; Range (aeronautics); Set (abstract data type); Data set","score_opus":0.06370320266780717,"score_gpt":0.32470061285242874,"score_spread":0.2609974101846216,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6961817835","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000052648164,0.00002498457,0.000058400547,0.00004602116,0.000012829755,0.0000065972417,0.99858284,0.0005621851,0.00065344095],"genre_scores_gemma":[0.00017564914,0.000028446779,0.00022707137,0.00004479239,0.000003283549,0.00004390902,0.99890137,0.00016219086,0.00041320507],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9990081,0.0001341648,0.0001297694,0.00034490434,0.00022746412,0.0001555259],"domain_scores_gemma":[0.9976394,0.00067824003,0.00019922048,0.000633244,0.00058924576,0.0002605814],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0009549969,0.0018893911,0.0014403454,0.004385363,0.0009996288,0.0024129695,0.002925996,0.0019639689,0.13806267],"category_scores_gemma":[0.0063290326,0.0008526219,0.0012454974,0.008358185,0.0004550638,0.0021912134,0.0024078246,0.0020720984,0.19633372],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000029873307,0.000012365402,0.00037107017,0.00043098393,0.000013737273,0.00001504659,0.00002238165,0.00013312964,0.00010024093,0.0003764887,0.99712557,0.0013691097],"study_design_scores_gemma":[0.00009263132,0.000009634095,0.0019984024,0.00018258489,0.000015522082,0.00004433015,0.00008764672,0.00024990932,0.00022117714,0.0009988206,0.99607974,0.000019614641],"about_ca_topic_score_codex":0.023240747,"about_ca_topic_score_gemma":0.03753669,"teacher_disagreement_score":0.86193734,"about_ca_system_score_codex":0.001568527,"about_ca_system_score_gemma":0.002385484,"threshold_uncertainty_score":0.46186566},"labels":[],"label_agreement":null},{"id":"W6961866467","doi":"10.15468/dl.6qnkf9","title":"Occurrence Download","year":2025,"lang":"en","type":"dataset","venue":"Global Biodiversity Information Facility","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Download; Matching (statistics); Range (aeronautics); Set (abstract data type)","score_opus":0.06370320266780717,"score_gpt":0.32470061285242874,"score_spread":0.2609974101846216,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6961866467","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000051393174,0.00002719478,0.00005588101,0.000047683647,0.000013536094,0.0000068193576,0.9986601,0.00052031205,0.0006170625],"genre_scores_gemma":[0.00018400008,0.000030753723,0.00022483572,0.00004781754,0.000003524901,0.000046065783,0.998906,0.00015079993,0.00040619934],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99899465,0.00013879933,0.00013396879,0.00034415038,0.00023192831,0.00015646488],"domain_scores_gemma":[0.9977349,0.0006635203,0.00019303503,0.00060087664,0.00055881793,0.00024889747],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0009853162,0.0018939495,0.0014548815,0.00437374,0.00097482925,0.002472,0.0028147763,0.0019983517,0.13442695],"category_scores_gemma":[0.0062371437,0.00084907084,0.0012921995,0.008189029,0.00045774135,0.0020733767,0.0023909097,0.0020040541,0.18586765],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000029386947,0.000012351211,0.00039373312,0.00046510698,0.000015383077,0.000015775247,0.000023658878,0.00014662398,0.00010392815,0.00038989176,0.99700373,0.0014004194],"study_design_scores_gemma":[0.00009639797,0.000009977979,0.0021871345,0.00019932487,0.000016962289,0.000044143173,0.00008814404,0.00026845894,0.00021677963,0.0010037032,0.9958489,0.000020203279],"about_ca_topic_score_codex":0.024209885,"about_ca_topic_score_gemma":0.03713645,"teacher_disagreement_score":0.86557305,"about_ca_system_score_codex":0.0015669588,"about_ca_system_score_gemma":0.0023520007,"threshold_uncertainty_score":0.44970298},"labels":[],"label_agreement":null},{"id":"W6961979184","doi":"10.15468/dl.euav2u","title":"Occurrence Download","year":2025,"lang":"en","type":"dataset","venue":"Global Biodiversity Information Facility","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Download; Matching (statistics); Range (aeronautics); Set (abstract data type)","score_opus":0.06370320266780717,"score_gpt":0.32470061285242874,"score_spread":0.2609974101846216,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6961979184","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000048711558,0.000026457483,0.00005507181,0.00004486428,0.000012646287,0.000006669084,0.99868375,0.00049929635,0.00062250893],"genre_scores_gemma":[0.0001798088,0.000030095815,0.00022694895,0.00004728067,0.0000034593008,0.000047496924,0.99890566,0.0001534498,0.0004057843],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9989832,0.00014054704,0.00013605123,0.0003450352,0.00023363545,0.00016151293],"domain_scores_gemma":[0.9976998,0.00065984525,0.00019904319,0.00061122194,0.0005759462,0.00025403348],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0010065348,0.0018967377,0.0014697781,0.00448847,0.0009844763,0.00244791,0.002844033,0.0019606908,0.13944943],"category_scores_gemma":[0.006254881,0.000854423,0.0012888967,0.008274281,0.00045211584,0.0020546273,0.002408126,0.0019577974,0.1931807],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000029145358,0.000011683736,0.00037114855,0.0004547858,0.000014682359,0.0000148763565,0.000022972496,0.00013184882,0.00010151466,0.0003755694,0.99709034,0.0013814041],"study_design_scores_gemma":[0.000092761664,0.000009257585,0.002098575,0.00019465025,0.000015914267,0.000042007996,0.00008514319,0.00023834562,0.00020515957,0.0009264351,0.99607253,0.000019152094],"about_ca_topic_score_codex":0.024246065,"about_ca_topic_score_gemma":0.037574794,"teacher_disagreement_score":0.8605506,"about_ca_system_score_codex":0.0015994925,"about_ca_system_score_gemma":0.0023929954,"threshold_uncertainty_score":0.4665048},"labels":[],"label_agreement":null},{"id":"W6962016178","doi":"10.15468/dl.ew6sm2","title":"Occurrence Download","year":2025,"lang":"en","type":"dataset","venue":"Global Biodiversity Information Facility","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Download; Matching (statistics); Range (aeronautics); Set (abstract data type)","score_opus":0.06370320266780717,"score_gpt":0.32470061285242874,"score_spread":0.2609974101846216,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6962016178","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000048651196,0.000026395834,0.000061885,0.000046454647,0.000013332309,0.000006818998,0.9985493,0.00058340526,0.00066380383],"genre_scores_gemma":[0.000170383,0.000030196039,0.00023415,0.0000482564,0.0000033299455,0.00004655525,0.9988715,0.00017521679,0.0004204541],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9989957,0.0001369927,0.00013016093,0.00034382468,0.00023426779,0.00015909507],"domain_scores_gemma":[0.99772424,0.00065747666,0.0001908099,0.0006033854,0.0005699063,0.0002542205],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0010100921,0.0020290858,0.001529077,0.004405422,0.0010107418,0.0025114696,0.0030011681,0.0020092442,0.14357525],"category_scores_gemma":[0.006325768,0.000877794,0.001307495,0.00848664,0.0004639901,0.0021880432,0.0025164962,0.002091967,0.19992752],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000028720446,0.000011933957,0.00033854466,0.00043711878,0.000014137799,0.000014706663,0.000022068389,0.00013923358,0.000096782984,0.0003869673,0.9971391,0.0013706732],"study_design_scores_gemma":[0.000095587355,0.000009019858,0.0018626914,0.00018777257,0.000015420617,0.000041888416,0.00008171943,0.000249333,0.0002092554,0.0010184168,0.99620914,0.00001974531],"about_ca_topic_score_codex":0.02530717,"about_ca_topic_score_gemma":0.039339464,"teacher_disagreement_score":0.85642475,"about_ca_system_score_codex":0.0016443375,"about_ca_system_score_gemma":0.002484976,"threshold_uncertainty_score":0.48030704},"labels":[],"label_agreement":null},{"id":"W6962023329","doi":"10.15468/dl.ccy9ce","title":"Occurrence Download","year":2025,"lang":"en","type":"dataset","venue":"Global Biodiversity Information Facility","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Matching (statistics); Range (aeronautics); Set (abstract data type); Identification (biology); Download","score_opus":0.06370320266780717,"score_gpt":0.32470061285242874,"score_spread":0.2609974101846216,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6962023329","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000050083116,0.000025910773,0.000055644112,0.000040086135,0.000011931482,0.0000063820903,0.9986204,0.0005159299,0.0006737405],"genre_scores_gemma":[0.00016910915,0.000031944874,0.0002522799,0.0000481066,0.000003237741,0.00004439186,0.99882954,0.00016807468,0.00045328194],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9989624,0.00014416024,0.00014395184,0.00035905975,0.00023535073,0.00015514398],"domain_scores_gemma":[0.997592,0.00069783913,0.00022008778,0.0006093273,0.00062525563,0.0002554507],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.000968576,0.0019506578,0.0013923269,0.004401776,0.0009336255,0.0023451096,0.0027584827,0.0018051303,0.13015029],"category_scores_gemma":[0.0062986403,0.00083932193,0.001215949,0.008581772,0.00043854755,0.0020430011,0.0022705183,0.0018762659,0.1815459],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000031710053,0.000011914575,0.00037801862,0.00046409143,0.0000142714025,0.000013982415,0.000022090093,0.00013867048,0.00010509839,0.00041795903,0.99698,0.0014221608],"study_design_scores_gemma":[0.00008592695,0.000009536655,0.0018107803,0.00017057011,0.000014660747,0.00003736719,0.000069671034,0.00021303663,0.00020366404,0.0009683446,0.99639773,0.000018709688],"about_ca_topic_score_codex":0.024626685,"about_ca_topic_score_gemma":0.040902648,"teacher_disagreement_score":0.8698497,"about_ca_system_score_codex":0.0015884284,"about_ca_system_score_gemma":0.0024983874,"threshold_uncertainty_score":0.43539608},"labels":[],"label_agreement":null},{"id":"W6968550496","doi":"10.5281/zenodo.4015732","title":"GLUT1 Inhibitor, A New Therapy For Triple-negative Breast Cancer","year":2020,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Breast cancer; Cancer; Clinical trial; Cancer therapy; MEDLINE; Cancer treatment","score_opus":0.2110105876347001,"score_gpt":0.37012737040253113,"score_spread":0.15911678276783103,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6968550496","genre_codex":"review","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.22581673,0.5134294,0.012713128,0.14599337,0.009748056,0.0013023985,0.017111462,0.0013370218,0.07254839],"genre_scores_gemma":[0.6886025,0.22651376,0.021263663,0.020146627,0.0030507946,0.0005962612,0.011638155,0.00017897406,0.028009247],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9984357,0.0006044673,0.00014273504,0.00015108612,0.00059181446,0.000074234726],"domain_scores_gemma":[0.997601,0.0011085283,0.00038743168,0.0002141428,0.00037305022,0.00031579722],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0040328014,0.00023643093,0.000605008,0.0009306335,0.00034730756,0.0018342816,0.00042972676,0.0005963802,0.0040543536],"category_scores_gemma":[0.005085868,0.00015623332,0.0007334058,0.0010053986,0.00036963527,0.000868163,0.0003871464,0.0013930385,0.00081010663],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.009162692,0.00029084712,0.009946782,0.0013301653,0.00080794876,0.00033255052,0.00008265161,0.0010728139,0.0037581243,0.0026765387,0.08558204,0.8849569],"study_design_scores_gemma":[0.009261922,0.009113008,0.06389831,0.0027518927,0.0031487946,0.0029473214,0.00034471808,0.011108969,0.017896853,0.013330376,0.8660521,0.00014574548],"about_ca_topic_score_codex":0.0025873124,"about_ca_topic_score_gemma":0.011589816,"teacher_disagreement_score":0.0040543536,"about_ca_system_score_codex":0.0018821992,"about_ca_system_score_gemma":0.0021406831,"threshold_uncertainty_score":0.021327794},"labels":[],"label_agreement":null},{"id":"W6968753945","doi":"10.5281/zenodo.3665755","title":"MINTED: Making Identifiers Necessary for Tracking Evolving Data","year":2020,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria","funders":"","keywords":"Software; Tracking (education); Identification (biology); Identifier; Software development; Tracking system","score_opus":0.43594237454996726,"score_gpt":0.4156393998529078,"score_spread":0.02030297469705944,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6968753945","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012293189,0.012610185,0.552851,0.019955784,0.02037709,0.0010074119,0.07433386,0.28764892,0.018922592],"genre_scores_gemma":[0.030373478,0.008842352,0.66553247,0.0074171755,0.0041187946,0.0013639925,0.17202494,0.057227746,0.053099073],"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98763824,0.0028064484,0.0018094649,0.0011498029,0.0059933164,0.00060266856],"domain_scores_gemma":[0.9060743,0.04145494,0.0046437113,0.024389742,0.020246234,0.003191115],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.019432215,0.0027355119,0.0019589765,0.007875142,0.0013752779,0.009478829,0.0067086625,0.0029721104,0.03591105],"category_scores_gemma":[0.11176423,0.0026978154,0.0024156831,0.005072218,0.0019774542,0.012584415,0.0063257436,0.0052914186,0.028491816],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00072013604,0.000118075266,0.0039431253,0.0011736469,0.00018831987,0.00038801678,0.0004730868,0.0013577044,0.003209651,0.007761872,0.7233385,0.25732785],"study_design_scores_gemma":[0.00026269007,0.0001319442,0.0030168227,0.0010029431,0.00024311314,0.00062093197,0.00016510698,0.008279976,0.009241753,0.0100270845,0.96681523,0.00019231778],"about_ca_topic_score_codex":0.00876984,"about_ca_topic_score_gemma":0.011817893,"teacher_disagreement_score":0.9805678,"about_ca_system_score_codex":0.0013619615,"about_ca_system_score_gemma":0.0053219018,"threshold_uncertainty_score":0.12013441},"labels":[],"label_agreement":null},{"id":"W6976977831","doi":"10.6084/m9.figshare.22729174","title":"Additional file 2 of Identifying dementia using medical data linkage in a longitudinal cohort study: Lothian Birth Cohort 1936","year":2023,"lang":"en","type":"article","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"Biotechnology and Biological Sciences Research Council","keywords":"Cohort; Record linkage; Linkage (software); Longitudinal data; Cohort study; Dementia; Data file; Cohort effect","score_opus":0.4652379535492501,"score_gpt":0.46450192286259634,"score_spread":0.000736030686653788,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6976977831","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00020005087,0.000009249649,0.00016363872,0.000053202275,0.00001125249,0.00009736887,0.9983576,0.00007193107,0.0010356727],"genre_scores_gemma":[0.009429741,0.00013057078,0.0025964342,0.00044623553,0.000082033366,0.0030391018,0.97235876,0.00028460755,0.011632532],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.9990221,0.00023733593,0.00020767286,0.00020889744,0.00019118022,0.0001327757],"domain_scores_gemma":[0.98313415,0.011444977,0.0016480883,0.0010213801,0.002254417,0.0004969823],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0019701358,0.00067292334,0.00089826284,0.0024299049,0.0010251015,0.0010493867,0.0014499893,0.00084208813,0.7971852],"category_scores_gemma":[0.025293935,0.0004328008,0.0006996185,0.004827428,0.00019921827,0.0009438786,0.00077132706,0.0005923846,0.086376354],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00024065452,0.00005427121,0.0037834013,0.0010710066,0.000044414202,0.000054482996,0.00005673451,0.00025066553,0.000053666667,0.0006361637,0.9878572,0.0058972593],"study_design_scores_gemma":[0.008479636,0.00045530894,0.100215994,0.0054113124,0.00046598449,0.00081534876,0.00079131394,0.0028837044,0.000903058,0.008974042,0.8704447,0.00015953655],"about_ca_topic_score_codex":0.021013701,"about_ca_topic_score_gemma":0.028351968,"teacher_disagreement_score":0.7971852,"about_ca_system_score_codex":0.0012542678,"about_ca_system_score_gemma":0.0021235815,"threshold_uncertainty_score":0.28929067},"labels":[],"label_agreement":null},{"id":"W6977134819","doi":"10.6084/m9.figshare.16909645.v1","title":"Additional file 7 of Assessing the suitability of general practice electronic health records for clinical prediction model development: a data quality assessment","year":2021,"lang":"en","type":"article","venue":"Figshare","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Data quality; Record linkage; Quality (philosophy); Health records; General practice; Health data; Quality assessment; Data collection","score_opus":0.6550559088450293,"score_gpt":0.5950021434766101,"score_spread":0.06005376536841922,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6977134819","genre_codex":"dataset","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0005729655,0.000014322087,0.00081059104,0.00028687232,0.000032686436,0.0007634286,0.9950133,0.00045195615,0.0020538613],"genre_scores_gemma":[0.025885673,0.00017165339,0.019364342,0.0011160687,0.00024010084,0.018100256,0.9168882,0.0017494076,0.016484307],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9929946,0.002227692,0.0020568585,0.0006643145,0.0016948276,0.00036158835],"domain_scores_gemma":[0.7191227,0.23363043,0.011156092,0.009040029,0.025463164,0.0015876498],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.012977269,0.00097308145,0.0010636314,0.004310036,0.0011263818,0.0022475007,0.0022090676,0.0013647751,0.8468087],"category_scores_gemma":[0.1879137,0.0006517429,0.0013354886,0.0058417525,0.00038525127,0.0023918971,0.0018056261,0.0010769361,0.09595143],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006988187,0.00016473682,0.003568458,0.0036116668,0.00010855189,0.00005749932,0.00013827851,0.0005004361,0.00007485799,0.0010058614,0.9740456,0.016025284],"study_design_scores_gemma":[0.017735925,0.00091534446,0.08570341,0.012349953,0.0008057574,0.00068330223,0.0015466235,0.008109708,0.00228783,0.019123567,0.8503596,0.00037901857],"about_ca_topic_score_codex":0.008502331,"about_ca_topic_score_gemma":0.011659032,"teacher_disagreement_score":0.15319133,"about_ca_system_score_codex":0.0021353543,"about_ca_system_score_gemma":0.0041163596,"threshold_uncertainty_score":0.21850878},"labels":[],"label_agreement":null},{"id":"W6979330234","doi":"","title":"A Unified Model for Cardinality Estimation by Learning from Data and Queries via Sum-Product Networks","year":2025,"lang":"en","type":"article","venue":"ArXiv.org","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Cardinality (data modeling); Key (lock); Inference; Component (thermodynamics); Node (physics); Data modeling; Computation; Distributed database; Limiting","score_opus":0.2847290431817994,"score_gpt":0.41813153751461796,"score_spread":0.13340249433281853,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6979330234","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005818566,0.00015375837,0.9927739,0.00019559363,0.000011798066,0.000043137592,0.00019826987,0.00030597203,0.00049899233],"genre_scores_gemma":[0.4140851,0.0009258605,0.5792896,0.0002689509,0.0001226542,0.00045773308,0.0017303736,0.00022057506,0.0028992014],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.996828,0.0008882414,0.00021188147,0.0008943585,0.00096368097,0.00021377027],"domain_scores_gemma":[0.9922414,0.0049356427,0.00058491365,0.0009850704,0.0010251588,0.0002278674],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0042580003,0.0011201771,0.0015244125,0.0017652106,0.0006842408,0.0030163801,0.0038562315,0.0011727856,0.0020238333],"category_scores_gemma":[0.015699288,0.0010288703,0.001084233,0.0031277747,0.0013520553,0.0075463085,0.0024491944,0.0025766287,0.0005461921],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000954679,0.000052179006,0.0014713316,0.0000701175,0.00004367655,0.00004764401,0.00008733099,0.91909766,0.0008083065,0.027971288,0.0013287495,0.048926238],"study_design_scores_gemma":[0.0000020342754,0.000006110511,0.000053506163,0.0000029535147,0.0000044927533,0.000008288743,0.000004422273,0.98946893,0.00015907177,0.010078687,0.00020874584,0.0000027113213],"about_ca_topic_score_codex":0.010693677,"about_ca_topic_score_gemma":0.012395086,"teacher_disagreement_score":0.010693677,"about_ca_system_score_codex":0.0027799467,"about_ca_system_score_gemma":0.0025105092,"threshold_uncertainty_score":0.022518754},"labels":[],"label_agreement":null},{"id":"W6997218280","doi":"","title":"A Weighted-Tree Simplicity Algorithm for Similarity Matching of Partial Product Descriptions","year":2005,"lang":"en","type":"article","venue":"NPARC","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"University of New Brunswick","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Simplicity; Tree (set theory); Matching (statistics); Similarity (geometry); Product (mathematics); Measure (data warehouse); Simple (philosophy); Order (exchange)","score_opus":0.1405199667415054,"score_gpt":0.3890718620059818,"score_spread":0.2485518952644764,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6997218280","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014715209,0.00010713977,0.98308474,0.00009829326,0.000015859267,0.00019020605,0.00016215374,0.00057039614,0.0010559473],"genre_scores_gemma":[0.09565084,0.00008111769,0.9024892,0.000066752065,0.000017311666,0.00016523375,0.00057027093,0.000093161136,0.0008661238],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9975321,0.0005941702,0.0002714139,0.00048420863,0.0009850217,0.00013310341],"domain_scores_gemma":[0.9958312,0.0017493245,0.00048108396,0.00096004194,0.0008239106,0.00015449362],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0026285443,0.0005124803,0.0011379502,0.0032153823,0.00095569814,0.0015381903,0.002212641,0.0014241352,0.0035015082],"category_scores_gemma":[0.013623309,0.00047974972,0.001170729,0.0042344276,0.0007005713,0.004410297,0.0025349522,0.0010785214,0.0011034107],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00034782392,0.00023108268,0.0041481415,0.00027149523,0.00014028176,0.00013514458,0.00037102526,0.08741693,0.009501965,0.0649051,0.005932643,0.82659847],"study_design_scores_gemma":[0.00008343004,0.00017462815,0.0013024308,0.000032403696,0.000059984926,0.00041887816,0.0000990641,0.8987125,0.0068741627,0.085124195,0.007077146,0.000041056603],"about_ca_topic_score_codex":0.002047362,"about_ca_topic_score_gemma":0.0029456976,"teacher_disagreement_score":0.0035015082,"about_ca_system_score_codex":0.0013573788,"about_ca_system_score_gemma":0.0017879034,"threshold_uncertainty_score":0.013901293},"labels":[],"label_agreement":null},{"id":"W6999452055","doi":"","title":"Data Quality Through Active Constraint Discovery and Maintenance","year":2012,"lang":"en","type":"dissertation","venue":"TSpace (University of Toronto)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Leverage (statistics); Constraint (computer-aided design); Data integrity; Data quality; Set (abstract data type); Domain (mathematical analysis); Class (philosophy)","score_opus":0.184695293736358,"score_gpt":0.41658034300572705,"score_spread":0.23188504926936904,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6999452055","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008707541,0.0004927975,0.98183006,0.0011638372,0.00009922189,0.0002452164,0.00038284887,0.005366768,0.0017116511],"genre_scores_gemma":[0.091788635,0.00037771207,0.90245414,0.0004459377,0.00009606187,0.00026838668,0.0014310864,0.0009925484,0.0021455605],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.968972,0.008462105,0.0029340067,0.005473561,0.013083747,0.0010745572],"domain_scores_gemma":[0.83889955,0.073451586,0.011399705,0.049233295,0.02569703,0.0013188913],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.026712023,0.0022119093,0.002334736,0.0064259926,0.002906275,0.009260726,0.010584916,0.0027011482,0.0041388352],"category_scores_gemma":[0.12734231,0.0020420505,0.0031238713,0.0058273477,0.003577784,0.012121643,0.009434886,0.005356438,0.001993348],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004293898,0.00046191504,0.011033655,0.000929388,0.00044621958,0.00036803412,0.0016930457,0.087559156,0.009993577,0.061236333,0.020373749,0.80547553],"study_design_scores_gemma":[0.00012985716,0.00012838516,0.0014670907,0.00025540718,0.0002192829,0.00047365288,0.00068283855,0.8448066,0.030900048,0.0866517,0.034153234,0.0001319635],"about_ca_topic_score_codex":0.01142821,"about_ca_topic_score_gemma":0.009818079,"teacher_disagreement_score":0.026712023,"about_ca_system_score_codex":0.0032386098,"about_ca_system_score_gemma":0.0074274936,"threshold_uncertainty_score":0.14126831},"labels":[],"label_agreement":null},{"id":"W7009593967","doi":"","title":"Évaluation d’Apache Ozone et de son intégration du protocole de consensus RAFT avec la librairie Apache Ratis afin d'obtenir un système distribué fiable et cohérent","year":2024,"lang":"fr","type":"article","venue":"R-libre (Université Téluq)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Saint-Boniface","funders":"","keywords":"Environmental policy; Air pollutants","score_opus":0.054902433307739605,"score_gpt":0.3312633851535205,"score_spread":0.2763609518457809,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7009593967","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.48217452,0.005916379,0.3157867,0.0044887913,0.00414968,0.004671998,0.005336604,0.12088566,0.056589715],"genre_scores_gemma":[0.6993644,0.0020733774,0.24636017,0.0008321946,0.0002799213,0.0019575362,0.013122407,0.007934607,0.028075265],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98139876,0.004878323,0.0014481995,0.0018569236,0.009150088,0.0012676687],"domain_scores_gemma":[0.97743535,0.0067611365,0.00088458613,0.004605116,0.0087140985,0.0015996734],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.022187775,0.001881035,0.0014442826,0.0022608365,0.0019710604,0.0044996333,0.0031532415,0.001533328,0.0075179706],"category_scores_gemma":[0.03652578,0.0013246547,0.0014133926,0.0023172298,0.0017793907,0.0060335365,0.0034675323,0.003430279,0.0031295607],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.008950467,0.0030585893,0.032663837,0.0050147064,0.001566289,0.0011697247,0.0053942516,0.05422069,0.110592954,0.028163629,0.13828705,0.6109178],"study_design_scores_gemma":[0.0025384803,0.007883995,0.048268933,0.0010069461,0.001254809,0.0011185703,0.0050791227,0.4462584,0.14872338,0.016465215,0.32045543,0.0009468019],"about_ca_topic_score_codex":0.028303953,"about_ca_topic_score_gemma":0.015353262,"teacher_disagreement_score":0.028303953,"about_ca_system_score_codex":0.002333065,"about_ca_system_score_gemma":0.0073309047,"threshold_uncertainty_score":0.11734152},"labels":[],"label_agreement":null},{"id":"W7009691967","doi":"","title":"Evaluating the Service Quality of Information Services Using a New 'P-C-P' Attributes Model","year":2001,"lang":"en","type":"article","venue":"Research Portal (Queen's University Belfast)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University","funders":"","keywords":"Information system; Quality (philosophy); Service (business); Service quality; Information quality; Information technology; Services computing; Key (lock); Context (archaeology)","score_opus":0.3957820113264607,"score_gpt":0.48819290166093615,"score_spread":0.09241089033447547,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7009691967","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.48786965,0.00038285233,0.5002977,0.0017213558,0.00007945646,0.00053115824,0.0010307855,0.00039526162,0.007691834],"genre_scores_gemma":[0.9503969,0.00009395536,0.04839702,0.000049991242,0.000026774847,0.00011927035,0.0003285503,0.000026765632,0.0005606779],"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9876466,0.0066899904,0.0008859443,0.0010592277,0.0029149663,0.00080326217],"domain_scores_gemma":[0.96320075,0.028311571,0.00209064,0.0018230244,0.003282009,0.0012919741],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.012324526,0.0011741935,0.0014966661,0.004688794,0.00093438063,0.006445977,0.0024697422,0.002358665,0.0028798403],"category_scores_gemma":[0.037359625,0.00061012985,0.0025635872,0.0054315445,0.0018152163,0.0076032747,0.0029872467,0.00226878,0.00032566674],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013541193,0.0009312608,0.045469895,0.00032508612,0.0006232591,0.00014835515,0.00025622817,0.85008824,0.00142983,0.033384774,0.0011920461,0.064796895],"study_design_scores_gemma":[0.00003406511,0.0001876435,0.0025294684,0.000009928555,0.00006576982,0.000028205008,0.00007387545,0.989645,0.00027805666,0.0069524776,0.00017960409,0.000016022997],"about_ca_topic_score_codex":0.017303094,"about_ca_topic_score_gemma":0.009127858,"teacher_disagreement_score":0.017303094,"about_ca_system_score_codex":0.0049437922,"about_ca_system_score_gemma":0.0028029562,"threshold_uncertainty_score":0.06517911},"labels":[],"label_agreement":null},{"id":"W7020951295","doi":"","title":"Miracle Cure: How to Solve America's Health Care Crisis and Why Canada Isn't the Answer","year":2004,"lang":"en","type":"other","venue":"DigitalGeorgetown (Georgetown University Library)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Miracle; Health care; Public health; Key (lock); Health services","score_opus":0.019644823314013363,"score_gpt":0.2453423860444746,"score_spread":0.2256975627304612,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7020951295","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0011450533,0.008044621,0.0011797793,0.7914402,0.002879062,0.000046031433,0.0016712153,0.000511237,0.19308284],"genre_scores_gemma":[0.07226244,0.026616618,0.008501105,0.26371107,0.0025427109,0.00015314092,0.002480411,0.0010161299,0.6227163],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.994938,0.0008705642,0.00011641834,0.00025954391,0.002532054,0.001283368],"domain_scores_gemma":[0.98064137,0.0035039342,0.00044484527,0.0010085693,0.009359517,0.005041909],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0057125688,0.00084150094,0.0007846622,0.0034157368,0.009923981,0.018782264,0.0021735323,0.0075405156,0.0860458],"category_scores_gemma":[0.029099008,0.00036687223,0.0005932296,0.006955708,0.007962654,0.008670787,0.004474168,0.0082099615,0.01091102],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000009132068,0.000015366846,0.00039222083,0.000053751497,0.0000056584327,0.000030018098,0.00027100364,0.000086793836,0.000028408856,0.036793124,0.92938423,0.03293035],"study_design_scores_gemma":[0.000021626545,0.0000050116123,0.0017993598,0.00027452337,0.000011759248,0.00002621613,0.0018303914,0.00040466234,0.000079178244,0.021694547,0.97382474,0.000027953114],"about_ca_topic_score_codex":0.93922126,"about_ca_topic_score_gemma":0.960889,"teacher_disagreement_score":0.0860458,"about_ca_system_score_codex":0.049849663,"about_ca_system_score_gemma":0.19215545,"threshold_uncertainty_score":0.3616863},"labels":[],"label_agreement":null},{"id":"W7023783286","doi":"","title":"Prenatal diagnoses lead to more abortions in Canada","year":2002,"lang":"en","type":"other","venue":"DigitalGeorgetown (Georgetown University Library)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Nucleofection; Gestational period; TSG101; Dysgeusia; Liquation; Diafiltration; Triacetin; Emperipolesis; Durvalumab","score_opus":0.03365306956211648,"score_gpt":0.25270563497599535,"score_spread":0.21905256541387888,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7023783286","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.15345831,0.016681971,0.0006174221,0.31328142,0.0067521133,0.00030250443,0.17034076,0.0012568437,0.33730868],"genre_scores_gemma":[0.43729585,0.023184748,0.0015979445,0.06440781,0.002912926,0.00012178388,0.043564703,0.00051088986,0.42640337],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.99861777,0.00008189389,0.000064545115,0.000074713724,0.0007975033,0.00036366042],"domain_scores_gemma":[0.99260324,0.0013219866,0.00064074737,0.00019475746,0.0034427803,0.0017965845],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006923483,0.00028588812,0.00028618862,0.0017690202,0.0021373467,0.0025849298,0.0010047005,0.0021046654,0.043708358],"category_scores_gemma":[0.006589419,0.00038986595,0.00080481987,0.0045786123,0.0005816289,0.0003933029,0.0005048012,0.0017527931,0.0016698869],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002551677,0.000059969614,0.08039025,0.00025119705,0.000072330266,0.0005303605,0.0003906436,0.00046696613,0.00012607635,0.0014805872,0.8649605,0.05101593],"study_design_scores_gemma":[0.00024422648,0.000059483427,0.6746395,0.00034521183,0.0002159851,0.00051164103,0.0028649787,0.0013258883,0.0006086138,0.00083169236,0.3182728,0.00007995329],"about_ca_topic_score_codex":0.9935222,"about_ca_topic_score_gemma":0.9968645,"teacher_disagreement_score":0.043708358,"about_ca_system_score_codex":0.024859414,"about_ca_system_score_gemma":0.056885857,"threshold_uncertainty_score":0.18036854},"labels":[],"label_agreement":null},{"id":"W7025214214","doi":"","title":"Top smart cities in Canada, India and beyond","year":2015,"lang":"en","type":"other","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"","score_opus":0.08843154607919923,"score_gpt":0.34236116211156,"score_spread":0.25392961603236075,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7025214214","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.114631206,0.0052649854,0.0016545434,0.026479932,0.0007964935,0.00022430328,0.08041024,0.0016163687,0.768922],"genre_scores_gemma":[0.42212027,0.0051145516,0.0024611063,0.0024076856,0.0001778394,0.00011147303,0.024416896,0.00041927156,0.54277086],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9982236,0.00008013198,0.000023820212,0.000082789724,0.0005636535,0.0010259739],"domain_scores_gemma":[0.9959508,0.0002148881,0.00014942109,0.00014756147,0.0017026289,0.0018345425],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00064986787,0.00048697926,0.0002954457,0.0027113806,0.0061557074,0.0077959797,0.0012830108,0.0010188076,0.032157537],"category_scores_gemma":[0.003043387,0.00027367155,0.0003663422,0.0103434725,0.001649319,0.0020669242,0.0032362507,0.0017511868,0.004413406],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000111887704,0.00007947211,0.028391777,0.00025493384,0.0000269823,0.00022903566,0.0018172438,0.0017707666,0.000116366,0.07762222,0.797516,0.092063256],"study_design_scores_gemma":[0.00002378708,0.000015980128,0.08870037,0.00017983955,0.000023018452,0.000103838465,0.01069709,0.001827674,0.00040527122,0.005551356,0.89242464,0.000047271085],"about_ca_topic_score_codex":0.9740615,"about_ca_topic_score_gemma":0.9906933,"teacher_disagreement_score":0.04491217,"about_ca_system_score_codex":0.04491217,"about_ca_system_score_gemma":0.10935961,"threshold_uncertainty_score":0.32586217},"labels":[],"label_agreement":null},{"id":"W7025225528","doi":"","title":"Turning Open Government Data Portals into Interactive Databases","year":2022,"lang":"en","type":"dissertation","venue":"UWSpace (University of Waterloo)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Upload; Key (lock); Governor; Set (abstract data type); Download; Table (database); Open data; Publication; Web application","score_opus":0.13103167425199025,"score_gpt":0.37989511964050693,"score_spread":0.24886344538851668,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7025225528","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011881784,0.0013870767,0.71543497,0.009260446,0.0016460354,0.0005734813,0.010118677,0.12050369,0.12919395],"genre_scores_gemma":[0.14436634,0.00386374,0.7002752,0.004475586,0.0014621232,0.0012504145,0.032862436,0.026635582,0.08480856],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9928444,0.0021944216,0.00050858856,0.0009244962,0.0030585884,0.00046950797],"domain_scores_gemma":[0.98602355,0.0047724466,0.0005391505,0.0053877034,0.0017748345,0.0015023373],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0088988,0.00063876546,0.00068443414,0.0030804803,0.001960675,0.014921096,0.0031988441,0.0016530118,0.030576605],"category_scores_gemma":[0.022020679,0.0013284094,0.001086603,0.0062732957,0.0021627499,0.019992676,0.01706407,0.0037653742,0.015969893],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004440809,0.00022690024,0.0026803545,0.0004649938,0.000061004033,0.00062536256,0.007292709,0.0034805024,0.0044495612,0.35588875,0.33873764,0.28564817],"study_design_scores_gemma":[0.000053569278,0.000018794257,0.00042152058,0.00012505839,0.000010210935,0.00007562228,0.0008134915,0.0048478935,0.0019731503,0.06875116,0.9228725,0.000037138427],"about_ca_topic_score_codex":0.0059752413,"about_ca_topic_score_gemma":0.0068029584,"teacher_disagreement_score":0.030576605,"about_ca_system_score_codex":0.002034267,"about_ca_system_score_gemma":0.0022562216,"threshold_uncertainty_score":0.10228896},"labels":[],"label_agreement":null},{"id":"W7034066571","doi":"","title":"SinglePoint publishes its monetary effects for the moment of the 2021 quarter and reports on its business","year":2021,"lang":"en","type":"other","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Quarter (Canadian coin); Moment (physics); Monetary policy; Business cycle; Monetary system","score_opus":0.1146221513617565,"score_gpt":0.35108818676756753,"score_spread":0.23646603540581101,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7034066571","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0045048483,0.0028266916,0.004922544,0.012100166,0.0073668477,0.00023917256,0.21683164,0.009206878,0.74200124],"genre_scores_gemma":[0.018746685,0.0029433588,0.004113083,0.0008726987,0.0027023486,0.00019045836,0.09305804,0.004970283,0.872403],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9973847,0.0001796748,0.00012127194,0.00022344412,0.001969175,0.00012169434],"domain_scores_gemma":[0.9793443,0.0048645884,0.0021474697,0.0018827559,0.0093532195,0.002407714],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0040649683,0.0014391957,0.00078423467,0.006238778,0.00079445896,0.0069615864,0.0014471249,0.0019618818,0.28864628],"category_scores_gemma":[0.02883323,0.00043221496,0.0005836461,0.0076218806,0.0007537787,0.0026628356,0.0017268396,0.0021013871,0.18583143],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00019708878,0.000051990515,0.0013139138,0.00020840878,0.000016409089,0.00003302018,0.00002372992,0.00061065477,0.00045007883,0.0051593403,0.91515326,0.07678202],"study_design_scores_gemma":[0.00007169668,0.000076086704,0.005539886,0.00011687336,0.000015422702,0.000030541025,0.00007917117,0.0012788967,0.0019099843,0.0053313235,0.9855194,0.000030666997],"about_ca_topic_score_codex":0.014597339,"about_ca_topic_score_gemma":0.010343698,"teacher_disagreement_score":0.28864628,"about_ca_system_score_codex":0.0024542173,"about_ca_system_score_gemma":0.0049413857,"threshold_uncertainty_score":0.965618},"labels":[],"label_agreement":null},{"id":"W7037404654","doi":"","title":"Dougal - Live at Liquid Adrenaline Timewarp 5 Part 1 08-05-2000","year":2000,"lang":"en","type":"other","venue":"Internet Archive (Internet Archive)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Epinephrine; Liquid phase; Liquid liquid; Context (archaeology)","score_opus":0.05253383487044749,"score_gpt":0.3230119861615656,"score_spread":0.27047815129111813,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7037404654","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0066636433,0.0004907487,0.003594881,0.001607954,0.0013171202,0.0008374145,0.035259478,0.0113603305,0.9388685],"genre_scores_gemma":[0.0058783363,0.00020050247,0.0013723683,0.0001491192,0.000095813644,0.00007489872,0.011215695,0.0012573267,0.979756],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9995407,0.0000139945105,0.00000807238,0.000045624685,0.00032218086,0.00006942902],"domain_scores_gemma":[0.9987941,0.000117632706,0.000038284375,0.00018267712,0.00056823844,0.0002990799],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.00058828155,0.00064193894,0.00051285565,0.0013161673,0.0013171529,0.002363133,0.0014571229,0.00093799137,0.727805],"category_scores_gemma":[0.0014174066,0.00042791586,0.00028976938,0.0011188313,0.00033883099,0.0008037909,0.0011470534,0.0013484533,0.4206899],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000357437,0.00012528148,0.0003985145,0.00013924752,0.000004103557,0.00006029685,0.000069861904,0.000087109955,0.005215482,0.0012002491,0.9174711,0.07487125],"study_design_scores_gemma":[0.00005766225,0.00011055838,0.0049680555,0.000033618893,0.0000046359855,0.00003090871,0.0001074152,0.00019022112,0.0047158077,0.00036054174,0.98940724,0.000013280429],"about_ca_topic_score_codex":0.024838904,"about_ca_topic_score_gemma":0.082184605,"teacher_disagreement_score":0.27219498,"about_ca_system_score_codex":0.0019251883,"about_ca_system_score_gemma":0.0015715782,"threshold_uncertainty_score":0.3882531},"labels":[],"label_agreement":null},{"id":"W7039308945","doi":"","title":"Le lien entre la représentation des femmes aux conseils d'administration et l'efficacité des politiques d'investissement : cas des entreprises canadiennes","year":2021,"lang":"fr","type":"other","venue":"Archipelago (University of Quebec in Montreal)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Context (archaeology); Citizenship; Lien","score_opus":0.09419180032451427,"score_gpt":0.3403797823532314,"score_spread":0.24618798202871714,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7039308945","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.98270124,0.0013914729,0.00056819915,0.0020889759,0.00003647549,0.000026106294,0.0009763829,0.000008089166,0.012203134],"genre_scores_gemma":[0.9927927,0.000639472,0.00036144143,0.00027602885,0.0000209624,0.000043609965,0.00030989532,0.000004022927,0.0055519547],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9983076,0.0005476584,0.00007449887,0.00024178412,0.00030497904,0.00052345666],"domain_scores_gemma":[0.9925984,0.00290282,0.0026829215,0.00028164397,0.00085080275,0.00068345206],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019411321,0.0002841696,0.00038784547,0.0013504584,0.001152442,0.0015703405,0.00059317535,0.0006663584,0.012222021],"category_scores_gemma":[0.008144361,0.00024692027,0.00041588786,0.002692101,0.0007896086,0.0009928122,0.001293827,0.0012098593,0.00068244274],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014869655,0.00006945487,0.9481215,0.00021808255,0.00016895063,0.00033271237,0.011292528,0.00034903476,0.0003471174,0.006915233,0.0027981948,0.029238477],"study_design_scores_gemma":[0.000008256807,0.00007240532,0.964469,0.00037874895,0.00008522226,0.00012480833,0.018474443,0.00037729487,0.0001957744,0.0009652805,0.0148275765,0.000021171561],"about_ca_topic_score_codex":0.16288325,"about_ca_topic_score_gemma":0.23339067,"teacher_disagreement_score":0.8371167,"about_ca_system_score_codex":0.0020965831,"about_ca_system_score_gemma":0.0030970606,"threshold_uncertainty_score":0.32387036},"labels":[],"label_agreement":null},{"id":"W7039554015","doi":"","title":"Miller, Myrtle Alberta (Birth, 1893-10-23)","year":2012,"lang":"en","type":"other","venue":"Spectrum Research Repository (Concordia University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Natural (archaeology); Assemblage (archaeology); Feature (linguistics)","score_opus":0.11179679212113681,"score_gpt":0.35689595608931535,"score_spread":0.24509916396817855,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7039554015","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0032104324,0.028259192,0.0007528238,0.025649969,0.011130202,0.000057358357,0.00876889,0.0006691046,0.9215021],"genre_scores_gemma":[0.0028161916,0.0032645755,0.000172124,0.0008862847,0.00026069608,0.0000055664614,0.00049682957,0.00006133162,0.9920364],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9997472,0.000008666504,0.000007792378,0.00006316544,0.00012524995,0.000047939666],"domain_scores_gemma":[0.9996686,0.000027589453,0.000013518683,0.000013596843,0.00014095313,0.00013583267],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.00043505992,0.0004788449,0.00038678912,0.0011132127,0.002688199,0.00205287,0.000704557,0.0009352005,0.37204632],"category_scores_gemma":[0.00092221616,0.00026023728,0.00020742176,0.0014834724,0.000553907,0.0011627149,0.0011370226,0.0018650973,0.14119321],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00002749799,0.00001017913,0.0007621301,0.000029650442,0.0000025087602,0.00016513151,0.00013377311,0.00004641882,0.000110600035,0.0044134078,0.91331553,0.080983154],"study_design_scores_gemma":[0.0000015097764,0.000004117908,0.0010077476,0.00002929245,0.0000014284408,0.00007882547,0.00007638977,0.00000912283,0.000039545204,0.00023697545,0.99851173,0.0000032967334],"about_ca_topic_score_codex":0.2179458,"about_ca_topic_score_gemma":0.5355907,"teacher_disagreement_score":0.7820542,"about_ca_system_score_codex":0.0027087384,"about_ca_system_score_gemma":0.0034342583,"threshold_uncertainty_score":0.89569974},"labels":[],"label_agreement":null},{"id":"W7042086444","doi":"","title":"Points de vue","year":2015,"lang":"en","type":"other","venue":"Summit (Simon Fraser University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Nucleofection; Gestational period; Hyporeflexia; Dysgeusia; TSG101; Diafiltration; Liquation; Fusible alloy","score_opus":0.06864641301097517,"score_gpt":0.30894447233753436,"score_spread":0.24029805932655918,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7042086444","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017484985,0.013200972,0.08289537,0.08464525,0.026914895,0.0008105748,0.0026853315,0.0034173073,0.76794535],"genre_scores_gemma":[0.3256204,0.010178909,0.058627035,0.021485046,0.008327141,0.0011914846,0.0036708675,0.0039971154,0.5669019],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.97752863,0.0077753332,0.0016165416,0.0025778636,0.008885503,0.0016162596],"domain_scores_gemma":[0.9705932,0.009685252,0.0014463118,0.006638444,0.007138021,0.0044988156],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.014729659,0.0011390304,0.0009785146,0.004034754,0.005962238,0.025532603,0.0031956271,0.005071306,0.07509343],"category_scores_gemma":[0.05332644,0.000575729,0.0014829469,0.0033699966,0.008531289,0.012317059,0.015345638,0.0069397986,0.022723395],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025266525,0.00010033522,0.0031399108,0.0012698594,0.0000691302,0.0011081743,0.0338914,0.00067038345,0.0022906633,0.31109208,0.2945479,0.35156754],"study_design_scores_gemma":[0.0000062310314,0.00003565028,0.00043864665,0.00053833675,0.000006429807,0.0004350592,0.005911311,0.00013877745,0.00040097616,0.020815285,0.97124577,0.000027430062],"about_ca_topic_score_codex":0.002877345,"about_ca_topic_score_gemma":0.002704356,"teacher_disagreement_score":0.07509343,"about_ca_system_score_codex":0.0041606235,"about_ca_system_score_gemma":0.0074932342,"threshold_uncertainty_score":0.25121254},"labels":[],"label_agreement":null},{"id":"W7070961349","doi":"","title":"Research and application of wood-concrete in world practice: an overview","year":2022,"lang":"en","type":"article","venue":"Digital Library of Polotsk State University (Polotsk State University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Filler (materials); Thermal insulation; Material selection; Thermal; Selection (genetic algorithm)","score_opus":0.11628178061933599,"score_gpt":0.35739529290609434,"score_spread":0.24111351228675837,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7070961349","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0059505957,0.9711405,0.0018757748,0.0010732973,0.0002416729,0.000041918945,0.00007007889,0.000024084817,0.019582096],"genre_scores_gemma":[0.01948984,0.9719639,0.0024438181,0.00028390007,0.00028409043,0.000029299372,0.00010568915,0.000008941694,0.0053905523],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9990752,0.00018547726,0.00010503059,0.00023005156,0.00030037417,0.00010391907],"domain_scores_gemma":[0.9991559,0.00031697552,0.00012370019,0.00003788369,0.00028955677,0.00007589796],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0010475792,0.000602322,0.0005327683,0.00598346,0.00048501338,0.0026416716,0.000604478,0.0013062261,0.0048942086],"category_scores_gemma":[0.0008641931,0.00033811753,0.0005986599,0.006935383,0.0010868339,0.0030189222,0.0009296351,0.0007360917,0.0018426628],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000078501274,0.00027068256,0.0035434845,0.0088004535,0.00003891502,0.00036768077,0.001137463,0.00041688333,0.0034549837,0.013783599,0.0054781274,0.9626291],"study_design_scores_gemma":[0.0000064587985,0.00038684258,0.015328475,0.0055388897,0.000063690095,0.0019978548,0.0019138249,0.0002780174,0.0023800044,0.003962651,0.968101,0.000042319338],"about_ca_topic_score_codex":0.003842655,"about_ca_topic_score_gemma":0.0049508745,"teacher_disagreement_score":0.00598346,"about_ca_system_score_codex":0.001664891,"about_ca_system_score_gemma":0.003248408,"threshold_uncertainty_score":0.01637274},"labels":[],"label_agreement":null},{"id":"W7084128860","doi":"10.64628/aam.hxurcjx5g","title":"The #advancedstyle movement celebrates and empowers stylish older women","year":2021,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Movement (music); MEDLINE; Action (physics); Older people","score_opus":0.04357030514862068,"score_gpt":0.3660470867078004,"score_spread":0.3224767815591797,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7084128860","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.15081935,0.0021661676,0.0039143064,0.6570446,0.010783763,0.00005725468,0.00034120632,0.00021483707,0.17465855],"genre_scores_gemma":[0.569114,0.002258474,0.003465088,0.15999247,0.006956872,0.00010804181,0.00022023977,0.00029257877,0.25759214],"study_design_codex":"not_applicable","study_design_gemma":"qualitative","domain_scores_codex":[0.9964915,0.0012312473,0.0001351422,0.00030515352,0.00094371504,0.00089318724],"domain_scores_gemma":[0.9814735,0.0058944277,0.001218051,0.001557174,0.0018709761,0.007985804],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009771065,0.00034115923,0.00026543494,0.0011114163,0.0068793655,0.0068455217,0.00083889934,0.0033864279,0.0197146],"category_scores_gemma":[0.023078736,0.00030102074,0.00045139712,0.00090510026,0.006155582,0.0041687516,0.013607767,0.0055987984,0.003828568],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022083255,0.00018716675,0.021356216,0.00015903961,0.000035053075,0.00056064385,0.07924256,0.00010388152,0.0024102314,0.18436803,0.517572,0.19378443],"study_design_scores_gemma":[0.000024922778,0.000082623585,0.0072541772,0.00010583573,0.000012012532,0.00022380352,0.016159644,0.00009070602,0.0002833697,0.012146695,0.9635903,0.00002593161],"about_ca_topic_score_codex":0.00857678,"about_ca_topic_score_gemma":0.020826051,"teacher_disagreement_score":0.0197146,"about_ca_system_score_codex":0.0019958236,"about_ca_system_score_gemma":0.0061778706,"threshold_uncertainty_score":0.065951884},"labels":[],"label_agreement":null},{"id":"W7092317075","doi":"","title":"FACTS: Table Summarization via Offline Template Generation with Agentic Workflows","year":2025,"lang":"","type":"article","venue":"arXiv (Cornell University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Mila - Quebec Artificial Intelligence Institute","funders":"","keywords":"Automatic summarization; Table (database); Workflow; Executable; Natural language; Key (lock); Robustness (evolution)","score_opus":0.18450859587016613,"score_gpt":0.2489525282214207,"score_spread":0.06444393235125456,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7092317075","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0063845306,0.00045205734,0.8454638,0.000695048,0.00019996145,0.000575506,0.009662259,0.132448,0.0041187876],"genre_scores_gemma":[0.060114186,0.00031998628,0.9042637,0.0003926522,0.00007846576,0.0005784254,0.024540378,0.0048741903,0.004838201],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9975055,0.0005942761,0.00034493726,0.0006571617,0.00077859906,0.00011954468],"domain_scores_gemma":[0.9943844,0.0020916355,0.00034816258,0.0021157353,0.00088935765,0.00017066972],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002574491,0.0015097995,0.0007783467,0.002075961,0.0007906782,0.003276933,0.0022155938,0.0008145704,0.0119327465],"category_scores_gemma":[0.0141929,0.0006561508,0.0017877062,0.0017772245,0.000676204,0.0030938834,0.002571888,0.0015743604,0.0070459386],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007969516,0.00033148273,0.0035421238,0.0014673471,0.00032286995,0.0006114538,0.0013518415,0.051533137,0.027226841,0.031764496,0.16032948,0.720722],"study_design_scores_gemma":[0.00043457167,0.00023106796,0.0015260575,0.00019548387,0.00020629153,0.00048206004,0.00066957256,0.61087793,0.062069576,0.097466215,0.22567928,0.00016192942],"about_ca_topic_score_codex":0.005875298,"about_ca_topic_score_gemma":0.008319314,"teacher_disagreement_score":0.0119327465,"about_ca_system_score_codex":0.00085119036,"about_ca_system_score_gemma":0.002507633,"threshold_uncertainty_score":0.03991908},"labels":[],"label_agreement":null},{"id":"W7095792784","doi":"","title":"CANADA S4S 0A2Expectation Propagation in ExGen Graphs for Summarization:","year":2003,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Automatic summarization; Generalization; Heuristics; Node (physics); Domain (mathematical analysis); Process (computing)","score_opus":0.11973997131540226,"score_gpt":0.3703554875670823,"score_spread":0.25061551625168005,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7095792784","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.036702137,0.00026651748,0.9369753,0.0014228472,0.000057738358,0.00026271952,0.004029092,0.012106456,0.008177186],"genre_scores_gemma":[0.22853589,0.00034706172,0.75356466,0.00029983517,0.00004975141,0.00021052748,0.008824631,0.0010643733,0.007103315],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9985286,0.0006301163,0.000091633265,0.0003121013,0.0003733266,0.00006420845],"domain_scores_gemma":[0.99397427,0.0023592357,0.0005288031,0.0012735553,0.0016883408,0.00017575659],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002259588,0.00069307385,0.00041150648,0.0028786438,0.0010013245,0.0017354848,0.0008262702,0.00070402614,0.0057916846],"category_scores_gemma":[0.008705576,0.0003232922,0.00058301724,0.0025800266,0.0006026725,0.0021926498,0.0012322735,0.00082753366,0.001452728],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00037797683,0.00014099415,0.013025187,0.00048219584,0.00011978737,0.0004263955,0.0010354092,0.1700885,0.017905371,0.051271044,0.054749954,0.69037724],"study_design_scores_gemma":[0.00006577185,0.00009884019,0.00557835,0.000070914364,0.000053038104,0.00023828063,0.00044708097,0.8587878,0.020536575,0.05124252,0.06281081,0.00007001858],"about_ca_topic_score_codex":0.041797526,"about_ca_topic_score_gemma":0.06746149,"teacher_disagreement_score":0.041797526,"about_ca_system_score_codex":0.002141453,"about_ca_system_score_gemma":0.0023557094,"threshold_uncertainty_score":0.083108485},"labels":[],"label_agreement":null},{"id":"W7096274211","doi":"","title":"Author Name Co-Mention Analysis: Testing a Poor Man&amp;apos;s Author Co-Citation Analysis Method","year":2016,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"German; Quarter (Canadian coin); Citation; Citation analysis; Service (business); Work (physics)","score_opus":0.5682010533063319,"score_gpt":0.5671922909398469,"score_spread":0.0010087623664849499,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7096274211","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5687412,0.0028689776,0.39666763,0.0070342594,0.0011152686,0.0010923506,0.0062537845,0.0029689681,0.013257603],"genre_scores_gemma":[0.8799351,0.00023082907,0.11330356,0.00068508,0.00043686636,0.000505235,0.0025110678,0.00049200485,0.0019003376],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.8585566,0.09999483,0.007081812,0.014225215,0.017762614,0.0023789664],"domain_scores_gemma":[0.27521822,0.6535374,0.015855018,0.033964254,0.018037088,0.0033880728],"candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.14723825,0.0012850068,0.0018420515,0.008735448,0.004319332,0.0054163346,0.007203514,0.003815525,0.0073540336],"category_scores_gemma":[0.35387078,0.0006533699,0.0038461995,0.009998253,0.004828514,0.0064264187,0.0050673205,0.0035519963,0.0028874837],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0050550574,0.0015565171,0.6672696,0.0017010074,0.008480375,0.0010654087,0.005738604,0.02167434,0.0028341645,0.025320608,0.026972784,0.23233147],"study_design_scores_gemma":[0.0010187189,0.0024835481,0.14208111,0.00053186074,0.0025644589,0.0018822432,0.0064414837,0.74023086,0.010594442,0.06164995,0.03020809,0.00031321304],"about_ca_topic_score_codex":0.007935734,"about_ca_topic_score_gemma":0.0051875324,"teacher_disagreement_score":0.9912646,"about_ca_system_score_codex":0.0016556878,"about_ca_system_score_gemma":0.0041552037,"threshold_uncertainty_score":0.7786796},"labels":[],"label_agreement":null},{"id":"W7096613607","doi":"","title":"www.cihi.ca","year":2008,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Quality (philosophy); Information quality; Health care; Information system; Data quality; Health information","score_opus":0.4501617695756432,"score_gpt":0.46043866559688645,"score_spread":0.010276896021243265,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7096613607","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0013087362,0.004387297,0.0020246657,0.01015629,0.0018817426,0.00033032996,0.1854047,0.009344668,0.78516173],"genre_scores_gemma":[0.04182848,0.0076942677,0.012105421,0.0114316065,0.0012052129,0.0005872352,0.19124845,0.0064664325,0.72743285],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9970855,0.00044438522,0.00023413514,0.000537488,0.001346311,0.00035209677],"domain_scores_gemma":[0.9868485,0.0032475463,0.0010425824,0.0019290424,0.00431021,0.002622132],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.002646703,0.0007748662,0.0010431807,0.0049316864,0.0011603986,0.007116895,0.00275904,0.0022381106,0.69251025],"category_scores_gemma":[0.01528979,0.000855081,0.00060139183,0.008398332,0.0009344349,0.0015900809,0.0020282248,0.0016907912,0.4040049],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000094510346,0.000022869172,0.0013832821,0.00026998183,0.000016991,0.000019167188,0.000026317535,0.00010477286,0.000050553546,0.0031934741,0.93924075,0.0555774],"study_design_scores_gemma":[0.00007902856,0.000009341151,0.0027925705,0.00022371371,0.000019877965,0.00004001479,0.000050842715,0.00035515387,0.00011760878,0.0011675138,0.9951257,0.000018576884],"about_ca_topic_score_codex":0.27243873,"about_ca_topic_score_gemma":0.21573518,"teacher_disagreement_score":0.30748975,"about_ca_system_score_codex":0.007434767,"about_ca_system_score_gemma":0.02138039,"threshold_uncertainty_score":0.54170597},"labels":[],"label_agreement":null},{"id":"W7096721468","doi":"","title":"The Development of a Data Quality Framework and Strategy for the New Zealand Ministry of Health","year":2008,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Data quality; Quality (philosophy); Christian ministry; Data governance; Quality management; Data management; Health data","score_opus":0.6633314680100575,"score_gpt":0.5505149266813276,"score_spread":0.11281654132872987,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7096721468","genre_codex":"commentary","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014330781,0.007731708,0.23822333,0.6773178,0.0025196492,0.014077885,0.003095904,0.00093541975,0.04176755],"genre_scores_gemma":[0.10239707,0.007198277,0.8219006,0.03389165,0.00084109645,0.01047424,0.0051380955,0.00029195074,0.017867014],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.8187381,0.085867435,0.025868634,0.006816846,0.051683843,0.011025191],"domain_scores_gemma":[0.7294966,0.06261168,0.022040019,0.018342286,0.13114956,0.03635987],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.30387643,0.0014050109,0.0020803348,0.013676679,0.007836353,0.026521167,0.008611305,0.009007182,0.0036052403],"category_scores_gemma":[0.22141644,0.0020727955,0.0022228041,0.012150323,0.011196942,0.019976314,0.015756924,0.010097691,0.0015489166],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001535794,0.00043252268,0.012668351,0.0036908071,0.0001710884,0.00066445174,0.013635554,0.008118553,0.0019479882,0.57104224,0.14721404,0.2402608],"study_design_scores_gemma":[0.00028501436,0.00067262916,0.02370268,0.009812771,0.00015414969,0.0006423854,0.01956699,0.015237127,0.0018765312,0.1503077,0.7771653,0.0005767891],"about_ca_topic_score_codex":0.31041342,"about_ca_topic_score_gemma":0.18954612,"teacher_disagreement_score":0.31041342,"about_ca_system_score_codex":0.08141555,"about_ca_system_score_gemma":0.40271905,"threshold_uncertainty_score":0.85844433},"labels":[],"label_agreement":null},{"id":"W7098475574","doi":"","title":"Final Report: British Columbia Problem Gambling Prevalence Study Submitted to: Gaming Policy and Enforcement Branch Ministry of Public Safety and Solicitor General Submitted by:","year":2010,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Christian ministry; Enforcement; Government (linguistics); Law enforcement","score_opus":0.08412132569334843,"score_gpt":0.3807746408175742,"score_spread":0.29665331512422577,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7098475574","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1021862,0.0004880246,0.0016225189,0.015675666,0.007169944,0.014218548,0.71044123,0.0011123029,0.14708553],"genre_scores_gemma":[0.12410209,0.000624944,0.0029307932,0.009222172,0.0006626913,0.008123171,0.27560908,0.0008240868,0.5779009],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.9951389,0.00075443415,0.00067768624,0.00039083505,0.00217163,0.0008664053],"domain_scores_gemma":[0.9553011,0.003173884,0.001252062,0.0031421112,0.03438826,0.0027425666],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0060363254,0.00076630304,0.0009772764,0.0042305687,0.0037477822,0.0027720595,0.0019060186,0.002029478,0.08714241],"category_scores_gemma":[0.033658702,0.0009717229,0.0005751786,0.003007265,0.0006443752,0.00072648725,0.0017255233,0.0015320685,0.030462846],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00039314426,0.00012811836,0.0313432,0.00010268283,0.000019004308,0.00014477286,0.00022163254,0.000094688105,0.00023386857,0.00014041184,0.95863134,0.008547251],"study_design_scores_gemma":[0.0006496252,0.000219516,0.6889839,0.00042959518,0.00009301888,0.00010637659,0.0021836252,0.0007603345,0.0015783748,0.00035522325,0.30454677,0.00009368392],"about_ca_topic_score_codex":0.6900711,"about_ca_topic_score_gemma":0.7998039,"teacher_disagreement_score":0.3099289,"about_ca_system_score_codex":0.0074988175,"about_ca_system_score_gemma":0.020276276,"threshold_uncertainty_score":0.6235082},"labels":[],"label_agreement":null},{"id":"W7098571762","doi":"","title":"Digraph Description Of K-Interchange Technique For Optimization Over Permutations (Extended Abstract)","year":2007,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Heuristics; Digraph; Travelling salesman problem; Permutation (music); Combinatorial optimization; Scheduling (production processes); Optimization problem","score_opus":0.2224664177847425,"score_gpt":0.4370657972583242,"score_spread":0.21459937947358168,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7098571762","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005969611,0.000610598,0.9415242,0.00063124695,0.0002879075,0.00024276238,0.00093459757,0.00071359926,0.049085442],"genre_scores_gemma":[0.13814501,0.0014293499,0.8089793,0.00035204165,0.000119208926,0.00060096185,0.0020912143,0.0003275789,0.04795528],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.999765,0.00005333777,0.000020075928,0.00004893373,0.00007396436,0.000038721766],"domain_scores_gemma":[0.9998405,0.00005487112,0.000013743328,0.00003439988,0.00004380556,0.000012659341],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00027686046,0.00049909577,0.00034486697,0.00069700275,0.0005547855,0.0010630479,0.0012221495,0.0006578035,0.019981623],"category_scores_gemma":[0.0007034014,0.00022259945,0.0009843886,0.001349456,0.00037164133,0.0010587958,0.00078955485,0.00088257145,0.0030188505],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000065639695,0.000103425205,0.00048094962,0.00035299288,0.000027792403,0.0006014726,0.00016585866,0.115658544,0.006037136,0.68508637,0.025152488,0.16626734],"study_design_scores_gemma":[0.000043168708,0.00011041824,0.00045231337,0.00009428104,0.000038924507,0.00077823224,0.00010603001,0.45988986,0.0047912677,0.33745837,0.19619428,0.00004295057],"about_ca_topic_score_codex":0.0048092026,"about_ca_topic_score_gemma":0.006361623,"teacher_disagreement_score":0.019981623,"about_ca_system_score_codex":0.0009880738,"about_ca_system_score_gemma":0.0008985423,"threshold_uncertainty_score":0.06684518},"labels":[],"label_agreement":null},{"id":"W7099523777","doi":"","title":"Correspondence","year":2004,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Phylogenetic tree; Enzootic; Genome; Clade; Recombinant DNA; Phylogenetics; Virus; Sequence analysis; Genetic diversity","score_opus":0.320829081153056,"score_gpt":0.48382058703924946,"score_spread":0.1629915058861935,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7099523777","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0041900873,0.0032662512,0.0027009337,0.009053866,0.0065702423,0.00033224694,0.005664076,0.0011327936,0.96708953],"genre_scores_gemma":[0.02407792,0.0023695834,0.0017593419,0.0030667114,0.0009545929,0.0001181453,0.0046825674,0.000495905,0.9624751],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.998914,0.00011835433,0.00008121654,0.00034084957,0.000335371,0.00021026887],"domain_scores_gemma":[0.9981248,0.00025647518,0.000096691,0.00020306725,0.00063811505,0.0006807602],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.00061044306,0.00093876827,0.00084566796,0.0012935337,0.0018346625,0.0029839708,0.0014051386,0.0023906208,0.8526066],"category_scores_gemma":[0.0028852387,0.0003311978,0.0004452492,0.0010109026,0.0005963086,0.0016644662,0.0019469925,0.0013151916,0.611047],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00035745095,0.00016410675,0.0032882947,0.0007681241,0.000023958104,0.0014888032,0.00038833197,0.00023798029,0.0016180198,0.011499573,0.55625385,0.42391163],"study_design_scores_gemma":[0.000019629728,0.000035457902,0.0011351015,0.00011374828,0.0000067166325,0.0005466876,0.00014811003,0.000095158786,0.00028335623,0.0016117037,0.99599636,0.000008057622],"about_ca_topic_score_codex":0.00278396,"about_ca_topic_score_gemma":0.0056662858,"teacher_disagreement_score":0.1473934,"about_ca_system_score_codex":0.0015998794,"about_ca_system_score_gemma":0.002167496,"threshold_uncertainty_score":0.21023881},"labels":[],"label_agreement":null},{"id":"W7100239799","doi":"","title":"University of Castilla-La Mancha","year":2008,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Maintainability; Metric (unit); Point (geometry); Software; Quality (philosophy); Order (exchange)","score_opus":0.3033654716840396,"score_gpt":0.3732940129860818,"score_spread":0.06992854130204218,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7100239799","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.20953356,0.052144863,0.014776518,0.024178497,0.0055439584,0.0007963495,0.041957498,0.007697596,0.6433712],"genre_scores_gemma":[0.4855781,0.03513022,0.042376716,0.0014933845,0.001287877,0.00075294514,0.022060227,0.0007023108,0.41061822],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9981341,0.0004640811,0.000065394954,0.00048837066,0.00054743193,0.00030063576],"domain_scores_gemma":[0.99647456,0.001332171,0.00029151439,0.00035246174,0.00096462585,0.00058476196],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0016059912,0.0012575885,0.0009655494,0.002458573,0.0017228452,0.0033853159,0.0018147022,0.0013626083,0.0720134],"category_scores_gemma":[0.005299913,0.00032434586,0.0006650558,0.0021250735,0.00083670043,0.0009975244,0.0015627837,0.001815491,0.019807236],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002719375,0.0010892744,0.022571266,0.0032958398,0.00019635953,0.0030121845,0.0014762036,0.0056938883,0.00987533,0.05296303,0.16030923,0.736798],"study_design_scores_gemma":[0.00033849923,0.00041562304,0.071906194,0.0022452336,0.00008154541,0.0015024788,0.0012932003,0.0045000445,0.00767319,0.008033562,0.9018288,0.00018167715],"about_ca_topic_score_codex":0.08185744,"about_ca_topic_score_gemma":0.06428766,"teacher_disagreement_score":0.9279866,"about_ca_system_score_codex":0.0051108627,"about_ca_system_score_gemma":0.0065555708,"threshold_uncertainty_score":0.24090886},"labels":[],"label_agreement":null},{"id":"W7104182958","doi":"","title":"Relational Deep Dive: Error-Aware Queries Over Unstructured Data","year":2025,"lang":"","type":"article","venue":"ArXiv.org","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Schema (genetic algorithms); Unstructured data; Modular design; Completeness (order theory); Relational database; Information extraction; Population; Data extraction","score_opus":0.31773586256303454,"score_gpt":0.4352136701261027,"score_spread":0.11747780756306814,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7104182958","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012974686,0.0010111838,0.9536378,0.001407422,0.00010078935,0.00024205101,0.003884105,0.02496233,0.0017796267],"genre_scores_gemma":[0.14552051,0.00051976385,0.8366554,0.0013246927,0.00011101209,0.0002855045,0.010833016,0.002402336,0.0023478589],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98433506,0.0045546815,0.001551091,0.003312625,0.005709708,0.0005367476],"domain_scores_gemma":[0.95608526,0.022145085,0.0022730788,0.015417031,0.003524433,0.0005550653],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013999367,0.0015363247,0.0015554478,0.0032041504,0.0013626589,0.005980832,0.0050936015,0.0021919904,0.003143423],"category_scores_gemma":[0.064603105,0.0012299265,0.0018057481,0.004103404,0.0025861312,0.011619629,0.011680519,0.0033510225,0.002231973],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008140882,0.00032197445,0.020519545,0.0018360814,0.0005518792,0.0007462269,0.0034691163,0.07823316,0.025316615,0.08856756,0.09232275,0.6873009],"study_design_scores_gemma":[0.00012343124,0.00017078046,0.0024218713,0.00019919623,0.000114230585,0.00096020097,0.0011318172,0.6771433,0.038107708,0.22003904,0.059466165,0.00012226227],"about_ca_topic_score_codex":0.0039214077,"about_ca_topic_score_gemma":0.008989659,"teacher_disagreement_score":0.013999367,"about_ca_system_score_codex":0.0014447441,"about_ca_system_score_gemma":0.0035642206,"threshold_uncertainty_score":0.07403666},"labels":[],"label_agreement":null},{"id":"W7113234448","doi":"","title":"Content, Design and Structure of Major Databases with Historical Longitudinal Population Data","year":2023,"lang":"en","type":"article","venue":"KNAW Research Portal (The Royal Netherlands Academy of Arts and Sciences)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Canadian Institute for Public Safety Research and Treatment","funders":"","keywords":"Erasmus+; Population; Linkage (software); Crowdsourcing; Range (aeronautics); Relational database","score_opus":0.6723114842298782,"score_gpt":0.4992735101447177,"score_spread":0.17303797408516047,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7113234448","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.06590489,0.0018787072,0.82419425,0.008088226,0.00061355217,0.017000686,0.055478536,0.011610415,0.01523073],"genre_scores_gemma":[0.14170183,0.0012552756,0.7781529,0.0010119725,0.00041384035,0.012253747,0.058945145,0.001634867,0.0046303524],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.9433243,0.0291598,0.009299707,0.005990466,0.010779426,0.0014462661],"domain_scores_gemma":[0.8039289,0.090436816,0.014317946,0.047300994,0.040055063,0.0039603133],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.062703386,0.0007209717,0.0013267455,0.011573839,0.0033002447,0.0133222705,0.0047203894,0.0014058629,0.0069064177],"category_scores_gemma":[0.17034242,0.0018196972,0.0014492073,0.014069354,0.002226783,0.008033017,0.008849111,0.0016709755,0.0034415433],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0029004596,0.0012597244,0.057881333,0.0035970546,0.0003443407,0.0005407139,0.009459672,0.011062747,0.010698236,0.12880898,0.11438307,0.65906376],"study_design_scores_gemma":[0.0015822515,0.0014561033,0.04623898,0.0031231067,0.00078500697,0.0011635813,0.009708341,0.093431436,0.07729806,0.12492511,0.6398307,0.0004573468],"about_ca_topic_score_codex":0.0033661213,"about_ca_topic_score_gemma":0.0021451786,"teacher_disagreement_score":0.062703386,"about_ca_system_score_codex":0.0041866014,"about_ca_system_score_gemma":0.009247261,"threshold_uncertainty_score":0.33161116},"labels":[],"label_agreement":null},{"id":"W7118185187","doi":"10.1145/3731599.3787543","title":"10.1145/3731599.3787543","year":2000,"lang":"en","type":"article","venue":"Time to knit","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Session (web analytics); Resource (disambiguation); Component (thermodynamics); Key (lock)","score_opus":0.07682765995816798,"score_gpt":0.32325578265318505,"score_spread":0.24642812269501707,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7118185187","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0021220187,0.006326007,0.016289437,0.002091968,0.0022398338,0.00048739492,0.021408608,0.019403378,0.92963153],"genre_scores_gemma":[0.004166848,0.0028514124,0.0030327246,0.0007995462,0.00019214855,0.0002337031,0.011584124,0.0025119365,0.9746276],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9991122,0.000070037466,0.00008029231,0.00024838658,0.00033202852,0.00015708483],"domain_scores_gemma":[0.9975101,0.0006347416,0.0001181019,0.00081717875,0.00052611297,0.00039380256],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0024297163,0.0028801209,0.0022252696,0.0033357877,0.0022595495,0.0052863667,0.002948661,0.0049828207,0.9362529],"category_scores_gemma":[0.00511192,0.0018190009,0.0013081197,0.01070105,0.0014926157,0.010696856,0.006339357,0.0024692523,0.9634862],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020021193,0.00014414138,0.00046571137,0.0005483382,0.000044227574,0.00016251227,0.00009895719,0.0006314992,0.00091352634,0.006314845,0.67320526,0.31727082],"study_design_scores_gemma":[0.00003109857,0.000026028223,0.0007044393,0.00025159246,0.00003848953,0.00012908931,0.00006312977,0.0006861746,0.00043315822,0.0014648712,0.99614197,0.00002992652],"about_ca_topic_score_codex":0.017278327,"about_ca_topic_score_gemma":0.011770081,"teacher_disagreement_score":0.06374711,"about_ca_system_score_codex":0.0025250907,"about_ca_system_score_gemma":0.0012185363,"threshold_uncertainty_score":0.09092754},"labels":[],"label_agreement":null},{"id":"W7126398324","doi":"10.21428/594757db.564cdb72","title":"Comparing Traditional and Deep Learning Approaches for Product Matching: Performance on Unseen Entities","year":2025,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Deep learning; Feature learning; Autoencoder; Matching (statistics); Transformer; Representation (politics); Feature (linguistics); Training set","score_opus":0.4048250354532657,"score_gpt":0.3676819528872744,"score_spread":0.0371430825659913,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7126398324","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9040287,0.004544829,0.075829,0.00084039255,0.0002710507,0.00018388266,0.0022209152,0.0039398884,0.008141345],"genre_scores_gemma":[0.9440903,0.0007607593,0.045818225,0.00025502447,0.000059556703,0.00005719832,0.005050253,0.000087432796,0.0038211849],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99755543,0.000661387,0.00021201829,0.0006422481,0.0006137434,0.00031516666],"domain_scores_gemma":[0.9962529,0.0016819463,0.00032813332,0.00093357114,0.0006277262,0.00017566458],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0052735214,0.0010590092,0.00075668836,0.0017276545,0.0004921059,0.0011457293,0.0017488095,0.0017133084,0.002028192],"category_scores_gemma":[0.0089581935,0.0002153289,0.0006958539,0.0017537404,0.000576145,0.003913779,0.0019928445,0.0014017192,0.0013373265],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0018091169,0.0015206003,0.047282968,0.000521446,0.0005389231,0.00020092887,0.00015289303,0.24080397,0.007871528,0.0024071108,0.011762556,0.685128],"study_design_scores_gemma":[0.0000720911,0.0008995941,0.009062201,0.000065852626,0.000080275924,0.00012323287,0.00021846475,0.9631212,0.018944046,0.0042633554,0.0031103317,0.00003941386],"about_ca_topic_score_codex":0.006334553,"about_ca_topic_score_gemma":0.009054456,"teacher_disagreement_score":0.006334553,"about_ca_system_score_codex":0.0011253956,"about_ca_system_score_gemma":0.000973836,"threshold_uncertainty_score":0.02788937},"labels":[],"label_agreement":null},{"id":"W7132922950","doi":"","title":"Essays in Computational Econometrics","year":2023,"lang":"","type":"dissertation","venue":"TSpace","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"Social Sciences and Humanities Research Council of Canada; National Institutes of Health","keywords":"Computational complexity theory; Computational problem; Matching (statistics); Probabilistic logic; Bayesian probability; Function (biology); Class (philosophy); Inference; Interval (graph theory)","score_opus":0.278320810239532,"score_gpt":0.4910467462801524,"score_spread":0.2127259360406204,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7132922950","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0039028984,0.11072878,0.38692707,0.24733558,0.037523326,0.00013171516,0.0013391179,0.00084630214,0.2112653],"genre_scores_gemma":[0.16300432,0.16349714,0.2762574,0.048488285,0.10112987,0.0009651874,0.0028008,0.0025938703,0.24126309],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9957367,0.001920062,0.00030631907,0.00058819517,0.0012932824,0.00015544413],"domain_scores_gemma":[0.9718746,0.02303526,0.0005261743,0.0018196685,0.0023474311,0.00039683664],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00686675,0.0010895017,0.0010287738,0.002204922,0.00148496,0.0049006436,0.0012168671,0.0022974769,0.01789472],"category_scores_gemma":[0.03467719,0.0006192556,0.0015225628,0.0031743676,0.0046556494,0.005559091,0.0020926562,0.006436888,0.0069177956],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000025292284,0.000028365399,0.00028827743,0.0002811299,0.00004919585,0.00004129968,0.00025394303,0.0047113816,0.0001104848,0.7069612,0.21752575,0.06972359],"study_design_scores_gemma":[0.000016563274,0.000014925901,0.00039543083,0.00035444603,0.000013758649,0.00007475082,0.0001321384,0.0068595307,0.00011694862,0.58588225,0.406117,0.000022322762],"about_ca_topic_score_codex":0.0015251827,"about_ca_topic_score_gemma":0.0012360346,"teacher_disagreement_score":0.01789472,"about_ca_system_score_codex":0.0029568383,"about_ca_system_score_gemma":0.0022207936,"threshold_uncertainty_score":0.059863806},"labels":[],"label_agreement":null},{"id":"W7133042738","doi":"","title":"Facilitating Discovery in Open Data Repositories","year":2024,"lang":"","type":"dissertation","venue":"TSpace","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Metadata; Data element; Metadata repository; Discoverability; Metadata modeling; Open data; Linked data; Schema (genetic algorithms); Data mapping","score_opus":0.32456081942087717,"score_gpt":0.5522434291650822,"score_spread":0.227682609744205,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7133042738","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.060725603,0.0010184897,0.8935187,0.004581252,0.00017116424,0.0009921093,0.0033038252,0.028837988,0.006850998],"genre_scores_gemma":[0.17772627,0.0006319977,0.80566925,0.0006891289,0.00008737252,0.0005714327,0.0109001575,0.0014304011,0.002294026],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9534627,0.01845184,0.0048157475,0.005974013,0.015482972,0.0018126847],"domain_scores_gemma":[0.8286931,0.08048492,0.012685134,0.059896674,0.014833047,0.0034072164],"candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.03919937,0.0012238555,0.0019028073,0.015709622,0.0039894143,0.01348432,0.0059213047,0.003171831,0.0020616082],"category_scores_gemma":[0.16020589,0.0017705897,0.002733156,0.014585497,0.0031409573,0.02520216,0.023033053,0.0036070647,0.0024947203],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008066978,0.0008116497,0.05786379,0.001983139,0.0004651598,0.0018526766,0.007909693,0.04473759,0.013361786,0.16687097,0.043662056,0.65967476],"study_design_scores_gemma":[0.0001739884,0.00020693411,0.0074267406,0.000639379,0.00021742992,0.0011751432,0.004751047,0.5381877,0.039933134,0.2802245,0.1267981,0.00026588116],"about_ca_topic_score_codex":0.008180687,"about_ca_topic_score_gemma":0.008961322,"teacher_disagreement_score":0.9940787,"about_ca_system_score_codex":0.0030060187,"about_ca_system_score_gemma":0.008705729,"threshold_uncertainty_score":0.20730853},"labels":[],"label_agreement":null},{"id":"W7134187860","doi":"10.1109/bigdata66926.2025.11402509","title":"Explainable Retrieval and Graph Augmented Code Vulnerability Repair Recommendations","year":2025,"lang":"","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Code (set theory); Graph; Vulnerability (computing); Source code; Key (lock)","score_opus":0.10895485461058127,"score_gpt":0.4230902027042033,"score_spread":0.314135348093622,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7134187860","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12025838,0.0027621395,0.7704073,0.015730964,0.0010457312,0.0012740635,0.021139154,0.03141993,0.035962317],"genre_scores_gemma":[0.5078182,0.0014404517,0.44248182,0.0018183291,0.00034973983,0.00039027535,0.027179053,0.0023264966,0.016195636],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99695146,0.0009175736,0.00017843687,0.00047030594,0.0012384066,0.00024390241],"domain_scores_gemma":[0.9828079,0.009012358,0.0007953822,0.003049743,0.0040388587,0.00029580313],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019041182,0.0012875655,0.0006933768,0.0038609055,0.00090005767,0.0021725057,0.0021702368,0.0023057405,0.023797452],"category_scores_gemma":[0.03443799,0.00050573196,0.0014412936,0.001993055,0.00066686305,0.0043437346,0.0020803546,0.0021603268,0.0042939917],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011066382,0.00046145666,0.017901288,0.001843305,0.0004610603,0.0015553228,0.0015623403,0.1025188,0.013535072,0.040234845,0.23527497,0.5835449],"study_design_scores_gemma":[0.00027465724,0.00037411065,0.009642627,0.0010357788,0.00072705443,0.0009200927,0.002054215,0.68395585,0.024947919,0.1422841,0.13356315,0.00022040388],"about_ca_topic_score_codex":0.01603345,"about_ca_topic_score_gemma":0.032588188,"teacher_disagreement_score":0.023797452,"about_ca_system_score_codex":0.0011244756,"about_ca_system_score_gemma":0.002416004,"threshold_uncertainty_score":0.07961041},"labels":[],"label_agreement":null},{"id":"W7162292117","doi":"10.63282/3050-9262.ijaidsml-v3i3p119","title":"Preparing Enterprise Data for LLM-Assisted Customer Issue Analysis: A Governance-Centric Framework","year":2022,"lang":"","type":"article","venue":"International Journal of Artificial Intelligence Data Science and Machine Learning","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute on Governance","funders":"","keywords":"Data governance; Enterprise data management; Scalability; Audit; Metadata; Corporate governance; Enterprise information system; Enterprise architecture; Customer intelligence; Enterprise information security architecture","score_opus":0.18746334802245912,"score_gpt":0.4515668028765007,"score_spread":0.2641034548540416,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7162292117","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.007895473,0.00022789938,0.9829034,0.002322567,0.000031094394,0.00045459234,0.00028274144,0.003613748,0.002268504],"genre_scores_gemma":[0.13609323,0.00023516343,0.8600737,0.00042123676,0.00005211572,0.00038958475,0.0013315738,0.00023635123,0.0011671543],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.98886967,0.005390892,0.0011805142,0.0018304549,0.002089024,0.00063953554],"domain_scores_gemma":[0.98678744,0.0042605796,0.0016802963,0.0044868495,0.0020439308,0.0007409746],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01732388,0.00088215823,0.00069821207,0.005363441,0.0017155879,0.0071041775,0.0027248466,0.0015262789,0.0012519158],"category_scores_gemma":[0.021898236,0.0008310411,0.0019519606,0.0031947629,0.0032960328,0.007562171,0.007906502,0.0023152318,0.0008611784],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022344987,0.0006861899,0.03648661,0.0007662853,0.00021761996,0.0011575066,0.007300247,0.057144307,0.014184631,0.40790212,0.012114553,0.46181646],"study_design_scores_gemma":[0.00005979137,0.00021094971,0.0065828124,0.000686484,0.00019495859,0.0006246337,0.00393503,0.5946566,0.019595247,0.27713504,0.09615544,0.00016307012],"about_ca_topic_score_codex":0.010205297,"about_ca_topic_score_gemma":0.011322857,"teacher_disagreement_score":0.01732388,"about_ca_system_score_codex":0.0027956897,"about_ca_system_score_gemma":0.009871407,"threshold_uncertainty_score":0.09161854},"labels":[],"label_agreement":null},{"id":"W7162329119","doi":"10.63282/3050-922x.ijeret-v4i2p117","title":"A Scalable Architecture for Automated Data Classification and Sensitive Information Discovery Using Artificial Intelligence","year":2023,"lang":"","type":"article","venue":"International Journal of Emerging Research in Engineering and Technology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute on Governance","funders":"","keywords":"Scalability; Data governance; Flexibility (engineering); Knowledge extraction; Data architecture; Cloud computing; Architecture; Data classification; Data warehouse","score_opus":0.28846272117441907,"score_gpt":0.49070007011040506,"score_spread":0.202237348935986,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7162329119","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02016253,0.00030587593,0.94067085,0.0006104825,0.00010053134,0.0003012877,0.00037301733,0.033229697,0.0042458023],"genre_scores_gemma":[0.43937948,0.00044789197,0.5483448,0.00078174705,0.00008981568,0.00043788052,0.003677063,0.00043896932,0.006402282],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99878377,0.00012788313,0.000115153496,0.00035837092,0.00049120473,0.00012362369],"domain_scores_gemma":[0.99859387,0.0002528381,0.00011927314,0.00047661687,0.00042969894,0.00012759255],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012932707,0.00057367596,0.0006258069,0.001482421,0.0007630988,0.0018983155,0.0027426276,0.00083176076,0.0021197482],"category_scores_gemma":[0.0021178185,0.00040136947,0.0007516261,0.0018429557,0.00090835505,0.0032676463,0.0022104986,0.0014687729,0.0013250608],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00081835774,0.0010013279,0.0081380755,0.0004233053,0.00031768205,0.0009475817,0.00064616004,0.10592103,0.06337828,0.054474317,0.043659393,0.72027445],"study_design_scores_gemma":[0.0000444665,0.00012605614,0.0013643978,0.000034442706,0.00008362163,0.00022633848,0.0000781121,0.9344678,0.018997459,0.025929565,0.018588955,0.00005880139],"about_ca_topic_score_codex":0.008025505,"about_ca_topic_score_gemma":0.006261097,"teacher_disagreement_score":0.008025505,"about_ca_system_score_codex":0.0012864849,"about_ca_system_score_gemma":0.0026390348,"threshold_uncertainty_score":0.015957594},"labels":[],"label_agreement":null},{"id":"W760598031","doi":"10.1007/s00778-015-0389-y","title":"Profiling relational data: a survey","year":2015,"lang":"en","type":"article","venue":"The VLDB Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":273,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Profiling (computer programming); Metadata; Computer science; Data mining; Data type; Information retrieval; Data science; World Wide Web","score_opus":0.8844173631534311,"score_gpt":0.5434835487839118,"score_spread":0.3409338143695193,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W760598031","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.20482203,0.4718415,0.2501662,0.02193191,0.00061691535,0.00050951267,0.010690295,0.0019408974,0.03748073],"genre_scores_gemma":[0.4661339,0.3631345,0.14219293,0.004883834,0.00095963036,0.00041791316,0.01806351,0.0006093284,0.003604455],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.98078996,0.003948452,0.0025944386,0.002924362,0.009087564,0.0006552319],"domain_scores_gemma":[0.86044216,0.09986163,0.007603403,0.010090188,0.01982508,0.0021775505],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.018697688,0.00067749346,0.0015072913,0.0150140915,0.0009242385,0.007538349,0.0027443732,0.0012737045,0.0019589588],"category_scores_gemma":[0.07480663,0.0007422493,0.0010518052,0.022260198,0.0017181793,0.017352844,0.0030627295,0.0015985226,0.0010219851],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00016783694,0.00017706855,0.0908149,0.0036929497,0.00018980583,0.00007622846,0.0015076757,0.0019367894,0.00225872,0.014154048,0.011427636,0.8735963],"study_design_scores_gemma":[0.000067401,0.00078845577,0.13737592,0.009211984,0.0006429999,0.0038354963,0.015518659,0.03142736,0.019080445,0.061744273,0.7199531,0.00035390182],"about_ca_topic_score_codex":0.0024348474,"about_ca_topic_score_gemma":0.0030642527,"teacher_disagreement_score":0.018697688,"about_ca_system_score_codex":0.0014644377,"about_ca_system_score_gemma":0.002510754,"threshold_uncertainty_score":0.098884046},"labels":[],"label_agreement":null},{"id":"W85648037","doi":"","title":"Proceedings of the 2008 ACM SIGMOD international conference on Management of data","year":2008,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":423,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Computer science; Dynamism; Session (web analytics); Field (mathematics); Sentence; Data science; Operations research; World Wide Web; Artificial intelligence","score_opus":0.5943424653324738,"score_gpt":0.46913552352602683,"score_spread":0.12520694180644698,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W85648037","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.026047375,0.17313771,0.1276523,0.17488965,0.15559228,0.0041752914,0.0731464,0.051435634,0.21392341],"genre_scores_gemma":[0.038122907,0.11095495,0.143491,0.0365993,0.0359305,0.0024236103,0.1711042,0.010017775,0.45135573],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9934749,0.0016221881,0.0005806941,0.00085263234,0.0030342843,0.0004352669],"domain_scores_gemma":[0.990293,0.0018668257,0.00065953104,0.0018749572,0.0032218487,0.0020836904],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010133214,0.002392226,0.0029276726,0.00531982,0.0023696814,0.013019988,0.0036383767,0.0030833315,0.08599043],"category_scores_gemma":[0.020794595,0.0014807647,0.0015408114,0.0035866245,0.001572972,0.015317936,0.007937919,0.009386421,0.07962357],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000070681876,0.00006920301,0.0004251222,0.00012831244,0.000034092307,0.00004124894,0.0000955231,0.00010961662,0.0003473743,0.001041625,0.94466984,0.052967355],"study_design_scores_gemma":[0.000031081723,0.000045947156,0.0012101533,0.00029295962,0.000031500902,0.00015236699,0.0002069746,0.0009989552,0.0004841285,0.003222739,0.9932816,0.000041602216],"about_ca_topic_score_codex":0.0055779675,"about_ca_topic_score_gemma":0.0060149487,"teacher_disagreement_score":0.08599043,"about_ca_system_score_codex":0.0033569694,"about_ca_system_score_gemma":0.004631874,"threshold_uncertainty_score":0.28766662},"labels":[],"label_agreement":null},{"id":"W86472440","doi":"10.2139/ssrn.2367300","title":"Analyzing the 2004-2011 KFS Multiply Imputed Data","year":2013,"lang":"en","type":"article","venue":"SSRN Electronic Journal","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Impact","funders":"","keywords":"Mathematics","score_opus":0.11393749553607897,"score_gpt":0.37751567357422133,"score_spread":0.2635781780381424,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W86472440","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9000316,0.0006707735,0.0072195935,0.0016857374,0.0001230087,0.00008809783,0.083257765,0.00027330936,0.0066500595],"genre_scores_gemma":[0.8770455,0.0002508753,0.007434824,0.00021170976,0.000075374504,0.00011988452,0.1072377,0.00007436682,0.007549839],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9885257,0.0030660948,0.0013857579,0.0014020159,0.0044535394,0.0011667861],"domain_scores_gemma":[0.9221889,0.031854432,0.014589126,0.013577913,0.016898843,0.00089074706],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008837029,0.0003882491,0.00074440235,0.005049071,0.0009720016,0.0020978763,0.0015360444,0.0010293561,0.0043290514],"category_scores_gemma":[0.0766624,0.0005688147,0.0010753886,0.013977079,0.0007100672,0.0014048383,0.0016086922,0.0013116047,0.0016456227],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00074607244,0.00021774236,0.8889907,0.0003350376,0.0006940978,0.0004118347,0.0011062843,0.019817498,0.0006986942,0.003609937,0.030287953,0.053084143],"study_design_scores_gemma":[0.000031271884,0.00017073928,0.95248675,0.00010537939,0.000279815,0.00027318008,0.0016356733,0.01006438,0.0016679532,0.00096833025,0.032256044,0.000060436203],"about_ca_topic_score_codex":0.1777346,"about_ca_topic_score_gemma":0.14671001,"teacher_disagreement_score":0.1777346,"about_ca_system_score_codex":0.003608129,"about_ca_system_score_gemma":0.0059506716,"threshold_uncertainty_score":0.35340017},"labels":[],"label_agreement":null},{"id":"W89272820","doi":"","title":"Analysis of recurrent event data with environmental covariates.","year":2005,"lang":"en","type":"article","venue":"Scholarship at UWindsor (University of Windsor)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Covariate; Event (particle physics); Computer science; Machine learning","score_opus":0.10593478874036612,"score_gpt":0.3312888164567091,"score_spread":0.225354027716343,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W89272820","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.15062365,0.0009869387,0.8436541,0.00047020515,0.00018151308,0.0005973269,0.001738891,0.0008190738,0.00092836854],"genre_scores_gemma":[0.7585136,0.00071927364,0.23224048,0.00025868442,0.00020173007,0.0013883607,0.005136781,0.0001277982,0.0014133129],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.97859156,0.017071756,0.0007699838,0.0018514452,0.0014305918,0.00028471422],"domain_scores_gemma":[0.78930056,0.18330456,0.009941026,0.013096319,0.0035013387,0.00085621385],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.044745047,0.0008287221,0.0018246649,0.0016754741,0.00042532608,0.0014648442,0.0019846295,0.00125161,0.0031527756],"category_scores_gemma":[0.13989583,0.00050721335,0.002341834,0.001821378,0.00085693336,0.0021996943,0.0012503958,0.0016165344,0.0005231979],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0023639873,0.0007631426,0.3070554,0.001682331,0.0065567973,0.0011408929,0.00086463674,0.41620052,0.002346754,0.041498024,0.004316218,0.21521138],"study_design_scores_gemma":[0.0001289508,0.0008836821,0.025687976,0.00013691247,0.0005212984,0.0004079417,0.00016221324,0.93499774,0.0011487167,0.031601824,0.0042616352,0.00006116771],"about_ca_topic_score_codex":0.00216388,"about_ca_topic_score_gemma":0.0020908753,"teacher_disagreement_score":0.044745047,"about_ca_system_score_codex":0.0006857799,"about_ca_system_score_gemma":0.0011796919,"threshold_uncertainty_score":0.23663723},"labels":[],"label_agreement":null},{"id":"W897078397","doi":"","title":"Proceedings of the ACM tenth international workshop on Data warehousing and OLAP","year":2007,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Online analytical processing; Data warehouse; Computer science; Data science; Business intelligence; Database; Field (mathematics); Decision support system; Data quality; Data mining; Engineering","score_opus":0.3997951615933993,"score_gpt":0.4744954337782644,"score_spread":0.07470027218486514,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W897078397","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011201668,0.13110475,0.559234,0.07339125,0.08423505,0.0014193648,0.0073008593,0.0117930295,0.120320044],"genre_scores_gemma":[0.04156353,0.10479186,0.47383896,0.012209489,0.021171741,0.0012382205,0.041886665,0.005090734,0.29820883],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99247026,0.0015706971,0.0009601423,0.0009666752,0.0034595923,0.00057266204],"domain_scores_gemma":[0.9896338,0.0019602175,0.00031821642,0.0023680301,0.004165049,0.0015547541],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010375508,0.0021066072,0.002460411,0.003318196,0.0018819422,0.011302298,0.00375414,0.0030255457,0.05055572],"category_scores_gemma":[0.0120235905,0.0014634535,0.0027470053,0.0042120046,0.002129973,0.011780818,0.0076379837,0.007996758,0.02656901],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00028074082,0.00027708826,0.0007734559,0.00070594426,0.00016312457,0.00035450692,0.0008029848,0.0013882075,0.003082769,0.022107668,0.6063205,0.36374292],"study_design_scores_gemma":[0.000030463634,0.000081060374,0.0006800851,0.00041732634,0.000039876475,0.00038658947,0.00033148148,0.00366739,0.0011198474,0.018174773,0.97501874,0.00005232264],"about_ca_topic_score_codex":0.0049858973,"about_ca_topic_score_gemma":0.004981941,"teacher_disagreement_score":0.05055572,"about_ca_system_score_codex":0.0014924237,"about_ca_system_score_gemma":0.004755766,"threshold_uncertainty_score":0.16912574},"labels":[],"label_agreement":null},{"id":"W984517805","doi":"","title":"What's in a name? Measuring use and non-use of Digital Resources in the Arts and Humanities through Log Analysis Techniques","year":2006,"lang":"en","type":"article","venue":"Durham Research Online (Durham University)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"World Wide Web; The arts; Digital humanities; The Internet; Computer science; Resource (disambiguation); Transaction log; Library science; Database transaction; Visual arts; Art; Database","score_opus":0.37799285482890904,"score_gpt":0.4094065370243242,"score_spread":0.03141368219541518,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W984517805","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.941438,0.0015134122,0.009516586,0.0036680314,0.00015213573,0.000614781,0.012659965,0.0003155881,0.030121487],"genre_scores_gemma":[0.96077037,0.0015462888,0.012955903,0.00038222066,0.00011843986,0.00068980193,0.009346844,0.00011802007,0.014072159],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99696785,0.0009344736,0.00034086165,0.0002926905,0.0012928664,0.0001713535],"domain_scores_gemma":[0.9840831,0.008077171,0.0033151363,0.00094987446,0.0028627415,0.0007119101],"candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.0027909097,0.00018537592,0.00024831176,0.003790402,0.00074147584,0.0037896372,0.00060485984,0.0004703323,0.004908474],"category_scores_gemma":[0.017457372,0.00023803438,0.00019524698,0.006544663,0.00074678153,0.003150684,0.0011471453,0.00075833825,0.0027074353],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00026272648,0.0004390016,0.6994895,0.0006752669,0.000064166896,0.00019546642,0.016048336,0.00039350608,0.0025027886,0.002952132,0.02843432,0.24854283],"study_design_scores_gemma":[0.000017701152,0.00035027083,0.8928931,0.00039577,0.000040895055,0.00032960993,0.03015747,0.0025419032,0.0039625396,0.0027870964,0.06644743,0.00007637879],"about_ca_topic_score_codex":0.009388336,"about_ca_topic_score_gemma":0.021339176,"teacher_disagreement_score":0.9962096,"about_ca_system_score_codex":0.001036528,"about_ca_system_score_gemma":0.00088880834,"threshold_uncertainty_score":0.01866734},"labels":[],"label_agreement":null},{"id":"W98491823","doi":"","title":"The Impact of Conceptual Modeling on Dataset Completeness: A Field Experiment","year":2014,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":27,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Completeness (order theory); Computer science; Context (archaeology); Conceptual model; Field (mathematics); Dimension (graph theory); Conceptual framework; Context model; Mathematics; Artificial intelligence","score_opus":0.3721302909571856,"score_gpt":0.4996081782359375,"score_spread":0.12747788727875192,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W98491823","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9937928,0.00004963684,0.0035074065,0.0001966867,0.000016382484,0.0010311732,0.00019894673,0.0000770414,0.0011299798],"genre_scores_gemma":[0.9785518,0.000059377628,0.017448047,0.00026028644,0.000031920066,0.0027158877,0.00031154763,0.000035604688,0.00058549765],"study_design_codex":"design_other","study_design_gemma":"nonrandomized_trial","domain_scores_codex":[0.9747728,0.017094143,0.002165483,0.002629149,0.0026015055,0.0007368935],"domain_scores_gemma":[0.4569533,0.49261114,0.018720178,0.021686519,0.0061653093,0.0038635056],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.03521703,0.00089407543,0.0010864649,0.001144167,0.0014687546,0.0026317392,0.0019694366,0.0019343043,0.004274365],"category_scores_gemma":[0.17634295,0.00082375255,0.0009800252,0.0008911055,0.0024442622,0.00465709,0.003046896,0.002552392,0.0003903258],"study_design_candidate":"nonrandomized_trial","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0827361,0.18884593,0.25064704,0.0045588156,0.0015228585,0.0010728891,0.055843864,0.034553904,0.09713119,0.013009684,0.0059710164,0.26410663],"study_design_scores_gemma":[0.027166797,0.32201657,0.36028075,0.0009339918,0.0023652145,0.0011410014,0.017540827,0.13815013,0.077007964,0.030542027,0.021751694,0.001102993],"about_ca_topic_score_codex":0.0011359806,"about_ca_topic_score_gemma":0.00083250535,"teacher_disagreement_score":0.96478295,"about_ca_system_score_codex":0.0013981794,"about_ca_system_score_gemma":0.0018013855,"threshold_uncertainty_score":0.1862477},"labels":[],"label_agreement":null}]}