{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":17,"total_is_capped":false,"direct_labels_cover":0,"predictions_cover":17,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"3a6ab8d7bbaf","filters":{"venue":"Journal of Data and Information Quality"}},"results":[{"id":"W2899154813","doi":"10.1145/3239571","title":"Anserini","year":2018,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Information Retrieval and Search Behavior","field":"Computer Science","cited_by":230,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada; National Science Foundation","keywords":"Computer science; Information retrieval; World Wide Web; Ranking (information retrieval); Context (archaeology); Search engine indexing; Implementation; Data science; Software engineering","authors":[{"name":"Peilin Yang","is_ca":false},{"name":"Hui Fang","is_ca":false},{"name":"Jimmy Lin","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1067568912519719,"gpt":0.3914247076637422,"spread":0.2846678164117703,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004391655,0.001382338,0.001320268,0.004665756,0.002545107,0.006867705,0.002537536,0.001988963,0.1391873],"category_scores_gemma":[0.01659606,0.000774427,0.001161966,0.003775898,0.001315966,0.007519593,0.005211914,0.002431556,0.1528894],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002295859,"about_ca_system_score_gemma":0.003203284,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004579382,"about_ca_topic_score_gemma":0.005225856,"domain_scores_codex":[0.9941661,0.001074485,0.0003905293,0.001403015,0.002542177,0.0004236937],"domain_scores_gemma":[0.9922965,0.002050696,0.0003985959,0.002452871,0.002163561,0.0006376668],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0003865675,0.0001824367,0.002591538,0.0006043327,0.0000581545,0.0002520788,0.0004523397,0.002013202,0.004741944,0.05996548,0.3109477,0.6178042],"study_design_scores_gemma":[0.00003409402,0.0001094384,0.001257177,0.0001531599,0.00002788227,0.0005490099,0.00009432207,0.008790037,0.005517837,0.01858827,0.9648036,0.00007508496],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"other","genre_gemma":"methods","genre_scores_codex":[0.01584384,0.01171018,0.2932384,0.01258994,0.005840839,0.0009887861,0.0129375,0.06034621,0.5865043],"genre_scores_gemma":[0.1044367,0.007031924,0.2440297,0.005872109,0.002175173,0.001032389,0.0305411,0.008911609,0.5959693],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.1391873,"threshold_uncertainty_score":0,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4220991771","doi":"10.1145/3506712","title":"Machine Learning and Data Cleaning: Which Serves the Other?","year":2022,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":51,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Data quality; Software deployment; Data science; Data integration; Quality (philosophy); Data mining; Software engineering; Engineering","authors":[{"name":"Ihab F. Ilyas","is_ca":true},{"name":"Theodoros Rekatsinas","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3220743629101961,"gpt":0.472009332225758,"spread":0.1499349693155619,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07152136,0.001742522,0.005239761,0.006614832,0.005035177,0.01717764,0.005089624,0.01266671,0.007506047],"category_scores_gemma":[0.1120041,0.001193143,0.002486946,0.01043934,0.02308006,0.04361614,0.01189791,0.01741279,0.005002258],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005777326,"about_ca_system_score_gemma":0.01080583,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007692141,"about_ca_topic_score_gemma":0.005181109,"domain_scores_codex":[0.9439567,0.03569829,0.002692401,0.005343246,0.01026506,0.002044325],"domain_scores_gemma":[0.8591707,0.08854808,0.007952981,0.01292209,0.02558225,0.005823916],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0002933572,0.000285069,0.008499325,0.005815925,0.0006314433,0.0003063944,0.003838439,0.001231206,0.0006543815,0.2313642,0.151699,0.5953813],"study_design_scores_gemma":[0.0001029928,0.0002075165,0.004055777,0.008103324,0.0002461692,0.001064917,0.00860488,0.005275103,0.001073999,0.5980473,0.3729418,0.000276191],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"commentary","genre_gemma":"empirical","genre_scores_codex":[0.001690619,0.2046066,0.06761272,0.7113822,0.007269031,0.00008128655,0.0001302913,0.0003295019,0.006897769],"genre_scores_gemma":[0.1398869,0.4284501,0.1501798,0.2071728,0.0614489,0.0005220362,0.0004801283,0.0009140194,0.01094546],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.07152136,"threshold_uncertainty_score":0.3782457,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2883256923","doi":"10.1145/3239570","title":"Evaluation-as-a-Service for the Computational Sciences","year":2018,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Machine Learning and Data Classification","field":"Computer Science","cited_by":44,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Data science; Crowdsourcing; Field (mathematics); Executable; Domain (mathematical analysis); Service (business); Confidentiality; Big data; Work (physics); World Wide Web; Data mining; Computer security","authors":[{"name":"Frank Hopfgartner","is_ca":false},{"name":"Allan Hanbury","is_ca":false},{"name":"Henning Müller","is_ca":false},{"name":"Ivan Eggel","is_ca":false},{"name":"Krisztian Balog","is_ca":false},{"name":"Torben Brodt","is_ca":false},{"name":"Gordon V. Cormack","is_ca":true},{"name":"Jimmy Lin","is_ca":true},{"name":"Jayashree Kalpathy–Cramer","is_ca":false},{"name":"Noriko Kando","is_ca":false},{"name":"Makoto P. Kato","is_ca":false},{"name":"Anastasia Krithara","is_ca":false},{"name":"Tim Gollub","is_ca":false},{"name":"Martin Potthast","is_ca":false},{"name":"Evelyne Viegas","is_ca":false},{"name":"Simon Mercer","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2061877675601156,"gpt":0.4578079204475153,"spread":0.2516201528873997,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1104304,0.003889116,0.005660941,0.005957027,0.002706884,0.02833686,0.008920494,0.009367264,0.06937005],"category_scores_gemma":[0.3549123,0.002231881,0.002885771,0.01181401,0.006521523,0.03369898,0.02044476,0.01377001,0.06938732],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.009390213,"about_ca_system_score_gemma":0.01526825,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003440714,"about_ca_topic_score_gemma":0.00159119,"domain_scores_codex":[0.8401427,0.1020142,0.009822131,0.008732376,0.03572103,0.003567586],"domain_scores_gemma":[0.5906311,0.1870697,0.01299012,0.1253466,0.06619105,0.01777153],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00171319,0.0004707482,0.00191778,0.002109351,0.000563507,0.0004571346,0.00148201,0.007057989,0.002716694,0.1678934,0.4142398,0.3993784],"study_design_scores_gemma":[0.0005427951,0.0002899703,0.001377192,0.001204523,0.00008520013,0.000399524,0.0006736586,0.05354907,0.00253817,0.2977712,0.6413067,0.0002619785],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001902376,0.004078073,0.8484744,0.01977888,0.003116607,0.002646337,0.002885493,0.05825112,0.05886663],"genre_scores_gemma":[0.18111,0.01123399,0.6511757,0.01394239,0.007840428,0.01134038,0.02310948,0.05245792,0.04778972],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.1104304,"threshold_uncertainty_score":0.5840189,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3042293458","doi":"10.1145/3328747","title":"Characterizing Disinformation Risk to Open Data in the Post-Truth Era","year":2020,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":34,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"Dalhousie University","funders":"","keywords":"Disinformation; Open data; Computer science; Data science; Data quality; Big data; Analytics; Harm; Transparency (behavior); Quality (philosophy); Business intelligence; Social media; Internet privacy; Computer security; Risk analysis (engineering); Business; Data mining; World Wide Web; Political science; Marketing","authors":[{"name":"Adrienne Colborne","is_ca":true},{"name":"Michael Smit","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.4065919786832916,"gpt":0.4886072663206588,"spread":0.08201528763736715,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.04142351,0.000470222,0.0004819229,0.005846429,0.006892259,0.01212273,0.001610439,0.0047402,0.003026488],"category_scores_gemma":[0.2096872,0.0005157298,0.0007598635,0.005210858,0.01352196,0.01498103,0.006866343,0.00717284,0.0002690573],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01418903,"about_ca_system_score_gemma":0.009671052,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0576504,"about_ca_topic_score_gemma":0.0573786,"domain_scores_codex":[0.9558169,0.02398844,0.001752627,0.002139824,0.01281822,0.003483836],"domain_scores_gemma":[0.605005,0.3065259,0.0446019,0.01641952,0.02409555,0.003352159],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0004829339,0.0002359126,0.1565963,0.0006524089,0.0001343836,0.003994393,0.1782425,0.01316852,0.002508511,0.5848114,0.007786795,0.05138584],"study_design_scores_gemma":[0.00005641285,0.0002709803,0.08168539,0.002306082,0.0001974615,0.003352698,0.3019804,0.05805468,0.007229124,0.4428433,0.101613,0.0004105941],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7590008,0.001642472,0.08908599,0.05407267,0.0001431249,0.0005921465,0.0008559813,0.000167885,0.0944389],"genre_scores_gemma":[0.9897592,0.000373189,0.007515496,0.0009189422,0.00004354352,0.00007322928,0.000131995,0.00003495992,0.00114942],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9983895,"threshold_uncertainty_score":0.2190711,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2604978321","doi":"10.1145/3148239","title":"Ontological Multidimensional Data Models and Contextual Data Quality","year":2017,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":20,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McMaster University; Carleton University","funders":"","keywords":"Computer science; Datalog; Dimension (graph theory); Context (archaeology); Data model (GIS); Data quality; Representation (politics); Ontology; Data mining; Data modeling; Theoretical computer science; Quality (philosophy); Information retrieval; Artificial intelligence; Database; Mathematics","authors":[{"name":"Leopoldo Bertossi","is_ca":true},{"name":"Mostafa Milani","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7487698138314796,"gpt":0.5623588758904626,"spread":0.1864109379410169,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01351414,0.0009027799,0.00103902,0.00552889,0.001848101,0.01005694,0.002522187,0.002114565,0.001753963],"category_scores_gemma":[0.0298539,0.0009026995,0.00278258,0.006619308,0.005944886,0.0165365,0.008100551,0.003632752,0.0003641383],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003830312,"about_ca_system_score_gemma":0.003108903,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006888836,"about_ca_topic_score_gemma":0.005091314,"domain_scores_codex":[0.9820619,0.006972117,0.002506417,0.002307321,0.005353225,0.0007990493],"domain_scores_gemma":[0.9761154,0.009785069,0.002707022,0.007548857,0.003156627,0.000686997],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0000228668,0.00002346336,0.001327945,0.0002070408,0.0000574868,0.0001849922,0.0006284381,0.01006731,0.0005712194,0.9679391,0.001351535,0.01761853],"study_design_scores_gemma":[0.00001672929,0.00002269526,0.0006696394,0.000214409,0.00007753968,0.0002773722,0.0005952217,0.06108586,0.001349203,0.9011849,0.03446044,0.00004596572],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.007276714,0.001166417,0.9803412,0.00450157,0.0001140218,0.0001083687,0.0006661793,0.0003234757,0.005502139],"genre_scores_gemma":[0.2160973,0.002145885,0.7759257,0.001370884,0.0002994531,0.0004606025,0.001828168,0.0001333548,0.001738712],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01351414,"threshold_uncertainty_score":0.0714705,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2726342193","doi":"10.1145/3041761","title":"Dependable Data Repairing with Fixing Rules","year":2017,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":14,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; Tuple; Data mining; Set (abstract data type); Data integrity; Class (philosophy); Artificial intelligence; Database","authors":[{"name":"Jiannan Wang","is_ca":true},{"name":"Nan Tang","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.4729249625945691,"gpt":0.5056587030425448,"spread":0.03273374044797572,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01049036,0.001795226,0.002042043,0.004519955,0.00188582,0.003534477,0.005688857,0.002823173,0.002144727],"category_scores_gemma":[0.06757914,0.001466909,0.003718339,0.003406347,0.003183718,0.005229757,0.004463663,0.00403516,0.001024441],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001350474,"about_ca_system_score_gemma":0.003630694,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005096319,"about_ca_topic_score_gemma":0.00471744,"domain_scores_codex":[0.9829055,0.00378684,0.002241965,0.004332307,0.005942374,0.0007910266],"domain_scores_gemma":[0.9244609,0.03783238,0.007519656,0.021432,0.008228188,0.0005268757],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003551353,0.0004389968,0.0152276,0.0008381406,0.0004632249,0.00131361,0.001093084,0.2949863,0.01886375,0.04008886,0.008919382,0.6174118],"study_design_scores_gemma":[0.00008391734,0.0001974949,0.002090101,0.0002622764,0.0002731972,0.001296507,0.0003671676,0.8143592,0.0494641,0.1153916,0.01606319,0.0001511511],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01484999,0.0002506442,0.9802639,0.0003545671,0.00004656556,0.0002514096,0.0002991194,0.003096773,0.0005870888],"genre_scores_gemma":[0.1276241,0.0002385696,0.8690225,0.0002993166,0.00004876978,0.0002534452,0.001142449,0.0004718306,0.0008989134],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01049036,"threshold_uncertainty_score":0.05547899,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2559039427","doi":"10.1145/3005395","title":"Editorial","year":2016,"lang":"en","type":"editorial","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Citation; Library science; Amazon rainforest; Computer science; World Wide Web","authors":[{"name":"Christian Bizer","is_ca":false},{"name":"Luna Dong","is_ca":false},{"name":"Ihab F. Ilyas","is_ca":true},{"name":"María-Esther Vidal","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1552228863963259,"gpt":0.4827182751786968,"spread":0.3274953887823709,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003830145,0.002055835,0.002066652,0.002140365,0.002156095,0.006395786,0.002805588,0.007236315,0.04199162],"category_scores_gemma":[0.02066355,0.0005355041,0.001879263,0.001011853,0.001491351,0.004367258,0.001588149,0.01181902,0.0341021],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001964101,"about_ca_system_score_gemma":0.002747329,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0009661994,"about_ca_topic_score_gemma":0.002400385,"domain_scores_codex":[0.9963874,0.0003525536,0.0004325076,0.0006228768,0.001865788,0.0003389331],"domain_scores_gemma":[0.9843923,0.002769328,0.0009107756,0.0005850644,0.008249421,0.003093191],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0000140643,0.00001081334,0.00003594464,0.00008929423,0.000004718599,0.00009649937,0.000007837651,0.0000167267,0.00003722788,0.0003346772,0.9915345,0.007817762],"study_design_scores_gemma":[0.00001389107,0.00001250393,0.0001361695,0.0001606467,0.000008303337,0.0002012914,0.00002657291,0.00004951985,0.00006279848,0.0005618097,0.9987596,0.000006893806],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"editorial","genre_gemma":"editorial","genre_scores_codex":[0.00004493486,0.002553798,0.0001276959,0.03326892,0.9605495,0.00001902578,0.00008320666,0.00006328568,0.003289624],"genre_scores_gemma":[0.0006239277,0.00400479,0.0001633735,0.02849727,0.9433421,0.00002583062,0.0001217218,0.00005974459,0.02316124],"genre_candidate":"editorial","genre_consensus":"editorial","teacher_disagreement_score":0.04199162,"threshold_uncertainty_score":0,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2797647106","doi":"10.1145/3190577","title":"InfoClean","year":2017,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Privacy-Preserving Technologies in Data","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McMaster University","funders":"","keywords":"Computer science; Confidentiality; Information sensitivity; Data mining; Process (computing); Data quality; Set (abstract data type); Information privacy; Information loss; Data set; Database; Data science; Computer security; Artificial intelligence","authors":[{"name":"Fei Chiang","is_ca":true},{"name":"Dhruv Gairola","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1247884661779293,"gpt":0.3855261588859472,"spread":0.2607376927080179,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00358904,0.002001266,0.001758306,0.005443807,0.002379751,0.008001858,0.004146279,0.0024005,0.0660184],"category_scores_gemma":[0.01714829,0.001316341,0.003210411,0.005452708,0.00108202,0.008340333,0.006678186,0.003096503,0.05080087],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001226624,"about_ca_system_score_gemma":0.003861419,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003355052,"about_ca_topic_score_gemma":0.004581771,"domain_scores_codex":[0.9954797,0.0006764446,0.0004586148,0.00109102,0.001986595,0.0003076331],"domain_scores_gemma":[0.9908944,0.002087051,0.0004648444,0.004645258,0.001661191,0.0002472372],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.000633198,0.0002024184,0.004495177,0.001681167,0.0003421363,0.000476353,0.0005889387,0.004188647,0.004322792,0.04188948,0.5373911,0.4037886],"study_design_scores_gemma":[0.00007639844,0.00007455832,0.0013501,0.0002446245,0.00008516922,0.0005479817,0.0002700013,0.01819371,0.01437706,0.04117215,0.9235305,0.00007787591],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.007545008,0.004687097,0.5485691,0.004734895,0.001684959,0.001084138,0.07921217,0.2595254,0.09295721],"genre_scores_gemma":[0.07170301,0.004382,0.5481141,0.005576994,0.0006767907,0.001135921,0.259783,0.03945182,0.06917652],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0660184,"threshold_uncertainty_score":0,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2542250253","doi":"10.1145/3012004","title":"The Challenge of Test Data Quality in Data Processing","year":2017,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"Natural Sciences and Engineering Research Council of Canada; Vienna Science and Technology Fund","keywords":"Citation; Test (biology); Computer science; Data quality; Library science; Quality (philosophy); World Wide Web; Data science; Engineering; Operations management","authors":[{"name":"Christoph Becker","is_ca":true},{"name":"Kresimir Duretec","is_ca":true},{"name":"Andreas Rauber","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.6182808189797534,"gpt":0.5581897740451959,"spread":0.06009104493455752,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.403006,0.001740443,0.004965005,0.006536602,0.003739403,0.0256544,0.008660882,0.00834165,0.005173991],"category_scores_gemma":[0.7120219,0.001738899,0.002399988,0.009797222,0.03329949,0.02914498,0.01573902,0.02005999,0.002570867],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01014484,"about_ca_system_score_gemma":0.01724264,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01141704,"about_ca_topic_score_gemma":0.004470924,"domain_scores_codex":[0.5772017,0.294138,0.02283281,0.02244843,0.08060777,0.002771234],"domain_scores_gemma":[0.1108718,0.7254237,0.02404773,0.08097336,0.05375158,0.004931756],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0008281323,0.0002890649,0.02984825,0.003238572,0.001186297,0.0002419938,0.003304286,0.01063016,0.00141033,0.3071983,0.08858178,0.5532428],"study_design_scores_gemma":[0.0002357011,0.0004190794,0.006533588,0.00178713,0.0001940445,0.0003913617,0.001425432,0.04384301,0.00183278,0.8797889,0.06337265,0.0001762334],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01787135,0.04738326,0.5098339,0.3895094,0.005346678,0.0007221657,0.002334238,0.00356174,0.02343708],"genre_scores_gemma":[0.5030618,0.0178712,0.404368,0.05028671,0.01267439,0.001343924,0.002777225,0.002384947,0.005231882],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.403006,"threshold_uncertainty_score":0.7361999,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2736121570","doi":"10.1145/3058750","title":"An Exploratory Case Study to Understand Primary Care Users and Their Data Quality Tradeoffs","year":2017,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo; Conestoga College","funders":"","keywords":"Completeness (order theory); Computer science; Data quality; Workflow; Quality (philosophy); Data mining; Data science; Database; Business; Mathematics; Marketing","authors":[{"name":"Justin St-Maurice","is_ca":true},{"name":"Catherine M. Burns","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5819441096579165,"gpt":0.5200055265519502,"spread":0.06193858310596634,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01337221,0.0005037371,0.0005636082,0.001624774,0.00693605,0.002762893,0.00151945,0.002895837,0.003388498],"category_scores_gemma":[0.02798397,0.0005437661,0.0005827384,0.001925746,0.002173599,0.002727146,0.002550664,0.002127328,0.0003348524],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004677927,"about_ca_system_score_gemma":0.003075411,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007623432,"about_ca_topic_score_gemma":0.01437208,"domain_scores_codex":[0.9836593,0.01267533,0.0005777774,0.0007731576,0.00116188,0.001152597],"domain_scores_gemma":[0.9491385,0.04174086,0.003021214,0.001239031,0.002457422,0.002402968],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.0006403549,0.006153448,0.2382424,0.001128274,0.0001194471,0.05378389,0.6289958,0.002051427,0.003386479,0.01286825,0.005636891,0.04699324],"study_design_scores_gemma":[0.0001771633,0.003822551,0.06671479,0.0005731864,0.00007711592,0.01763838,0.8700976,0.006884926,0.002488485,0.004483483,0.02692495,0.0001173205],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9903072,0.0002983879,0.003235762,0.001640986,0.00001386552,0.0005492888,0.000132075,0.00001397758,0.003808544],"genre_scores_gemma":[0.9896469,0.0003738993,0.007379335,0.0005092212,0.00002332685,0.0004798188,0.00007319487,0.000009756048,0.001504605],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01337221,"threshold_uncertainty_score":0.07071984,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4366683629","doi":"10.1145/3592534","title":"A Method to Classify Data Quality for Decision Making Under Uncertainty","year":2023,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Université Laval","funders":"Fonds de recherche du Québec – Nature et technologies; Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Data quality; Quality (philosophy); Context (archaeology); Process (computing); Data mining; Decision support system; Risk analysis (engineering); Data science","authors":[{"name":"Vanessa Simard","is_ca":true},{"name":"Mikael Rönnqvist","is_ca":true},{"name":"Luc LeBel","is_ca":true},{"name":"Nadia Lehoux","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.6503576233917492,"gpt":0.6216140905973337,"spread":0.02874353279441544,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0236772,0.001729151,0.00196136,0.01181441,0.002362009,0.007844283,0.002809549,0.002690065,0.002918512],"category_scores_gemma":[0.07481039,0.0007125044,0.002684148,0.007943411,0.003243072,0.006849261,0.003300268,0.004078655,0.0007741687],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003898165,"about_ca_system_score_gemma":0.004429591,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004378161,"about_ca_topic_score_gemma":0.003098162,"domain_scores_codex":[0.9731752,0.01010255,0.003593683,0.003178646,0.009102407,0.0008475213],"domain_scores_gemma":[0.9261028,0.04548399,0.00754509,0.005876682,0.01401466,0.0009768547],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0004043903,0.000371042,0.01369917,0.001150085,0.0004142151,0.0003011497,0.002569301,0.05980819,0.006512091,0.1879009,0.007194345,0.7196752],"study_design_scores_gemma":[0.000145275,0.0003896799,0.005375887,0.0009143389,0.0002896304,0.0006131352,0.001368924,0.7195312,0.01037256,0.2287335,0.03195264,0.0003131651],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.003335367,0.000199166,0.9932061,0.0004902125,0.00007266102,0.0003352838,0.0001735676,0.0003925505,0.001795064],"genre_scores_gemma":[0.06379846,0.000140985,0.9344884,0.0001172867,0.00006812442,0.0005521444,0.0002207736,0.0000540097,0.000559727],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.0236772,"threshold_uncertainty_score":0.1252185,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2516718098","doi":"10.1145/2883616","title":"Unifying Data and Constraint Repairs","year":2016,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"McMaster University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Data integrity; Data quality; Constraint (computer-aided design); Scalability; Set (abstract data type); Data mining; Semantics (computer science); Data type; Data modeling; Quality (philosophy); Database; Programming language","authors":[{"name":"Fei Chiang","is_ca":true},{"name":"Siddharth Sitaramachandran","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.4241185632103378,"gpt":0.4856853147821305,"spread":0.0615667515717927,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01619767,0.002537354,0.002985861,0.005475366,0.001479954,0.006376355,0.009088022,0.003722545,0.004613788],"category_scores_gemma":[0.08203267,0.001684524,0.003843165,0.006112706,0.003289207,0.01512703,0.007227059,0.004233909,0.0009097249],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004236169,"about_ca_system_score_gemma":0.004460956,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01248793,"about_ca_topic_score_gemma":0.01066636,"domain_scores_codex":[0.9759837,0.006108108,0.002873556,0.004909281,0.00883339,0.001292097],"domain_scores_gemma":[0.9394224,0.02815418,0.007101059,0.01588883,0.008328592,0.001105012],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0003759437,0.0001958787,0.007099397,0.0007543031,0.0003816018,0.0004056256,0.0007785801,0.5699845,0.002027823,0.1352055,0.005626826,0.277164],"study_design_scores_gemma":[0.00003785919,0.0001166817,0.0007608439,0.0001017139,0.00009993762,0.000277464,0.0002203022,0.8763836,0.003074681,0.109442,0.009425591,0.00005922853],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01183543,0.000630103,0.9824901,0.0007082358,0.0001114318,0.0002575235,0.0007580153,0.001610146,0.001599072],"genre_scores_gemma":[0.1936479,0.0005449021,0.7993613,0.0003162349,0.0001229708,0.0004530305,0.002106388,0.0008393119,0.002607861],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01619767,"threshold_uncertainty_score":0.08566248,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4224288101","doi":"10.1145/3524303","title":"Contextual Data Cleaning with Ontology Functional Dependencies","year":2022,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Ontario Tech University; University of Waterloo; McMaster University","funders":"","keywords":"Ontology; Axiom; Computer science; Functional dependency; Inference; Dependency (UML); Set (abstract data type); Dependency theory (database theory); Relation (database); Data mining; Artificial intelligence; Relational database; Mathematics","authors":[{"name":"Zheng Zheng","is_ca":true},{"name":"Longtao Zheng","is_ca":false},{"name":"Morteza Alipourlangouri","is_ca":true},{"name":"Fei Chiang","is_ca":true},{"name":"Lukasz Golab","is_ca":true},{"name":"Jaroslaw Szlichta","is_ca":true},{"name":"Sridevi Baskaran","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.4677702605003999,"gpt":0.452390842963974,"spread":0.01537941753642585,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01280239,0.001243768,0.001304515,0.0050879,0.002656621,0.003263409,0.003442183,0.001836035,0.001586263],"category_scores_gemma":[0.0736202,0.001182292,0.003740099,0.005494535,0.003134922,0.006782784,0.007689937,0.00373953,0.0004864841],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002123281,"about_ca_system_score_gemma":0.006386623,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01121266,"about_ca_topic_score_gemma":0.01602696,"domain_scores_codex":[0.9794614,0.00682774,0.001962819,0.004136915,0.006737336,0.0008737772],"domain_scores_gemma":[0.9316756,0.03637591,0.005555235,0.01868323,0.007211703,0.0004982552],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004681487,0.0004289915,0.04186444,0.002014238,0.0006958778,0.001640723,0.003385196,0.1520008,0.02277221,0.1707439,0.01503735,0.588948],"study_design_scores_gemma":[0.00007202521,0.0002059869,0.007526405,0.0004824576,0.0004333254,0.001647893,0.001416314,0.5662795,0.05752672,0.3157865,0.04842591,0.0001969989],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01189464,0.0002454798,0.9846015,0.0005385164,0.00003807854,0.0001720083,0.0005525779,0.001190898,0.0007663086],"genre_scores_gemma":[0.1265616,0.0002376093,0.8702582,0.0003603526,0.00005106887,0.0001964058,0.001461933,0.0002612167,0.0006116922],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01280239,"threshold_uncertainty_score":0.06770635,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3195742729","doi":"10.1145/3468063","title":"Benchmark of Bitrate Adaptation in Video Streaming","year":2021,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Image and Video Quality Assessment","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Windsor","funders":"","keywords":"Computer science; Benchmark (surveying); Upload; Task (project management); Heuristic; Benchmarking; Throughput; Upper and lower bounds; Streaming algorithm; Session (web analytics); Time complexity; Algorithm; Artificial intelligence; Wireless; Mathematics","authors":[{"name":"Jessica Chen","is_ca":true},{"name":"Henry Milner","is_ca":false},{"name":"Ion Stoica","is_ca":false},{"name":"Jibin Zhan","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.08316224013716889,"gpt":0.3659461388783409,"spread":0.282783898741172,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00176635,0.001371491,0.001004995,0.0009112665,0.0005561673,0.0008344293,0.001350062,0.001036285,0.002441328],"category_scores_gemma":[0.007026459,0.0002009128,0.0004780026,0.001242082,0.0005477998,0.000926432,0.0008097262,0.001227251,0.000297314],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001376537,"about_ca_system_score_gemma":0.0009922046,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007304842,"about_ca_topic_score_gemma":0.004282838,"domain_scores_codex":[0.9985908,0.0004378063,0.00006948777,0.0002150529,0.0003766627,0.0003101514],"domain_scores_gemma":[0.9954187,0.003058175,0.0002029962,0.000358922,0.0007213532,0.0002398529],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0009764367,0.0006418032,0.001450022,0.000833863,0.00007916732,0.0002078811,0.00007927076,0.9076961,0.008801808,0.005988626,0.006089654,0.06715542],"study_design_scores_gemma":[0.00007529512,0.0003260236,0.001107963,0.00001751309,0.00001358073,0.0000416747,0.00005542318,0.9899814,0.004728834,0.002648111,0.0009945318,0.000009790741],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8275874,0.005862884,0.1204914,0.001483801,0.0005651699,0.0004712072,0.00215468,0.0029454,0.03843804],"genre_scores_gemma":[0.9508204,0.0006335589,0.04502879,0.0001084655,0.00005378229,0.0001062168,0.001193993,0.0001353955,0.00191951],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.007304842,"threshold_uncertainty_score":0.01452464,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2972308422","doi":"10.1145/3309682","title":"Improving Adaptive Video Streaming through Session Classification","year":2019,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Image and Video Quality Assessment","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Windsor","funders":"","keywords":"Computer science; Session (web analytics); Popularity; Quality of experience; Throughput; Computer network; The Internet; Multimedia; Quality of service; Real-time computing; World Wide Web; Telecommunications; Wireless","authors":[{"name":"Zahaib Akhtar","is_ca":false},{"name":"Anh Le","is_ca":true},{"name":"Yun Seong Nam","is_ca":false},{"name":"Jessica Chen","is_ca":true},{"name":"Ramesh Govindan","is_ca":false},{"name":"Ethan Katz-Bassett","is_ca":false},{"name":"Sanjay Rao","is_ca":false},{"name":"Jibin Zhan","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.09982095728446964,"gpt":0.3748448468625624,"spread":0.2750238895780927,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001234139,0.0006391147,0.0009657398,0.001087363,0.0004115863,0.0005663785,0.0008915616,0.0005059289,0.0004750876],"category_scores_gemma":[0.002842107,0.0001664297,0.0005505723,0.0006952878,0.0001767337,0.001011517,0.0005457636,0.0008219543,0.0002496692],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004070687,"about_ca_system_score_gemma":0.0006735952,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004107688,"about_ca_topic_score_gemma":0.003787701,"domain_scores_codex":[0.9992396,0.0001794704,0.00005770933,0.000150126,0.0002424659,0.000130816],"domain_scores_gemma":[0.9981493,0.0005718762,0.0001692666,0.0001772835,0.0007795059,0.0001527227],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008190287,0.0009479467,0.02754083,0.0001435988,0.0001158712,0.000152104,0.0003859777,0.08292449,0.06840292,0.001370598,0.003357745,0.813839],"study_design_scores_gemma":[0.00001508287,0.0002347316,0.009119025,0.000009490395,0.00005028541,0.0001267704,0.00008806128,0.975369,0.01227887,0.001563022,0.00111713,0.00002839059],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3478142,0.0005311572,0.6462323,0.0001977103,0.0001133809,0.0002285806,0.0003143715,0.003164307,0.001403936],"genre_scores_gemma":[0.8812921,0.0001759142,0.116036,0.00009509356,0.0000932454,0.00009858543,0.0007730281,0.0001106675,0.001325302],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004107688,"threshold_uncertainty_score":0.008167565,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4402806881","doi":"10.1145/3696110","title":"Automated anomaly detection for categorical data by repurposing a form filling recommender system","year":2024,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Anomaly Detection Techniques and Applications","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Ottawa","funders":"Fonds National de la Recherche Luxembourg; Natural Sciences and Engineering Research Council of Canada; BNP Paribas Cardif; Canada Research Chairs; Science Foundation Ireland","keywords":"Repurposing; Computer science; Categorical variable; Recommender system; Anomaly detection; Data mining; Anomaly (physics); Artificial intelligence; Information retrieval; Machine learning","authors":[{"name":"Hichem Belgacem","is_ca":false},{"name":"Xiaochen Li","is_ca":false},{"name":"Domenico Bianculli","is_ca":false},{"name":"Lionel Briand","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.08194400033841359,"gpt":0.3697688114118219,"spread":0.2878248110734083,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00242391,0.001020686,0.001538939,0.003489438,0.0006471191,0.00130454,0.002395192,0.001345336,0.001276666],"category_scores_gemma":[0.01381316,0.0004280077,0.001232573,0.002430668,0.0004614303,0.002077238,0.001326919,0.001516042,0.00154038],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007778803,"about_ca_system_score_gemma":0.001373397,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01157072,"about_ca_topic_score_gemma":0.01557805,"domain_scores_codex":[0.9973292,0.0004796236,0.0002757277,0.0007873395,0.0009555171,0.0001725847],"domain_scores_gemma":[0.9921741,0.002835057,0.0008200105,0.001679924,0.00221385,0.0002770142],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000335739,0.0003959139,0.07709959,0.0002385712,0.0001699851,0.000398272,0.0004141322,0.02856445,0.01842239,0.002329936,0.009806726,0.8618242],"study_design_scores_gemma":[0.00002469877,0.000116149,0.008871322,0.00002352304,0.00004232174,0.0003900046,0.0001100818,0.9736782,0.009672527,0.002777977,0.004245755,0.00004738571],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1264278,0.0007294449,0.8360167,0.0006553657,0.0001182499,0.000277827,0.001643039,0.03274892,0.001382729],"genre_scores_gemma":[0.4556178,0.0002021261,0.5400087,0.0001916294,0.00004864875,0.0001407568,0.002145278,0.0001893548,0.001455656],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01157072,"threshold_uncertainty_score":0.02300674,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4405575840","doi":"10.1145/3708503","title":"Editorial: Special Issue on Software Engineering and AI for Data Quality","year":2024,"lang":"en","type":"editorial","venue":"Journal of Data and Information Quality","topic":"Big Data and Business Intelligence","field":"Business, Management and Accounting","cited_by":0,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Polytechnique Montréal","funders":"","keywords":"Computer science; Quality (philosophy); Data quality; Data science; Software; Software engineering; Software quality; Software development; Engineering; Programming language","authors":[{"name":"Foutse Khomh","is_ca":true},{"name":"Andreas Metzger","is_ca":false},{"name":"Phu H. Nguyen","is_ca":false},{"name":"Sagar Sen","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.089642029191433,"gpt":0.3800565962012896,"spread":0.2904145670098566,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005946701,0.002999996,0.002929335,0.004028669,0.003074186,0.008231211,0.002350141,0.009316119,0.03236313],"category_scores_gemma":[0.02549596,0.0009658474,0.00204024,0.00156467,0.001942154,0.00405578,0.001288502,0.01360281,0.02534462],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002301152,"about_ca_system_score_gemma":0.004010036,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001547691,"about_ca_topic_score_gemma":0.005583355,"domain_scores_codex":[0.9941112,0.0007174329,0.0005603745,0.0005626574,0.003705326,0.0003428679],"domain_scores_gemma":[0.9723466,0.008683115,0.001392836,0.0006045358,0.01328347,0.003689443],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00001746761,0.000007131076,0.00001780196,0.00007026055,0.000005805779,0.00004596879,0.000004924984,0.00001393481,0.00003225431,0.0001903465,0.9963229,0.003271291],"study_design_scores_gemma":[0.00005545582,0.00002485434,0.0002278687,0.0003008783,0.00002585135,0.0001979256,0.00003294198,0.0001744791,0.0001090806,0.001428695,0.9974065,0.00001556198],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"editorial","genre_gemma":"editorial","genre_scores_codex":[0.00002926157,0.001992176,0.0001460804,0.02520349,0.9695366,0.00001921773,0.00006802246,0.00006141872,0.002943768],"genre_scores_gemma":[0.0003038847,0.001953377,0.0001442118,0.01308394,0.9697376,0.00002210029,0.00005307746,0.00006303598,0.01463868],"genre_candidate":"editorial","genre_consensus":"editorial","teacher_disagreement_score":0.03236313,"threshold_uncertainty_score":0.1082654,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}