{"meta":{"query_hash":"3a6ab8d7bbaf","filters":{"venue":"Journal of Data and Information Quality"},"cohort_total":17,"direct_labels_cover":0,"predictions_cover":17,"exported":17,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/3a6ab8d7bbaf","api":"https://metacan.xera.ac/api/v1/cohort?venue=Journal+of+Data+and+Information+Quality"},"results":[{"id":"W2516718098","doi":"10.1145/2883616","title":"Unifying Data and Constraint Repairs","year":2016,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Data integrity; Data quality; Constraint (computer-aided design); Scalability; Set (abstract data type); Data mining; Semantics (computer science); Data type; Data modeling; Quality (philosophy); Database; Programming language","score_opus":0.4241185632103378,"score_gpt":0.4856853147821305,"score_spread":0.0615667515717927,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2516718098","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011835425,0.000630103,0.98249006,0.00070823584,0.00011143181,0.00025752347,0.00075801526,0.0016101458,0.0015990719],"genre_scores_gemma":[0.19364792,0.00054490205,0.79936135,0.0003162349,0.00012297083,0.00045303046,0.0021063876,0.00083931186,0.002607861],"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9759837,0.006108108,0.0028735555,0.0049092807,0.00883339,0.0012920973],"domain_scores_gemma":[0.93942237,0.028154178,0.007101059,0.015888834,0.008328592,0.0011050118],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.016197674,0.002537354,0.002985861,0.0054753656,0.0014799542,0.006376355,0.009088022,0.003722545,0.0046137883],"category_scores_gemma":[0.082032666,0.001684524,0.0038431645,0.006112706,0.003289207,0.015127032,0.0072270585,0.004233909,0.0009097249],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00037594367,0.00019587872,0.0070993975,0.00075430307,0.00038160183,0.00040562556,0.00077858014,0.5699845,0.0020278234,0.13520548,0.005626826,0.27716404],"study_design_scores_gemma":[0.000037859187,0.0001166817,0.00076084386,0.000101713944,0.00009993762,0.00027746396,0.00022030217,0.8763836,0.0030746812,0.109442025,0.009425591,0.000059228532],"about_ca_topic_score_codex":0.012487928,"about_ca_topic_score_gemma":0.010666365,"teacher_disagreement_score":0.016197674,"about_ca_system_score_codex":0.004236169,"about_ca_system_score_gemma":0.004460956,"threshold_uncertainty_score":0.085662484},"labels":[],"label_agreement":null},{"id":"W2542250253","doi":"10.1145/3012004","title":"The Challenge of Test Data Quality in Data Processing","year":2017,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"Natural Sciences and Engineering Research Council of Canada; Vienna Science and Technology Fund","keywords":"Citation; Test (biology); Computer science; Data quality; Library science; Quality (philosophy); World Wide Web; Data science; Engineering; Operations management","score_opus":0.6182808189797534,"score_gpt":0.5581897740451959,"score_spread":0.060091044934557525,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2542250253","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017871348,0.047383264,0.50983393,0.38950944,0.0053466777,0.00072216574,0.0023342383,0.0035617403,0.023437075],"genre_scores_gemma":[0.5030618,0.017871203,0.40436804,0.050286707,0.012674389,0.0013439236,0.002777225,0.0023849474,0.0052318824],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.5772017,0.29413798,0.022832807,0.022448434,0.08060777,0.0027712337],"domain_scores_gemma":[0.11087179,0.7254237,0.024047732,0.080973364,0.053751584,0.004931756],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.40300605,0.0017404434,0.0049650054,0.0065366016,0.0037394026,0.025654398,0.008660882,0.00834165,0.005173991],"category_scores_gemma":[0.71202195,0.0017388992,0.002399988,0.009797222,0.03329949,0.02914498,0.015739016,0.020059993,0.0025708668],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00082813227,0.0002890649,0.029848246,0.0032385716,0.0011862968,0.00024199377,0.0033042862,0.010630159,0.0014103297,0.30719832,0.08858178,0.5532428],"study_design_scores_gemma":[0.00023570114,0.00041907938,0.0065335883,0.00178713,0.0001940445,0.00039136174,0.0014254319,0.043843012,0.0018327798,0.87978894,0.06337265,0.00017623341],"about_ca_topic_score_codex":0.011417037,"about_ca_topic_score_gemma":0.0044709244,"teacher_disagreement_score":0.40300605,"about_ca_system_score_codex":0.010144838,"about_ca_system_score_gemma":0.01724264,"threshold_uncertainty_score":0.73619986},"labels":[],"label_agreement":null},{"id":"W2559039427","doi":"10.1145/3005395","title":"Editorial","year":2016,"lang":"en","type":"editorial","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Citation; Library science; Amazon rainforest; Computer science; World Wide Web","score_opus":0.15522288639632592,"score_gpt":0.4827182751786968,"score_spread":0.3274953887823709,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2559039427","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000044934855,0.0025537976,0.00012769585,0.03326892,0.96054953,0.000019025778,0.00008320666,0.00006328568,0.0032896244],"genre_scores_gemma":[0.0006239277,0.0040047895,0.0001633735,0.02849727,0.94334215,0.000025830615,0.000121721794,0.00005974459,0.02316124],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99638736,0.0003525536,0.00043250757,0.0006228768,0.0018657875,0.00033893305],"domain_scores_gemma":[0.9843923,0.002769328,0.00091077556,0.0005850644,0.008249421,0.003093191],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0038301449,0.002055835,0.0020666518,0.002140365,0.002156095,0.006395786,0.0028055883,0.0072363154,0.041991618],"category_scores_gemma":[0.020663554,0.0005355041,0.0018792633,0.0010118528,0.0014913512,0.004367258,0.0015881495,0.011819017,0.034102105],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000140643015,0.000010813338,0.00003594464,0.00008929423,0.0000047185995,0.00009649937,0.000007837651,0.0000167267,0.000037227885,0.00033467717,0.99153453,0.007817762],"study_design_scores_gemma":[0.000013891066,0.000012503932,0.00013616952,0.00016064673,0.000008303337,0.00020129139,0.000026572907,0.000049519847,0.000062798485,0.0005618097,0.9987596,0.0000068938057],"about_ca_topic_score_codex":0.00096619944,"about_ca_topic_score_gemma":0.0024003854,"teacher_disagreement_score":0.041991618,"about_ca_system_score_codex":0.0019641013,"about_ca_system_score_gemma":0.0027473294,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W2604978321","doi":"10.1145/3148239","title":"Ontological Multidimensional Data Models and Contextual Data Quality","year":2017,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":20,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University; Carleton University","funders":"","keywords":"Computer science; Datalog; Dimension (graph theory); Context (archaeology); Data model (GIS); Data quality; Representation (politics); Ontology; Data mining; Data modeling; Theoretical computer science; Quality (philosophy); Information retrieval; Artificial intelligence; Database; Mathematics","score_opus":0.7487698138314796,"score_gpt":0.5623588758904626,"score_spread":0.18641093794101693,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2604978321","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0072767143,0.001166417,0.9803412,0.00450157,0.00011402181,0.00010836866,0.00066617934,0.0003234757,0.005502139],"genre_scores_gemma":[0.21609728,0.0021458846,0.7759257,0.0013708837,0.00029945307,0.00046060252,0.0018281682,0.00013335483,0.0017387118],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9820619,0.0069721173,0.0025064172,0.0023073214,0.0053532254,0.0007990493],"domain_scores_gemma":[0.9761154,0.009785069,0.0027070222,0.0075488575,0.0031566273,0.000686997],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013514141,0.0009027799,0.00103902,0.00552889,0.0018481013,0.010056939,0.002522187,0.002114565,0.0017539631],"category_scores_gemma":[0.0298539,0.00090269954,0.00278258,0.0066193077,0.0059448862,0.016536504,0.008100551,0.0036327522,0.00036413834],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000022866801,0.00002346336,0.0013279449,0.00020704082,0.0000574868,0.00018499223,0.0006284381,0.010067315,0.00057121937,0.96793914,0.0013515347,0.017618528],"study_design_scores_gemma":[0.000016729295,0.000022695256,0.0006696394,0.00021440898,0.00007753968,0.0002773722,0.0005952217,0.061085857,0.0013492032,0.90118486,0.03446044,0.000045965717],"about_ca_topic_score_codex":0.0068888357,"about_ca_topic_score_gemma":0.005091314,"teacher_disagreement_score":0.013514141,"about_ca_system_score_codex":0.0038303123,"about_ca_system_score_gemma":0.0031089033,"threshold_uncertainty_score":0.0714705},"labels":[],"label_agreement":null},{"id":"W2726342193","doi":"10.1145/3041761","title":"Dependable Data Repairing with Fixing Rules","year":2017,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; Tuple; Data mining; Set (abstract data type); Data integrity; Class (philosophy); Artificial intelligence; Database","score_opus":0.47292496259456906,"score_gpt":0.5056587030425448,"score_spread":0.03273374044797572,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2726342193","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014849988,0.00025064423,0.9802639,0.0003545671,0.000046565565,0.00025140957,0.0002991194,0.003096773,0.00058708875],"genre_scores_gemma":[0.12762414,0.00023856956,0.86902255,0.0002993166,0.00004876978,0.00025344524,0.0011424489,0.00047183063,0.00089891336],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9829055,0.0037868405,0.0022419647,0.004332307,0.0059423745,0.00079102657],"domain_scores_gemma":[0.9244609,0.037832383,0.0075196563,0.021432001,0.008228188,0.0005268757],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010490363,0.0017952261,0.0020420426,0.0045199553,0.0018858202,0.0035344772,0.005688857,0.0028231726,0.0021447274],"category_scores_gemma":[0.067579135,0.0014669088,0.0037183387,0.0034063468,0.0031837183,0.005229757,0.004463663,0.00403516,0.0010244406],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003551353,0.0004389968,0.015227605,0.0008381406,0.00046322486,0.0013136105,0.0010930835,0.2949863,0.018863749,0.04008886,0.008919382,0.6174118],"study_design_scores_gemma":[0.00008391734,0.00019749494,0.0020901014,0.00026227636,0.00027319722,0.0012965067,0.00036716755,0.81435925,0.0494641,0.11539156,0.016063187,0.00015115108],"about_ca_topic_score_codex":0.0050963187,"about_ca_topic_score_gemma":0.00471744,"teacher_disagreement_score":0.010490363,"about_ca_system_score_codex":0.0013504737,"about_ca_system_score_gemma":0.003630694,"threshold_uncertainty_score":0.05547899},"labels":[],"label_agreement":null},{"id":"W2736121570","doi":"10.1145/3058750","title":"An Exploratory Case Study to Understand Primary Care Users and Their Data Quality Tradeoffs","year":2017,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo; Conestoga College","funders":"","keywords":"Completeness (order theory); Computer science; Data quality; Workflow; Quality (philosophy); Data mining; Data science; Database; Business; Mathematics; Marketing","score_opus":0.5819441096579165,"score_gpt":0.5200055265519502,"score_spread":0.06193858310596634,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2736121570","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9903072,0.0002983879,0.0032357622,0.0016409864,0.000013865524,0.00054928876,0.000132075,0.0000139775775,0.0038085443],"genre_scores_gemma":[0.98964685,0.0003738993,0.0073793354,0.00050922116,0.000023326846,0.00047981882,0.00007319487,0.000009756048,0.0015046049],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.98365927,0.012675334,0.00057777745,0.0007731576,0.0011618801,0.0011525969],"domain_scores_gemma":[0.94913846,0.041740857,0.0030212137,0.0012390306,0.0024574217,0.0024029682],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013372206,0.0005037371,0.0005636082,0.0016247744,0.0069360496,0.0027628934,0.0015194505,0.0028958374,0.0033884982],"category_scores_gemma":[0.02798397,0.0005437661,0.0005827384,0.0019257464,0.0021735986,0.0027271463,0.0025506637,0.0021273284,0.0003348524],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00064035493,0.0061534485,0.23824245,0.0011282742,0.00011944713,0.053783886,0.62899584,0.0020514273,0.003386479,0.012868252,0.0056368914,0.04699324],"study_design_scores_gemma":[0.00017716333,0.0038225513,0.06671479,0.00057318644,0.000077115925,0.017638376,0.87009764,0.0068849255,0.0024884853,0.004483483,0.026924947,0.000117320466],"about_ca_topic_score_codex":0.007623432,"about_ca_topic_score_gemma":0.01437208,"teacher_disagreement_score":0.013372206,"about_ca_system_score_codex":0.0046779267,"about_ca_system_score_gemma":0.0030754106,"threshold_uncertainty_score":0.07071984},"labels":[],"label_agreement":null},{"id":"W2797647106","doi":"10.1145/3190577","title":"InfoClean","year":2017,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Privacy-Preserving Technologies in Data","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Computer science; Confidentiality; Information sensitivity; Data mining; Process (computing); Data quality; Set (abstract data type); Information privacy; Information loss; Data set; Database; Data science; Computer security; Artificial intelligence","score_opus":0.12478846617792934,"score_gpt":0.3855261588859472,"score_spread":0.2607376927080179,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2797647106","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.007545008,0.004687097,0.5485691,0.0047348947,0.0016849588,0.0010841378,0.07921217,0.25952545,0.092957206],"genre_scores_gemma":[0.07170301,0.004382,0.54811406,0.005576994,0.00067679066,0.0011359211,0.25978297,0.039451815,0.069176525],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9954797,0.0006764446,0.00045861478,0.0010910201,0.0019865949,0.00030763308],"domain_scores_gemma":[0.99089444,0.0020870506,0.0004648444,0.004645258,0.0016611908,0.00024723724],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0035890397,0.0020012665,0.0017583057,0.0054438068,0.002379751,0.008001858,0.0041462793,0.0024004995,0.0660184],"category_scores_gemma":[0.017148292,0.0013163415,0.0032104112,0.005452708,0.0010820203,0.008340333,0.0066781864,0.0030965025,0.050800867],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00063319795,0.00020241842,0.004495177,0.0016811673,0.0003421363,0.00047635296,0.00058893865,0.004188647,0.004322792,0.041889485,0.53739107,0.4037886],"study_design_scores_gemma":[0.000076398435,0.00007455832,0.0013501004,0.00024462448,0.00008516922,0.0005479817,0.0002700013,0.018193709,0.014377058,0.041172147,0.92353046,0.00007787591],"about_ca_topic_score_codex":0.0033550523,"about_ca_topic_score_gemma":0.0045817713,"teacher_disagreement_score":0.0660184,"about_ca_system_score_codex":0.0012266244,"about_ca_system_score_gemma":0.0038614187,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W2883256923","doi":"10.1145/3239570","title":"Evaluation-as-a-Service for the Computational Sciences","year":2018,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Machine Learning and Data Classification","field":"Computer Science","cited_by":44,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Data science; Crowdsourcing; Field (mathematics); Executable; Domain (mathematical analysis); Service (business); Confidentiality; Big data; Work (physics); World Wide Web; Data mining; Computer security","score_opus":0.2061877675601156,"score_gpt":0.4578079204475153,"score_spread":0.2516201528873997,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2883256923","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0019023764,0.004078073,0.84847444,0.019778877,0.0031166065,0.0026463366,0.0028854934,0.05825112,0.05886663],"genre_scores_gemma":[0.18111,0.011233989,0.6511757,0.013942387,0.007840428,0.011340383,0.023109475,0.052457917,0.047789723],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.84014267,0.102014214,0.009822131,0.008732376,0.035721026,0.0035675862],"domain_scores_gemma":[0.59063107,0.18706971,0.012990115,0.12534656,0.06619105,0.017771535],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.11043044,0.003889116,0.0056609414,0.005957027,0.0027068844,0.028336857,0.008920494,0.009367264,0.06937005],"category_scores_gemma":[0.35491225,0.0022318815,0.002885771,0.011814006,0.0065215225,0.03369898,0.020444756,0.013770009,0.069387324],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017131901,0.0004707482,0.00191778,0.0021093509,0.00056350697,0.00045713462,0.0014820105,0.0070579886,0.0027166943,0.16789344,0.41423976,0.39937842],"study_design_scores_gemma":[0.0005427951,0.00028997025,0.0013771917,0.0012045227,0.00008520013,0.00039952403,0.00067365856,0.053549074,0.0025381697,0.2977712,0.6413067,0.00026197854],"about_ca_topic_score_codex":0.0034407142,"about_ca_topic_score_gemma":0.0015911903,"teacher_disagreement_score":0.11043044,"about_ca_system_score_codex":0.009390213,"about_ca_system_score_gemma":0.015268247,"threshold_uncertainty_score":0.58401895},"labels":[],"label_agreement":null},{"id":"W2899154813","doi":"10.1145/3239571","title":"Anserini","year":2018,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Information Retrieval and Search Behavior","field":"Computer Science","cited_by":230,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada; National Science Foundation","keywords":"Computer science; Information retrieval; World Wide Web; Ranking (information retrieval); Context (archaeology); Search engine indexing; Implementation; Data science; Software engineering","score_opus":0.1067568912519719,"score_gpt":0.3914247076637422,"score_spread":0.2846678164117703,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2899154813","genre_codex":"other","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015843838,0.011710183,0.2932384,0.012589938,0.0058408394,0.0009887861,0.012937501,0.060346212,0.5865043],"genre_scores_gemma":[0.10443672,0.0070319236,0.24402975,0.0058721094,0.0021751735,0.0010323889,0.030541101,0.008911609,0.59596926],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99416614,0.0010744849,0.00039052934,0.0014030145,0.0025421767,0.0004236937],"domain_scores_gemma":[0.9922965,0.0020506957,0.00039859593,0.0024528708,0.002163561,0.0006376668],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004391655,0.0013823385,0.0013202677,0.0046657557,0.0025451074,0.0068677054,0.002537536,0.0019889628,0.13918728],"category_scores_gemma":[0.016596057,0.00077442697,0.001161966,0.003775898,0.001315966,0.0075195935,0.005211914,0.0024315557,0.15288942],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003865675,0.00018243674,0.0025915382,0.0006043327,0.000058154503,0.00025207884,0.00045233968,0.0020132016,0.0047419444,0.05996548,0.3109477,0.6178042],"study_design_scores_gemma":[0.000034094017,0.00010943838,0.0012571767,0.00015315987,0.00002788227,0.0005490099,0.00009432207,0.008790037,0.005517837,0.018588275,0.96480364,0.00007508496],"about_ca_topic_score_codex":0.004579382,"about_ca_topic_score_gemma":0.0052258563,"teacher_disagreement_score":0.13918728,"about_ca_system_score_codex":0.0022958587,"about_ca_system_score_gemma":0.003203284,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W2972308422","doi":"10.1145/3309682","title":"Improving Adaptive Video Streaming through Session Classification","year":2019,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Image and Video Quality Assessment","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"","keywords":"Computer science; Session (web analytics); Popularity; Quality of experience; Throughput; Computer network; The Internet; Multimedia; Quality of service; Real-time computing; World Wide Web; Telecommunications; Wireless","score_opus":0.09982095728446964,"score_gpt":0.37484484686256236,"score_spread":0.2750238895780927,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2972308422","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.34781417,0.00053115725,0.6462323,0.00019771027,0.00011338094,0.00022858061,0.00031437151,0.003164307,0.0014039364],"genre_scores_gemma":[0.8812921,0.0001759142,0.11603604,0.00009509356,0.0000932454,0.00009858543,0.0007730281,0.00011066746,0.001325302],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99923956,0.00017947037,0.000057709334,0.00015012595,0.00024246586,0.000130816],"domain_scores_gemma":[0.9981493,0.0005718762,0.00016926657,0.00017728345,0.0007795059,0.0001527227],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012341389,0.0006391147,0.00096573983,0.0010873626,0.0004115863,0.0005663785,0.0008915616,0.00050592894,0.00047508764],"category_scores_gemma":[0.0028421069,0.00016642967,0.0005505723,0.0006952878,0.00017673368,0.0010115168,0.0005457636,0.0008219543,0.0002496692],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008190287,0.00094794674,0.027540835,0.00014359884,0.00011587121,0.000152104,0.00038597774,0.082924485,0.06840292,0.0013705976,0.003357745,0.813839],"study_design_scores_gemma":[0.000015082875,0.00023473156,0.0091190245,0.000009490395,0.00005028541,0.00012677039,0.00008806128,0.97536904,0.012278873,0.0015630224,0.0011171302,0.000028390588],"about_ca_topic_score_codex":0.0041076876,"about_ca_topic_score_gemma":0.0037877006,"teacher_disagreement_score":0.0041076876,"about_ca_system_score_codex":0.00040706873,"about_ca_system_score_gemma":0.0006735952,"threshold_uncertainty_score":0.008167565},"labels":[],"label_agreement":null},{"id":"W3042293458","doi":"10.1145/3328747","title":"Characterizing Disinformation Risk to Open Data in the Post-Truth Era","year":2020,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":34,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Dalhousie University","funders":"","keywords":"Disinformation; Open data; Computer science; Data science; Data quality; Big data; Analytics; Harm; Transparency (behavior); Quality (philosophy); Business intelligence; Social media; Internet privacy; Computer security; Risk analysis (engineering); Business; Data mining; World Wide Web; Political science; Marketing","score_opus":0.4065919786832916,"score_gpt":0.48860726632065876,"score_spread":0.08201528763736715,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3042293458","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.75900084,0.001642472,0.08908599,0.054072674,0.00014312493,0.00059214653,0.0008559813,0.00016788497,0.0944389],"genre_scores_gemma":[0.9897592,0.00037318896,0.007515496,0.00091894215,0.00004354352,0.00007322928,0.00013199497,0.000034959918,0.0011494196],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9558169,0.023988439,0.0017526266,0.0021398235,0.012818224,0.0034838358],"domain_scores_gemma":[0.60500497,0.3065259,0.044601902,0.016419522,0.02409555,0.003352159],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.041423514,0.000470222,0.00048192294,0.0058464287,0.0068922588,0.0121227335,0.0016104386,0.0047402005,0.003026488],"category_scores_gemma":[0.20968719,0.0005157298,0.00075986347,0.0052108583,0.013521962,0.014981033,0.0068663433,0.0071728397,0.00026905735],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00048293386,0.00023591261,0.15659629,0.0006524089,0.00013438358,0.003994393,0.17824255,0.013168518,0.0025085108,0.58481145,0.0077867955,0.051385842],"study_design_scores_gemma":[0.00005641285,0.00027098032,0.08168539,0.0023060823,0.00019746152,0.0033526977,0.30198038,0.05805468,0.0072291237,0.44284326,0.10161298,0.00041059408],"about_ca_topic_score_codex":0.0576504,"about_ca_topic_score_gemma":0.057378598,"teacher_disagreement_score":0.99838954,"about_ca_system_score_codex":0.014189031,"about_ca_system_score_gemma":0.009671052,"threshold_uncertainty_score":0.21907109},"labels":[],"label_agreement":null},{"id":"W3195742729","doi":"10.1145/3468063","title":"Benchmark of Bitrate Adaptation in Video Streaming","year":2021,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Image and Video Quality Assessment","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"","keywords":"Computer science; Benchmark (surveying); Upload; Task (project management); Heuristic; Benchmarking; Throughput; Upper and lower bounds; Streaming algorithm; Session (web analytics); Time complexity; Algorithm; Artificial intelligence; Wireless; Mathematics","score_opus":0.08316224013716889,"score_gpt":0.36594613887834093,"score_spread":0.28278389874117205,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3195742729","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8275874,0.005862884,0.12049141,0.0014838014,0.0005651699,0.0004712072,0.00215468,0.0029454003,0.03843804],"genre_scores_gemma":[0.9508204,0.0006335589,0.045028787,0.00010846546,0.000053782293,0.000106216816,0.0011939933,0.0001353955,0.0019195102],"study_design_codex":"simulation_or_modeling","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99859077,0.0004378063,0.000069487774,0.00021505287,0.00037666273,0.00031015137],"domain_scores_gemma":[0.99541867,0.0030581746,0.00020299622,0.000358922,0.00072135316,0.00023985295],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0017663495,0.0013714914,0.0010049954,0.00091126654,0.0005561673,0.00083442935,0.0013500622,0.0010362852,0.0024413283],"category_scores_gemma":[0.007026459,0.00020091276,0.0004780026,0.001242082,0.0005477998,0.000926432,0.0008097262,0.0012272508,0.00029731402],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00097643666,0.0006418032,0.0014500216,0.00083386304,0.00007916732,0.00020788111,0.00007927076,0.9076961,0.008801808,0.0059886263,0.0060896543,0.06715542],"study_design_scores_gemma":[0.000075295124,0.00032602355,0.0011079626,0.000017513092,0.000013580726,0.000041674695,0.000055423177,0.98998135,0.0047288337,0.0026481107,0.0009945318,0.000009790741],"about_ca_topic_score_codex":0.0073048417,"about_ca_topic_score_gemma":0.004282838,"teacher_disagreement_score":0.0073048417,"about_ca_system_score_codex":0.0013765366,"about_ca_system_score_gemma":0.0009922046,"threshold_uncertainty_score":0.014524639},"labels":[],"label_agreement":null},{"id":"W4220991771","doi":"10.1145/3506712","title":"Machine Learning and Data Cleaning: Which Serves the Other?","year":2022,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":51,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Data quality; Software deployment; Data science; Data integration; Quality (philosophy); Data mining; Software engineering; Engineering","score_opus":0.32207436291019614,"score_gpt":0.472009332225758,"score_spread":0.14993496931556188,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4220991771","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0016906194,0.20460662,0.067612715,0.71138215,0.0072690314,0.00008128655,0.0001302913,0.00032950187,0.0068977694],"genre_scores_gemma":[0.13988686,0.42845014,0.15017976,0.2071728,0.0614489,0.00052203616,0.00048012834,0.0009140194,0.010945456],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9439567,0.035698295,0.002692401,0.0053432463,0.010265056,0.0020443248],"domain_scores_gemma":[0.8591707,0.08854808,0.007952981,0.012922091,0.025582254,0.005823916],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.071521364,0.0017425218,0.005239761,0.006614832,0.005035177,0.017177643,0.005089624,0.012666713,0.007506047],"category_scores_gemma":[0.11200414,0.001193143,0.002486946,0.010439336,0.02308006,0.043616142,0.011897907,0.017412795,0.0050022583],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00029335718,0.00028506896,0.008499325,0.005815925,0.0006314433,0.0003063944,0.0038384392,0.0012312061,0.00065438147,0.23136419,0.15169899,0.59538126],"study_design_scores_gemma":[0.000102992766,0.0002075165,0.0040557766,0.008103324,0.0002461692,0.0010649174,0.00860488,0.0052751033,0.0010739992,0.59804726,0.37294182,0.00027619104],"about_ca_topic_score_codex":0.0076921415,"about_ca_topic_score_gemma":0.0051811086,"teacher_disagreement_score":0.071521364,"about_ca_system_score_codex":0.005777326,"about_ca_system_score_gemma":0.010805831,"threshold_uncertainty_score":0.37824565},"labels":[],"label_agreement":null},{"id":"W4224288101","doi":"10.1145/3524303","title":"Contextual Data Cleaning with Ontology Functional Dependencies","year":2022,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ontario Tech University; University of Waterloo; McMaster University","funders":"","keywords":"Ontology; Axiom; Computer science; Functional dependency; Inference; Dependency (UML); Set (abstract data type); Dependency theory (database theory); Relation (database); Data mining; Artificial intelligence; Relational database; Mathematics","score_opus":0.4677702605003999,"score_gpt":0.452390842963974,"score_spread":0.015379417536425855,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4224288101","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011894644,0.00024547975,0.9846015,0.00053851644,0.000038078542,0.00017200827,0.0005525779,0.001190898,0.00076630857],"genre_scores_gemma":[0.1265616,0.0002376093,0.87025815,0.00036035257,0.000051068866,0.00019640577,0.0014619327,0.00026121674,0.0006116922],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.97946143,0.0068277395,0.0019628187,0.004136915,0.0067373356,0.0008737772],"domain_scores_gemma":[0.9316756,0.036375906,0.005555235,0.018683234,0.0072117033,0.0004982552],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.012802386,0.0012437678,0.0013045153,0.0050878995,0.0026566212,0.0032634095,0.0034421827,0.0018360348,0.0015862626],"category_scores_gemma":[0.0736202,0.0011822922,0.0037400988,0.0054945354,0.0031349221,0.006782784,0.0076899366,0.0037395302,0.00048648415],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00046814868,0.00042899145,0.04186444,0.0020142382,0.00069587777,0.0016407233,0.0033851957,0.15200084,0.022772208,0.17074394,0.01503735,0.588948],"study_design_scores_gemma":[0.00007202521,0.00020598693,0.0075264047,0.00048245763,0.0004333254,0.0016478932,0.0014163143,0.5662795,0.05752672,0.3157865,0.048425913,0.00019699887],"about_ca_topic_score_codex":0.011212665,"about_ca_topic_score_gemma":0.016026959,"teacher_disagreement_score":0.012802386,"about_ca_system_score_codex":0.0021232814,"about_ca_system_score_gemma":0.006386623,"threshold_uncertainty_score":0.06770635},"labels":[],"label_agreement":null},{"id":"W4366683629","doi":"10.1145/3592534","title":"A Method to Classify Data Quality for Decision Making Under Uncertainty","year":2023,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval","funders":"Fonds de recherche du Québec – Nature et technologies; Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Data quality; Quality (philosophy); Context (archaeology); Process (computing); Data mining; Decision support system; Risk analysis (engineering); Data science","score_opus":0.6503576233917492,"score_gpt":0.6216140905973337,"score_spread":0.02874353279441544,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4366683629","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0033353672,0.00019916597,0.99320614,0.0004902125,0.00007266102,0.00033528375,0.0001735676,0.00039255054,0.0017950641],"genre_scores_gemma":[0.063798465,0.00014098501,0.9344884,0.00011728667,0.00006812442,0.0005521444,0.00022077364,0.000054009703,0.000559727],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9731752,0.010102546,0.0035936828,0.0031786463,0.009102407,0.0008475213],"domain_scores_gemma":[0.92610276,0.04548399,0.00754509,0.005876682,0.014014659,0.0009768547],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.023677204,0.0017291509,0.00196136,0.011814406,0.0023620091,0.007844283,0.0028095492,0.0026900647,0.0029185116],"category_scores_gemma":[0.07481039,0.0007125044,0.002684148,0.007943411,0.003243072,0.0068492605,0.0033002682,0.004078655,0.0007741687],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00040439027,0.00037104197,0.01369917,0.0011500852,0.0004142151,0.00030114967,0.0025693006,0.059808187,0.0065120915,0.1879009,0.0071943454,0.7196752],"study_design_scores_gemma":[0.00014527499,0.00038967986,0.0053758873,0.00091433886,0.00028963038,0.0006131352,0.0013689237,0.7195312,0.010372562,0.22873354,0.031952642,0.0003131651],"about_ca_topic_score_codex":0.004378161,"about_ca_topic_score_gemma":0.003098162,"teacher_disagreement_score":0.023677204,"about_ca_system_score_codex":0.0038981652,"about_ca_system_score_gemma":0.0044295914,"threshold_uncertainty_score":0.12521851},"labels":[],"label_agreement":null},{"id":"W4402806881","doi":"10.1145/3696110","title":"Automated anomaly detection for categorical data by repurposing a form filling recommender system","year":2024,"lang":"en","type":"article","venue":"Journal of Data and Information Quality","topic":"Anomaly Detection Techniques and Applications","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"Fonds National de la Recherche Luxembourg; Natural Sciences and Engineering Research Council of Canada; BNP Paribas Cardif; Canada Research Chairs; Science Foundation Ireland","keywords":"Repurposing; Computer science; Categorical variable; Recommender system; Anomaly detection; Data mining; Anomaly (physics); Artificial intelligence; Information retrieval; Machine learning","score_opus":0.08194400033841359,"score_gpt":0.3697688114118219,"score_spread":0.2878248110734083,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402806881","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1264278,0.0007294449,0.83601665,0.0006553657,0.00011824988,0.000277827,0.0016430394,0.032748915,0.0013827286],"genre_scores_gemma":[0.45561782,0.00020212613,0.5400087,0.00019162941,0.000048648748,0.00014075679,0.002145278,0.00018935479,0.0014556565],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99732924,0.00047962365,0.0002757277,0.0007873395,0.0009555171,0.00017258467],"domain_scores_gemma":[0.99217415,0.0028350565,0.0008200105,0.0016799244,0.00221385,0.00027701416],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0024239097,0.0010206855,0.0015389388,0.003489438,0.00064711913,0.0013045401,0.0023951922,0.0013453357,0.0012766661],"category_scores_gemma":[0.0138131585,0.00042800765,0.0012325734,0.0024306676,0.0004614303,0.0020772377,0.0013269186,0.0015160418,0.0015403801],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000335739,0.0003959139,0.07709959,0.00023857121,0.00016998514,0.00039827198,0.00041413223,0.028564453,0.018422393,0.002329936,0.009806726,0.8618242],"study_design_scores_gemma":[0.000024698767,0.000116149,0.0088713225,0.000023523044,0.00004232174,0.00039000457,0.00011008182,0.97367823,0.009672527,0.0027779771,0.004245755,0.00004738571],"about_ca_topic_score_codex":0.011570724,"about_ca_topic_score_gemma":0.015578052,"teacher_disagreement_score":0.011570724,"about_ca_system_score_codex":0.00077788025,"about_ca_system_score_gemma":0.001373397,"threshold_uncertainty_score":0.023006737},"labels":[],"label_agreement":null},{"id":"W4405575840","doi":"10.1145/3708503","title":"Editorial: Special Issue on Software Engineering and AI for Data Quality","year":2024,"lang":"en","type":"editorial","venue":"Journal of Data and Information Quality","topic":"Big Data and Business Intelligence","field":"Business, Management and Accounting","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Polytechnique Montréal","funders":"","keywords":"Computer science; Quality (philosophy); Data quality; Data science; Software; Software engineering; Software quality; Software development; Engineering; Programming language","score_opus":0.089642029191433,"score_gpt":0.38005659620128956,"score_spread":0.2904145670098566,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4405575840","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000029261566,0.001992176,0.00014608043,0.025203492,0.9695366,0.00001921773,0.00006802246,0.00006141872,0.002943768],"genre_scores_gemma":[0.0003038847,0.0019533772,0.00014421182,0.013083937,0.96973765,0.000022100292,0.000053077463,0.00006303598,0.014638676],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99411124,0.00071743294,0.0005603745,0.00056265737,0.0037053262,0.00034286786],"domain_scores_gemma":[0.9723466,0.008683115,0.0013928359,0.0006045358,0.013283469,0.0036894425],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005946701,0.0029999958,0.0029293352,0.0040286686,0.0030741857,0.0082312105,0.0023501406,0.009316119,0.032363128],"category_scores_gemma":[0.025495961,0.0009658474,0.00204024,0.0015646697,0.0019421543,0.0040557804,0.0012885021,0.013602807,0.025344618],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000017467613,0.000007131076,0.000017801958,0.000070260554,0.000005805779,0.00004596879,0.0000049249843,0.000013934806,0.00003225431,0.00019034646,0.9963229,0.0032712915],"study_design_scores_gemma":[0.000055455817,0.000024854342,0.00022786875,0.0003008783,0.000025851354,0.00019792559,0.00003294198,0.00017447908,0.00010908059,0.0014286947,0.99740654,0.000015561982],"about_ca_topic_score_codex":0.0015476908,"about_ca_topic_score_gemma":0.005583355,"teacher_disagreement_score":0.032363128,"about_ca_system_score_codex":0.002301152,"about_ca_system_score_gemma":0.004010036,"threshold_uncertainty_score":0.1082654},"labels":[],"label_agreement":null}]}