{"id":"W2039548475","doi":"10.1145/2588555.2610520","title":"Descriptive and prescriptive data cleaning","year":2014,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":53,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Tuple; Scalability; Data mining; Transformation (genetics); Decoupling (probability); Quality (philosophy); Benchmark (surveying); Data quality; Data source; Database; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.02157726,0.001337307,0.001369978,0.004222921,0.001303544,0.004800144,0.004654005,0.001549173,0.003509097],"category_scores_gemma":[0.07067107,0.001392569,0.001682205,0.00499059,0.002709425,0.005055314,0.002901172,0.003111713,0.001927845],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001832544,"about_ca_system_score_gemma":0.005779378,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004683796,"about_ca_topic_score_gemma":0.00606717,"domain_scores_codex":[0.9730216,0.007409014,0.003247532,0.004070922,0.01159189,0.0006590077],"domain_scores_gemma":[0.8672229,0.0493957,0.01061243,0.05689372,0.01500395,0.0008711846],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0006253257,0.0008257437,0.04595576,0.003307317,0.0004295904,0.0009343505,0.002431111,0.08700112,0.01795153,0.1302501,0.03043009,0.679858],"study_design_scores_gemma":[0.0002140413,0.0004873133,0.0166814,0.001381356,0.0003080278,0.003037569,0.001532533,0.5065267,0.09309501,0.1918512,0.1844996,0.000385315],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01173441,0.0006937836,0.9680576,0.0009211331,0.00008979318,0.0006275573,0.002067548,0.009997819,0.005810422],"genre_scores_gemma":[0.210128,0.001167222,0.7754181,0.001083396,0.0001274132,0.0006041274,0.005747418,0.001277354,0.004446927],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.9784228,"threshold_uncertainty_score":0.1141128,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4878263125069607,"score_gpt":0.4445102663131563,"score_spread":0.04331604619380447,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}