{"id":"W2513414733","doi":"10.1109/sai.2016.7556026","title":"A density-based data cleaning approach for deduplication with data consistency and accuracy","year":2016,"lang":"en","type":"article","venue":"2016 SAI Computing Conference (SAI)","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":11,"is_retracted":false,"has_abstract":true,"ca_institutions":"McMaster University","funders":"","keywords":"Data deduplication; Computer science; Data mining; Correctness; Data warehouse; Data quality; Tuple; Data transformation; Consistency (knowledge bases); Scalability; Data consistency; Data modeling; Data set; Database; Data integrity; Set (abstract data type); Algorithm; Artificial intelligence; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006211936,0.001255333,0.001870586,0.003812885,0.001875623,0.002869184,0.004685185,0.001537053,0.001349821],"category_scores_gemma":[0.03130373,0.001044863,0.001768924,0.004669575,0.00138042,0.005635941,0.004658213,0.002236048,0.0005436629],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002032753,"about_ca_system_score_gemma":0.002612976,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004585028,"about_ca_topic_score_gemma":0.00464976,"domain_scores_codex":[0.9928739,0.00142469,0.0006471683,0.001110992,0.0035502,0.0003930402],"domain_scores_gemma":[0.9826925,0.004717656,0.001733619,0.004319694,0.006078258,0.0004582465],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003447802,0.0004910741,0.01077938,0.000443979,0.0002795969,0.000319807,0.001059175,0.2878492,0.01100276,0.05912939,0.006831299,0.6214696],"study_design_scores_gemma":[0.00002359238,0.0001466732,0.001604087,0.00004315934,0.00008229415,0.0003694957,0.0001615081,0.9595872,0.009512382,0.02346365,0.004948393,0.00005748708],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.008858684,0.0002333005,0.9893049,0.000201734,0.00003707494,0.0001624382,0.00006745545,0.0006423616,0.0004920871],"genre_scores_gemma":[0.236706,0.0003677186,0.7599131,0.000194076,0.0001109215,0.0003118486,0.0004014562,0.0002319451,0.001763004],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006211936,"threshold_uncertainty_score":0.03285223,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4115022651312117,"score_gpt":0.4283854050917017,"score_spread":0.01688313996049001,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}