{"id":"W2140609014","doi":"10.1145/1007568.1007650","title":"Information-theoretic tools for mining database structure from large data sets","year":2004,"lang":"en","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":55,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Data mining; Redundancy (engineering); Categorical variable; Ranking (information retrieval); Data redundancy; Data modeling; Set (abstract data type); Information retrieval; Database; Machine learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01826726,0.003181467,0.003625223,0.02026222,0.001690386,0.005681135,0.003928775,0.002204592,0.002465431],"category_scores_gemma":[0.1014811,0.001820314,0.003450163,0.01707983,0.004327216,0.009801391,0.004806526,0.004643534,0.0009446218],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002862595,"about_ca_system_score_gemma":0.003083233,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001663878,"about_ca_topic_score_gemma":0.002446892,"domain_scores_codex":[0.9847734,0.006630018,0.001752948,0.001232065,0.005411,0.000200527],"domain_scores_gemma":[0.9066713,0.07343424,0.005888759,0.01009948,0.00322375,0.0006825775],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002820388,0.0005057774,0.005721909,0.00319467,0.001095178,0.0005584816,0.0008724104,0.2596902,0.002336943,0.2910267,0.0103092,0.4244066],"study_design_scores_gemma":[0.00007920679,0.0001570369,0.0007611005,0.0003402364,0.0001564569,0.0002739725,0.0002172058,0.4490795,0.002020741,0.5394881,0.007352931,0.00007349019],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.001786026,0.001239207,0.9945415,0.0004632261,0.00002394946,0.0002080823,0.0004727785,0.0006398019,0.0006254534],"genre_scores_gemma":[0.04223443,0.001369931,0.9535502,0.0002123232,0.0001456601,0.0007658925,0.001426731,0.0000921354,0.0002026848],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02026222,"threshold_uncertainty_score":0.09660763,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2199736201345843,"score_gpt":0.4288470871589206,"score_spread":0.2088734670243363,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}