{"id":"W304693962","doi":"10.1007/978-3-319-13186-3_34","title":"Models for Distributed, Large Scale Data Cleaning","year":2014,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":false,"ca_institutions":"McMaster University","funders":"","keywords":"Computer science; Data quality; Big data; Data mining; Dynamic data; Scale (ratio); Data stream mining; Variety (cybernetics); Distributed computing; Real-time computing; Database; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","scholarly_communication","open_science"],"consensus_categories":[],"category_scores_codex":[0.01123474,0.0003788996,0.0006325504,0.0005654545,0.0004174889,0.001224115,0.009130902,0.0002241517,0.0000734412],"category_scores_gemma":[0.001318907,0.0003009418,0.0001215269,0.0004757155,0.0005373646,0.0009873674,0.00608099,0.0004113847,0.0001214852],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001070317,"about_ca_system_score_gemma":0.0001961712,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001565072,"about_ca_topic_score_gemma":0.0004927431,"domain_scores_codex":[0.9937856,0.00006483463,0.0008874905,0.002370776,0.002196784,0.0006945101],"domain_scores_gemma":[0.9925311,0.002294897,0.0004439236,0.004217358,0.0003420022,0.0001707442],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001831695,0.00002938428,0.00001119032,0.0000341456,0.00001098296,0.000007752034,0.0003429627,0.0637655,0.000002675183,0.09352476,0.007712,0.8345403],"study_design_scores_gemma":[0.0001633615,0.00003660996,0.000005522557,0.00007115337,0.000008033521,0.000002526616,0.000001084362,0.49455,0.000009837675,0.3685251,0.1364039,0.000222908],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.00000689615,0.0001134024,0.9917003,0.001235993,0.001465796,0.0005246184,0.001668859,0.00006185108,0.003222316],"genre_scores_gemma":[0.1154469,0.00007315075,0.8618183,0.01173766,0.002379523,0.00003391053,0.00242035,0.0001142607,0.005975905],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.8343174,"threshold_uncertainty_score":0.9999443,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1703087149308163,"score_gpt":0.3783480416925222,"score_spread":0.2080393267617059,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}