{"id":"W4417510432","doi":"10.1109/eecsi67060.2025.11290640","title":"A Novel Approach to Responding to Key Data Anomalies Using Unsupervised Learning: Work In Progress","year":2025,"lang":"","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"","keywords":"Key (lock); Data pre-processing; Preprocessor; Confusion; Data quality; Anomaly detection; Hyperparameter; Data modeling","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004874152,0.001215857,0.001289107,0.001921062,0.0006465717,0.001834703,0.002440849,0.001039295,0.0006172739],"category_scores_gemma":[0.009577683,0.0003835873,0.001332039,0.002137168,0.0007746491,0.002700376,0.001142054,0.001895509,0.0004014994],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006759343,"about_ca_system_score_gemma":0.001948667,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006765312,"about_ca_topic_score_gemma":0.006298047,"domain_scores_codex":[0.9966156,0.001143409,0.0002805869,0.0009425345,0.0008400098,0.0001778576],"domain_scores_gemma":[0.9915391,0.003456172,0.0007343275,0.001479829,0.002547301,0.0002431634],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001276185,0.0006712211,0.0203078,0.0003373144,0.0004498619,0.0001391562,0.0004579303,0.1045342,0.007511462,0.004010939,0.005821812,0.8556308],"study_design_scores_gemma":[0.00001081665,0.0000975761,0.003011901,0.00002917306,0.00003756588,0.00007495374,0.0001627875,0.9853415,0.003432982,0.004883924,0.002884047,0.00003278414],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02840784,0.001032935,0.9665087,0.001068568,0.0001397219,0.0001860164,0.000193978,0.001616899,0.0008452534],"genre_scores_gemma":[0.3603932,0.001021123,0.6347858,0.0004709247,0.0003260924,0.0002685011,0.0009660693,0.0001672873,0.00160105],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006765312,"threshold_uncertainty_score":0.02577728,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3676543107054321,"score_gpt":0.4582932247787897,"score_spread":0.09063891407335756,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}