{"id":"W4417510432","doi":"10.1109/eecsi67060.2025.11290640","title":"A Novel Approach to Responding to Key Data Anomalies Using Unsupervised Learning: Work In Progress","year":2025,"lang":"","type":"article","venue":"","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"","keywords":"Key (lock); Data pre-processing; Preprocessor; Confusion; Data quality; Anomaly detection; Hyperparameter; Data modeling","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","bibliometrics","scholarly_communication","open_science"],"consensus_categories":["open_science"],"category_scores_codex":[0.0177815,0.00050933,0.0008866144,0.005367431,0.0006088155,0.003357373,0.007053295,0.0001968503,0.00031958],"category_scores_gemma":[0.007217834,0.0004583402,0.00009995183,0.02336172,0.0002198421,0.001782273,0.01489991,0.0004956319,0.0003277912],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002420101,"about_ca_system_score_gemma":0.0004217292,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004118982,"about_ca_topic_score_gemma":0.0002145825,"domain_scores_codex":[0.9908891,0.001019657,0.001976336,0.002982929,0.001968395,0.001163623],"domain_scores_gemma":[0.9938718,0.001167159,0.0002291445,0.00408143,0.0002368736,0.0004135712],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.005881707,0.005501776,0.05308182,0.000720764,0.0004609534,0.00006677088,0.0391724,0.05366743,0.001251666,0.2607898,0.08637349,0.4930315],"study_design_scores_gemma":[0.001565221,0.0001734481,0.01197244,0.001242055,0.00009414549,0.000002672285,0.05448194,0.08625728,0.0001143583,0.0004368859,0.8426393,0.001020254],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1467195,0.0007746342,0.7684606,0.01425094,0.001371084,0.003835387,0.0002037323,0.0001536881,0.06423048],"genre_scores_gemma":[0.523841,0.00002628293,0.3976501,0.004684257,0.0001140545,0.0001015807,0.0001384776,0.00004205801,0.07340224],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.7562658,"threshold_uncertainty_score":0.9997869,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3676543107054321,"score_gpt":0.4582932247787897,"score_spread":0.09063891407335756,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}