{"id":"W3161168558","doi":"10.1145/3447541","title":"TabReformer: Unsupervised Representation Learning for Erroneous Data Detection","year":2021,"lang":"en","type":"article","venue":"ACM/IMS Transactions on Data Science","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"IBM (Canada); University of Alberta","funders":"","keywords":"Computer science; Pipeline (software); Range (aeronautics); Representation (politics); Encoder; Probabilistic logic; Artificial intelligence; Tuple; Machine learning; External Data Representation; Mixture model; Task (project management); Data mining; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00269111,0.001338262,0.001084381,0.001651764,0.0004410109,0.0014699,0.003412914,0.001390923,0.00364527],"category_scores_gemma":[0.01049024,0.0004717833,0.001041168,0.001660149,0.0006963309,0.003231169,0.002346288,0.002102145,0.002520682],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008966124,"about_ca_system_score_gemma":0.00153505,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003736615,"about_ca_topic_score_gemma":0.005197323,"domain_scores_codex":[0.9986287,0.0003145168,0.00009495452,0.0004146288,0.0004180984,0.000129053],"domain_scores_gemma":[0.9965827,0.001189805,0.0003077326,0.001176867,0.0006621355,0.00008089797],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003664786,0.0002451871,0.004091773,0.0002588769,0.0001069777,0.0001593887,0.0002345342,0.06896214,0.008176684,0.005796449,0.0292989,0.8823026],"study_design_scores_gemma":[0.00002379862,0.00009487145,0.0005705663,0.00004297548,0.00002684246,0.0001111984,0.00005546673,0.9718132,0.01283342,0.009405375,0.004997239,0.00002497158],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02080682,0.0006514707,0.9493197,0.0003738153,0.0001516006,0.000173427,0.001584687,0.02579315,0.001145361],"genre_scores_gemma":[0.3250497,0.0005654745,0.656737,0.000762548,0.0001255237,0.000555262,0.008846264,0.001477664,0.005880588],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.003736615,"threshold_uncertainty_score":0.0142321,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1334307593239981,"score_gpt":0.3654867943384096,"score_spread":0.2320560350144115,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}