{"id":"W2070529691","doi":"10.1109/ccece.2006.277770","title":"On Some Feature Selection Strategies for Spam Filter Design","year":2006,"lang":"en","type":"article","venue":"","topic":"Spam and Phishing Detection","field":"Computer Science","cited_by":18,"is_retracted":false,"has_abstract":true,"ca_institutions":"Concordia University","funders":"","keywords":"Feature selection; Computer science; Artificial intelligence; Curse of dimensionality; Feature vector; Simulated annealing; Text categorization; Dimensionality reduction; Classifier (UML); Machine learning; Filter (signal processing); Pattern recognition (psychology); Support vector machine; Data mining; Feature extraction; Categorization","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002179708,0.0008722453,0.0009811551,0.001179563,0.0005798982,0.0007541537,0.0008487611,0.001032469,0.001611419],"category_scores_gemma":[0.00558402,0.0004278626,0.0009007539,0.001038131,0.0005675683,0.0009554233,0.0003758868,0.0005417655,0.000373105],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005888259,"about_ca_system_score_gemma":0.0005919128,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002069836,"about_ca_topic_score_gemma":0.001653783,"domain_scores_codex":[0.9992018,0.0003575079,0.00007217063,0.000120286,0.0001926239,0.00005558998],"domain_scores_gemma":[0.9981749,0.001102542,0.0001222075,0.00010543,0.0004615346,0.00003339661],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000290156,0.0002720084,0.002216886,0.0002153287,0.0001454618,0.0001875291,0.0003124593,0.3578143,0.01526144,0.02585925,0.00339157,0.5940335],"study_design_scores_gemma":[0.00005259469,0.0001719308,0.0007729022,0.00002272247,0.000048154,0.0001031531,0.00003591637,0.9849984,0.004599181,0.007550231,0.001628737,0.00001618612],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01115549,0.0003264671,0.9874993,0.0001542552,0.00001383477,0.00005954731,0.00001584479,0.0001352932,0.0006399141],"genre_scores_gemma":[0.3152753,0.0005490105,0.6810868,0.0002516588,0.00008349544,0.0004199995,0.0001405224,0.00006741527,0.002125752],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.002179708,"threshold_uncertainty_score":0.01152754,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01955711205504025,"score_gpt":0.2310359724797079,"score_spread":0.2114788604246676,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}