{"id":"W2106388373","doi":"10.1016/j.ipm.2006.07.006","title":"Contextual feature selection for text classification","year":2006,"lang":"en","type":"article","venue":"Information Processing & Management","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":10,"is_retracted":false,"has_abstract":false,"ca_institutions":"Université de Montréal","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Bigram; Computer science; Feature selection; Selection (genetic algorithm); Set (abstract data type); Filter (signal processing); Feature (linguistics); Information retrieval; Artificial intelligence; Data set; Simple (philosophy); Data mining","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008478424,0.0007032077,0.001365546,0.002415389,0.0007541231,0.0009540697,0.0007813594,0.0006689111,0.00395913],"category_scores_gemma":[0.002732613,0.0001963679,0.0008535962,0.00263523,0.0002724701,0.001153246,0.0007002558,0.0006428215,0.001536383],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003058565,"about_ca_system_score_gemma":0.0008871077,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002351315,"about_ca_topic_score_gemma":0.004303399,"domain_scores_codex":[0.9991977,0.0001862699,0.00008601011,0.0002155529,0.0002068287,0.0001077858],"domain_scores_gemma":[0.9988298,0.000501485,0.00008632385,0.0001884117,0.0003223969,0.00007157345],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.001041791,0.000356784,0.004841818,0.0003454584,0.0001328106,0.0002217279,0.000103292,0.008087556,0.04286039,0.00255571,0.01835809,0.9210947],"study_design_scores_gemma":[0.0002324321,0.0007368704,0.02182954,0.0001357582,0.0005516116,0.0007594835,0.0003610538,0.8686979,0.05754805,0.01631942,0.03271049,0.0001173333],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1589049,0.005720418,0.8163757,0.0004884315,0.0005392036,0.0003377647,0.004424477,0.008764171,0.004444972],"genre_scores_gemma":[0.6941668,0.001110767,0.2893232,0.0001912434,0.0005769409,0.0005321308,0.009777974,0.0003398751,0.003980978],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00395913,"threshold_uncertainty_score":0.01324457,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01355166644046986,"score_gpt":0.2484269728550914,"score_spread":0.2348753064146216,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}