{"id":"W1714192071","doi":"","title":"Categorical proportional difference: a feature selection method for text categorization","year":2008,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":47,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Regina","funders":"","keywords":"Artificial intelligence; Computer science; Feature selection; Categorical variable; Word (group theory); Task (project management); Naive Bayes classifier; Mutual information; Natural language processing; Feature (linguistics); Selection (genetic algorithm); Categorization; Measure (data warehouse); Support vector machine; Pattern recognition (psychology); Machine learning; Data mining; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004528372,0.001081919,0.001374531,0.005162566,0.0006889248,0.0009572151,0.001712007,0.0008905767,0.002825053],"category_scores_gemma":[0.009728521,0.0002733685,0.001318201,0.003916801,0.0006571818,0.001412556,0.001131039,0.001136066,0.001186595],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006465095,"about_ca_system_score_gemma":0.0008573253,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001420061,"about_ca_topic_score_gemma":0.001300865,"domain_scores_codex":[0.9960334,0.001160751,0.0003344697,0.0008092428,0.001481434,0.0001806744],"domain_scores_gemma":[0.9956702,0.002294959,0.000312341,0.0004862781,0.001129531,0.0001066317],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007381495,0.0002630784,0.005129711,0.0002919036,0.0002448856,0.0001514952,0.0002043282,0.009801404,0.02092265,0.00302503,0.008724689,0.9505026],"study_design_scores_gemma":[0.0004030557,0.001231861,0.02220967,0.00008361142,0.0002502277,0.001556286,0.0002846791,0.8563497,0.05742226,0.02786576,0.0320473,0.0002954968],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02636944,0.0006221407,0.9667667,0.0001954142,0.0002027513,0.0005156865,0.0008954974,0.003328197,0.001104319],"genre_scores_gemma":[0.2976147,0.0002333767,0.6957486,0.0002840815,0.0002198112,0.001108064,0.002049441,0.0002480662,0.002493838],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.005162566,"threshold_uncertainty_score":0.02394861,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02953612645523518,"score_gpt":0.2917414232733742,"score_spread":0.262205296818139,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}