{"id":"W1595744771","doi":"10.5555/1786374.1786451","title":"Maximum entropy modeling with feature selection for text categorization","year":2008,"lang":"en","type":"article","venue":"Asia Information Retrieval Symposium","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Feature selection; Principle of maximum entropy; Categorization; Computer science; Text categorization; Artificial intelligence; Entropy (arrow of time); Pattern recognition (psychology); Feature (linguistics); Selection (genetic algorithm); Cross entropy; Data mining; Machine learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002062634,0.0006453936,0.001199804,0.0009999593,0.0005199287,0.0009491225,0.0009645127,0.0006937513,0.001478429],"category_scores_gemma":[0.004542315,0.0003769381,0.001269641,0.001156383,0.0003531018,0.001657312,0.0007373084,0.0009964083,0.0006546339],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005362634,"about_ca_system_score_gemma":0.0006097514,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002649957,"about_ca_topic_score_gemma":0.002283553,"domain_scores_codex":[0.9991834,0.0004124834,0.00004862122,0.0001238653,0.0001613008,0.00007037778],"domain_scores_gemma":[0.9979821,0.001600812,0.00008131081,0.0001376347,0.0001669967,0.00003106547],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000578746,0.0003178983,0.002547513,0.0001820253,0.0002848302,0.0002021562,0.0001531853,0.5647709,0.009636167,0.01426358,0.006073452,0.4009895],"study_design_scores_gemma":[0.000004178618,0.00001708213,0.0002873257,0.000002791754,0.00001043483,0.00001160879,0.000003664354,0.9942305,0.0006740615,0.004564621,0.0001886111,0.000005181188],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02063323,0.0003946382,0.9775224,0.0001850096,0.00005344552,0.00004415225,0.0001541241,0.0005100311,0.0005028076],"genre_scores_gemma":[0.7482014,0.0005781764,0.2440822,0.0001531267,0.0002537268,0.0003121453,0.001143803,0.0001932215,0.005082148],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.002649957,"threshold_uncertainty_score":0.01090837,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01148243115622647,"score_gpt":0.2143680934824013,"score_spread":0.2028856623261748,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}