{"id":"W2138954094","doi":"10.1145/1097047.1097059","title":"Narrative text classification for automatic key phrase extraction in web document corpora","year":2005,"lang":"en","type":"article","venue":"","topic":"Advanced Text Analysis Techniques","field":"Computer Science","cited_by":64,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"","keywords":"Computer science; Automatic summarization; Information retrieval; Plain text; Key (lock); Natural language processing; Phrase; tf–idf; Artificial intelligence; Ranking (information retrieval); Document clustering; Information extraction; HTML element; Web page; Keyword extraction; Cluster analysis; World Wide Web; Term (time)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004971606,0.001279869,0.001024761,0.007092583,0.001309666,0.001990597,0.001043538,0.0009905315,0.006275678],"category_scores_gemma":[0.02771288,0.0004659655,0.0009978147,0.005589753,0.0005008634,0.004242604,0.0009427947,0.0009187756,0.006822853],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007999136,"about_ca_system_score_gemma":0.001403273,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002603024,"about_ca_topic_score_gemma":0.003520015,"domain_scores_codex":[0.9961916,0.001404987,0.0008353284,0.0005765585,0.0008472668,0.0001441361],"domain_scores_gemma":[0.9856133,0.008096746,0.001078833,0.00126459,0.003703939,0.0002426057],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007460054,0.0002627656,0.005378508,0.002387255,0.0001521974,0.0003569991,0.001078642,0.004414628,0.1200738,0.003729195,0.02358152,0.8378384],"study_design_scores_gemma":[0.0006249656,0.001603589,0.04594003,0.0006633648,0.0005681191,0.002670287,0.002366386,0.5175076,0.2818992,0.01136628,0.1344045,0.0003857906],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1040356,0.002914625,0.8533756,0.0006291355,0.0003279838,0.001950045,0.01033765,0.02095034,0.00547905],"genre_scores_gemma":[0.09328279,0.0006168459,0.8852324,0.00007071499,0.0001240971,0.00138948,0.01720149,0.0005766425,0.001505452],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.007092583,"threshold_uncertainty_score":0.02629268,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02461358341141394,"score_gpt":0.3336148891383208,"score_spread":0.3090013057269069,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}