{"id":"W2029219570","doi":"10.1145/2644866.2644868","title":"An ensemble approach for text document clustering using Wikipedia concepts","year":2014,"lang":"en","type":"article","venue":"","topic":"Web Data Mining and Analysis","field":"Computer Science","cited_by":18,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"Natural Sciences and Engineering Research Council of Canada; Universidade Federal de Minas Gerais","keywords":"Document clustering; Computer science; Cluster analysis; Term (time); Information retrieval; Representation (politics); tf–idf; Text corpus; Artificial intelligence; Feature (linguistics); Natural language processing; Document retrieval","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001366455,0.0009733977,0.001374125,0.004258852,0.001269753,0.001264602,0.001431155,0.0008399116,0.0008342603],"category_scores_gemma":[0.004492652,0.0004181734,0.001265551,0.004411822,0.0003560095,0.002910319,0.001405986,0.001028199,0.0006209695],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006130686,"about_ca_system_score_gemma":0.0008849195,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006483796,"about_ca_topic_score_gemma":0.01006279,"domain_scores_codex":[0.9986362,0.0002637791,0.00009722797,0.0003838671,0.0005369549,0.00008199192],"domain_scores_gemma":[0.9981053,0.0004678192,0.0001071009,0.0002892757,0.0009385781,0.00009201203],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001966027,0.0002416239,0.004459537,0.0002163529,0.0003947328,0.0002355397,0.0007530415,0.09307894,0.01614911,0.009088778,0.008453849,0.8667319],"study_design_scores_gemma":[0.00002215155,0.00008851442,0.00175589,0.00003121719,0.0001454138,0.0002875867,0.0002376691,0.9599478,0.009863091,0.01646239,0.01109447,0.00006382505],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02168012,0.0006260204,0.9746187,0.0001072663,0.00009339827,0.0001257659,0.0002648816,0.00137264,0.00111118],"genre_scores_gemma":[0.1471459,0.0005495882,0.847385,0.00008486611,0.000115818,0.0002987227,0.001753011,0.000226394,0.002440655],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006483796,"threshold_uncertainty_score":0.01289213,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03155555860397413,"score_gpt":0.3061687329010991,"score_spread":0.274613174297125,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}