{"id":"W2906685695","doi":"10.1007/s10115-018-1278-7","title":"Combining semantic and term frequency similarities for text clustering","year":2019,"lang":"en","type":"article","venue":"Knowledge and Information Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":21,"is_retracted":false,"has_abstract":false,"ca_institutions":"Dalhousie University","funders":"Fundação de Amparo à Pesquisa do Estado de Minas Gerais; Conselho Nacional de Desenvolvimento Científico e Tecnológico; Natural Sciences and Engineering Research Council of Canada; Coordenação de Aperfeiçoamento de Pessoal de Nível Superior; Fundação de Amparo à Pesquisa do Estado de São Paulo","keywords":"Cluster analysis; Semantic similarity; Computer science; Document clustering; Similarity (geometry); Measure (data warehouse); Information retrieval; Similarity measure; Natural language processing; Term (time); Artificial intelligence; Word (group theory); Data mining; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00211578,0.0006341282,0.001262585,0.01437788,0.001130186,0.002137496,0.001045712,0.001225269,0.002666824],"category_scores_gemma":[0.009617088,0.0002898363,0.001536634,0.01171675,0.0005454635,0.003095946,0.00118344,0.0006619652,0.00218431],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006573049,"about_ca_system_score_gemma":0.001343273,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003248692,"about_ca_topic_score_gemma":0.005441156,"domain_scores_codex":[0.9970804,0.0005349146,0.0003549845,0.0005263233,0.001317149,0.0001862606],"domain_scores_gemma":[0.9957747,0.001754288,0.0003476068,0.0004820694,0.001505379,0.0001360321],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000933483,0.0004256205,0.01097661,0.000657147,0.0006392734,0.0001525617,0.0003585493,0.01542342,0.03027804,0.007473375,0.006437035,0.9262449],"study_design_scores_gemma":[0.0002191065,0.0006747313,0.03179697,0.0002195308,0.001267676,0.001348452,0.0008799106,0.8438234,0.03290542,0.06828828,0.01831172,0.0002647747],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1238826,0.003607151,0.8606651,0.0003190131,0.0004058735,0.0003209196,0.002177426,0.003327159,0.005294564],"genre_scores_gemma":[0.5690671,0.001371774,0.418795,0.0001126642,0.0006654824,0.0003299161,0.005411552,0.0004216472,0.003824939],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01437788,"threshold_uncertainty_score":0.01118946,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01570786528100131,"score_gpt":0.2428618567949933,"score_spread":0.227153991513992,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}