{"id":"W1970187450","doi":"10.1145/2245276.2245457","title":"Enhancing semi-supervised document clustering with feature supervision","year":2012,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":16,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"","keywords":"Cluster analysis; Computer science; Pairwise comparison; Feature (linguistics); Artificial intelligence; Brown clustering; Consensus clustering; Data mining; Correlation clustering; Fuzzy clustering; Pattern recognition (psychology); Conceptual clustering; Machine learning; Canopy clustering algorithm","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003098029,0.001202258,0.001511993,0.001326873,0.0009325498,0.001361923,0.002039611,0.001207578,0.001174233],"category_scores_gemma":[0.01137755,0.0004124235,0.0009775111,0.001499832,0.001022137,0.002550819,0.002026736,0.001550451,0.001471249],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007664899,"about_ca_system_score_gemma":0.001577966,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002774945,"about_ca_topic_score_gemma":0.005404252,"domain_scores_codex":[0.9968702,0.001291166,0.0001779273,0.0006712103,0.0008657125,0.0001237512],"domain_scores_gemma":[0.9901451,0.003858438,0.0007967363,0.00219984,0.002756354,0.0002435873],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006553699,0.0007016925,0.006387237,0.000532029,0.0002579628,0.0002008664,0.0009839947,0.1668173,0.04407053,0.006983385,0.009779951,0.7626297],"study_design_scores_gemma":[0.00003880961,0.0001224465,0.001413722,0.00002248217,0.00004100132,0.0001542397,0.0001323199,0.96741,0.01884001,0.008431478,0.003349572,0.00004411504],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03299342,0.000214846,0.9618576,0.0001355089,0.00003299354,0.000137513,0.0001735547,0.003150451,0.001304045],"genre_scores_gemma":[0.3382365,0.0001720009,0.6573293,0.0001647477,0.00008333481,0.0002313189,0.001574196,0.0003218359,0.001886739],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003098029,"threshold_uncertainty_score":0.01638412,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0141388141283832,"score_gpt":0.2425182503680033,"score_spread":0.2283794362396201,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}