{"id":"W2149433841","doi":"10.1109/wi.2003.1241276","title":"Incremental document clustering using cluster similarity histograms","year":2004,"lang":"en","type":"article","venue":"","topic":"Advanced Clustering Algorithms Research","field":"Computer Science","cited_by":48,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Cluster analysis; Computer science; Document clustering; Fuzzy clustering; Data mining; Information retrieval; Brown clustering; Conceptual clustering; Correlation clustering; Histogram; Consensus clustering; Similarity measure; Similarity (geometry); CURE data clustering algorithm; Artificial intelligence; Image (mathematics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009997074,0.0005681967,0.001050531,0.004419129,0.000806321,0.001755879,0.001933564,0.0007316202,0.001603005],"category_scores_gemma":[0.005565453,0.00039813,0.0007442594,0.005132163,0.0004720818,0.00206506,0.001235862,0.0007937801,0.001164786],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001050616,"about_ca_system_score_gemma":0.001313105,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008005599,"about_ca_topic_score_gemma":0.005564764,"domain_scores_codex":[0.9987957,0.0001914463,0.00006439257,0.0002760579,0.0005875005,0.00008480404],"domain_scores_gemma":[0.9974897,0.0009636463,0.000204323,0.0003763822,0.0008726912,0.00009333035],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002423498,0.0001305798,0.002139886,0.0001922073,0.0001482171,0.0001160362,0.0002426502,0.1364649,0.01397836,0.01373152,0.006776891,0.8258365],"study_design_scores_gemma":[0.00004180888,0.00007994023,0.001955879,0.00001536142,0.0000603569,0.0002079829,0.0001018652,0.9615159,0.01178829,0.01843244,0.005727358,0.00007280549],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01348319,0.0002937399,0.9828205,0.00006234764,0.00004202547,0.0001197112,0.000221437,0.002164465,0.0007926213],"genre_scores_gemma":[0.1852658,0.0004395592,0.8103555,0.00005862902,0.00009196094,0.0002368484,0.001579177,0.000282626,0.001689882],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008005599,"threshold_uncertainty_score":0.01591796,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03597026134903813,"score_gpt":0.3216917714434714,"score_spread":0.2857215100944333,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}