{"id":"W4366850523","doi":"10.1145/3543507.3583457","title":"CEIL: A General Classification-Enhanced Iterative Learning Framework for Text Clustering","year":2023,"lang":"en","type":"article","venue":"","topic":"Domain Adaptation and Few-Shot Learning","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Cluster analysis; Computer science; Artificial intelligence; Conceptual clustering; Document clustering; Correlation clustering; Canopy clustering algorithm; CURE data clustering algorithm; Brown clustering; Representation (politics); Machine learning; Feature learning; Data mining; Pattern recognition (psychology)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0003467275,0.0001300923,0.000136798,0.0001613753,0.0003825478,0.000368778,0.0004108576,0.00007794039,0.00006328485],"category_scores_gemma":[0.0003269903,0.0001240802,0.0000775095,0.0007450302,0.00002548187,0.0004138621,0.0001377395,0.000222958,0.0003830417],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00003729948,"about_ca_system_score_gemma":0.00004391943,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000003599483,"about_ca_topic_score_gemma":0.000004345416,"domain_scores_codex":[0.9987261,0.00007873658,0.0002338659,0.0004182265,0.0002010232,0.0003420545],"domain_scores_gemma":[0.9989706,0.0004574264,0.0001060548,0.0002651382,0.0001108948,0.00008988469],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001889688,0.00002544928,0.0002015607,0.00002649998,0.00003252349,0.000003553823,0.01177699,0.04604376,0.01695873,0.7621865,0.00137186,0.1613536],"study_design_scores_gemma":[0.0002667742,0.00006144795,0.002964573,0.00002445443,0.000002052184,0.000001447389,0.000857588,0.9719354,0.001045019,0.007588475,0.0150608,0.0001919635],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.00538277,0.00001046775,0.9830906,0.001582233,0.00038,0.0002240311,6.30389e-7,0.000871641,0.008457658],"genre_scores_gemma":[0.5960936,0.000009654872,0.3909121,0.0005441693,0.000139365,0.0001092393,0.00001248621,0.00001639007,0.01216306],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9258916,"threshold_uncertainty_score":0.5059845,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05283188345815129,"score_gpt":0.3228554519467172,"score_spread":0.2700235684885659,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}