{"id":"W2033681837","doi":"10.1007/s10791-011-9163-y","title":"Improving document clustering using Okapi BM25 feature weighting","year":2011,"lang":"en","type":"article","venue":"Information Retrieval","topic":"Image Retrieval and Classification Techniques","field":"Computer Science","cited_by":77,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Weighting; Cluster analysis; Computer science; Artificial intelligence; Data mining; Feature (linguistics); Document clustering; Pattern recognition (psychology); Term (time)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001286215,0.001523025,0.002147975,0.003822709,0.001504776,0.001497301,0.001797576,0.001301136,0.003830502],"category_scores_gemma":[0.003912301,0.0003931382,0.001579602,0.0052016,0.0003445635,0.00181931,0.001047734,0.001271639,0.004966393],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009573669,"about_ca_system_score_gemma":0.001502157,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01665235,"about_ca_topic_score_gemma":0.0221511,"domain_scores_codex":[0.9980074,0.0003271185,0.0001747653,0.0004182296,0.0008859279,0.0001865955],"domain_scores_gemma":[0.9984641,0.0002158647,0.0000707106,0.000296273,0.0008949515,0.00005813068],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003351036,0.0003208881,0.0009958755,0.0001676287,0.0001665119,0.0000499503,0.00005875853,0.01102796,0.03079706,0.001411118,0.02052903,0.9341402],"study_design_scores_gemma":[0.0001069064,0.0003264932,0.006820633,0.00005601645,0.0005100734,0.0004436292,0.0001924954,0.8821591,0.08027036,0.007953618,0.02102135,0.0001392535],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04692125,0.004228389,0.9325089,0.0002710973,0.0007061816,0.000263758,0.0009773949,0.01039429,0.003728774],"genre_scores_gemma":[0.2293731,0.001367304,0.7497625,0.0003207954,0.0003474439,0.0002854152,0.005917789,0.0009853313,0.01164025],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01665235,"threshold_uncertainty_score":0.03311086,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02482047029488173,"score_gpt":0.2420373186875677,"score_spread":0.2172168483926859,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}