{"id":"W2045517286","doi":"10.1109/icdim.2010.5664669","title":"Latent semantic indexing and large dataset: Study of term-weighting schemes","year":2010,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Northern British Columbia","funders":"","keywords":"Computer science; Weighting; Information retrieval; Term (time); Search engine indexing; Precision and recall; Document retrieval; Latent semantic analysis; Graph; Term Discrimination; Data mining; Search engine; Concept search; Web search query","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03403037,0.001091888,0.001442821,0.006456625,0.001666014,0.003032512,0.002102288,0.002110602,0.0007040037],"category_scores_gemma":[0.1044395,0.0003070626,0.001611663,0.009365052,0.00129056,0.006540039,0.001927322,0.002285837,0.0002819136],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002442159,"about_ca_system_score_gemma":0.001343216,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007918057,"about_ca_topic_score_gemma":0.006042019,"domain_scores_codex":[0.9820219,0.009316021,0.001648404,0.002641844,0.003832556,0.0005392923],"domain_scores_gemma":[0.8768646,0.09906382,0.005433371,0.01225694,0.005474999,0.0009062686],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00292641,0.002825809,0.2110792,0.002307357,0.002872382,0.0005215782,0.001349409,0.201752,0.01410881,0.04188096,0.02538827,0.4929878],"study_design_scores_gemma":[0.0002389463,0.001017748,0.05534191,0.0001785535,0.0004316659,0.0008387151,0.0007287801,0.8968669,0.008258031,0.02712952,0.008768452,0.0002006511],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6344007,0.01013413,0.3320613,0.003176161,0.0004802732,0.001157894,0.01214096,0.002244576,0.004203959],"genre_scores_gemma":[0.8260376,0.001415953,0.1498877,0.0003011807,0.0003349113,0.0006615946,0.02004318,0.0002058144,0.001111907],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03403037,"threshold_uncertainty_score":0.179972,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02180303817818376,"score_gpt":0.2713560739859011,"score_spread":0.2495530358077173,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}