{"id":"W2898962309","doi":"10.5539/cis.v11n4p77","title":"Topic Modelling in Bangla Language: An LDA Approach to Optimize Topics and News Classification","year":2018,"lang":"en","type":"article","venue":"Computer and Information Science","topic":"Computational and Text Analysis Methods","field":"Social Sciences","cited_by":19,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Regina","funders":"","keywords":"Computer science; Latent Dirichlet allocation; Topic model; Bengali; Natural language processing; Bigram; Artificial intelligence; Language model; Similarity (geometry); Information retrieval; Categorization; Popularity; Document clustering; Cluster analysis; Trigram","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002275336,0.0009869834,0.001473591,0.002360454,0.001091465,0.00266283,0.001439146,0.001196343,0.002418353],"category_scores_gemma":[0.004943455,0.0005978181,0.002147873,0.003156906,0.0006177176,0.002183431,0.001226872,0.001550513,0.002133784],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001105393,"about_ca_system_score_gemma":0.001076811,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006585066,"about_ca_topic_score_gemma":0.007829938,"domain_scores_codex":[0.9982071,0.000839455,0.0001318507,0.0004212087,0.0002638604,0.0001365594],"domain_scores_gemma":[0.9983215,0.001076472,0.0001229151,0.0001384906,0.0002801934,0.00006050345],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005341091,0.0003859649,0.007565468,0.000627065,0.0006721275,0.0003597595,0.001658182,0.1864248,0.008929342,0.04742341,0.0222692,0.7231506],"study_design_scores_gemma":[0.00002835884,0.00006189069,0.001897614,0.00004027077,0.00009818343,0.0001675335,0.0002120366,0.9588206,0.001789204,0.02687676,0.009951636,0.00005597536],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01433266,0.001729801,0.9793117,0.0005926212,0.000146004,0.000128785,0.0005686258,0.0007996372,0.00239008],"genre_scores_gemma":[0.3319114,0.003041926,0.6436038,0.0003754573,0.0008128254,0.0008879194,0.003399581,0.0006635891,0.01530357],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006585066,"threshold_uncertainty_score":0.01309347,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06869610714418223,"score_gpt":0.3682764751611717,"score_spread":0.2995803680169895,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}