{"id":"W2994813639","doi":"10.5539/cis.v13n3p57","title":"Topic Subject Creation Using Unsupervised Learning for Topic Modeling","year":2020,"lang":"en","type":"preprint","venue":"Computer and Information Science","topic":"Advanced Text Analysis Techniques","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Latent Dirichlet allocation; Topic model; Non-negative matrix factorization; Subject (documents); Computer science; Artificial intelligence; Machine learning; Matrix decomposition; Data science; World Wide Web","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.0005482225,0.0001962996,0.0002644607,0.0004552188,0.0004451838,0.001205131,0.001072449,0.00009598619,0.000001178859],"category_scores_gemma":[0.0001026727,0.0001930766,0.00008648008,0.0006203147,0.00008987335,0.006714234,0.001544164,0.0002778723,0.000002725363],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001205825,"about_ca_system_score_gemma":0.0002436892,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002134703,"about_ca_topic_score_gemma":5.640748e-7,"domain_scores_codex":[0.9984401,0.00002895441,0.0004735877,0.0004483692,0.0003538764,0.0002550415],"domain_scores_gemma":[0.9987275,0.00004959255,0.0002401421,0.000405693,0.0004665232,0.0001105436],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00000546997,0.00001021721,0.0002932052,0.0002696922,0.00001651438,5.51436e-7,0.005369042,0.6078609,0.0005998111,0.04587111,0.00002839394,0.3396751],"study_design_scores_gemma":[0.0001317337,0.00004338445,0.0001722854,0.00005909386,0.000009217393,0.000003198094,0.000021322,0.9887592,0.0006486769,0.009253691,0.0006817328,0.0002164502],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02264576,0.00004798578,0.9757001,0.0003121439,0.0002864515,0.0003756815,0.00000110526,0.0003190279,0.0003117211],"genre_scores_gemma":[0.5272017,0.00004949375,0.4721773,0.000440264,0.0000896715,0.00001898371,0.00001471578,0.000003665973,0.000004242698],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.5045559,"threshold_uncertainty_score":0.9998317,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.050476913095002,"score_gpt":0.3225352121898026,"score_spread":0.2720582990948006,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}