{"id":"W2949266915","doi":"10.48550/arxiv.1808.03967","title":"Augmenting word2vec with latent Dirichlet allocation within a clinical application","year":2018,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Latent Dirichlet allocation; Word2vec; Dirichlet distribution; Word (group theory); Embedding; Topic model; Computer science; Word embedding; Artificial intelligence; Natural language processing; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002031783,0.001221291,0.0007437621,0.001355645,0.0003959808,0.0008949242,0.0008054383,0.001041585,0.002554164],"category_scores_gemma":[0.006207993,0.0004332256,0.0008203478,0.001214183,0.0005108541,0.001298965,0.001367515,0.001454631,0.002787998],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004734478,"about_ca_system_score_gemma":0.001380903,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004952267,"about_ca_topic_score_gemma":0.009686399,"domain_scores_codex":[0.998005,0.001183237,0.00009298081,0.0004052831,0.0001955011,0.0001180518],"domain_scores_gemma":[0.9975947,0.001648891,0.00008354711,0.0002718761,0.0003030371,0.00009799754],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001082523,0.0006720651,0.01436635,0.0004059036,0.0004347904,0.0004125454,0.0004702418,0.08504161,0.01629277,0.007430492,0.0249988,0.848392],"study_design_scores_gemma":[0.00007836083,0.0002746427,0.003464226,0.00006268155,0.0001393632,0.0005561944,0.0001599854,0.9388571,0.01100315,0.03197183,0.01335626,0.00007625656],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.08065404,0.002455326,0.8997421,0.002297102,0.0005910584,0.0002417115,0.003140185,0.006240377,0.004638171],"genre_scores_gemma":[0.6782271,0.00119767,0.3047124,0.0009605755,0.0005121872,0.0003732835,0.007261476,0.0005369699,0.006218367],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004952267,"threshold_uncertainty_score":0.01074523,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06291036633874258,"score_gpt":0.2380961944838567,"score_spread":0.1751858281451142,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}