{"id":"W4312072439","doi":"10.1214/22-aos2229","title":"Likelihood estimation of sparse topic distributions in topic models and its applications to Wasserstein document distance calculations","year":2022,"lang":"en","type":"article","venue":"The Annals of Statistics","topic":"Bayesian Methods and Mixture Models","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Mathematics; Estimator; Minimax; Applied mathematics; Context (archaeology); Matrix (chemical analysis); Combinatorics; Multinomial distribution; Matrix norm; Statistics; Eigenvalues and eigenvectors; Mathematical optimization","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004951772,0.0007927737,0.001416992,0.001689545,0.0005277258,0.00153645,0.001919773,0.00153683,0.001348068],"category_scores_gemma":[0.03678048,0.0008966569,0.0009749454,0.00179225,0.001697427,0.003571607,0.002576228,0.00241729,0.0005932742],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001183495,"about_ca_system_score_gemma":0.001006234,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003680523,"about_ca_topic_score_gemma":0.002623813,"domain_scores_codex":[0.9983498,0.000844922,0.00007482785,0.0002539462,0.0003949005,0.00008156144],"domain_scores_gemma":[0.9889607,0.009277237,0.0005078375,0.0004682502,0.0006197604,0.0001661037],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006031122,0.00004987683,0.001297986,0.0002173637,0.00007870726,0.0001119864,0.0002878576,0.6808286,0.001777532,0.2370292,0.001565336,0.0766952],"study_design_scores_gemma":[0.000004759035,0.000008786048,0.0001187927,0.00001314808,0.00000342183,0.00002207159,0.00001072411,0.9292888,0.0002249407,0.06973648,0.0005579719,0.00001008206],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.003252123,0.0002839365,0.9958618,0.0001859752,0.00001362843,0.00001106427,0.00001736605,0.00006792378,0.0003061391],"genre_scores_gemma":[0.2530446,0.001951852,0.7392629,0.0002332555,0.0002791317,0.0002764876,0.0005050085,0.0002853905,0.004161347],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004951772,"threshold_uncertainty_score":0.02618778,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06472341957351041,"score_gpt":0.3489276257576649,"score_spread":0.2842042061841545,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}