{"id":"W2021343534","doi":"10.1109/slt.2014.7078547","title":"Document-based Dirichlet class language model for speech recognition using document-based n-gram events","year":2014,"lang":"en","type":"article","venue":"","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Institut National de la Recherche Scientifique","funders":"","keywords":"Perplexity; n-gram; Language model; Computer science; Artificial intelligence; Natural language processing; Context (archaeology); Class (philosophy); Part of speech; Word error rate; Latent Dirichlet allocation; Speech recognition; Word (group theory); Gram; Dirichlet distribution; Topic model; Linguistics; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002526724,0.001092542,0.002000943,0.001646864,0.0008949382,0.001704372,0.003478513,0.001772381,0.002473496],"category_scores_gemma":[0.005253276,0.000709967,0.002151023,0.001860387,0.001292479,0.003135839,0.001193773,0.002989216,0.001745704],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002080835,"about_ca_system_score_gemma":0.001635179,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01320077,"about_ca_topic_score_gemma":0.01318358,"domain_scores_codex":[0.9976833,0.0009259036,0.0001654277,0.0006319988,0.0003733803,0.0002200832],"domain_scores_gemma":[0.9974152,0.001706181,0.0001668668,0.0002632903,0.0003576731,0.00009080683],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001623882,0.0004722868,0.005004117,0.0004793881,0.0003905449,0.0003718908,0.001284297,0.5617589,0.01298976,0.08409448,0.009663212,0.3218671],"study_design_scores_gemma":[0.00002489244,0.00003571514,0.0003459279,0.00001205923,0.00002437845,0.00004254155,0.00002337568,0.9848571,0.001153026,0.01227443,0.001173749,0.00003282883],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02916158,0.0009155003,0.9656172,0.00071563,0.0002306418,0.0001360617,0.0006859737,0.001022961,0.001514456],"genre_scores_gemma":[0.7127275,0.001762362,0.2643135,0.000836943,0.0006816921,0.001083347,0.003503338,0.0004760512,0.0146153],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01320077,"threshold_uncertainty_score":0.02624786,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02450039446759717,"score_gpt":0.307604008500186,"score_spread":0.2831036140325889,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}