{"id":"W3025873536","doi":"10.48550/arxiv.2005.05864","title":"Exploiting Syntactic Structure for Better Language Modeling: A Syntactic Distance Approach","year":2020,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Topic Modeling","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Mila - Quebec Artificial Intelligence Institute; McGill University; Canadian Institute for Advanced Research; Université de Montréal","funders":"","keywords":"Treebank; Perplexity; Computer science; Parsing; Natural language processing; Artificial intelligence; Language model; Task (project management); Representation (politics); Syntactic structure; Ground truth; Parse tree; Syntax","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0021846,0.001161799,0.0009799093,0.001966053,0.0007056638,0.001691592,0.001814032,0.001517423,0.001783963],"category_scores_gemma":[0.006557176,0.0006168719,0.001442058,0.001883051,0.0008874138,0.004927264,0.00264229,0.002972089,0.001078777],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009520874,"about_ca_system_score_gemma":0.001254619,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001473436,"about_ca_topic_score_gemma":0.002680819,"domain_scores_codex":[0.998607,0.0006670193,0.00007365638,0.0003690135,0.0002076802,0.00007559981],"domain_scores_gemma":[0.9969216,0.001835159,0.0002392446,0.0005445002,0.0003579631,0.0001015644],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003466326,0.0003586438,0.006822278,0.0003062274,0.0004389991,0.0002602665,0.0008564717,0.4292026,0.02440361,0.1088098,0.006995593,0.4211988],"study_design_scores_gemma":[0.00001034107,0.00003700374,0.0004357796,0.00001162328,0.00003511538,0.0000484025,0.00003109028,0.9361193,0.002374587,0.05973311,0.001144512,0.00001903144],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.04936378,0.0004128163,0.946127,0.0007428547,0.00004606044,0.00004723635,0.0003252121,0.000956528,0.00197854],"genre_scores_gemma":[0.6736137,0.0005303821,0.3201622,0.0003289407,0.0001548144,0.0001711594,0.001753416,0.0005029973,0.002782329],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.0021846,"threshold_uncertainty_score":0.01155341,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09857051092529527,"score_gpt":0.203068910580581,"score_spread":0.1044983996552857,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}