{"id":"W4392425987","doi":"10.48550/arxiv.2403.00143","title":"Tree-Averaging Algorithms for Ensemble-Based Unsupervised Discontinuous Constituency Parsing","year":2024,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Alliance de recherche numérique du Canada; Alberta Innovates; DeepMind; Natural Sciences and Engineering Research Council of Canada; Canadian Institute for Advanced Research","keywords":"Parsing; Tree (set theory); Computer science; Artificial intelligence; Ensemble learning; Natural language processing; Machine learning; Mathematics; Combinatorics","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003213688,0.001657896,0.0020639,0.002553097,0.001348981,0.001637873,0.003093145,0.001681887,0.003447811],"category_scores_gemma":[0.009486797,0.0006827228,0.001607377,0.003525075,0.0007786512,0.003999539,0.001787542,0.003956696,0.002683913],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009631581,"about_ca_system_score_gemma":0.00187545,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00465046,"about_ca_topic_score_gemma":0.01031291,"domain_scores_codex":[0.9979972,0.0006019915,0.000129358,0.0006968558,0.0004082067,0.0001663742],"domain_scores_gemma":[0.9938377,0.003471501,0.0002750707,0.001344427,0.0008885682,0.0001827445],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001689551,0.0001965465,0.002643964,0.0001962927,0.0002913647,0.0001159029,0.000259336,0.1656361,0.007561197,0.01663941,0.01771651,0.7885745],"study_design_scores_gemma":[0.00001161436,0.00003302187,0.0004542102,0.00001477696,0.00003664098,0.00005804325,0.00003458825,0.9672701,0.002780995,0.02672046,0.002567114,0.00001842546],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01013122,0.000620277,0.9819649,0.0001826873,0.00009643779,0.00005838736,0.0003389998,0.005676597,0.0009304745],"genre_scores_gemma":[0.1645935,0.0005092958,0.8261802,0.0002664928,0.0002638972,0.0002991311,0.003987782,0.001377888,0.002521764],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00465046,"threshold_uncertainty_score":0.01699579,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1041477433313896,"score_gpt":0.2212843106027825,"score_spread":0.1171365672713929,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}