{"id":"W4412661434","doi":"10.1101/2025.07.22.666196","title":"Efficient Grammar Compression via RLZ-based RePair","year":2025,"lang":"en","type":"preprint","venue":"bioRxiv (Cold Spring Harbor Laboratory)","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"Natural Sciences and Engineering Research Council of Canada; National Institutes of Health; National Science Foundation","keywords":"Bigram; Computer science; Parsing; Encoding (memory); Substring; Rule-based machine translation; Grammar; String (physics); Scalability; Artificial intelligence; Natural language processing; Database; Data structure; Programming language; Mathematics; Linguistics; Trigram","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001169954,0.001167878,0.001173863,0.001879553,0.0006839553,0.001363644,0.002015186,0.001284329,0.004113555],"category_scores_gemma":[0.007822033,0.0006538585,0.001222739,0.00236942,0.001344288,0.002451553,0.002649339,0.001840733,0.004016121],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007544042,"about_ca_system_score_gemma":0.001616079,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001666095,"about_ca_topic_score_gemma":0.002686835,"domain_scores_codex":[0.998206,0.0002775437,0.0001771769,0.0005570734,0.000656603,0.0001255228],"domain_scores_gemma":[0.9961376,0.001520804,0.0002488208,0.001538397,0.0004946259,0.0000598241],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004255085,0.0001797475,0.0020688,0.0007031967,0.0001240822,0.0008843697,0.001111013,0.07749937,0.1159023,0.04409828,0.03235137,0.7246519],"study_design_scores_gemma":[0.0001475613,0.0001942879,0.001272976,0.00009333851,0.0000995166,0.0010556,0.0004469102,0.6784729,0.1856609,0.09202866,0.04040113,0.0001262373],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02417491,0.0004677381,0.9475042,0.0003240211,0.0001309591,0.0001523621,0.001508603,0.02346749,0.002269795],"genre_scores_gemma":[0.1542306,0.0004254888,0.8277446,0.0004560595,0.00009888473,0.000379265,0.007019608,0.004024335,0.005621123],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004113555,"threshold_uncertainty_score":0.01376122,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.00963221893959893,"score_gpt":0.2353076449725961,"score_spread":0.2256754260329972,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}