{"id":"W4399728557","doi":"10.1109/tit.2024.3416063","title":"Reinforcement Learning for Near-Optimal Design of Zero-Delay Codes for Markov Sources","year":2024,"lang":"en","type":"article","venue":"IEEE Transactions on Information Theory","topic":"Modular Robots and Swarm Intelligence","field":"Engineering","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"Queen's University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Reinforcement learning; Markov chain; Zero (linguistics); Computer science; Markov process; Markov decision process; Variable-order Markov model; Mathematical optimization; Algorithm; Markov model; Mathematics; Artificial intelligence; Machine learning; Statistics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001624299,0.0005320789,0.0006869818,0.0003130405,0.0003198082,0.0006864253,0.0007099914,0.0007941543,0.001368069],"category_scores_gemma":[0.006424163,0.0003142318,0.0002818255,0.0002539786,0.001822294,0.0007744145,0.0009801973,0.00114261,0.0001749264],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001339894,"about_ca_system_score_gemma":0.001697546,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003103336,"about_ca_topic_score_gemma":0.002116222,"domain_scores_codex":[0.9994498,0.0002002013,0.00002721431,0.0001076985,0.0001382558,0.00007693846],"domain_scores_gemma":[0.9970894,0.002164002,0.0002629196,0.00008864481,0.0002940953,0.0001009625],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00008343571,0.00003638413,0.0002871326,0.00006547021,0.00001144968,0.0000392123,0.00007906725,0.9399334,0.002287187,0.04132114,0.0002756449,0.01558035],"study_design_scores_gemma":[0.00001115566,0.00002504629,0.00001935756,0.000005660943,0.0000016643,0.000004523364,0.000003457048,0.9924515,0.0003672033,0.007000877,0.000106447,0.000003150639],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01820624,0.000118115,0.9803547,0.0001587556,0.00001782128,0.00003095677,0.00001271692,0.00008836205,0.001012347],"genre_scores_gemma":[0.9295688,0.000150583,0.06865406,0.0001028437,0.00001440551,0.0001053894,0.00002821578,0.00002660499,0.001349158],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003103336,"threshold_uncertainty_score":0.009721696,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0141723234347798,"score_gpt":0.2327273639614343,"score_spread":0.2185550405266545,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}