{"id":"W7123357605","doi":"10.1109/cdc57313.2025.11312431","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","year":2025,"lang":"","type":"article","venue":"","topic":"Adaptive Dynamic Programming Control","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Convergence (economics); Salient; Regularization (linguistics); Reinforcement learning; State (computer science); Fixed point; Stationary point","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005508339,0.000779616,0.001329564,0.0006283317,0.0005048788,0.001101332,0.001464054,0.001347847,0.002725217],"category_scores_gemma":[0.02420778,0.0006139585,0.0006659565,0.0004012997,0.002299585,0.001697389,0.001800449,0.001856894,0.0002605471],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001825992,"about_ca_system_score_gemma":0.002137097,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006648969,"about_ca_topic_score_gemma":0.00273533,"domain_scores_codex":[0.9985648,0.0007752973,0.00006735646,0.0002096626,0.0002261955,0.0001567159],"domain_scores_gemma":[0.9882545,0.009416508,0.0006889616,0.0004371695,0.0008962958,0.0003064833],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00004132995,0.00002751819,0.0005742628,0.00004630664,0.00002544152,0.00004224164,0.00006685335,0.9463878,0.0002713708,0.04733,0.0002747768,0.004912019],"study_design_scores_gemma":[0.000007354297,0.00001259804,0.00003265447,0.000004641394,0.000001739569,0.000003890751,0.000005002059,0.9853615,0.00006575588,0.0144128,0.000089617,0.00000235279],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03701483,0.0002122819,0.9594768,0.000370543,0.00003162317,0.00006572143,0.00004287012,0.0001792995,0.002605914],"genre_scores_gemma":[0.8913866,0.0001974962,0.1058591,0.0001693136,0.00002780009,0.00023629,0.0001002578,0.00009323866,0.001929957],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006648969,"threshold_uncertainty_score":0.02913117,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.007703628012805853,"score_gpt":0.2450067562005608,"score_spread":0.2373031281877549,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}