{"id":"W4380366610","doi":"10.48550/arxiv.2306.05991","title":"Approximate information state based convergence analysis of recurrent Q-learning","year":2023,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Advanced Memory and Neural Computing","field":"Engineering","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Alliance de recherche numérique du Canada","keywords":"Convergence (economics); Reinforcement learning; Computer science; Markov decision process; Representation (politics); Observable; Partially observable Markov decision process; Recurrent neural network; Markov chain; Markov process; Artificial intelligence; Machine learning; Mathematical optimization; Algorithm; Markov model; Artificial neural network; Mathematics; Statistics","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006823622,0.001000419,0.001721026,0.001043284,0.0005653729,0.001464203,0.001980431,0.001436233,0.002690905],"category_scores_gemma":[0.03438437,0.0005817705,0.0007654538,0.0006222682,0.002185475,0.00229217,0.002432369,0.002340915,0.0003970418],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001924623,"about_ca_system_score_gemma":0.002057031,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005077274,"about_ca_topic_score_gemma":0.002718291,"domain_scores_codex":[0.9982806,0.0007268912,0.000085371,0.0002303105,0.0004607496,0.0002160468],"domain_scores_gemma":[0.9812658,0.01431528,0.0009808209,0.0009203481,0.002031676,0.0004861072],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001310883,0.0000647393,0.001247349,0.0001227019,0.00005249042,0.00007115581,0.0001283508,0.9211322,0.000991613,0.05676201,0.0007323716,0.01856399],"study_design_scores_gemma":[0.000003409876,0.00001634811,0.00004567405,0.000006061574,0.000002517707,0.000005335096,0.000003649548,0.9935913,0.0001369316,0.006134124,0.00005225586,0.000002378748],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04544544,0.0005873675,0.9501355,0.0004350159,0.00003487841,0.00006020227,0.00006132516,0.0003455011,0.002894826],"genre_scores_gemma":[0.9087558,0.0004289546,0.08677124,0.0002178555,0.00005209048,0.0002007286,0.0002219385,0.0001770222,0.003174188],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006823622,"threshold_uncertainty_score":0.03608721,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06678416009321476,"score_gpt":0.1896028334901685,"score_spread":0.1228186733969537,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}