{"id":"W4240203305","doi":"10.22215/etd/2014-10293","title":"Multiple Model Reinforcement Learning for Environments with Poissonian Time Delays","year":2014,"lang":"en","type":"dissertation","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Carleton University","funders":"","keywords":"Reinforcement learning; Computer science; Convergence (economics); Mobile robot; Robot; Reinforcement; Q-learning; Artificial intelligence; Grid; Simulation; Mathematics; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001706491,0.0007917541,0.00133475,0.0003772488,0.0004536248,0.0009390126,0.001673497,0.0009241253,0.001940616],"category_scores_gemma":[0.006065129,0.0005476943,0.0007172983,0.0003851018,0.0009335086,0.001201847,0.00163005,0.001858021,0.0002674734],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001588868,"about_ca_system_score_gemma":0.001432569,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006401143,"about_ca_topic_score_gemma":0.00488275,"domain_scores_codex":[0.9992427,0.0002838404,0.00003148624,0.0001582928,0.0001673911,0.000116395],"domain_scores_gemma":[0.9974309,0.001850841,0.0002400588,0.00009598108,0.0002347111,0.0001475663],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00003733027,0.0000279446,0.0002316925,0.00002880613,0.00001938574,0.00003663171,0.00003341515,0.9725002,0.0002686332,0.0152009,0.000314911,0.01130013],"study_design_scores_gemma":[0.000007905532,0.000008752262,0.00002012018,0.000001660822,0.000001896188,0.000003561753,0.000002329719,0.9940526,0.0000615921,0.005720955,0.0001167449,0.000001910164],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01849528,0.0002270469,0.9792046,0.0002274351,0.00004780633,0.00002986462,0.00001816653,0.0001878143,0.001561931],"genre_scores_gemma":[0.8692905,0.0003420815,0.1229751,0.0001435524,0.00008173082,0.0002059246,0.00008603459,0.00009066091,0.006784486],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006401143,"threshold_uncertainty_score":0.0127278,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01021222507287907,"score_gpt":0.2247518188517965,"score_spread":0.2145395937789175,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}