{"id":"W3176644733","doi":"10.1016/j.jprocont.2021.06.004","title":"Online reinforcement learning for a continuous space system with experimental validation","year":2021,"lang":"en","type":"article","venue":"Journal of Process Control","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":54,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Reinforcement learning; Computer science; State space; Artificial intelligence; Machine learning; Heuristic; Trajectory; Asynchronous communication; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004842431,0.0008033051,0.0007245813,0.0004558559,0.0005699549,0.0008000032,0.001171312,0.001383636,0.002906624],"category_scores_gemma":[0.013082,0.0003452593,0.0004901171,0.0002175561,0.001552647,0.0008890641,0.001415336,0.001287149,0.0003125661],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00103242,"about_ca_system_score_gemma":0.00142212,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009307378,"about_ca_topic_score_gemma":0.004883247,"domain_scores_codex":[0.9989325,0.0004494615,0.00007254985,0.0001641351,0.0002498964,0.0001313781],"domain_scores_gemma":[0.9877286,0.008287542,0.0008822093,0.0009422926,0.001913948,0.0002454884],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001016194,0.0002956835,0.001537531,0.0002721596,0.00006545417,0.0001262879,0.0001592234,0.9661995,0.009084319,0.003640125,0.0003308924,0.01727266],"study_design_scores_gemma":[0.00006150654,0.0002110865,0.0004555016,0.000009689777,0.000009290536,0.0000138247,0.000009104343,0.9951435,0.003320219,0.0006464375,0.0001084426,0.00001140167],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5252957,0.0002833099,0.4683843,0.0004658852,0.0001228967,0.0003076297,0.0002264127,0.0009724162,0.003941572],"genre_scores_gemma":[0.9886631,0.00001483326,0.01062091,0.00001477606,0.000002767387,0.00007356402,0.00004695264,0.0000128589,0.0005501923],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.009307378,"threshold_uncertainty_score":0.02560955,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0123185152797147,"score_gpt":0.2662024340434771,"score_spread":0.2538839187637624,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}