{"id":"W3185807839","doi":"10.1109/tie.2021.3099234","title":"Reinforcement Learning With Constrained Uncertain Reward Function Through Particle Filtering","year":2021,"lang":"en","type":"article","venue":"IEEE Transactions on Industrial Electronics","topic":"Fault Detection and Control Systems","field":"Engineering","cited_by":13,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Reinforcement learning; Noise (video); Probabilistic logic; Process (computing); Computer science; Filter (signal processing); Particle filter; Artificial intelligence; Function (biology); Reinforcement; Quality (philosophy); Machine learning; Engineering; Computer vision","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001154328,0.0008671861,0.001227207,0.0003914055,0.0003446691,0.0007409037,0.0008062,0.001078925,0.001058617],"category_scores_gemma":[0.003703093,0.0004543685,0.0004811445,0.0003412461,0.000868534,0.0007213163,0.0007024823,0.001220177,0.0001772251],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008259703,"about_ca_system_score_gemma":0.001277551,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009023084,"about_ca_topic_score_gemma":0.005149058,"domain_scores_codex":[0.9995795,0.0001222733,0.00002289517,0.00009782173,0.0001094634,0.00006798062],"domain_scores_gemma":[0.9985986,0.0009381085,0.0001585163,0.00005705545,0.0001892713,0.00005834502],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004333752,0.00002723856,0.0003917469,0.00002610285,0.00002257794,0.00003570141,0.00002638411,0.9779972,0.0008472521,0.004455435,0.000352003,0.01577498],"study_design_scores_gemma":[0.000005155195,0.00000808635,0.00002936744,0.000001456668,0.000002010012,0.000002372438,7.739908e-7,0.9991317,0.00009901307,0.0006634722,0.00005504977,0.000001493552],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01489947,0.0001639706,0.9835072,0.0001585565,0.00004195419,0.00002476138,0.00001389818,0.0002380647,0.000952067],"genre_scores_gemma":[0.9033021,0.0001652501,0.09370751,0.000154021,0.0000578261,0.0001287554,0.00005511462,0.00004198261,0.002387447],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009023084,"threshold_uncertainty_score":0.01794112,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02347443230118521,"score_gpt":0.2229018177853744,"score_spread":0.1994273854841892,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}