{"id":"W4206914807","doi":"10.1109/ssci50451.2021.9660081","title":"Investigation of Maximization Bias in Sarsa Variants","year":2021,"lang":"en","type":"article","venue":"2021 IEEE Symposium Series on Computational Intelligence (SSCI)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Maximization; Reinforcement learning; Computer science; Randomness; Artificial intelligence; Q-learning; Expectation–maximization algorithm; Variance (accounting); Machine learning; Statistics; Mathematical optimization; Mathematics; Maximum likelihood; Economics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01206927,0.001156032,0.00149478,0.001050887,0.000548896,0.001666691,0.0016319,0.001325578,0.001970969],"category_scores_gemma":[0.06358129,0.0005238141,0.0007694051,0.000556412,0.001360506,0.002085895,0.001562218,0.002188388,0.0003215907],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001538065,"about_ca_system_score_gemma":0.003151007,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00216672,"about_ca_topic_score_gemma":0.001941164,"domain_scores_codex":[0.9949655,0.002252099,0.0003508059,0.0006836193,0.00113084,0.0006171517],"domain_scores_gemma":[0.9337267,0.05186747,0.00340158,0.004961586,0.00486747,0.001175218],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008851227,0.0005947767,0.01506546,0.0003554651,0.0002824092,0.0001969737,0.0002474183,0.8947628,0.004998381,0.01966596,0.002246921,0.06069824],"study_design_scores_gemma":[0.00006493708,0.0003221658,0.001128457,0.00004534126,0.00003028267,0.0001014971,0.00006125867,0.9889703,0.002192625,0.006545586,0.0005223037,0.00001532731],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6922896,0.002372308,0.2922658,0.001326452,0.000237698,0.0002769725,0.0001720447,0.001224347,0.009834868],"genre_scores_gemma":[0.9603121,0.0002261884,0.03794466,0.0002173617,0.00003051928,0.0001131166,0.0001195506,0.0001502565,0.0008861235],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01206927,"threshold_uncertainty_score":0.06382918,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05639518078776527,"score_gpt":0.2753421580849772,"score_spread":0.2189469772972119,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}