{"id":"W4403534366","doi":"10.1109/codit62066.2024.10708505","title":"Combining Dense and Sparse Rewards to Improve Deep Reinforcement Learning Policies in Reach-Avoid Games with Faster Evaders in Two vs. One Scenarios","year":2024,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Royal Military College of Canada; Queen's University","funders":"","keywords":"Reinforcement learning; Computer science; Reinforcement; Artificial intelligence; Human–computer interaction; Psychology; Social psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0008180325,0.0003076549,0.0003500469,0.0007277295,0.0000949125,0.0006960136,0.0004658161,0.00006753543,0.00002085898],"category_scores_gemma":[0.0001382644,0.0002698007,0.00003736855,0.0009158948,0.00008840823,0.0007248268,0.0006009568,0.0006530955,0.00005032761],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002533821,"about_ca_system_score_gemma":0.0001296235,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001243797,"about_ca_topic_score_gemma":0.000701814,"domain_scores_codex":[0.9974013,0.0001161097,0.0005365908,0.0006724984,0.0005643356,0.000709145],"domain_scores_gemma":[0.998993,0.0002030236,0.00008724924,0.0004788879,0.00005999685,0.0001777883],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004640217,0.00001699522,0.009320988,0.00009139796,0.00002969986,0.00007183191,0.02053024,0.9586486,0.0007541564,0.005588044,0.00004481427,0.004856793],"study_design_scores_gemma":[0.001076747,0.000754325,0.003288772,0.0006608948,0.00001208802,0.0000252896,0.001899728,0.9902411,0.000782813,0.000060829,0.0007686502,0.0004287744],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2283738,0.0001158225,0.7630294,0.002380737,0.0001984063,0.0006241394,1.19956e-7,0.000308767,0.004968803],"genre_scores_gemma":[0.9759741,0.00003609322,0.01972407,0.0009436496,0.00003338493,0.00004224547,0.000002697475,0.00003325298,0.003210466],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.7476004,"threshold_uncertainty_score":0.9999754,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01728873881557427,"score_gpt":0.2657106130266615,"score_spread":0.2484218742110873,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}