{"id":"W4296474750","doi":"10.1109/cog51982.2022.9893546","title":"Mitigating Cowardice for Reinforcement Learning Agents in Combat Scenarios","year":2022,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Ontario Tech University","funders":"","keywords":"Cowardice; Reinforcement learning; Computer science; Reinforcement; Computer security; Artificial intelligence; Engineering; Geography","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002487208,0.001132619,0.000996668,0.0004303917,0.0004501207,0.0007402298,0.001210814,0.001074764,0.001162368],"category_scores_gemma":[0.008348693,0.0004384303,0.0003292776,0.0001549435,0.001288187,0.001158017,0.001203894,0.001935338,0.0001855664],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008712535,"about_ca_system_score_gemma":0.001280671,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00368818,"about_ca_topic_score_gemma":0.003791045,"domain_scores_codex":[0.9991487,0.0003659148,0.00005084681,0.0001246155,0.0001642064,0.0001456195],"domain_scores_gemma":[0.9951644,0.003111118,0.0006640216,0.0003057771,0.0004589347,0.0002956619],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002471349,0.0002257217,0.002569864,0.00008167789,0.00006604171,0.00008796216,0.0001209369,0.9458408,0.005171734,0.004149497,0.0004770959,0.04096151],"study_design_scores_gemma":[0.00002088587,0.0001296382,0.0002183786,0.0000065348,0.000008137485,0.00001810967,0.00001102799,0.9968266,0.0009979559,0.001561698,0.0001949321,0.00000601661],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2454188,0.0003460296,0.7494494,0.0004993309,0.00006491809,0.0001493708,0.00002073083,0.001017779,0.003033565],"genre_scores_gemma":[0.9691855,0.00005407638,0.02983018,0.0001068669,0.00001163805,0.00004764684,0.00001471315,0.00002682526,0.0007224381],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00368818,"threshold_uncertainty_score":0.01315379,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03762955635733645,"score_gpt":0.2827725526344957,"score_spread":0.2451429962771593,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}