{"id":"W4210266050","doi":"10.1109/cinti53070.2021.9668479","title":"Deep Reinforcement Learning with DQN vs. PPO in VizDoom","year":2021,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":22,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"","keywords":"Reinforcement learning; Computer science; Artificial intelligence; Convergence (economics); Reinforcement; Quality (philosophy); Track (disk drive); Object (grammar); Machine learning; Human–computer interaction; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001094612,0.0005000744,0.000783718,0.0002086452,0.0002983243,0.000804798,0.001184617,0.00118981,0.003240115],"category_scores_gemma":[0.002884733,0.0003170327,0.0002915057,0.0002426566,0.0008671242,0.001129377,0.001429373,0.001683279,0.000478928],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007483952,"about_ca_system_score_gemma":0.00107529,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006710474,"about_ca_topic_score_gemma":0.004606679,"domain_scores_codex":[0.9996866,0.00007415618,0.00001776814,0.0001038103,0.00006016781,0.0000574661],"domain_scores_gemma":[0.9993506,0.0002993476,0.00005040369,0.00009789899,0.0001208384,0.00008090933],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004118118,0.0001587936,0.001194616,0.0000961018,0.00004306358,0.00007547298,0.00005844633,0.8553181,0.002711348,0.01772689,0.002505969,0.1196993],"study_design_scores_gemma":[0.00002666642,0.00005111081,0.00008557473,0.00000509057,0.000005288768,0.000009683577,0.000005248326,0.9943115,0.0006250608,0.004224716,0.0006458197,0.000004254786],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.05311354,0.0007661901,0.9339629,0.00069276,0.0002351572,0.00009442287,0.00008781176,0.001827124,0.009220084],"genre_scores_gemma":[0.9169317,0.0001488059,0.07850231,0.0002857057,0.00003606824,0.00008863674,0.00008188799,0.00009439535,0.003830404],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006710474,"threshold_uncertainty_score":0.0133428,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01072931158088935,"score_gpt":0.2251434012773191,"score_spread":0.2144140896964297,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}