{"id":"W3175558129","doi":"10.1609/aaai.v35i12.17276","title":"Improving Sample Efficiency in Model-Free Reinforcement Learning from Images","year":2021,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":201,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Robustness (evolution); Computer science; Artificial intelligence; Stability (learning theory); Machine learning; Encoder; Representation (politics); Noise (video); Code (set theory); Image (mathematics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00287718,0.001089397,0.001490106,0.0004586175,0.0005317111,0.0009690191,0.00191144,0.001345246,0.002587386],"category_scores_gemma":[0.01377756,0.0007505636,0.0005369825,0.0003158504,0.001755786,0.002083955,0.001910697,0.002246659,0.0005209126],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001177835,"about_ca_system_score_gemma":0.001638619,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0048034,"about_ca_topic_score_gemma":0.005092191,"domain_scores_codex":[0.9992006,0.0003284492,0.00003865067,0.000173811,0.0001601231,0.00009839044],"domain_scores_gemma":[0.9949868,0.00358998,0.0003471301,0.0005897412,0.0003096294,0.0001767602],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002345487,0.000134606,0.00107486,0.00009412781,0.00004032804,0.00007708144,0.0001054798,0.9261957,0.002501302,0.01738233,0.0009957497,0.05116394],"study_design_scores_gemma":[0.00001375428,0.00002473642,0.00004657449,0.000005340339,0.00000283055,0.000007565566,0.000003567057,0.9945098,0.000486509,0.004798462,0.00009816155,0.000002773098],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0382784,0.0001822629,0.9582589,0.0003032137,0.00002585605,0.00005384235,0.00003297544,0.001095519,0.001768987],"genre_scores_gemma":[0.8619704,0.00009982718,0.1352307,0.0002118733,0.00002748986,0.0001516864,0.0001102942,0.0002401543,0.001957451],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.0048034,"threshold_uncertainty_score":0.01521611,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01918541106757507,"score_gpt":0.2364670789210525,"score_spread":0.2172816678534774,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}