{"id":"W2953243993","doi":"10.48550/arxiv.1906.08226","title":"Unsupervised State Representation Learning in Atari","year":2019,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":27,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Sherbrooke; Université de Montréal","funders":"","keywords":"Representation (politics); Computer science; Benchmark (surveying); Feature learning; Artificial intelligence; Generative grammar; Variety (cybernetics); Generative model; Encoder; Code (set theory); Machine learning; State (computer science); Encoding (memory)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001826958,0.0009673155,0.001234579,0.000651614,0.0006642738,0.00125061,0.00332825,0.00177848,0.005461422],"category_scores_gemma":[0.008599085,0.0005006068,0.001022367,0.0007195655,0.001604276,0.003052748,0.002761222,0.003681345,0.001252105],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001664111,"about_ca_system_score_gemma":0.001709185,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005010374,"about_ca_topic_score_gemma":0.007127433,"domain_scores_codex":[0.9986101,0.0005718771,0.00005475741,0.0004125165,0.0002477986,0.0001028003],"domain_scores_gemma":[0.9975241,0.001222502,0.0002216944,0.0006613953,0.0002423631,0.0001280348],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001941932,0.0002313728,0.001157418,0.0002234632,0.0001004952,0.0001332323,0.0002570998,0.6699487,0.0041702,0.1718884,0.008370222,0.1433252],"study_design_scores_gemma":[0.00001582052,0.00003018389,0.0001013784,0.000009990234,0.000005977935,0.0000196268,0.00001080181,0.9458082,0.0008687044,0.05197534,0.001144121,0.000009709664],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01650256,0.0002226793,0.9755344,0.0004809255,0.00005710981,0.0001156396,0.0003432227,0.001740617,0.00500287],"genre_scores_gemma":[0.5463634,0.0002260097,0.4419813,0.0004325722,0.00008168023,0.0006020314,0.001697192,0.0007108579,0.007904981],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005461422,"threshold_uncertainty_score":0.01827031,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0804774768729731,"score_gpt":0.2042313606317191,"score_spread":0.123753883758746,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}