{"id":"W2963388106","doi":"10.1609/aaai.v33i01.33015797","title":"QUOTA: The Quantile Option Architecture for Reinforcement Learning","year":2019,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":20,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Quantile; Reinforcement learning; Architecture; Computer science; Optimism; Value (mathematics); Artificial intelligence; Econometrics; Machine learning; Economics; Psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001672937,0.000687212,0.0009121712,0.0003510092,0.0004076825,0.00112451,0.001672412,0.0009906929,0.006537286],"category_scores_gemma":[0.004551687,0.0003620611,0.0004646695,0.000422952,0.001165391,0.001806188,0.001649493,0.002009379,0.0007707943],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008151458,"about_ca_system_score_gemma":0.001072496,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002295019,"about_ca_topic_score_gemma":0.002141561,"domain_scores_codex":[0.999337,0.0002798668,0.00003426533,0.0001184386,0.0001547691,0.00007564022],"domain_scores_gemma":[0.9989169,0.0005653277,0.0000851427,0.0001286924,0.0001938928,0.0001100843],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002925705,0.0001323185,0.001294877,0.0001247487,0.00008845281,0.00009812408,0.0001270237,0.7556628,0.003087479,0.1163745,0.002594133,0.120123],"study_design_scores_gemma":[0.00002074997,0.000046549,0.00007469801,0.000008611348,0.000007357105,0.00001413838,0.000005528228,0.9607384,0.0003974087,0.03771995,0.0009589583,0.000007670334],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01246995,0.0003311844,0.9828524,0.0003537117,0.00007661223,0.00005036423,0.00004914277,0.0006704391,0.003146149],"genre_scores_gemma":[0.8616918,0.0003433469,0.1328481,0.0003169359,0.00007298282,0.0002386451,0.0001087362,0.0001295864,0.004250013],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.006537286,"threshold_uncertainty_score":0.02186942,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05244733210608453,"score_gpt":0.2880631182674069,"score_spread":0.2356157861613223,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}