{"id":"W6891724308","doi":"10.48448/ey03-4n67","title":"A Distributional Framework for Risk-Sensitive End-to-End Planning in Continuous MDPs","year":2022,"lang":"en","type":"other","venue":"Underline Science Inc.","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Backpropagation; Leverage (statistics); Novelty; Key (lock); Markov decision process; Probability distribution; Stochastic optimization; Optimization problem; Reinforcement learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.002982012,0.0005813349,0.0007443466,0.001983518,0.0006657867,0.0002187379,0.001259035,0.0003347918,0.003836789],"category_scores_gemma":[0.00427175,0.0006078368,0.0001402427,0.003305543,0.001393932,0.0001742003,0.0006905252,0.001339167,0.0007662515],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001735115,"about_ca_system_score_gemma":0.001438768,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007942122,"about_ca_topic_score_gemma":0.0007274816,"domain_scores_codex":[0.9944306,0.0002021074,0.0005723775,0.001635702,0.001787991,0.001371236],"domain_scores_gemma":[0.9968452,0.001069944,0.0007431157,0.0007324012,0.0002311103,0.0003781573],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0007707308,0.00121706,0.02516529,0.0001222876,0.000308023,0.0005692508,0.003543381,0.007244229,0.001647181,0.1916215,0.7530316,0.01475939],"study_design_scores_gemma":[0.002058178,0.0006425853,0.007332335,0.0009330712,0.0001474477,0.00008441236,0.003683315,0.01172767,0.0002781884,0.01903346,0.9518791,0.002200218],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01433264,0.001581843,0.4875545,0.002025393,0.006584637,0.01255215,0.1374522,0.003061847,0.3348548],"genre_scores_gemma":[0.5869283,0.00002894399,0.3080961,0.001832348,0.003345041,0.001465307,0.008436403,0.003039993,0.08682753],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.5725957,"threshold_uncertainty_score":0.9996373,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0246026434461901,"score_gpt":0.3260392245394246,"score_spread":0.3014365810932345,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}