{"id":"W2951110424","doi":"10.48550/arxiv.1612.02088","title":"Transition-based versus State-based Reward Functions for MDPs with Value-at-Risk","year":2016,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Concordia University","funders":"","keywords":"Markov decision process; Reinforcement learning; Function (biology); Action (physics); Transformation (genetics); Bellman equation; Markov process; Markov chain; State (computer science); Current (fluid); Order (exchange); Computer science; Mathematical optimization; Econometrics; Mathematics; Economics; Artificial intelligence; Statistics; Machine learning; Engineering; Algorithm; Finance","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006680563,0.001604151,0.001917319,0.0008628182,0.0004624757,0.001684037,0.001285447,0.001732184,0.001981599],"category_scores_gemma":[0.02287401,0.0006671826,0.001133221,0.0007567951,0.002481149,0.003774744,0.002049591,0.002796716,0.0002836894],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002397175,"about_ca_system_score_gemma":0.001878185,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002866604,"about_ca_topic_score_gemma":0.001511169,"domain_scores_codex":[0.9965107,0.002134077,0.0001773824,0.0004974443,0.0004264559,0.0002540069],"domain_scores_gemma":[0.9816621,0.01593328,0.0009149249,0.0004142658,0.0007292716,0.000346173],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00009076751,0.00004977293,0.0005259269,0.0001127299,0.00004121775,0.00004800802,0.00007865761,0.9013988,0.0004063885,0.08068662,0.0002759206,0.0162852],"study_design_scores_gemma":[0.000006297461,0.00002762118,0.00006911678,0.00001254565,0.000007432908,0.000008999156,0.000006978277,0.9720861,0.0001575023,0.02746896,0.0001404358,0.000008101454],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01218962,0.0005293076,0.9858934,0.0002903604,0.00002942495,0.00003329676,0.00002719646,0.0000870407,0.0009204762],"genre_scores_gemma":[0.8162323,0.001203118,0.1784309,0.0002122486,0.0001032282,0.0002741453,0.000172471,0.0001555367,0.003216005],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006680563,"threshold_uncertainty_score":0.03533059,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05494755650732404,"score_gpt":0.1875184610339302,"score_spread":0.1325709045266061,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}