{"id":"W2951110424","doi":"10.48550/arxiv.1612.02088","title":"Transition-based versus State-based Reward Functions for MDPs with Value-at-Risk","year":2016,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Concordia University","funders":"","keywords":"Markov decision process; Reinforcement learning; Function (biology); Action (physics); Transformation (genetics); Bellman equation; Markov process; Markov chain; State (computer science); Current (fluid); Order (exchange); Computer science; Mathematical optimization; Econometrics; Mathematics; Economics; Artificial intelligence; Statistics; Machine learning; Engineering; Algorithm; Finance","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0003278761,0.0004602598,0.000377272,0.0003822001,0.0005090586,0.0001394354,0.00137215,0.0002633868,0.0000472896],"category_scores_gemma":[0.00006369517,0.0004384424,0.0003405724,0.0004865971,0.0002037225,0.00029084,0.0003240894,0.0004878378,0.0001197754],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007299475,"about_ca_system_score_gemma":0.0007912063,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00008044081,"about_ca_topic_score_gemma":0.00005204712,"domain_scores_codex":[0.9974579,0.0001945059,0.0002711266,0.00128196,0.0002270208,0.0005674773],"domain_scores_gemma":[0.9964986,0.0007769953,0.0004798947,0.001632342,0.0003697919,0.0002423834],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0009391464,0.00005075553,0.0007553226,0.0000930367,0.0001705695,0.00004631685,0.00009518043,0.992417,0.000009896819,0.004835558,0.0004532075,0.0001340093],"study_design_scores_gemma":[0.004983595,0.0006739076,0.0002474394,0.0001754287,0.0002620469,6.404839e-7,0.00002214488,0.9893674,0.0002432101,0.001353829,0.002021441,0.0006489129],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0204072,0.000009617196,0.975777,0.0003471228,0.0009586537,0.0007903125,0.0001411573,0.0004947418,0.001074161],"genre_scores_gemma":[0.983323,0.00001592827,0.01339542,0.0001560043,0.00007309777,0.00001124944,0.000123274,0.00005025842,0.002851731],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9629158,"threshold_uncertainty_score":0.9998068,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05494755650732404,"score_gpt":0.1875184610339302,"score_spread":0.1325709045266061,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}