{"id":"W2962951833","doi":"","title":"Cumulative Prospect Theory Meets Reinforcement Learning: Prediction and Control","year":2015,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Traffic control and management","field":"Engineering","cited_by":48,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Reinforcement learning; Simultaneous perturbation stochastic approximation; Cumulative prospect theory; Computer science; Mathematical optimization; Bellman equation; Empirical distribution function; Convergence (economics); Random variable; Cumulative distribution function; Stochastic approximation; Stochastic process; Artificial intelligence; Mathematics; Probability density function; Expected utility hypothesis; Statistics; Key (lock)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005567902,0.001770805,0.001630713,0.0007614118,0.000577764,0.002950322,0.001541355,0.002426929,0.003927671],"category_scores_gemma":[0.02557192,0.0006326634,0.0007754652,0.001073375,0.003151298,0.003639753,0.00199456,0.003911894,0.0004871868],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002548681,"about_ca_system_score_gemma":0.002279446,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004458593,"about_ca_topic_score_gemma":0.001869641,"domain_scores_codex":[0.9969828,0.00187564,0.0001003385,0.0004343103,0.0004283593,0.0001786023],"domain_scores_gemma":[0.9843419,0.01312162,0.0008060701,0.0005149001,0.0008428724,0.0003726978],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007680994,0.00005120619,0.0007547887,0.0001059353,0.0000613153,0.00007192117,0.00006901542,0.6524617,0.0003985294,0.3198575,0.001420064,0.02467118],"study_design_scores_gemma":[0.00001308072,0.00002195532,0.00008287212,0.00001269536,0.000005663551,0.00001029617,0.000007252315,0.8526695,0.0001299227,0.1465618,0.0004752482,0.00000968845],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.008031369,0.0005050334,0.9852904,0.001018271,0.00007214259,0.00003992806,0.00003802666,0.0001098352,0.004894987],"genre_scores_gemma":[0.8635634,0.001521732,0.1287173,0.000372935,0.000371458,0.0003384796,0.0001103148,0.00008367467,0.00492089],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005567902,"threshold_uncertainty_score":0.02944624,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02721012820076477,"score_gpt":0.1492170774226893,"score_spread":0.1220069492219245,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}