{"id":"W2064203730","doi":"10.5555/777092.777139","title":"Greedy linear value-approximation for factored Markov decision processes","year":2002,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":41,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto; University of Waterloo","funders":"","keywords":"Markov decision process; Bellman equation; Mathematical optimization; Linear programming; Computer science; Dynamic programming; Basis (linear algebra); Set (abstract data type); Linear approximation; Approximation error; Approximation algorithm; Function (biology); Value (mathematics); Function approximation; Markov process; Mathematics; Artificial intelligence; Nonlinear system; Artificial neural network","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003797494,0.001523339,0.002399641,0.0009731358,0.0005859678,0.00140926,0.001523917,0.00173093,0.003519913],"category_scores_gemma":[0.01336399,0.0009371208,0.001043167,0.001133277,0.00192476,0.001764017,0.001744977,0.002601881,0.0006064524],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003226116,"about_ca_system_score_gemma":0.002616965,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009016861,"about_ca_topic_score_gemma":0.007416551,"domain_scores_codex":[0.9981262,0.0009330405,0.00007927848,0.0002868158,0.0003482905,0.0002264388],"domain_scores_gemma":[0.9919477,0.006787943,0.0004384128,0.0003008726,0.0003524162,0.0001726528],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00005090429,0.00002112387,0.0002020885,0.00004817729,0.00001960478,0.0000261811,0.00003429175,0.9649186,0.0001452329,0.02344648,0.0004316314,0.01065578],"study_design_scores_gemma":[0.000006788144,0.000007705279,0.00001322509,0.000005902588,0.000002361739,0.000003300286,0.00000259908,0.9856393,0.00005714297,0.01415265,0.0001070991,0.000001985933],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.007719731,0.0003275897,0.9898579,0.0001661093,0.00002018065,0.00003967374,0.00004721939,0.0002823634,0.001539312],"genre_scores_gemma":[0.5931128,0.0006935992,0.4015684,0.0001964227,0.00006344167,0.0004490401,0.0002869368,0.0001956105,0.00343393],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009016861,"threshold_uncertainty_score":0.02340722,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03629519433379755,"score_gpt":0.266278795498935,"score_spread":0.2299836011651375,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}