{"id":"W223326216","doi":"10.1613/jair.4301","title":"Policy Iteration Based on Stochastic Factorization","year":2014,"lang":"en","type":"article","venue":"Journal of Artificial Intelligence Research","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"Natural Sciences and Engineering Research Council of Canada; National Institutes of Health; McGill University; Fonds Québécois de la Recherche sur la Nature et les Technologies; Compute Canada; Coordenação de Aperfeiçoamento de Pessoal de Nível Superior","keywords":"Markov decision process; Factorization; Mathematical optimization; Factoring; Mathematics; Multiplication (music); Computer science; Markov process; Applied mathematics; Algorithm; Finance","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001702507,0.0009004488,0.001511597,0.0005992737,0.0005271062,0.0009255277,0.0008708689,0.001065943,0.002594016],"category_scores_gemma":[0.00597566,0.0005215895,0.000722343,0.0005326747,0.001379857,0.001284936,0.001263982,0.001506771,0.0003973708],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001244654,"about_ca_system_score_gemma":0.002549771,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005468792,"about_ca_topic_score_gemma":0.003335363,"domain_scores_codex":[0.9988035,0.0004441836,0.0000665467,0.0002226028,0.0003123564,0.0001507901],"domain_scores_gemma":[0.9972832,0.001951355,0.0002039187,0.0001756597,0.0002864528,0.00009949982],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00009184562,0.00003669708,0.0004453352,0.0000694734,0.00002977364,0.00007334872,0.0000816694,0.9018918,0.001472507,0.04735608,0.0007131996,0.04773841],"study_design_scores_gemma":[0.000008803598,0.00001901004,0.00001933163,0.000005059947,0.000002517949,0.00001363681,0.000003470763,0.9889543,0.0003645056,0.01030547,0.0003005314,0.000003393976],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.005871476,0.00006615995,0.9925727,0.00007912912,0.00002197929,0.00003923711,0.00001684419,0.0001739676,0.001158484],"genre_scores_gemma":[0.5574819,0.0002428124,0.4389271,0.0001337442,0.000055106,0.0003346274,0.000142223,0.00009561291,0.002586831],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005468792,"threshold_uncertainty_score":0.01087391,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.127637866729138,"score_gpt":0.4165855694153244,"score_spread":0.2889477026861863,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}