{"id":"W2111467524","doi":"","title":"An Expectation Maximization Algorithm for Continuous Markov Decision Processes with Arbitrary Reward","year":2009,"lang":"en","type":"article","venue":"TUbilio (Technical University of Darmstadt)","topic":"Gaussian Processes and Bayesian Inference","field":"Computer Science","cited_by":30,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Parameterized complexity; Markov decision process; Mathematical optimization; Computer science; Maximization; Linear-quadratic-Gaussian control; Computation; Gaussian process; Heuristics; Optimization problem; Algorithm; Quadratic equation; Markov process; Gaussian; Mathematics; Optimal control","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002336677,0.0008454513,0.001162546,0.0005499157,0.0003703636,0.0009538284,0.001353878,0.001177528,0.003299749],"category_scores_gemma":[0.005857802,0.0006011821,0.0008519689,0.00083072,0.0009998197,0.001565019,0.00145848,0.002012817,0.001053553],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009605986,"about_ca_system_score_gemma":0.001590776,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002023427,"about_ca_topic_score_gemma":0.001816757,"domain_scores_codex":[0.9989803,0.0003989215,0.00006423707,0.0001950257,0.0002866411,0.00007485441],"domain_scores_gemma":[0.9981147,0.001428182,0.000113811,0.00008170001,0.0002104188,0.00005121987],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006552797,0.00006959455,0.0003320836,0.000127831,0.00006713299,0.00007612876,0.0001034051,0.7685263,0.001826245,0.09687621,0.002058202,0.1298714],"study_design_scores_gemma":[0.00001068346,0.0000120645,0.00002975279,0.000009246381,0.000005269721,0.00001809894,0.000002831812,0.9799709,0.0003082005,0.01877655,0.0008502907,0.000006001565],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0004466199,0.00004891116,0.9990562,0.00004371938,0.000008523912,0.000009547647,0.000007072901,0.00006568486,0.0003138135],"genre_scores_gemma":[0.08060929,0.0003376879,0.9163064,0.0001294239,0.00005513281,0.000225896,0.0001129898,0.0001444109,0.002078908],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003299749,"threshold_uncertainty_score":0.01235771,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.005562707577122003,"score_gpt":0.2138742374957114,"score_spread":0.2083115299185894,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}