{"id":"W7124164408","doi":"10.65109/ycuv1950","title":"Policy optimization by marginal-map probabilistic inference in generative models","year":2014,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Partially observable Markov decision process; Inference; Benchmark (surveying); Bounded function; Generative model; Probabilistic logic; Bayesian inference; Scalability","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002108755,0.0009894794,0.001512906,0.0006737181,0.0005223274,0.001327762,0.002043434,0.001372824,0.00229901],"category_scores_gemma":[0.007713744,0.0009407798,0.001199393,0.0007723023,0.002141656,0.001595422,0.002203148,0.002388654,0.0002916769],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00189491,"about_ca_system_score_gemma":0.002341043,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01146541,"about_ca_topic_score_gemma":0.01014146,"domain_scores_codex":[0.9990956,0.0003417559,0.00003656046,0.000193725,0.0002261104,0.0001063793],"domain_scores_gemma":[0.9972335,0.002168109,0.0001741953,0.0001766079,0.0001559223,0.00009168685],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00002219493,0.00001248988,0.000182599,0.00002983862,0.00001578006,0.0000194141,0.00003130826,0.974934,0.0002570073,0.01714917,0.0002168034,0.007129354],"study_design_scores_gemma":[0.000003413772,0.000003978901,0.00001972218,0.000002299736,0.000002297759,0.000003530652,0.00000304665,0.9912339,0.0001190065,0.008514163,0.00009244699,0.000002231478],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.005259996,0.0000919797,0.9936088,0.0001083719,0.000009728523,0.00001627609,0.00003068004,0.0001976471,0.0006764846],"genre_scores_gemma":[0.6867552,0.0002912896,0.3101177,0.0001805525,0.00005398963,0.0001954131,0.0002146702,0.0002211555,0.001970037],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01146541,"threshold_uncertainty_score":0.02279735,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02209908059410262,"score_gpt":0.2683492951967342,"score_spread":0.2462502146026316,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}