{"id":"W7124164408","doi":"10.65109/ycuv1950","title":"Policy optimization by marginal-map probabilistic inference in generative models","year":2014,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Partially observable Markov decision process; Inference; Benchmark (surveying); Bounded function; Generative model; Probabilistic logic; Bayesian inference; Scalability","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0008296253,0.0004943482,0.0004724468,0.0004450286,0.0002216413,0.0008182838,0.001388082,0.0002404469,0.0001769273],"category_scores_gemma":[0.00109106,0.000497642,0.000076977,0.001343823,0.0002205285,0.00174385,0.0006782765,0.0004799755,0.0001378889],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004215799,"about_ca_system_score_gemma":0.000620595,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003329426,"about_ca_topic_score_gemma":0.00002298339,"domain_scores_codex":[0.9959023,0.0005498495,0.0009412097,0.0009891365,0.0007207196,0.0008967788],"domain_scores_gemma":[0.997454,0.0005033223,0.0003806044,0.001040246,0.0003650868,0.0002566766],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000006249094,0.00006331729,0.0001153533,0.00005097186,0.000009822608,0.000001046226,0.0009417388,0.7547389,0.00001965291,0.2414756,0.0003212256,0.002256161],"study_design_scores_gemma":[0.0006518554,0.0003534519,0.00002478393,0.0001151286,0.0000100955,0.000001327654,0.00002048529,0.9897929,0.00008284805,0.008114412,0.000282396,0.0005503039],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.00009318266,0.00004795135,0.9778408,0.003187914,0.0003621855,0.0007196611,0.000002361169,0.0001174067,0.01762847],"genre_scores_gemma":[0.7550333,0.0001190327,0.2340501,0.00110203,0.0001663014,0.000050932,0.00002722875,0.00003311734,0.009417899],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.7549402,"threshold_uncertainty_score":0.9997475,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02209908059410262,"score_gpt":0.2683492951967342,"score_spread":0.2462502146026316,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}