{"id":"W2141690016","doi":"10.1145/1553374.1553383","title":"Predictive representations for policy gradient in POMDPs","year":2009,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université Laval","funders":"","keywords":"Computer science; Artificial intelligence; Mathematical optimization; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002127504,0.0008519499,0.001328943,0.0006742583,0.0003752967,0.001174583,0.001293183,0.001239885,0.002093834],"category_scores_gemma":[0.01088387,0.0006702704,0.0005862153,0.0006284362,0.001401325,0.002134024,0.001168397,0.001807076,0.0002394822],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001312651,"about_ca_system_score_gemma":0.00126624,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005143863,"about_ca_topic_score_gemma":0.00288969,"domain_scores_codex":[0.9993603,0.0002368208,0.00003640452,0.0001304632,0.0001595694,0.00007648349],"domain_scores_gemma":[0.9966048,0.002551606,0.0003256861,0.0001793031,0.0002555086,0.00008304785],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002663633,0.00001199181,0.0001574295,0.00003201066,0.0000083805,0.00001984926,0.0000266696,0.9686927,0.0001781875,0.02183766,0.000169054,0.008839514],"study_design_scores_gemma":[0.000004480499,0.000005240068,0.00001887595,0.000003470622,0.000001582891,0.000002696592,0.000002144595,0.9916985,0.00009181257,0.008091482,0.00007770793,0.000001992944],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01789058,0.0001646647,0.9803094,0.000174748,0.00002098417,0.00003478527,0.00004427474,0.0002872457,0.001073404],"genre_scores_gemma":[0.8373135,0.0003211921,0.1600858,0.00009475226,0.00005614747,0.0002513257,0.0001843173,0.000105484,0.001587496],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.005143863,"threshold_uncertainty_score":0.01125145,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02090219095413405,"score_gpt":0.3127686912663465,"score_spread":0.2918665003122125,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}