{"id":"W3037098147","doi":"","title":"Efficient Planning under Partial Observability with Unnormalized Q Functions and Spectral Learning","year":2019,"lang":"en","type":"article","venue":"International Conference on Artificial Intelligence and Statistics","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal; McGill University","funders":"","keywords":"Observability; Sample complexity; Reinforcement learning; Computer science; Observable; Artificial intelligence; Sample (material); Plan (archaeology); Mathematical optimization; Algorithm; Machine learning; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002834578,0.0001668376,0.0001570795,0.00009871877,0.0001689261,0.0004309604,0.0002748024,0.00005024931,0.0001912949],"category_scores_gemma":[0.000130781,0.0001462844,0.00001832787,0.0001246643,0.0001528173,0.0001410188,0.0001217023,0.0003026091,0.00007784873],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004427375,"about_ca_system_score_gemma":0.00007781546,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00003329813,"about_ca_topic_score_gemma":0.00001293133,"domain_scores_codex":[0.9985508,0.00007959679,0.0003099177,0.0004047973,0.0004123463,0.000242509],"domain_scores_gemma":[0.9990212,0.0003436869,0.0001324221,0.0001882476,0.0002174783,0.00009701591],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006777837,0.00002194966,0.002850748,0.00000527925,0.00001745589,0.000005577956,0.000347642,0.5224936,0.0001866392,0.4695868,0.000005597105,0.004410932],"study_design_scores_gemma":[0.00007719956,0.0004364651,0.00252573,0.00004891422,0.000007684236,0.00001365979,0.0008986883,0.9867063,0.0002249702,0.008710685,0.0001598596,0.0001898516],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.109572,0.000007050091,0.8862106,0.0004497762,0.0003913263,0.0001432682,0.000009033293,0.0000620483,0.0031549],"genre_scores_gemma":[0.9796579,0.00001372264,0.01955938,0.000106014,0.00004174778,0.000006638566,0.00001710007,0.000007836894,0.0005895997],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.870086,"threshold_uncertainty_score":0.5965304,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09226570585973484,"score_gpt":0.3228543093033689,"score_spread":0.230588603443634,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}