{"id":"W7124165107","doi":"10.65109/twxw5772","title":"Sigma point policy iteration","year":2008,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Iterated function; Sigma; Function (biology); Fixed point; Point (geometry); Order (exchange); Markov decision process; Bellman equation","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0002857808,0.0003013009,0.0002473786,0.0003524068,0.0006094653,0.0004412301,0.0009749659,0.0001453521,0.0006981143],"category_scores_gemma":[0.000261735,0.0002974318,0.0001433156,0.001029316,0.000168216,0.001434145,0.0005279158,0.0003096745,0.001661908],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002113977,"about_ca_system_score_gemma":0.0006129905,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001375387,"about_ca_topic_score_gemma":0.000002248398,"domain_scores_codex":[0.99729,0.0001304047,0.000642523,0.0005712673,0.0007169962,0.0006487797],"domain_scores_gemma":[0.9981576,0.00009802001,0.0002249437,0.001055327,0.0002223775,0.0002417717],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000005204629,0.0000532515,0.0009270665,0.00001882315,0.0000278039,0.00005729743,0.004456098,0.8276007,0.0003044249,0.1525906,0.006453012,0.007505709],"study_design_scores_gemma":[0.000408084,0.0003266934,0.002766332,0.00002220643,0.000005649642,0.0001643066,0.00002557647,0.9860527,0.0007177355,0.0002160518,0.008936278,0.0003583803],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.001458899,0.00004531482,0.8987091,0.006011042,0.0007954278,0.0002503866,3.219653e-7,0.0002066526,0.09252281],"genre_scores_gemma":[0.9033417,0.00015511,0.02974929,0.002946604,0.0006237041,0.000004859364,0.000004009768,0.00001941317,0.06315535],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9018828,"threshold_uncertainty_score":0.9999478,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02866147398799097,"score_gpt":0.2603251415755973,"score_spread":0.2316636675876063,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}