{"id":"W3132477017","doi":"","title":"Non-Linear Rewards For Successor Features","year":2021,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Western University","funders":"","keywords":"Successor cardinal; Computer science; Reinforcement learning; Artificial intelligence; Machine learning; Feature (linguistics); Function (biology); Term (time); Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0001549747,0.00008984643,0.0001126945,0.00003581965,0.000101166,0.0001705397,0.000553233,0.00005302762,0.00004747259],"category_scores_gemma":[0.0001305656,0.00007824143,0.00007475284,0.0002303438,0.00001533485,0.0002421044,0.0002333848,0.00009076601,0.00005593848],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00002015457,"about_ca_system_score_gemma":0.00009315435,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000008001301,"about_ca_topic_score_gemma":0.000004854832,"domain_scores_codex":[0.9991258,0.00001290282,0.0001433728,0.000268893,0.0002126937,0.0002363717],"domain_scores_gemma":[0.9991013,0.00009519829,0.00004425061,0.0005093344,0.0001900677,0.00005984824],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001411854,0.0000722903,0.001566145,0.0001337472,0.00009616573,0.00006328967,0.0007917969,0.6197046,0.003163162,0.2663228,0.09543263,0.01263921],"study_design_scores_gemma":[0.0004855062,0.00009021992,0.001331867,0.00001424087,0.000007062886,0.00001909715,0.00003151549,0.8906911,0.0373482,0.0005970856,0.06916698,0.0002170884],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0003702988,0.00003238827,0.9764017,0.002310399,0.0005102907,0.0001157628,5.320298e-7,0.0001415456,0.02011712],"genre_scores_gemma":[0.1587153,0.0000135821,0.7549319,0.002128749,0.0002267717,0.00002496103,0.0000151017,0.00001673887,0.08392692],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.2709865,"threshold_uncertainty_score":0.3190593,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01908450848725854,"score_gpt":0.2887595636198263,"score_spread":0.2696750551325677,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}