{"id":"W7132969921","doi":"","title":"Learning the Discount Factor in Inverse Reinforcement Learning with Application to Animal Behaviour","year":2023,"lang":"","type":"dissertation","venue":"TSpace","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Foraging; Reinforcement learning; Function (biology); Convexity; Preference; Factor (programming language)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002814102,0.0008934256,0.001099052,0.0004976392,0.0004446423,0.001165528,0.001166869,0.00136743,0.002614718],"category_scores_gemma":[0.01330403,0.0004850989,0.0008792648,0.0006121913,0.002212607,0.00231045,0.001476837,0.003236746,0.0002350177],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001760087,"about_ca_system_score_gemma":0.001091321,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004105758,"about_ca_topic_score_gemma":0.002816726,"domain_scores_codex":[0.9993978,0.0002871177,0.00003458869,0.0001345855,0.00009750164,0.00004857399],"domain_scores_gemma":[0.9945548,0.004452434,0.0003519181,0.0001825895,0.0003055117,0.0001527939],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007175881,0.00009976111,0.001253871,0.0001872082,0.0000499893,0.00008371049,0.0001957799,0.7717932,0.001551343,0.1688669,0.0007658102,0.0550806],"study_design_scores_gemma":[0.00001042325,0.00002710284,0.00009668282,0.00001326788,0.000007415046,0.00001134182,0.00001132543,0.9592898,0.0002536038,0.03981378,0.0004556867,0.000009474135],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02038585,0.0006475981,0.9752899,0.0004899694,0.00005732465,0.00004097968,0.00001783508,0.00009150664,0.002979117],"genre_scores_gemma":[0.5692794,0.001573372,0.4218743,0.0002223036,0.0001426687,0.0002544601,0.00005735139,0.0001504774,0.006445765],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004105758,"threshold_uncertainty_score":0.01488256,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02195637573274086,"score_gpt":0.317475079676105,"score_spread":0.2955187039433642,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}