{"id":"W3023876387","doi":"10.48550/arxiv.2005.01138","title":"Off-Policy Adversarial Inverse Reinforcement Learning","year":2020,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Adversarial system; Reinforcement learning; Computer science; Artificial intelligence; Imitation; Machine learning; Task (project management); Function (biology); Transfer of learning; Class (philosophy); Temporal difference learning; Psychology; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001018625,0.0009468672,0.001022893,0.0003045709,0.0002936664,0.0006113304,0.001241459,0.001011741,0.003306509],"category_scores_gemma":[0.004670985,0.0002960742,0.0003703141,0.0002303742,0.001263887,0.000750736,0.00119594,0.001627148,0.0006220852],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006784158,"about_ca_system_score_gemma":0.001016277,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002810495,"about_ca_topic_score_gemma":0.002028352,"domain_scores_codex":[0.9994407,0.0001778626,0.00002280707,0.0001385316,0.0001351674,0.00008490153],"domain_scores_gemma":[0.998028,0.001305239,0.0001646991,0.0001934925,0.0002126863,0.00009582501],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00009949991,0.00006392827,0.0005027637,0.00004955281,0.00002019355,0.00009549586,0.00003526981,0.9474649,0.001554299,0.01197735,0.001450855,0.0366859],"study_design_scores_gemma":[0.000005828747,0.00001348259,0.00002746808,0.000002617354,0.00000150984,0.00001008061,0.000002029633,0.9969502,0.0003022057,0.002466128,0.0002163717,0.000002087497],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0193091,0.0001940394,0.9743822,0.0002741879,0.00006536628,0.00006334683,0.0000419758,0.0008307236,0.004839227],"genre_scores_gemma":[0.9140307,0.0001275043,0.07924981,0.0002621261,0.00003937879,0.0001489942,0.0001195751,0.0001069048,0.005915111],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003306509,"threshold_uncertainty_score":0.01106137,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0758925450107277,"score_gpt":0.2042774652760245,"score_spread":0.1283849202652968,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}