{"id":"W3023876387","doi":"10.48550/arxiv.2005.01138","title":"Off-Policy Adversarial Inverse Reinforcement Learning","year":2020,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Adversarial system; Reinforcement learning; Computer science; Artificial intelligence; Imitation; Machine learning; Task (project management); Function (biology); Transfer of learning; Class (philosophy); Temporal difference learning; Psychology; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0003091606,0.0005551935,0.000524039,0.0005010137,0.0003218431,0.0002937925,0.003175747,0.000435044,0.0000921707],"category_scores_gemma":[0.000350082,0.000698171,0.0003778779,0.001103748,0.0001554965,0.0006267306,0.006497051,0.001802026,0.0007598746],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000729367,"about_ca_system_score_gemma":0.0009102013,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002836777,"about_ca_topic_score_gemma":0.000009207915,"domain_scores_codex":[0.9968854,0.0002528979,0.0004300086,0.001444258,0.0003024763,0.0006850081],"domain_scores_gemma":[0.9971527,0.000128123,0.0006352718,0.00146498,0.0001937374,0.0004251314],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00003450854,0.00001412462,0.0004453346,0.00007339433,0.0001306117,0.0002569042,0.0006009127,0.8762776,0.000021853,0.1208723,0.0009505461,0.0003219545],"study_design_scores_gemma":[0.0008783149,0.000168361,0.00009896317,0.00008420226,0.00007331225,0.000003071882,0.00009152624,0.9798865,0.00005503536,0.003113063,0.01488822,0.0006594037],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.00361146,0.00001533351,0.9735701,0.000598589,0.001086725,0.000442002,0.00000176108,0.0007698754,0.01990416],"genre_scores_gemma":[0.9860907,0.0003138551,0.003092064,0.0005601126,0.0004578618,0.00000146597,0.00005314603,0.00004147698,0.009389274],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9824793,"threshold_uncertainty_score":0.9995469,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0758925450107277,"score_gpt":0.2042774652760245,"score_spread":0.1283849202652968,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}