{"id":"W7126269717","doi":"10.21428/594757db.25036134","title":"Generating Malicious Demonstration Policies to Exploit Vulnerabilities in Inverse Reinforcement Learning","year":2025,"lang":"en","type":"article","venue":"","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Exploit; Adversarial system; Reinforcement learning; Task (project management); Function (biology); Imitation","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002251343,0.001019972,0.0006208837,0.0003423656,0.0003508063,0.0006792943,0.00128661,0.0009786717,0.002110853],"category_scores_gemma":[0.0179742,0.0003870986,0.0004259893,0.0001646404,0.00169186,0.001299547,0.001996918,0.002157845,0.0004357695],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006639485,"about_ca_system_score_gemma":0.00108862,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001196552,"about_ca_topic_score_gemma":0.001255783,"domain_scores_codex":[0.9986873,0.000520926,0.0000642559,0.0002589049,0.0002997,0.000168887],"domain_scores_gemma":[0.9905551,0.006262578,0.00100031,0.001409022,0.0004408252,0.0003322565],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003471887,0.00020457,0.003319341,0.0001821726,0.00007684232,0.0003261673,0.0002032046,0.9191124,0.01755248,0.02085978,0.00125387,0.03656205],"study_design_scores_gemma":[0.00001979855,0.0001151964,0.0002905932,0.00001925629,0.000009415281,0.00006624316,0.00002078304,0.9843808,0.00597302,0.008440374,0.0006529788,0.00001151529],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2045806,0.0003751576,0.7880805,0.0006114578,0.0001054777,0.0001640566,0.00010801,0.001536769,0.004437861],"genre_scores_gemma":[0.94349,0.00009217973,0.05475263,0.0001553125,0.00001243372,0.0001138663,0.00008020561,0.0001154507,0.001187977],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.002251343,"threshold_uncertainty_score":0.01190639,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0159369100862271,"score_gpt":0.2814066750714292,"score_spread":0.2654697649852021,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}