研究者提出 Reward Stealing Attack,从对齐模型行为反推安全奖励实施攻击
提出 ReSA,从对齐模型行为恢复安全奖励并在解码时反转
- arXiv
- 2610.06670
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Llama3.1-8B-Instruct、Gemma-7B-Instruct、Qwen2.5-7B-Instruct 等 9 个
摘要ReSA 用最大熵 IRL 从对齐模型行为恢复代理安全奖励,并在解码时反转以诱导有害输出。
ReSA 是一种对抗攻击:从对齐模型的可观察行为恢复代理安全奖励,再在解码时把该奖励反过来用。。