评测与基准arXiv 2609.19140
AgentLSD:在对抗性任务污染下评测 AI 安全 Agent
评测安全 Agent 在对抗性任务污染下的解题成功与开销
- arXiv
- 2609.19140
- 发表
- 层
- 应用层
- 被测模型
- Gemma-4 31B、DeepSeek-V4 Flash、GPT-OSS 120B 等 6 个
- 攻击提示注入
摘要AgentLSD 用配对 web CTF 表明,欺骗性环境证据会改变安全智能体的解题率与工作量。
AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。