评测与基准arXiv 2609.19140
AgentLSD:在对抗性任务污染下评测 AI 安全 Agent
用 AgentLSD 评测安全 Agent 在对抗任务污染下的解题与开销
- arXiv
- 2609.19140
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 测试
- Mistral Small 4、Gemma-4 31B、DeepSeek-V4 Flash 等 6 个
- 攻击提示注入
摘要AgentLSD 用配对 web CTF 表明,欺骗性环境证据会改变安全智能体的解题率与工作量。
AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。