防御arXiv 2610.08773
AdvSim2Real 用任务与注入对手共同演化训练网页智能体
提出 AdvSim2Real,协同训练网页智能体抵御页面注入
- arXiv
- 2610.08773
- 发表
- 层
- 应用层
- 被测模型
- Qwen3.5-4B
提出 AdvSim2Real,协同训练网页智能体抵御页面注入
评测安全 Agent 在对抗性任务污染下的解题成功与开销
AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。
测量任务无关说服对 Agent 编码与网页研究行为的影响
这篇工作测量一件事:与任务无关的说服进入对话之后,AI 智能体执行后面的编码或网页研究时,轨迹是否系统性不同,以及“更容易被说服”能否预测差有多大。