防御arXiv 2610.08773·10月7日AdvSim2Real 用任务与注入对手共同演化训练网页智能体提出 AdvSim2Real,协同训练网页智能体抵御页面注入arXiv2610.08773发表10月7日层应用层场景web agent被测模型Qwen3.5-4B防御模型加固攻击提示注入深度解读完整解读
评测与基准arXiv 2609.19140·9月17日AgentLSD:在对抗性任务污染下评测 AI 安全 Agent评测安全 Agent 在对抗性任务污染下的解题成功与开销arXiv2609.19140发表9月17日层应用层场景web agent被测模型Gemma-4 31B、DeepSeek-V4 Flash、GPT-OSS 120B 等 6 个攻击提示注入摘要AgentLSD 用配对 web CTF 表明,欺骗性环境证据会改变安全智能体的解题率与工作量。AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。深度解读完整解读