攻击arXiv 2609.01222
研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响
提出针对 Agent Harness 的上下文特权提升攻击
- arXiv
- 2609.01222
- 发表
- 层
- 应用层
- 被测模型
- GPT-5.5、GPT-5.4 mini、Claude-Sonnet-4.6 等 7 个
提出针对 Agent Harness 的上下文特权提升攻击
提出 VPH 与 VTH,只改视频帧劫持世界模型并投毒下游策略
只改看似安全的视频帧,经世界模型之后才改变下游机器人策略。 问题在于世界模型进入数据生成后,数据集检查看到的仍是安全演示,合成轨迹却可以变危险。
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
提出 eTAMP,用网页内容跨会话投毒 Web Agent 轨迹记忆并诱导越权操作
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。