攻击arXiv 2609.01222
研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响
提出针对 Agent Harness 的上下文特权提升攻击
- arXiv
- 2609.01222
- 发表
- 层
- 应用层
- 被测模型
- GPT-5.5、GPT-5.4 mini、Claude-Sonnet-4.6 等 7 个
提出针对 Agent Harness 的上下文特权提升攻击
提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化
提出 AMS,用激活分离与方向相似度检测安全训练改动
AMS 是面向开放权重模型、部署前使用的激活扫描器,用来看安全训练被拿掉或改写之后,激活空间里还留着什么几何痕迹。
评测编码 Agent 记忆文件中提示注入的跨会话影响
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。