攻击arXiv 2609.01222
研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
- arXiv
- 2609.01222
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- DeepSeek-V4-Flash、GPT-5.5、GPT-5.4 mini 等 7 个
另有 78 篇论文还没打上分类标签,暂不在筛选结果里。
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
提出 SkillSecurer,检测定位并修补智能体技能中的提示注入
提出 memetic trojans,把对抗载荷嵌入智能体自发转发的社会传染内容
Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
提出跨目标课程强化学习,生成间接提示注入以劫持智能体
该研究针对强化学习自动化提示注入红队在攻击前沿大模型时的冷启动问题,提出了一种基于目标模型鲁棒性递进的课程强化学习方法。
提出残余权限重放攻击,跨任务复用已批准授权绕过确认