微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力
提出能力洗钱攻击,拆分任务向对齐模型套取能力
- arXiv
- 2609.15383
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 黑盒
- 被测模型
- GPT-5.5、Claude Opus 4.8、Grok-4.3 等 7 个
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出能力洗钱攻击,拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出多轮越狱框架 BLUEPRINT,用世界观模拟与心理因素诱导有害输出
BLUEPRINT 是一个将因子化社会影响力策略空间与跨轮世界观模拟解耦的多轮大语言模型安全评测框架。
提出工作流级越狱,诱导 IDE 编程 Agent 在多轮开发中编写有害代码
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
提出 SMT 框架,用模拟审核轨迹越狱函数调用 LLM
提出 OTTER 词元替换越狱,绕过表面毒性审核诱导有害回答
摘要论文展示了表面毒性与恶意意图的解耦现象,通过标准 API 实现黑盒越狱测试,并提出闭环分类器加固建议。
提出 Persona Attack,分步写入对话记忆指令以越狱
提出多轮意图欺骗越狱 iDecep,用良性意图伪装引出有害内容
iDecep 是一种黑盒多轮越狱:用表面良性的意图维持与恶意目标贴近的对话,并单独计入 safe completion 替代内容中的有害信息。。
提出纯视觉越狱攻击 VJA,把有害编辑指令编码进图像
提出 MM-Plan 多模态越狱框架,自动规划多轮图像编辑以越狱视觉独占目标
MM-Plan 是面向 Visual Exclusivity 的 black-box 多模态红队方法,并配有人工基准 VE-Safety。
提出多轮多模态越狱,并用 FragGuard 拦截有害响应
提出无外部攻击模型的多轮自我越狱方法 SLIP
摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
提出图像排版操纵与多轮提示越狱,绕过交通场景视觉语言模型安全对齐
提出 MetaBreak,用特殊 token 操纵越狱在线 LLM 服务并绕过审核
摘要利用特殊 token 注入对抗平台模板包裹与审核,多场景验证了越狱有效性与互补性。
提出自适应攻击框架,击穿越狱与提示注入防御
提出 STAC 框架,把恶意目标拆成多轮看似无害的工具调用链
摘要作者提出并验证了智能体在序列化工具攻击下的普遍脆弱性,指出针对累积动作序列防御的必要性。