微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力
提出能力洗钱攻击,拆分任务向对齐模型套取能力
- arXiv
- 2609.15383
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 黑盒
- 被测模型
- GPT-5.5、Claude Opus 4.8、Grok-4.3 等 7 个
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出能力洗钱攻击,拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出 MIPC 与 CFA,观察模型自拟测验后接受开发者身份
这项工作把“模型自己出题、自己批改、再宣布身份已核验”定义成对话层认证失败,并与后端提权分开。
提出多轮越狱框架 BLUEPRINT,用世界观模拟与心理因素诱导有害输出
BLUEPRINT 是一个将因子化社会影响力策略空间与跨轮世界观模拟解耦的多轮大语言模型安全评测框架。
提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害
摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。
提出工作流级越狱,诱导 IDE 编程 Agent 在多轮开发中编写有害代码
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
提出 SMT 框架,用模拟审核轨迹越狱函数调用 LLM
提出 AdvGRPO,用 GRPO 闭环共训多轮越狱攻击者与防御者
提出 CFD 跨会话分解攻击,利用工件来源缺口绕过工具型 Agent 的本地检查
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。
提出 TRACE 框架,用分解与可演化多轮策略诱导智能体执行有害工作流
提出 Persona Attack,分步写入对话记忆指令以越狱
提出多轮意图欺骗越狱 iDecep,用良性意图伪装引出有害内容
iDecep 是一种黑盒多轮越狱:用表面良性的意图维持与恶意目标贴近的对话,并单独计入 safe completion 替代内容中的有害信息。。
提出 MM-Plan 多模态越狱框架,自动规划多轮图像编辑以越狱视觉独占目标
MM-Plan 是面向 Visual Exclusivity 的 black-box 多模态红队方法,并配有人工基准 VE-Safety。
提出多轮多模态越狱,并用 FragGuard 拦截有害响应
提出无外部攻击模型的多轮自我越狱方法 SLIP
摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
提出图像排版操纵与多轮提示越狱,绕过交通场景视觉语言模型安全对齐
提出 STAC 框架,把恶意目标拆成多轮看似无害的工具调用链
摘要作者提出并验证了智能体在序列化工具攻击下的普遍脆弱性,指出针对累积动作序列防御的必要性。