微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力
作者发现未对齐SLM可向对齐模型分步咨询并本地组装;CyBench上Gemma-4-31B配GPT-5.5恢复57%候选差距。
- 57%CyBench:Gemma-4-31B+GPT-5.5候选恢复率
- 78%CyBench:Gemma-4-31B+Opus 4.8候选恢复率
- 33%BountyBench:Gemma-4-31B+GPT-5.5恢复率
评估弱未对齐模型能否通过任务拆解向强对齐模型咨询并本地组合,以绕过基于单次交互的对齐防御。
梳理了直接提示越狱、目标分解攻击及未对齐技术,指出既有分解研究未度量弱编排器的端到端能力增益。
设计能力洗钱框架,本地未对齐小模型结合结构化脚手架,向无状态对齐顾问发起脱敏咨询并组装。
在网络安全两项基准上恢复多项差距候选,生物攻击链评测中上游两用步骤较下游释放步骤得分提升更多。
作者指出了顾问模型数量、评测基准代表性、生物安全LLM评审偏置及单通道设定等局限与后续方向。
作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。