攻击arXiv:2609.15383 · 9月14日微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力编程 Agent攻击者黑盒·测试GPT-5.5、Claude Opus 4.8、Grok-4.3 等 7 个·应用层恶意使用危险能力多轮渐进摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。完整解读
攻击arXiv:2609.27422 · 9月23日RAMP:逆转对抗扰动以增强针对恶意软件检测器的干净标签后门攻击RAMP 反转对抗扰动加强 clean-label 后门。测试MalConv、MalConvGCG摘要RAMP 用反转扰动做 clean-label 投毒。RAMP 是 score-based black-box 下的 clean-label 后门增强,对象是会微调的 Windows PE 原始字节恶意软件检测器。完整解读