论文:分解攻击可跨不可关联身份绕过 LLM 有状态防御
Decomposition Attacks Across Unlinkable Identities: Limits of Stateful Defenses for LLM Services
AI 导读
论文提出分解攻击的新威胁模型:攻击者把有害任务拆成单独看都合规的请求,再在服务之外合并答案,并用服务无法关联的新身份提交,使有状态监控失去分组信号。作者证明,在固定攻击策略且不重试时,安全与效用的权衡完全取决于同能力良性请求的分组方式;一旦允许重试并从 Allow/Block 反馈中学习,这一有利工作点就消失。实验基于 91 个可执行任务、365 个操作请求和 11,393 条能力匹配的良性请求,在 1% 匹配对照拒绝率和 0.5% 背景流量拒绝率上限下,包括拥有精确请求到操作映射的特权策略在内,十种被测策略要么拦不住攻击要么超出预算;在防御未见过的任务族上,一次尝试后攻击成功率至少 99%,两次后达 100%。作者认为有效防御需要可靠身份关联、新身份成本或对答案使用的控制等额外证据。
推荐理由
论文用 91 个可执行任务和 1.1 万余条同能力良性请求,量化了分解攻击在有状态防御下的安全与误伤边界。