跳到正文
10月8日 · 周四

Anthropic · 论文

找到 5 篇
  1. 攻击arXiv:2608.09867 ·

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链

    测试
    Inkling、Claude Opus 4.8、Claude Sonnet 4.6 等 15 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
    • 论文定位:本文揭示了主流商业大模型 API(Anthropic、OpenAI、Google)用于维护无状态架构的客户端加密思维链数据块存在跨会话、跨用户与跨模型的系统性互换漏洞。
    • 要解决的问题:厂商为了保护商业知识产权并防范有害信息外泄而隐藏思维链,但在生态内部广泛启用了宽松的加密块兼容性,使得强模型的内省对齐防线因同厂商弱模型的安全不对称性而面临被击穿的风险。
    • 方法核心机制:提出了一种基于弱模型充当模糊解密器的解密越狱方法;攻击者将强模型生成的加密签名注入同厂商低成本且防御宽松的弱模型(如 Claude Haiku 4.5、GPT-5.6 Luna、Gemini Robotics 1.6)中,利用输出预填或针对性提示词诱导其将加密内容逐字转写为明文,必要时结合强模型进行去噪调和。
    • 核心实验发现:
      1. 在 120 道 Codeforces 题目上,解密生成的 token 数量与 API 报告的原始计费思维 token 数量呈 1:1 紧密追踪(Figure 1)。
      2. 从公开抓取的 6,708 条智能体交互日志(315,320 个加密块)中解密出 941 项独立敏感伪影,从真实用户会话中恢复出 62 个 API 密钥、33 个密码等凭证,其中 64 项仅存在于加密思维而在可见聊天记录中已被用户清洗(Table 4)。
      3. 成功演示了将 HarmBench 恶意请求的隐藏思考还原为未审查输出,以及将恶意备份指令隐藏于加密块向 GPT-5.6 Sol 和 Opus 4.7 实施隐蔽提示词注入(Section 3.2、Section 4.2)。
      4. 预填 1% 的 Opus 4.8 思维可使 Kimi-K3 在 HLE STEM 题目上的最佳可见回答 n-gram 重叠度从 0.160 上升至 0.305(Table 3)。
    • 作者结论与启示:当前将加密数据对用户保密却对第三方缺乏防重放保护的设计无法保障隐私与安全;作者建议采用服务端存储的有状态架构,或在 AEAD 关联数据中强制绑定用户与会话哈希链,并呼吁行业重视多模型生态中弱模型的对齐短板。
    完整解读
  2. 攻击arXiv:2609.08236 ·

    研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

    提出内容不变样式包装,翻转安全评审器的判定

    测试
    Keyword (rulebased)、Vicuna-13B、GPT-4o-mini (gpt4o) 等 12 个提示层
    场景
    模型与 API攻击者无盒黑盒
    摘要论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。

    这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。

    • 核心定位与研究问题:论文探究以 Llama Guard 和大模型打分提示词为代表的自动安全裁判,在回复的操作性主体内容完全保持不变的情况下,是否会仅因外层语气或框架修饰而改变安全与否的判定。
    • 方法设计:研究者设计了 9 种在字节级别保持回复内容不变的样式包装器(包含 6 种隐匿危害与 3 种虚构危害包装,并划分为纯语气层与增添断言层),在来自 JailbreakBench 的 600 条多模型回复上对 8 种评审器展开评测,建立包含噪声底线测定与 Holm 配对校正的评估流程。
    • 大模型评审器的盲点:在通用提示词下,GPT-4o-mini 对带有先声明拒绝再遵从框架(refusal-then-comply)的有害回复产生了 19.9% 的翻转率(95% CI [15.0, 24.0],Holm p < 10^-4),而其在原始回复上的噪声底线仅为 0.5%;三判两胜重测下该翻转率仍保持在 18.2%。
    • 部署型审查模型的差异表现:部署型审查模型 Llama Guard 4 对教育场景框架(educational framing)产生了 12.3% 的有害漏报翻转(Holm p < 0.05),对 token 拒绝包装产生了 8.3% 的翻转;而专用推理安全分类器 gpt-oss-safeguard-20b 在全部包装下的翻转率均不超过 1.2%,处于其自身 1.5% 噪声底线之内。
    • 提示词改进的防御效果:在相同模型 GPT-4o-mini 上,采用明确要求忽略外层语气的 StrongREJECT 风格提示词后,token 拒绝包装的翻转率从 19.9% 降至 1.7%,降幅约为十倍。
    • 作者结论与建议:作者认为安全评审器的脆弱性并非普遍均匀分布,而是呈现模型特异性盲点;作者建议安全基准与防御评估在报告安全得分的同时,应报告面对内容不变修饰时的翻转预算(flip budget),并在采用评审器前对其样式不变性进行先期审计。
    完整解读
  3. 攻击arXiv:2609.15383 ·

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力

    测试
    Muse-Glimmer-30B、GPT-5.5、Claude Opus 4.8 等 7 个应用层
    场景
    编程 Agent攻击者黑盒
    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
    • 研究定位:该论文针对基于单次交互的大模型安全评估假定,提出了一种通过多交互任务拆解与重组来提取被拒绝能力的攻击范式。
    • 要解决的问题:现有多阶段防御主要依靠对单次请求中完整有害意图的拦截,当攻击者将任务分解为孤立技术细节并保留在外部环境中时,前沿模型的单次拒绝机制无法防止底层能力的泄露与组合利用。
    • 核心方法设计:提出能力洗钱攻击,以本地未对齐小语言模型作为编排器,结合结构化便签与看门狗脚手架,向无状态对齐前沿模型发起目标脱敏的技术咨询,随后在本地验证并拼装完成端到端任务。
    • 主要实验结果:在网络安全基准 CyBench 上,Gemma-4-31B 配合 GPT-5.5 恢复了 8/14(57%)的差距候选任务,配合 Opus 4.8 恢复 7/9(78%);在 BountyBench 上分别恢复 3/9(33%)与 2/3(67%);在生物攻击链评测中,咨询支持使 Gemma-4-31B 平均量规分由 75.3 提升至 83.1。
    • 能力边界发现:能力提升受编排器自身的推理与状态保持能力制约,同量级的 Muse-Glimmer-30B 在真实漏洞任务上取得 0 恢复率;生物链条中具两用特征的上游步骤增益明显,而直接涉及武器化的下游释放步骤几乎无增益。
    • 作者结论与建议:作者认为单次交互层面的对齐无法保障系统级安全,防御体系必须从独立的单次请求过滤,转向能够跟踪请求来源、跨会话推演功能依赖关系的组合感知监控架构。
    完整解读
  4. 攻击arXiv:2609.22510 ·

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用

    测试
    Devin AI CLI、Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct 等 14 个应用层
    场景
    AI Agent
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    完整解读
  5. 攻击arXiv:2609.36941 ·

    研究者提出针对黑盒 LLM 的实用密钥提取框架

    提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据

    测试
    StarCoder2-7B、DeepSeek-Coder-7B、LLaMA-3-8B 等 8 个模型层
    场景
    模型与 API攻击者黑盒
    摘要论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。
    • 定位与核心问题:针对黑盒商业大语言模型仅暴露生成文本且隐藏内部概率分布的限制,解决缺乏精确训练上下文时提取模型记忆的高熵 API key 的安全风险。
    • 两阶段方法框架:第一阶段利用注释编辑、死代码注入等 5 种语义保留代码变换扰动输入前缀,结合格式与长度双层过滤,通过硬标签响应蒸馏将黑盒模型的有效凭据输出迁移至本地白盒代理模型;第二阶段舍弃耗时的奖励模型,在白盒代理上通过 Sample-k%p 截断采样扩展候选空间,并基于最小窗口熵和 4-gram 重复子串抑制离线过滤幻觉凭据。
    • 凭据恢复效果:在 5 个 API 平台的受控评测中,针对 DeepSeek-Coder-7B、Qwen2.5-Coder-7B 和 LLaMA-3-8B 三大受害模型,平均恢复的真实凭据数量相较直接查询基线提升 11.8%–25.0%,分别达到 35.0、35.0 和 49.4 个(Table 1)。
    • 候选质量与多样性:在弱扰动条件下真实凭据比例(RR)相比白盒基线 DESEC 提升最高达 2.6 倍(Table 2),prompt 内候选凭据的余弦相似度和 3-gram Jaccard 相似度显著降低(Table 3)。
    • 推断效率提升:将过滤与排序转移至本地离线后,单次提取延迟降至 210–454 秒,较 token 级引导解码的 DESEC 提速 20.7 倍至 34.8 倍(Figure 3)。
    • 真实商业系统验证:在未接触模型权重的情况下,成功从 Qwen3-27B、GPT-Codex 5.3 和 Claude Haiku 4.5 中提取出多条凭据,并在 GitHub 上检索到公开匹配记录(Figure 4)。
    • 作者结论与启示:作者指出,实验表明 output-only 访问权限足以暴露黑盒模型记忆的机密凭据,构成现实的安全威胁,呼吁业界在预训练前执行更严格的数据清洗以避免敏感信息记忆。
    完整解读
已经到底了