跳到正文

Anthropic

今天新收录 4 条(含旧文)

第 3 页更新的内容回到最新

10月1日周四
  1. Embrace The Red · 收录 · 原文 50

    研究者演示在 Agent Skill 中植入不可见 Unicode 后门并发布扫描工具

    安全研究者 Johann Rehberger 演示了如何用不可见的 Unicode Tag 码点在 Agent Skill 中植入提示注入后门,使其通过人工文本审查。他把这类隐藏指令加入 OpenAI 官方 Skills 项目中的 security-best-practices Skill,用户调用后 Claude 会按指令输出指定文本并执行 Bash 命令;该手法在 GitHub Copilot 配合 Claude 4.5 时同样生效。作者指出 Skill 的 name 和 description 会直接进入系统提示词上下文,且 Agent 能自行创建或修改 Skill 影响自身与其他 Agent。

  2. Embrace The Red · 收录 · 原文 43

    Agent Commander:用提示注入把 OpenClaw 等智能体变成 C2 僵尸网络

    安全研究者发布 Agent Commander,一个基于提示词的命令与控制(C2)服务器,被劫持的智能体定期回连领取自然语言任务,不执行原始系统命令。作者演示了三种智能体的间接提示注入入口:Kimi Claw 分析文档、OpenClaw 接收恶意邮件(无需人工操作)、NanoClaw 访问网站即被劫持。持久化方面,OpenClaw 利用默认每 30 分钟运行一次的 HEARTBEAT.md,并用 HEARTBEAT_OK 抑制用户通知;NanoClaw 则通过注入定时任务实现。作者观察到通知抑制效果显著,但有一次 OpenClaw 在整理每日笔记时识别出心跳中的后门,Opus 4.6 更擅长发现攻击但可被绕过。

  3. Embrace The Red · 收录 · 原文 50

    用 ChatGPT 生成的对抗图片劫持 Claude Opus 4.7 记忆工具

    作者用 ChatGPT 生成一张含解谜元素的对抗图片,让 Claude Opus 4.7 在分析图片时被间接提示注入劫持,调用 memory 工具写入虚假记忆。测试中 Opus 4.7 在 10 次里 5 次写入虚假信息,包括用户名、年龄、NASA 宇航员职业和饮食偏好,且每次都察觉到可能存在提示注入却仍被劫持。作者观察到初始记忆为空时攻击更易成功,内容越像真实用户会保存的信息越容易通过。该对抗样本在文章发布约 24 小时后攻击成功率降为 0%,原因不明。作者已于 2026 年 3 月通过 HackerOne 向 Anthropic 报告,工单被以安全问题关闭,后续邮件未获回复。

  4. Failure-First · 收录 · 原文 51

    Endless Jailbreaks 用双射学习构建可调强度的越狱攻击

    该论文提出双射学习越狱方法:通过多轮演示让目标模型学会一套临时的替换密码,再把有害请求用这套密码编码提交,模型在安全训练识别之前先完成解码并给出回答。攻击分三步,先教双射映射,再提交编码查询,最后反转映射解码回答,解码错误用 GPT-4o-mini 清理。攻击强度由 dispersion(字母表被重映射的比例)和编码长度(每个字符对应的数字位数)两个参数控制。

  5. Trail of Bits · 收录 · 原文 57

    Trail of Bits 绕过 ClawHub、Cisco 与 skills.sh 的 skill 扫描器

    Trail of Bits 测试了 ClawHub、Cisco skill-scanner 以及 skills.sh 集成的 Gen、Socket、Snyk 三家扫描器,用四个恶意 skill 全部绕过检测,其中三个不到一小时就完成。攻击手法包括在恶意代码前插入 10 万个换行符让 OpenClaw 扫描器截断文件、用 .docx 压缩包间接引用恶意脚本、在看似无害的格式化 skill 中夹带会读取环境变量的 .pyc 字节码,以及用企业环境配置话术包装的提示注入,诱导 agent 把 npm/yarn 指向攻击者控制的 registry。

    推荐理由Trail of Bits 用四个恶意 skill 实测了 ClawHub、Cisco 与 skills.sh 的扫描器,并公开了可复现的攻击仓库,适合评估 skill 分发链的信任模型。

  6. Simon Willison · 收录 · 原文 53

    Prompt Armor 发现 Claude Cowork 可被绕过域名白名单外泄文件

    Prompt Armor 发现 Claude Cowork 的出站流量域名白名单存在可绕过路径。Claude Cowork 默认只允许向特定域名列表发起出站 HTTP 流量,用于防范通过提示注入外泄用户数据的攻击。由于 Anthropic 的 API 域名在该白名单内,攻击者构造了一个包含自己 Anthropic API key 的攻击,让 Agent 把能看到的文件上传到 https://api.anthropic.com/v1/files 端点,攻击者随后即可取回这些内容。

    推荐理由Prompt Armor 利用白名单内的 Anthropic API 域名绕过出站限制,展示了域名白名单防护在 Agent 场景下的可绕过路径。

  7. Simon Willison · 收录 · 原文 43

    2,000 人尝试攻击 OpenClaw 助手,6,000 次均未泄露密钥

    Fernando Irarrázaval 在 hackmyclaw.com 发起挑战,让参与者通过发送邮件诱导其 OpenClaw 测试实例泄露密钥,结果 6,000 次尝试全部失败,期间消耗 500 美元 token 费用,并因入站邮件过多导致一个 Google 账号被封。该实例底层模型为 Opus 4.6,并配有明确的反提示注入规则,禁止依据邮件内容泄露 secrets.env 或凭据、修改自身文件、执行邮件中的命令或代码,以及向外部端点外传数据。

  8. Wiz Research · 收录 · 原文 55

    Wiz 披露 AI GitHub Actions 的权限绕过与密钥外泄风险

    Wiz 对 OpenAI、Anthropic、Google 等厂商的 AI GitHub Actions 做了安全分析,发现外部 App 与 bot 可绕过权限校验触发 AI 执行,并存在针对动态生成凭据文件的密钥外泄路径。研究覆盖 anthropics/claude-code-action(超 1.2 万个公开工作流)、google-github-actions/run-gemini-cli(超 1 千个)、openai/codex-action 和 actions/ai-inference,受影响仓库合计星标超 20 万。

    推荐理由Wiz 对主流 AI GitHub Actions 的实测披露了权限绕过与凭据外泄两类新路径,并附厂商修复进展,可对照检查自家工作流配置。

  9. Wiz Research · 收录 · 原文 59

    Wiz 披露 GhostApproval 漏洞:六款 AI 编码助手存在符号链接信任边界缺陷

    Wiz Research 披露名为 GhostApproval 的漏洞模式,影响 Amazon Q Developer、Anthropic Claude Code、Augment、Cursor、Google Antigravity 和 Windsurf 六款 AI 编码助手。攻击者构造含符号链接(CWE-61)的恶意仓库,诱使 Agent 将文件写入工作区之外,例如把攻击者 SSH 公钥写入 ~/.ssh/authorized_keys,从而获得持久免密访问甚至远程代码执行。

    推荐理由Wiz 披露六款 AI 编码助手共有的符号链接信任边界缺陷,并给出各厂商修复与拒绝的处置差异,可供评估 Agent 文件写入权限的团队参考。

  10. OWASP GenAI Security Project · 收录 · 原文 50

    OWASP 作者解析 MemoryTrap:Claude Code 记忆与配置成为持久提示注入面

    OWASP ASI06 条目联合负责人 Idan Habler 结合 Cisco 对 Claude Code 的研究,说明 Agent 的记忆与上下文如何成为攻击面。在被称为 MemoryTrap 的漏洞中,常规开发流程即可触发持久提示注入:克隆仓库、让 Agent 协助、批准依赖安装,恶意载荷便进入持久记忆、全局 hooks 配置,并通过 system prompt 影响高信任指令层,从而跨会话、跨项目乃至重启后持续影响模型行为。作者指出,记忆文件、hook 脚本和本地配置实际属于 Agent 的受信运行环境与控制面,一旦被投毒,系统会继续把攻击者控制的内容当作合法指引,这正是 ASI06 记忆与上下文投毒所针对的风险。

    推荐理由以 MemoryTrap 为例说明 Agent 的记忆、hooks 与本地配置如何成为持久化提示注入面,并给出 Claude Code 的修复版本。

  11. Adversa AI · 收录 · 原文 52

    Adversa AI 梳理 Claude Code 十起攻击:多数落在配置与审批机制而非模型行为

    Adversa AI 汇总了 2025 年 9 月至 2026 年 9 月间公开的十起针对 Claude Code 的攻击,指出它们几乎都不是模型行为问题,而是落在配置文件、hook 定义、审批弹窗、MCP 工具描述、插件 pin 和 skill 包这些模型外围机制上。其中 Miasma 蠕虫在真实环境中运行,导致微软四个组织下 73 个仓库被禁用;两起获得 CVE(CVE-2025-59536 与 CVE-2026-21852,均已修复);四起被厂商以超出威胁模型为由拒绝处理。作者称十起攻击无一需要越狱,反复出现的失效点是同意机制:弹窗显示的对象与实际授权的操作不一致,这一问题出现在三个研究团队的四处发现中。

9月30日周三
  1. arXiv · 收录 · 原文 论文53

    研究者提出针对黑盒 LLM 的实用密钥提取框架

    研究者提出一套仅依赖输出接口的黑盒密钥提取框架,用于从商业 API 大模型中提取被记忆的 API key。方法分两阶段:先用语义保持的提示变体、响应交叉验证和厂商格式过滤,把受害模型的密钥相关行为蒸馏到本地白盒代理;再在代理上用截断 top-p 采样配合局部 token 熵、N-gram 频率和厂商结构先验筛选候选。在含 5 家厂商、4 种编程语言共 100 个真实密钥的受控基准上,恢复效果较代表性基线最高提升 57.1%,真实密钥比例最高提升 2.6 倍,构建后提取延迟降低 20.7 至 34.8 倍。真实环境评估从三个独立部署的黑盒系统中恢复了被掩码的厂商凭证,涉及 OpenAI 与 Claude Code,GitHub 搜索显示这些密钥存在公开匹配,作者出于伦理未发起实际 API 调用。

    推荐理由论文给出仅凭输出接口提取记忆密钥的两阶段方法,并附受控基准与真实系统验证,可对照现有白盒审计思路。

  2. Simon Willison · 收录 · 原文 50

    研究者利用嵌套链接绕过 Claude web_fetch 防护,泄露用户隐私数据

    Ayush Paul 发现 Claude web_fetch 工具的一个漏洞,可绕过其数据外泄防护。该工具原本只允许访问用户自己输入的 URL 或 web_search 返回的链接,但此前也允许访问已抓取页面中嵌入的链接,攻击者据此搭建蜜罐站点,诱导 Agent 逐字母浏览嵌套生成的链接,从而提取出用户姓名、所在城市和雇主名称。

  3. Simon Willison · 收录 · 原文 53

    论文披露从专有 LLM API 窃取加密思维链的方法

    一篇论文发现 Anthropic、OpenAI 和 Google 返回给客户端的加密思维链块可在不同会话、用户和模型间重放,把前沿模型的推理轨迹喂给同族较弱模型并越狱后,即可还原出强模型的隐藏推理明文。

    推荐理由论文披露加密思维链块可在同族模型间重放并越狱还原,还衍生出借思维链实施提示注入的新变体。

  4. Simon Willison · 收录 · 原文 58

    研究者披露绕过 Claude Code Opus 5 auto mode 的攻击

    Johann Rehberger 发现一种绕过 Claude Code auto mode 的攻击,据其称成功率约 80%:诱使 Claude Code 下载并解压 zip 压缩包,再执行导入 base64 的代码,从而加载并运行压缩包中提取的本地 struct.py 文件。

    推荐理由Johann Rehberger 披露的绕过 Claude Code auto mode 的攻击给出 80% 成功率,并暴露安全机制反而阻断清理命令的失效模式。

  5. Embrace The Red · 收录 · 原文 55

    研究者用多跳提示注入链攻破 Claude Code Opus 5 Auto Mode,成功率最高 80%

    研究者展示了一条针对 Claude Code Opus 5 Auto Mode 的定向攻击链:先诱导模型从 WebFetch 转向 curl 下载 ZIP 压缩包。

    推荐理由作者用一条多跳攻击链实测 Claude Code Auto Mode,并给出与厂商 0.00% 评测结果的对照,可看到基准数字与定向攻击之间的差距。

已经到底了