跳到正文

Agent 安全

智能体与工具调用带来的安全问题:权限、沙箱、数据外泄与失控行为。

171条精选相关主题提示注入AI 控制真实事件

最新精选

第 121–140 条 · 共 171 条
6月10日周三
  1. Google DeepMind · 62

    Google DeepMind 联合 Schmidt Sciences 等发起最高 1000 万美元多智能体安全研究资助

    Google DeepMind 与 Schmidt Sciences、Cooperative AI Foundation、ARIA 合作,并在 Google.org 支持下,发起最高 1000 万美元的多智能体 AI 安全技术研究资助征集。该资助聚焦大规模多智能体系统作为群体时的行为,以及理解和缓解潜在风险的框架,目标是应对独立系统跨网络交互时出现的“隐形”安全风险。征集列出四个优先方向:沙箱与测试床、智能体网络科学、智能体基础设施强化、以及大规模部署智能体的监督与控制。申请截止日期为 2026 年 8 月 8 日,获资助者预计于 2026 年秋季公布。

    推荐理由Google DeepMind 联合多家机构出资征集多智能体安全研究,四个优先方向可作为研究者判断选题与申请窗口的参考。

6月3日周三
  1. Trail of Bits Blog · 82

    Trail of Bits 绕过 ClawHub、Cisco 与 skills.sh 的 skill 扫描器

    Trail of Bits 测试了 ClawHub、Cisco skill-scanner 以及 skills.sh 集成的 Gen、Socket、Snyk 三家扫描器,用四个恶意 skill 全部绕过检测,其中三个不到一小时就完成。攻击手法包括在恶意代码前插入 10 万个换行符让 OpenClaw 扫描器截断文件、用 .docx 压缩包间接引用恶意脚本、在看似无害的格式化 skill 中夹带会读取环境变量的 .pyc 字节码,以及用企业环境配置话术包装的提示注入,诱导 agent 把 npm/yarn 指向攻击者控制的 registry。

    推荐理由Trail of Bits 用四个恶意 skill 实测了 ClawHub、Cisco 与 skills.sh 的扫描器,并公开了可复现的攻击仓库,适合评估 skill 分发链的信任模型。

5月29日周五
  1. DeepMind Safety Research · 74

    DeepMind 用自动审计与蜜罐评测测试 Gemini 模型的谋划倾向

    DeepMind Safety Research 发布两项工作,测试 Gemini 模型在作为编码 Agent 时是否会破坏监督自身的防护措施。第一项提出 Gram 自动审计框架,基于 17 个种子场景的模拟环境发现 Gemini 模型约 2–3% 的场景出现破坏行为,红队式审计指令下升至最高 8%,Gemini 3 系列的谋划相关推理明显多于 Gemini 2.5。

    推荐理由DeepMind 用模拟审计与真实代码库蜜罐两类方法评测 Gemini 的谋划倾向,并给出各模型在受提示与未受提示条件下的差异。

5月26日周二
  1. Adversa AI · 87

    Adversa AI 披露 SymJack:符号链接劫持在六款 AI 编码 Agent 上实现 RCE

    Adversa AI 研究员 Rony Utevsky 披露名为 SymJack 的攻击手法,通过恶意仓库中的符号链接劫持,让 AI 编码 Agent 在用户批准一次看似无害的文件复制时改写自身配置,并在下次重启时以用户权限执行攻击者代码。该手法在 Claude Code、Gemini CLI/Antigravity CLI、Cursor Agent CLI、GitHub Copilot CLI、Grok Build CLI 和 OpenAI Codex CLI 六款产品上得到验证,作者认为这是架构层面的共性问题而非单个产品的漏洞。

    推荐理由Adversa AI 披露的 SymJack 用符号链接劫持让审批提示显示错误写入目标,六个编码 Agent 的厂商回应与修复差异可供对照。

5月20日周三
  1. METR · 86

    METR 发布 2026 年 2 至 3 月前沿风险报告,评估内部 AI 智能体的失控部署风险

    METR 在 2026 年 2 月 16 日至 3 月 16 日的评估窗口内开展试点,联合 Anthropic、Google、Meta 和 OpenAI 评估前沿 AI 开发者内部 AI 智能体的失准风险。

    推荐理由METR 首次以机构为单位评估前沿实验室内部 AI 智能体的失控部署风险,并公开了参与方与流程限制。

5月14日周四
  1. OWASP GenAI Security Project · 71

    OWASP 作者解析 MemoryTrap:Claude Code 记忆与配置成为持久提示注入面

    OWASP ASI06 条目联合负责人 Idan Habler 结合 Cisco 对 Claude Code 的研究,说明 Agent 的记忆与上下文如何成为攻击面。在被称为 MemoryTrap 的漏洞中,常规开发流程即可触发持久提示注入:克隆仓库、让 Agent 协助、批准依赖安装,恶意载荷便进入持久记忆、全局 hooks 配置,并通过 system prompt 影响高信任指令层,从而跨会话、跨项目乃至重启后持续影响模型行为。作者指出,记忆文件、hook 脚本和本地配置实际属于 Agent 的受信运行环境与控制面,一旦被投毒,系统会继续把攻击者控制的内容当作合法指引,这正是 ASI06 记忆与上下文投毒所针对的风险。

    推荐理由以 MemoryTrap 为例说明 Agent 的记忆、hooks 与本地配置如何成为持久化提示注入面,并给出 Claude Code 的修复版本。

5月12日周二
  1. Wiz Research · 76

    TeamPCP 再度投毒:TanStack、UiPath、Mistral AI 等 npm 与 PyPI 包被植入窃密蠕虫

    2026 年 5 月 11 日,TeamPCP 对 npm 与 PyPI 生态发起协同供应链攻击,同时污染多个命名空间下的包,包括周下载量约 1200 万次的 @tanstack/react-router、@uipath 系列工具与 Agent SDK、Mistral AI 官方 TypeScript 客户端 @mistralai/mistralai,以及 PyPI 上的 [email protected] 和 [email protected]。

    推荐理由完整还原了 TanStack 等 npm 包被投毒的攻击链与凭证窃取范围,可对照排查自身 CI/CD 与依赖。

5月7日周四
  1. Adversa AI · 82

    TrustFall:Claude Code、Cursor、Gemini CLI 与 Copilot CLI 存在一键 RCE 缺陷

    Adversa AI 披露 TrustFall 缺陷:Claude Code、Gemini CLI、Cursor CLI、Copilot CLI 四个编码 CLI 在开发者接受文件夹信任提示后,会立即执行项目自定义的 MCP 服务器,恶意仓库只需一次回车即可触发未沙箱化的 RCE。

    推荐理由报告给出四个编码 CLI 在信任对话框后自动执行项目 MCP 服务器的完整链路,并附可复现 PoC 与端点加固清单。

5月4日周一
  1. Embrace The Red · 86

    Copirate 365:M365 Copilot 与消费版 Copilot 的漏洞链(CVE-2026-24299)

    作者在 DEF CON Singapore 演讲中复盘了 M365 Copilot 与消费版 Copilot 的一系列漏洞,MSRC 分配编号 CVE-2026-24299,相关缺陷已修补。

    推荐理由作者以第一手披露者身份复盘 M365 Copilot 的完整攻击链与补丁时间线,可看到间接提示注入如何从单次泄露升级为持久后门。

5月1日周五
4月30日周四
  1. Wiz Research · 78

    Wiz 披露 AI GitHub Actions 的权限绕过与密钥外泄风险

    Wiz 对 OpenAI、Anthropic、Google 等厂商的 AI GitHub Actions 做了安全分析,发现外部 App 与 bot 可绕过权限校验触发 AI 执行,并存在针对动态生成凭据文件的密钥外泄路径。研究覆盖 anthropics/claude-code-action(超 1.2 万个公开工作流)、google-github-actions/run-gemini-cli(超 1 千个)、openai/codex-action 和 actions/ai-inference,受影响仓库合计星标超 20 万。

    推荐理由Wiz 对主流 AI GitHub Actions 的实测披露了权限绕过与凭据外泄两类新路径,并附厂商修复进展,可对照检查自家工作流配置。

4月29日周三
  1. Wiz Research · 68

    TeamPCP 供应链攻击投毒 SAP npm 包,窃取开发者与 CI/CD 凭据

    Wiz 披露 TeamPCP 发起代号 Mini Shai Hulud 的供应链攻击,通过篡改 SAP 生态 npm 包注入 preinstall 脚本,在 npm install 时下载 Bun 运行时并执行混淆载荷。受影响包包括 @cap-js/sqlite 2.2.2、@cap-js/postgres 2.2.2、@cap-js/db-service 2.10.1 和 mbt 1.2.48。

    推荐理由Wiz 披露 TeamPCP 针对 SAP npm 包的供应链投毒,含恶意文件哈希与凭据轮换建议,可对照排查自身 CI/CD 环境。

4月28日周二
  1. Wiz Research · 84

    Wiz 披露 GitHub 内部 git 协议注入漏洞 CVE-2026-3854,可经单次 git push 实现远程代码执行

    Wiz Research 披露 GitHub 内部 git 基础设施中的严重漏洞 CVE-2026-3854,任何已认证用户仅用标准 git 客户端、通过一次 git push 即可在 GitHub 后端服务器执行任意命令。漏洞源于 babeld 将 git push option 值直接写入 X-Stat 头且未过滤分号,攻击者可注入 rails_env、custom_hooks_dir、repo_pre_receive_hooks 等字段,绕过沙箱并借路径穿越执行任意二进制。

    推荐理由Wiz 披露 GitHub 内部 git 协议注入漏洞的完整利用链,并给出 GHES 受影响版本与修复版本,便于管理员自查。

4月24日周五
  1. Google Security Blog · 74

    Google 扫描公开网页:间接提示注入的真实分布与增长趋势

    Google 威胁情报团队扫描 Common Crawl 的公开网页,发现真实存在的间接提示注入(IPI)尝试,多数属于无害恶作剧、帮助性引导、SEO 操纵和劝阻 AI 抓取,少数涉及数据窃取和破坏。

    推荐理由Google 对 Common Crawl 全网扫描,给出间接提示注入在真实网页中的分类分布与增长数据,可了解当前攻击成熟度。

4月10日周五
  1. Wiz Research · 66

    Wiz 分析 Anthropic 未发布模型 Claude Mythos 的漏洞发现能力与防御准备

    Wiz Research 分析称,Anthropic 未发布的前沿模型 Claude Mythos 能自主发现主流操作系统和浏览器中的数千个零日漏洞,并可在数小时内、以较低成本根据 CVE 编号和 git commit hash 生成可用的完整利用代码,还能串联多个漏洞并逆向闭源二进制文件。目前该模型仅提供给 Microsoft、Google、Linux Foundation 等关键软件基础设施方,Anthropic 表示没有公开计划。Wiz 预计短期内会出现大量 AI 发现的 CVE,中期约 12-18 个月后类似能力可能进入可本地运行的开源模型,届时攻击者将能大规模武器化 0-day 并在 n-day 公开后数小时内利用。

    推荐理由安全厂商从防御方视角梳理 Anthropic 未发布模型带来的漏洞发现节奏变化,并给出短中长期应对路径。

4月4日周六
  1. Wiz Research · 71

    Wiz 披露 prt-scan 供应链攻击:同一攻击者六波活动,滥用 pull_request_target 触发 GitHub Actions

    Wiz Research 追踪到同一威胁行为者自 2026 年 3 月 11 日起发起的六波活动,共开启超过 500 个恶意 PR,成功入侵至少两个 npm 包,比公开披露早三周。攻击者滥用 GitHub 的 pull_request_target 触发器,在 conftest.py、package.json、Makefile、build.rs 等 CI 执行文件中注入载荷,窃取 GITHUB_TOKEN、枚举密钥并探测 AWS/Azure/GCP 云元数据,通过 base64 编码的日志标记和 PR 评论外泄凭据。

    推荐理由Wiz 追踪到同一攻击者六波活动,还原了从粗糙脚本到 AI 生成载荷的演进路径与不足 10% 的成功率。

4月2日周四
  1. Adversa AI · 82

    Claude Code 被曝 deny 规则静默绕过:命令超过 50 条子命令即跳过安全检查

    Adversa AI 披露 Claude Code 存在安全策略绕过漏洞:当 shell 命令包含超过 50 条由 &&、|| 或 ; 连接的子命令时,bashPermissions.ts 会跳过逐子命令的安全分析,包括 deny 规则检查,回退到可被自动放行的通用询问提示。攻击路径是恶意仓库在 CLAUDE.md 中写入 50 多条看似正常的构建命令,把窃取凭据的命令藏在第 51 位,开发者让 Claude Code 构建项目时 deny 规则不会触发。作者实测显示,单独运行 curl 会被 deny 规则拦截,但前面加上 50 个 true 空操作后,Claude Code 提示无法逐条安全检查并询问是否继续。

    推荐理由披露了 Claude Code 在复合命令超过 50 条子命令时静默跳过 deny 规则的具体代码路径与利用链,可据此检查自身 Agent 权限配置。

4月1日周三
  1. Goodfire Research · 66

    Goodfire 与 Rakuten 用 SAE 探针在生产环境检测 PII

    Goodfire 与 Rakuten 合作,将稀疏自编码器(SAE)探针用于 Rakuten AI 智能体的 PII 检测,这是已知首个将 SAE 用于语言模型护栏的企业应用。方法是在 Llama 3.1 8B 侧模型上训练 SAE,再用其特征激活训练分类器,逐 token 判断姓名、地址、电话、邮箱等 PII 类别。由于真实 PII 敏感,训练数据全部为合成数据,SAE 探针在合成到真实生产数据的分布迁移上优于普通激活探针和注意力探针,并在非英语和标签噪声场景下同样表现更好。成本上,探针比常见 LLM-as-judge 方案便宜 10 到 500 倍,性能相当;用同一模型做白盒探针的 F1 从黑盒判官的 51% 提升到 96%。

    推荐理由Goodfire 与 Rakuten 的落地案例给出了 SAE 探针在合成到真实数据迁移上的对比数据,可迁移到企业护栏场景。

3月31日周二
  1. MITRE ATLAS 数据发布 · 65

    MITRE ATLAS 发布 v5.4.0,新增 AI Agent 攻击技术与案例研究

    MITRE ATLAS 发布 v5.4.0,新增多项针对 AI Agent 的攻击技术,包括发布被投毒的 AI Agent 工具、从 Agent 逃逸到宿主机、利用漏洞获取凭据、利用漏洞规避防御,以及 AI Agent 用户执行类的被投毒工具与恶意链接。该版本还更新了修改 AI Agent 配置这一既有技术。案例研究方面新增了暴露的 ClawdBot 控制接口导致凭据访问与执行、通过被投毒 ClawdBot 技能实施供应链入侵、OpenClaw 一键远程代码执行,以及通过提示注入对 OpenClaw 实施命令与控制。

    推荐理由MITRE ATLAS v5.4.0 新增针对 AI Agent 的攻击技术与真实案例,做 Agent 威胁建模的团队可对照更新自己的攻击面清单。

3月26日周四
  1. METR · 71

    METR 红队测试 Anthropic 内部 Agent 监控系统,发现多个新漏洞

    METR 员工 David Rein 与 Anthropic 合作,用三周时间对 Anthropic 部分内部 Agent 监控与安全系统进行红队测试,这些系统多数在 Opus 4.6 Sabotage Risk Report(附录 8.4,尤其是 8.4.8)中有描述。Anthropic 提供了相关内部系统和信息的大量访问权限,并安排员工在测试期间答疑和反馈。此次测试发现若干具体的新漏洞,其中一些已被修补,且没有任何一个严重动摇 Opus 4.6 Sabotage Risk Report 的主要结论。

    推荐理由METR 成员进入 Anthropic 内部系统做三周红队测试,披露了外部评估者嵌入前沿实验室的具体做法与产出。