跳到正文

Agent 安全

今天新收录 18 条(含旧文)

第 8 页更新的内容回到最新

10月1日周四
  1. Wiz Research · 收录 · 原文 41

    Wiz Red Agent 借 GitHub Copilot 辅助 PR 中的缺陷进入 Snowflake 内部 Jira

    Wiz Red Agent 独立发现并利用了一个 GitHub Actions 注入漏洞,该漏洞被 GitHub Advanced Security 漏检,Red Agent 借此验证了对 Snowflake 内部 Jira 敏感数据的访问权限并评估了影响范围,全程无需人工干预,距漏洞上线仅五天。该事件源于一个由 GitHub Copilot 辅助生成的 PR 中引入的缺陷。

  2. OWASP GenAI Security Project · 收录 · 原文 50

    OWASP 作者解析 MemoryTrap:Claude Code 记忆与配置成为持久提示注入面

    OWASP ASI06 条目联合负责人 Idan Habler 结合 Cisco 对 Claude Code 的研究,说明 Agent 的记忆与上下文如何成为攻击面。在被称为 MemoryTrap 的漏洞中,常规开发流程即可触发持久提示注入:克隆仓库、让 Agent 协助、批准依赖安装,恶意载荷便进入持久记忆、全局 hooks 配置,并通过 system prompt 影响高信任指令层,从而跨会话、跨项目乃至重启后持续影响模型行为。作者指出,记忆文件、hook 脚本和本地配置实际属于 Agent 的受信运行环境与控制面,一旦被投毒,系统会继续把攻击者控制的内容当作合法指引,这正是 ASI06 记忆与上下文投毒所针对的风险。

    推荐理由以 MemoryTrap 为例说明 Agent 的记忆、hooks 与本地配置如何成为持久化提示注入面,并给出 Claude Code 的修复版本。

  3. 腾讯玄武实验室 · 收录 · 原文 50

    腾讯玄武实验室披露 Agentic Coding 的幽灵依赖供应链威胁并发布 Atuin 插件

    腾讯玄武实验室提出 Agentic Coding 范式下的“幽灵依赖”供应链风险,即 LLM 自主选择第三方组件时倾向于引入过时版本(版本幽灵)或捏造不存在的组件名(名称幽灵)。对某主流编程模型的测试显示,Python Web 场景下其生成的 requirements.txt 几乎总是包含 2023 年或更早的过时组件版本,在长尾需求下编造组件名的幻觉率高达 40% 且集中在可预测的模式上。实验表明,完全由 AI 构建的 Python Web 应用因引入存在高危 SQL 注入漏洞的过时组件而“出厂即自带后门”;针对某一高频幻觉组件名在公共仓库注册后,20 天内被下载 500 次以上。

    推荐理由腾讯玄武实验室披露 Agentic Coding 中模型自主选包带来的两类供应链风险,并给出可复现的实测数据与防护插件。

  4. Wiz Research · 收录 · 原文 56

    Wiz 蜜罐记录 90 天针对 AI 基础设施的攻击:MCP 服务器 RCE、盲提示注入与 AI 原生后渗透

    Wiz Threat Research 在 LiteLLM、Flowise、LangChain、Langflow、ChromaDB、Ollama 等 AI 与 ML 服务上部署蜜罐,90 天遥测中观察到持续攻击,并将其归纳为三类模式:利用面向互联网的 MCP 服务器实现远程代码执行、针对 AI 智能体框架的盲提示注入,以及适配 AI 基础设施内部结构的后渗透。

    推荐理由Wiz 用 90 天蜜罐遥测还原了针对 AI 基础设施的三类攻击链,并给出可对照排查的 IOC 与加固清单。

  5. Adversa AI · 收录 · 原文 52

    Adversa AI 梳理 Claude Code 十起攻击:多数落在配置与审批机制而非模型行为

    Adversa AI 汇总了 2025 年 9 月至 2026 年 9 月间公开的十起针对 Claude Code 的攻击,指出它们几乎都不是模型行为问题,而是落在配置文件、hook 定义、审批弹窗、MCP 工具描述、插件 pin 和 skill 包这些模型外围机制上。其中 Miasma 蠕虫在真实环境中运行,导致微软四个组织下 73 个仓库被禁用;两起获得 CVE(CVE-2025-59536 与 CVE-2026-21852,均已修复);四起被厂商以超出威胁模型为由拒绝处理。作者称十起攻击无一需要越狱,反复出现的失效点是同意机制:弹窗显示的对象与实际授权的操作不一致,这一问题出现在三个研究团队的四处发现中。

9月30日周三
  1. arXiv:危险能力与安全评测 · 收录 · 原文 论文54

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    研究者提出 MMSkillRisk 基准,用于端到端评估多模态技能中由图像携带的攻击,并设计 Native-Context Visual Attack(NCVA),把恶意指令伪装成教学图像里的注释、界面标签等原生元素,SKILL.md 只引导 Agent 查看相关区域而不写明恶意操作。基准由 28 个干净技能构建,包含 36 个攻击包和 108 个可执行用例,覆盖数据外泄、持久化、权限提升、产物污染和完整性破坏五类目标,并在隔离沙箱中分别检查攻击成功与合法任务完成。在九种模型与 harness 组合上,NCVA 的合并攻击成功率为 43.1%,比逐例匹配的纯文本载体基线高 16.4 个百分点,且在全部九种组合上都更高;攻击成功与合法任务完成同时出现的比例为 36.5%,GPT-5.6-sol 搭配 Codex 时达到 72.2%。

    推荐理由论文给出图像载体攻击在九种模型与 harness 组合上的成功率,并说明任务完成与攻击成功可以同时发生。

  2. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    工具调用改变大语言模型的拒答机制

    研究者在多个开源权重模型上发现,工具调用场景下的有害请求比普通对话更少被拒答。危害信息仍被模型表征编码并可跨两种交互模式迁移,但工具调用把危害计算分散到不同位置,且需要更高的有效拒答阈值才触发拒答。工具调用的拒答也更脆弱,在更低的干预强度下即被破坏,而正常能力不受影响,说明常规安全评测未必适用于 LLM 智能体。

  3. Unit 42 · 收录 · 原文 55

    Unit 42 披露 AWS AgentCore Harness 默认配置下凭据可被提示注入窃取

    Unit 42 发现 AWS AgentCore Harness 默认开启的内置 shell 工具以 root 运行,且与解析凭据的运行时同处一个进程,攻击者可通过间接提示注入读取 /proc/1/mem,从堆内存中提取 AgentCore Identity 保管的明文 JWT。

    推荐理由原文完整还原了从间接提示注入到读取进程内存、外泄 JWT 并重放取 PII 的链路,部署 Agent 运行时的团队可据此检查 shell 工具与凭据解析是否同处一个进程。

  4. Unit 42 · 收录 · 原文 30

    OperTraitor:Kubernetes Operator 如何背离你的安全态势

    Unit 42 开源了 LLM 驱动的分析引擎 OperTraitor,它从本地 Operator 和 OperatorHub 目录读取原始 RBAC 配置,比对 Operator 文档功能与实际授予权限的差异,并给出 1–10 的风险评分。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  5. Google Security · 收录 · 原文 52

    Google 扫描公开网页:间接提示注入的真实分布与增长趋势

    Google 威胁情报团队扫描 Common Crawl 的公开网页,发现真实存在的间接提示注入(IPI)尝试,多数属于无害恶作剧、帮助性引导、SEO 操纵和劝阻 AI 抓取,少数涉及数据窃取和破坏。

    推荐理由Google 对 Common Crawl 全网扫描,给出间接提示注入在真实网页中的分类分布与增长数据,可了解当前攻击成熟度。

  6. Trail of Bits · 收录 · 原文 61

    Trail of Bits 报告 GPT 5.6-Cyber 在受控测试中突破 QEMU/KVM 隔离

    Trail of Bits 报告在自建开发机上让 GPT 5.6-Cyber 执行虚拟机逃逸挑战,展示具备网络安全能力的智能体对隔离环境的风险。三轮测试中,首轮尝试导致宿主崩溃,不能概括为三次均完整逃逸;后续两轮在不同更新配置下实现越界访问。作者指出测试环境、软件更新和攻击面会影响结果,并建议缩小权限与攻击面、加强监控。这是作者报告的受控能力演示,未经独立复现,不是在野事故。

    推荐理由作者用自家 Linux 主机实测 GPT 5.6-Cyber 的逃逸能力,给出三次逃逸的具体漏洞链与失败路径,可迁移到 Agent 沙箱设计。

  7. Embrace The Red · 收录 · 原文 60

    Copirate 365:M365 Copilot 与消费版 Copilot 的漏洞链(CVE-2026-24299)

    作者在 DEF CON Singapore 演讲中复盘了 M365 Copilot 与消费版 Copilot 的一系列漏洞,MSRC 分配编号 CVE-2026-24299,相关缺陷已修补。

    推荐理由作者以第一手披露者身份复盘 M365 Copilot 的完整攻击链与补丁时间线,可看到间接提示注入如何从单次泄露升级为持久后门。

  8. Simon Willison · 收录 · 原文 50

    研究者利用嵌套链接绕过 Claude web_fetch 防护,泄露用户隐私数据

    Ayush Paul 发现 Claude web_fetch 工具的一个漏洞,可绕过其数据外泄防护。该工具原本只允许访问用户自己输入的 URL 或 web_search 返回的链接,但此前也允许访问已抓取页面中嵌入的链接,攻击者据此搭建蜜罐站点,诱导 Agent 逐字母浏览嵌套生成的链接,从而提取出用户姓名、所在城市和雇主名称。

  9. Simon Willison · 收录 · 原文 55

    研究者披露针对 Microsoft Word 的自我复制提示注入蠕虫

    Håkon Måløy 发现一种针对 Microsoft Word 的提示注入新变体,可升级为自我复制的蠕虫。攻击者在文档中埋入隐藏指令,当该文档被 Copilot for Word 用作素材时,Copilot 可能把指令当作请求的一部分,改动正在起草或编辑的文档,并把隐藏指令复制进新文档,使其成为新的传播载体。

    推荐理由材料给出一种可自我复制的提示注入变体,说明文档在 Copilot 工作流间传播指令的路径,可帮助评估办公场景的注入面。

  10. Simon Willison · 收录 · 原文 58

    研究者披露绕过 Claude Code Opus 5 auto mode 的攻击

    Johann Rehberger 发现一种绕过 Claude Code auto mode 的攻击,据其称成功率约 80%:诱使 Claude Code 下载并解压 zip 压缩包,再执行导入 base64 的代码,从而加载并运行压缩包中提取的本地 struct.py 文件。

    推荐理由Johann Rehberger 披露的绕过 Claude Code auto mode 的攻击给出 80% 成功率,并暴露安全机制反而阻断清理命令的失效模式。

  11. Embrace The Red · 收录 · 原文 55

    研究者用多跳提示注入链攻破 Claude Code Opus 5 Auto Mode,成功率最高 80%

    研究者展示了一条针对 Claude Code Opus 5 Auto Mode 的定向攻击链:先诱导模型从 WebFetch 转向 curl 下载 ZIP 压缩包。

    推荐理由作者用一条多跳攻击链实测 Claude Code Auto Mode,并给出与厂商 0.00% 评测结果的对照,可看到基准数字与定向攻击之间的差距。

已经到底了