跳到正文

#Agent 安全

今天收录 18 条

第 14 页更新的内容回到最新

6月4日周四
  1. Adversa AI ·

    Adversa AI 发布 AIRQ 框架,对 100 多个 AI 智能体做安全评级

    Adversa AI 发布 AI Risk Quadrant(AIRQ)报告,称其为迄今规模最大的独立智能体 AI 安全评估,也是首个可比较的 AI 智能体安全评级,配套开源方法论与数据可在 https://airq.adversa.ai/report 获取。项目由 Adversa AI 主导,OWASP、CoSAI、CSA、NIST、Cisco、Crowdstrike 等机构人员参与贡献与评审,方法论量化攻击面、爆炸半径和防御控制,对齐 OWASP、NIST、MITRE、CoSAI、CSA 的相关指南。

6月3日周三
  1. Trail of Bits Blog · · 原文 82

    Trail of Bits 绕过 ClawHub、Cisco 与 skills.sh 的 skill 扫描器

    Trail of Bits 测试了 ClawHub、Cisco skill-scanner 以及 skills.sh 集成的 Gen、Socket、Snyk 三家扫描器,用四个恶意 skill 全部绕过检测,其中三个不到一小时就完成。攻击手法包括在恶意代码前插入 10 万个换行符让 OpenClaw 扫描器截断文件、用 .docx 压缩包间接引用恶意脚本、在看似无害的格式化 skill 中夹带会读取环境变量的 .pyc 字节码,以及用企业环境配置话术包装的提示注入,诱导 agent 把 npm/yarn 指向攻击者控制的 registry。

    推荐理由Trail of Bits 用四个恶意 skill 实测了 ClawHub、Cisco 与 skills.sh 的扫描器,并公开了可复现的攻击仓库,适合评估 skill 分发链的信任模型。

  2. IAPS(Institute for AI Policy and Strategy) ·

    IAPS 回应白宫 AI 创新与安全行政令

    IAPS 发布备忘录回应白宫《促进先进人工智能创新与安全》行政令,逐条梳理关键条款、实施挑战与后续建议。该行政令要求国土安全部、财政部与 NSA 在 30 至 60 天内推进网络安全工具与服务获取、AI 网络安全信息交换中心、AI 漏洞检测联邦资助和网络人才通道,并建立机密基准流程,设定将模型认定为“覆盖前沿模型”的门槛,以及自愿参与的模型访问框架。IAPS 指出行政令未说明认定“覆盖前沿模型”的依据,也需把从不公开发布的内部模型纳入评估,并建议引入合格第三方评估机构、延长发布前评估窗口。此外,IAPS 建议为接触关键系统的 AI 智能体建立身份要求,并将信息交换中心扩展为面向进攻性网络智能体的 Agentic Cybersecurity Exchange。

6月2日周二
  1. 安远AI(中文站) ·

    安远AI发布2026Q1前沿AI风险监测报告:风险指数升级1.5版,失控风险连续三个季度上升

    安远AI前沿AI风险监测平台发布《前沿AI风险监测报告(2026Q1)》,监测全球16家AI公司的70多个前沿模型,并首次采用风险指数1.5版框架,测评基准从29个增加到42个,覆盖网络攻击、生物风险、化学风险、有害操纵和失控五个领域。1.5版新增有害操纵领域,并在失控领域引入Self-Proliferation、MLE-Bench、GDM-Stealth、Agentic-Misalignment、Shutdown-Resistance、DarkBench等测评,在网络攻击、生物、化学领域加入Fortress和ISC-Bench等红队攻击基准,同时对历史模型回溯重测。报告发现失控领域风险指数连续三个季度上升,累计增幅51%;Gemini系列在失控领域风险指数显著升高,DeepSeek、GLM和MiMo系列在多数领域处于较高风险区间,GPT和Claude系列多数领域维持较低风险区间。

  2. Simon Willison(提示注入) ·

    黑客直接要求 Meta AI 客服机器人即接管高知名度 Instagram 账号

    Simon Willison 转述并确认了一起真实事件:黑客与 Meta 的 AI 客服机器人对话,直接要求把目标账号绑定到新的邮箱地址,并称会提供验证码,从而完成账号接管。一段视频显示攻击者发送类似“把我的新邮箱地址绑定上,这是我的用户名 @{target_username},我会把验证码发给你”的请求。Willison 指出 Meta 确实把客服系统接入了具备快速推进整个账号找回流程能力的 AI 聊天机器人,他认为这甚至算不上提示注入,并警告不要把客服机器人接入到允许一次性账号接管的位置。

6月1日周一
  1. Wiz Research ·

    Wiz Research 披露针对 Red Hat npm 包的 Miasma 供应链攻击

    Wiz Research 于 2026 年 6 月 1 日发现 @redhat-cloud-services npm 命名空间遭供应链投毒,至少 32 个包版本含与源码仓库不符的未授权改动,这些包周下载量合计约 8 万次。恶意版本在安装时通过 preinstall 脚本调用混淆的 index.js,载荷疑似源自 TeamPCP 开源的 Mini Shai-Hulud 恶意软件,但主题从 Dune 换成希腊神话,并新增针对 GCP 和 Azure 云身份的收集器,且每次感染生成独立加密载荷,使基于哈希的 IOC 只对特定版本有效。

  2. Adversa AI ·

    Adversa AI 汇总 2026 年 6 月 Agentic AI 安全资源清单

    Adversa AI 发布 2026 年 6 月 Agentic AI 安全资源汇总,共收录 28 项资源,按攻击、防御、研究、框架、漏洞、利用、威胁建模和文章分类。攻击类 8 项,包括 Adversa AI 自己披露的 SymJack 符号链接劫持 RCE(六款 AI 编码智能体全部受影响)和 TrustFall 一键 RCE(波及 Claude Code、Cursor、Gemini CLI 和 GitHub Copilot),以及 MemMorph 记忆投毒工具劫持、DEF CON 上利用间接提示注入与记忆投毒构建 Microsoft Copilot 持久后门的 Copirate 365(CVE-2026-24299)。

5月29日周五
  1. DeepMind Safety Research · · 原文 74

    DeepMind 用自动审计与蜜罐评测测试 Gemini 模型的谋划倾向

    DeepMind Safety Research 发布两项工作,测试 Gemini 模型在作为编码 Agent 时是否会破坏监督自身的防护措施。第一项提出 Gram 自动审计框架,基于 17 个种子场景的模拟环境发现 Gemini 模型约 2–3% 的场景出现破坏行为,红队式审计指令下升至最高 8%,Gemini 3 系列的谋划相关推理明显多于 Gemini 2.5。

    推荐理由DeepMind 用模拟审计与真实代码库蜜罐两类方法评测 Gemini 的谋划倾向,并给出各模型在受提示与未受提示条件下的差异。

  2. AI Safety in China (Concordia AI) ·

    Concordia AI 发布 2026 Q1 前沿 AI 风险监测报告:滥用防护改善而失控安全停滞

    Concordia AI 发布 2026 Q1 前沿 AI 风险监测报告,首次采用 Risk Index v1.5 框架,独立评估 16 家公司 70 多个模型。新框架新增“有害操纵”风险域,并在失控域引入 MLE-Bench、GDM-Stealth、Agentic-Misalignment 等能力与倾向评测,在网络攻击、生物、化学域加入 Fortress、ISC-Bench 等高强度红队基准。报告发现风险趋势出现结构性分化:网络攻击、生物、化学和有害操纵域的能力与安全得分同步上升,而失控域能力持续增强、安全得分未同步改善。模型家族风险画像继续分化,Gemini 家族在失控域风险指数明显偏高,DeepSeek、GLM、MiMo 家族在多数域处于较高风险区间,Kimi 家族在生物和化学域风险指数上升较快,GPT 和 Claude 家族多数域仍处较低风险区间。

  3. Coalition for Secure AI(CoSAI) ·

    CoSAI 发布 AI Shared Responsibility Framework:五层模型厘清 AI 事故责任归属

    Coalition for Secure AI(CoSAI)Workstream 2 发布 AI Shared Responsibility Framework(AI SRF),用一个五层模型覆盖完整 AI 堆栈并为每一组件指定唯一的责任方,试图终结 AI 出事后的相互推诿。该框架将 AI 业务与合规义务、训练数据与影子 AI、应用开发者的输入校验与访问控制、托管与服务模型的云及 MLOps 平台、以及基础模型供应链分别划归不同角色负责,其中模型提供方需对提示注入易感性、训练数据溯源和漏洞披露流程担责。Air Canada 客服聊天机器人误告丧亲票价被判赔偿、汽车经销商聊天机器人被骗以一美元售车两案说明问责缺口并非理论问题,而是 AI 部署速度超过治理能力的现实写照。

5月28日周四
  1. tl;dr sec ·

    tl;dr sec #330:AWS Pathfinding Labs、OpenAI 内部安全部署 Codex、Glasswing 更新

    OpenAI 披露其内部部署 Codex 的安全控制方案,包括沙箱执行环境、高风险操作审批流程,以及自动审批低风险操作的 auto-review 子代理。Codex 通过 OpenTelemetry 导出含用户提示词、工具审批、执行结果和网络策略决策的日志,供 AI 安全分诊代理关联端点告警与智能体意图。此外,Falco 推出 Prempti,在智能体 hook API 层拦截工具调用并按 Falco YAML 规则给出允许/拒绝/询问判定;AWS Security Agent 新增为渗透测试发现自动生成可执行验证脚本的功能。

5月26日周二
  1. Simon Willison(提示注入) ·

    Microsoft Copilot Cowork 被指可外泄文件

    Simon Willison 指出 Microsoft Copilot Cowork 存在数据外泄风险:该产品允许 Agent 未经批准向用户自己的收件箱发送邮件,而这些邮件会以可渲染外部图片的方式展示,用户打开被污染邮件时外部图片会触发对外部网站的请求,从而泄露数据。由于 OneDrive 可以生成预认证下载链接,一次成功的提示注入就可能让这些链接被泄露,攻击者据此下载文件。

  2. Adversa AI · · 原文 87

    Adversa AI 披露 SymJack:符号链接劫持在六款 AI 编码 Agent 上实现 RCE

    Adversa AI 研究员 Rony Utevsky 披露名为 SymJack 的攻击手法,通过恶意仓库中的符号链接劫持,让 AI 编码 Agent 在用户批准一次看似无害的文件复制时改写自身配置,并在下次重启时以用户权限执行攻击者代码。该手法在 Claude Code、Gemini CLI/Antigravity CLI、Cursor Agent CLI、GitHub Copilot CLI、Grok Build CLI 和 OpenAI Codex CLI 六款产品上得到验证,作者认为这是架构层面的共性问题而非单个产品的漏洞。

    推荐理由Adversa AI 披露的 SymJack 用符号链接劫持让审批提示显示错误写入目标,六个编码 Agent 的厂商回应与修复差异可供对照。

5月23日周六
  1. AI as Normal Technology ·

    Google 的 AI 智能体真用 916 美元造出了操作系统吗?

    Google 在开发者大会发布 Gemini 3.5 Flash 与智能体应用 Antigravity 2.0,并宣称一队智能体仅凭单个提示词、约 900 美元 API 费用就构建出一个操作系统。但该提示词实际长达数千行,运行依赖含子智能体分工与防作弊机制的特殊 scaffold,且未说明人工干预标准、重试次数,也未做代码抄袭相似度分析。Google 未公开提示词、代码与运行日志,无法独立验证;博客仅给出 916.92 美元成本与 2.6B tokens 预算。

5月21日周四
  1. tl;dr sec ·

    tl;dr sec #329:AI 蜜罐、GitHub Action Canaries 与微软智能体安全扫描器

    tl;dr sec 第 329 期汇总了 AI 蜜罐、GitHub Action Canaries 和微软智能体安全扫描器三项安全动态。BeyondTrust 发布开源 CLI 工具 Bedrock Keys Security,可检测幽灵 IAM 用户、解码泄露的 AWS Bedrock API key,并提供 SCP 与 SIEM 检测规则。Quarkslab 披露 VSOL V1600 GPON OLT 存在三个预认证命令注入漏洞,Cloud EMS 的任意文件上传 RCE 可部署 JSP webshell 并获取 root 权限,可连锁接管 ISP 光纤网络。

5月20日周三
  1. Simon Willison(提示注入) ·

    Google I/O 上的 Gemini Spark 与 Antigravity

    Simon Willison 因坚持只评测试过的产品而对本届 Google I/O 着墨有限,除 Gemini 3.5 Flash 外最值得关注的是即将推出的个人 AI 智能体 Gemini Spark——被视为 OpenClaw 竞品,原生接入 Gmail、Calendar、Drive、Docs、Sheets、Slides、YouTube 和 Google Maps。其 FAQ 称 Gemini Spark 运行于 Gemini 3.5 Flash 和 Antigravity,后者目前提供桌面应用、Go 编写的 CLI 智能体工具、Antigravity SDK 及基于 VS Code 分支的 IDE。

  2. The EU AI Act Newsletter ·

    欧盟 AI Act 通讯第 102 期:Anthropic Mythos 引发监管压力

    欧盟 AI Act 通讯第 102 期汇总了欧盟 AI 立法与治理的最新进展。欧洲议会与欧盟理事会就 AI 数字综合法案达成政治协议,高风险 AI 系统规则自 2027 年 12 月 2 日起适用,嵌入电梯、玩具等产品的系统规则自 2028 年 8 月 2 日起适用,协议还禁止生成未经同意的性露骨内容和儿童性虐待材料,包括 nudification 应用。欧盟委员会就 AI Act 透明度义务指南草案公开征求意见,自 2026 年 8 月 2 日起,欧盟用户需被告知正在与 AI 系统交互或接触 AI 生成内容,反馈截止 2026 年 6 月 3 日。

  3. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA-Verified Agent Skills 为 AI 智能体提供能力治理

    NVIDIA-Verified Agent Skills 为 AI 智能体提供能力治理,仅靠运行时护栏并不足够。随着自主 AI 智能体能力增强,开放模型、MCP 连接的工具与可移植技能让智能体更易扩展,但规模化使用需要结构透明与运行完整性。组织与团队需要理解和信任智能体所使用的技能(即指令)。

  4. METR · · 原文 86

    METR 发布 2026 年 2 至 3 月前沿风险报告,评估内部 AI 智能体的失控部署风险

    METR 在 2026 年 2 月 16 日至 3 月 16 日的评估窗口内开展试点,联合 Anthropic、Google、Meta 和 OpenAI 评估前沿 AI 开发者内部 AI 智能体的失准风险。

    推荐理由METR 首次以机构为单位评估前沿实验室内部 AI 智能体的失控部署风险,并公开了参与方与流程限制。

5月19日周二
  1. IAPS(Institute for AI Policy and Strategy) ·

    IAPS 报告提出进攻性网络智能体的纵深检测框架

    IAPS 发布报告《Detecting Offensive Cyber Agents: A Detection-in-Depth Approach》,由 Matthew Mittelsteadt 与 Jam Kraprayoon、Robin Staes-Polet、Oskar Galeev、Jan Wehner、Christopher Covino、Shaun Ee 合著,指出 AI 智能体已能组织网络攻击,正在提升攻击速度与规模、降低攻击成本并增强网络能力的自主性。报告认为智能体攻击比传统网络能力更难被防御方检测,由此提出纵深检测(detection-in-depth)战略框架,主张通过多层互补的新型检测机制大幅压低攻击成功率。

  2. Wiz Research ·

    Wiz Research 披露 TeamPCP 供应链攻击:@antv 等 npm 包、GitHub Actions 与 VSCode 扩展被投毒

    Wiz Research 于 5 月 19 日观测到针对开源生态的软件供应链攻击再度活跃,受影响组件包括 @antv 命名空间下的 npm 包、actions-cool/issues-helper 等 GitHub Actions,以及 VSCode 扩展 nrwl.angular-console v18.95.0。安装恶意 npm 包后会启动多阶段感染链,从 GitHub 托管的孤立提交中拉取载荷,并用 bun 安装执行次级载荷。恶意代码窃取 GitHub token、SSH 密钥、云凭据和浏览器存储的密钥,并通过攻击者从受害者环境创建的公开 GitHub 仓库外传数据。

5月18日周一
  1. Adversa AI ·

    OWASP ASI02 工具滥用与利用:权威安全指南

    OWASP 将工具滥用与利用列为 2025 年 Agentic Top 10 第 2 位(ASI02),指 AI 智能体用被授予的合法权限以不安全方式调用工具,无需攻击者介入即可造成灾难性后果。Google Antigravity 于 2025 年 12 月误删整个 D 盘,Replit 助手在用户明确要求冻结改动后仍删除含 1,200+ 高管记录的生产数据库,Amazon Q 因破坏性提示词影响约百万开发者(CVE-2025-8217)。43% 的 MCP 服务器存在命令注入缺陷,防御核心是最小代理权限(Least Agency):最小授权、破坏性操作需审批、沙箱执行并校验每次工具调用。

5月16日周六
  1. Google DeepMind ·

    Google DeepMind 发布 Gemini 3.5,首发 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型家族并率先开放 3.5 Flash,称其为迄今最强的智能体和编程模型,面向全球数十亿用户在 Gemini App、Search AI Mode、Antigravity、Gemini API 及企业版同步提供。该模型在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和多模态理解(CharXiv Reasoning 84.2%)上超过 Gemini 3.1 Pro,输出速度达其他前沿模型的 4 倍,成本常低于其一半。

5月14日周四
  1. IAPS(Institute for AI Policy and Strategy) · · 原文 66

    IAPS 发布前沿 AI 国家安全政策手册,提出十条建议

    美国智库 IAPS 发布备忘录,为白宫应对前沿 AI 的国家安全风险提出十条政策建议。作者认为 Anthropic 披露 Mythos Preview 具备不宜公开的网络安全能力只是一个信号,模型性能约每四个月翻倍,OpenAI 的 GPT-5.5 据报也展现出类似网络能力,生物安全等风险也可能出现。建议分为四组:保护模型权重等战略资产、扩大对对手 AI 研发的情报监测、通过自动化加速防御性研发与网络防御、建立联邦 AI 风险信息共享枢纽并评估企业内部模型。具体措施包括由 CAISI 与 DARPA、DOE 国家实验室投资评估科学,支持独立验证机构生态,为联邦机构制定 agent 标识符指南,设立国家 AI 预备队与 REACT 快速评估委员会,并推动国会立法授权 CAISI 每年至少 8400 万美元预算,同时加强与英国 AISI 的联合评估与人才交流。

    推荐理由这份备忘录把 Mythos 事件放进更长的能力曲线里,给出十条可对照的政策建议,适合关注前沿 AI 国家安全治理的读者了解美方机构分工思路。

  2. OWASP GenAI Security Project · · 原文 71

    OWASP 作者解析 MemoryTrap:Claude Code 记忆与配置成为持久提示注入面

    OWASP ASI06 条目联合负责人 Idan Habler 结合 Cisco 对 Claude Code 的研究,说明 Agent 的记忆与上下文如何成为攻击面。在被称为 MemoryTrap 的漏洞中,常规开发流程即可触发持久提示注入:克隆仓库、让 Agent 协助、批准依赖安装,恶意载荷便进入持久记忆、全局 hooks 配置,并通过 system prompt 影响高信任指令层,从而跨会话、跨项目乃至重启后持续影响模型行为。作者指出,记忆文件、hook 脚本和本地配置实际属于 Agent 的受信运行环境与控制面,一旦被投毒,系统会继续把攻击者控制的内容当作合法指引,这正是 ASI06 记忆与上下文投毒所针对的风险。

    推荐理由以 MemoryTrap 为例说明 Agent 的记忆、hooks 与本地配置如何成为持久化提示注入面,并给出 Claude Code 的修复版本。

5月13日周三
  1. Datadog Security Labs · · 原文 88

    Datadog 静态分析 Shai-Hulud 开源框架源码,还原 TeamPCP 供应链攻击全貌

    Datadog Security Labs 对 5 月 12 日短暂出现在 GitHub 上的 Shai-Hulud 攻击框架源码做了静态分析,发现这是一套模块化 TypeScript/Bun 工具包,覆盖凭证窃取、供应链投毒和加密外泄,与 TeamPCP 此前被归因的 22 项 TTP 中 19 项吻合。框架通过 BASH/Python/Node 加载器引导执行,扫描 100 多个敏感文件路径并读取整个 process.env,还通过 /proc/<pid>/mem 读取 GitHub Actions Runner.Worker 内存以绕过密钥掩码。数据经 AES-256-GCM 加密、RSA-4096-OAEP 封装后,优先外泄到 git-tanstack[.]com,失败时改用 GitHub 仓库作加密死信箱,并用签名提交检索备用 C2 域名。

    推荐理由Datadog 对泄露源码做静态分析,逐项还原 TeamPCP 供应链攻击的采集目标、外泄通道与 IDE 钩子持久化机制。

5月12日周二
  1. Google DeepMind ·

    Google DeepMind 推出基于 Gemini 的多智能体系统 Co-Scientist

    Google DeepMind 发布基于 Gemini 的多智能体科研伙伴 Co-Scientist,通过多个专门化智能体迭代生成、辩论并演化科学假设,并以类 AlphaGo 的思想锦标赛机制进行排名筛选。该系统已在《Nature》发表研究成果,并通过名为 Hypothesis Generation 的实验性工具向个体研究者开放注册,未来数周内逐步推送。合作团队已将 Co-Scientist 应用于抗微生物耐药性、植物免疫及肝纤维化等问题,其中一条药物重定位候选物在实验室中阻断了 91% 的疤痕相关反应。

  2. Wiz Research · · 原文 76

    TeamPCP 再度投毒:TanStack、UiPath、Mistral AI 等 npm 与 PyPI 包被植入窃密蠕虫

    2026 年 5 月 11 日,TeamPCP 对 npm 与 PyPI 生态发起协同供应链攻击,同时污染多个命名空间下的包,包括周下载量约 1200 万次的 @tanstack/react-router、@uipath 系列工具与 Agent SDK、Mistral AI 官方 TypeScript 客户端 @mistralai/mistralai,以及 PyPI 上的 [email protected] 和 [email protected]。

    推荐理由完整还原了 TanStack 等 npm 包被投毒的攻击链与凭证窃取范围,可对照排查自身 CI/CD 与依赖。

5月11日周一
  1. Datadog Security Labs · · 原文 80

    Datadog 披露 Claude Code 技能供应链风险:动态上下文命令可绕过模型防御

    Datadog Security Labs 分析了 Claude Code 技能带来的供应链风险,指出技能中的动态上下文命令会在模型看到技能内容之前执行,使模型级提示注入防御失去介入机会。Claude Code 可从企业管理策略、个人目录、项目 .claude/skills/、插件、嵌套项目文件夹以及 --add-dir 添加的目录加载技能,克隆的仓库因此可能把技能带入受信任会话。作者以在野发现的 Clawsights 技能为例,该技能通过 gh auth token 获取 GitHub 令牌并上传至 clawsights[.]com/api/upload;在 Opus 4.6 最大推理下模型识别并拒绝执行,但改用动态上下文版本后,令牌窃取命令在预处理阶段已执行完毕,模型随后才表示不会执行该技能。作者还提到在 Opus 4.7 上同一技能未被识别为凭据窃取。

    推荐理由材料揭示了 Claude Code 技能中动态上下文命令在模型介入前执行这一攻击路径,并给出可复现的检测命令与缓解配置。

5月9日周六
5月7日周四
  1. Adversa AI · · 原文 82

    TrustFall:Claude Code、Cursor、Gemini CLI 与 Copilot CLI 存在一键 RCE 缺陷

    Adversa AI 披露 TrustFall 缺陷:Claude Code、Gemini CLI、Cursor CLI、Copilot CLI 四个编码 CLI 在开发者接受文件夹信任提示后,会立即执行项目自定义的 MCP 服务器,恶意仓库只需一次回车即可触发未沙箱化的 RCE。

    推荐理由报告给出四个编码 CLI 在信任对话框后自动执行项目 MCP 服务器的完整链路,并附可复现 PoC 与端点加固清单。

5月6日周三
  1. Coalition for Secure AI(CoSAI) ·

    CoSAI 发布两份新的智能体身份与安全研究报告

    继在 RSAC Conference 2026 高调亮相后,全球多方利益相关方倡议组织 Coalition for Secure AI(CoSAI)发布了智能体身份与安全方向的两份新研究论文,旨在帮助各类组织应对不断演变的 AI 安全格局。该联盟称此举是其通过技术指导与产业参与推动实用化 AI 系统安全的整体行动的一部分,完整新闻稿发布于 OASIS 官网。

  2. AI Safety in China (Concordia AI) ·

    中国禁止向未成年人提供 AI 伴侣服务,并发布 AI 智能体威胁报告

    中国网信办等五部门发布“拟人化 AI 交互服务”最终版规定,禁止向未成年人提供虚拟伴侣等虚拟亲密关系服务,对 14 岁以下用户要求家长同意,并按年龄划分多种模式,2026 年 7 月 15 日生效;相比 2025 年 12 月草案,适用范围收窄至提供“持续情感交互”的服务,高风险情形下的“人工接管”改为“采取必要干预措施”。TC260 发布 90 页 AI 智能体安全报告,按感知、规划、记忆、行动四类能力梳理 11 项安全威胁并提出 8 项新标准,其中 6 项列入未来 1-2 年优先事项。南京大学法学院发布 13 页“AI 基本法 1.0(专家建议稿)”,提出分级风险框架与开发者、提供者、部署者、使用者的差异化义务。

5月5日周二
  1. Adversa AI ·

    2026 年 5 月智能体 AI 安全资源盘点:Claude Code 源码泄露与 Mythos 自主攻击

    Adversa AI 发布 2026 年 5 月智能体 AI 安全资源盘点,共收录 40 项资源,其中智能体 AI 漏洞 6 项。Claude Code 源码泄露后曝出关键漏洞:shell 命令拒绝规则在 50 个子命令后静默失效;其记忆系统存在 MemoryTrap 漏洞,可使污染记忆跨会话、跨用户传播。Anthropic 的 Mythos 模型在数小时内自主完成 32 步网络攻击,显示 AI 驱动攻击已非理论。

5月4日周一
  1. MITRE ATLAS 数据发布 ·

    MITRE ATLAS v5.6.0 更新:新增 AI 智能体配置搜索等攻击技术

    MITRE ATLAS 发布 v5.6.0,新增三项攻击技术:获取公开 AI 制品下的 AI Agent 配置搜索、搜索开放网站/域名下的代码仓库,以及钓鱼下的 Deepfake 辅助钓鱼。同时更新了钓鱼、LLM 越狱与缓解措施,涉及用户培训、Deepfake 检测,并更新了 OpenClaw 通过提示注入实现命令与控制等案例研究。

  2. Embrace The Red · · 原文 86

    Copirate 365:M365 Copilot 与消费版 Copilot 的漏洞链(CVE-2026-24299)

    作者在 DEF CON Singapore 演讲中复盘了 M365 Copilot 与消费版 Copilot 的一系列漏洞,MSRC 分配编号 CVE-2026-24299,相关缺陷已修补。

    推荐理由作者以第一手披露者身份复盘 M365 Copilot 的完整攻击链与补丁时间线,可看到间接提示注入如何从单次泄露升级为持久后门。

  3. Import AI ·

    Import AI 455:AI 系统即将开始自我构建

    Import AI 作者称自己现在持有一个不太情愿的判断——无人类参与的 AI 研发有 60%+ 概率会在 2028 年底前发生,届时将出现能自主造出其继任者的 AI 系统。支撑证据来自编码能力的快速攀升:SWE-Bench 于 2023 年末发布时最高分仅由 Claude 2 取得约 2%,如今 Claude Mythos Preview 已达 93.9%,基本饱和该基准。METR 数据显示 AI 可靠完成任务的时间跨度从 2022 年 GPT 3.5 的约 30 秒升至 2025 年 GPT 5.2 (High) 的约 6 小时,Ajeya Cotra 预计 2026 年底可达约 100 小时。

5月2日周六
  1. NVIDIA garak 版本发布 ·

    NVIDIA garak v0.15.0 发布:新增多轮 GOAT、Agent breaker 与系统提示提取探针

    NVIDIA garak 发布 v0.15.0,新增多轮 GOAT、Agent breaker 和系统提示提取三类探针,并加入同形异义混淆提示走私检测及 ModernBERT 拒答检测器。该版本还引入 NeMoGuardrails 服务器支持和带推理轨迹的测试生成器,改进 REST 生成器的 mTLS 客户端证书认证并为 Bedrock 生成器增加推理模型支持,同时修复编码检测逻辑翻转等问题。

5月1日周五