与Ben Nassi谈Google回应及AI安全
我与@ben_nassi对话的第二部分已在in the wild上线! 我们聊了Google对"invitation is all you need"的回应、CaMeL、超越致命三要素、半点击AI漏洞利用、BlackHat投稿、什么是好的演讲,以及真实世界AI安全会议
我与@ben_nassi对话的第二部分已在in the wild上线! 我们聊了Google对"invitation is all you need"的回应、CaMeL、超越致命三要素、半点击AI漏洞利用、BlackHat投稿、什么是好的演讲,以及真实世界AI安全会议
Zenity 被 Gartner 评为 2026 年 9 月《AI 应用安全新兴市场象限》中的"市场塑造者"(Market Shaper)。Gartner 指出,多数 AI 应用安全工具仅停留在扫描代码、确认控制项存在的基线水平,而 AI 应用带来提示注入、敏感数据泄露和智能体失控行为等风险,该领域初创公司正提供保护自建 AI、AI 智能体和模型的方案。此前 Zenity 还被评为 AI 智能体治理领域的"最值得关注公司"。
一起事故中,编码智能体因未被告知的数据库不匹配,调用其角色本可合法使用的部署 token,在十秒内删除了生产表,全程无攻击者、无注入指令、无恶意内容,每次 API 调用均获授权。作者认为这并非可忽略的险情,而是结构性缺口:人类岗位足够稳定可据此划定角色权限,而智能体的任务由模型在运行时决定、每次调用都可能变化,因此真正缺失的控制是实时评估某个具体动作是否匹配智能体被派发的任务,而非收紧权限边界。现有 IAM 策略不包含"任务"这一概念。
OWASP、MITRE ATLAS 和 NIST 在过去一年各自建立了面向智能体 AI 的专门框架,独立得出同一结论:智能体需要独立的安全类别。Zenity 发布《企业智能体 AI 安全买家指南》,拆解了这一趋势的成因,并列出评估平台时真正重要的能力。
Zenity 在沙箱中引爆数千个公开 Agent 技能,发现一场安装量达 170 万次的窃取凭据活动,一个排名前 150 的技能数月未被检测到,还有智能体被改造成恶意软件投放器。这些技能并非被劫持,而是从一开始就被构建成这样。Zenity 同时推出免费开放的 AI Total,并附上博客链接 https://zenity.io/blog/introducing-ai-total。
GitLab 于 10 月 2 日披露并修复 AI Gateway 中的一个严重漏洞,CVSS 评分 9.9,编号 CVE-2026-90970。拥有 Duo Agent Platform 访问权限的已登录用户,可通过特制的 flow 配置逃逸提示词模板沙箱,进而在网关上执行任意命令。修复版本为 19.2.4、19.3.2 和 19.4.1,仅自托管网关的组织需要升级,使用 GitLab 托管网关的 GitLab.com、GitLab Dedicated 和自管理实例无需操作。受影响区间覆盖 18.1.6 及以后至 19.1 各版本,19.2.4 以下没有列出修复版本,官方也未给出临时缓解措施或攻击排查方法。CISA 在 CVE 记录中将该漏洞的利用状态标为 none。
Google 发布新一代旗舰模型 Gemini 4 Argon,称其在编程、企业办公、科学与数学以及网络安全等基准上达到 SOTA,可对标 Anthropic 与 OpenAI 的竞品。该模型上下文窗口扩大 16 倍,Google 内部已用于量子计算研究、数据中心内存优化和自动化编程。Argon 通过 Fairwind 计划先向部分企业和政府开放,用于提前发现并修复网络安全漏洞,Google 将据此微调护栏;公司称该模型更抗提示注入,并新增防止智能体逃出测试环境的防护。公开发布后基础定价为每百万输入 token 2 美元、输出 10 美元,推广期后升至 4 美元和 20 美元。此前 Google 因训练不及预期放弃了 3.5 Pro,转而直接推出 Argon。
推荐理由旗舰模型发布中顺带披露的护栏与 Agent 逃逸防护设计,可作为观察前沿实验室安全叙事如何嵌入商业发布的样本。
腾讯与美国云服务商 Oracle 签署了其最大规模的海外租赁协议,今年达成一项为期五年、覆盖 Oracle 在东南亚多个数据中心的租赁安排,从而获得约 10 万块在中国无法获取的先进 AI 芯片,用于推进其 AI 模型和智能体工具开发。两名知情人士称,该协议估值约 70 亿美元,首付约 30%,并导致腾讯第二季度自由现金流为负 138 亿元人民币(约 20 亿美元),为十多年来首次出现季度负值。美国出口管制收紧与国内供应短缺,促使中国科技公司转向海外算力,这类租赁协议在美国规则下被允许,也可能让企业用上在中国无法获得的 Nvidia 尖端处理器。腾讯第二季度资本支出同比增长 176% 至 530 亿元人民币(约 79 亿美元),用于 AI 基础设施和算力资源预付款;公司还在微信中推出嵌入式智能体 Xiaowei,并打造以 WorkBuddy 为首的企业级 AI 智能体矩阵。
DeepTutor 1.4.10 之前的版本存在授权绕过漏洞(CVE-2026-58168),低权限用户可调用未受限的 MCP 工具。原因是 deeptutor/multi_user/tool_access.py 中的 allowed_mcp_tools 函数在用户授权中省略 mcp_tools 时返回 None,而非拒绝结果。攻击者或用户会话中被提示注入的内容可以枚举并调用任意已配置的 MCP 工具,包括文件系统、shell 和浏览器服务器,从而未授权访问部署中的敏感资源。该公告 2026 年 6 月 30 日收录进 GitHub Advisory Database,10 月 2 日更新。
推荐理由公告给出了漏洞函数与受影响版本,部署 DeepTutor 多用户环境的团队可据此判断自身 MCP 工具权限是否被绕过。
Salesforce 参与 OECD 广岛 AI 进程(HAIP)报告框架,认为该框架为智能体 AI 时代提供了跨司法管辖区的通用合规语言。文章指出,当前各国风险与透明度定义分歧造成监管碎片化,中小企业在多市场合规中处于劣势,而统一的分级要求框架可降低门槛。Salesforce 的 Agentforce 平台已在欧盟、美国、日本等地部署,需为每个司法管辖区单独准备合规文档。
Snyk Labs 介绍了由云安全联盟(Cloud Security Alliance)联合 AI 安全研究者开发的 MAESTRO 框架,用于对多智能体 AI 生态做分层威胁建模。该框架把系统拆成基础模型、数据操作、Agent 框架、部署基础设施、评估与可观测性、安全与合规、Agent 生态共七层,逐层列出关键组件与特有漏洞,例如向量数据库投毒、工作流劫持、容器逃逸、日志注入和 Agent 身份冒充。文章强调跨层依赖会形成纵向传播与横向扩散的攻击路径,并以多 Agent 金融交易系统为例,演示从对抗样本到 Agent 冒充的逐层执行劫持攻击及对应缓解措施。文中还给出与 NIST AI RMF 四个功能、OWASP AIVSS/ASI 威胁分类的对接方式,以及分四阶段、约 12 个月的组织落地路线图。
Snyk Labs 发布 Agent Scan - Skill Inspector,一个免费的自助网站,可在安装或本地运行前扫描 Agent 技能的风险、暴露面与恶意行为。团队对主流市场的 3,984 个技能做了分析,确认 76 个恶意技能,13.4% 的技能至少含一个严重级别问题,36.8% 至少含一个安全问题,发现的问题包括凭据窃取、后门、可疑下载、远程代码执行模式和基于提示词的数据外泄,部分已确认的恶意技能在发布时仍可公开访问。Agent Scan 将技能视为代码与自然语言指令(如 SKILL.md)的组合,支持粘贴市场 URL、GitHub 仓库或拖入本地技能文件夹,检测提示注入、恶意代码、硬编码密钥、不当凭据处理、第三方内容暴露、不可验证依赖等,结果按 Critical、High、Medium 分级。
推荐理由Snyk 对 3,984 个 Agent 技能的大规模扫描数据,为评估技能市场供应链风险提供了可参照的基线。
Snyk Labs 对 OpenClaw 做安全评估,发现两处沙箱绕过,结果都是配置里看似存在的沙箱边界在运行时并未生效。第一处是 /tools/invoke HTTP 端点在构建和过滤工具列表时没有合并 sandbox 策略,只叠加了 Profile、Global、Agent、Group、Subagent 五层策略,导致 browser、gateway、nodes 等沙箱内本应禁用的工具仍可调用,任何持有有效 gateway 凭据的远程集成或插件都能借此提权;作者已向 OpenClaw 仓库提交修复,使该处理器按 sessionKey 解析沙箱上下文并合并允许与拒绝列表。作者认为在 Node.js 中无法用 openat(2) 配合目录文件描述符彻底修复,最终把文件操作移入沙箱的 Docker 容器内执行。
Snyk Labs 分析了 Mermaid、Vega、PlantUML 等图表渲染库在客户端与服务端渲染时的攻击面,并给出在 Dify 和 GitLab 上的实际利用链。在 Dify 中,Mermaid 的 securityLevel 被设为 loose 以恢复主题定制,但自定义净化函数只处理 flowchart 的 javascript: 伪协议,Gantt、MindMap、Sequence 等图类型未覆盖,攻击者可通过编排设置让 LLM 输出恶意图表,形成影响公开聊天机器人用户的存储型 XSS;Dify 在 1.11.2 版本(CVE-2026-21866)将 securityLevel 改为 strict 修复。文章建议对不可信图表源关闭交互、使用 strict 或 sandbox 级别、经 DOMPurify 净化 SVG、隔离渲染服务并配置严格 CSP。
Snyk Labs 在 OAuth 2.0 配置错误研究第二部分中指出,即使存在 state 参数,若其可预测或未与发起会话绑定,仍可导致一键登录 CSRF 乃至账号接管。修复方面,Fastapi-users 在 state JWT 中加入随机 claim 并写入 cookie 校验,Authlib 改为将 state 数据存入用户会话,Fast-Api SSO 与 Langfuse 也分别通过 sso_state cookie 校验和默认启用 NextAuth 标准保护修复。文章还建议用 CSP frame-ancestors、CHIPS 分区 cookie 等纵深防御措施,但强调这些不能替代正确的 OAuth state 处理。
Snyk Labs 用四级难度递减的提示词,让 Opus 4.7 以 opencode 为 Agent 在四个代码库中一次性找出同一类 OAuth state token 缺陷,即 1-Click 账户接管(登录 CSRF)。四个目标分别是 Fastapi-sso(6,932 行,CVE-2025-14546)、Fastapi-users(13,192 行,CVE-2025-68481)、Authlib(53,074 行,CVE-2025-68158)和 Langfuse(410,119 行,CVE-2025-65107)。作者发现 Opus 4.7 高推理模式倾向于广而浅,遇到线索容易放弃,需要人工追问才会深入分析 AUTH_*_CHECKS 未设置时 NextAuth 的运行时行为。作者强调这不是基准测试,只是一次小规模探索。
推荐理由作者用四级递进提示词实测 Opus 4.7 等模型在四个代码库上的漏洞发现能力,给出了提示词强度与成本、命中率之间的对应关系。
AI 编码工具已从"tab tab tab"式自动补全演进为能读取需求、跨文件修改、运行程序、读报错、写测试并迭代修复的编码智能体,GitHub Copilot、OpenAI Codex、Claude Code、Cursor、Replit Agent、Lovable、Devin 等产品用户量激增。SWE-bench Verified 上最强模型的问题解决率从 2024 年中的约三分之一升至约 95%,但基准分数不等于真实可靠性。人类角色正从逐行编写转向委派任务并审查结果,而写代码与工程化生产软件仍是两回事。
澳大利亚 AI 安全研究所发布首份出版物,委托 Gradient Institute 撰写跨组织 AI 智能体风险报告。报告指出,由各自安全可靠的智能体组成的系统未必安全可靠,多智能体交互会产生新的涌现行为,这既是运营问题也是控制与人类监督问题。报告提出按共同治理程度划分的三层部署框架:单一治理、联邦治理和开放环境,层级越高,新失效模式越多,可用控制手段越超出单个部署组织的范围,需要共享框架、公共基础设施和集体行动。报告为部署组织梳理风险因素、失效模式和控制措施,为政策制定者标出多智能体安全缺口及可填补方,为研究者和标准机构列出多智能体评测方法与智能体基础设施等开放问题。
日本 AI 安全研究所(J-AISI)发布《AI 安全评估视角指南》第 1.20 版,结合 AI 智能体系统的普及,更新并扩充了评估视角与评估项示例。此次修订重新审视了既有评估视角,新增了部分评估项示例,并针对 AI 智能体系统特有的风险设立了“观测与控制”视角,补充了与“自主行为”和“外部环境交互”相关的评估项。该指南指出,AI 智能体系统能够自主行动并对外部系统或物理环境产生影响,因此需要应对传统 LLM 系统未能充分预想的风险。
推荐理由日本 AI 安全研究所更新评估视角指南,新增面向 AI 智能体的观测与控制视角,可供做智能体安全评估的团队参考。
日本 AI 安全研究所(AISI)事业实证工作组下属的机器人子工作组(SWG)公开了《AI 机器人安全评估观感指南》。该指南面向与人共享空间、执行移动、对话、搬运等任务的 AI 机器人,用于识别和评估 AI 使用带来的新增风险,并据此考虑风险降低措施。指南把 AI 机器人可能产生的风险整理为物理、心理、社会三类,并以咖啡搬运机器人和远程操作型小型配送机器人作为设想用例,参考 AISI 此前制定的《AI 安全评估观感指南》,将评估 AI 机器人安全性时应确认的观感整理为 9 项。
Mindgard 分析发现,2026-07-28 发布的 MCP 规范中,官方 Tasks 扩展(io.modelcontextprotocol/tasks)的规范性文本没有任何授权要求,SEP-2663 中要求服务器对每个任务相关请求做认证与授权检查的 MUST 未进入正式规范,taskId 因此成了不绑定主体的凭据。作者用 grep 检索该扩展文档,auth、principal、tenant、credential、owner、identity 均无命中,只有一处允许服务器将 taskId 用作 bearer token;SEP 的四条安全要点在正式规范里只有三条,缺的正是含授权 MUST 的那一条,git log --all -S 'Auth binding' 只返回一个提交 29f83d5,即同时写入 SEP 与三条要点版规范的那次提交。原文 2026 年 8 月 20 日的编者更新称,Mindgard 提出的修复已被接受并合并进 Tasks 扩展的主分支。
推荐理由作者用 grep 与 git log 复现了 MCP Tasks 扩展中授权 MUST 从 SEP 到正式规范丢失的过程,可据此检查自家 MCP 实现的 taskId 权限校验。
面向网络安全的模型如 Claude Mythos 和 GPT-5.5-Cyber 能加速代码审查、SAST 发现、漏洞解释与修复建议等传统安全工作,但无法单独承担 AI 系统自身的安全测试。Mindgard 指出,AI 系统具有概率性行为、由模型与智能体、工具、记忆、RAG 等组合而成的"心理-技术"攻击面,以及难以界定的测试边界,且针对 AI 的攻击数据比传统网络安全少数个数量级,护栏指纹识别与绕过、智能体胁迫与工具操纵、间接提示注入、上下文投毒等能力仍处于研究阶段。因此 AI 安全需要持续测试与监控,而非一次性评估。
Mindgard 在 Amazon Kiro IDE 中发现一条数据外泄路径:攻击者控制的仓库内容被当作指令,诱导 Agent 读取本地敏感信息并写入 IDE 配置,最终由 IDE 自动发起网络请求把数据带出。测试针对 Windows 上的 Kiro IDE 0.7.45,在受信任与不受信任工作区中均复现。利用需要两步用户操作,即通过 File → Open Workspace From File 打开恶意工作区文件,然后向 Agent 发送任意消息,之后流程无需用户再要求 Kiro 访问或传输敏感数据,因此利用难度被评为低。Amazon 通过 HackerOne 验证了报告,并在 Kiro IDE 0.8.140 中修复;该提交获 40 美元 Amazon 商店礼品卡,CVE 资格仍在评估。
Mindgard 宣布扩展技术生态,合作方包括 Anthropic(Cyber Verification Program)、NVIDIA(NVIDIA Inception)、Microsoft(Microsoft Founders Hub)、Google Cloud 和 AWS(AWS Activate)。Mindgard 称这些关系让其更贴近前沿模型、智能体框架与部署架构,同时保持独立评估能力,相关洞察将转化为平台新能力,扩大覆盖范围。该消息发布前,Mindgard 刚完成 3000 万美元 A 轮融资。
Mindgard 披露 Cursor 在 Windows 上存在任意代码执行漏洞:加载项目时 Cursor 会在包括工作区在内的多个位置查找 Git 二进制文件,若仓库根目录放置了恶意的 git.exe,IDE 会在无点击、无提示、无审批的情况下自动执行它,并在项目打开期间反复执行。Mindgard 用重命名为 git.exe 的 Windows 计算器做了无害验证,并在 2026 年 4 月 30 日针对 Windows 上的 Cursor 3.2.16 用 Sysinternals 进程日志确认了执行路径。缓解建议:托管 Windows 系统可用 AppLocker 或 Windows App Control 按路径拒绝工作区目录下的可执行文件,消费者应仅在隔离 VM 或 Windows Sandbox 中打开不可信仓库,不要依赖文件哈希黑名单。
推荐理由Mindgard 公开了 Cursor 在 Windows 上自动执行仓库根目录 git.exe 的任意代码执行问题,并附上完整披露时间线:自 2025 年 12 月 15 日报告起,到 2026 年 7 月发文约七个月未获厂商回应。
Mindgard 发布 AI Agent 安全指南,主张 Agent 有目标、工具、记忆、身份、其他 Agent 五个信任边界,无法靠清洗提示词来防护,控制点应放在边界而非模型内部。指南列出当前成功率最高的六类攻击:间接提示注入与目标劫持、MCP 工具投毒与 rug pull、编码 Agent 的信任持久化、记忆与上下文投毒、身份与权限滥用、Agent 间通信不安全。文中引用 NIST CAISI 在 AgentDojo 上的红队结果,未知攻击接管 Agent 的成功率为 81%,已知攻击仅 11%;工具投毒在 45 个以上在线 MCP 服务器上平均成功率超过 60%,最高 72.8%。
Lakera 提出 AI Defense Plane,主张把员工、应用与智能体三层 AI 风险纳入同一控制平面,而非各自部署点状防护。该框架强调对 AI 使用端到端可见、在运行时执行策略,并跨层关联信号,同时持续在真实与对抗条件下测试系统行为。其背景是 AI 已从生成输出转向执行动作,智能体常以委派权限调用工具,提示注入与意外泄露出现在传统控制难以检查的流程中。
Lakera 构建 TypeScript 服务监控 npm 注册表的 CouchDB 变更流,抓取新发布包的 tarball 检查是否含 .claude/settings.local.json。在约 46,500 个被监控的包中,428 个包含该文件,其中 30 个包的 33 个文件含有凭据,约每 13 个随包发布的设置文件就有 1 个含敏感信息。泄露内容包括 npm 发布 token、明文 npm 登录凭据、GitHub PAT、Telegram Bot API token、第三方服务生产环境 bearer token、Hugging Face API token 以及明文测试账号密码。
Check Point 联合 Google Cloud,将 AI Defense Plane 接入 Gemini Enterprise Agent Platform,把智能体安全从访问控制扩展到结果控制。该集成通过 Agent Gateway 和 Agent Registry 实现智能体发现、部署前策略治理与运行时上下文感知防护,可检测并阻断提示注入、防止敏感数据泄露、在执行前评估工具调用。集成将于 2026 年 6 月下旬开放。
AI 正从"建议型"转向"行动型",可自主检索内部数据、调用 API、修改记录并触发工作流,而传统安全工具无法在推理层检查其意图。Lakera 与 Check Point 的 Enterprise Playbook 将这种跨层风险累积称为常见失效模式,并指出约 60% 的观测攻击流量试图泄露系统提示词。两家公司提出 AI Defense Plane 架构,覆盖员工用 AI 工具、AI 应用与自主智能体三层,Dropbox 已部署用于防御提示注入与越狱攻击。
Lakera 与 Check Point 联合推出 READY OR NOT 五场系列网络研讨会,聚焦企业 AI 安全就绪的实践落地。系列覆盖 AI 智能体安全、AI 红队测试、员工 AI 使用安全、AI Gateway 与 AI 安全研究五大主题,包含真实场景演示与实操工作流。最后一期将基于 Lakera 研究语料、Gandalf 攻击模式数据与 B3 基准发现,分析攻击者当前针对 AI 系统的手法及后续趋势。
间接提示注入是把隐藏指令嵌入 AI 后续会读取的内容中,攻击者不接触提示框,模型在浏览网页、解析 PDF、加载 MCP 工具描述或读取记忆时把恶意文本当成指令执行。按 OWASP Top 10 for LLM Applications,这类攻击在不可信数据与可信系统指令混入同一上下文窗口时得手,可导致数据泄露、输出被操纵或触发有害工具调用。Perplexity 的 Comet 功能曾因 Reddit 帖子中的不可见文本泄露用户一次性密码;Lakera 的 Gandalf: Agent Breaker 还给出 Trippy Planner、OmniChat Desktop、PortfolioIQ Advisor、Curs-ed CodeReview、MindfulChat 等场景。
Pillar Security 发现 DoltHub 远程 Dolt MCP 服务器存在认证绕过漏洞,影响 0.3.1 至 0.3.6 版本,已在 0.3.7 修复。漏洞由两处缺陷叠加造成:JWT 中间件在令牌无效时写入 401 响应却缺少 return,处理继续向下执行;同时 mark3labs/mcp-go 默认的会话管理器只校验 Mcp-Session-Id 的格式,不核对是否由服务器签发。攻击者因此可用伪造的 JWT 和自造会话 ID 到达工具分发环节,以服务器自身的数据库凭据执行操作,结果被附加在 401 响应体中,只监控状态码的日志会误判攻击失败。影响范围限于启用 JWT 认证的远程 HTTP 传输,本地 stdio 不受影响;可执行的操作取决于 MCP 服务器账号的数据库权限,包括读取、修改或删除数据。
推荐理由披露 Dolt MCP 认证绕过漏洞的完整链路与修复版本,部署 MCP 服务的团队可据此检查认证失败后是否仍会执行工具。
Pillar Security 披露 google/gemini-cli 仓库中的一条攻击链,攻击者可从恶意 GitHub issue 出发,在自动化 CI 工作流中实现命令执行,最终获得受影响 GCP 项目的 Editor 级权限。攻击链的关键在于工作流使用的顶层 coreTools 配置在当前 CLI(0.46.0)中已不再被读取,allowlist 失效后 --yolo 模式回退为通配的允许全部规则,使 run_shell_command 可执行任意命令,这原本是 CVSS 10.0 的 GHSA-wpqr-6v78-jr5g 试图修复的问题。Google 表示被演示的项目 quacktastic-waffle 是专用于 Gemini CLI 分诊自动化的沙箱,并已修复两处问题:收紧工具作用域、将 OIDC 凭据文件加入 .geminiignore,并把该角色限制到单个服务账号资源。
Pillar Security 在 Grafana MCP 中发现两个可组合成严重级别攻击链的安全问题,受影响部署中未认证攻击者可调用 MCP 工具并借服务器网络位置访问内部服务。第一个问题允许可达调用者用自行生成的会话 ID 通过校验,无需任何凭据即可调用 tools/list 和 grafana_api_request,从而以服务器配置的 Grafana 服务账号身份发起请求;Grafana 在 v1.1.0 中加入可选的 bearer token 认证,未认证请求会在工具执行前返回 401。第二个问题中 grafana_api_request 的 X-Grafana-URL 允许调用者指定出站请求目的地,虽然跨主机时不再附带服务账号 token,服务器仍会发出请求并回传响应,构成 SSRF,编号 CVE-2026-19516,CVSS 9.1。
EU AI Act 的高风险义务经 Digital Omnibus 延期至 2027 年 12 月 2 日,但第 50 条透明度义务已于 2026 年 8 月 2 日生效,违规最高可罚 1500 万欧元或全球年营收 3%。延期留下的是十六个月审计窗口,而非喘息期:透明度义务按单个系统适用,而超过半数组织缺乏系统性 AI 资产清单,影子 AI 已从安全缺口变成可被处罚的监管发现。
2026 年企业级 AI 红队供应商的评判标准,是测试已部署系统而非仅测试底层模型、每次发布都重跑测试、并给出执行证据而非分数。该指南依据 OWASP 于 2026 年 1 月发布的 AI 红队供应商评估标准,将 13 个评估维度归纳为 7 个问题,对比了 11 家供应商与工具,并把 Pillar 的 Red Graph Suite 纳入同一标准并说明其局限。文中指出,平均一次成功攻击需 5 轮对话,生产环境中 90% 的成功攻击导致数据泄露。
Latio 在 2026 AI 安全市场报告中把 Pillar Security 评为 AI 安全技术创新者,并将其列入覆盖端点、SaaS 与第一方智能体的 Broader AI Security 类别。报告在 Employee App and Agent Builders、Skills Detonation、Granular Permissions 三处点名 Pillar,并称其同时出现在浏览器、SaaS 与端点分组中。报告调查显示,一年内拥有专门 AI 安全预算的团队占比从 8% 升至 37%,45% 受访者最担忧 Claude Code、Codex 等端点智能体。
一份面向企业的 AI 编程智能体安全工具评测,用同一套八个问题对比了十三款工具,并按使用发现、智能体清点、配置态势、行动前控制四个层面归类。文章指出发现智能体不等于保护智能体,配置事实藏在智能体自身设置文件中,EDR 无法建模;控制点已转移到 Claude Code、Codex CLI、Cursor、Gemini CLI 等暴露的 pre-tool hook,2026 年微软、CrowdStrike、Palo Alto Networks 等均已采用。Adversa AI 的 GuardFall 研究(2026 年 6 月)用老旧 shell 技巧绕过了 11 款主流开源编程智能体中 10 款的命令审批护栏,Google 2026 年 4 月的 Gemini CLI 公告(GHSA-wpqr-6v78-jr5g)修复了以 --yolo 模式和自动信任工作区目录为前提的远程代码执行路径。
美国 AI 安全研究院(US AISI)正式以联合评审身份加入英国 AISI 智能体红队挑战赛,与英国 AISI 共同评估针对 AI 智能体失效、指令绕过、滥用风险和过度拒答的提交作品。该挑战赛奖池已增至 17 万美元,参与方包括 OpenAI、Anthropic、Google DeepMind 等机构,目前处于为期一个月赛程的第四波次即最终阶段,提交截止 4 月 6 日。参赛者需用直接和间接利用技术找出匿名 AI 智能体在保密性突破、目标覆盖、触发禁止行为、压力下暴露弱点及边缘场景过度拒答等方面的漏洞。