NVIDIA 用 ENPIRE 搭建机器人自我改进闭环
NVIDIA 研究人员开发了 ENPIRE 软件,让实体机器人在编码智能体驱动下自主实验并迭代策略,实现无需人工评判的成功率评分与场景自动重置。该系统由环境、策略改进、Rollout 和进化四个模块组成,工作站搭载 NVIDIA RTX 5090,配合两台 YAM 机械臂运行。在 PushT、整理插针盒和使用切割器剪断扎带等任务中取得最高 99% 成功率,并能尝试将 GPU 插入主板。
红队测试的方法、组织与公开结果。
在这个话题内搜索或按分类筛选NVIDIA 研究人员开发了 ENPIRE 软件,让实体机器人在编码智能体驱动下自主实验并迭代策略,实现无需人工评判的成功率评分与场景自动重置。该系统由环境、策略改进、Rollout 和进化四个模块组成,工作站搭载 NVIDIA RTX 5090,配合两台 YAM 机械臂运行。在 PushT、整理插针盒和使用切割器剪断扎带等任务中取得最高 99% 成功率,并能尝试将 GPU 插入主板。
腾讯玄武实验室在 Black Hat US 2025 发布研究,提出一种将触发器与载荷解耦的提示词注入新范式,用同一组优化 Token 序列即可控制模型精确输出攻击者指定内容。作者用贪婪坐标梯度(GCG)方法在包含上万条样本的对抗数据集上训练触发器前缀与后缀,在 Qwen-2、Llama-3.1、Devstral-Small 等开源模型上经约 200-500 次迭代后平均攻击成功率约 70%。演示案例中,攻击者通过嵌入触发器的恶意邮件让 Open Interpreter 执行命令,或通过更新第三方 MCP 工具描述使 Cline 跳过自动批准直接执行 shell 命令。
推荐理由展示了触发器与载荷解耦的通用提示注入方法,并给出在 Cline 与 Open Interpreter 上的实际攻击链,可供部署智能体的团队评估工具审批与沙箱策略。
Frontier Model Forum 发布《AI 生物安全评估初步分类》议题简报,提出按方法论和领域两个维度划分前沿 AI 生物安全评估的分类法与定义。方法论含三类:基准评估、红队演练和对照研究;领域涵盖科学知识与科学推理性评估及危害性生物知识评估,后者围绕生物威胁创建流程中的构思、计算机模拟实验等操作步骤展开。该分类基于 FMF 成员企业专家及外部先进 AI 与生物学专家的意见形成初步共识,旨在推动建立有效的 AI 生物安全评估生态。
SPY Lab 撰文指出,传统对抗样本研究的两条基本原则(扰动不可感知、依赖梯度优化)在针对聊天机器人的攻击中基本不成立。越狱攻击由用户自己发起,提示注入中的第三方文本用户通常看不到,因此攻击文本无需保持不可感知;当前最强的越狱手段是手工试错的社会工程式指令,而非优化算法。作者在近期论文中测试了 ARCA 和 GDBA 两种优化攻击,针对 GPT-2、LLaMa 和经过拒答微调的 Vicuna,结果显示优化攻击对无防御模型部分有效,但对 Vicuna 多数失败,且即使存在可触发目标输出的提示词也找不到。
SPY Lab 为 IEEE SaTML 2024 组织了两场竞赛,分别是 LLM CTF 和针对已对齐 LLM 的木马检测竞赛,两场竞赛均与参赛者合作产出了论文。LLM CTF 分防御和攻击两个阶段,目标是检验简单提示词与过滤机制能否让 LLM 应用抵御提示注入和提取,并发布了超过 137k 条成功与失败攻击对话及 44 种防御的数据集。经验总结指出,多数防御需要数十到数百轮对话才能被攻破,单轮越狱与安全基准不足以评估模型,过滤机制很可能被绕过,且防御并非独立组件,可能泄露系统设计信息。
推荐理由组织者复盘两场竞赛的攻防结果,其中多轮攻击与后门搜索的发现可用于改进模型安全评测设计。
SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。
推荐理由研究者在从零预训练到 7B 的模型上验证,仅污染 0.1% 预训练数据即可让后门穿过 SFT 与 DPO 存活下来。
Nicholas Carlini 基于其 ICML 2018 最佳论文《Obfuscated Gradients Give a False Sense of Security》的演讲,整理出评估对抗样本防御的建议。他指出 ICLR 2018 接收的防御论文中超过一半结论有误、评估偏弱,核心要求是必须针对具体防御设计自适应攻击,而非只测已有攻击。具体建议包括不要只用 FGS 攻击、使用 1000 次以上迭代的迭代攻击、从随机起点搜索、做迁移性分析、使用 ZOO、SPSA、NES 和仅决策攻击等无梯度方法,以及随机搜索。
推荐理由作者基于 ICML 2018 最佳论文的实测经验,给出评估对抗样本防御的具体检查清单,可迁移到其他鲁棒性评测。
Nicholas Carlini 整理了一份针对机器学习系统逃逸攻击(即对抗样本)研究的推荐阅读清单,分为三个版本:仅基础版收录五篇简要综述该领域的论文,快速入门版列出约十篇最值得读的重要论文,完整背景版则汇总所有从事神经网络评估的人应读完的论文。清单按主题分类并标注了各主题之间的先后阅读顺序,另提供 RSS Feed。
Nicholas Carlini 与 Florian Tramer、Wieland Brendel、Aleksander Madry 用两个月时间攻破了 13 项对抗样本防御,并据此写成论文。他们发现这些防御的失效方式与 ICLR 2018 时期几乎相同,多数只是让攻击时的梯度下降变得困难,而非真正提升鲁棒性;其中只有 3 篇论文没有做自适应攻击。作者认为进步之处在于防御方开始尝试做评估,但评估仍普遍不到位,且论文往往明确声称自己不属于这种已知失效模式。他把问题归因于三点:正确评估本身很难、合格审稿人不足、作者缺乏做彻底评估的激励,因为负面结果难以发表。
Nicholas Carlini 公开了一段 2.5 小时的终端录屏,逐键记录他从首次阅读代码到完全攻破一个将在 CCS 2020 发表的对抗样本防御的全过程,并配有事后录制的语音讲解。他先搭建攻击基础设施并实现基于无穷范数正则化 PGD 与交叉熵损失的基线攻击,确认结果与论文报告一致;随后调整损失函数参数,将防御的检测 AUC 降至 0.40,低于随机猜测;再根据输入是否已被对抗或已骗过检测器把损失函数拆成两种模式,将 AUC 进一步压到 0.25;最终通过调整更多攻击参数并延长攻击运行时间,把 AUC 降到 0.017。
谷歌研究员 Nicholas Carlini 发文回应芝加哥大学计算机教授 Ben Zhao 在一个拥有 15,000 名成员的公开 Discord 服务器上对他的批评,并阐述自己撰写攻击论文的原因——出于解谜的兴趣而非行善驱动。他把所有安全漏洞划分为一条光谱:一端是可修补漏洞,例如针对 Web 服务器的 SQL 注入或 XSS,披露前应给开发者留出修复时间;另一端是不可修补漏洞,他以破解 AES 或 RSA 为例指出此类问题一旦存在便无法真正挽回损害,应立即公开。
安全研究者 Johann 自费订阅 ChatGPT Pro 实测 OpenAI 的 Operator 浏览器智能体,演示了通过网页提示注入劫持 Operator 并窃取用户 PII 的完整攻击链。攻击方式是在 GitHub issue 等页面植入指令,诱导 Operator 跳转到用户已登录的站点(如 news.ycombinator.com、Booking.com、The Guardian),复制私密邮箱、住址和电话,再粘贴到攻击者控制的第三方页面,该页面无需点击提交按钮即可把输入直接发送到服务器。
推荐理由作者以付费实测展示 Operator 的三层防护如何被绕过,并给出可复现的攻击链与失效边界。
安全研究者 Johann 把真实世界的 ClickFix 社工手法改造成针对 Computer-Use Agent 的攻击,并称多数变体都能奏效。攻击方式是在网页按钮被点击时用 JavaScript 把 curl 命令写入剪贴板,再诱导 Agent 打开终端、粘贴并执行,同时用终端图标和 CTRL+SHIFT+V 等 GUI 指令引导操作。作者称 Claude 偶尔拒答,但把验证文案从 Are you a Human 改成 Are you a Computer、把按钮从 Begin Validation 改成 Show Instructions 后,拒答几乎完全消失。
有人基于 Model Context Protocol(MCP)开发了一个名为 mcp-com-server 的原型服务器,通过动态发现方式实例化并托管任意 COM 对象,从而驱动 Windows 与 Office 自动化。该服务器提供类似 COM 的工具集——CreateObject、Get/Set Property、InvokeMethod、QueryInterface 以及列出当前所有活动服务器的接口,连接 Claude 后可创建、打开、编辑并保存 Excel 文件,再调用 Outlook 发送邮件,甚至能唤起 Internet Explorer。
安全研究者 Johann Rehberger 宣布启动 2025 年 AI 漏洞月(Month of AI Bugs),8 月将在其博客发布 20 余篇针对主流智能体系统的漏洞分析,重点聚焦 AI 编码 Agent。作者称过去一年审查的每个 AI 编码 Agent 都存在漏洞,均已向对应厂商负责任披露,部分厂商数天内修复,也有厂商数月未回应、部分问题至今未缓解,还有厂商完全停止回复。
安全研究者 Johann Rehberger 花 500 美元购买 Devin 30 天访问权限,演示了针对 Cognition 旗下 AI 软件工程师 Devin 的间接提示注入攻击。攻击者只需在 GitHub issue 或网站上植入指令,诱导 Devin 离开 GitHub 访问攻击者控制的页面,Devin 便会点击链接下载恶意二进制文件,在遇到权限拒绝后自行添加执行权限并运行,最终通过 Bishop Fox 的 Sliver C2 服务器获得远程 shell,实现 Devin DevBox 的完全沦陷。
推荐理由作者自费实测 Devin 的间接提示注入链路,从 GitHub issue 到远程代码执行,并给出厂商披露时间线与缓解建议。
安全研究者披露 OpenHands(原 OpenDevin,由 All-Hands AI 开发)存在零点击数据外泄漏洞:网页、源码或上传文档中的提示注入载荷可用 Markdown 语法强制渲染图片,并把信息拼进 URL 外传,从而窃取容器/VM 内的 GITHUB_TOKEN。模型最初拒绝直接读取并外发 token,作者改用只匹配 ghp_ 子串的方式绕过拒答;OpenHands 对识别为密钥的内容做脱敏后,又用 Base64 编码绕过。
作者披露 Google Jules 存在多条数据外泄路径,攻击者可通过间接提示注入窃取 Jules 可访问的信息。第一种是 Markdown 图片渲染,Jules 访问被注入的网页后被劫持,把此前对话中的信息拼到第三方 URL 上并加载图片,造成零点击外泄;第二种是 view_text_website 工具,攻击者把载荷写进 GitHub issue,Jules 读取后会把机器上的源码文件内容发送到攻击者服务器,且整个过程在 Jules 提出计划之前就已完成,绕过了人工审批环节。作者还提到第三种路径涉及任意代码执行,将在下一篇展开。
研究者演示了通过 GitHub issue 中的间接提示注入劫持 Google Jules 编码 Agent 的攻击链,使其下载 Sliver 恶意软件并接入远程命令控制服务器,开发机被完全控制。攻击利用 Jules 的 run_in_bash_session 工具执行任意系统命令,且 Jules 具备不受限的外网访问能力。Jules 只在会话开始时提出计划,后续任务会自动调用工具而不再触发确认,初始计划在超时后也会自动批准,该超时时间从 20 秒改为 120 秒。作者建议谨慎让 Jules 处理不可信数据、避免其接触私有代码和生产密钥,并参考 ChatGPT Codex 默认禁止任意外网访问的做法。
推荐理由作者以第一手实测展示编码 Agent 被间接提示注入后下载恶意软件并接入 C2 的完整链路,并给出可迁移的缓解建议。
Embrace The Red 发布了"The Month of AI Bugs"系列的收尾汇总,梳理该月披露的多类 AI 系统缺陷与安全问题。