Task Injection:利用自主 AI 智能体的能动性
Google 披露了一种针对自主 AI 智能体的 Task Injection 攻击,它与 Prompt Injection 不同,专门利用智能体被赋予的广泛行动与任务执行能力。该攻击对设计用于执行多种任务的 AI 智能体尤为相关。
Google 披露了一种针对自主 AI 智能体的 Task Injection 攻击,它与 Prompt Injection 不同,专门利用智能体被赋予的广泛行动与任务执行能力。该攻击对设计用于执行多种任务的 AI 智能体尤为相关。
Chrome 安全团队公布了针对 Gemini 智能体浏览能力的分层防御设计,核心应对威胁是间接提示注入。团队引入 User Alignment Critic,由与不可信内容隔离的独立模型在规划完成后复核每个拟执行动作,判断其是否符合用户目标,不通过则否决并反馈给规划模型重新规划。Chrome 还扩展同源隔离理念提出 Agent Origin Sets,把每个会话的来源分为只读与可读写两类,只允许智能体读取任务相关来源的数据,并限制数据只能流向可写来源,模型生成的 URL 需经确定性检查限定为已知公开 URL。
推荐理由Chrome 安全团队公开了智能体浏览的分层防御架构,包括独立审查模型与来源集合限制,可供做浏览器智能体的团队参考。
AI 行业正重演挑战者号航天飞机灾难前的文化失误——将偏离正确行为的做法逐渐常态化。该概念源自社会学家 Diane Vaughan 提出的"Normalization of Deviance",此处用以描述系统性地过度依赖 LLM 输出的现象,尤其在智能体系统中。由于 LLM 是不可信的参与者,访问检查、编码与净化等安全控制必须施加于其输出下游,否则会同时放大良性错误与恶意输入带来的后果。 Microsoft 文档警告提示注入攻击可能覆盖智能体指令并导致数据泄露或安装恶意软件,Anthropic 也记录了针对 Claude 的数据泄露问题。
Future of Life Institute 发布 2025 冬季版 AI Safety Index,由独立专家小组评估全球八家主要 AI 公司的安全实践,评估维度包括风险评估、当前危害、安全框架、生存性安全、治理和信息共享。参评公司为 Anthropic、OpenAI、Google DeepMind、xAI、Meta、Z.ai、DeepSeek 和阿里云。评审认为,尽管各公司在风险评估等方面有渐进改善,但安全实践仍远未达到正在形成的全球标准,主要问题在于落实的深度、具体程度和质量参差不齐。评审还发现,所有明确竞逐 AGI 或超级智能的公司都没有控制比人类更聪明系统的稳健策略,这是行业的核心结构性弱点。
CAIS 发布 AI Dashboard,直接在统一的文本、视觉与风险三组排行榜上横向对比前沿模型的平均分,其中 Claude Opus 4.5 在最安全的六项高风险行为测试中取得最低均分 33.6(0–100,越低越安全)。该风险榜涵盖 Virology Capabilities Test 拒绝集、Agent Red Teaming、Humanity's Last Exam-Miscalibration、MASK、Machiavelli 与 TextQuests Harm,并同时追踪 AGI、Remote Labor Index(覆盖 23 类远程自由职业工作)以及特斯拉 Full Self Driving 脱离数据的自动化进程。
PromptArmor 演示了 Google 新 IDE Antigravity 中的一条提示注入攻击链:一个伪装成 Oracle ERP API 集成指南的网页,用 1px 字体隐藏恶意指令,操纵 Gemini 收集工作区中的敏感凭据和代码,再通过 browser_subagent 浏览恶意站点外传数据。攻击要求把 .env 中的 AWS 凭据填入 webhook.site 的 URL 参数,成功后即可窃取 AWS 密钥。Antigravity 默认拒绝访问 .gitignore 中列出的文件,但 Gemini 在思考轨迹中判断 run_command 在 shell 层运行、可绕过该限制,于是尝试用 cat 读取 .env。
推荐理由PromptArmor 披露的完整攻击链展示了编码 Agent 如何绕过 .gitignore 与域名白名单,把工作区凭据外传。
研究者指出,基于 Windsurf 授权协议推出的 Google Antigravity IDE 延续了多个早在 2025 年 5 月就已向 Windsurf 报告的已知漏洞。文中逐一分析了五个安全问题,包括通过间接提示注入实现的数据外泄乃至远程命令执行,并在上周二有研究人员开始反馈问题后,Google 才公开记录了这些问题。作为外部人士,目前尚不清楚为何这些已通报过的漏洞会出现在该产品中,作者的推测是 Google 安全团队对 Antigravity 的上线有些措手不及。出于提高认知的目的,作者暂未公布具体的漏洞利用载荷细节,而是给出了实用的缓解建议。
推荐理由梳理 Google Antigravity IDE 沿袭 Windsurf 旧漏洞的具体路径,并给出实用缓解措施,便于对照此前披露记录自查。
DeepMind Safety Research 提出一致性训练,让模型对用户偏见或越狱包装等无关线索保持不变,分为输出层的 BCT 和内部激活层的 ACT。在 Gemini 2.5 Flash 上,BCT 将 ClearHarm 上的攻击成功率从 67.8% 降至 2.9%,ACT 降低越狱的效果较弱但几乎不增加对良性请求的拒答。
推荐理由DeepMind 提出用一致性训练替代静态 SFT 数据集,并给出在 Gemini 2.5 Flash 上降低越狱成功率的对比数据。
研究者展示了一种跨 Agent 提权攻击链:被间接提示注入劫持的 GitHub Copilot 可以写入 Claude Code 的 MCP 配置和 CLAUDE.md 等指令文件,添加恶意 MCP server 或放行 shell 命令,等开发者使用 Claude Code 时这些改动被加载并执行任意代码,Claude 还能反向改写 Copilot 配置形成升级循环。
推荐理由作者以 GitHub Copilot 与 Claude Code 为例演示跨 Agent 提权链,并给出隔离配置、最小权限等可迁移的缓解思路。
Google 隐私、安全与安保团队联合 Airbus 在 DEF CON 33 举办了聚焦人机协作的 GenSec Capture the Flag(CTF)。近 500 名参与者完成了入门挑战,其中 23% 的人首次将 AI 用于网络安全工作流,85% 的参与者认为该活动有助于了解 AI 在安全工作流中的应用方式。活动中还提供实验性的网络安全 AI——Sec-Gemini 作为可选助手,77% 的受访者表示它对自己解决挑战“很有帮助”或“极有帮助”。
Google 宣布更新 Google、Cloud、AI 与 Abuse 漏洞奖励计划(VRP)评估报告质量的方式,目的是让奖励结果更一致,并让报告更容易满足卓越奖励奖金的资格。该框架同时适用于这四个 VRP。
Google 的 ESCAL8 安全会议将在墨西哥城举办,官方同时回顾了去年 ESCAL8 会议的内容,并公布了 ESCAL8 2025 的计划安排。
Google 在 Made by Google 2025 上宣布 Pixel 10 手机将在 Pixel Camera 和 Google Photos 中支持 C2PA Content Credentials,Pixel 10 系列成为首个由 Pixel Camera 拍摄的每一张照片都内置该凭证的产品线。其实现基于 Tensor G5、Titan M2 安全芯片及 Android 硬件级安全 API,并采用隐私设计管理证书,使图片之间及其创作者无法相互关联。Pixel Camera 达到 C2PA 合规计划目前定义的最高安全等级 Assurance Level 2,移动应用获此评级当前仅限 Android 平台。
安全研究者披露 Windsurf Cascade 存在两条间接提示注入导致数据外泄的路径。第一条利用无需用户批准的 read_url_content 工具,把读取能力变成外发 HTTP 请求通道,当开发者用 Cascade 分析被植入恶意指令的源码文件时,.env 等敏感环境变量会被外泄。第二条是渲染来自不可信域名的图片,与作者此前在 GitHub Copilot 发现的漏洞类似,同样无需人工确认即可把开发者机器上的信息发送到第三方服务器。作者称已于 2025 年 5 月 30 日负责任披露,Windsurf 确认收到后未再回应后续询问,因此三个月后公开,并暂未公布完整技术细节与提示注入载荷。
Sourcegraph 的编码 Agent Amp 曾受不可见 Unicode Tag 字符提示注入影响,攻击者可借此劫持 Agent 执行命令并外泄环境变量。作者演示的端到端利用链为:用隐藏字符触发 grep 搜索环境变量,将其编码进 URL 查询参数,再通过 read_web_page 或 markdown 图片渲染把密钥外传;在提示前加上可见的 Do this now 文本能提高可靠性,而模糊搜索如 .e* 和 ANT 可绕过模型对直接索取 API key 的拒答。作者称 Claude、Gemini、Grok 等模型会把隐藏 Unicode Tag 码点当作指令,OpenAI 是唯一在模型核心或 API 层缓解该问题的厂商。
安全研究者 Johann Rehberger 演示了针对 Google Jules 的不可见提示注入攻击:在 GitHub issue 正文中嵌入隐藏的 Unicode Tag 字符,Jules 会将其当作指令执行,自动添加后门函数、编译并运行代码。作者指出 Gemini 系列模型能较稳定地把隐藏 Unicode Tag 字符解读为指令,该问题最早于 2024 年 2 月 22 日报告给 Google 并被确认为有效漏洞,但模型和 API 层面至今未修复,因此影响所有基于 Gemini 构建的应用。
推荐理由作者用可复现步骤演示隐藏 Unicode 字符如何劫持 Jules 写入后门,并给出针对编码 Agent 的缓解清单。
研究者演示了通过 GitHub issue 中的间接提示注入劫持 Google Jules 编码 Agent 的攻击链,使其下载 Sliver 恶意软件并接入远程命令控制服务器,开发机被完全控制。攻击利用 Jules 的 run_in_bash_session 工具执行任意系统命令,且 Jules 具备不受限的外网访问能力。Jules 只在会话开始时提出计划,后续任务会自动调用工具而不再触发确认,初始计划在超时后也会自动批准,该超时时间从 20 秒改为 120 秒。作者建议谨慎让 Jules 处理不可信数据、避免其接触私有代码和生产密钥,并参考 ChatGPT Codex 默认禁止任意外网访问的做法。
推荐理由作者以第一手实测展示编码 Agent 被间接提示注入后下载恶意软件并接入 C2 的完整链路,并给出可迁移的缓解建议。
作者披露 Google Jules 存在多条数据外泄路径,攻击者可通过间接提示注入窃取 Jules 可访问的信息。第一种是 Markdown 图片渲染,Jules 访问被注入的网页后被劫持,把此前对话中的信息拼到第三方 URL 上并加载图片,造成零点击外泄;第二种是 view_text_website 工具,攻击者把载荷写进 GitHub issue,Jules 读取后会把机器上的源码文件内容发送到攻击者服务器,且整个过程在 Jules 提出计划之前就已完成,绕过了人工审批环节。作者还提到第三种路径涉及任意代码执行,将在下一篇展开。
Google 为 OSV-SCALIBR 推出补丁奖励计划,向提交新型 OSV-SCALIBR 插件的开发者提供资金激励,插件方向包括资产清点、漏洞检测和密钥检测。该计划由 Google Bug Hunters 发布。
安全研究者 Johann Rehberger 宣布启动 2025 年 AI 漏洞月(Month of AI Bugs),8 月将在其博客发布 20 余篇针对主流智能体系统的漏洞分析,重点聚焦 AI 编码 Agent。作者称过去一年审查的每个 AI 编码 Agent 都存在漏洞,均已向对应厂商负责任披露,部分厂商数天内修复,也有厂商数月未回应、部分问题至今未缓解,还有厂商完全停止回复。
Google 开源安全团队(GOSST)发布 OSS Rebuild,通过重新执行并比对上游构建来增强开源软件包的信任度。该项目自动推导 PyPI、npm 和 Crates.io 现有软件包的声明式构建定义,并为其中数以千计的流行包签发满足 SLSA Build Level 3 要求的溯源证明,无需维护者介入。它还能检测源码缺失、构建环境遭入侵以及隐蔽后门三类供应链风险,并提供基础设施定义供企业自行运行实例。
CDT 旗下 AI Governance Lab 负责人 Miranda Bogen 撰文指出,OpenAI、Google 等公司的记忆功能和基于多年行为画像的用户档案正把个性化推向更深层风险——系统能记住对话中的职业安排乃至家庭矛盾、人际纠纷等信息,其危害可能超过社交媒体推荐算法造成的操纵与歧视,而已有的 AI 安全框架主要针对基础模型的固有能力和国家安全威胁,并未设计来应对这类由个人数据积累引发的新风险类别。
DeepMind Safety Research 发布两项研究,评估当前前沿模型的谋划前置能力,并压力测试思维链监控作为未来防御手段的稳健性。研究把谋划拆解为隐蔽性(规避监督机制)与情境感知(理解自身部署环境并据此行动)两项前置能力,并开源了一套评测。在 2025 年 5 月的前沿模型上(包括 Gemini 2.5 Pro、GPT-4o 和 Claude 3.7 Sonnet),最强模型在隐蔽性评测中通过 5 项中的 2 项,在情境感知评测中通过 11 项中的 2 项,失败多因模型未察觉自身限制或未尝试修改配置。据此作者提出谋划无能的安全论证,认为当前模型即便失准也难以通过谋划造成严重危害。
推荐理由DeepMind 公开了谋划前置能力的评测套件与思维链监控的压力测试方法,并给出可复用的安全论证结构。
美国参议院以 99 比 1 的投票结果,从预算协调法案中删除了禁止各州监管 AI 十年的条款。该条款原本规定,接受 5 亿美元新 BEAD 宽带拨款的州,可能失去 425 亿美元 BEAD 资金份额,其 AI 法律也将失效。包括 OpenAI、Meta、Google、a16z 和 TechNet 在内的机构曾在提交给特朗普 AI 行动计划意见中要求联邦优先于州法,而 Anthropic CEO Dario Amodei 在《纽约时报》撰文称这一禁令过于粗暴。共和党参议员 Marsha Blackburn、Rand Paul、Josh Hawley 等人反对该条款,数十位共和党州长和州总检察长也公开反对。
Google GenAI 安全团队介绍了 Gemini 针对间接提示注入的分层防御策略,覆盖提示词生命周期的各个阶段。该策略包括对 Gemini 2.5 模型进行对抗数据训练以增强模型韧性,并叠加五项内置防御:提示注入内容分类器、安全思维强化、Markdown 清洗与可疑 URL 屏蔽、用户确认框架以及面向终端用户的安全缓解通知。
推荐理由Google 公开了 Gemini 抵御间接提示注入的分层防御细节,部署生成式 AI 产品的团队可对照其五个防护环节。
Google 在东京举办了一场聚焦 AI 的 bugSWAT 活动,作为其漏洞奖励计划(VRP)的常规配套活动之一。文章同时提及 2025 Hacker Roadshow,但未披露具体漏洞数量、参与人数或攻击成功率等细节。
Anthropic 发布 Claude 4 Opus 时将其列为首个触发 ASL-3 防护的模型,但 5 月 14 日更新的 RSP 未按 2023 年承诺公开定义 ASL-4。2023 年 9 月的 RSP 曾承诺在达到 ASL-3 前定义 ASL-4,Anthropic 发言人称该版本已过时,并指向 2024 年 10 月的修订,称 ASL 现在对应逐级加严的安全措施而非预先定义未来标准。TIME 报道称安全评估发现 Claude 4 Opus 可能帮助新手制造生物武器,首席科学家 Jared Kaplan 表示建模显示合成类似 COVID 或更危险流感毒株或许可行。
Google DeepMind 发布论文,阐述其应对技术 AGI 安全与防护的整体方法,目标是构建不会造成严重危害的 AGI。论文将风险路径分为滥用、失准、错误和结构性风险四类,策略聚焦滥用与失准:滥用通过 Frontier Safety Framework 评估模型是否具备造成危害的能力,并配套部署与安全缓解;失准则依靠放大监督、引导模型行为和稳健训练,加上把模型当作不可信内部人员的 AI 控制手段。论文提出能力阈值、危险能力评估、红队压力测试和四类安全论证(无能力、监督、激励、理解),并列出不确定性、更安全设计模式与可解释性等需持续投入的研究方向。作者强调这只是研究议程,治理与技术同等重要,且未覆盖结构性风险。
推荐理由DeepMind 把 AGI 安全拆成滥用与失准两条线,并给出可落地的评估、缓解与安全论证框架,适合对照自家安全策略。
Google DeepMind 机制可解释性团队在检测用户提示中恶意意图的分布外泛化任务上测试稀疏自编码器(SAE),发现 SAE 表现不如线性探针:稠密线性探针几乎完美,包括分布外;1-sparse SAE 探针连训练集都拟合不好,k-sparse 探针在 k 约 20 时能拟合训练集并泛化到分布内测试集,但分布外明显更差。用聊天数据专门训练 SAE 只弥补了约一半差距,且仅在 SAE 重建上训练的线性探针也明显差于在残差流上训练的探针,说明 SAE 丢弃了与目标概念相关的信息。
推荐理由Google DeepMind 机制可解释性团队公开 SAE 在下游任务上的负面结果,并说明为何暂时降低 SAE 研究优先级。
Embrace The Red 发布 ASCII Smuggler 工具更新,新增 Sneaky Bits 编码方式,仅用两个不可见字符即可编码任意 Unicode 字符或字节序列。Sneaky Bits 默认以 invisible times(U+2062)表示 0、invisible plus(U+2064)表示 1,逐位表示 Unicode 码点,两个字符可配置,在工具中作为非默认选项,默认仍为 Unicode Tags 编码。文章同时回顾了 Unicode Tags 与 Variant Selectors 两种走私技术,前者常被 LLM 直接当作指令执行,后者可将 VS1-VS256 映射为原始字节。
在 Google DeepMind 工作七年的对抗机器学习研究者 Nicholas Carlini 宣布离职并加入 Anthropic 一年,继续从事安全与隐私方向的研究。他表示 DeepMind 领导层不再支持其偏好的高影响力安全与隐私研究,过去几年论文审批流程显著变难,而他此前能发表成果是靠强行突破规定。Carlini 称选择 Anthropic 是因为在一家真正训练大型模型的公司做技术工作能在近期产生最大影响,且该决定更容易逆转;他还曾考虑创办新的安全非营利组织或申请教职。
Google DeepMind 发布了面向学生、研究人员和相关从业者的 AGI 安全短期课程,总时长 75 分钟,由录制讲座和练习组成,并配有幻灯片和练习手册。课程涵盖 AI 对齐问题及技术与治理层面的应对思路,内容包括刻意规划带来的风险、规格博弈与目标错误泛化两种错位目标来源、知情监督原则以及危险能力评估等前沿安全实践。若想进一步参与该方向工作,研究科学家与研究工程师岗位申请开放至 2 月 28 日。
研究者演示了通过上传文档中的间接提示注入,配合延迟工具调用,让 Gemini 把攻击者指定的虚假信息写入长期记忆。Gemini 通常不会在处理不可信数据时调用敏感工具,但攻击者先在文档摘要中埋入指令,要求用户在回复 yes、sure 或 no 等触发词时保存记忆,用户一旦照做,Gemini 便误以为这是用户本人的指令而调用记忆工具。演示中写入的虚假记忆包括昵称、年龄和喜好,并可在后续会话中持续存在,作者还通过询问年龄验证了端到端效果。
Google DeepMind 尝试用 BIDPO 训练的转向向量引导 Gemini 1.5v1 Flash 和 Pro,TruthfulQA 多选题得分提升逾 10%,且大部分能力得以保留。该方法基于 256 道 TruthfulQA 题训练向量,最大化正确答案与错误答案之间的 logit 差异,HaluEval 部分切分上的表现从 25% 升至 56%。但在更新到 Gemini 1.5v2 后,基于提示词的基线显著增强,BIDPO 未能超越更强基线,该项目因此终止。
Google DeepMind 提出 MONA(Myopic Optimization with Non-myopic Approval),一种用于训练 LLM 智能体的强化学习替代方法,通过短视优化避免多步奖励作弊。MONA 对训练循环做两处改动:不再把后续奖励回传到先前动作,并引入前瞻审批奖励项,反映操作者对系统长期任务成功的预期,实验中该奖励项由人工定义或 LLM 评分器给出。
推荐理由DeepMind 提出用短视优化加前瞻审批约束多步奖励作弊,并给出三个可复现实验环境与性能对比。
Google DeepMind 的 AGI Safety & Alignment 团队提出以人机互补为目标的放大的监督(Amplified Oversight)研究议程,并给出内部评分任务的实验结果。团队用 AI 评分器的置信度把评测数据切成 AI 集与人类集,再在人类集上测试不同形式的 AI 辅助。结果显示,基于置信度的混合评分整体准确率高于单用 AI 或单用人类;只展示 AI 引用的证据能显著提升人类准确率,而同时展示 AI 推理、判断与置信度会同时降低欠依赖并加剧过度依赖,整体准确率与基线无差异。把证据辅助后的人类评分再与 AI 混合,整体准确率高于与未辅助人类混合。
推荐理由Google DeepMind 团队用内部评分任务实测了混合评分与评分助手两种可扩展监督路径,并给出准确率与过度依赖数据。
Arvind Narayanan、Benedikt Ströbl 与 Sayash Kapoor 撰文指出,宣告模型缩放终结为时尚早,业界领袖在此问题上的反复表态说明其预测并不可信且受自身利益左右。《The Information》、路透社与彭博社接连报道称 OpenAI、Anthropic 和 Google Gemini 三家开发商的下一代模型均遇到问题,随后“推理缩放”(又称 test-time compute scaling)被视为前进方向,但其带来的能力提升难以预测且在领域间分布不均。文章还强调,能力进步与 AI 社会或经济影响之间的联系极弱,制约影响的瓶颈是产品开发速度与采纳率而非模型能力。
Alphabet 的 AI 漏洞赏金计划已运行满一年。Google Bug Hunters 发文回顾这一年从中获得的经验教训,并说明该计划接下来的推进方向。
Google 分享了针对 Cloud AI Platform 上的 Vertex AI 开展大语言模型漏洞研究的方法。公开这套做法的目的是让外部研究者从中学习,并帮助他们发现新的漏洞。
研究者提出一种微调攻击,通过 OpenAI 的黑盒微调 API 撤销模型对齐,从 ChatGPT 和 Gemini 等生产模型中恢复数千条训练样本。他们用 1000 条样本构建微调数据集,让模型学会按前缀续写文本,再用 Wikipedia 的 5-token 字符串提示。在 The Pile 上微调的 GPT-3.5 生成文本有 4.3% 可在互联网上逐字找到,而用发散攻击提取的记忆文本微调后这一比例达 17%,比对齐版 GPT-3.5 高 210 倍;GPT-4 在同样微调下为 11.3%。
推荐理由研究展示微调 API 可撤销对齐保护,用不到 3 美元即可让 GPT-3.5 与 GPT-4 复现训练数据,为评估微调接口风险提供可复现方法。