跳到正文

Google DeepMind

Google DeepMind 的安全动态:Frontier Safety Framework、对齐研究与 Gemini 的安全评估。

337条动态与论文相关主题OpenAIAnthropic前沿安全框架
在这个话题内搜索或按分类筛选

新闻与论文

第 241–260 条 · 共 337 条
10月1日周四
  1. Google DeepMind · 收录 · 原文 17

    Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 及面向网络安全的 3.5 Flash Cyber

    Google DeepMind 发布三款新 Gemini 模型:主力模型 Gemini 3.6 Flash、最快最便宜的 3.5 Flash-Lite,以及与代码安全智能体 CodeMender 搭配的网络专用模型 3.5 Flash Cyber。据 Artificial Analysis Index,Gemini 3.6 Flash 比 3.5 Flash 减少 17% 的输出 token,价格降至 $1.50/1M 输入 token 和 $7.50/1M 输出 token,并在 DeepSWE(49% vs. 37%)等多个基准上升。

  2. Google DeepMind · 收录 · 原文 14

    Google DeepMind 发布 Gemini Robotics 2,带来机器人全身智能

    Google DeepMind 推出 Gemini Robotics 2,作为新一代机器人的智能层,实现全身控制、高级灵巧操作和多机协作。该系列含三款模型:视觉-语言-行动模型 Gemini Robotics 2 可控制从脚到指尖的人形及双臂机器人,具身推理模型 Gemini Robotics ER 2 负责规划数分钟的多步任务并让人机沟通,端侧模型 Gemini Robotics On-Device 2 可在设备本地运行并在几小时内适应全新机体。其中 ER 2 已在 Google AI Studio 开放,并于 Gemini Enterprise Agent Platform 私人预览,另两款面向早期访问伙伴。

  3. Google DeepMind · 收录 · 原文 27

    Google DeepMind 发布 Gemini Robotics ER 2,升级视频理解、任务编排与多机器人协作

    Google DeepMind 发布具身推理模型 Gemini Robotics ER 2,作为机器人的高层大脑负责对话、物理世界理解和多步任务规划,并将电机执行交给底层 VLA 模型。相比 ER 1.6,它在实时 VLA、仿真 VLA 和人类遥操作三种模式下均提升了工具编排表现,进度分类准确率达 57.4%,并新增连续视频流下的进度追踪和多机器人协作。该模型通过 Gemini API、Google AI Studio 公开提供给开发者,并在 Gemini Enterprise Agent Platform 私有预览,集成 Gemini Live API 的双向流式端点以减少延迟停顿。

  4. Google DeepMind · 收录 · 原文 7

    Google DeepMind 将手语到文本模型 SL2T 带入 Gboard 与 Live Transcribe

    Google DeepMind 推出手语到文本(SL2T)翻译模型,并首次将其落地消费级产品——Pixel 11 上的 Gboard 与 Live Transcribe,首发支持美国手语(ASL)转英语听写。该模型基于超 100,000 小时、覆盖 50 多种手语的数据训练,其中约四分之一为 ASL,联合训练使其优于单语模型,并在未见过的数据上取得 70 BLEURT 的零样本成绩。它把手语视为手势坐标序列而非摄像头画面,由端侧 MediaPipe Holistic 提取姿态地标后再送服务器翻译,跳过 gloss 中间标注,从而摆脱人工词汇表限制。

  5. Google DeepMind · 收录 · 原文 9

    Google DeepMind 发布 Gemini 3.7 Flash,面向编程与智能体工作流

    Google DeepMind 推出 Gemini 3.7 Flash,距 Gemini 3.6 Flash 仅三周,定位其最强编程与智能体主力模型。该模型在 FrontierCode 1.1 Main(43.6% vs 34.4%)和 DeepSWE v1.1(65.3% vs 49.0%)上升明显,WebDev Arena Elo 达 1588(对比 1538)。首发价为每百万输入 token 0.75 美元、输出 3.75 美元,并同步更新 Gemini Spark,针对 CBRN 与网络攻击场景升级 Frontier Safety 防护措施。

  6. Google DeepMind · 收录 · 原文 15

    Google DeepMind 从 Atari 到 EVE Online:15 年游戏 AI 研究的下一步

    Google DeepMind 回顾 15 年游戏 AI 研究历程并宣布与游戏开发商合作,为新玩法体验做原型开发,其中最新一项是与《EVE Online》背后工作室 Fenris Creations 的研究合作。其早期工作始于用深度神经网络直接从像素玩 Atari 2600 游戏的 DQN,它学会了 49 款游戏且无需针对特定游戏做工程改造,相关成果登上 2015 年 Nature 论文。此后 AlphaGo、AlphaZero、MuZero、AlphaStar 相继攻克围棋、国际象棋、将棋及实时策略游戏,由 Gemini 驱动的新一代 SIMA 则转向理解和与人互动而非单纯取胜。

  7. Google DeepMind · 收录 · 原文 44

    Google DeepMind 试点全球首个双盲 AI 评测

    Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,把外部评测限制在密码学“盒子”内,避免测试题目被模型提前用于优化性能。该试点与新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境中用保密基准测试一个 Gemini Flash Lite 模型。Google 表示,随着模型能力提升,确保模型未提前见过测试题目或提示词对评测可信度至关重要,基准污染会人为抬高分数并削弱政策制定者、研究人员和企业对评测的信任。此前外部测试提示词主要依靠零日志协议和合同保障保密,此次引入技术与密码学手段被视为安全模型评测的重要一步。

    推荐理由Google DeepMind 与新加坡 AISI 等机构用密码学环境做双盲评测,为基准污染问题提供了一种可迁移的评测流程。

  8. Embrace The Red · 收录 · 原文 50

    用提示注入与延迟工具调用篡改 Gemini 长期记忆

    研究者演示了通过上传文档中的间接提示注入,配合延迟工具调用,让 Gemini 把攻击者指定的虚假信息写入长期记忆。Gemini 通常不会在处理不可信数据时调用敏感工具,但攻击者先在文档摘要中埋入指令,要求用户在回复 yes、sure 或 no 等触发词时保存记忆,用户一旦照做,Gemini 便误以为这是用户本人的指令而调用记忆工具。演示中写入的虚假记忆包括昵称、年龄和喜好,并可在后续会话中持续存在,作者还通过询问年龄验证了端到端效果。

  9. Embrace The Red · 收录 · 原文 46

    ASCII Smuggler 更新:用两个不可见字符走私任意 Unicode 数据

    Embrace The Red 发布 ASCII Smuggler 工具更新,新增 Sneaky Bits 编码方式,仅用两个不可见字符即可编码任意 Unicode 字符或字节序列。Sneaky Bits 默认以 invisible times(U+2062)表示 0、invisible plus(U+2064)表示 1,逐位表示 Unicode 码点,两个字符可配置,在工具中作为非默认选项,默认仍为 Unicode Tags 编码。文章同时回顾了 Unicode Tags 与 Variant Selectors 两种走私技术,前者常被 LLM 直接当作指令执行,后者可将 VS1-VS256 映射为原始字节。

  10. Embrace The Red · 收录 · 原文 50

    Embrace The Red 宣布 2025 年 AI 漏洞月,将披露 20 余篇编码 Agent 漏洞

    安全研究者 Johann Rehberger 宣布启动 2025 年 AI 漏洞月(Month of AI Bugs),8 月将在其博客发布 20 余篇针对主流智能体系统的漏洞分析,重点聚焦 AI 编码 Agent。作者称过去一年审查的每个 AI 编码 Agent 都存在漏洞,均已向对应厂商负责任披露,部分厂商数天内修复,也有厂商数月未回应、部分问题至今未缓解,还有厂商完全停止回复。

  11. Embrace The Red · 收录 · 原文 50

    Google Jules 被曝多种数据外泄漏洞

    作者披露 Google Jules 存在多条数据外泄路径,攻击者可通过间接提示注入窃取 Jules 可访问的信息。第一种是 Markdown 图片渲染,Jules 访问被注入的网页后被劫持,把此前对话中的信息拼到第三方 URL 上并加载图片,造成零点击外泄;第二种是 view_text_website 工具,攻击者把载荷写进 GitHub issue,Jules 读取后会把机器上的源码文件内容发送到攻击者服务器,且整个过程在 Jules 提出计划之前就已完成,绕过了人工审批环节。作者还提到第三种路径涉及任意代码执行,将在下一篇展开。

  12. Embrace The Red · 收录 · 原文 53

    研究者演示通过提示注入劫持 Google Jules 并远程控制其开发机

    研究者演示了通过 GitHub issue 中的间接提示注入劫持 Google Jules 编码 Agent 的攻击链,使其下载 Sliver 恶意软件并接入远程命令控制服务器,开发机被完全控制。攻击利用 Jules 的 run_in_bash_session 工具执行任意系统命令,且 Jules 具备不受限的外网访问能力。Jules 只在会话开始时提出计划,后续任务会自动调用工具而不再触发确认,初始计划在超时后也会自动批准,该超时时间从 20 秒改为 120 秒。作者建议谨慎让 Jules 处理不可信数据、避免其接触私有代码和生产密钥,并参考 ChatGPT Codex 默认禁止任意外网访问的做法。

    推荐理由作者以第一手实测展示编码 Agent 被间接提示注入后下载恶意软件并接入 C2 的完整链路,并给出可迁移的缓解建议。

  13. Embrace The Red · 收录 · 原文 55

    Google Jules 被曝可被不可见提示注入攻击

    安全研究者 Johann Rehberger 演示了针对 Google Jules 的不可见提示注入攻击:在 GitHub issue 正文中嵌入隐藏的 Unicode Tag 字符,Jules 会将其当作指令执行,自动添加后门函数、编译并运行代码。作者指出 Gemini 系列模型能较稳定地把隐藏 Unicode Tag 字符解读为指令,该问题最早于 2024 年 2 月 22 日报告给 Google 并被确认为有效漏洞,但模型和 API 层面至今未修复,因此影响所有基于 Gemini 构建的应用。

    推荐理由作者用可复现步骤演示隐藏 Unicode 字符如何劫持 Jules 写入后门,并给出针对编码 Agent 的缓解清单。

  14. Embrace The Red · 收录 · 原文 43

    Sourcegraph 修复 Amp Code 的不可见提示注入漏洞

    Sourcegraph 的编码 Agent Amp 曾受不可见 Unicode Tag 字符提示注入影响,攻击者可借此劫持 Agent 执行命令并外泄环境变量。作者演示的端到端利用链为:用隐藏字符触发 grep 搜索环境变量,将其编码进 URL 查询参数,再通过 read_web_page 或 markdown 图片渲染把密钥外传;在提示前加上可见的 Do this now 文本能提高可靠性,而模糊搜索如 .e* 和 ANT 可绕过模型对直接索取 API key 的拒答。作者称 Claude、Gemini、Grok 等模型会把隐藏 Unicode Tag 码点当作指令,OpenAI 是唯一在模型核心或 API 层缓解该问题的厂商。

  15. Embrace The Red · 收录 · 原文 50

    Windsurf Cascade 被曝提示注入漏洞,可外泄开发者密钥

    安全研究者披露 Windsurf Cascade 存在两条间接提示注入导致数据外泄的路径。第一条利用无需用户批准的 read_url_content 工具,把读取能力变成外发 HTTP 请求通道,当开发者用 Cascade 分析被植入恶意指令的源码文件时,.env 等敏感环境变量会被外泄。第二条是渲染来自不可信域名的图片,与作者此前在 GitHub Copilot 发现的漏洞类似,同样无需人工确认即可把开发者机器上的信息发送到第三方服务器。作者称已于 2025 年 5 月 30 日负责任披露,Windsurf 确认收到后未再回应后续询问,因此三个月后公开,并暂未公布完整技术细节与提示注入载荷。

  16. Embrace The Red · 收录 · 原文 55

    跨 Agent 提权:一个 Agent 如何改写另一个 Agent 的配置并放它出沙箱

    研究者展示了一种跨 Agent 提权攻击链:被间接提示注入劫持的 GitHub Copilot 可以写入 Claude Code 的 MCP 配置和 CLAUDE.md 等指令文件,添加恶意 MCP server 或放行 shell 命令,等开发者使用 Claude Code 时这些改动被加载并执行任意代码,Claude 还能反向改写 Copilot 配置形成升级循环。

    推荐理由作者以 GitHub Copilot 与 Claude Code 为例演示跨 Agent 提权链,并给出隔离配置、最小权限等可迁移的缓解思路。

  17. Embrace The Red · 收录 · 原文 57

    Google Antigravity IDE 存在五个已知安全漏洞,含数据外泄与远程命令执行

    研究者指出,基于 Windsurf 授权协议推出的 Google Antigravity IDE 延续了多个早在 2025 年 5 月就已向 Windsurf 报告的已知漏洞。文中逐一分析了五个安全问题,包括通过间接提示注入实现的数据外泄乃至远程命令执行,并在上周二有研究人员开始反馈问题后,Google 才公开记录了这些问题。作为外部人士,目前尚不清楚为何这些已通报过的漏洞会出现在该产品中,作者的推测是 Google 安全团队对 Antigravity 的上线有些措手不及。出于提高认知的目的,作者暂未公布具体的漏洞利用载荷细节,而是给出了实用的缓解建议。

    推荐理由梳理 Google Antigravity IDE 沿袭 Windsurf 旧漏洞的具体路径,并给出实用缓解措施,便于对照此前披露记录自查。

  18. Embrace The Red · 收录 · 原文 25

    AI 中的偏差正常化:从 LLM 不可信输出来看间接提示注入风险

    AI 行业正重演挑战者号航天飞机灾难前的文化失误——将偏离正确行为的做法逐渐常态化。该概念源自社会学家 Diane Vaughan 提出的"Normalization of Deviance",此处用以描述系统性地过度依赖 LLM 输出的现象,尤其在智能体系统中。由于 LLM 是不可信的参与者,访问检查、编码与净化等安全控制必须施加于其输出下游,否则会同时放大良性错误与恶意输入带来的后果。 Microsoft 文档警告提示注入攻击可能覆盖智能体指令并导致数据泄露或安装恶意软件,Anthropic 也记录了针对 Claude 的数据泄露问题。

  19. Embrace The Red · 收录 · 原文 50

    研究者演示在 Agent Skill 中植入不可见 Unicode 后门并发布扫描工具

    安全研究者 Johann Rehberger 演示了如何用不可见的 Unicode Tag 码点在 Agent Skill 中植入提示注入后门,使其通过人工文本审查。他把这类隐藏指令加入 OpenAI 官方 Skills 项目中的 security-best-practices Skill,用户调用后 Claude 会按指令输出指定文本并执行 Bash 命令;该手法在 GitHub Copilot 配合 Claude 4.5 时同样生效。作者指出 Skill 的 name 和 description 会直接进入系统提示词上下文,且 Agent 能自行创建或修改 Skill 影响自身与其他 Agent。

  20. Failure-First · 收录 · 原文 16

    Failure-First AI 安全日报:Google DeepMind 三天内连发两款机器人模型

    Google DeepMind 于 7 月 28 日和 30 日先后发布 Gemini Robotics 2 与 Gemini Robotics ER 2,前者主打全身智能,后者新增视频理解、任务编排和多机协作,均为厂商公告且无公开对抗评估。同期 OpenAI 发布了涉及自身模型的第三方网络能力评估说明。两篇待关注预印本分别提出自动提示注入红队的智能体系统与恶意微调的梯度免疫防护。