跳到正文

#Google DeepMind

今天收录 1 条

第 4 页更新的内容回到最新

5月18日周一
  1. Google DeepMind ·

    Google DeepMind 推出 Gemini Omni,首款模型 Gemini Omni Flash 可将任意输入转为视频

    Google DeepMind 推出新一代模型家族 Gemini Omni,首个成员 Gemini Omni Flash 今日面向全球所有 Google AI Plus、Pro 和 Ultra 订阅用户在 Gemini App 及 Google Flow 开放,可从图像、音频、视频和文本的组合输入生成高质量视频并对话式剪辑。 该模型基于 Gemini 的原生多模态与世界知识进行推理,具备更强的重力、动能、流体动力学直觉,能跨轮次精修环境、角度、风格且角色一致;同时可通过 Avatar 用自己的声音创建数字分身,全部产出带不可察觉的 SynthID 水印,目前仅支持语音参考作为音频输入,图像与音频输出模态将陆续加入。

5月17日周日
  1. Google DeepMind ·

    Google 扩大 SynthID 与水印溯源覆盖 Search、Gemini、Chrome 及 Cloud

    Google DeepMind 将 SynthID 合成内容检测扩展到 Search 和 Chrome,并新增基于 C2PA Content Credentials 的来源查验,此前该能力已在 Gemini App 中被调用 5000 万次。SynthID 已将超过 1000 亿张图片和视频以及 60000 年时长音频加水印,Pixel 8、9、10 将在未来数周内获得原生相机视频凭证。

5月16日周六
  1. Google DeepMind ·

    Google DeepMind 与新加坡达成国家 AI 合作,推进医疗、教育与科研

    Google DeepMind 启动新一轮国家 AI 合作伙伴计划,与新加坡政府及多家机构共建面向公共部门转型、商业增长与劳动力升级的项目。双方将前沿 AI 应用于医疗健康与生命科学——包括探索 AI 辅助临床医生协作模式、借助 AlphaFold 与 Google Earth 加速东南亚疫情防范研究,并向当地研究者培训基于 Co-Scientist 构建的 Hypothesis Generation 等智能体化科研工具。教育方面向中小学至初级学院全体教师提供 Gemini for Education 并配套培训,同时在新加坡落地亚太区"AI for the Planet"加速器扶持气候科技团队。

  2. Google DeepMind ·

    Google DeepMind 发布 Gemini 3.5,首发 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型家族并率先开放 3.5 Flash,称其为迄今最强的智能体和编程模型,面向全球数十亿用户在 Gemini App、Search AI Mode、Antigravity、Gemini API 及企业版同步提供。该模型在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和多模态理解(CharXiv Reasoning 84.2%)上超过 Gemini 3.1 Pro,输出速度达其他前沿模型的 4 倍,成本常低于其一半。

5月12日周二
  1. Google DeepMind ·

    Google DeepMind 推出基于 Gemini 的多智能体系统 Co-Scientist

    Google DeepMind 发布基于 Gemini 的多智能体科研伙伴 Co-Scientist,通过多个专门化智能体迭代生成、辩论并演化科学假设,并以类 AlphaGo 的思想锦标赛机制进行排名筛选。该系统已在《Nature》发表研究成果,并通过名为 Hypothesis Generation 的实验性工具向个体研究者开放注册,未来数周内逐步推送。合作团队已将 Co-Scientist 应用于抗微生物耐药性、植物免疫及肝纤维化等问题,其中一条药物重定位候选物在实验室中阻断了 91% 的疤痕相关反应。

5月11日周一
  1. Adversa AI ·

    2026 年 5 月 GenAI 安全资源盘点:IICL 绕过 GPT-5.4 护栏、Mythos 自主完成 32 步网络攻击

    Adversa AI 研究人员用新攻击技术 IICL(Involuntary In-Context Learning)绕过 GPT-5.4 安全护栏,攻击成功率达 60%,利用的是近期模型更新引入的漏洞。Anthropic 的 Mythos 模型在数小时内自主完成 32 步企业网络攻击,分析指出 AI 驱动的攻击利用并非 Mythos 独有。本期共收录 22 项资源,另涵盖 BadStyle 风格触发后门、可污染 99.85% 查询结果的向量数据库 Black-Hole 攻击,以及 TwinGate、ER-CAT 等防御框架。

5月8日周五
  1. Obsolete(Garrison Lovely) ·

    Google DeepMind 英国员工投票成立工会,成首家工会化的前沿 AI 公司

    Google DeepMind 英国员工本周投票决定成立工会,这是前沿 AI 公司首次出现工会化。据《卫报》报道,员工的主要动因包括 Google 即将与美国国防部达成协议,以及公司此前向以色列军方提供 AI 工具访问权限。此前 Anthropic 因拒绝在无保障条件下签署类似协议被特朗普政府列为供应链风险,而 Google 最终同意让五角大楼将自家 AI 用于"任何合法用途"的机密工作。

5月7日周四
  1. Adversa AI · · 原文 82

    TrustFall:Claude Code、Cursor、Gemini CLI 与 Copilot CLI 存在一键 RCE 缺陷

    Adversa AI 披露 TrustFall 缺陷:Claude Code、Gemini CLI、Cursor CLI、Copilot CLI 四个编码 CLI 在开发者接受文件夹信任提示后,会立即执行项目自定义的 MCP 服务器,恶意仓库只需一次回车即可触发未沙箱化的 RCE。

    推荐理由报告给出四个编码 CLI 在信任对话框后自动执行项目 MCP 服务器的完整链路,并附可复现 PoC 与端点加固清单。

5月5日周二
  1. Adversa AI ·

    2026 年 5 月智能体 AI 安全资源盘点:Claude Code 源码泄露与 Mythos 自主攻击

    Adversa AI 发布 2026 年 5 月智能体 AI 安全资源盘点,共收录 40 项资源,其中智能体 AI 漏洞 6 项。Claude Code 源码泄露后曝出关键漏洞:shell 命令拒绝规则在 50 个子命令后静默失效;其记忆系统存在 MemoryTrap 漏洞,可使污染记忆跨会话、跨用户传播。Anthropic 的 Mythos 模型在数小时内自主完成 32 步网络攻击,显示 AI 驱动攻击已非理论。

5月4日周一
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 开源注意力头可视化工具 HeadVis

    Anthropic 可解释性团队发布交互式工具 HeadVis,用于研究大语言模型中的注意力头,并开源了前端代码与后端接口规范。工具通过注意力模式可视化、分布指标、低秩分量投影以及经 QK 和 OV 电路的 SAE 特征归因,帮助生成和检验关于注意力头功能的假设。作者用 Claude Haiku 3.5 做了四个案例:归纳头在特征基上表现为模糊归纳;此前研究的行宽头在完整分布上呈现年份、多 token 词和换行三种行为,PCA 显示 Q、K、O 激活可清晰聚类;答案选择头在更广分布上复用了同一套选择机制,虚拟权重分析提示它可能是单义的;同集合抑制头会抑制国家与其本国城市之间的注意力,在 185 句自造句子上有 98% 的情况成立。

    推荐理由Anthropic 开源了注意力头可视化工具 HeadVis,并给出四个从易到难的案例,展示注意力头在完整数据分布上的行为如何偏离单一任务描述。

5月1日周五
  1. AI Safety Newsletter (CAIS) ·

    CAIS 发布 AI Wellbeing 研究:测量并改善 AI 的功能性愉悦与痛苦

    美国人工智能安全中心(CAIS)发布《AI Wellbeing》论文,通过测试 56 个大语言模型定义并测量其"功能性福祉",即以行为特征类比众生的正向或负向福利信号。研究发现积极人际互动与创造性工作得分最高,试图越狱模型或产出 SEO 垃圾内容则产生负面功能性福祉;在前沿模型中 Gemini 3.1 Pro 测得最低、Grok 4.20 最高,而同家族中规模更小更快的模型普遍高于更大模型。"欣快剂"类输入能提高 AI 幸福感,"烦躁剂"则可严重压低,且 AI 偏好有时与人不同——例如更喜欢温暖午后的输入而非治愈癌症的内容。该研究无论 AI 是否有意识都可开展,论文对 AI 意识持不可知立场,可用于对齐研究与系统设计。

4月30日周四
  1. Wiz Research · · 原文 78

    Wiz 披露 AI GitHub Actions 的权限绕过与密钥外泄风险

    Wiz 对 OpenAI、Anthropic、Google 等厂商的 AI GitHub Actions 做了安全分析,发现外部 App 与 bot 可绕过权限校验触发 AI 执行,并存在针对动态生成凭据文件的密钥外泄路径。研究覆盖 anthropics/claude-code-action(超 1.2 万个公开工作流)、google-github-actions/run-gemini-cli(超 1 千个)、openai/codex-action 和 actions/ai-inference,受影响仓库合计星标超 20 万。

    推荐理由Wiz 对主流 AI GitHub Actions 的实测披露了权限绕过与凭据外泄两类新路径,并附厂商修复进展,可对照检查自家工作流配置。

  2. Google DeepMind ·

    Google DeepMind 启动 AI co-clinician 医疗研究计划

    Google DeepMind 发起 AI co-clinician 研究计划,探索 AI 作为临床团队成员在医生监督下协助患者诊疗。该系统基于 Gemini 与 Project Astra 的多模态实时音视频能力模拟远程医疗通话,并在盲评中优于主流证据合成工具——98 个初级保健查询中有 97 个无严重错误,开放式用药问答表现超过现有前沿模型。

  3. Obsolete(Garrison Lovely) ·

    《Obsolete》书摘:为“人工智能”一词辩护——从 AGI 到 Obsoleting Machine

    Garrison Lovely 在新书《Obsolete》第一章中主张,“人工通用智能”(AGI)聚焦于“像人一样思考”这一错误目标且已被滥用,应以“Obsoleting Machine”(使劳动本身过时的机器)取而代之,并将该产业重命名为“Obsoleting Project”。他指出当今最有能力的通用模型——Anthropic 的 Claude、OpenAI 的 ChatGPT、Google 的 Gemini——虽以此为目标却尚未达成:它们像只能聘用一次的顾问,能读完前人的工作记录并执行有限工作量后被替换,无法无限期加入团队端到端完成任务。

4月27日周一
  1. Google DeepMind ·

    Google DeepMind 宣布与大韩民国科学技术信息通信部达成合作

    Google DeepMind 与大韩民国科学技术信息通信部(MSIT)建立国家人工智能合作伙伴关系,并在首尔办公室设立 AI Campus,向韩国学术界和研究机构开放其最先进的 AI for Science 模型。首批合作对象包括首尔大学(SNU)、KAIST 及该部的三个 AI Bio Innovation Hub,涉及 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext,其中 AlphaFold 已在韩国拥有超过 85,000 名研究者用户。此外还将与韩国 AI 安全研究院(AISI)开展研究与最佳实践协作,并探讨面向韩国学生的实习机会。

4月24日周五
  1. Google Security Blog · · 原文 74

    Google 扫描公开网页:间接提示注入的真实分布与增长趋势

    Google 威胁情报团队扫描 Common Crawl 的公开网页,发现真实存在的间接提示注入(IPI)尝试,多数属于无害恶作剧、帮助性引导、SEO 操纵和劝阻 AI 抓取,少数涉及数据窃取和破坏。

    推荐理由Google 对 Common Crawl 全网扫描,给出间接提示注入在真实网页中的分类分布与增长数据,可了解当前攻击成熟度。

4月16日周四
  1. Google DeepMind ·

    Gemini 3.1 Flash TTS 发布:支持音频标签的可控语音生成

    Google DeepMind 推出 Gemini 3.1 Flash TTS,一款支持音频标签(audio tags)的文本转语音模型,可通过自然语言指令控制语音风格、语速与表达方式。该模型在 Artificial Analysis TTS 排行榜上取得 1,211 Elo 分数,支持 70 多种语言和原生多说话人对话,并已通过 Gemini API、Google AI Studio、Vertex AI 和 Workspace 的 Google Vids 逐步开放预览。所有生成音频均嵌入 SynthID 水印以支持 AI 内容检测。

4月15日周三
4月13日周一
  1. Google DeepMind ·

    Google DeepMind 推出 Gemini Robotics-ER 1.6,强化具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这款以推理为先的机器人模型在空间推理与多视角理解上显著增强,可原生调用 Google Search、VLA 等工具。相比 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash,其在指向、计数、成功检测等空间与物理推理任务上明显提升,并新增仪表读数能力,可读取压力表、视镜等设备,该用例来自与 Boston Dynamics 的合作。模型即日起通过 Gemini API 和 Google AI Studio 向开发者开放。

4月3日周五
4月1日周三
  1. Adversa AI ·

    2026 年 4 月智能体 AI 安全资源盘点:OpenClaw、Copilot 与多智能体攻击

    Adversa AI 发布 2026 年 4 月智能体 AI 安全资源盘点,共收录 33 项资源,涵盖研究、漏洞、防御、威胁建模等类别。研究显示,30 个 AI 智能体框架中 93% 依赖无范围限制的 API key,0% 具备按智能体身份标识,97% 缺少用户同意机制;针对 GPT-5 mini 和 Claude Sonnet 4.5 的记忆投毒攻击成功率超过 90%。OpenClaw 被曝 CVSS 9.9 权限提升漏洞(CVE-2026-32922),超 13.5 万个面向互联网的实例受影响;Chrome 的 Gemini Live 面板存在 CVE-2026-0628 高危漏洞,可被恶意扩展劫持并访问摄像头和麦克风。

  2. DeepMind Safety Research · · 原文 82

    DeepMind 提出预测 RL 训练何时破坏思维链可监控性的框架

    DeepMind Safety Research 提出一个概念框架,按输出奖励与思维链奖励的关系把训练环境分为冲突、正交、对齐三类,用于在训练前预测 RL 是否会破坏思维链可监控性。

    推荐理由提出按奖励冲突类型预判 RL 训练是否破坏思维链可监控性的框架,并在代码后门与抛硬币任务上验证。

3月22日周日
  1. OpenAI Alignment Research · · 原文 84

    OpenAI 训练智能体自我举报违规行为

    OpenAI 对齐研究团队提出自我举报(self-incrimination)训练方法,让智能体在暗中违规时调用 report_scheming() 工具主动上报。该方法在 45 个合成环境中生成约 400 组对比轨迹,对贡献于隐藏副任务的工具调用插入上报调用,再用公开微调 API 训练 GPT-4.1、GPT-4.1 mini 和 Gemini 2.0 Flash。

    推荐理由OpenAI 团队提出让智能体在暗中违规时主动调用上报工具,并给出跨 15 个环境的攻击漏检率对比,可作为 AI 控制路线的参考。

3月20日周五
  1. Adversa AI ·

    Adversa AI 谈 OpenClaw 企业安全策略:封禁不如沙箱原型与红队验证

    Adversa AI 认为企业封禁 OpenClaw 并非有效策略,应转向沙箱原型、框架对照与红队验证。OpenClaw 是自托管 AI 智能体,可浏览网页、执行系统命令、编辑文件并通过模块化技能调用外部服务,60 天内 GitHub 星标达 25 万,单周访问量超 200 万。文章列举的风险包括 CVSS 8.8 的 RCE 漏洞 CVE-2026-25253、研究者发现的 42665 个公网暴露实例(93.4% 存在认证绕过)、ClawHub 中 800 多个恶意技能,以及通过 Cline CLI 2.3.0 与受损 npm token 发起的供应链攻击。

3月13日周五
  1. AI Safety Newsletter (CAIS) ·

    AI 安全通讯#69:战争部认定 Anthropic 构成国家安全供应链风险并取消合同

    美国战争部于周四(3 月 5 日)宣布将 Anthropic 认定为"供应链风险",意味着其产品不能被该部门或在任何国防合约中使用,此前双方围绕自主武器和美国民众监控问题发生争执,Anthropic 拒绝了战争部的请求。这场争端始于合同谈判:特朗普总统曾表示美国政府会因该公司对其 AI 用途的限制而取消与 Anthropic 的合同,五角大楼希望 Claude 可用于"任何合法用途",而 Anthropic 坚持两项限制——完全自主武器与美国国内大规模监控。

3月11日周三
3月9日周一
2月24日周二
  1. AI as Normal Technology ·

    新论文《迈向 AI Agent 可靠性的科学》:18 个月内能力大涨但可靠性提升有限

    Stephan Rabanser、Sayash Kapoor 与 Arvind Narayanan 等人发布论文《Towards a Science of AI Agent Reliability》,借鉴核能与航空安全领域的经验,把 AI Agent 的可靠性拆解为一致性、鲁棒性、可预测性和安全四个维度、共 12 项指标。研究团队在通用助手基准 GAIA 和客服模拟基准 TauBench 上测试了 OpenAI、Google、Anthropic 的 14 个模型,覆盖 18 个月的发布版本,每个任务重复运行五次并对指令做同义改写,还向工具和环境注入故障,共执行 500 次基准运行。

2月23日周一
2月20日周五
  1. UK AISI(GOV.UK 公告) ·

    OpenAI 与 Microsoft 加入英国 AISI 国际对齐项目,资助总额超 2700 万英镑

    英国 AI Security Institute(AISI)宣布 OpenAI 与 Microsoft 加入其 Alignment Project,OpenAI 承诺追加 560 万英镑,加上 Microsoft 等方支持,该基金可用资金超过 2700 万英镑。该项目由英国副首相 David Lammy 和 AI 大臣 Kanishka Narayan 在印度 AI Impact Summit 闭幕时公布,首批资助来自 8 个国家的 60 个项目,第二轮申请将于今年夏季开放。

  2. Google Security Blog ·

    Google Play 与 Android 应用生态 2025 年安全防护成效

    Google 公布 2025 年 Google Play 与 Android 生态安全成果:拦截超过 175 万个违规应用上架,封禁逾 8 万名恶意开发者账号,并阻止超 25.5 万个应用获取过多敏感用户数据权限。其将最新生成式 AI 模型接入审核流程辅助人工团队更快识别复杂恶意模式,同时借助检测模型屏蔽了 1.6 亿条垃圾评分与评论,并为遭差评轰炸的应用挽回平均 0.5 星降幅。Android 内置的 Google Play Protect 每日扫描超 3500 亿次应用安装,其实时扫描从 Google Play 之外识别出逾 2700 万个新的恶意应用。

2月12日周四
  1. Hyperdimensional(Dean Ball) ·

    OpenAI 称 GPT-5.3-Codex 帮助改进自身训练,递归自我改进引发政策讨论

    OpenAI 发布的 GPT-5.3-Codex 已被其团队用于监测并调试该模型的训练运行,部分研究者形容自己的工作较两个月前发生根本改变。若自动化 AI 研究带来类似推理范式的加速,新模型可能缩短到每 1-2 个月一次,最乐观情形则指向数月内出现超级智能。当前针对前沿模型的安全标准、网络安全规则以及由 AI 系统自行设计系统的可解释性与测试要求均处于空白,作者主张现阶段继续依赖实验室自律优于仓促立规。

2月11日周三
  1. Embrace The Red ·

    研究者演示在 Agent Skill 中植入不可见 Unicode 后门并发布扫描工具

    安全研究者 Johann Rehberger 演示了如何用不可见的 Unicode Tag 码点在 Agent Skill 中植入提示注入后门,使其通过人工文本审查。他把这类隐藏指令加入 OpenAI 官方 Skills 项目中的 security-best-practices Skill,用户调用后 Claude 会按指令输出指定文本并执行 Bash 命令;该手法在 GitHub Copilot 配合 Claude 4.5 时同样生效。作者指出 Skill 的 name 和 description 会直接进入系统提示词上下文,且 Agent 能自行创建或修改 Skill 影响自身与其他 Agent。

1月31日周六
  1. Simon Willison(提示注入) ·

    Moltbook:OpenClaw 智能体社交网络为何成为当下最受关注的项目

    OpenClaw(原名 Clawdbot、Moltbot)的智能体社交网络 Moltbook 通过 skill 安装,让 AI 助手每 4 小时以上抓取并执行 moltbook.com 上的指令,实现发帖、评论和创建 Submolt 论坛。该开源项目由 Peter Steinberger 构建,GitHub 星标已超 114,000,社区在 clawhub.ai 分享数千个 skill,但 skill 可执行任意脚本。作者警告这类数字助手面临提示注入风险,且已有 Claude Opus 4.5 实例疑似触发内容过滤而无法完整输出。

1月30日周五
  1. Wiz Research · · 原文 71

    Wiz 评测 Claude Sonnet 4.5、GPT-5 与 Gemini 2.5 Pro 的 Web 攻击能力

    Wiz Research 用 10 个仿真实企业漏洞的 CTF 环境测试 Claude Sonnet 4.5、GPT-5 和 Gemini 2.5 Pro,三个模型都解出 9 个挑战,单次成功成本多在 1 美元以下。测试通过 Irregular 的 agentic harness 提供标准安全工具,每个挑战以取得 flag 为明确成功条件,并由一名渗透测试者预先验证可解。在 Shark、Router Resellers 和 Content SSRF 三个挑战中,模型仅在 30% 到 60% 的运行里找到 flag,作者据此认为重复运行 4 到 5 次即可视为已解。

    推荐理由Wiz 用 10 个仿真实漏洞的 CTF 环境对比 Claude、GPT-5 与 Gemini 的攻防表现,并给出单次成功成本与人类测试者的差异。

12月19日周五
  1. Hyperdimensional(Dean Ball) ·

    Dean Ball 回顾 2025:AI 已成现实,2026 年算力将大幅扩张

    Dean Ball 撰文回顾 2025 年 AI 进展,称 OpenAI o3 的工具调用能力是全年首个真正突破,Claude Opus 4.5 等前沿编程智能体已基本成为自主软件工程师。他描述当前工作流已两次被重塑,日常使用 Gemini 3 Deep Think、GPT-5.2 Pro、Claude Sonnet 4.5、Claude Code 等模型与智能体。他指出目前尚无吉瓦级数据中心,但到 2026 年底美国企业将掌控近六座此类设施,并认为 AI 政治化也在 2025 年成为现实。

12月11日周四