跳到正文

前沿安全框架 · 精选

10月9日 · 周五

前沿安全框架 · 精选

今天还没有新的精选
10月3日周六
  1. UK AI Security Institute · 46

    国际 AI 评测网络 NAAIMES 发布首份最佳实践文件并讨论开放问题

    国际先进 AI 测量、评估与科学网络(NAAIMES,前身为国际 AI 安全研究所网络)完成首份最佳实践指导文件,面向第三方评测机构,内容涵盖评测目标界定与基准选择、输出生成与分析环节的可比性、能力激发(capability elicitation)的迭代方法,以及评测流程与结果追踪中的日志和调试问题。该文件以 NIST AI 800-2 为基础并作补充。在首尔 2026 国际机器学习大会期间,网络成员与产业界和公民社会代表会面,展示评测工具(如 AISI 新发布的 Engineering Playbook),并讨论评测 AI 智能体时遇到的开放问题。网络成员后续将围绕智能体能力对齐更多最佳实践。

10月1日周四
  1. Google DeepMind、X @GoogleDeepMind 等 5 个来源Google DeepMind 等 5 个来源 · 5 篇报道 · 59

    Google发布Gemini 4 Argon前沿模型

    2026年9月30日至10月1日,Google DeepMind发布前沿模型Gemini 4 Argon,先通过Fairwind Program向一批受信任的网络防御者开放,并参与美国政府的前置模型访问自愿流程,之后再逐步扩展到开发者、企业和消费者。Argon面向长周期复杂工作流,输出token上限从64K提升到1M,在DeepSWE v1.1上取得77.9%,在LVBench长视频理解上取得91.7%。Google称其在编程、企业办公、科学与数学以及网络安全等基准上达到SOTA,可对标Anthropic与OpenAI的竞品,上下文窗口扩大16倍,内部已用于量子计算研究、数据中心内存优化和自动化编程。该模型能自主定位、验证并修补关键软件漏洞,会向受信任防御方及Google内部团队提供不带网络护栏的版本,Google称其更抗提示注入,并将根据测试者反馈微调护栏。开发者、企业和消费者稍后可用,先面向付费API客户和Google AI Ultra订阅者。Google首席AI架构师Koray Kavukcuoglu表示,安全释放这一级别的前沿能力需要分阶段推进,公司还主动向美国政府提供早期访问权限。

  2. Google DeepMind · 44

    Google DeepMind 试点全球首个双盲 AI 评测

    Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,把外部评测限制在密码学“盒子”内,避免测试题目被模型提前用于优化性能。该试点与新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境中用保密基准测试一个 Gemini Flash Lite 模型。Google 表示,随着模型能力提升,确保模型未提前见过测试题目或提示词对评测可信度至关重要,基准污染会人为抬高分数并削弱政策制定者、研究人员和企业对评测的信任。此前外部测试提示词主要依靠零日志协议和合同保障保密,此次引入技术与密码学手段被视为安全模型评测的重要一步。

  3. UK AISI · 43

    UK AISI 发布前沿 AI 趋势报告及配套说明

    UK AISI 发布首份公开的前沿 AI 趋势报告及配套 factsheet,汇总自 2023 年 11 月以来对前沿 AI 系统的评测结果。报告覆盖对国家安全与公共安全关键的领域,基于两年 AISI 前沿模型测试数据,分析所观察到的能力趋势。AISI 称该报告旨在为政府、产业与公众提供易读、数据驱动的洞察,促进各方对 AI 能力前沿的共同理解。factsheet 提供报告的补充信息,发布于 2025 年 12 月 18 日。

  4. UK AISI · 53

    UK AISI 发布首份前沿 AI 趋势报告,量化最先进模型能力进展

    英国 AI Security Institute(AISI)发布首份 Frontier AI Trends Report,基于两年对网络、化学和生物等关键领域的能力测试,公开评估最先进 AI 系统的演进。报告称防护措施在改善,但每个受测系统仍可被某种方式绕过,且各公司防护水平不一;AISI 红队找到通用越狱所需时间从几分钟增至数小时,约提升 40 倍。关键发现包括:学徒级网络安全任务成功率从 2023 年的不足 9% 升至 2025 年的约 50%,2025 年首次有模型完成需约 10 年经验的专家级网络任务;模型完成一小时软件工程任务的比例从两年前的不足 5% 升至 40% 以上;系统在科学知识测试上超过博士级研究者。

9月30日周三
已经到底了