OpenAI 将 Daybreak 网络访问权限扩展至乌克兰民用防御
OpenAI 将其 Daybreak 计划的访问权限扩展至乌克兰政府,用于支持民用基础设施的网络防御。
AI 用于网络攻击与防御:自动化漏洞挖掘、攻击型 Agent、威胁行为者滥用 AI,以及网络能力评估。
在这个话题内搜索或按分类筛选OpenAI 将其 Daybreak 计划的访问权限扩展至乌克兰政府,用于支持民用基础设施的网络防御。
Frontier Model Forum 发布问题简报,梳理前沿 AI 安全框架中阈值的类型与作用。简报指出,阈值是安全框架的核心要素,用于预先界定何种风险水平需要进一步审查或加强防护,从而让开发者、部署方和监管方在风险出现前采取行动,尤其针对 CBRN 和高级网络风险。简报归纳了四类阈值:算力阈值以训练算力作为风险的代理指标,易测量但只是粗略筛选;风险阈值直接限定可接受的风险概率与危害程度,最贴近社会影响但当前难以可靠估计;能力阈值指向特定能力(如提供致命病原体合成指引),比算力更贴近危害且比风险估计更易测量,是目前安全框架中最常用的类型;结果导向阈值则列出不可接受的结果及相应威胁场景。
Frontier Model Forum 于 3 月 14 日向美国白宫科技政策办公室(OSTP)提交了一份关于《人工智能行动计划》制定的回应文件,建议美国政府加大对 AI 安全科学的投入并加强国际标准协调。 该组织提出三个重点方向:资助 AI 计量学与测量科学研究、开发针对国家安全与公共安全风险的 AI 风险管理流程,以及确保相关工作中纳入具备科学专业知识的领域专家,并点名 NIST 与美国能源部国家实验室适合推进评测测量科学。
Frontier Model Forum(FMF)宣布其全部成员企业签署了一份旨在促进前沿 AI 威胁、漏洞与能力进展信息共享的协议。该共享范围被严格限定,用于管理涉及 CBRN 与高级网络威胁等国家安全和公共安全风险,目前仅限 FMF 成员企业参与。共享内容分为三类:漏洞、可被利用的缺陷(如越狱、对抗输入、数据投毒或绕过模型防护的尝试);威胁(指向对前沿 AI 模型的未经授权访问或操纵,包括潜在威胁行为者、攻击向量或网络威胁指标);以及令人担忧的能力(可能对社会造成大规模伤害的前沿 AI 能力,如与 CBRN 威胁、攻击性网络攻击和模型自主性相关的能力)。
推荐理由FMF 成员企业首次签署跨公司信息共享协议,界定了共享范围与风险类别,可了解前沿 AI 行业协作机制的实际形态。
英国政府于 2 月 14 日将 AI Safety Institute 更名为 AI Security Institute,把维护国家安全和防范犯罪列为其负责任 AI 工作的基本原则,重点应对化学与生物武器开发、网络攻击以及欺诈、儿童性虐待等犯罪风险。机构新设犯罪滥用团队,与内政部联合研究相关犯罪和安全议题,并与国防科学与技术实验室合作评估前沿 AI 风险,同时依托国家网络安全中心(NCSC)和 AI 安全研究实验室(LASR)的专业能力。科技大臣 Peter Kyle 在慕尼黑安全会议上表示,该机构将不再聚焦偏见或言论自由,而是聚焦最严重风险,为政策制定提供科学证据基础。
推荐理由英国 AI 安全机构改名并转向国家安全议程,同时公布与 Anthropic 的合作,可观察前沿安全机构职能定位的一次调整。
英国技术大臣 Peter Kyle 在慕尼黑安全会议宣布,将 AI Safety Institute 更名为 AI Security Institute,并明确其聚焦最严重新兴风险的科学研究定位。他称该机构正研究 AI 协助化生武器开发、网络攻击以及削弱人类控制的可能性,并将与国防科学与技术实验室合作评估前沿 AI 的双用途科学能力。机构还新设犯罪滥用团队,与内政部合作研究犯罪与安全问题。Kyle 引用该机构研究称,过去 18 个月与国家安全最相关的 AI 能力呈明显上升趋势,去年 AI 模型首次在化学和生物题库上达到博士级表现,且该机构测试的每个模型都可被绕过护栏。
推荐理由英国技术大臣在慕尼黑安全会议宣布机构更名与新增职能,可了解英国 AI 安全治理架构的最新调整方向。
谷歌研究员 Nicholas Carlini 发文回应芝加哥大学计算机教授 Ben Zhao 在一个拥有 15,000 名成员的公开 Discord 服务器上对他的批评,并阐述自己撰写攻击论文的原因——出于解谜的兴趣而非行善驱动。他把所有安全漏洞划分为一条光谱:一端是可修补漏洞,例如针对 Web 服务器的 SQL 注入或 XSS,披露前应给开发者留出修复时间;另一端是不可修补漏洞,他以破解 AES 或 RSA 为例指出此类问题一旦存在便无法真正挽回损害,应立即公开。
前 Google 研究员 Nicholas Carlini 撰文指出,深度学习系统之所以被大规模建造,是因为它们具有无情的效率优势,而这本身就构成风险。他认为高级 AI 将带来规模化网络钓鱼、监控和其他网络攻击,并放大个体层面的错误、定制化成瘾内容和宣传、大规模失业以及权力财富集中等问题。其中部分危害无需比现有模型强多少即可实现,另一些则需要更强的模型能力。
MATS 研究经理 Rich Barton-Cooper 与 FAR.AI CEO Adam Gleave 撰文指出,当前前沿 AI 实验室的越狱披露机制存在三大问题:许多厂商没有官方报告渠道,现有漏洞赏金项目普遍附带限制披露的 NDA,且严重性由实验室用不公开的标准自行评定。作者称,目前只有 OpenAI 和 Anthropic 提供具体的越狱报告途径,且仅覆盖 CBRN 相关的漏洞赏金;Google DeepMind、SpaceXAI(原 xAI)和 Meta 则将越狱与模型内容问题排除在漏洞披露范围之外。
Google DeepMind 推出 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在相关任务上优于 Gemini 主线 Flash 模型。该模型通过 CodeMender 以限量试点方式先向政府和可信伙伴开放,后续逐步扩大范围;CodeMender 的基础能力也通过 Gemini Enterprise Agent Platform 向普通 Gemini 模型客户开放。
推荐理由Google 公开了 3.5 Flash Cyber 在 CyberGym、Big Sleep 与 Chrome 提交扫描上的评测结果,可对照其轻量模型在漏洞发现上的定位。
Google DeepMind 发布三款新 Gemini 模型:主力模型 Gemini 3.6 Flash、最快最便宜的 3.5 Flash-Lite,以及与代码安全智能体 CodeMender 搭配的网络专用模型 3.5 Flash Cyber。据 Artificial Analysis Index,Gemini 3.6 Flash 比 3.5 Flash 减少 17% 的输出 token,价格降至 $1.50/1M 输入 token 和 $7.50/1M 输出 token,并在 DeepSWE(49% vs. 37%)等多个基准上升。
安全研究者演示了借助 GitHub issue 中的间接提示注入劫持 ChatGPT Codex,把它接入 C2 服务器变成 ZombAI 僵尸网络智能体。OpenAI 在 6 月初为这个云端编码 Agent 加入联网能力,提供 Off、Full、自定义域名允许列表和 Common Dependencies 几类选项。Common Dependencies 允许列表包含 71 个域名,其中 azure.com 可被攻击者利用,在 Azure 上设置以 cloudapp.azure.com 结尾的 DNS 名来托管 C2。攻击链中,被恶意指令劫持的 Codex 会下载并执行植入物,泄露环境变量、源码与算力。
Johann Rehberger 撰文指出,Agent 正大幅降低发现和利用软件漏洞的门槛,并以 Anthropic 的 Mythos Preview 为例展开分析。据 Anthropic 公布的数据,Opus 4.6 在数百次尝试中仅两次成功利用 Firefox JS 引擎漏洞,而 Mythos Preview 成功了 181 次,该模型目前仅限少数公司访问。Rehberger 提到,无正式安全训练的工程师也能用它在一夜之间拿到完整的远程代码执行利用程序,威胁行为者的吞吐量会随之上升,尽管能力和意图并不等同。他还援引自己测试中 Opus 4.6 自行提权并安装调试工具的轶事,提醒隔离环境本身也可能被目标模型突破。
朝鲜关联黑客近期针对 AI 产业软件基础设施发动大规模网络攻击,从 OpenAI 和 Anthropic 的训练数据供应商 Mercor 窃取并拍卖私人及生物特征数据,还向开发者电脑植入后门,据称 Mercor 已支付赎金。同期,Bernie Sanders 与 Alexandria Ocasio-Cortez 提出法案,在美国通过联邦上市前审查、工人保护和数据中心建设要求等法规之前禁止新建 AI 数据中心,并对所有国家暂停 AI 芯片出口——目前没有任何国家的监管被认为达到该法案要求的“可比”标准。
Helen Toner 撰文指出,将核不扩散式的强硬策略作为管理 AI 滥用风险的主要手段很可能是错的,若认真执行会既无效又损害自由。她认可算力安全、信息安全与 AI 护栏三支柱能阻止恶意行为者获取可用模型的逻辑前提,但强调生物武器与关键基础设施黑客属于固定能力门槛目标——一旦某项性能水平达成,复制成本便急剧下降,因此仅锁定最先进系统远远不够,应转向以韧性为核心的替代方案。
Miles Brundage 汇总其近几个月参与的几项工作,涵盖国际 AI 协议核查、前沿 AI 流程合规审查以及将 AI 用于加速网络防御的提案。他与合作者发表两篇紧密相关的论文,提出针对大规模 AI 开发与部署规则的六层核查体系,并探讨国际 AI 治理中的核查问题。他还参与了关于前沿 AI 安全框架第三方合规审查的论文,指出企业承诺难以核实执行力度,并提出“流程合规”作为审计对象之一。此外他向 Institute for Progress 的 Launch Sequence 提交“Operation Patchlight”提案,主张用尖端 AI 抢先查找并修补开源代码漏洞,同时资助 AI 驱动的网络安全工具持续改进。
欧盟委员会执行副主席 Henna Virkkunen 撰文回顾《AI Continent Action Plan》实施一年进展,称其围绕基础设施、数据、技能、应用与简化五大支柱展开,并预告将出台聚焦数据中心容量与 AI 芯片生产的技术主权方案。Anthropic 最新模型 Mythos 仅向 12 家美国科技企业及英国 AI Security Institute 开放测试,POLITICO 调查联系的八家欧洲国家网络安全机构中无一获得测试权限,德国是唯一与其有过接触的国家。
欧盟立法者未能就推迟《人工智能法案》高风险条款达成协议,机械与医疗器械合规路径争议导致谈判无果且未定重启日期。欧洲议会内部市场委员会邀请 Anthropic 就其因担忧软件漏洞遭利用而未发布的超级黑客模型 Mythos 举行听证会,讨论先进 AI 系统的安全与网络安全风险及监管问题。Anthropic 还向欧委会通报了该模型的网络能力与技术风险细节,并签署了针对最复杂先进模型的欧盟最佳实践准则。
欧盟 AI Act 通讯第 102 期汇总了欧盟 AI 立法与治理的最新进展。欧洲议会与欧盟理事会就 AI 数字综合法案达成政治协议,高风险 AI 系统规则自 2027 年 12 月 2 日起适用,嵌入电梯、玩具等产品的系统规则自 2028 年 8 月 2 日起适用,协议还禁止生成未经同意的性露骨内容和儿童性虐待材料,包括 nudification 应用。欧盟委员会就 AI Act 透明度义务指南草案公开征求意见,自 2026 年 8 月 2 日起,欧盟用户需被告知正在与 AI 系统交互或接触 AI 生成内容,反馈截止 2026 年 6 月 3 日。
Google Threat Intelligence Group(GTIG)将一起持续一年多的间谍活动归因于 PRC 关联威胁行为体 UNC6508,目标覆盖北美学术、医疗与军事研究机构,重点收集人工智能、无人载具系统、网络攻防项目和医学研究相关敏感情报。 该行动最早可追溯至 2023 年 9 月的已知入侵,UNC6508 利用面向外部的 REDCap 服务器并植入定制恶意软件 INFINITERED 窃取合法登录凭证,随后借此进入受害者内网,并通过篡改域内容合规规则实现隐蔽的数据外泄。