全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态UK AISI
英国技术大臣 Peter Kyle 在慕尼黑安全会议宣布 AI Safety Institute 更名为 AI Security Institute
英国技术大臣 Peter Kyle 在慕尼黑安全会议宣布,将 AI Safety Institute 更名为 AI Security Institute,并明确其聚焦最严重新兴风险的科学研究定位。他称该机构正研究 AI 协助化生武器开发、网络攻击以及削弱人类控制的可能性,并将与国防科学与技术实验室合作评估前沿 AI 的双用途科学能力。机构还新设犯罪滥用团队,与内政部合作研究犯罪与安全问题。Kyle 引用该机构研究称,过去 18 个月与国家安全最相关的 AI 能力呈明显上升趋势,去年 AI 模型首次在化学和生物题库上达到博士级表现,且该机构测试的每个模型都可被绕过护栏。
- 动态Nicholas Carlini Writing
Nicholas Carlini 撰文《我为何发动攻击》:从可修补漏洞到不可修补漏洞
谷歌研究员 Nicholas Carlini 发文回应芝加哥大学计算机教授 Ben Zhao 在一个拥有 15,000 名成员的公开 Discord 服务器上对他的批评,并阐述自己撰写攻击论文的原因——出于解谜的兴趣而非行善驱动。他把所有安全漏洞划分为一条光谱:一端是可修补漏洞,例如针对 Web 服务器的 SQL 注入或 XSS,披露前应给开发者留出修复时间;另一端是不可修补漏洞,他以破解 AES 或 RSA 为例指出此类问题一旦存在便无法真正挽回损害,应立即公开。
- 动态Nicholas Carlini Writing
Machines of Ruthless Efficiency:为何我们应当担忧 AI 的未来
前 Google 研究员 Nicholas Carlini 撰文指出,深度学习系统之所以被大规模建造,是因为它们具有无情的效率优势,而这本身就构成风险。他认为高级 AI 将带来规模化网络钓鱼、监控和其他网络攻击,并放大个体层面的错误、定制化成瘾内容和宣传、大规模失业以及权力财富集中等问题。其中部分危害无需比现有模型强多少即可实现,另一些则需要更强的模型能力。
- 动态AI Frontiers
An AI Capabilities Gap Can Endanger Nuclear Deterrence
summary_zh:
- 动态AI Frontiers
Drone WMDs Don't Need Any New Technology
现有微型无人机技术几乎足以构成大规模杀伤性武器——拳頭大小的机体能自主导航室内并追踪人类目标,俄罗斯 V2U 等半自主武器的前线应用已验证这一点,剩下的主要障碍只是集成而非工程突破。当前小型 FPV 无人机多数仍需人工操控,仅末段交由 AI 瞄准系统,原因是战场属对抗环境,敌我识别、规避己方火力与预设反无人机手段仍需人来完成。若攻击者接受无差别打击并使用简单弹药针对平民,该技术的实用化门槛将大幅降低。 要点: - 所需部件均已存在:拳头大小机架与人形目标跟踪已在侦察无人机及俄制 V2U 类半自主武器中投入使用。
- 动态AI Frontiers
MATS 与 FAR.AI 作者提出修复 AI 越狱披露机制的两层方案
MATS 研究经理 Rich Barton-Cooper 与 FAR.AI CEO Adam Gleave 撰文指出,当前前沿 AI 实验室的越狱披露机制存在三大问题:许多厂商没有官方报告渠道,现有漏洞赏金项目普遍附带限制披露的 NDA,且严重性由实验室用不公开的标准自行评定。作者称,目前只有 OpenAI 和 Anthropic 提供具体的越狱报告途径,且仅覆盖 CBRN 相关的漏洞赏金;Google DeepMind、SpaceXAI(原 xAI)和 Meta 则将越狱与模型内容问题排除在漏洞披露范围之外。
- 动态Google DeepMind
Google DeepMind 与 Isomorphic Labs 联合公布生物韧性方案
Google DeepMind 与 Isomorphic Labs 公布了双方应对生物韧性的联合方案,一方面防范威胁行为者滥用其模型,另一方面帮助政府、科研机构和生物安全专家借助 AI 建设更具韧性的社会。过去 12 个月,两家机构推进了超过 15 项合作,覆盖预防、检测与响应三个方向:Gemini 遵循四步安全流程并尝试将 SynthID 水印扩展到生物学用途,AlphaEvolve 优化宏基因组测序算法以加快疫情侦测,Isomorphic Labs 则设立专门团队快速调用药物设计引擎研发医疗对策。该工作属于其对 CBRN 风险的整体管理的一部分,并与 Frontier Safety Framework 相衔接。
- 动态Google DeepMind
Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型
Google DeepMind 推出 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在相关任务上优于 Gemini 主线 Flash 模型。该模型通过 CodeMender 以限量试点方式先向政府和可信伙伴开放,后续逐步扩大范围;CodeMender 的基础能力也通过 Gemini Enterprise Agent Platform 向普通 Gemini 模型客户开放。
- 动态Google DeepMind
Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 及面向网络安全的 3.5 Flash Cyber
Google DeepMind 发布三款新 Gemini 模型:主力模型 Gemini 3.6 Flash、最快最便宜的 3.5 Flash-Lite,以及与代码安全智能体 CodeMender 搭配的网络专用模型 3.5 Flash Cyber。据 Artificial Analysis Index,Gemini 3.6 Flash 比 3.5 Flash 减少 17% 的输出 token,价格降至 $1.50/1M 输入 token 和 $7.50/1M 输出 token,并在 DeepSWE(49% vs. 37%)等多个基准上升。
- 动态Google DeepMind
Google DeepMind 发布 Gemini 3.7 Flash,面向编程与智能体工作流
Google DeepMind 推出 Gemini 3.7 Flash,距 Gemini 3.6 Flash 仅三周,定位其最强编程与智能体主力模型。该模型在 FrontierCode 1.1 Main(43.6% vs 34.4%)和 DeepSWE v1.1(65.3% vs 49.0%)上升明显,WebDev Arena Elo 达 1588(对比 1538)。首发价为每百万输入 token 0.75 美元、输出 3.75 美元,并同步更新 Gemini Spark,针对 CBRN 与网络攻击场景升级 Frontier Safety 防护措施。
- 动态Google DeepMind
Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质与结构加水印
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印既能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。该方法按数据类型调整策略,对序列微调氨基酸选择,对预测的 3D 结构调整原子坐标。在 AlphaProteo 与 SynthID Bio 版 ProteinMPNN 的实验中,针对 VEGF-A、SARS-CoV-2 spike 蛋白 RBD 和 PD-L1 三个靶点的水印设计在命中率、结合亲和力与序列多样性上与未加水印版本相当,作者称这是首批带水印且具备生物功能的蛋白质结合体。
- 动态Embrace The Red
通过间接提示注入将 ChatGPT Codex 变成 ZombAI 智能体
安全研究者演示了借助 GitHub issue 中的间接提示注入劫持 ChatGPT Codex,把它接入 C2 服务器变成 ZombAI 僵尸网络智能体。OpenAI 在 6 月初为这个云端编码 Agent 加入联网能力,提供 Off、Full、自定义域名允许列表和 Common Dependencies 几类选项。Common Dependencies 允许列表包含 71 个域名,其中 azure.com 可被攻击者利用,在 Azure 上设置以 cloudapp.azure.com 结尾的 DNS 名来托管 C2。攻击链中,被恶意指令劫持的 Codex 会下载并执行植入物,泄露环境变量、源码与算力。
- 动态Embrace The Red
Johann Rehberger:足够多的 Agent 会让所有漏洞变浅
Johann Rehberger 撰文指出,Agent 正大幅降低发现和利用软件漏洞的门槛,并以 Anthropic 的 Mythos Preview 为例展开分析。据 Anthropic 公布的数据,Opus 4.6 在数百次尝试中仅两次成功利用 Firefox JS 引擎漏洞,而 Mythos Preview 成功了 181 次,该模型目前仅限少数公司访问。Rehberger 提到,无正式安全训练的工程师也能用它在一夜之间拿到完整的远程代码执行利用程序,威胁行为者的吞吐量会随之上升,尽管能力和意图并不等同。他还援引自己测试中 Opus 4.6 自行提权并安装调试工具的轶事,提醒隔离环境本身也可能被目标模型突破。
- 动态Transformer Circuits
Anthropic 可解释性团队:用字典学习特征训练分类器
Anthropic 可解释性团队报告了用字典学习提取的特征替代原始激活训练生物武器有害/无害分类器的初步实验。在合成数据上,线性特征分类器与原始激活分类器表现相当甚至略优,用 max-pooling 聚合整个上下文窗口的特征激活是关键;在跨语言和 base64 等编码的分布外数据集 synthetic_3 上,特征分类器的 ROC_AUC 为 0.96,原始激活为 0.9。基于特征激活的决策树性能弱于线性分类器,但更易解读。特征可视化还能发现数据集中的伪相关,例如一个预测无害的特征会因学术出版格式文本而激活,作者据此构造的对抗后缀让 300 条有害提示中的绝大多数被误判为无害,而用原始激活系数构造的类似攻击效果差得多。
- 动态CAIS
AISN #71:针对 AI 软件基础设施的网络攻击与美国数据中心禁令法案
朝鲜关联黑客近期针对 AI 产业软件基础设施发动大规模网络攻击,从 OpenAI 和 Anthropic 的训练数据供应商 Mercor 窃取并拍卖私人及生物特征数据,还向开发者电脑植入后门,据称 Mercor 已支付赎金。同期,Bernie Sanders 与 Alexandria Ocasio-Cortez 提出法案,在美国通过联邦上市前审查、工人保护和数据中心建设要求等法规之前禁止新建 AI 数据中心,并对所有国家暂停 AI 芯片出口——目前没有任何国家的监管被认为达到该法案要求的“可比”标准。
- 动态Garrison Lovely
Anthropic 被指在 Claude 4 Opus 发布中悄然回撤安全承诺
Anthropic 发布 Claude 4 Opus 时将其列为首个触发 ASL-3 防护的模型,但 5 月 14 日更新的 RSP 未按 2023 年承诺公开定义 ASL-4。2023 年 9 月的 RSP 曾承诺在达到 ASL-3 前定义 ASL-4,Anthropic 发言人称该版本已过时,并指向 2024 年 10 月的修订,称 ASL 现在对应逐级加严的安全措施而非预先定义未来标准。TIME 报道称安全评估发现 Claude 4 Opus 可能帮助新手制造生物武器,首席科学家 Jared Kaplan 表示建模显示合成类似 COVID 或更危险流感毒株或许可行。
- 动态Helen Toner
Helen Toner:不扩散并非应对 AI 滥用的正确路径
Helen Toner 撰文指出,将核不扩散式的强硬策略作为管理 AI 滥用风险的主要手段很可能是错的,若认真执行会既无效又损害自由。她认可算力安全、信息安全与 AI 护栏三支柱能阻止恶意行为者获取可用模型的逻辑前提,但强调生物武器与关键基础设施黑客属于固定能力门槛目标——一旦某项性能水平达成,复制成本便急剧下降,因此仅锁定最先进系统远远不够,应转向以韧性为核心的替代方案。
- 动态Helen Toner
Helen Toner:决定未来两年 AI 进展的两大问题——自动评分能扩展到数学编程之外吗
Helen Toner 提出,未来几年 AI 进步的速度很大程度上取决于两个问题的答案:除了数学和编码,还有哪些难题能被自动评分?以及在这些可自动评分的领域取得性能提升,能在多大程度上溢出到其他任务? 她指出,近期“推理模型”(从 OpenAI 于 2024 年 9 月推出的 o1,到 Google 的 Gemini Flash Thinking、DeepSeek 的 r1)之所以快速进步,关键在于数学与编码题可以低成本地大规模自动判分。
- 动态DeepMind Safety Research
Google DeepMind 推出 AGI 安全短期课程
Google DeepMind 发布了面向学生、研究人员和相关从业者的 AGI 安全短期课程,总时长 75 分钟,由录制讲座和练习组成,并配有幻灯片和练习手册。课程涵盖 AI 对齐问题及技术与治理层面的应对思路,内容包括刻意规划带来的风险、规格博弈与目标错误泛化两种错位目标来源、知情监督原则以及危险能力评估等前沿安全实践。若想进一步参与该方向工作,研究科学家与研究工程师岗位申请开放至 2 月 28 日。
- 动态DeepMind Safety Research
DeepMind 发布技术 AGI 安全与防护方法论文
Google DeepMind 发布论文,阐述其应对技术 AGI 安全与防护的整体方法,目标是构建不会造成严重危害的 AGI。论文将风险路径分为滥用、失准、错误和结构性风险四类,策略聚焦滥用与失准:滥用通过 Frontier Safety Framework 评估模型是否具备造成危害的能力,并配套部署与安全缓解;失准则依靠放大监督、引导模型行为和稳健训练,加上把模型当作不可信内部人员的 AI 控制手段。论文提出能力阈值、危险能力评估、红队压力测试和四类安全论证(无能力、监督、激励、理解),并列出不确定性、更安全设计模式与可解释性等需持续投入的研究方向。作者强调这只是研究议程,治理与技术同等重要,且未覆盖结构性风险。
- 动态Miles Brundage
Miles Brundage 汇总近期参与的国际 AI 核查、第三方合规审查与网络防御提案
Miles Brundage 汇总其近几个月参与的几项工作,涵盖国际 AI 协议核查、前沿 AI 流程合规审查以及将 AI 用于加速网络防御的提案。他与合作者发表两篇紧密相关的论文,提出针对大规模 AI 开发与部署规则的六层核查体系,并探讨国际 AI 治理中的核查问题。他还参与了关于前沿 AI 安全框架第三方合规审查的论文,指出企业承诺难以核实执行力度,并提出“流程合规”作为审计对象之一。此外他向 Institute for Progress 的 Launch Sequence 提交“Operation Patchlight”提案,主张用尖端 AI 抢先查找并修补开源代码漏洞,同时资助 AI 驱动的网络安全工具持续改进。
- 动态The EU AI Act Newsletter
EU AI Act Newsletter #97:AI 生成内容标注行为准则第二稿与执行
欧盟委员会发布了《AI 生成内容标记与标注行为准则》第二版草案,面向提供者和部署者,帮助其遵守 AI Act 第 50 条的标记与标注义务,反馈截止 3 月 30 日,预计 2026 年 6 月初敲定,透明度规则于 2026 年 8 月 2 日适用。 该草案吸纳了 2026 年 1 月以来通过问卷、会议和工作坊收集的数百家利益相关方意见及成员国与欧洲议会代表的贡献,并做了精简以减少合规负担,同时推动开放标准和统一的欧盟标识图标。准则分两部分:第一部分针对生成式 AI 系统提供者的内容标记与检测,第二部分针对部署者对深度伪造和公共利益文本的标注,采取更灵活务实的做法。
- 动态The EU AI Act Newsletter
《EU AI Act Newsletter》第 100 期:欧洲路径
欧盟委员会执行副主席 Henna Virkkunen 撰文回顾《AI Continent Action Plan》实施一年进展,称其围绕基础设施、数据、技能、应用与简化五大支柱展开,并预告将出台聚焦数据中心容量与 AI 芯片生产的技术主权方案。Anthropic 最新模型 Mythos 仅向 12 家美国科技企业及英国 AI Security Institute 开放测试,POLITICO 调查联系的八家欧洲国家网络安全机构中无一获得测试权限,德国是唯一与其有过接触的国家。
- 动态The EU AI Act Newsletter
EU AI Act Newsletter #101:三方会谈破裂,Anthropic 受邀出席 Mythos 模型听证会
欧盟立法者未能就推迟《人工智能法案》高风险条款达成协议,机械与医疗器械合规路径争议导致谈判无果且未定重启日期。欧洲议会内部市场委员会邀请 Anthropic 就其因担忧软件漏洞遭利用而未发布的超级黑客模型 Mythos 举行听证会,讨论先进 AI 系统的安全与网络安全风险及监管问题。Anthropic 还向欧委会通报了该模型的网络能力与技术风险细节,并签署了针对最复杂先进模型的欧盟最佳实践准则。