跳到正文

#前沿安全框架

今天收录 3 条

第 5 页更新的内容回到最新

5月17日周六
  1. Obsolete(Garrison Lovely) ·

    独家:OpenAI 承认其非营利董事会权力将大幅缩水

    Obsolete 获取了 OpenAI 律师 5 月 15 日致加州总检察长 Rob Bonta 的 13 页信函,其中 OpenAI 为其营利实体重组方案作法律辩护。信函承认非营利董事会将有权解雇 PBC 董事,但非营利组织将以现有经济利益换取新 PBC 的股权,并获得对 PBC 知识产权、技术和人员的访问权,而非直接拥有或控制底层技术。核心变化在于法律义务:现行 LLC 运营协议规定公司对使命的责任优先于盈利,而新结构下 PBC 董事只需在股东利益与公共利益之间取得平衡。信函近二十次提及 Elon Musk,将批评者与 Musk 的商业利益挂钩,同时私下向加州非营利联盟成员发出合作邀请。

5月13日周二
  1. Rising Tide(Helen Toner) ·

    Helen Toner 借《The Future and Its Enemies》提出安全超级智能的动态主义愿景

    Helen Toner 借用 Virginia Postrel 1998 年著作《The Future and Its Enemies》,主张用动态主义(dynamism)而非停滞主义(stasism)来审视通往超级智能道路上的 AI 安全问题。她指出 AI 安全界部分政策带有明显停滞主义色彩——例如偏好少数领先 AI 项目乃至仅存一家、以及通过防扩散减少接触危险技术的途径。但她强调 AI 安全并非天然属于停滞主义阵营,亲技术与反技术、拥抱风险与规避风险的二分并不贴合这场争论的真实分歧。

5月1日周四
  1. AI as Normal Technology ·

    AGI 不是里程碑:从 OpenAI o3 谈起

    OpenAI 发布 o3 后,关于通用人工智能是否已达成的争论再起,但 AGI 并非一个里程碑式事件。o3 的关键创新是用强化学习让模型在推理链中搜索网页并使用工具,从而完成更复杂的认知任务。文章认为,即便系统达到某种能力阈值,其影响仍取决于扩散速度与环境设计,因此判定某系统是否构成 AGI 只能事后回溯。

4月22日周二
  1. Frontier Model Forum ·

    Frontier Model Forum 推出前沿 AI 框架技术报告系列

    Frontier Model Forum 启动前沿 AI 框架技术报告系列,计划在未来数月内陆续发布四份报告,分别覆盖风险分类与阈值、前沿能力评估、缓解措施以及第三方评估。该系列旨在说明不同组织情境下如何有效落地前沿 AI 框架,并推动实施标准的形成。目前已有 12 家主要 AI 开发商发布了各自的前沿 AI 框架,其中包括 Google DeepMind 的 Frontier Safety Framework、Anthropic 的 Responsible Scaling Policy 和 OpenAI 的 Preparedness Framework。

4月15日周二
  1. AI as Normal Technology ·

    《AI as Normal Technology》:将 AI 视为普通技术的未来愿景

    一份逾 15000 字的论文提出应将人工智能理解为“普通技术”(normal technology),而非类似人类的高自主超级智能实体,并主张无需激进政策干预或技术突破即可让人保有对其的控制权。该框架强调技术与社会的关系,拒绝技术决定论,指出变革性的经济和社会影响会缓慢发生——其关键在于区分 AI 方法、AI 应用与 AI 采纳三者处于不同时间尺度。论文分四部分展开:人机分工中越来越多的人类工作变成“AI 控制”、从事故、军备竞赛、滥用和对齐失败四个角度重估风险,以及以减少不确定性为首要目标、以韧性应对灾难性风险的 AI 政策建议。

4月8日周二
  1. DeepMind Safety Research · · 原文 62

    DeepMind 发布技术 AGI 安全与防护方法论文

    Google DeepMind 发布论文,阐述其应对技术 AGI 安全与防护的整体方法,目标是构建不会造成严重危害的 AGI。论文将风险路径分为滥用、失准、错误和结构性风险四类,策略聚焦滥用与失准:滥用通过 Frontier Safety Framework 评估模型是否具备造成危害的能力,并配套部署与安全缓解;失准则依靠放大监督、引导模型行为和稳健训练,加上把模型当作不可信内部人员的 AI 控制手段。论文提出能力阈值、危险能力评估、红队压力测试和四类安全论证(无能力、监督、激励、理解),并列出不确定性、更安全设计模式与可解释性等需持续投入的研究方向。作者强调这只是研究议程,治理与技术同等重要,且未覆盖结构性风险。

    推荐理由DeepMind 把 AGI 安全拆成滥用与失准两条线,并给出可落地的评估、缓解与安全论证框架,适合对照自家安全策略。

4月6日周日
  1. Rising Tide(Helen Toner) ·

    Helen Toner:不扩散并非应对 AI 滥用的正确路径

    Helen Toner 撰文指出,将核不扩散式的强硬策略作为管理 AI 滥用风险的主要手段很可能是错的,若认真执行会既无效又损害自由。她认可算力安全、信息安全与 AI 护栏三支柱能阻止恶意行为者获取可用模型的逻辑前提,但强调生物武器与关键基础设施黑客属于固定能力门槛目标——一旦某项性能水平达成,复制成本便急剧下降,因此仅锁定最先进系统远远不够,应转向以韧性为核心的替代方案。

4月2日周三
  1. Rising Tide(Helen Toner) ·

    Helen Toner:通往先进 AI 的长时限已变得极短

    Helen Toner 指出,"长时限"阵营如今也承认人类水平 AI 可能在一二十年内出现——Yann LeCun 称达到人类水平 AI 需数年乃至十年,并私下估计 2045 年前 AI 承接多数认知任务的概率达 20%。三家领先 AI 公司的负责人则公开表示 2026-2027 年最有可能建成比几乎所有人在几乎一切事情上都更强的 AI。她强调这并不意味着人类水平 AI 一定会在 20 年内到来或在 5 年内不会到来,也不意味着应把所有注意力从当下危害转移走,而是说明即使怀疑派的观点也指向动荡的一二十年。

3月29日周六
  1. Frontier Model Forum · · 原文 60

    Frontier Model Forum 成员企业签署首份前沿 AI 信息共享协议

    Frontier Model Forum(FMF)宣布其全部成员企业签署了一份旨在促进前沿 AI 威胁、漏洞与能力进展信息共享的协议。该共享范围被严格限定,用于管理涉及 CBRN 与高级网络威胁等国家安全和公共安全风险,目前仅限 FMF 成员企业参与。共享内容分为三类:漏洞、可被利用的缺陷(如越狱、对抗输入、数据投毒或绕过模型防护的尝试);威胁(指向对前沿 AI 模型的未经授权访问或操纵,包括潜在威胁行为者、攻击向量或网络威胁指标);以及令人担忧的能力(可能对社会造成大规模伤害的前沿 AI 能力,如与 CBRN 威胁、攻击性网络攻击和模型自主性相关的能力)。

    推荐理由FMF 成员企业首次签署跨公司信息共享协议,界定了共享范围与风险类别,可了解前沿 AI 行业协作机制的实际形态。

3月19日周三
  1. Frontier Model Forum ·

    Frontier Model Forum 发布 AI 生物安全评测三级报告分层方案

    Frontier Model Forum 发布议题简报,提出 AI 生物安全评测信息的三级报告框架,按公开、可信网络内共享、仅私下披露划分披露范围。Tier 1 可公开发布研究问题、科学领域、高层级评测方法、参与者背景、受测模型、任务示例、分析方法和关键高层级结论及研究局限;Tier 2 限可信网络共享完整威胁模型、深入评测方法、结果详细解读和模型增强细节;Tier 3 仅在决策相关方之间私下披露具体模型漏洞、特定训练数据和私有数据集。该框架采取预防性思路,信息只有在确信更广泛传播不会带来信息或注意力风险时才扩大共享范围,部分条目的报告层级取决于评测结果,例如确认新型生物威胁或可利用漏洞的高层级结论可能不宜公开。

3月14日周五
  1. Frontier Model Forum ·

    Frontier Model Forum 向 OSTP 提交 AI 行动计划意见书

    Frontier Model Forum 于 3 月 14 日向美国白宫科技政策办公室(OSTP)提交了一份关于《人工智能行动计划》制定的回应文件,建议美国政府加大对 AI 安全科学的投入并加强国际标准协调。 该组织提出三个重点方向:资助 AI 计量学与测量科学研究、开发针对国家安全与公共安全风险的 AI 风险管理流程,以及确保相关工作中纳入具备科学专业知识的领域专家,并点名 NIST 与美国能源部国家实验室适合推进评测测量科学。

3月12日周三
  1. Joe Carlsmith ·

    Joe Carlsmith 谈 AI 安全:路径与中途站点

    Joe Carlsmith 在系列文章第三篇中提出,AI 对齐问题的解决取决于"问题画像"与"文明能力画像"的组合,后者由安全进展、风险评估与能力约束三个安全因素构成。他区分了胜利与代价高昂的未失败两种目标状态,并讨论了全球暂停、自动化对齐研究、全脑仿真等中途里程碑,为后续"AI for AI safety"一文铺垫。

3月5日周三
  1. UK AISI(GOV.UK 公告) ·

    英国 AI 安全研究所启动首个挑战基金,最高资助 20 万英镑攻关 AI 安全研究

    英国 AI 安全研究所(AI Security Institute)启动了其首个挑战基金,作为一项 500 万英镑计划的一部分,面向全球研究人员和非营利组织提供单个项目最高 20 万英镑的资助,申请于 2025 年 3 月 5 日开放,入选项目将在 12 周内公布。该基金聚焦四类关键的 AI 安全与安保挑战,重点覆盖防范 AI 滥用以及确保人类对自主系统的可靠监督与控制,旨在加固金融、医疗、能源电网等关键基础设施并增强公众信任。

2月16日周日
  1. Miles Brundage ·

    Miles Brundage 公布今年不会亲自推进的多项重要 AI 议题

    Miles Brundage 列出自己离开 OpenAI 后今年不会亲身投入的重要 AI 方向,涵盖让人直观感受到 AGI 紧迫性、AI 智能体的基础设施与社会规范及法律责任、AI 的经济冲击以及欧盟《人工智能法案》落地谈判。他认为自己在这些问题上的技能更适合处理其他问题,因此选择回避而非放弃关注,并可能偶尔向他人提供建议。

2月15日周六
  1. UK AISI(GOV.UK 公告) · · 原文 62

    英国技术大臣 Peter Kyle 在慕尼黑安全会议宣布 AI Safety Institute 更名为 AI Security Institute

    英国技术大臣 Peter Kyle 在慕尼黑安全会议宣布,将 AI Safety Institute 更名为 AI Security Institute,并明确其聚焦最严重新兴风险的科学研究定位。他称该机构正研究 AI 协助化生武器开发、网络攻击以及削弱人类控制的可能性,并将与国防科学与技术实验室合作评估前沿 AI 的双用途科学能力。机构还新设犯罪滥用团队,与内政部合作研究犯罪与安全问题。Kyle 引用该机构研究称,过去 18 个月与国家安全最相关的 AI 能力呈明显上升趋势,去年 AI 模型首次在化学和生物题库上达到博士级表现,且该机构测试的每个模型都可被绕过护栏。

    推荐理由英国技术大臣在慕尼黑安全会议宣布机构更名与新增职能,可了解英国 AI 安全治理架构的最新调整方向。

2月14日周五
  1. DeepMind Safety Research ·

    Google DeepMind 推出 AGI 安全短期课程

    Google DeepMind 发布了面向学生、研究人员和相关从业者的 AGI 安全短期课程,总时长 75 分钟,由录制讲座和练习组成,并配有幻灯片和练习手册。课程涵盖 AI 对齐问题及技术与治理层面的应对思路,内容包括刻意规划带来的风险、规格博弈与目标错误泛化两种错位目标来源、知情监督原则以及危险能力评估等前沿安全实践。若想进一步参与该方向工作,研究科学家与研究工程师岗位申请开放至 2 月 28 日。

  2. UK AISI(GOV.UK 公告) · · 原文 69

    英国 AI Safety Institute 更名为 AI Security Institute,并新增犯罪滥用研究团队

    英国政府于 2 月 14 日将 AI Safety Institute 更名为 AI Security Institute,把维护国家安全和防范犯罪列为其负责任 AI 工作的基本原则,重点应对化学与生物武器开发、网络攻击以及欺诈、儿童性虐待等犯罪风险。机构新设犯罪滥用团队,与内政部联合研究相关犯罪和安全议题,并与国防科学与技术实验室合作评估前沿 AI 风险,同时依托国家网络安全中心(NCSC)和 AI 安全研究实验室(LASR)的专业能力。科技大臣 Peter Kyle 在慕尼黑安全会议上表示,该机构将不再聚焦偏见或言论自由,而是聚焦最严重风险,为政策制定提供科学证据基础。

    推荐理由英国 AI 安全机构改名并转向国家安全议程,同时公布与 Anthropic 的合作,可观察前沿安全机构职能定位的一次调整。

2月11日周二
  1. Miles Brundage ·

    Miles Brundage 评美国副总统 Vance 在 AI Action Summit 演讲中的 AI 政策信号

    Miles Brundage 发文点评美国副总统 Vance 在 AI Action Summit 上的演讲,指出其释放的美国 AI 政策议程中既有令人鼓舞之处也有隐忧。Vance 强调需保护 AI 技术与半导体免受窃取和滥用,Brundage 解读这指向模型权重及算法机密的安全防护,并希望该议题形成两党共识。他还推测 Vance 主张轻量化且聚焦极端风险、避免被大型科技企业俘获的安全监管路径,同时注意到其在 AI 与经济就业关系上偏向经济民粹主义立场而非科技右翼。

2月7日周五
  1. Frontier Model Forum ·

    Frontier Model Forum 发布前沿 AI 安全框架阈值问题简报

    Frontier Model Forum 发布问题简报,梳理前沿 AI 安全框架中阈值的类型与作用。简报指出,阈值是安全框架的核心要素,用于预先界定何种风险水平需要进一步审查或加强防护,从而让开发者、部署方和监管方在风险出现前采取行动,尤其针对 CBRN 和高级网络风险。简报归纳了四类阈值:算力阈值以训练算力作为风险的代理指标,易测量但只是粗略筛选;风险阈值直接限定可接受的风险概率与危害程度,最贴近社会影响但当前难以可靠估计;能力阈值指向特定能力(如提供致命病原体合成指引),比算力更贴近危害且比风险估计更易测量,是目前安全框架中最常用的类型;结果导向阈值则列出不可接受的结果及相应威胁场景。

2月3日周一
  1. Miles Brundage ·

    DeepSeek R1 的真正启示:规模加人才即可逼近超人类 AI

    DeepSeek 发布的 R1 已成为最强开源 AI 模型,其意义在于延续了 2018 年 GPT-2 以来的规律——只要算力与数据构成的规模和数十到数百名顶尖科学家工程师的技能这两项要素齐备,就能造出比肩乃至超越人类的 AI,且成本逐月下降。 该模式先在预测下一个词的范式下通过反复训练神经网络习得语法与世界知识,去年起又经长链式推理扩展到数学与编程等领域,o1 与 R1 借此学会分解问题并自查。 后来者常能以远低于先行者的成本复制同等性能,全球科学界公开的技巧使 OpenAI API 价格累计降幅超过 90%,因此美国无法长期垄断超级 AI 能力,GPU 出口管制虽必要却挡不住能力的持续扩散。

1月16日周四
  1. Miles Brundage ·

    Miles Brundage 对《通用目的 AI 行为准则》第二稿的反馈

    Miles Brundage 针对欧盟《通用目的 AI 行为准则》(COP)第二稿发表反馈意见,认为草稿正朝更具体、更连贯的方向改进,但仍存在大量未竟事项。他指出起草工作组的推进节奏过于仓促,问题根源在于欧洲议会启动该流程过晚而非主席团本身。对于具有系统性风险的模型的合规条款,他认为大型企业大体能够遵守,并强调若合规低效或错配风险,可能适得其反地损害企业内部的安全声誉。

1月11日周六
  1. Miles Brundage ·

    Miles Brundage 为何将前沿 AI 公司的安全置于首位

    Miles Brundage 撰文论证前沿 AI 公司的安全应比安全性更为紧迫。他指出,独立专家基于对前沿 AI 公司员工的访谈估计,这些企业距离抵御中俄等国资源充足的攻击尚有数年差距,且一年内 AI 系统能力还会大幅提升,现有竞争编码能力已达人类前几百名的水平。由于投资安全的成本由公司独自承担、投入不足的成本却由整个社会分担,加上单方面加强安全可能拖慢研发进度并丧失市场优势,这一问题不会自动解决。他还强调,芯片和数据中心的安全建设以及安全许可审批所需的时间超过模型迭代间隔,因此无法留待后期自动化处理。

12月21日周六
  1. Miles Brundage ·

    Time's Up for AI Policy:超级人类级 AI 临近,未来数月政策决定至关重要

    Miles Brundage 发文警告,超越几乎所有认知领域的超级人类 AI 几乎必然在未来几年内建成并部署,而接下来几个月的政策抉择将决定其治理方式。他以当日发布的 o3 为例指出超人类编程与数学能力的到来比许多人预期更快,社会尚未消化 Claude 3.5 Sonnet、o1 及即将推出的更大模型的冲击。特朗普政府首批行动、下一届美国国会立法、英国 AI 法案以及欧盟《通用人工智能行为准则》是关键节点,呼吁有意推动 AI 治理的人立即行动而非规划数年后产生影响。 --- **说明**: - 标题保留了原作者意图中的紧迫感("Time's Up"→"关键时刻/迫在眉睫"语义由副题承载),并按规则补入核心议题主体。

12月19日周四
  1. AI as Normal Technology ·

    AI 进展是否放缓?Arvind Narayanan 等人解析模型缩放与推理缩放的证据

    Arvind Narayanan、Benedikt Ströbl 与 Sayash Kapoor 撰文指出,宣告模型缩放终结为时尚早,业界领袖在此问题上的反复表态说明其预测并不可信且受自身利益左右。《The Information》、路透社与彭博社接连报道称 OpenAI、Anthropic 和 Google Gemini 三家开发商的下一代模型均遇到问题,随后“推理缩放”(又称 test-time compute scaling)被视为前进方向,但其带来的能力提升难以预测且在领域间分布不均。文章还强调,能力进步与 AI 社会或经济影响之间的联系极弱,制约影响的瓶颈是产品开发速度与采纳率而非模型能力。

10月31日周四
  1. Yoshua Bengio ·

    Yoshua Bengio:AGI 对国家和国际安全的影响

    Yoshua Bengio 在 Aspen Strategy Group 的论文中指出,AGI 可能在几年到十年内到来,Metaculus 上超过 20% 的预测认为 2027 年前可实现,而 AGI 到 ASI 的过渡或只需几个月到几年。前沿公司正试图开发能推进 AI 研究本身的 AI:训练需数万块 GPU,但推理阶段可并行部署,相当于数十万个自动化 AI 工作者。近 3000 名机器学习论文作者的调查显示,37.8%–51.4% 认为先进 AI 造成人类灭绝级后果的概率至少 10%,论文据此讨论权力高度集中与失控风险。

7月9日周二
  1. Yoshua Bengio ·

    Yoshua Bengio 撰文反驳轻视 AI 安全的论点

    Yoshua Bengio 发文系统回应反对重视 AI 安全的常见论据,指出当前无人掌握能让比人类更聪明的实体可靠地按其开发者意图行事的技术方法。他强调,即使未来找到可扩展到超级智能的对齐与控制手段,确保其不被滥用的政治制度仍然缺失,因此主张科学界与社会应投入大规模集体努力解决这一问题。

6月20日周四
  1. Yoshua Bengio ·

    Bengio 介绍《先进 AI 安全国际科学报告》中期版

    Yoshua Bengio 作为主席介绍了《先进 AI 安全国际科学报告》,该报告源于 2023 年 11 月英国 Bletchley Park AI 安全峰会上一项由 30 个国家及 EU、UN 代表推动的决议,中期报告已于 2024 年 5 月 22 日首尔 AI 峰会上提交,最终版将在明年 2 月法国 AI 行动峰会上发布。报告由 70 多位专家参与撰写,其中包括各国提名的 32 位专家和 26 位高级顾问,综合科学文献并附 40 页引用,按要求不提出政策建议。

9月13日周三
  1. Yoshua Bengio ·

    Yoshua Bengio 提出建立多边公益 AI 研究实验室网络以防卫民主与人权

    Yoshua Bengio 提议建立一个由非营利与非政府实验室组成的多边协作网络,共同防卫民主、人权并抵御可能失控的自主 AI。该提案强调避免单点故障、防止经济政治军事权力过度集中,并要求强有力的国际性与民主授权的治理机制。相关论文已在《Journal of Democracy》发表。

已经到底了