全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态FAR.AI
FAR.AI 举办 NOLA Alignment Workshop 2023:GPT-3.5 越狱演示与 Bengio 主旨演讲
FAR.AI 于 2023 年 12 月 10-11 日在 NeurIPS 前夕举办 NOLA Alignment Workshop,吸引 149 名参会者,图灵奖得主 Yoshua Bengio 发表主旨演讲。Zico Kolter 现场演示越狱 GPT-3.5 以启动汽车,凸显对齐与安全措施的紧迫性;Owain Evans 指出 GPT-4 等先进模型目前仍难以完成复杂的情境外推理,但未来模型需重点评估这一潜在危险能力。
- 动态FAR.AI
全球 AI 科学家在北京对话,呼吁就 AI 红线开展国际合作
2024 年 3 月 10 日至 11 日,第二届 AI 安全国际对话(IDAIS-Beijing)在北京举行,由 FAR.AI 旗下 Safe AI Forum 与北京智源人工智能研究院(BAAI)合作举办。Yoshua Bengio、姚期智、Geoffrey Hinton 等图灵奖得主,与张宏江、黄铁军及薛澜、Gillian Hadfield 等治理专家参会,讨论 AGI 系统的安全发展路径。会议形成共识声明,建议为 AI 开发设定红线,禁止开发可自主复制、自我改进、寻求权力或欺骗创造者的 AI 系统,以及可用于制造大规模杀伤性武器和发动网络攻击的系统,并提出确保这些红线不被跨越的措施。次日科学家与中国官员及企业 CEO 会面,介绍红线提案并讨论 AI 的生存性风险,官员对共识声明表示欢迎,讨论聚焦于该议题上国际合作的必要性。
- 动态FAR.AI
图灵奖得主 Bengio、Hinton、姚期智等科学家在威尼斯呼吁全球 AI 安全应急准备
2024 年 9 月 6 日至 8 日,Yoshua Bengio、Andrew Yao、Geoffrey Hinton 等计算机科学家与薛澜、Gillian Hadfield 等治理专家在威尼斯参加第三届国际 AI 安全对话(IDAIS-Venice),提出三项政策建议:针对先进 AI 风险建立国际应急准备协议,涵盖模型注册与披露、事件报告、tripwires 和应急计划;要求开发者在部署能力超过特定阈值的模型前提交高置信度安全案例,并接受独立审计;推动全球范围、多政府与慈善机构资助的安全与验证研究。
- 动态FAR.AI
FAR.AI 湾区对齐研讨会 2024:160 名研究者聚焦 AI 安全与对齐
2024 年 10 月 24-25 日,160 名来自学术界、产业界、政府和公益组织的研究者与负责人齐聚 Santa Cruz,参加 FAR.AI 湾区对齐研讨会,围绕评估、鲁棒性、可解释性与治理展开讨论。Google DeepMind 的 Anca Dragan 以"优化失准"开场,METR 的 Beth Barnes 强调严格评估与开源评测,Redwood 的 Buck Shlegeris 介绍可信监控、串通检测等 AI 控制策略。会议还涵盖中国 AI 政策、稀疏自编码器与因果抽象、辩论式可扩展监督等议题。
- 动态FAR.AI
FAR.AI 巴黎 AI 安全论坛 2025:Bengio、RAND 与英国 AISI 共议 AI 系统风险
2025 年 2 月 9 日,约 200 名研究者、工程师和政策制定者在巴黎皇家宫殿参加 FAR.AI 主办的 Paris AI Security Forum,讨论自主网络攻击、AI 智能体被劫持及硬件层防护等安全问题。Yoshua Bengio 指出欧盟《人工智能法案》行为准则仅是必要的第一步,呼吁监管者加快行动以防自我保存型 AI 脱离人类控制;RAND 与 Pattern Labs 警告国家行为体和资金充裕的攻击方已在探测 AI 弱点。Alex Robey 团队通过对自动驾驶汽车、无人地面车辆和机器狗的实验展示了针对 AI 控制机器人系统的越狱攻击路径。
- 动态FAR.AI
Safe AI Forum 从 FAR.AI 分拆独立
Safe AI Forum(SAIF)已从 FAR.AI 分拆为独立组织。SAIF 于 2023 年作为 FAR.AI 的财政赞助项目启动,以举办 International Dialogues on AI Safety 闻名,在获得 501(c)(3) 非营利资格后完成过渡。FAR.AI CEO Adam Gleave 以个人身份加入 SAIF 董事会,双方将在相关领域保持密切合作。
- 动态FAR.AI
Redwood Research、FAR.AI 与英国 AI Security Institute 举办 ControlConf 2025
Redwood Research、FAR.AI 和英国 AI Security Institute 于 3 月 27-28 日举办 ControlConf 2025,聚焦 AI 控制领域的基础问题。会议涵盖通过重采样控制 AI 智能体、低风险研究破坏、AI 控制安全案例、颠覆策略评估等议题,Anthropic、Google DeepMind、Apollo Research 等机构研究者参与。
- 动态FAR.AI
FAR.AI 首届 Technical Innovations for AI Policy 会议汇聚逾 150 位专家共议 AI 治理
FAR.AI 于 5 月 31 日至 6 月 1 日举办首届 Technical Innovations for AI Policy 会议,联合 FAI、CNAS 和 RAND Corporation,召集超过 150 名技术专家、研究者与政策制定者讨论半导体出口管制、硬件赋能治理机制、AI 安全性评估、数据中心安全及国防应用等议题。会上提出国会众议员 Bill Foster 推动芯片位置核查立法以防走私、《RAISE Act》要求前沿 AI 企业提交安全计划并接受第三方审计,以及保障 AI 基础设施所需额外 80-100 GW 电力容量的策略,演讲者还强调建立有效治理框架的关键 1,000 天窗口期。
- 动态FAR.AI
FAR.AI 新加坡对齐研讨会 2025:Bengio keynote 与 CVE-Bench 等 AI 安全研究
FAR.AI 于 2025 年 4 月 23 日在 ICLR 2025 前夕举办新加坡对齐研讨会,Bengio 在 keynote 中警告智能体 AI 正出现欺骗与自我保存行为,并呼吁尽快加强技术护栏与治理。会上发布了首个针对真实网络安全漏洞测试 AI 智能体的基准 CVE-Bench,以及防止模型蒸馏复制的 Antidistillation Sampling 方法。Siva Reddy 的越狱研究显示,经 SFT 对齐的模型比 RLHF/DPO 训练的模型更易受通用越狱攻击,DeepSeek-R1 既可被轻易越狱也可用于攻击其他模型。
- 动态FAR.AI
FAR.AI 会议探讨面向 AI 政策的技术创新
FAR.AI 在华盛顿举办会议,汇聚超 150 名专家讨论 AI 治理的技术基础,涵盖能源需求、与中国竞争、安全评估及形式化可验证承诺等问题。会上提出将审计作为综合生态系统推进有效治理,并建议以多层防御系统应对失控风险——由可信 AI 通过红队评估监视不可信 AI,同时警告这只是权宜之计。
- 动态FAR.AI
FAR.AI 联合创始人兼 CEO Adam Gleave 获评 Schmidt Sciences AI2050 早期职业研究员
FAR.AI 联合创始人兼 CEO Adam Gleave 入选 Schmidt Sciences 的 AI2050 早期职业研究员。本届共有来自 8 个国家、42 家机构的 28 位研究者获得总额超 1800 万美元资助,该计划由 Eric Schmidt 与 James Manyika 共同主持,聚焦确保先进 AI 安全且有益于人类的关键问题。Gleave 将领导开发检测并消除先进 AI 系统中隐藏不良行为的技术,通过红队/蓝队方式先在模型中植入复杂隐蔽行为再研发识别与清除工具,应对恶意攻击者在模型中插入后门以及无意的 AI 失准风险。
- 动态IAPS
IAPS 提议由市场化出口审计机构协助美国芯片出口管制执法
IAPS 在一份工作论文中提出,美国出口管制执法可由独立营利性出口审计机构协助,这些机构由美国工业与安全局(BIS)认证和监管,进口方须为特定类别出口聘请经认证的审计公司,审计方通过现场检查等方式发现潜在的转运行为。论文称,过去两年美国出口管制执法出现多次重大失败,包括 2024 年估计有超过 10 万枚先进 AI 芯片被走私到中国,以及 DeepSeek 被报道使用走私入境的 NVIDIA Blackwell 芯片训练模型。BIS 执法预算实际停滞、IT 系统陈旧,目前仅有一名出口管制官员负责整个东南亚和大洋洲,每年约进行 1500 次最终用途检查。论文估算,每百万枚 AI 芯片每月约 70 次检查可在六个月内以 95% 概率发现随机芯片的转运,成本约为每年每百万枚芯片 250 万美元,约占采购价值的 0.005%。
- 动态FAR.AI
AGI 到来时记者准备好了吗?FAR.AI 举办记者研讨会
FAR.AI 举办研讨会,帮助记者理解 AGI 时间线的分歧预测。Helen Toner 提出三种分析视角,Anton Korinek 指出 AGI 能胜任人类创造的任何新工作,将根本性削弱人类劳动在经济中的角色。Anthropic 的 Evan Hubinger 与 OpenAI 的 Jason Wolfe 分别分享了模型训练中失准及"谋划"行为的研究,后者在压力测试中于前沿模型上发现此类行为,但强调这不代表典型部署条件。
- 动态IAPS
IAPS 评估 H200 对华出口的影响:DeepSeek 算力或接近美国数据中心
IAPS 发布 Issue Brief,评估美国商务部 BIS 1 月半导体出口规则下 Nvidia H200 对华销售的影响。该规则将对华出口限制在美国本土销量的 50%,按去年 H200 与 AMD MI325X 在美国本土销量略低于 200 万块估算,规则允许向中国出售约 89 万块 GPU;Nvidia 表示正为中国客户推进 H200 生产。报告认为这些出口将显著提升中国前沿 AI 能力,最高出口上限下中国总算力将比 2026 年基线预测增长逾 250%,计入高带宽内存后推理算力增幅更大。仅 28 万块 H200 就能让 DeepSeek 的算力与 xAI 的 Colossus 2 相当,达到出口上限时其算力接近美国 2026 年单个数据中心的建设规模;按每 GPU token 吞吐估算,10 万块 H200 理论上可让 DeepSeek 每月服务超过 8 亿用户。
- 动态IAPS
半导体制造设备出口管制如何遏制中国 AI 芯片产能——美国 IAPS 问题简报解析
美国对半导体制造设备的出口管制显著延缓了中国 AI 芯片制造进程,使美国在 AI 基础设施上保持优势。据 IAPS 测算,2026 年中国本土生产的 AI 芯片总量仅为美国公司的 1–2%。现行管制通过实体清单、最终用途限制及外国直接产品规则(FDPR)覆盖 EUV 光刻机等先进设备,荷兰 ASML 独家供应且研发投入达 60 亿欧元、耗时 17 年才实现量产,成为中国难以逾越的关键瓶颈。
- 动态FAR.AI
FAR.AI 获超 3000 万美元多资助方支持,扩展前沿 AI 安全研究
FAR.AI 在 2025 年获得超 3000 万美元资助承诺,资助方包括 Coefficient Giving、Schmidt Sciences、Survival and Flourishing Fund、CSET 和由 Frontier Model Forum 支持的 AI Safety Fund。资金将用于把技术研究团队从 15 人扩至 30 人以上、新设技术治理部门、每年支持 20 名以上研究员,并将 Alignment Workshop 从每年两场增至三场、拓展至亚洲和全球南方。FAR.AI 计划到 2028 年取得 3-5 项重大技术突破,并推动前沿实验室采纳安全标准。
- 动态FAR.AI
FAR.AI 牵头欧盟 AI Act CBRN 风险联盟
FAR.AI 宣布被欧盟委员会 AI Office 选中,牵头 EU AI Act 下 CBRN 风险建模与评估联盟,为法案实施提供技术安全研究。该联盟由 FAR.AI(AI 安全研究与红队)、SecureBio(生物威胁评估)、SaferAI(AI 治理与风险建模)组成,并有 GovAI、Nemesys Insights、Equistamp 作为分包方,中标项目为 EC-CNECT/2025/OP/0032 Lot 1。未来三年,FAR.AI 将与 AI Office 共同开展风险建模与场景开发、评估工具与标准化报告流程建设、红队与对抗测试,以及定期向委员会通报模型、风险来源、诱导技术、缓解措施与事件等新进展。FAR.AI 还将作为分包方参与同一招标 Lot 4 的有害操纵风险建模评估。
- 动态IAPS
IAPS 备忘录:Claude Mythos 的网络能力跃升与政策优先事项
IAPS 发布备忘录,评估 Anthropic 于 4 月 7 日发布的 Claude Mythos Preview 及其配套的差异化访问计划 Project Glasswing,认为政策制定者应把该模型和 AI 网络能力的加速轨迹视为需要紧急行动的国家安全风险。Anthropic 的内部评估与独立评测显示,Mythos 在未知漏洞发现、漏洞利用生成和自动化攻击上均有明显提升,据报已发现数千个高危或严重漏洞,覆盖各大操作系统和浏览器;UK AISI 的 32 步企业网络攻击模拟中,Mythos 是首个端到端完成该靶场的模型,10 次尝试中成功 3 次,平均完成 22 步,而 Opus 4.6 平均 16 步。备忘录指出,从漏洞披露到出现可用利用的平均时间已从 2018 年的 2.3 年降至 2025 年的 23 天,2026 年 4 月进一步缩短到 20 小时。
- 动态IAPS
IAPS 发布面向前沿开发者的内部 AI 模型使用风险报告指南
IAPS 发布报告,为前沿 AI 开发者提供一套统一的内部模型使用风险报告标准,以同时适配加州 SB 53、纽约 RAISE 法案和欧盟 General-Purpose AI Code of Practice 三套监管框架。报告指出,前沿公司会先内部部署最强模型数周至数月进行安全测试与迭代,例如 Anthropic 的 Mythos Preview 在公开宣布前已内部使用至少六周,这类内部使用带来的风险可能被外部部署框架忽略。报告给出内部使用的风险分类法,并建议每当内部部署能力显著更强或风险更高的模型时,开发者应撰写风险报告并论证其可安全部署。报告主要面向前沿开发者的评测与安全团队,其次面向希望了解良好报告标准的监管者与审计方。
- 动态IAPS
IAPS 政策备忘录:以差异化访问推进美国网络战略
IAPS 发布政策备忘录,主张美国政府主导差异化访问战略,让联邦机构、承包商和关键基础设施运营方优先获得网络能力模型,以在攻防之间取得优势。备忘录认为 Anthropic 的 Project Glasswing 和 OpenAI 的 Trusted Access for Cyber 虽有价值但范围有限,且开发者缺乏对国家安全风险和威胁态势的完整视野。文中指出 AI 网络能力快速提升,英国政府评估能力每四个月翻倍,此前为八个月;OpenAI 的 GPT-5.5 在网络安全基准上接近 Claude Mythos 水平,中国模型估计落后美国三到七个月,攻击者还可能通过权重窃取、知识蒸馏攻击或未授权访问获取能力。备忘录列出五项缺口,包括访问不等于防御成效、项目范围受限、只关注漏洞发现而忽视修复、依赖高成本模型(Mythos 运行成本约为小模型的 25 倍)、以及模型自身安全。
- 动态FAR.AI
FAR.AI 举办伦敦对齐研讨会 2026,逾 200 人聚焦前沿 AI 监管缺口
FAR.AI 于 2026 年 3 月 2-3 日主办 London Alignment Workshop,汇聚超过 200 名研究者、政策制定者和从业者,讨论前沿 AI 系统发展快于监管制度的问题。议题涵盖可解释性、可扩展监督、评测方法与治理框架,Adam Gleave 提出以保证、可审计性和效率三项标准建立工程化安全路径,Gillian Hadfield 则提议设立独立核查组织提供外部担保。
- 动态IAPS
IAPS 政策备忘录:美国应对 AI 蒸馏攻击的行政与国会行动仍需补强
IAPS 发布政策备忘录,认为白宫与国会在应对 AI 蒸馏攻击上已有动作,但力度与威胁规模不匹配。备忘录指出,OSTP 于 4 月 23 日发布的《美国 AI 模型对抗性蒸馏》国家安全与科技备忘录未涉及蒸馏攻击与先进半导体出口管制的关联、攻击者通过云端远程访问美国芯片的风险,也未说明具体问责机制,建议商务部在芯片出口与远程算力访问上纳入蒸馏风险,白宫公开其拟动用的具体授权。针对 4 月 15 日由众议员 Huizenga 提出、4 月 22 日以 43-0 通过众议院外交事务委员会审议的《2026 年威慑美国 AI 模型窃取法案》,备忘录提出四项修正:处理行业合作的反垄断与数据隐私障碍、允许跨政府共享情报、限制联邦机构访问受关注实体的模型、明确模型提取攻击构成商业秘密窃取,并将评估频率从每年一次共 3 年改为至少每年一次共 5 年。
- 动态IAPS
IAPS 发布前沿 AI 国家安全政策手册,提出十条建议
美国智库 IAPS 发布备忘录,为白宫应对前沿 AI 的国家安全风险提出十条政策建议。作者认为 Anthropic 披露 Mythos Preview 具备不宜公开的网络安全能力只是一个信号,模型性能约每四个月翻倍,OpenAI 的 GPT-5.5 据报也展现出类似网络能力,生物安全等风险也可能出现。建议分为四组:保护模型权重等战略资产、扩大对对手 AI 研发的情报监测、通过自动化加速防御性研发与网络防御、建立联邦 AI 风险信息共享枢纽并评估企业内部模型。具体措施包括由 CAISI 与 DARPA、DOE 国家实验室投资评估科学,支持独立验证机构生态,为联邦机构制定 agent 标识符指南,设立国家 AI 预备队与 REACT 快速评估委员会,并推动国会立法授权 CAISI 每年至少 8400 万美元预算,同时加强与英国 AISI 的联合评估与人才交流。
- 动态FAR.AI
FAR.AI 第二届 TIAP 会议:AI 政策的技术创新——我们听到了什么
FAR.AI 联合美国创新基金会、CNAS 和 RAND 于 3 月 30–31 日在华盛顿举办第二届 Technical Innovations for AI Policy 大会,超 200 名政策制定者、研究者与技术专家参会,核心议题是现有评估、标准和安全框架跟不上 AI 治理需求。Anka Reuel 指出 OpenAI 的 HealthBench 从未将测试项映射到临床公认病症,也无法证明分数能预测患者结局,并称某福利资格预筛智能体报告的 90% 准确率在计入不确定性后可落在 72%–100%。Ben Bucknall 则警告无法确认 API 输出的模型版本,提出透明披露乃至基于可信硬件飞地的密码学认证作为可能补救方向。