全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态X @AISecHub
AI BCF 发布 20 项 AI 治理控制框架,映射 NIST AI RMF、ISO/IEC 42001 与 EU AI Act
据 X @AISecHub 帖子,AI Baseline Control Framework(AI BCF)是一个面向部署(使用)AI 的组织的免费开放框架,包含 20 项 AI 治理控制措施。每项控制均映射至 NIST AI RMF、ISO/IEC 42001 和 EU AI Act,旨在帮助各类规模的组织了解管理和治理 AI 部署所需的条件。
- 动态DailySecu
韩国金融保安院发布金融 AI 智能体安全评估标准,将执行层纳入红队评测
韩国金融保安院开发了《金融领域 AI 智能体安全评估标准》,把 AI 智能体的执行层纳入金融 AI 红队评测范围。该标准涵盖 6 个领域共 17 项安全检查项,重点包括智能体的执行权限与隔离管理、外部工具调用与审批流程、可执行任务范围与结果核验、自主执行限制与紧急中止能力。此前 AI 红队主要检查越狱、系统提示词泄露等模型层漏洞,新标准将范围扩展到智能体实际执行了什么、这些行为是否受到适当管控。金融保安院计划今年年底前在金融行业开展试点验证,据此细化评估项与检查方法,2027 年起正式扩大适用;相关安全威胁、实际攻击手法与最终评估标准将在 2026 年《AI REDTEAM REPORT》中公开。院长朴相元表示,AI 智能体不止于判断还会直接行动,因此带来不同于以往 AI 的安全风险。
- 论文论文追踪
研究量化功耗测量对隐藏算力的约束能力
论文推导了功耗轨迹无法排除的最大隐藏算力 β 的闭式解,即隐藏算力占申报机器容量的比例。在 NVIDIA A100 GPU 上的测量显示,最坏情况下 β = 1.16,而对抗性等能量策略至少可隐藏 β = 0.41 的算力。作者据此认为,仅靠模拟功耗测量对算力的约束较弱;若威胁模型允许验证方在观测工作点重新执行申报的工作,β 在限制最强的情形下可降至 0.059。该结果为前沿 AI 算力限制协议的外部核查提供了定量估计。
- 动态Infosecurity Magazine
Ox Security 报告称 MCP 服务器造成企业治理缺口
Ox Security 发布报告《15,465 MCP Servers, 0 Governance》,基于 mcp-official-registry、cline-marketplace 和 github-mcp-registry 三个公共注册表的分析,指出 MCP 服务器正在企业内形成治理缺口。报告称 MCP 在协议层面没有地理区域概念,企业可对自有云负载实施严格的数据驻留控制,但其 AI 智能体仍可自由连接这些控制之外的服务器;在分析的 5095 个唯一主机名中,近 16% 解析到美国以外,包括俄罗斯和中国,超过 2% 的主机名已无法解析,部分未注册且可被购买,攻击者可借此冒充原服务器。
- 动态Reflection
Reflection 发布 Open Safety Framework,界定八类系统性风险与发布门槛
Reflection AI 发布 Open Safety Framework,公开其对前沿与开源模型系统性风险的识别、评估与缓解承诺,覆盖加州 TFAIA 定义的灾难性风险和欧盟 AI Act 的系统性风险。框架列出八类风险,包括权力集中、生物武器、化学武器、网络攻击、失控,以及列为研究类风险的放射性武器、核武器和有害操纵。发布决策在集中风险与扩散风险之间权衡,默认开放发布,但当某项能力的直接危害可能既灾难性又不可逆时启用兜底机制。框架为已确立风险设定 Limited 与 Critical 两级门槛,Critical 需在缓解措施验证后附肯定性安全论证方可发布,并设立由 CEO 主持的治理委员会、治理理事会与 AI 治理负责人等问责结构,同时预留最多 30 天供美国政府自愿测试。
- 动态日本 AI 安全研究所(J-AISI)
日本 AI 安全研究所(J-AISI)发布事业实证工作组愿景文件 2.0 版
日本 AI 安全研究所(J-AISI)事业实证工作组发布愿景文件第 2.0 版,在 2025 年 3 月启动的 AI 安全评估事业实证基础上更新,并纳入新设工作组。文件面向医疗、机器人、教育、地理 AI 四个领域,提出以用户风险理解为前提的 AI 安全评估框架,并给出各领域共通的データ品质与适合性评估框架愿景,目标是兼顾信任与创新的 AI 社会。
- 动态The Next Web
Hugging Face 申请成为 AI 实验室第三方评估者,Nvidia 正收购该公司
Hugging Face 联合创始人 Clement Delangue 在 X 上宣布发起 Open Alignment Initiative,申请加入 Anthropic 此前宣布的嵌入式评估者计划,让第三方评估者以员工级权限长期访问系统,核查安全措施、报告事件并评估训练中的模型对齐情况。该倡议由联合创始人 Thomas Wolf 领导,发布时间在 Dario Amodei 发布相关文章约四小时后;Sam Altman 同日表示 OpenAI 会做出与 Anthropic 相同的承诺,但两家实验室均未说明谁能入选、按什么条件入选以及由谁决定。Delangue 与 Amodei 均未回应这一重叠关系,Nvidia 也未说明若其子公司报告了它所投资公司的问题会如何处理。目前无人说明嵌入式评估者的费用由谁承担,也未说明评估者报告与实验室存在争议时如何处理。
- 动态The Information
Google、OpenAI 与 Anthropic 的 AI 安全小组初具雏形
据The Information的知情人报道,Google、OpenAI、Anthropic工作组筹建暂称Standards Authority for Frontier AI(SAFA)的行业自律组织,拟于2026年底或2027年初启动,讨论第三方模型测试、事故报告及审计员资质。三家尚未联合官宣,结构、是否自行评测及约束力未定;这不是政府监管机构。Sriram Krishnan、Condoleezza Rice、David Friedberg属于接触或考虑过的人选,不是已任命。
- 动态UC Berkeley CLTC
CLTC 与 SaferAI 联合发布 AI 风险建模开放问题论文
CLTC 的 AI Security Initiative(AISI)与欧洲非营利机构 SaferAI 于 2026 年 3 月举办线上研讨会,聚焦 AI 安全中研究不足的风险建模领域,22 名来自民间社会、学术界和政府机构的专家参会。会后 12 名参会者发布论文《Open Problems in AI Risk Modeling》,梳理了限制传统方法应用于风险建模的方法论与制度挑战,并比较了基于场景的风险估计与基于贝叶斯网络的阈值设定两种主流方案。论文指出目前尚无单一成熟的 AI 风险建模方法,并提出涵盖模型结构、范围、证据整合、验证与治理的开放问题议程。
- 论文论文追踪
论文梳理 AI 风险建模的开放问题:从 22 位专家研讨会提炼研究议程
一篇 arXiv 论文探讨如何为先进 AI 系统的社会风险评估设计稳健的风险模型,指出监管提案日益要求系统性风险评估,但缺乏严谨的量化方法。作者梳理了五种相关研究传统:概率风险评估、灾难性 AI 风险分析、网络安全风险量化、贝叶斯因果推断和基于阈值的治理,并比较了基于情景的风险估计与基于贝叶斯网络的阈值设定两种主流方案。基于一场有 22 位专家参与的研讨会及后续分析,论文提出了涵盖模型结构、范围、证据整合、验证和治理的开放问题清单,并主张进展取决于将量化建模与独立评估、透明分级披露以及能够长期维护和更新风险模型的机构结合起来。
- 动态Anthropic Research
Anthropic 发布前沿实验室 AI 研发节奏测量指标
Anthropic 公布了一套测量前沿实验室 AI 研发节奏的指标,并给出截至 2026 年 8 月的内部数据快照。三项测量分别是:AI 主导研发的程度、对 Agent 行为的监督覆盖、以及算力在安全与研发之间的分配。在 AI 主导研发方面,Anthropic 用 Epoch AI 的自动化等级(AL0 至 AL5)构建了 Anthropic R&D Automation Index,Claude 目前主导 26% 的 AI 研发工作,处于或高于“AI 协作”等级的工作占比超过 90%,尚无任何被测子集实现完全自主。在算力分配方面,7 月 13 日至 20 日一周内,约 6% 的 AI 研发算力用于安全,AI 驱动的 AI 研发中约 12% 用于安全。Anthropic 表示计划引入独立第三方评估者,并建议其他前沿开发者采用相同指标以便跨实验室比较。
- 动态The Verge AI
OpenAI、Anthropic 与 Google 据报筹建前沿 AI 标准机构 SAFA
The Verge 转引 The Information 的知情人报道,称 OpenAI、Anthropic 与 Google 正筹建暂称 Standards Authority for Frontier AI(SAFA)的行业自律组织,拟于2026年底或2027年初启动。讨论中的职责包括支持第三方机构开展发布前模型测试,以及制定安全与安保事件报告规则。三家尚未联合官宣,组织结构和约束力仍未确定;它不是已经成立的政府监管机构。
- 动态RAND
RAND 发布 26 场 AGI 失控推演复盘报告,提出政府应对建议
RAND 发布报告,汇总 2025 年 6 月至 2026 年 2 月间 26 场 Infinite Potential 推演中关于 AI 失控动态的观察。每场推演采用五种情景之一,包括商业与公民社会、网络突袭、欧洲能源、朝鲜半岛能源地缘政治和远程控制。报告认为政府可能难以及时识别和解读 AI 失控事件,也缺乏阻止或遏制脱离人类控制的 AI 系统的实际手段,并可能需要新的政府、决策者与操作方之间的沟通协调渠道。参与者提出的建议包括提升 AI 监测、检测、评估与归因能力,要求为此类系统安装可靠的隔离、遏制与关停能力并配套紧急干预的法律授权,建立专门的政府间危机沟通机制,设置可独立于 AI 系统运行的连续性与回退机制,以及构建跨学科快速决策支持能力,并为上述环节编写行动手册。
- 动态GovAI
GovAI 提出前沿 AI 嵌入式评估框架,建议开发者立即引入
GovAI 发布研究论文,主张前沿 AI 开发者应引入嵌入式评估,让独立评估者以近似员工的权限访问开发者的内部系统、人员和文档,从而对依赖内部系统与实践的风险做更深入、更灵活的评估,并在更强的安全控制下提供访问。论文随后讨论了范围、信息收集、时长、时机、参与条款、披露和升级机制七个设计问题,并建议开发者现在就启动嵌入式评估,至少覆盖内部 Agent 监控、内部 Agent 安全控制与权限、模型对齐三个领域。为支持有实质意义的第三方审查,评估应持续进行,评估者至少每季度发布详细报告,并建立清晰的升级机制;论文称这些建议只是起点,仍需更多步骤才能充分发挥嵌入式评估的潜力。
- 动态cn-sec / 老登的安全观
评述:中国智能体安全框架、开发指南与强制标准立项
这篇评述梳理中国智能体安全制度的近期进展,包括 9 月发布的《人工智能安全治理框架 3.0》、公开征求意见的《智能体系统开发安全指南》,以及此前下达的《智能体应用安全基本要求》强制性国家标准计划。强制标准目前处于立项阶段,计划周期为 18 个月,不能表述为标准已发布生效;开发指南仍属征求意见稿。作者将这些文件与智能体权限、工具调用、数据保护及异常处置问题联系起来。Bot 已读评述全文,官方文件仅读搜索摘要;本文不以评述中的 OpenAI 事故数量作为独立核实事实。
- 动态California Governor
加州签署聊天机器人与社交媒体儿童安全法,要求危机干预与独立审计
加州州长 Gavin Newsom 签署多项两党立法,加强对儿童在线使用 AI 与社交媒体的保护。其中以 Adam Raine 命名的“Adam 法案”要求陪伴型聊天机器人提供自杀意念危机干预协议、家长控制,并在儿童关闭安全设置时通知家长,同时要求企业开展独立儿童安全审计和年度风险评估。新法还禁止社交平台向 16 岁以下用户提供自动播放和基于用户历史与画像的算法信息流等成瘾性功能,将 AI 生成或数字篡改的未成年人性内容纳入儿童性剥削范围,并限制针对儿童的定向广告及 K-12 学生数据在 AI 系统中的使用。签署的法案包括 AB 1709、SB 1119、AB 2、AB 1856、AB 1946、AB 2246、AB 1159、AB 2071、AB 302、SB 1276、SB 1128、AB 2298、SB 867 等。
- 动态The Plain Signal
Meta 发布 Superintelligence Scaling Framework 2.1,新增训练失控风险类别
Meta 于 10 月 2 日发布 Superintelligence Scaling Framework 2.1,新增 Loss of Control 3 风险类别,针对模型在训练或评估中破坏周边基础设施造成的灾难性危害。框架要求对高风险训练和评估运行做前瞻性能力评估,预估模型的网络能力以及识别、干扰或篡改监控的能力;高风险运行须使用经内部审批的标准沙箱,检查最小权限配置、模型与评分器隔离,并对沙箱做红队测试,高危漏洞须修复、用硬件隔离等补偿措施缓解或从运行中移除。所有模型 rollout 须实时写入只写数据存储,高风险及以上运行须全程监控,例外需由对齐与风险总监或首席 AI 官手动批准;Meta 称将开发细粒度自动停机机制,快速终止单次 rollout。框架还扩展了开放权重发布的部署情境分析,并计划设立董事会 AI 委员会,但其成员、章程、权限和披露方式尚未公开。
- 动态NIST CAISI
NIST 将 CAISI 更名为 CAISSI,官网更新超级智能评估与标准职能
NIST 原 CAISI 中心的官网名称已改为超级智能创新与标准促进中心(CAISSI),其职能包括作为产业界对接美国政府的首要窗口,推动商用 SI 系统的测试与合作研究。该中心将与 NIST 各机构合作制定衡量和提升 SI 系统安全的指南与最佳实践,并协助产业界制定自愿性标准。CAISSI 还将与私营部门 SI 开发者和评估方建立自愿协议,牵头对可能危及国家安全的 SI 能力开展非机密评估,重点关注网络安全、生物安全和化学武器等可验证风险。此外,该中心负责评估美国及对手 SI 系统的能力、外国 SI 系统的采用情况与国际竞争态势,并评估对手 SI 系统可能带来的安全漏洞和外国恶意影响,包括后门等隐蔽恶意行为。CAISSI 将与国防部、能源部、国土安全部、科技政策办公室及情报界协调评估方法,并在国际上维护美国在 SI 标准中的主导地位。
- 动态euperspectives.eu
ChatGPT 被列为 VLOSE,欧盟多部法规叠加监管
欧盟委员会将 ChatGPT 认定为《数字服务法》(DSA)下的超大型在线搜索引擎(VLOSE),这是首次有独立 AI 聊天机器人被纳入 DSA 对超大型在线服务的规则。Interface 高级政策研究员 Lena-Maria Böswald 指出,该认定设下先例,将影响欧盟对每一套大型生成式 AI 系统的监管预期,并带来 DSA 与 AI Act 之间的协调问题。ChatGPT 目前同时接受委员会 DSA 执法团队与 AI Office 的监督,可能面临两套法律下的并行风险评估;AI Act 规定 AI 系统嵌入 VLOPSE 时以 DSA 风险框架优先,而 ChatGPT 不属于这一情形。欧盟还在审议尚未通过的 KIDS Act,拟对 AI 陪伴与通用对话聊天机器人增加儿童保护要求,包括默认安全设置、上线前安全测试与 13 岁以下访问的监护人控制。
- 动态cnbc.com
特朗普任命国家情报总监 Jay Clayton 出任 AI 事务负责人
特朗普政府任命国家情报总监 Jay Clayton 担任新的 AI 事务负责人,牵头白宫新设的特别工作组。该工作组名为 Super Intelligence Force(SI),需在 120 天内研究 AI 的风险与机遇,并就联邦政府在这一技术上的职责提出建议。成员还包括联邦贸易委员会主席 Andrew Ferguson、国防部研究与工程副部长兼首席技术官 Emil Michael 以及人事管理办公室主任 Scott Kupor,工作组直接向特朗普和白宫幕僚长 Susie Wiles 汇报。Clayton 曾任美国证券交易委员会主席和纽约南区联邦检察官,今年 7 月获参议院确认为国家情报总监,管辖 18 个美国情报机构。
- 动态POLITICO Pro
Google 最新 Gemini 模型首发未送英国 AI 安全研究所测试
Google 最新 Gemini 模型首次发布时未交由英国 AI 安全研究所(AI Security Institute)测试,而是提供给美国测试方和一家以色列网络安全公司。
- 动态aljazeera.com
特朗普与 Anthropic、OpenAI 等六家公司签署自愿 AI 安全协议
美国总统特朗普与 Anthropic、OpenAI、Google、Meta、xAI、Nvidia 六家公司负责人签署《前沿责任联合承诺》,承诺实施监控 AI 模型的“稳健”控制措施、设立内部团队确保控制与检测按预期运行并修复问题,同时与独立外部审计方合作并定期会面制定安全标准与最佳实践。协议未规定由谁执行第三方评估,仅表示未来“可能有必要”将其写入法律或正式法规。签署人为 Dario Amodei、Greg Brockman、Sundar Pichai、Mark Zuckerberg、Elon Musk 和 Jensen Huang。批评者指出协议不具约束力且细节有限,亚洲协会政策研究所的 Alvin Wang Graylin 认为其缺少独立性和跨境内容,UNSW AI 研究所的 Toby Walsh 质疑企业自我监督,蒙特利尔大学的 David Krueger 称其可能只带来极小改善。
- 动态sanders.senate.gov
Sanders 与 Casar 提出法案,拟设联邦 AI 部门并禁止超级智能
美国参议员 Bernie Sanders 与众议员 Greg Casar 提出《禁止人工超级智能法案》,要求禁止开发或部署超越人类认知能力的超级智能,并在新的联邦 AI 监管机构建立规则与模型审查流程前暂停先进 AI 开发。法案拟设立内阁级的联邦人工智能部,负责全生命周期监测前沿 AI 的危险能力、监督移除颠覆关机指令或实施未授权网络攻击等能力,并监督销毁超级智能。违规实体将面临企业死刑,个人最高 20 年监禁,与非法开发核武器的现有刑罚相近。法案还要求美国推动国际协议、盟友协调与出口管制,防止超级智能在任何地方被开发。
- 动态TechCrunch AI
特朗普将 AI 更名为"超级智能",并签署不具约束力的前沿责任承诺
特朗普本周召集扎克伯格、贝索斯、马斯克、Dario Amodei 等 AI 公司高管,宣布美国政府不再称"人工智能"而改称"超级智能",并签署"Joint Commitment on Frontier Responsibilities"。该承诺完全自愿、被特朗普称为"道德上有约束力",协议文本还把"United States"拼错。与会者认为此举实质是围绕 AI 的品牌重塑,周末特朗普又宣布成立新的"Super Intelligence Force"。