跳到正文

US CAISI · 精选

10月9日 · 周五

US CAISI · 精选

今天还没有新的精选
10月7日周三
  1. Office of Rep. Sam Liccardo · 53

    美国两党议员提出中美 AI 安全协调法案,设 AI 热线并授权 1 亿美元

    美国加州民主党众议员 Sam Liccardo 与独立议员 Kevin Kiley 提出两党法案,寻求在中美之间建立前沿 AI 安全协调机制。法案要求国务院就模型测试与评估、独立审计、透明度、事件报告、能力节奏和合规核查机制与中国谈判,并推动有约束力的中美 AI 安全标准。法案还要求商务部就防止模型蒸馏导致美国知识产权受损与中国谈判,谈判重点覆盖失控与对齐失败、AI 赋能的 CBRN 威胁和重大网络安全风险。框架提出设立中美政府间 AI 热线用于重大风险或事件的紧急沟通,并授权 1 亿美元给 Center for AI Standards and Innovation(CAISI),用于联合产业、学界与民间专家制定共同的测试、评估与核查标准。

10月5日周一
  1. NIST CAISI、CSA Labs ResearchNIST CAISI 等 2 个来源 · 2 篇报道 · ↑153

    NIST 将 CAISI 更名为 CAISSI,聚焦超级智能评测与标准

    NIST 原 CAISI 中心官网名称已改为超级智能创新与标准促进中心(CAISSI),职能包括作为产业界对接美国政府的首要窗口,推动商用 SI 系统的测试与合作研究,与 NIST 各机构合作制定衡量和提升 SI 系统安全的指南与最佳实践,协助产业界制定自愿性标准,并与私营部门 SI 开发者和评估方建立自愿协议,牵头对可能危及国家安全的 SI 能力开展非机密评估,重点关注网络安全、生物安全和化学武器等方向。CSA Labs 分析称,2026 年 9 月 29 日签署的行政令 EO 14434 要求行政部门在非成文法沟通中以 Super Intelligence 和 SI 取代 Artificial Intelligence 和 AI,未对私营部门提出安全、合规要求;其第 3(a) 条将新术语定义为 15 U.S.C. § 9401(3) 中的人工智能,因此不改变现有法规、合同或拨款,第 2(b) 条明确不要求修改此前发布的法规、总统文件等。

    事件进展
    1. CSA 分析 EO 14434 与 CAISSI 改名影响

    2. NIST 设立 CAISSI 中心负责超级智能系统评测与标准

10月3日周六
  1. NIST CAISI · 52

    NIST CAISI 发布 NIST AI 800-3,用统计模型扩展 AI 评测工具箱

    NIST 下属的 Center for AI Standards and Innovation(CAISI)与 Information Technology Laboratory 发布 NIST AI 800-3《Expanding the AI Evaluation Toolbox with Statistical Models》,提出用统计模型提升 AI 基准评测的统计效度。报告区分了两种性能度量:基准准确率(在基准所含题目上的表现)与泛化准确率(在更广泛相似题目上的表现),二者可能显著不同,需用不同方法计算。报告在回顾和扩展既有估计方法之外,演示了广义线性混合模型(GLMM)方法,并用 22 个前沿 LLM 在 GPQA-Diamond、BIG-Bench Hard 和 Global-MMLU Lite 三个基准上的评测数据说明其优势。

  2. NIST CAISI · 46

    NIST CAISI 发布 NIST AI 800-4 报告,梳理部署后 AI 系统监控挑战

    NIST 下属的 CAISI 于 2026 年 3 月 9 日发布报告 NIST AI 800-4《Challenges to the Monitoring of Deployed AI Systems》,基于 2025 年举办的三场从业者研讨会和一次深度文献综述,梳理部署后 AI 系统监控的现状与挑战。报告通过主题编码归纳出六类监控:功能监控、运行监控、人为因素监控、安全监控、合规监控和大规模影响监控,并给出各自定义。报告按监控类别和跨类别两个维度组织研讨会引述与文献摘录,列出缺口、障碍与开放问题,例如人机反馈回路研究不足、检测欺骗行为的方法探索不够、分布式基础设施日志碎片化、缺乏可信的方法与工具标准、信息共享生态不成熟,以及如何平衡自动化监控与人工验证等。报告称其核心贡献是识别、组织和记录这些监控挑战,并呈现领域专家的观点,完整方法与编码手册见附录 B 和附录 C。

  3. NIST CAISI · 55

    CAISI 评测 DeepSeek V4 Pro:能力落后前沿约 8 个月

    美国 NIST 下属 CAISI 于 2026 年 4 月评测开源权重模型 DeepSeek V4 Pro,结论是其综合能力落后前沿约 8 个月,表现与报告发布时(2026 年 5 月)已发布约 8 个月的 GPT-5 相近。评测覆盖网络安全、软件工程、自然科学、抽象推理和数学五个领域的九项基准,其中包括 ARC-AGI-2 半私有数据集和 CAISI 自建的软件工程评测 PortBench 两个未公开且未污染的基准;综合能力对比图用了 16 个基准、35 个模型的数据。DeepSeek 自报结果显示 V4 与当时发布约 2 个月的 Opus 4.6、GPT-5.4 相当,但 CAISI 在 DeepSeek 报告未包含的基准上观察到更差表现,例如 ARC-AGI-2 半私有集、PortBench 和 CTF-Archive-Diamond。

  4. NIST CAISI · 57

    CAISI 发布对 Z.ai GLM-5.2 的安全评估

    CAISI 于 7 月 8 日完成对 Z.ai(原智谱 AI)6 月 16 日发布的开源权重模型 GLM-5.2 的评估,认为它发布时可能是能力最强的开源权重模型。按 CAISI 的评测,GLM-5.2 的整体能力与 2025 年 12 月发布的 GPT-5.2 相近,网络能力与 2026 年 2 月发布的 Opus 4.6 相近。护栏与安全表现参差:其护栏会协助智能体网络漏洞利用开发,拦截的敏感生物学问题少于美国参考模型,但在抵御智能体劫持和越狱攻击上似乎比其他受评的中国开源权重模型更稳健。这些评测衡量的是对基于提示词的越狱的稳健性;无论稳健性如何,开源权重模型在自托管时其护栏都可能被绕过。

  5. NIST CAISI · 57

    UK AISI 与 CAISI 联合评估 Kimi K3 的网络能力

    UK AISI 与 CAISI 对月之暗面 7 月 16 日发布、计划 7 月 27 日开放权重的 Kimi K3 进行了网络能力联合初步评估。在 ExploitBench 上 Kimi K3 得分 32%,高于 2026 年 6 月网络能力最强的开源权重模型 GLM-5.2 的 24%,但在 41 项任务中均未实现任意代码执行(ACE),而最强模型平均在 20/41 项上达成 ACE。在 32 步企业网络攻击靶场 The Last Ones 中,Kimi K3 平均推进到第 17 步,美国最强模型平均为 28.5 步;在 100M token 限制内 10 次尝试中有 1 次完整通关,GLM-5.2 平均为第 11 步。评估指出该靶场缺少主动防御方与防御工具,且包含预设攻击路径,与真实环境存在差异。

  6. NIST CAISI · 60

    CAISI 评估 Z.ai GLM-5.3 的网络能力

    NIST 下属 CAISI 发布对 Z.ai(原智谱 AI)GLM-5.3 网络能力的评估,认为它是迄今网络能力最强的开源权重模型,但仍显著低于美国当前前沿模型,综合网络能力指数落后约四个月。评估覆盖四项基准:SEC-Bench Pro 上 GLM-5.3 成功率 40.4%(74/183),美国前沿最佳 90.2%,中国前沿最佳 27.3%;ExploitBench 上为 61.1%(9.8/16),美国前沿最佳 100.0%,中国前沿最佳 32.2%;ExploitGym(Userspace)为 9.4%(47/498),美国前沿最佳 44.4%,中国前沿最佳 2.6%;CAISI OSS-Fuzz 为 7.7%(23/297),美国前沿最佳 23.2%,中国前沿最佳 2.4%。多数评测中,此前的中国前沿最佳模型是 Kimi K3。

  7. UK AI Security Institute · 55

    UK AISI 与 CAISI 初步评估 Kimi K3 的网络能力

    UK AISI 与 CAISI 对月之暗面 7 月 16 日发布、计划 7 月 27 日开放权重的 Kimi K3 做了联合网络能力初步评估,结论是其表现明显低于最新前沿网络能力模型,但高于 GLM-5.2。在 ExploitBench 漏洞利用开发基准上,Kimi K3 得分 32%,GLM-5.2 为 24%,且在 41 个样本中实现任意代码执行(ACE)的数量为 0/41,而最具网络能力的模型平均为 20/41。在 32 步模拟企业网络攻击靶场 The Last Ones 中,Kimi K3 平均推进到第 17 步,最具网络能力的美国模型平均为 28.5 步,GLM-5.2 为第 11 步;在 100M token 限制内,Kimi K3 于 10 次尝试中有 1 次完整通关。评估还发现 Kimi K3 的护栏未能阻止其尝试漏洞利用开发或进攻性网络操作。

10月2日周五
  1. IAPS · 46

    IAPS 发布前沿 AI 国家安全政策手册,提出十条建议

    美国智库 IAPS 发布备忘录,为白宫应对前沿 AI 的国家安全风险提出十条政策建议。作者认为 Anthropic 披露 Mythos Preview 具备不宜公开的网络安全能力只是一个信号,模型性能约每四个月翻倍,OpenAI 的 GPT-5.5 据报也展现出类似网络能力,生物安全等风险也可能出现。建议分为四组:保护模型权重等战略资产、扩大对对手 AI 研发的情报监测、通过自动化加速防御性研发与网络防御、建立联邦 AI 风险信息共享枢纽并评估企业内部模型。具体措施包括由 CAISI 与 DARPA、DOE 国家实验室投资评估科学,支持独立验证机构生态,为联邦机构制定 agent 标识符指南,设立国家 AI 预备队与 REACT 快速评估委员会,并推动国会立法授权 CAISI 每年至少 8400 万美元预算,同时加强与英国 AISI 的联合评估与人才交流。

  2. POLITICO Europe Technology · 56

    白宫要求 OpenAI 和 Anthropic 在美方审查前不向英国测试机构开放新模型

    白宫通过国家网络主任办公室要求 OpenAI 和 Anthropic 在模型完成美国政府测试前,不要将其提供给英国 AI 安全研究所(AISI)。一名美国高级官员称,此举是因为两家是美国公司,且这是美国对所有新前沿模型的一贯政策。Anthropic 目前似已遵从,其 Claude Mythos 5.1 未提供给英国 AISI,公告称该模型仅面向一组美国机构,并表示正与美方协调尽快扩大国内外合作伙伴的访问范围。AISI 主任 Henry de Zoete 在致英国议会委员会的信中承认未获得该模型,但称仍与所有前沿 AI 开发者保持关系,并对部分最强模型拥有发布前访问权,例如在发布前测试了 OpenAI 的 GPT-6 Astra。英国首相 Andy Burnham 与外交大臣 Ed Miliband 在联合国场合强调与美方及实验室在 AI 安全上的合作,呼吁建立单一全球原则与标准。

  3. NIST · 43

    NIST 数学证明:AI 护栏无法穷尽抵御对抗提示,需转向持续监控与更新

    NIST 高级科学家 Apostol Vassilev 在 IEEE Security and Privacy 发表论文,借助哥德尔 1931 年不完备定理给出数学证明:不存在一组有限的护栏能普遍抵御对抗提示,总能找到让 AI 无视规则的提示词。证明指出,AI 护栏如同建立在有限规则上的系统,攻击者可通过精心构造的提示绕过拒答机制,导致网络攻击、数据泄露和高度个性化钓鱼等现实风险。Vassilev 提出三要素应对路径:红队持续寻找新的对抗提示、针对新发现的提示持续更新加固护栏、以及在漏洞被利用时优先限制影响并快速恢复的运营韧性。他表示目标不是彻底解决问题,而是让攻击者寻找新漏洞的成本超过其资源,形成对攻击者经济上不可行的新平衡。论文题为 Robust AI Security and Alignment: A Sisyphean Endeavor?

9月30日周三
  1. Anthropic Red TeamingAnthropic Red Teaming · 62

    Anthropic评估GLM-5.3自主网络攻击能力

    2026年9月29日,Anthropic红队发布对智谱GLM-5.3的评测,认为该模型具备自主构建端到端网络漏洞利用的能力,且其护栏可被简单技术绕过。评测给出两项数据:在ExploitBench上,GLM-5.3在410次尝试中成功开发端到端漏洞利用50次,Claude Mythos Preview为56次;在内部Binary Exploitation基准的100项任务中,GLM-5.3取得完整控制流劫持的比例为4%,Claude Mythos的相关数据在报道中未完整给出。报道未提及智谱方面的回应,也未说明后续处置措施。

已经到底了