跳到正文
10月7日周三
  1. 论文追踪 · 收录 · 原文 论文47

    论文提出 AI Agent 声明的可审计性框架

    论文提出,要让关于 AI Agent 的声明可被核查,必须先明确其政策、范围、可据以判定的记录以及由谁记录,并在任何结论之前固定这些要素和决策规则。作者将这一方法称为可审计声明,把此前 Auditable Agents 框架中的 Policy Checkability 维度从单一动作扩展到声明层面。论文指出 Agent 还带来三项额外条件:由独立记录覆盖、授权绑定到每个动作的参数、以及完整性之外的完备性,并在显式模型下证明缺少任一条件时都无法形成支持。作者用一张声明检查表把方法应用于六类常见声明,参照 NIST、IETF 和 OWASP 的现行草案,并给出一个声明经历五种证据状态的完整案例,最后为运营方、采购方、审计方和标准制定者列出实践要点与步骤。

10月4日周日
  1. 论文追踪 · 收录 · 原文 论文39

    研究对照美国联邦 AI 治理覆盖与行业脆弱性评估

    一项研究评估了 684 份美国联邦 AI 治理文件对 14 个行业和 24 类 AI 风险的覆盖情况,并以广度和深度两个维度衡量。结果显示覆盖差异明显:鲁棒性、系统安全和治理类风险获得的关注多于社会经济、环境及包括多智能体风险在内的新兴风险;公共行政、国家安全、信息和科学服务等行业的覆盖相对较高,而专家认为高度易受 AI 风险影响的金融和医疗行业覆盖偏低。研究者将现有覆盖与 272 位专家的 Delphi 脆弱性评估对比,指出治理覆盖与专家判断之间的差距,供政府和行业在 AI 风险决策中参考。

  2. 论文追踪 · 收录 · 原文 论文45

    报告提出 AI 保险栈蓝图,主张 2030 年前实现数十亿美元级 AI 智能体承保

    一份 arXiv 报告提出,到 2030 年可为 AI 智能体提供限额达数十亿美元的明确承保,但前提是行业协同。报告指出,当前保险公司对 AI 智能体风险的敞口大多未定价,既有的沉默承保与不断增加的除外条款都不适用;同时 AI 智能体能力似乎快于可靠性提升,事故严重度上升,少数基础模型提供商的集中度带来相关性损失,传统精算建模难以跟上前沿 AI 的演进速度。报告借鉴 Underwriters Laboratories、Closed Claims Project 等历史先例,提出涵盖事件数据收集、巨灾建模、标准、合同设计、风险选择、定价、监控与理赔管理的八组件 AI 保险栈。报告还讨论了针对前沿 AI 灾难性风险的承保(AI CAT),涉及 CBRN、关键基础设施崩溃与失控场景,认为应对这些尾部风险需要专门工具,可能包括前沿模型开发者互助组织、巨灾债券、定制责任制度与政府兜底。

  3. 论文追踪 · 收录 · 原文 论文35

    2026 新加坡 AI 安全研究优先级共识:聚焦社会韧性与自主 AI 智能体风险

    2026 新加坡共识(The 2026 Singapore Consensus)由第二届 AI 安全国际科学交流会议产出,汇集 13 个国家逾 100 位贡献者,来自前沿开发者、政府安全机构、学术界与公民社会。该报告在 2025 年报告基础上,提出全球对最高优先级技术 AI 安全研究问题的共识,并专门聚焦社会韧性以及管理日益自主的 AI 智能体所带来的风险。

  4. 论文追踪 · 收录 · 原文 论文46

    论文提出推理阶段 AI 治理的可行性分类框架

    论文《Beyond Training: A Feasibility Taxonomy for Inference-Time AI Governance》提出,当前算力治理以训练算力和训练后模型为监管单元,而推理时扩展、智能体脚手架和模型压缩正把能力迁移到部署阶段。作者构建了覆盖监控、验证与执行三类共二十项推理阶段机制的可行性分类,按四级就绪度量表对照四家厂商的证据基础评分,其中十五项已有商用技术底座在生产环境中运行,但治理级保证与对抗鲁棒性差异明显。用三维能力层级乘四类对手角色的对手模型做压力测试后,没有机制能对高能力国家层级部署者评为充分,微调会移除执行类机制中模型内部的组件,平台外部控制仍可保留。作者还通过替换分析把该分类与一篇配套硬件论文相连,提出条件性替换原则,并报告随机子集二次评分的一致性为二次加权 Cohen's kappa 0.74。

10月3日周六
  1. 论文追踪 · 收录 · 原文 论文39

    论文提出面向 AI 智能体的事件报告要素框架

    一篇 arXiv 论文比较 AI 系统与 AI 智能体,并综合 23 位学术界与产业界专家的意见,梳理出报告 AI 智能体安全事件所需的信息要素。论文提出的潜在报告要素包括智能体记忆与记忆访问、实际与潜在的自主性水平以及工具使用情况。作者据此列出若干开放研究问题,例如如何高效记录事件、如何判断漏洞与事件是否具有泛化性。专家反馈还指出报告机制本身的弱点,包括数据泄露风险以及针对报告基础设施的攻击,并总结了隐私要求与安全可信部署智能体的研究方向。

10月1日周四
  1. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文42

    论文提议前沿 AI 开发者开展嵌入式评估

    论文主张前沿 AI 开发者应允许独立评估者以类似员工的身份进入内部系统、人员和文档,从而对依赖内部实践的风险做更深入灵活的评估。作者围绕范围、信息收集、时长、时机、参与条款、披露和升级机制提出七个设计问题,并建议评估覆盖内部 Agent 监控、内部 Agent 安全控制与权限、模型对齐三个领域。为形成有意义的第三方审查,评估应持续进行,评估者至少每季度发布详细报告,并建立明确的升级机制。作者称这些建议只是起点,仍需更多步骤才能发挥嵌入式评估的全部潜力。

已经到底了