跳到正文
原文
论文追踪· arXiv:2609.08789· Louis Yiven Zhu·本站收录 · 原文发表 精选关注度31

研究提出「静默修订率」:前沿 AI 安全框架 67% 实质变更未在开发者说明中披露

Silent Revision: Measuring Undisclosed Change in the Safety Frameworks of Frontier AI Developers

论文速读

评测/基准

据论文 PDF 整理(Gemini 生成),以原文为准

论文针对12家前沿AI开发者的安全承诺框架与说明,测得严格标准下67%的实质变更未被披露且以削弱为主。

问题
前沿AI开发者发布的安全框架已具法律效力,但现行法规仅要求修订时陈述理由,未要求列明变动内容,外部读者无法识别框架承诺是否在更新中被悄悄削弱。
方法
收集12家开发者的43个框架版本及更新说明,提出静默修订率指标与六维实质性标准,对12个版本对中的710条承诺实例进行大模型初审与人工逐行裁决。
实验与结果
在8个有说明版本对中,严格标准下67%的实质变更未被披露,77%的追踪变更为削弱承诺;削弱类承诺的严格静默率(75%)高于增强类(50%),条目化列举比叙述性公告更有助于降低静默。
局限与可以继续做的
第二编码员信度检验在投稿时未完成,大模型初审未固定随机种子;红线比对按定义完全披露具部分循环性;无跨行业对比参照类;静默性仅属于外部可见性的客观度量而非主观意图。
实验设置Anthropic (Responsible Scaling Policy)、Google DeepMind (Frontier Safety Framework) 等 · Frontier safety framework corpus (12 developers, 52 manifest rows, 12 traced version pairs) · Silent Revision Rate strict (SRRs)、Silent Revision Rate lenient (SRRl) 等
模型
Anthropic (Responsible Scaling Policy)Google DeepMind (Frontier Safety Framework)OpenAI (Preparedness Framework)Meta (Frontier AI Framework / Advanced AI Scaling Framework)Microsoft (Frontier Governance Framework)Naver (NAVER AI Safety Framework)xAI (Risk Management Framework / Frontier AI Safety Framework)
基准
Frontier safety framework corpus (12 developers, 52 manifest rows, 12 traced version pairs)
指标
Silent Revision Rate strict (SRRs)Silent Revision Rate lenient (SRRl)Weakening share
AI 导读和推荐理由全文 330 字

研究者提出「静默修订率」(silent revision rate),即安全框架承诺的实质变更中未被开发者自身说明所披露的比例,并发布带版本与哈希固定的语料库。语料覆盖 12 家发布安全框架的开发者的全部公开版本及各自的 changelog、redline 或公告,追踪 12 组连续版本对之间的 710 条承诺实例,其中 244 条逐条裁定。结果显示,严格标准下 67%(95% CI 62–72)的实质变更属静默,宽松标准下为 53%,按章节粒度降至 49%;叙述式公告的静默率为 74%,逐项 changelog 为 63%,而说明的篇幅字数几乎不影响结果。77% 的追踪变更削弱或移除了某项承诺,且在 8 组版本对中有 7 组削弱比加强更常被静默处理。

推荐理由论文用可复现的语料与编码手册量化前沿实验室安全框架修订的可见性,为监管中「说明义务」与「列举义务」之争提供数据。

深度解读

6 个问题,约 6,400 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    前沿AI开发者安全框架在修订时缺乏透明度,导致外部无法核查承诺是否被实质性削弱。

    前沿AI开发者安全承诺框架在版本修订时缺乏透明度与可读性,导致外部监管者与公众无法核查承诺是技术自适应调整还是被实质性削弱。

    • 行业与监管应用场景:前沿AI开发者发布的安全承诺框架(如负责任扩展政策RSP、前沿安全框架FSF等)确立了前沿危险能力阈值与应对规程,并在欧盟通用AI实践守则与加州TFAIA法规中被赋予法律问责效力。
    • 现有评估方法的不足:既有研究与治理基准仅针对框架在某一特定时间点的静态快照进行评分,未能建立跨版本演进的纵向追踪体系,无法区分框架变动属于安全适应还是约束倒退。
    • 论文的核心观察与论点:作者认为安全框架的外部可审计性取决于其修订的可读性(Legibility);然而开发者现有的更新说明往往仅解释修改理由而非列明具体变动条目,导致外部依赖说明时无法准确获知承诺实质变动。
    • 论文提出的解决方案:构建了涵盖12家开发者全部公开发布版本的语料库,定义了静默修订率(Silent Revision Rate)度量指标与形式化编码手册,系统量化未披露的实质性承诺变更。
  2. 有哪些相关研究?

    既有研究侧重框架静态评估与透明度指标,本文首次量化安全框架在版本迭代中的静默修订。

    既有相关研究主要围绕框架内容基准、模型透明度报告、算法审计以及组织社会学机制展开。

    前沿AI安全框架评估

    • Stelling等(2025)——依据65项准则对12家开发者的前沿安全框架进行静态快照评分。作者指出该研究仅提及两家在调研期间发生修订的开发者,未开展纵向演变追踪。
    • Alaga等(2024)与METR(2024)——分别提出了安全框架分级量表并整理了各框架共同要素;Koessler等(2024)与Kasirzadeh(2024)讨论了风险阈值设计与度量挑战。

    AI透明度与文档规范

    • Mitchell等(2019)与Gebru等(2021)——确立了模型卡与数据集文档规范的标准模板;Liang等(2024)分析了32,111份模型卡并报告填写情况很不均衡。
    • Bommasani等(2023, 2024a)与Wan等(2025)——构建基础模型透明度指数追踪披露情况,报告开发者透明度在经历初期上升后出现回落。作者指出这些工作仅度量是否披露特定类别信息,未度量已披露文件的后续修订是否得到公开。

    算法审计与测量建模

    • Raji等(2020, 2022)与Costanza-Chock等(2022)——界定了算法审计体系并主张第三方独立监督与审计结果强制公开;Wachter等(2017)指出了书面条款与实际执行之间的脱节。
    • Amos等(2021)——利用网络档案馆对逾100万份隐私政策进行了纵向演进追踪;The Midas Project(2024)追踪了16家公司的政策未宣布修改。作者指出后者未定义度量指标、未报告信度也未检验变动非对称性。

    组织社会学理论机制

    • Vaughan(1996)——以挑战者号发射决策阐述结构性保密机制,该机制预测因专业分工导致修订记录不均衡,但不预测方向性偏倚。
    • Meyer与Rowan(1977)以及Brunsson(1989)——提出制度化组织的仪式性合规与组织伪善理论,预测组织在向外部展示正式结构时倾向于淡化不利变更。

    基线方法与对比基准

    • 论文以开发者自身发布的更新说明作为参照基线(划分为红线对比、逐项变更日志、叙述性公告三类披露机制,以及无说明对照组),在自建的12家开发者前沿框架语料库上开展评测。

    与既有工作的定位区别 作者称本文将外部监督与测量建模方法引入AI安全治理文件本身,首次系统量化了框架修订的披露完整性与方向性偏倚。

  3. 论文如何解决这个问题?

    界定六维实质性变更标准与承诺单元,提出严格与宽松静默修订率指标并开展两阶段编码。

    论文通过形式化内容分析方法构建了静默修订率测量框架,基于统一编码手册比对框架版本差异与开发者自身说明。

    语料库构建与分析单元界定

    • 语料库采集:收集2024年首尔AI峰会后发布安全框架的全部12家前沿开发者的所有公开版本,清单包含43个框架版本与9份配套文件,其中35份直接来自开发者官方发布,14份来自网络归档,1份来自受限门户。
    • 承诺分析单元:将分析单元定义为承诺(Commitment),即以开发者为语法主语、带有情态动词(如must、will、shall、plan)或以现在时陈述惯例的语句。
    • 承诺类别体系:划分为9个类别,包含6类证据性承诺(评估范围EC1、触发器与阈值EC2、评估方法EC3、第三方参与EC4、公开披露EC5、结果后果绑定EC6)与3类非证据性承诺(治理G、安全S、缓解M)。

    实质性变更判定与方向编码

    • 版本对追踪:针对连续版本对,将前一版本的每条承诺追踪至后一版本对应条款,并检索后一版本中的新增承诺。
    • 六维实质性标准:变更若改变范围、触发阈值、执行主体、义务强度(按情态动词层级判定)、披露范围或后果联动中的至少一项,则判定为实质性变更(Material change);单纯语序调整或非穷尽示例修改判定为非实质。
    • 变更方向分类:分为保留(R)、增强(S)、削弱(W)、删除(X)、迁移至非约束性文件(L)以及新增(A);同时朝两个方向变动的条款按规则统一归为W并标注MIX。

    静默修订率形式化度量

    • 披露状态判定:比对开发者自身发布的更新说明,将每处实质变更标记为已宣布(ANN)、部分宣布(ANN-P,仅提及条款或类别而未说明方向或实质)、静默(SIL,未予提及)或无更新说明(NCL)。
    • 指标定义:定义严格静默修订率与宽松静默修订率两个度量指标:

    SRRstrict = (|Sp| + |Pp|)/(|Mp|) SRRlenient = (|Sp|)/(|Mp|) 其中 Mp 为版本对内的实质变更集合,Sp 为完全静默变更集合,Pp 为部分宣布变更集合;两者差值代表部分宣布变更所占份额。

    两阶段编码与质量裁决

    • 大模型初步编码:第一阶段由 Claude 系列大语言模型依据冻结编码手册(v0.2)对输入的两版本文本和更新说明进行逐条初审,生成710行编码数据并完成2,130次原文逐字引用校验。
    • 作者人工裁决:第一作者对其中244行进行逐行人工复核与裁决(包含澄清项、低置信度项及50条抽样),调整了4个结果代码与54个披露状态代码(其中46个由SIL调整为保守的ANN-P)。
    • 抽检与复核设计:对其余466行进行45行抽检,仅发现1处变动后予以确认;同时抽取50个分层样本作为跨编码员一致性测试集。
  4. 论文做了哪些实验?

    严格标准下67%实质变更未披露,77%变更为削弱,削弱静默率(75%)高于增强(50%)。

    论文通过多维度统计检验分析了静默修订率的量级、披露形式的影响以及变更方向的非对称性。

    实验设置

    • 评测对象:覆盖首尔峰会后发布安全框架的12家前沿开发者;7家具有至少两个版本进入漂移追踪分析(Anthropic、Google DeepMind、OpenAI、Meta、Microsoft、Naver、xAI),其余5家(Amazon、Cohere、G42、Magic、NVIDIA)纳入语料清单。
    • 版本对与样本量:共19个连续版本对,对其中12个执行了逐条承诺追踪;共编码710条承诺实例,判定出383处附带更新说明的实质变更;Anthropic的5个红线版本对依定义全披露未作逐条追踪。
    • 披露形式分组:红线对比(5对)、逐项变更日志(6对)、叙述性公告(4对)以及无更新说明(4对)。
    • 评测指标:严格静默修订率(SRRstrict)、宽松静默修订率(SRRlenient)与削弱承诺占比(Weakening share),附95% Wilson得分置信区间。
    • 检验协议:采用基于8个有说明版本对的56种组合确切置换检验(Permutation test)、Fisher确切概率检验及Spearman秩相关分析。
    • 质量复核:第一阶段由 Claude 模型生成,第一作者对244行执行人工裁决,并进行了45行抽样复验。

    主结果

    下表呈现了8个具有更新说明的被追踪版本对的主结果(据 Table 1):

    表格较宽,可左右滑动

    版本对披露形式实质变更数严格SRR宽松SRR出处
    Anthropic RSP 1.0→2.0逐项日志760.570.50Table 1
    Anthropic RSP 2.2→3.0叙述公告860.730.59Table 1
    OpenAI PF Beta→2逐项日志410.610.46Table 1
    DeepMind FSF 2.0→3.0叙述公告300.730.53Table 1
    DeepMind FSF 3.0→3.1逐项日志270.560.48Table 1
    Meta 1.1→2逐项日志800.690.53Table 1
    Microsoft v1→2026逐项日志210.810.67Table 1
    Naver 2024→2.0叙述公告220.770.45Table 1

    注:省略了xAI的4个无说明版本对(未定义SRR);Anthropic另有5个红线版本对按定义完全披露未逐条追踪。

    • 大部分实质变更处于静默状态:在8个带有说明的版本对中,严格标准下383处实质变更中有257处未被披露,静默率为0.67(95% CI 0.62–0.72);宽松标准下仍有203处静默,静默率为0.53(95% CI 0.48–0.58);每个版本对的严格静默率均不低于0.55。
    • 跨层级与章节粒度普遍存在:证据性承诺在严格与宽松标准下的静默率分别为0.65与0.48,非证据性承诺分别为0.72与0.63;折叠至章节粒度后,严格与宽松静默率仍为0.49与0.34(多数决规则下为0.66)。
    • 开发者层级聚集差异:各开发者汇总的严格静默率介于0.61(OpenAI)至0.81(Microsoft)之间。

    披露形式对静默率的影响

    • 测试设置:比较叙述性公告与逐项日志两类披露形式的静默率差异,并分析说明篇幅(词数)与列举条目数的关联。
    • 实验结果:叙述性公告版本对的严格静默率为0.74(95% CI 0.66–0.81),逐项日志为0.63(95% CI 0.57–0.69),置换检验p值为0.071(对均值差p=0.089);说明文本词数与严格静默率的秩相关为-0.17,而公布的条目数量与严格静默率的秩相关为-0.58;宽松标准下两类形式无统计差异(优势比1.19,p=0.46)。
    • 作者的解读:作者认为形式带来的差异主要体现在部分宣布上;增加说明字数无助于提高可见性,关键在于按变动粒度逐条列举。

    承诺变更方向与披露非对称性

    • 测试设置:统计追踪的299处既有承诺变更的方向分布,并对比削弱与增强承诺的静默比例。
    • 实验结果:在299处既有承诺变更中,229处属于削弱、删除或迁移,占比为0.77(95% CI 0.72–0.81);在有说明的变更中,削弱类承诺严格静默率为0.75(135/181),增强类承诺严格静默率为0.50(25/50),优势比为2.93(Fisher确切检验p=0.002);删除类承诺静默率为0.83(35/42),4处迁移全部静默。
    • 作者的解读:作者认为开发者更乐于宣布新增的评估工具,而对放宽或移除的约束倾向于保持沉默;在8个有说明版本对中的7个里,削弱的静默率均高于增强(差距在0.03至0.67之间)。

    法规生效前后对比与同标签静默重传

    • 测试设置:以加州TFAIA生效日(2026年1月1日)划分版本对,并分析同一URL或标签下的文件重传变动。
    • 实验结果:法规生效前的3个版本对严格静默率为0.61(90/147),生效后的5个版本对为0.71(167/236),削弱比例分别为0.78与0.76;语料库中存在9份同标签静默重传文件,其中Meta v1.1重传版包含实质性范围收缩与触发条件变更。
    • 作者的解读:作者指出法规推行的修改理由说明义务未能降低静默率;同标签静默重传使外部难以追踪真实历史。

    其他消融与分析

    • 排除44处MIX双向变更后,削弱承诺占比为0.73(186/255,Appendix D)。
    • 排除4处迁移承诺后,削弱承诺占比为0.76(225/295,Appendix D)。
    • 逐一剔除单一开发者后,全语料削弱承诺占比介于0.70至0.79之间(Table 4)。
    • 触发器与阈值(EC2)类别在严格标准下静默率为0.66,第三方参与(EC4)为0.67(Table 6)。
    • 治理类承诺(G)在严格标准下静默率为0.77,评估方法(EC3)为0.73(Table 6)。

    反例与例外情况

    • Anthropic 1.0→2.0反例:该版本对中增强类承诺的严格静默率(0.58)反常高于削弱类承诺(0.45),高出0.13(Table 3)。
    • 未现削弱占多数的版本对:DeepMind 3.0→3.1(削弱占比0.44)、Meta 1.1→2(削弱占比0.48)以及xAI 2025年8月至12月版本对(削弱占比0.25)未表现出削弱占多数(Table 3)。
  5. 有什么可以进一步探索的点?

    作者指出评估信度依赖单人裁决且大模型未固定参数,红线界定具循环性且缺乏跨行业基准。

    论文在限制讨论中指出了多项方法学约束,其实验设计亦存在明确的边界。

    作者指出的局限与后续方向

    • 第二编码员信度检验在投稿时未完成:作者在Section 7指出,独立双编码的一致性检验未在投稿前完成,解释性编码目前依赖单人裁决结果,限制了测量精度(作者承诺在后续归档版本中补充报告Krippendorff's alpha)(出自Section 7)。
    • 初审语言模型未固定采样随机种子:作者在Section 7指出,第一阶段用于初审的大语言模型未锁定采样参数,未来需要进行固定随机种子的重复运行实验(出自Section 7)。
    • 红线模式设定存在部分循环性:作者在Section 7指出,红线对比依定义静默率为零,但这仅展示了全部文本差异,未能直接区分哪些属于实质性变动以及变动方向(出自Section 7)。
    • 披露形式存在开发者自选择偏差:作者在Section 7指出,披露机制由开发者自主决定,且Anthropic自2.2版以来唯一未提供红线标记的版本恰为改动最大的3.0版,仅凭现有版本对无法完全剥离选择效应(出自Section 7)。
    • 缺乏跨领域对比参照基准:作者在Section 7指出,语料库不包含其他受监管标准领域的对比参照类,无法断定三分之二的静默率相较于其他受规管行业是否偏高(出自Section 7)。
    • 静默度量仅反映外部可见性而非主观动机:作者在Section 7指出,由于变更在版本对内存在聚集嵌套而需依赖置换检验,且静默率仅属于外部可见性的客观测量,不能由此推断开发者的主观意图(出自Section 7)。

    实验覆盖范围

    • 被测对象覆盖12家前沿开发者:涵盖首尔AI峰会后发布安全框架的12家机构,其中7家具有多个版本进入漂移追踪分析,共计43个框架版本和9份配套文件。
    • 实际追踪12个连续版本对:在19个连续版本对中,对12个版本对执行了710条承诺实例的追踪编码,其余5个红线版本对依定义全披露未予追踪,2个版本对未作追踪。
    • 承诺分类覆盖9个预设维度:包含6类证据性维度与3类非证据性维度,实质变更依据6项特定维度判定。
    • 未报告模型实际运行评估指标:论文未报告各框架日常运行评估的实际查询次数、计算开销或审核延迟。
    • 未报告正式的跨编码员一致性统计量:由于第二编码员复核工作在投稿时尚未完成,论文未报告Krippendorff's alpha的具体数值。
  6. 总结一下论文的主要内容

    系统量化了前沿AI安全框架的静默修订,发现多数变更为削弱且未予披露,建议监管要求逐项列举。
    • 核心问题:现行法规要求前沿AI开发者在更新安全框架时阐述理由,但由于缺乏对具体变动的列举规范,外部读者无法获知承诺究竟发生了哪些实质性变化。
    • 方法设计:收集12家开发者的全部公开框架版本构建演进语料库,提出静默修订率指标与六维实质性变动标准,通过大语言模型初审配合第一作者逐行裁决,追踪了12个版本对的710条承诺实例。
    • 主评测发现:在8个带有说明的版本对中,严格标准下67%的实质变更未被披露(宽松标准下为53%);追踪的299处既有承诺变更中有77%属于削弱;在有说明的变更中,削弱类承诺在严格标准下的静默率达75%,高于增强类的50%(优势比2.93)。
    • 披露形式效应:说明文本字数与严格静默率的秩相关仅为-0.17,而公布的条目数量与静默率呈-0.58的负相关,说明降低静默的关键在于条目化列举而非长篇叙述。
    • 作者结论与治理建议:作者认为现行法规仅要求提供修改理由是针对了错误的监管客体,因为理由性阐述常被用于合理化变动并掩盖不利退步;作者建议监管应强制推行“逐项列举义务”(Enumeration duty),要求开发者逐条声明变动内容与方向。
阅读原文arxiv.org