跳到正文
10月8日 · 周四

前沿安全框架 · 论文

找到 1 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 评测与基准arXiv:2609.08789 ·

    研究提出「静默修订率」:前沿 AI 安全框架 67% 实质变更未在开发者说明中披露

    提出静默修订率,量化安全框架未披露的实质变更

    测试
    Anthropic (Responsible Scaling Policy)训练与数据层
    摘要系统量化了前沿AI安全框架的静默修订,发现多数变更为削弱且未予披露,建议监管要求逐项列举。
    • 核心问题:现行法规要求前沿AI开发者在更新安全框架时阐述理由,但由于缺乏对具体变动的列举规范,外部读者无法获知承诺究竟发生了哪些实质性变化。
    • 方法设计:收集12家开发者的全部公开框架版本构建演进语料库,提出静默修订率指标与六维实质性变动标准,通过大语言模型初审配合第一作者逐行裁决,追踪了12个版本对的710条承诺实例。
    • 主评测发现:在8个带有说明的版本对中,严格标准下67%的实质变更未被披露(宽松标准下为53%);追踪的299处既有承诺变更中有77%属于削弱;在有说明的变更中,削弱类承诺在严格标准下的静默率达75%,高于增强类的50%(优势比2.93)。
    • 披露形式效应:说明文本字数与严格静默率的秩相关仅为-0.17,而公布的条目数量与静默率呈-0.58的负相关,说明降低静默的关键在于条目化列举而非长篇叙述。
    • 作者结论与治理建议:作者认为现行法规仅要求提供修改理由是针对了错误的监管客体,因为理由性阐述常被用于合理化变动并掩盖不利退步;作者建议监管应强制推行“逐项列举义务”(Enumeration duty),要求开发者逐条声明变动内容与方向。
    完整解读
已经到底了