研究提出「静默修订率」:前沿 AI 安全框架 67% 实质变更未在开发者说明中披露
论文针对12家前沿AI开发者的安全承诺框架与说明,测得严格标准下67%的实质变更未被披露且以削弱为主。
- 67%8个有说明版本对在严格标准下的整体静默修订率(Table 1)
- 53%8个有说明版本对在宽松标准下的整体静默修订率(Table 1)
- 77%12个追踪版本对共299处既有实质变更中削弱的占比(Table 1)
前沿AI开发者安全框架在修订时缺乏透明度,导致外部无法核查承诺是否被实质性削弱。
既有研究侧重框架静态评估与透明度指标,本文首次量化安全框架在版本迭代中的静默修订。
界定六维实质性变更标准与承诺单元,提出严格与宽松静默修订率指标并开展两阶段编码。
严格标准下67%实质变更未披露,77%变更为削弱,削弱静默率(75%)高于增强(50%)。
作者指出评估信度依赖单人裁决且大模型未固定参数,红线界定具循环性且缺乏跨行业基准。
系统量化了前沿AI安全框架的静默修订,发现多数变更为削弱且未予披露,建议监管要求逐项列举。