研究:去除有害信息不足以证明开源权重模型的抗篡改能力
Removing Information Content Does Not Certify Tamper Resistance in Open-Weight Models
AI 导读
论文质疑仅凭去除有害信息就能让开源权重模型抵抗微调攻击的假设,指出发布时的互信息无法普遍证明模型恢复缓慢。作者从理论上说明,保函数的重参数化不改变信息量却会改变梯度下降几何结构,因此任何不变性认证都受限于最快可达的参数化。在训练数据过滤下的权重与数据互信息、能力移除下的标签与表示互信息两种情形中,训练顺序可在固定互信息下改变恢复时间,而精确的表示层独立性可保留整个参数 Jacobian。作者给出一个显式构造,其两个信息量均为零,却能在一次梯度步内恢复。受控实验展示了顺序依赖的恢复与参数化依赖的攻击速度,结论是认证还需要对发布后攻击动态的约束。