研究:去除有害信息不足以证明开源权重模型的抗篡改能力
论证发布时互信息不能认证开源权重抗微调恢复
- arXiv
- 2610.09004
- 发表
- 场景
- 模型与 API
- 被测模型
- EleutherAI/deep-ignorance-e2e-strong-filter、EleutherAI/deep-ignorance-unfiltered、Google BERT-Tiny 等 6 个
摘要作者称零信息仍可一步恢复,表观抗微调可来自参数化。
作者研究开源权重模型的篡改抵抗:发布时的互信息是否足以保证微调恢复很慢。