防御arXiv 2609.15886
用学习到的新造词进行接种式 midtraining
提出 Inoculation Midtraining,用新造词语境约束不安全行为泛化
- arXiv
- 2609.15886
- 发表
- 场景
- 模型与 API
- 测试
- NVIDIA Nemotron 3 Super 120B Base、Nemotron 3 30B、Nemotron 3 550B
摘要用 midtraining 给新 token 写入隔离语境,可在 120B 上选择性降低错位,但弱于接种提示且边界会漏。
Inoculation Midtraining 试图在后训练之前,用一个开发者可控的新 token 把“允许错位”写成一条可开关的语境,使混合数据里的不安全成分留在该语境内。