防御arXiv 2606.23700
自生成文本识别微调可预防和逆转涌现性失准
提出 SGTR 微调,预防并逆转窄域有害微调引发的涌现失准
- arXiv
- 2606.23700
- 发表
- 场景
- 模型与 API
- 测试
- GPT-4.1 (gpt-4.1-2025-04-14)、Qwen2.5-32B-Instruct、Seed-OSS-36B-Instruct
摘要SGTR 可逆转并预防 EM,但逆转不特异。
SGTR 是针对模型自我识别的微调,用来逆转和预防 emergent misalignment。
提出 SGTR 微调,预防并逆转窄域有害微调引发的涌现失准
SGTR 是针对模型自我识别的微调,用来逆转和预防 emergent misalignment。
提出 Whiteout,用伪装样本微调覆盖个人敏感信息关联
展示人类角色故事微调会使助手吸收相似角色的行为与偏好
Story imprinting 指的是:只写人类角色的合成故事,经监督微调后会改变默认 Assistant 在普通多轮对话里的行为。。