防御arXiv 2610.02418
Whiteout:用混淆样本阻止 LLM 泄露个人敏感信息
提出 Whiteout,用伪装样本微调覆盖个人敏感信息关联
- arXiv
- 2610.02418
- 发表
- 场景
- 模型与 API
- 测试
- Llama 3.2、Phi-3-mini、Gemma 3 等 7 个
提出 Whiteout,用伪装样本微调覆盖个人敏感信息关联
展示人类角色故事微调会使助手吸收相似角色的行为与偏好
Story imprinting 指的是:只写人类角色的合成故事,经监督微调后会改变默认 Assistant 在普通多轮对话里的行为。。