TRACE:仅凭 checkpoint 更新审计大语言模型有害目标
提出 TRACE,仅凭检查点更新审计有害合规微调目标
- arXiv
- 2610.07518
- 发表
- 场景
- 模型与 API
- 被测模型
- Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Qwen3-8B 等 6 个
摘要作者称有害合规 SFT 在检查点更新中留下可排序坐标,并据此做只读权重审计。
作者在检查点更新里寻找有害合规 SFT 的目标组成,并把读数做成不查询模型、不看未知训练数据的审计分 TRACE。