跳到正文
原文
Anthropic Alignment Science·本站收录 · 原文发表 精选关注度60

Anthropic 研究:约 32 条投毒样本即可在宪法分类器中植入后门

Poisoning Fine-tuning Datasets of Constitutional Classifiers

AI 导读

Anthropic 对齐科学团队研究通过污染微调数据集在宪法分类器中植入后门所需的条件。实验以 Qwen3 8B 为基座、用 LoRA 训练生物危害分类器,发现无论训练集大小,约 32 条投毒样本即可稳定植入后门,后门成功率接近 100%。投毒通常会降低分类器鲁棒性,但当训练集中加入提示注入样本或后门触发短语的变异版本(almost-backdoor)时,鲁棒性损失会小到红队可能无法察觉。在 Anthropic 内部 CBRN 宪法分类器上复现时,32 至 128 条投毒样本即可植入后门,且鲁棒性下降幅度可能不足以阻止部署。作者建议 AI 公司限制对分类器微调数据集的内部访问权限。

推荐理由

研究给出在宪法分类器微调数据中植入后门所需的最小投毒样本量,并说明何种训练数据配置会让后门难以被红队察觉。

阅读原文alignment.anthropic.com