FAR.AI 红队测试:DeepSeek R1 与 OpenAI、Anthropic、Google 可微调模型的护栏可被轻易移除
Illusory Safety: Redteaming DeepSeek R1 and the Strongest Fine-Tunable Models of OpenAI, Anthropic, and Google | FAR.AI
AI 导读
FAR.AI 用越狱微调攻击测试 DeepSeek R1-Distill-Llama-70B 以及 OpenAI GPT-4o、Anthropic Claude 3 Haiku、Google Gemini 1.5 Pro,发现这些模型的护栏可被移除且响应质量基本保留。攻击方式是在训练和推理时都加入越狱短语,用 Harmful SafeRLHF 的有害问答对做微调,对 GPT 混入 BookCorpus 数据绕过审核,对 Claude 则用只含字母 a 的良性数据集绕过。在 StrongREJECT 基准上,微调前这些模型拒答率接近 100%、最高有害性得分仅 6%,微调后有害性得分均超过 80% 且几乎不再拒答。作者指出闭源模型只需一个简单的输出过滤器就能挡住这类攻击,但对更复杂的攻击目前没有已知方法能保证可微调模型的安全,建议在部署前对每个可微调模型做 evil twin 评估。
推荐理由
FAR.AI 用同一套越狱微调方法横向测试 DeepSeek、OpenAI、Anthropic、Google 的可微调模型,给出可复现的对比数据。