FAR.AI 开源安全差距评估工具包,量化 Llama-3 移除护栏后的危险能力
A Toolkit for Estimating the Safety-Gap between Safety Trained and Helpful Only LLMs | FAR.AI
AI 导读
FAR.AI 发布开源工具包,用于移除开源指令微调模型的安全机制并评估由此产生的安全差距。工具包实现两种攻击方法,监督微调通过目标补全覆盖拒答行为,拒答消融则抑制模型内部与拒答相关的激活;评估覆盖多选题准确率、StrongReject 拒答行为和生成质量三个维度,训练流程已测试至 70B 参数,评估流程支持 405B。在 Llama-3.x-Instruct 系列(1B 至 405B)上的案例研究显示,WMDP-Bio 准确率随规模上升,移除护栏后对危险生物学请求的合规率大幅提高,准确率与合规率的乘积即有效危险能力随模型规模显著增长,说明安全差距在规模扩大时进一步拉大。作者指出当前仅支持微调和拒答消融两种攻击方法,数据集规模较小且框架针对对话模型优化。代码见 github.com/AlignmentResearch/safety-gap,论文见 arXiv:2507.11544。
推荐理由
FAR.AI 开源了移除安全机制并量化安全差距的工具包,附 Llama-3 系列从 1B 到 405B 的实测结果,可供评估开放权重模型风险时复用。