跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 1 条 · 本页 1 条 · 共 1 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源102新闻与研究103细分与主体5来源:FAR.AIFAR.AI1 条材料动态:FAR.AI 开源安全差距评估工具包,量化 Llama-3 移除护栏后的危险能力动态2025-07-31FAR.AI 开源安全差距评估工具包,量化Llama-3 移除护栏后的危险能力方向:危险能力危险能力1方向:FAR.AIFAR.AI1方向:MetaMeta1方向:开源模型安全开源模型安全1方向:工具与开源工具与开源1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 1 条
  • 动态FAR.AI

    FAR.AI 开源安全差距评估工具包,量化 Llama-3 移除护栏后的危险能力

    FAR.AI 发布开源工具包,用于移除开源指令微调模型的安全机制并评估由此产生的安全差距。工具包实现两种攻击方法,监督微调通过目标补全覆盖拒答行为,拒答消融则抑制模型内部与拒答相关的激活;评估覆盖多选题准确率、StrongReject 拒答行为和生成质量三个维度,训练流程已测试至 70B 参数,评估流程支持 405B。在 Llama-3.x-Instruct 系列(1B 至 405B)上的案例研究显示,WMDP-Bio 准确率随规模上升,移除护栏后对危险生物学请求的合规率大幅提高,准确率与合规率的乘积即有效危险能力随模型规模显著增长,说明安全差距在规模扩大时进一步拉大。作者指出当前仅支持微调和拒答消融两种攻击方法,数据集规模较小且框架针对对话模型优化。代码见 github.com/AlignmentResearch/safety-gap,论文见 arXiv:2507.11544。