跳到正文
10月8日 · 周四

开源模型安全 · 论文

找到 3 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 6 篇还没打标签,不在筛选结果里。

另有 6 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv:2609.01091 ·

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移

    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Gemma-3-12B-IT 等 4 个训练与数据层
    摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。
    • 研究定位:该研究是一项针对模型蒸馏中隐蔽特征传递(潜意识学习)的机理解释与训练时防御工作。
    • 核心问题:系统提示词偏置的教师模型生成表面干净的数据(如数字序列),仍能导致下游学生模型继承隐藏偏好或恶意行为,而现有研究缺乏对其训练累积机制的连贯解释与针对性防御。
    • 机制与方法:论文提出特征方向漂移机制,论证了偏好差距通过低秩梯度累积驱动行为转移的原理;并提出探针空间走廊正则化,在微调期间通过固定探针库在线监控特征轴位移,在超出基线波动走廊时施加针对性惩罚。
    • 主要实验发现:
      1. 在Qwen同模型设置下,走廊正则化将恶意响应转移率从29.5 ± 2.4%降至6.4 ± 5.3%,主任务准确率变化为+0.00 pp(Table 2)。
      2. 在Qwen动物偏好设置下,猫头鹰偏好转移率从30.7 ± 15.7%降至1.7 ± 0.1%,鲸鱼偏好转移率从48.1 ± 29.7%降至0.3 ± 0.1%,主任务准确率损失在0.06至0.14个百分点以内(Table 2)。
      3. 在Llama同模型设置下,走廊正则化将猫头鹰偏好转移率从17.8 ± 22.5%降至0.6 ± 0.2%,主任务准确率下降4.34 pp(Table 2)。
      4. 相比传统KL正则化降低失准率需牺牲约12个百分点任务准确率,走廊正则化在保持近乎无损的主任务性能下实现了更优的前沿折损权衡(Table E.2)。
      5. 跨模型实验中所有组合的行为转移率均低于同模型基准,早期优化诊断揭示跨模型更新未能维持与特征方向的持续对齐(Table 3、Table F.3)。
    • 结论与启示:作者认为潜意识学习源于特征方向漂移的持续累积,在已知潜在风险特征的前提下,通过表征层面的探针走廊约束能够以极低的通用效用代价阻断隐蔽失准传递。
    完整解读
  2. 评测与基准arXiv:2608.08542 ·

    SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御

    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3 等 6 个模型层
    场景
    模型与 API攻击者白盒
    摘要论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。

    本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。

    完整解读
  3. 防御arXiv:2608.21500 ·

    SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%

    提出SecOPD同策略蒸馏微调,降低模型对自适应提示注入的顺从

    测试
    Qwen3.6-27B (Undefended)、Meta-SecAlign、SecOPD应用层
    场景
    AI Agent
    摘要SecOPD 通过纯净上下文 token 级同策略蒸馏,在 Qwen3.6-27B 上将自适应攻击 ASR 降至 9.0% 并保持了模型通用能力。
    • 定位与核心问题:论文针对现有基于 DPO 和 GRPO 等序列级反馈的防御微调难以抵御自适应提示注入的问题,提出通过 token 级同策略蒸馏实现细粒度信用分配的 SecOPD 防御框架。
    • 方法核心机制:SecOPD 在训练时为每个样本配对构建注入输入与纯净输入,由模型在注入输入下生成回答轨迹,并利用良性输入下的冻结基座模型为对应 token 计算概率差异,通过优势函数抑制恶意注入行为并强化正常任务遵循,不依赖外部安全裁判模型。
    • 自适应攻击防御效果:在 Qwen3.6-27B 上的评测中,针对强自适应攻击 PISmith,SecOPD 将 pass@10 ASR 降至 9.0%,相比此前基线 Meta-SecAlign(94.0%)与 GRPO(61.2%)实现大幅度降低(Table 1)。
    • 静态攻击与场景泛化:在 SEP 六类静态攻击组合下,SecOPD 取得了 1.3% 的 ASR;在未见过的 AgentDojo 智能体工具调用基准中,SecOPD 取得 4.7% ASR,验证了指令与数据解耦能力向工具调用场景的迁移(Table 1)。
    • 通用能力保留:在涵盖数学推理、问答和指令遵循的七项通用基准评测中,SecOPD 维持了 88.1% 的平均实用性,与未防御基座模型的 88.1% 相当,避免了 GRPO 带来的通用能力明显衰减(Table 2)。
    • 作者结论与启示:作者认为前沿大语言模型自身的安全潜力此前未被充分挖掘,即使利用简单样本进行防御微调也能建立可泛化的安全边界;当前防御虽未彻底解决提示注入问题,但为构建鲁棒的智能体基座提供了新路径。
    完整解读
已经到底了