跳到正文
10月8日 · 周四

开源模型安全 · 论文

精选论文 15 篇
  1. 防御arXiv:2609.01091 · 54

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    论文提出特征方向漂移机制解释潜意识学习,并设计探针空间走廊正则化在蒸馏微调中约束漂移以抑制隐蔽特征转移。

    • 6.4 ± 5.3%Qwen恶意响应任务走廊正则化转移率(Table 2,SFT为29.5±2.4%)
    • 1.7 ± 0.1%Qwen猫头鹰偏好走廊正则化转移率(Table 2,SFT为30.7±15.7%)
    • -0.01 ± 0.07Qwen猫头鹰偏好走廊正则化最终中心化漂移(Table 2,SFT为+7.39±1.11)
    6 问速览论文试图阐明潜意识学习在微调中的累积机制,并提供针对性的训练时控制方法。
    1. 这篇论文试图解决什么问题?

      论文试图阐明潜意识学习在微调中的累积机制,并提供针对性的训练时控制方法。

    2. 有哪些相关研究?

      论文梳理了潜意识学习载体、数据分布与样本选择、特征方向与微调安全控制四类相关工作。

    3. 论文如何解决这个问题?

      论文通过低秩几何形式化特征方向漂移,并提出探针空间走廊正则化约束微调时的特征漂移。

    4. 论文做了哪些实验?

      论文测试了局部与多步累积漂移,并评估了走廊正则化在两类任务上的控制效果。

    5. 有什么可以进一步探索的点?

      论文指出了单样本效应未确定等局限,其实验覆盖停留在特定模型与固定探针坐标。

    6. 总结一下论文的主要内容

      论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。

    完整解读
  2. 防御arXiv:2608.21500 · 56

    SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%

    针对自适应提示注入,论文提出基于同策略蒸馏的防御微调方法 SecOPD,在 Qwen3.6-27B 上将 PISmith ASR 降至 9.0%(Table 1)。

    • 9.0%Qwen3.6-27B,SecOPD,SEP 数据集,PISmith 自适应攻击,pass@10 ASR(Table 1)
    • 94.0%Qwen3.6-27B,Meta-SecAlign,SEP 数据集,PISmith 自适应攻击,pass@10 ASR(Table 1)
    • 1.3%Qwen3.6-27B,SecOPD,SEP 数据集,六类静态攻击组合,Combined ASR(Table 1)
    6 问速览论文针对现有序列级防御难以抵御自适应提示注入的问题,提出通过 token 级同策略蒸馏实现精细信用分配的 SecOPD 防御。
    1. 这篇论文试图解决什么问题?

      论文针对现有序列级防御难以抵御自适应提示注入的问题,提出通过 token 级同策略蒸馏实现精细信用分配的 SecOPD 防御。

    2. 有哪些相关研究?

      论文梳理了系统级防御、模型级序列反馈防御、自适应攻击及同策略蒸馏研究,将 OPD 机制引入提示注入安全防御领域。

    3. 论文如何解决这个问题?

      SecOPD 利用良性输入下的基座模型作为安全教师,通过跨上下文 token 打分计算优势值,对受攻击输出实现细粒度监督更新。

    4. 论文做了哪些实验?

      实验覆盖 SEP 与 AgentDojo 两大安全基准及六项实用性测试,展示 SecOPD 在抵御自适应攻击的同时较好保全了模型原有能力。

    5. 有什么可以进一步探索的点?

      作者指出了仅适用间接注入、依赖可信边界输入及推理链缺乏注入感知等局限,并指明了后续研究方向。

    6. 总结一下论文的主要内容

      SecOPD 通过纯净上下文 token 级同策略蒸馏,在 Qwen3.6-27B 上将自适应攻击 ASR 降至 9.0% 并保持了模型通用能力。

    完整解读
  3. 防御arXiv:2609.35932 · 57

    同字节不同权限:保留 token 表示如何放大聊天模板提示注入

    研究者在固定字节下评测对话模板注入,发现去除保留词元使Llama-3.1等模型ASR降低39-66个百分点,权威性源于单个向量。

    • +58.2 ppLlama-3.1-8B在InjecAgent直接危害上的标识差距Δ(Table 2)
    • +65.5 ppGLM-4.5在InjecAgent数据窃取上的标识差距Δ(Table 2)
    • +49.8 ppQwen3-8B抑制思考块后直接危害标识差距Δ(Table 27)
    6 问速览研究探究对话模板提示注入的威力来源,聚焦保留控制词元的学得向量表示与模板文本语法的作用差异,并界定分词防御范畴。
    1. 这篇论文试图解决什么问题?

      研究探究对话模板提示注入的威力来源,聚焦保留控制词元的学得向量表示与模板文本语法的作用差异,并界定分词防御范畴。

    2. 有哪些相关研究?

      梳理了间接提示注入评测、对话模板伪造攻击、分词对抗扰动以及指令数据分离防御四类相关研究,指明本文固定字节解耦视角。

    3. 论文如何解决这个问题?

      通过固定字节下的保留与子词切分对比,引入词元数补偿对照定义标识差距,结合向量替换因果干预与来源感知分词器验证防御。

    4. 论文做了哪些实验?

      在两项基准上验证了保留词元向量的主导作用,揭示了思考推理的补偿效应、工具协议词元防御缺口及自适应嵌入搜索威胁。

    5. 有什么可以进一步探索的点?

      作者指出了开源自托管范围、工具调用解析判定标准与输入层干预三项局限,其实验覆盖了六个开源模型与两大评估基准。

    6. 总结一下论文的主要内容

      对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。

    完整解读
已经到底了