跳到正文
10月8日 · 周四

开源模型安全 · 论文

精选论文 15 篇
  1. 分析/可解释性arXiv:2610.02586 · 62

    研究发现类型化决策模型主要按选项标签而非定义作答

    研究者在开源类型化决策模型上发现模型主要遵循选项标签而非定义规则,该偏差源于提示词渲染而非决策头结构。

    • +0.1511LAYA-TD 在 PolicyBench-XF 上任意标签相比对齐标签的准确率提升(Table 3)
    • -0.0516LAYA-TD 在固定标签分类任务上标签与定义冲突相比对齐标签的准确率变化(Table 5)
    • 0.136LAYA-TD 在固定标签分类任务误导标签下准确率暴跌至(Table 5)
    6 问速览探究类型化决策模型中概率输出被选项标签主导而非遵循规则定义的根因。
    1. 这篇论文试图解决什么问题?

      探究类型化决策模型中概率输出被选项标签主导而非遵循规则定义的根因。

    2. 有哪些相关研究?

      回顾类型化决策模型评估与上下文校准,反驳此前归咎于决策头的观点。

    3. 论文如何解决这个问题?

      通过通道解耦、构建 PolicyBench、代码级渲染干预及双调用测试定位偏差。

    4. 论文做了哪些实验?

      在多模型与基准上证实标签主导决策,干预代码消除该效应,发现否定失效与置信度倒挂。

    5. 有什么可以进一步探索的点?

      作者指出了未覆盖闭源模型及数据合成等局限,实验覆盖了9个模型与11项任务。

    6. 总结一下论文的主要内容

      揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。

    完整解读
  2. 分析/可解释性arXiv:2610.06851 · 54

    研究发现基础模型仅靠固定开头 token 即可达到 RL 级推理表现

    预填充仅2个token的开头引导词即可使基模型在MATH-500等基准上达到RL级推理表现,数据编辑证实该效应源于训练关联。

    • 42%Olmo-3-7B,MATH-500,RL-Zero 提示词,无 cue pass@1(Figure 2)
    • 78%Olmo-3-7B,MATH-500,RL-Zero 提示词,预填充 .\\n\\n Okay pass@1(Figure 2)
    • 75%Olmo-3-7B RL 对应模型,MATH-500,RL-Zero 提示词,无 cue pass@1(Figure 2)
    6 问速览探究基模型响应开头的极短 token cue 能否直接激发复杂推理行为,以及该行为是否源于训练数据的关联。
    1. 这篇论文试图解决什么问题?

      探究基模型响应开头的极短 token cue 能否直接激发复杂推理行为,以及该行为是否源于训练数据的关联。

    2. 有哪些相关研究?

      围绕推理激发、Token级控制、RL机理及训练数据关联展开,定位为解释短 cue 激发行为的成因。

    3. 论文如何解决这个问题?

      利用答案一致性最小化香农熵自动检索短 cue,并通过预填充与数据反事实编辑验证因果联系。

    4. 论文做了哪些实验?

      极短 cue 在多模型上匹敌 RL 表现,数据编辑可因果改变 cue 效应,在安全场景亦显著影响拒答。

    5. 有什么可以进一步探索的点?

      作者指出研究集中于直接 RL 设定且依赖模型数据特性,后续需深入解耦语义与数据关联。

    6. 总结一下论文的主要内容

      揭示基模型可通过2个token的cue达到RL级推理水平,数据编辑证实该效应源于训练关联。

    完整解读
  3. 分析/可解释性arXiv:2609.14759 · 54

    研究:拒答只读取模型道德表征中的伤害切片

    作者分析OLMo-3等,发现拒绝仅读取一维伤害感知(OLMo-3拒绝因果输入76%在道德基外),跨架构有早承诺等差异。

    • 0.999OLMo-3预训练结束时道德子空间与最终状态的余弦相似度(Figure 1a)
    • 0.155OLMo-3基座proto-refusal与对齐拒绝门的余弦相似度(Figure 1)
    • 76%OLMo-3在42对request-twins上位于rank-16道德基底外的拒绝因果输入比例(Table 7)
    6 问速览研究模型拒绝决策时实际读取了哪些内部表征,探究后训练对齐易被移除的机制解释与跨模型表征差异。
    1. 这篇论文试图解决什么问题?

      研究模型拒绝决策时实际读取了哪些内部表征,探究后训练对齐易被移除的机制解释与跨模型表征差异。

    2. 有哪些相关研究?

      涵盖后训练对齐与拒绝消除、表征阅读与因果交换干预、道德与伤害表征编码等相关研究。

    3. 论文如何解决这个问题?

      结合校准投影梯与嵌套因果交换干预,在控制token瓶颈处解耦表征读取与行为承诺时机。

    4. 论文做了哪些实验?

      多模型参与率确认决策瓶颈,因果交换显示OLMo拒绝在rank-1伤害饱和,消融实验显示Llama存在道德纠缠。

    5. 有什么可以进一步探索的点?

      作者指出了两轴规律的架构混杂、GPT-OSS非因果测试、部分模型行为耦合偏弱等局限与后续方向。

    6. 总结一下论文的主要内容

      作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    完整解读
  4. 分析/可解释性arXiv:2609.05241 · 55

    10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发

    10a Labs分析开源生态,发现原版去安全模型平均被重新打包2.4次,重分发层构成持久留存基础。

    • 2.4HuggingFace原版去安全模型平均被重新打包次数
    • 52%前3名重分发者占全部压缩重分发仓库比例
    • 25%GitHub去安全模型应用中明确恶意类别的占比
    6 问速览论文测绘了去安全开源大模型从生产、压缩重分发到下游部署的完整供应链,阐明其规模与持久留存机制。
    1. 这篇论文试图解决什么问题?

      论文测绘了去安全开源大模型从生产、压缩重分发到下游部署的完整供应链,阐明其规模与持久留存机制。

    2. 有哪些相关研究?

      相关研究聚焦于去安全模型实证统计、网络犯罪知识图谱分析、地下黑市流通以及底层去安全技术。

    3. 论文如何解决这个问题?

      论文结合多语言检索与GPT-5分类,构建了覆盖模型生产、重分发与应用部署的供应链测绘体系。

    4. 论文做了哪些实验?

      论文报告原版模型平均被重包装2.4次,前三名重分发者占52%份额,下游应用主要依赖Ollama分发。

    5. 有什么可以进一步探索的点?

      作者在第4.2节指出了平台范围、分类验证、技术归因、统计周期、检索上限与基模溯源共六项局限。

    6. 总结一下论文的主要内容

      论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。

    完整解读
已经到底了