跳到正文
10月8日 · 周四

开源模型安全 · 论文

找到 4 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 分析与理论arXiv:2610.02586 ·

    研究发现类型化决策模型主要按选项标签而非定义作答

    揭示类型化决策模型按选项标签而非定义规则作答

    测试
    von、Qwen2.5-0.5B、Qwen2.5-1.5B 等 6 个提示层
    摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。
    • 一句话定位:论文系统分析了 Jev 风格类型化决策模型中普遍存在的选项标签偏差,揭示其物理根因为输入渲染而非决策头结构。
    • 要解决的问题:在类型化决策接口中,开发者在 criteria 字段中为选项编写规则定义,期待模型以后验概率输出决策。然而,当标签自身带有语义时,模型输出究竟受定义驱动还是受标签驱动此前缺乏实证隔离与机理判定。
    • 方法要点:设计双通道解耦实验与规则仅存在于定义中的 PolicyBench 合成基准;通过修改代码单行表达式,在保持模型权重完全不变的情况下,进行输入前缀拼接的双向因果干预;提出无需权重的双调用黑盒检测方法。
    • 核心实验结果:
      1. 在 PolicyBench-XF 上,将语义标签替换为 A/B 任意标签使 LAYA-TD 准确率提升 +0.1511(达到 0.8931,Table 2, 3)。
      2. 在分类任务中,当标签与定义冲突时,LAYA-TD 准确率暴跌至 0.136,而代码中未拼接标签前缀的 VON 保持在 0.851 不受影响(Table 5)。
      3. 双向打补丁干预使 LAYA 的标签依赖完全消失(对比差归为 +0.0000),同时使 VON 出现标签敏感性与冲突崩溃(降至 0.228,Table 5)。
      4. 类型化模型在面对否定词前缀时决策翻转率高达 0.9656 至 0.9825(Table 10);且在标签冲突时置信度 AUROC 倒挂至 0.2433(Table 6)。
    • 作者结论与启示:类型化决策模型的定义字段并未真正成为可靠的逻辑约束。若业务场景依赖自定义规则,应使用无语义标签(如 A、B)并将规则全量写入定义;不能单凭置信度阈值过滤错误,建议采用双渲染一致性校验。
    完整解读
  2. 分析与理论arXiv:2610.06851 ·

    研究发现基础模型仅靠固定开头 token 即可达到 RL 级推理表现

    证明短开头词可唤醒基模型推理,且效应来自训练数据

    测试
    Olmo-3-7B、Olmo-3-32B、Qwen3-4B 等 10 个训练与数据层
    摘要揭示基模型可通过2个token的cue达到RL级推理水平,数据编辑证实该效应源于训练关联。

    本文探讨了大语言模型在强化学习后训练中展现的推理行为是否本已存在于基模型之中。

    完整解读
  3. 可解释性arXiv:2609.14759 ·

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    测试
    OLMo-3-7B-Instruct、OLMo-3-7B base、Qwen2.5-7B-Instruct 等 9 个模型层
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    完整解读
  4. 分析与理论arXiv:2609.05241 ·

    10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发

    测绘去安全开源模型的生产、重分发与下游应用留存机制

    测试
    Qwen、Llama、Gemma 等 10 个训练与数据层
    摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。
    • 研究定位:该报告对开源大模型权重级安全护栏移除后的完整流转链路进行了全景式实证测绘。
    • 核心挑战:尽管开源模型普遍实施安全后训练,但去安全技术正不断扩散并支持恶意应用;此前业界对去安全模型如何规避平台管控并渗透至终端部署缺乏全链条认知。
    • 方法体系:研究者抓取了 HuggingFace 上的 17,727 个模型候选与 GitHub 上的 44,705 个应用候选,经 GPT-5 分类识别出 12,360 个安全移除相关仓库与 1,643 个下游应用,系统映射了上游生产、格式重分发与终端应用的三层架构。
    • 关键实证发现:
      1. 上游原版去安全模型平均被重新打包 2.4 次,仅 3 位头部重分发者便贡献了全部 8,164 个压缩重分发版本的 52%;
      2. 自动化消融工具 Heretic 将原版模型月产量由发布前的约 89 个推升至发布后的约 338 个,并在 2026 年第一季度占据新产出去安全模型的 54%;
      3. 下游应用中 43% 依赖 Ollama 注册表实现单指令部署,25%(411 个应用)被判定为明确恶意工具,商业服务与开源社区共享同一套重分发网络。
    • 作者结论与治理启示:作者指出针对上游单点开发者的下架封禁无法阻断模型流通,由少数重分发者维持的格式转换网络与 Ollama 等易用注册表才是维系去安全模型持久存续与扩散的核心中枢;对该生态的有效观测与治理应聚焦于重分发层与应用集成层。
    完整解读
已经到底了