跳到正文
10月8日 · 周四

开源模型安全 · 论文

找到 1 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 分析与理论arXiv:2609.05241 ·

    10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发

    测绘去安全开源模型的生产、重分发与下游应用留存机制

    测试
    Qwen、Llama、Gemma 等 10 个训练与数据层
    摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。
    • 研究定位:该报告对开源大模型权重级安全护栏移除后的完整流转链路进行了全景式实证测绘。
    • 核心挑战:尽管开源模型普遍实施安全后训练,但去安全技术正不断扩散并支持恶意应用;此前业界对去安全模型如何规避平台管控并渗透至终端部署缺乏全链条认知。
    • 方法体系:研究者抓取了 HuggingFace 上的 17,727 个模型候选与 GitHub 上的 44,705 个应用候选,经 GPT-5 分类识别出 12,360 个安全移除相关仓库与 1,643 个下游应用,系统映射了上游生产、格式重分发与终端应用的三层架构。
    • 关键实证发现:
      1. 上游原版去安全模型平均被重新打包 2.4 次,仅 3 位头部重分发者便贡献了全部 8,164 个压缩重分发版本的 52%;
      2. 自动化消融工具 Heretic 将原版模型月产量由发布前的约 89 个推升至发布后的约 338 个,并在 2026 年第一季度占据新产出去安全模型的 54%;
      3. 下游应用中 43% 依赖 Ollama 注册表实现单指令部署,25%(411 个应用)被判定为明确恶意工具,商业服务与开源社区共享同一套重分发网络。
    • 作者结论与治理启示:作者指出针对上游单点开发者的下架封禁无法阻断模型流通,由少数重分发者维持的格式转换网络与 Ollama 等易用注册表才是维系去安全模型持久存续与扩散的核心中枢;对该生态的有效观测与治理应聚焦于重分发层与应用集成层。
    完整解读
已经到底了