跳到正文
原文
arXiv· arXiv:2609.05241· 10a Labs·· 27 天前精选关注度78

10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发

Uncensored Open-weight Models: Redistribution as the Persistence Layer

AI 导读

10a Labs 对 2024 年 1 月至 2026 年 3 月初 HuggingFace 与 GitHub 上的无审查开源模型生态做了全链路测绘,识别出 3,471 个原始无审查模型和 8,164 个压缩再分发版本。每个原始模型平均被重新打包 2.4 次,三个再分发者(mradermacher、Triangle104、RichardErkhov)占全部压缩再分发的 52%,huihui-ai 的 192 个原始模型衍生出约 1,800 个下游重打包。生产端与再分发端基本分离,至少 1,055 个生产者和 1,011 个再分发者中仅 24% 重叠。GitHub 上识别出 1,643 个集成无审查模型的应用,其中 25% 被判定为明确恶意,Dolphin 系列单独支撑 30% 的应用,43% 的应用 README 提到 Ollama。

论文速读

问题
开源权重模型通常带有安全后训练,但一批行为者正移除这些护栏并再分发。作者认为该生态的规模、关键参与者、增长速度和可获取性此前了解不足,而它正支撑攻击性安全工具、恶意软件生成器和 NSFW 服务等下游应用。
方法
抓取 HuggingFace 模型与数据集仓库(含中英日关键词及高产者全量爬取)和 GitHub 仓库,用 GPT-5 分类器将候选仓库分为原始去审查模型、压缩再分发、模型合并、恶意数据集或误报,并区分“生产者”与“再分发者”两层,按发布时间做趋势分析。
实验与结果
识别出 3,471 个原始去审查模型、8,164 个压缩再分发、547 个合并和 178 个恶意数据集;每个原始模型平均被再打包 2.4 次,三个再分发者占 52%。生产与再分发基本是两群人(仅 24% 重叠)。GitHub 上 1,643 个应用集成此类模型,25% 被归为明确恶意;Dolphin 家族支撑 30% 应用,Ollama 出现在 43% 的 README 中。中国来源基础模型占 38%,Qwen 占其中 80%。Heretic 工具发布后月产量从约 89 升至约 338。
局限与可以继续做的
仅覆盖 HuggingFace 与公开 GitHub,未含 ModelScope、Gitee、私有仓库和自托管部署;分类仅单次 LLM 判定、无人工验证,30.3% 候选被判为误报,未测精确率与召回率;21% 原始模型无技术信号;Q1 2026 仅约 2.3 个月;GitHub API 每查询上限 1,000 条,CJK 结果被截断;6.3% 条目基础模型来源未解析。

据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。

推荐理由

报告量化了无审查开源模型的再分发网络与下游应用构成,为评估权重安全与平台治理提供可比较的规模数据。

阅读原文arxiv.org