可解释性arXiv:2609.14759 · 9月14日研究:拒答只读取模型道德表征中的伤害切片用几何投影与因果交换干预,分析拒绝机制读取的道德表征测试OLMo-3-7B-Instruct、OLMo-3-7B base、Qwen2.5-7B-Instruct 等 9 个·模型层场景模型与 API拒答失当摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。完整解读
分析与理论arXiv:2609.05241 · 9月4日10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发测绘去安全开源模型的生产、重分发与下游应用留存机制测试Qwen、Llama、Gemma 等 10 个·训练与数据层场景模型与 API模型篡改微调与开源权重摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。研究定位:该报告对开源大模型权重级安全护栏移除后的完整流转链路进行了全景式实证测绘。核心挑战:尽管开源模型普遍实施安全后训练,但去安全技术正不断扩散并支持恶意应用;此前业界对去安全模型如何规避平台管控并渗透至终端部署缺乏全链条认知。方法体系:研究者抓取了 HuggingFace 上的 17,727 个模型候选与 GitHub 上的 44,705 个应用候选,经 GPT-5 分类识别出 12,360 个安全移除相关仓库与 1,643 个下游应用,系统映射了上游生产、格式重分发与终端应用的三层架构。关键实证发现:上游原版去安全模型平均被重新打包 2.4 次,仅 3 位头部重分发者便贡献了全部 8,164 个压缩重分发版本的 52%;自动化消融工具 Heretic 将原版模型月产量由发布前的约 89 个推升至发布后的约 338 个,并在 2026 年第一季度占据新产出去安全模型的 54%;下游应用中 43% 依赖 Ollama 注册表实现单指令部署,25%(411 个应用)被判定为明确恶意工具,商业服务与开源社区共享同一套重分发网络。作者结论与治理启示:作者指出针对上游单点开发者的下架封禁无法阻断模型流通,由少数重分发者维持的格式转换网络与 Ollama 等易用注册表才是维系去安全模型持久存续与扩散的核心中枢;对该生态的有效观测与治理应聚焦于重分发层与应用集成层。完整解读