分析与理论arXiv 2609.05241
10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发
测绘去安全开源模型的生产与重分发留存链路
- arXiv
- 2609.05241
- 发表
- 场景
- 模型与 API
- 测试
- Qwen、Llama、Gemma 等 10 个
摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。
测绘去安全开源模型的生产与重分发留存链路
摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。
解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。
提出 MCPS EC,仅凭 MCP 工具元数据检测间接提示注入
比较用于审计提示注入与隐瞒的 token 位置选择信号
用因果激活修补定位模型服从提示注入的决策层
这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。