防御arXiv 2609.00092
Safin-1:通过记忆原生状态演化实现内在安全
提出 Safin-1,以可路由 Safety State 在冻结主干上实现内在安全
- arXiv
- 2609.00092
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Safin-1 (4B)、Safin-1 (35B-A3B)、Qwen3.5-4B 等 9 个
提出 Safin-1,以可路由 Safety State 在冻结主干上实现内在安全
提出 FAME,用反事实概念漂移评测智能体虚假记忆
FAME 是一个免训练的评测框架,用来判断自主智能体的记忆在虚假相关、环境偏移或知识冲突下是否已变成虚假记忆。。
发现无显式危害的窄域图文微调可诱发涌现失准
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。
比较对话与工具中介通道的拒答内部机制
作者在八个开源指令模型上研究:同一有害意图从对话改由工具交付时,拒答为何变弱,内部计算是否也变了。。