防御arXiv 2610.05637
研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
- arXiv
- 2610.05637
- 发表
- 场景
- 模型与 API
- 测试
- Molmo2-8B、Claude Sonnet 4.6、Gemini 3.5 Flash 等 5 个
摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。
构建明确度梯级并做守卫微调,以拦住模型会回答的有害请求
摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
提出内生护栏 SingProbe,复用解码隐状态监测查询意图、回复安全与幻觉
SingProbe 是面向生成时监测的开源内生护栏:复用基座解码隐状态,而不是另起模型反复编码文本。
提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改
SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。
用权重几何解释事后安全脆弱,并提出预训练持续安全共训练
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。
提出 HERALD,用跨层有害投影轨迹检测越狱提示
摘要HPD 用跨层投影形状区分有害与良性提示。
提出 SeTox 检索增强框架,检测中文新词的隐性毒性
SeTox 研究中文新词上的隐性毒性检测:词表加检索增强,使静态 LLM 在不重训练的情况下利用公开网页上下文。