可解释性arXiv 2609.04721
研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
- arXiv
- 2609.04721
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Falcon-Mamba-7B、Falcon3-Mamba-7B、Llama-3.1-8B 等 8 个
摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响
作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
摘要作者称检测靠分散的词法线索。
检验权重谱度量能否代理成员推断泄漏
作者在 MLP 上检查 WeightWatcher 谱统计是否与 online LiRA 同向,以便不看数据、不训练 shadow 模型就做模型级成员风险筛查。放出前的审计要知道训练成员会不会被认出来。LiRA 依赖大量 shadow 模型,候选一多就难以逐个跑。
比较用于审计提示注入与隐瞒的 token 位置选择信号
用因果激活修补定位模型服从提示注入的决策层
这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。