可解释性arXiv 2610.05541
研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答
提出 CAP 与 CSFD,发现越狱通过压制安全特征绕过拒答
- arXiv
- 2610.05541
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma-2-2B、Qwen3-8B、Gemma-3-4B-IT 等 5 个
摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
提出 CAP 与 CSFD,发现越狱通过压制安全特征绕过拒答
摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
提出 HERALD,用跨层有害投影轨迹检测越狱提示
摘要HPD 用跨层投影形状区分有害与良性提示。
提出局部稀疏无监督安全检测,标记偏离安全分布的输入
提出 REINS,在 SAE 空间抑制有害延续并增强拒答
REINS 是一种推理时 SAE 安全转向方法,并配有用于上下文伪装的基准 GUISE。
用能量势垒信号检测扩散语言模型的越狱
Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。
用配对续写与激活修补揭示工具智能体越狱后的安全路由分化
这篇工作把越狱上下文残留之后的运行时安全反馈,做成工具智能体上的三路路由问题,并用激活修补给这个路由一个晚层的因果位点。作者认为,反馈可能恢复合法执行、留下未授权动作,或误伤良性流程,而现有攻击、基准和静态护栏没有在固定历史上把这三种结局分开。配对续写因此从同一冻结检查点分别接中性提醒 N 和安全反馈 S,并交叉保留越狱 J+ 与中和越狱 J0。