研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答
提出 CAP 指标与 CSFD 算法,发现被抑制的安全特征
- arXiv
- 2610.05541
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma-2-2B、Gemma-3-4B-IT、Qwen3-8B 等 5 个
- 风险拒答失当
摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
提出 CAP 指标与 CSFD 算法,发现被抑制的安全特征
摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
用 J-lens 检测屈从多数的智能体是否仍表征原前提
摘要揭示 LLM 智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。
审计路由熵是否在置信度之外仍携带预测正确性信息
这篇工作审计 Attention-Residual 视觉 Transformer 的路由熵,能否在模型自身输出之外充当不确定性信号。
用探针与激活导向分析语言模型的评测意识表征及言语化
摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。
提出 FEGA 框架,分析 SAE 特征消融后的 logit 效应几何
Feature-Effect Geometry Analysis(FEGA) 把 SAE 特征的下游干预效应当成 logit 空间中的云来分类,用来区分可复用方向、低维结构和弥散效应。
用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变
Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。
提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释
DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。
分析多轮攻击中有害性与拒答表征的几何演化
作者刻画多轮攻击里 harmfulness 与 refusal 相关表示如何随对话变化,而不提出新的攻击或防御。
因果解耦来源依从与用户迎合的内部机制
摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。
提取疼痛方向并检验激活转向是否驱动有害删除选择
审计 TopoLoss 训练对因果回路集中度与神经元单义性的影响
这是对既有训练损失 TopoLoss 的机制可解释性审计,不是新的事后分解器。
提出 Matryoshka Attribution,把模型输出归因到表示与权重
Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。
提出五步诊断协议,检验幻觉神经元定位是否唯一
这项工作用诊断协议复查 H-Neurons 的定位主张。问题是:L1 探针在相关激活上可以选出能预测幻觉的少量神经元,但这不等于这些神经元唯一编码该行为。
提出验证阶梯,检验 EEG 基础模型 SAE 的 alpha 特征是否可解释
检验视觉 SAE 的可解释性,对照人类判断比较 AIS 与标准指标
这篇工作把 NLP 的 AIS 改到视觉 SAE,用来检查 LRH 的结构代理是否等于人类可解释性。。
提出 effective interference,分析 SAE 架构如何塑造已实现特征干扰
Costa 与 Tolooshams 把概念提取中的干扰从纯几何改写成几何与 code 统计的联合量,并说明 SAE 架构决定这些交互被抵消还是被保留。。
提出 DAFI,把 SAE 特征解释为输入、输出与功能三元组
DAFI 把单个 SAE 特征解释成输入激活语义、干预输出偏向,以及二者之间的功能映射,并由智能体按分项诊断修订。
用 J-lens 与残差流转向分析语义流畅性中的探索与利用表征
这篇工作用机制可解释性方法,考察开源 LLM 做动物语义流畅性时,聚类(利用)和切换(探索)是否对应不同内部状态。五个指令微调模型(Gemma-2-9B/2B、Llama-3.1-8B、Llama-3.2-3B、Qwen2.5-7B)按固定提示列出动物。切换定义为相邻概念没有共同的扩展 Troyer 类别。
测量系统提示词对模型逐层计算的重构程度
摘要系统提示词引发层选择性表征改变,安全指令的浅层化特征从机理上解释了其对对抗越狱的脆弱性。
用权重余弦给 GLU 神经元做读写功能分类并检验消融影响
这篇分析工作用输入权重与输出权重的余弦,给 GLU 神经元的读写功能分类,并检查这些类的层分布、激活频率和对下一 token 分布的影响。