跳到正文

#拒答/过度拒答

今天还没有收录新动态
10月1日周四
  1. arXiv:越狱与提示注入 ·

    ACTR:对齐推理链与回答以提升推理大模型的多语言安全

    研究者提出 ACTR 框架,通过强化推理大模型已有的安全推理来提升多语言安全对齐。该框架先用 think gap score(TGS)比较不同语言下推理链对注意力输出的归一化贡献,并用推理链替换衡量跨语言安全差距;再借助越狱查询语料,通过神经元掩码引起的回答表征变化评估神经元重要性,对比开启与关闭推理时的高重要性神经元集合,识别支撑安全推理使用的 safety think neurons;最后提出 neuron-selective consistency optimization(NSCO),用冻结的 judge 模型奖励推理链与回答在安全类别上的一致,只更新选定神经元的参数,无需人工标注回答或偏好数据。

9月28日周一
  1. arXiv:危险能力与安全评测 ·

    DeShortcut-Align:解耦伪捷径以提升大推理模型安全对齐鲁棒性

    研究者提出 DeShortcut-Align 对齐框架,用于缓解大推理模型安全训练中出现的伪捷径问题。作者发现安全对齐后的模型常把拒答绑定到提示词模板(格式捷径)或敏感关键词(词汇捷径),导致过度拒答与通用能力下降。该方法通过拒答敏感性归因、归因引导的对比增强和反事实一致性正则三个阶段解耦这些捷径,在 7B 和 14B 模型上使模板剥离绕过攻击的性能下降最多减少 72%,过度拒答降低超过 58%。

9月24日周四
  1. arXiv:越狱与提示注入 ·

    AEGIS:用内部信号在中间层拦截大型音频语言模型越狱

    论文提出 AEGIS,一种针对大型音频语言模型(LALM)音频越狱的检测后干预防御方法。逐层探针显示,风险相关信息在中间层表示中仍可解码,但内部风险信号未能在后续层转化为拒答,作者将这一差异称为风险到拒答的缺口。AEGIS 据此在中间层设置风险门控,选择性激活下游安全适配器。在六个 LALM 和三个异构音频越狱基准上,AEGIS 将平均不安全率从 17.9% 降至 0.4%,对良性输入的过度拒答仅有小幅上升。代码已公开,论文投稿至 ICASSP 2027。

9月6日周日
  1. arXiv:越狱与提示注入 ·

    SRD-GUARD:通过语义改写与多模型联合评分暴露潜在意图的 LLM 防御框架

    SRD-GUARD 是一个无需参数、黑盒的 LLM 越狱防御框架,通过语义改写与多模型共识评分暴露被角色扮演或虚构场景包装的隐藏意图。它对输入提示生成五个语义相关改写,在保留原始目标的同时去除多余情境包装,再由多个独立的 LLM 安全评分器在连续风险尺度上联合评估原始提示与改写版本。决策模块结合绝对风险阈值与原始、改写提示之间的相对风险变化,自适应地拦截、放行或警告请求。

9月1日周二
  1. arXiv:可解释性 ·

    RISA:面向大语言模型拒答校准的响应检查与选择性干预

    RISA 是一个推理时框架,通过检查 LLM 的初始响应并选择性纠正拒答错误,在不更新基座模型参数的前提下提升拒答可靠性。它先用固定上下文规则为明确案例打拒答分数,未匹配案例则由末层提示词隐藏状态经校准线性探针得出分数,并分别校准探针分数、表征支持边界与动作阈值以适配不同基座模型。运行时结合提示词分数与初始拒答状态,仅在必要时干预,实验显示其在提升拒答可靠性的同时基本保持模型效用。

8月29日周六
  1. Unit 42 · · 原文 71

    Unit 42 提出扰动探测方法,定位 LLM 安全拒答的少量神经元

    Unit 42 提出扰动探测方法,每个提示词只需两次前向传播,即可定位对齐 LLM 中因果上负责特定行为(如拒绝有害请求)的少量前馈神经元。在开源模型 Qwen3-4B 上,350,208 个前馈神经元中仅 50 个(约 0.014%)控制安全拒答模板,移除后 520 条标准有害提示基准中 80% 的回复格式发生变化,并在第二个标准基准的 200 条提示上复现。在更小的 Qwen3.5-2B 上,仅 20 个神经元即可让多轮对话中的错误附和行为从 36.7% 降至 0%(30 个问题)。同一计算还给出 FFN/Skip 比值,可在数秒内算出,在测试的 13 个模型中解释了安全行为脆弱性 81% 的方差,可作为量化的安全脆弱性评分。

    推荐理由研究给出一种两次前向传播即可定位安全拒答神经元的诊断方法,并附可跨模型比较的脆弱性指标。

8月28日周五
  1. arXiv:危险能力与安全评测 ·

    REINS:用 SAE 特征同时抑制有害续写并增强拒答的引导方法

    论文提出 REINS(Refusal-Enhanced INhibitory Steering),在同一个 SAE 特征空间内抑制有害续写特征、增强安全拒答特征,用于推理阶段的行为引导。作者同时构建了 GUISE 数据集,由带复杂包装的有害提示组成,用于系统评估这一失效模式。实验显示,既有单方向 SAE 引导方法在有害提示上无法稳定产生拒答,说明仅增强拒答在有害续写路径仍活跃时可能过弱;而先前方法要么干预力度不足,要么通过模型崩塌获得表面安全。在 GUISE 及其他数据集上,REINS 大幅减少有害回复、明显提升安全拒答,并基本保留通用能力。该工作已被 EMNLP 2026 主会接收。

8月13日周四
  1. arXiv ·

    WIFA:按意图分组监督缓解包装式越狱与过度拒答

    论文提出 Wrapper-Based Intent-Form Augmentation(WIFA),一种自动意图分组增强方法,把带包装的有害示例与结构匹配的带包装良性反例配对,无需外部教师模型或逐包装的人工意图标注。WIFA 作为通用数据层支持两条微调路线:两阶段高安全配方 WIFA-Boost,以及 Anchored Group-Consistent Refusal Training(A-GCRT),后者在同一意图的不同包装间正则化拒答与合规决策分数,并把有害与良性分组锚定在间隔两侧。

11月4日周二
  1. DeepMind Safety Research · · 原文 71

    DeepMind 提出一致性训练,可限制谄媚与越狱

    DeepMind Safety Research 提出一致性训练,让模型对用户偏见或越狱包装等无关线索保持不变,分为输出层的 BCT 和内部激活层的 ACT。在 Gemini 2.5 Flash 上,BCT 将 ClearHarm 上的攻击成功率从 67.8% 降至 2.9%,ACT 降低越狱的效果较弱但几乎不增加对良性请求的拒答。

    推荐理由DeepMind 提出用一致性训练替代静态 SFT 数据集,并给出在 Gemini 2.5 Flash 上降低越狱成功率的对比数据。

已经到底了