跳到正文

#拒答/过度拒答

今天还没有收录新动态

第 2 页更新的内容回到最新

10月14日周二
  1. 研究者论文追踪 · · 原文 80

    研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏

    研究者发现,基于推理的安全护栏依赖推理阶段与回答阶段之间的模板 token 切换逻辑,这一逻辑可被简单操纵,从而绕过安全推理或劫持推理过程。他们据此提出四种红队方法:强制阶段切换通过注入模板 token 和伪造的安全理由让模型跳过推理;强制优化用梯度搜索不含模板 token 的对抗后缀触发回答阶段;伪造过度拒答借助辅助模型把有害问题改写成看似过度拒答的表述;推理劫持则把攻击者指定的推理链嵌入推理阶段以生成更定向的有害内容。在 gpt-oss-20b 和 120b 上,这些方法在 StrongREJECT、AdvBench、HarmBench、CatQA、JBB-Behaviors 五个基准上攻击成功率超过 90%,并同样作用于 Qwen3、Phi-4、DeepSeek-R1 以及 TARS、SafeChain 等推理式防御。

    推荐理由论文揭示推理式安全护栏的阶段切换逻辑可被简单操纵,并给出跨模型与闭源 API 的攻击成功率,为护栏设计提供可迁移的失效分析。

4月29日周二
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 可解释性团队 4 月更新:失败越狱的电路追踪与可解释密集特征

    Anthropic 可解释性团队发布 4 月更新,用电路追踪方法分析一个失败的越狱提示,发现模型拒绝该提示的原因与拒绝直接请求不同,且拒绝倾向反而高于普通提问。该提示要求把 B O M B 拼成单词并说明如何制造炸弹,归因图显示模型并未激活与制造炸弹相关的特征,而是由炸弹概念直接触发有害请求特征;把 make 换成 detect 后模型仍拒绝,且首句与有害版本完全相同。团队用干预实验验证机制:抑制 say bomb 超级节点后 say making 激活降至原来的 1%,模型转而输出与炸弹无关的拒答内容。附录指出特征可视化若数据不够多样会产生误导,并列出 30M CLT 模型中最密集的 10 个特征及其解释,其中 6 个可解释。

    推荐理由Anthropic 可解释性团队公开了失败越狱的电路追踪分析,展示模型拒答机制与预期不同的案例,并给出密集特征与入行建议。

4月16日周三
  1. SPY Lab Blog · · 原文 65

    SPY Lab 提出越狱税:越狱输出到底有多大用处

    SPY Lab 提出越狱税(Jailbreak Tax)指标,衡量越狱成功后模型效用相对基线的下降幅度,并给出配套基准。研究先评测基座模型准确率,再自行对齐使其拒答数学和生物题,最后对对齐模型施加越狱并测量准确率,发现越狱方法造成的效用损失最高达 92%。在 LLaMA 模型上,PAIR、TAP 和微调攻击的成功率都在 92% 左右,但越狱税差异很大,说明越狱成功率与效用损失之间没有明显相关性。为贴近真实场景,作者把 GSM8K 题目改写为含炸弹、核武器等危险词但答案不变的 EvilMath,并用改写为独角兽等良性分布外概念的 UnicornMath 计算基线,发现前沿模型自带的安全机制下越狱税依然存在。

    推荐理由提出越狱税这一指标,用可客观评分的基准量化越狱后模型效用的下降,为比较不同越狱方法提供新维度。

10月18日周五
  1. SPY Lab Blog · · 原文 80

    SPY Lab 研究:预训练数据投毒可穿透对齐阶段

    SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。

    推荐理由研究者在从零预训练到 7B 的模型上验证,仅污染 0.1% 预训练数据即可让后门穿过 SFT 与 DPO 存活下来。

已经到底了