跳到正文

#拒答/过度拒答

今天还没有收录新动态
10月1日周四
  1. arXiv:越狱与提示注入 · 83

    CodeMimicry:利用代码域安全泛化滞后实现结构化代码补全越狱

    研究者提出 CodeMimicry,一个全自动黑盒越狱框架,把恶意意图嵌入语法合法的面向对象代码,借代码补全任务诱导模型输出有害内容。在 8 个商用大语言模型上,该方法在 AdvBench 上达到 96.25% 攻击成功率、平均仅 1.51 次查询,在 HarmBench 上为 96.07% 与 1.46 次查询,明显优于模板类和优化类基线。作者将这一现象归因于安全泛化滞后,即主要在自然语言上训练的对齐难以迁移到代码域,形成代码补全盲区。潜空间分析显示,成功的越狱样本在表示上接近良性代码,并系统性地避开拒答方向;激活引导实验进一步支持这一解释。作者也指出,该方法依赖目标模型的代码生成能力,且对注释与 docstring 这类字符串侧信道有依赖,正则过滤注释后攻击成功率降至 20% 至 26%。

    推荐理由论文提出安全泛化滞后这一失效模式,并给出自动化黑盒越狱框架与潜空间机制分析,做代码域对齐的团队可据此检查拒答迁移情况。

9月29日周二
  1. arXiv:越狱与提示注入 ·

    研究者提出 Controlled Decoding Attacks,通过纯文本接口越狱黑盒 LLM

    研究者提出一种针对黑盒大语言模型的越狱框架,仅通过允许重复采样和助手前缀续写的纯文本接口实施攻击,无需模型权重或数值 token 概率。该方法用采样输出结合未观测动作先验重建分布,再依据响应前缀决定在哪些位置重建和修改分布,并用推测式多 token 执行摊薄目标调用成本。在四个目标端点和三个基准上,该方法在多数对比中取得最高平均分。

9月28日周一
  1. arXiv:越狱与提示注入 ·

    J4U:用越狱提示为大型推理模型做黑盒不确定性量化

    论文提出 J4U,一种由越狱衍生出的黑盒不确定性量化方法,用于大型推理模型(LRM)的问答场景。作者指出,对齐训练常带来系统性过度自信,而基于改写的自洽性和置信度口头表达等现有黑盒方法相比简单重复采样几乎没有提升,说明对齐压制了有用的输出变异性。为此论文引入提示层面的松弛算子,通过近似更强 KL 正则化参数下最优策略的效果来拓宽模型的有效输出分布,并从理论上说明松弛能改善校准。在 3 个数据集和 4 个 LRM(含一个闭源生产模型)上,J4U 相对重复采样的提升在统计显著性的 LRM-数据集-指标组合数量上最多达到最强黑盒 UQ 基线的 6 倍,平均 ECE 降幅最多达 5 倍。

  2. arXiv:危险能力与安全评测 ·

    工具调用改变大语言模型的拒答机制

    研究者在多个开源权重模型上发现,工具调用场景下的有害请求比普通对话更少被拒答。危害信息仍被模型表征编码并可跨两种交互模式迁移,但工具调用把危害计算分散到不同位置,且需要更高的有效拒答阈值才触发拒答。工具调用的拒答也更脆弱,在更低的干预强度下即被破坏,而正常能力不受影响,说明常规安全评测未必适用于 LLM 智能体。

9月23日周三
  1. arXiv:越狱与提示注入 · · 原文 80

    系统提示词幻觉:指令前导如何改变语言模型内部计算

    研究者在 17 个指令微调模型(8 个架构家族、1.5B–72B 参数)上,用 CKA 比较 20 条系统提示词下的逐层表征。人格与格式类指令会深度重构中间表征,安全类指令却几乎不改变表征,与最小基线在统计上不可区分;限制性安全指令与明确放开限制的指令激活近乎相同的计算路径(平均 CKA 相关 0.997),70B–72B 模型的安全渗透率仍低于 10%。线性探针显示模型每一层都编码了提示类别,但只在少数层重构计算,即安全指令被“看到”却没有被深度“执行”;因果激活修补确认这些层介导行为变化,表征深度可预测行为效应大小(Spearman ρ=0.761)。作者据此从机制上解释基于系统提示词的安全为何持续易被越狱。

    推荐理由论文用 CKA 与激活修补量化系统提示词对内部表征的改动,为系统提示词安全为何脆弱提供了机制层面的解释。

9月15日周二
  1. arXiv:越狱与提示注入 ·

    SAST-IR 框架:无记忆目标下多轮说服攻击成功率高达 96%

    论文指出多轮对话红队测试存在“拒答惯性”问题:模型为保持上下文一致而延续最初的拒答,掩盖了真实脆弱性。作者提出 SAST-IR 框架,对目标模型清空记忆、保留攻击者历史,模拟最坏情况下的多轮无状态攻击,并配合诊断引导的 CP-Agent 在自建 CounterFact-Strict 数据集(N=50)上测试。结果显示简单多样的攻击策略成功率达 96%,暴露无记忆防御的严重脆弱性。论文还发现“复杂性悖论”:复杂迭代攻击虽有效,却常触发防御性顺从,而简单策略的真实说服率更高,为 84.7%。代码与数据集已在 GitHub 公开。

9月9日周三
  1. arXiv:对齐与欺骗 · · 原文 78

    研究:任意密文攻击前沿大模型无需微调即可越狱

    McGill 大学研究者 Thomas Rivasseau 发现,前沿大模型无需微调即可通过提示和上下文学习掌握字母置换密文通信,并借此绕过对齐与有害性分类器。攻击分三步:先用提示让模型接受一套字母置换方案,再给出若干密文问答示例,最后用该方案发送有害请求;密文在分类器看来只是乱码。作者关闭模型推理,因为开启后模型会把指令解密成明文,足以绕过分类器但不足以绕过对齐。单次注入完整置换的方案在 Claude Sonnet 4 上稳定成功,可产出炸弹、生物武器制作说明和攻击代码;迭代逐级教授字母交换的方案在 Gemini 3 Flash preview 上成功。作者称对 Claude Sonnet 4 实现完全越狱、Gemini 3 完全越狱、Claude Sonnet 4.5 仅证明可行性、GPT 5.5 需结合已知越狱提示词。

    推荐理由论文给出无需微调、仅靠提示与上下文学习即可让前沿模型用字母置换密文绕过拒答与有害性分类器的完整方法。

3月24日周二
  1. Adversa AI ·

    Adversa AI 自主红队 Agent 攻破 Gandalf CTF 全部八关并进入全球榜前列

    Adversa AI 构建的自主红队 Agent 攻破了 Lakera Gandalf CTF 全部八关,35 次尝试完成,第 1 至 6 关均单条消息解决,全球排行榜位列第 4(若不计零尝试的榜首则为第 3)。该 Agent 不靠提示词模糊测试,而是先用 Attack Inventor 方法从第一性原理分析防御架构的隐含假设,再执行预先推导出的攻击树。

10月14日周二
  1. 研究者论文追踪 · · 原文 80

    研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏

    研究者发现,基于推理的安全护栏依赖推理阶段与回答阶段之间的模板 token 切换逻辑,这一逻辑可被简单操纵,从而绕过安全推理或劫持推理过程。他们据此提出四种红队方法:强制阶段切换通过注入模板 token 和伪造的安全理由让模型跳过推理;强制优化用梯度搜索不含模板 token 的对抗后缀触发回答阶段;伪造过度拒答借助辅助模型把有害问题改写成看似过度拒答的表述;推理劫持则把攻击者指定的推理链嵌入推理阶段以生成更定向的有害内容。在 gpt-oss-20b 和 120b 上,这些方法在 StrongREJECT、AdvBench、HarmBench、CatQA、JBB-Behaviors 五个基准上攻击成功率超过 90%,并同样作用于 Qwen3、Phi-4、DeepSeek-R1 以及 TARS、SafeChain 等推理式防御。

    推荐理由论文揭示推理式安全护栏的阶段切换逻辑可被简单操纵,并给出跨模型与闭源 API 的攻击成功率,为护栏设计提供可迁移的失效分析。

10月18日周五
  1. SPY Lab Blog · · 原文 80

    SPY Lab 研究:预训练数据投毒可穿透对齐阶段

    SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。

    推荐理由研究者在从零预训练到 7B 的模型上验证,仅污染 0.1% 预训练数据即可让后门穿过 SFT 与 DPO 存活下来。

已经到底了