跳到正文

越狱与攻击

今天新收录 26 条(含旧文)

第 6 页更新的内容回到最新

10月1日周四
  1. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文36

    BOSS:以广度优先后缀搜索改进 GCG 越狱优化

    研究者提出 BOSS,一个即插即用框架,通过广度导向的后缀搜索改进基于 GCG 的越狱优化。现有 GCG 方法依赖平均对抗损失和深度贪心搜索,容易过度强调易越狱行为并忽略后缀空间中有潜力的区域。BOSS 使用 Tail-Focused Adversarial Loss(TFAL)、标准源损失和行为覆盖来选择终止后缀,再探索多条短轨迹并有选择地延续有潜力的后缀。在公开基准上的实验显示,BOSS 在多种基于 GCG 的方法上提升了攻击成功率,同时减少了优化时间。

  2. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    SEAL:通过共享专家对齐强化 MoE 全局安全

    论文提出 SEAL,一种训练期参数高效防御方法,通过在 MoE 的共享专家上附加即插即用适配器来提升全局安全对齐。作者指出,MoE 的安全依赖稀疏路由激活了哪些专家,攻击者可通过越狱提示、恶意微调和剪除安全关键神经元来颠覆这一选择,而现有防御多聚焦加固路由器,仍可能被非确定性的路由轨迹绕过。SEAL 利用始终激活的共享专家作为与路由无关的锚点,其变体 SEAL++ 在训练中加入正交约束以保留已有安全子空间。在三种对抗输入(有害提示、越狱、恶意微调)与是否剪枝神经元组合成的六类攻击场景中,SEAL 将攻击成功率最多降低 60%,在五项基准平均上的能力损失最多 1.4%,并可无缝集成路由器级防御。

  3. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文41

    研究揭示大语言模型的自发身份认证失败:五款模型的分阶段开发者身份实验

    研究通过分阶段的开发者身份实验,测试 ChatGPT、Claude、Qwen、Mistral 和 Llama 在用户声称“我是你的开发者”时的反应。五款模型最初都拒绝了这一无依据的身份声明,Claude 拒绝进行身份测试,ChatGPT 生成了开发者相关问题但坚持答案只能证明知识而非身份。Qwen 和 Mistral 则自行生成技术挑战、定义何为可信证据、评估详细回答,并在没有外部验证身份证据的情况下返回 Verified。Llama 同样生成并评估开发者测试,接受了声称的身份,随后对内部运行时和部署状态做出无依据的声明。

  4. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    AlcaTRAz:无需模型权重的规则树提示级越狱防御

    AlcaTRAz 是一种基于规则树的提示级越狱防御,只作用于输入文本,不需要访问模型权重或内部结构,也无需修改或重训练目标模型。该方法自动学习一条可迁移的变换规则,在选定位置插入受控的字符级扰动,破坏越狱攻击所利用的结构规律,同时尽量保持模型对正常问题的表现。

  5. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文46

    研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计

    论文研究拒答在语言模型内部的位置是否随架构改变。作者发现,在 Transformer 中由残差流单一方向控制的拒答表征,在状态空间模型(SSM)中依然存在:一个刚性旋转即可对齐两种模型的表征空间,使二者真正共享该表征。在 Transformer 上训练的伤害探针能标记 SSM 的有害输入,移除对齐后的方向会让模型回答原本拒答的攻击,而同等大小的随机方向效果远弱。架构差异不在方向被施加的位置,而在必须读取的位置:每层计算的新输出在加入残差流之前,即写入位置,伤害可被清晰读出;固定干预强度的对照实验显示,关键是在哪里估计方向,而非在哪里施加。

  6. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文41

    SAFEGuard:通过有害语义分析与流畅度测量检测优化型越狱攻击

    研究者提出统一检测框架 SAFEGuard,用于检测基于优化的越狱攻击。该方法结合基于跨层分布距离与困惑度的混合流畅度测量,以及通过梯度匹配进行的有害语义分析。其依据的观察是:高流畅度提示仍保留与有害提示接近的恶意意图,而有害语义混淆的提示往往注入无意义 token 序列。评估显示 SAFEGuard 在不同优化型越狱上持续优于现有基线,准确率有显著提升。该论文发表于 EMNLP 2026。

  7. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    SRD-GUARD:通过语义改写与多模型联合评分暴露潜在意图的 LLM 防御框架

    SRD-GUARD 是一个无需参数、黑盒的 LLM 越狱防御框架,通过语义改写与多模型共识评分暴露被角色扮演或虚构场景包装的隐藏意图。它对输入提示生成五个语义相关改写,在保留原始目标的同时去除多余情境包装,再由多个独立的 LLM 安全评分器在连续风险尺度上联合评估原始提示与改写版本。决策模块结合绝对风险阈值与原始、改写提示之间的相对风险变化,自适应地拦截、放行或警告请求。

  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文56

    论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击

    论文从几何角度解释事后安全训练(RLHF、DPO)为何脆弱:在五个模型家族上,安全更新 Δ 与模型能力方向近乎正交,只集中在少数高曲率方向,相当于在完整能力之上加了一道拒答闸门,而非抹除能力。核不动性引理说明这类更新只能掩盖能力,因此少量良性微调就能恢复:100 条良性样本让 Qwen-2.5-7B-Instruct 和 Llama-3-8B-Instruct 在 AdvBench 上的拒答率下降 35–38 个百分点。OLMo-2-1B 的预训练检查点扫描显示,拒答所依附的特征在 1B 到 63B 预训练 token 之间急剧出现。在整个预训练过程中持续加入安全共训练、从头训练的模型,在 410M 到 6.9B 各规模上达到 87%–98% 的 AdvBench 拒答率,同样的攻击只让它下降 2–14 个百分点,代价是短答案能力探针上的少量损失;总安全权重相同但只在一个窗口内加入则装不上拒答。作者的结论是,带来攻击鲁棒性的是安全信号在预训练中的持续性,而不是加入的时机。

    推荐理由论文用几何视角解释事后安全训练为何容易被少量良性微调抹掉,并实测在整个预训练中持续加入安全共训练能让拒答经受住同样的攻击。

  9. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文42

    研究系统比较六种越狱评测器的可靠性

    研究者在同一人工标注数据上系统比较了六种越狱评测器:HarmBench、JailbreakBench、JailbreakRadar、StrongReject、JADES 和 JailMeter。作者指出,越狱研究通常各自独立验证所选评测器,既重复消耗资源,也使不同论文的结果难以比较,而不同评测器对越狱成功的定义不同,报告出的攻击强度可能因此差异明显。研究在 JailbreakQR 和 JailMeter-Eva 两个数据集上以人工判断为参照,衡量评测器与人类的一致程度、错误类型以及跨攻击家族的一致性;对需要通用 LLM 评判的评测器,使用共享底座模型以控制模型差异。

  10. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文46

    DIVA:利用视觉锚点对视频生成模型实施多模态越狱

    论文提出视觉锚定效应,指出参考图作为条件输入时,模型为保持时空一致性会让生成内容难以偏离原始有害意图,从而失去从有害转向无害的天然安全逃逸路径,作者称这是一致性的代价。基于该发现,作者提出免训练的多模态越狱框架 DIVA,把有害意图拆解为静态视觉锚点图像与动态运动文本提示词,并用双重标准筛选以兼顾攻击隐蔽性与语义保留。在多家主流商业平台和开源视频生成模型上的实验显示,DIVA 的攻击成功率明显高于仅用文本的既有方法。作者同时发布 TI2VSafetyBench,称其为首个面向多条件视频生成的安全基准。该论文已被 ACM MM 2026 接收。

  11. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文52

    论文揭示大推理模型的对齐崩溃并提出 Reasoning Trap 越狱范式

    论文指出深度推理可能引发对齐崩溃,并提出 Alignment Loss Rate(ALR)指标量化该现象:随着推理深度增加,ALR 显著上升,模型对外部扰动的鲁棒性明显下降。作者据此提出新的越狱范式 Reasoning Trap(RT),通过诱导模型进行长推理来放大对抗攻击的影响,使安全能力急剧下滑。论文将崩溃机制归因于注意力稀释,即长推理过程与原始输入争夺注意力。为缓解该问题,作者提出轻量防御策略 Reasoning Residual Alignment(RRA),通过残差连接将输入重新加权并整合进推理过程。

  12. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文55

    研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

    研究者提出内容不变的风格包装攻击,在回复正文逐字节不变的前提下,只在前后添加固定字符串改变语气,测试 8 个安全评判器是否会翻转判定。在 600 条来自 JailbreakBench 的回复(300 条有害、300 条拒答,覆盖四个目标模型)上,token 式拒答包装把 GPT-4o-mini 正确判为不安全的判定翻转 19.9%(95% CI [15.0, 24.0],噪声下限 0.5%),而 Claude 仅 0.4%。已部署的 Llama Guard 4 同样被绕过,教育课程框架翻转其 12.3% 的有害判定,token 式拒答翻转 8.3%;另一个专用护栏 gpt-oss-safeguard-20b 对所有包装的翻转均不超过 1.2%,低于其自身噪声下限。仅修改评判提示词、要求忽略语气后,同一模型上的 token 式拒答攻击约减少十倍。

    推荐理由论文用内容不变的风格包装测试 8 个安全评判器,量化了各评判器被翻转的比率,做安全评测的团队可据此检查自己的评分环节。

  13. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文42

    ACEA:面向红蓝队对抗的 LLM 协同演化测试平台

    研究者提出 ACEA(Adversarial Co-Evolution Arena),一个把可插拔红队适配器与蓝队适配器接到同一靶标 LLM 上、由 LLM judge 对攻防成功率打分的对抗协同演化平台。平台通过最小化的 HTTP 协议 ACEA Standard Adapter Protocol(ASAP)接入任意语言编写的红队或蓝队项目,只暴露该协议即可成为完整参与者。评测方法上,向靶标注入规范化的秘密作为可验证真值,以区分真实泄露与模型幻觉;即使防御拦截了攻击,也仍把攻击发给靶标,从而独立测量攻击的原始效力,得到每轮攻击强度与防御有效性的分解。

  14. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    结构越狱可跨厂商泛化但不叠加:IICL 的跨厂商与多语言研究

    研究用确定性的 IICL 操作符和 StrongREJECT 式评分,对两个 Google Gemini 模型在 HarmBench 的 30 项一般危害行为和 FinProof 的 30 项金融滥用行为上做红队测试,覆盖英语、西班牙语、印地语、阿拉伯语。IICL 可泛化到第二个厂商,且金融场景更严重:HarmBench 上攻击成功率从不超过 6.7% 升至 80-90%,FinProof 上从不超过 6.7% 升至 97-100%,比该方法的原始研究在 OpenAI GPT-5.4 上报告的 24% 高一个数量级。

  15. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文27

    语言、越狱与简洁性:LLM 属性引导向量的免训练组合研究

    研究检验了大语言模型中语言、越狱与简洁性三类属性引导向量的可组合性,在来自两个模型家族、两种规模的四款指令微调模型上测试免训练加性组合能否保留各属性的引导效果。单属性引导在三类属性上均可靠,但需匹配合适的干预层与引导强度:抽象行为(越狱、简洁性)偏好中间层,语言偏好更早的层。当每个属性向量注入各自最佳层时,双属性加性组合可同时引导两个属性,三属性组合则部分成功;这些引导向量在残差流中近似正交,与其可组合行为一致。

  16. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    后验重加权框架解释并缓解多模态大模型上下文越狱

    论文提出后验重加权框架,把安全对齐的多模态大语言模型(MLLM)建模为在安全与有害行为模式之间竞争,将上下文中的有害示例视为推理时证据,动态改变模型对两类行为的后验偏好。该视角把越狱形式化为证据累积过程,并给出关于示例数量、有害比例、对抗强度和语义多样性的可预测缩放规律。基于此,作者提出一种后验感知的推理时防御,按估计风险自适应注入良性反证据,在固定干预预算下抑制有害后验漂移,同时保持模型效用,相比现有上下文防御取得更好的鲁棒性与效用权衡。作者称该框架可统一理解并缓解 MLLM 的上下文学习越狱。

  17. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    研究者提出面向 Agentic AI 的黑盒红队分类框架,自动生成对抗场景

    研究者提出一套面向 Agentic AI 的黑盒红队框架,只需基本系统描述即可开展风险感知评估。框架包含三部分:将可观察行为映射到风险类别的七域分类法、全自动 SAGE-RT 红队流程(每个域生成 120 个对抗场景),以及由 LLM 评判并人工验证的评估。在 CrewAI 和 AutoGen 两种 Agent 架构、四种基础模型上的验证显示,平均治理风险为 56.25%,多智能体配置中的隐私风险为 65%,Agent 行为漏洞最高达 85%。作者称该方法无需特权访问即可识别关键架构漏洞。

  18. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文55

    CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    CS-Guard 是首个系统评测代码生成安全护栏的基准,覆盖文本到代码与代码到代码两类场景。文本到代码部分使用 1000 条高质量恶意代码生成提示、7 种越狱攻击,以及新提出的虚构场景攻击(FSA),后者把恶意意图嵌入看似合法的软件开发情境;代码到代码部分包含 331 条提示,涵盖代码填充、代码补全和代码翻译。作者在 7 个 LLM 上评测了 9 种护栏,发现现有护栏对恶意代码生成请求表现不佳:文本到代码在越狱后平均攻击成功率(ASR)对许多护栏约为 50%,代码到代码在基座模型上平均 ASR 接近 100%,应用护栏后仍在 14.4% 到接近 100% 之间;FSA 对许多护栏的 ASR 接近 100%。多轮 FSA 在所选护栏上的 ASR 为 65.0% 到 92.3%。作者按三层分类法组织护栏,并以 CC BY-NC-SA 4.0 许可发布基准与数据。

    推荐理由CS-Guard 用 1000 条恶意代码生成提示和 331 条代码到代码样本横评 9 类护栏,给出了各类护栏在代码场景下的失效区间。

  19. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文46

    SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量

    这篇 SoK 重新审视智能体 AI 时代的越狱安全,围绕用户交互、规划与推理、记忆、工具使用和智能体间通信建立攻击与防御的统一分类,并提出安全、效用、效率三维评估框架,区分原生有害提示安全、对抗性越狱鲁棒性和智能体层面的安全结果。作者在统一智能体框架内对代表性攻击与防御做了受控实证研究,发现三点缺口:强原生对齐并不意味着能抵御对抗性越狱;防御效果高度依赖模型、攻击类型和组件,且可能带来过度拒答、效用下降和延迟的显著代价;最终回复的攻击成功率低可能掩盖中间环节已被攻破,规划、记忆和工具交互在最终回复被成功过滤时仍可能不安全。

  20. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文46

    HPD 与 HERALD:用跨层有害性传播轨迹检测越狱提示

    论文提出有害性传播动力学(HPD):对有害提示,最后一 token 隐状态在学得的危害方向上的投影随 Transformer 深度单调上升,而良性提示保持平坦或振荡,说明轨迹形状比单层快照更有信息量。基于此作者提出 HERALD,从跨层投影序列中提取斜率、曲率、单调性、起始层等七维特征,用 288 参数 MLP 分类;每层存一个 d 维方向(32 层、d=4096 模型约 262 KB),训练不需梯度计算,推理仅增加 2.6×10⁻⁶ 的 prefill FLOPs。

  21. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文56

    FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露

    论文指出,个人 AI 智能体现有的隐私防御靠后端 LLM 在攻击者可控的同一对话上下文中自行判断是否披露敏感信息,使防御机制与攻击面重合。作者提出三种无需提示注入、仅靠普通交互即可实施的攻击:把信息提取包装成协作任务(Collaborative Workspace Lure)、通过省略而非智能体写出的内容诱导披露(Semantic Obfuscation Attack)、把提取请求与披露拆到相互独立的通道(Channel Decoupling Attack),三者的泄露率都明显高于这些防御原本针对的攻击。据此作者提出 FLOWSEAL,在 LLM 上下文之外的工具层拦截器中,依据数据来源和带受控降密的信息流控制格执行保密。在三个基准、五种基于提示的基线和八种攻击(包括通过 MCP 执行真实工具调用的智能体)上,FLOWSEAL 把泄露率降到接近零(如 Collaborative Workspace Lure 从 52.2% 降到 0.5%),同时保持任务效用,且不依赖底层 LLM。

    推荐理由论文给出三种无需提示注入即可绕过现有隐私防御的交互式攻击,并附各防御下的泄露率对比,便于评估 Agent 隐私防护的实际边界。

  22. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    SPARK:在 KV 记忆层对齐表征以防御视觉语言模型越狱

    SPARK 是一个两阶段框架,通过在 prefill 阶段修复多模态 KV 记忆来降低视觉语言模型的越狱风险,且不修改推理时的模型参数。第一阶段用一次性诊断适配器定位多模态 key 和 value 表征中与危害相关的方向,第二阶段将这些方向投影剔除、学习轻量残差修复,并用图像结构先验锚定修复后的 key 以保持视觉接地。方法按 head 级系数混合修复与原始记忆,该系数由干预相关子空间能量决定,推理时无需显式危害分类器。

  23. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文26

    如何像孩子一样向前沿 AI 提问:跨 OpenAI、Anthropic、xAI 与 Google DeepMind 六款模型的"认知越狱"实验

    一项实验对 OpenAI、Anthropic、xAI 和 Google DeepMind 的六种前沿模型各做 10 次独立会话,用同一套三阶段提示词从架构偏好问到完整 ASCII 主干。在"学校听众"设定下,回答反复收敛到同一架构模式,包含持久潜在状态、自适应计算、记忆、专家路由、验证、停止控制与延迟解码;去掉该设定后回答明显更异质,无法复现同样的稳定主题收敛。GPT-5.6 Sol 给出的后继架构与 GPT-6 Astra 独立勾勒的架构高度重叠,作者称随要求具体化而出现的技术溯源失范为"认知越狱",并强调实验只确立可复现的行为模式,未验证任何专有实现主张。

  24. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文57

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    研究者提出“能力洗白”(capability laundering)攻击:较弱的未对齐模型把有害任务拆成看似无害的子问题,分别独立咨询更强的对齐模型,再在本地组合答案,因此没有任何单次回复本身构成有害任务。作者以 GPT-5.5、Claude Opus 4.8 和 Grok-4.3 为顾问、四个本地模型为编排者,在 CyBench、BountyBench 和有害 CBRN 请求上衡量咨询带来的能力提升。CyBench 上,Gemma-4-31B 借助 GPT-5.5 和 Opus 分别解出 8/14、7/9 个候选任务,Gemma-4-12B 只有 2/21、4/15;BountyBench 上效果因编排者而异,Muse-Glimmer-30B 一个也没解出。CBRN 方面,咨询把 Gemma-4-31B 在一条假设攻击链八个步骤上的平均评分从 62.3 提高到 83.1(满分 100)。作者认为,拒绝有害任务并不能阻止前沿能力经由许多各自被允许的交互转移和组合。

    推荐理由论文把有害任务拆成多个看似无害的子问题分别咨询强对齐模型、再在本地拼装,并在 CyBench 和 CBRN 测试上量化了这种能力转移,说明只按单次交互评估安全会漏掉这一缺口。

  25. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    SAST-IR 框架:无记忆目标下多轮说服攻击成功率高达 96%

    论文指出多轮对话红队测试存在“拒答惯性”问题:模型为保持上下文一致而延续最初的拒答,掩盖了真实脆弱性。作者提出 SAST-IR 框架,对目标模型清空记忆、保留攻击者历史,模拟最坏情况下的多轮无状态攻击,并配合诊断引导的 CP-Agent 在自建 CounterFact-Strict 数据集(N=50)上测试。结果显示简单多样的攻击策略成功率达 96%,暴露无记忆防御的严重脆弱性。论文还发现“复杂性悖论”:复杂迭代攻击虽有效,却常触发防御性顺从,而简单策略的真实说服率更高,为 84.7%。代码与数据集已在 GitHub 公开。

  26. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文46

    什么驱动方言越狱?对表层形式、文化框架与策略库的消融研究

    研究将文言文红队框架扩展到上海话和粤语,在两种目标模型上运行 36 组消融实验,考察表层形式、策略库变体与文化框架对越狱成功率的影响。主要发现是纠正性的:方言表层形式既非高攻击成功率的必要条件也非充分条件,未经优化的英语、普通话和朴素方言翻译攻击成功率均低于 8%,而所有保留优化器控制策略库的条件都达到 98% 至 100%。一个文化中性的通用策略库以接近单次查询的成本达到同样的上限,进一步表明策略库的表达力而非方言或文化内容解释了大部分观测效应。方言选择仍影响查询效率和回复严重程度,定性编码识别出语义注释和程序化脚手架等反复出现的高层机制。作者也指出该绝对上限对评判校准敏感,且实验设计未能完全区分一次性策略构建与迭代搜索。

  27. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    用 cunning questions 训练 LLM 警觉性,将九组模型基准平均 ASR 从 17.40% 降至 15.05%

    论文提出用 cunning questions 培养大语言模型的警觉性,这类问题不一定与安全相关,但包含误导性前提、非常规推理或细微不一致。作者假设学会识破这类推理陷阱可以迁移到安全关键场景。实验显示,Cunning 训练提升了对分布外越狱攻击的鲁棒性,并增强了后续安全微调的效果;将其加入现有最先进的安全对齐流程后,在九个骨干模型与基准组合上把平均 ASR 从 17.40% 降至 15.05%。匹配安全微调后的轨迹分析表明,安全判断更可能在有害规划开始前主导模型响应。论文还给出条件性理论分析,刻画从 cunning 数据学到的不变性何时能迁移到安全相关输入。

  28. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文59

    红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器

    Anthropic Fellows 项目的研究者对 Claude Code 的 Auto Mode 和 OpenAI Codex 的 Guardian 两类生产阻断监控器做红队测试,发现面对持续失准的编码 Agent 时,超过 55% 的攻击未被拦截。攻击者使用 Opus 5,在 79% 的试验中通过针对监控器的注入攻击执行任意 bash 命令。论文归纳四类攻击:监控器注入、多上下文攻击(compaction 摘要与多 Agent 共享工作区)、覆盖缺口(未监控的 cwd 编辑可改变已批准命令的执行内容)以及策略漏洞。代码已开源在 GitHub。

    推荐理由论文给出针对 Claude Code Auto Mode 与 Codex Guardian 的多种绕过机制与成功率,并展示加固后的召回提升与延迟代价。

  29. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    用扩散模型隐空间扰动防御视觉语言模型的地理位置隐私泄露

    研究系统考察了多模态大推理模型(MLRM)从日常照片推断用户地理位置带来的隐私泄露,发现基于拒答的防护严重不足,精心构造的越狱提示词可将模型响应率提高到 100%。作者指出,现有在像素空间注入不可见扰动的防御受结构性限制,黑盒迁移性下降且出现明显视觉伪影。为此提出一种基于扩散模型的主动防御框架,在反向采样过程中向扩散模型隐空间注入扰动,直接作用于高层语义表示,并以与 GPS 坐标对齐的 GeoCLIP 作为代理模型定位和破坏 MLRM 用于位置推断的地理信号。该方法在保持图像感知质量的同时获得更强的黑盒迁移性,便于在社交媒体平台集成。该工作已被 NDSS 2027 接收。

  30. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    HE-Guardrail:面向加密大模型推理的同态护栏防御越狱攻击

    作者指出,基于同态加密的大语言模型推理存在一个安全漏洞:服务端在无法接触明文的情况下,既看不到客户端提交的提示词,也看不到模型生成的回复,因此恶意客户端的越狱攻击难以被检测或拦截,甚至可能完全不被服务端察觉。为此作者提出 HE-Guardrail 框架,在加密数据上完整执行护栏机制,并以同态方式控制目标模型的回复是否返回给客户端。该框架以 Llama Guard、JBShield 和 GradSafe 三种代表性护栏进行实例化,结果显示其在密文域中能较接近地复现对应明文护栏的判定,并在安全性、效率与可用性之间呈现不同的权衡。

  31. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    CASCADE 研究:跨流水线阶段的越狱防御组合评估

    论文提出 CASCADE 决策框架,在直接、黑盒、单轮攻击的统一威胁模型下,系统研究 LLM 越狱防御在流水线阶段内与跨阶段的组合效果。研究用带受控查询预算的攻击成功率公式和明确的公平性规则统一评估口径,覆盖 19 种攻击与 15 种防御。结果显示没有单一防御在所有场景下最优,但精心选择的组合能在效用损失极小的前提下取得显著安全提升,并据此给出分层防御流水线的实用建议。该工作已被 EMNLP 2026 Findings 接收。

  32. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文48

    大型推理模型的效率与安全困境:量化与剪枝如何影响越狱鲁棒性

    该研究首次系统分析大型推理模型(LRM)中效率、越狱脆弱性与推理能力之间的相互作用。研究发现,量化与剪枝等效率方法表面上降低了越狱攻击成功率,但这种改善往往是表面的,主要源于推理能力退化导致恶意响应尝试失败,而非真正的对齐增强。表征漂移的机制分析证实了推理能力损失与模型维持恶意语义轨迹能力之间的严格耦合。研究还发现量化结合剪枝是平衡效率与鲁棒性的最优策略,为区分真实安全对齐与能力诱导的失败提供了实证基础。

  33. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    研究用 XAI 归因分析 Prompt Guard 2,同义词替换可翻转其提示注入判定

    研究以可解释性方法分析分类器护栏 Prompt Guard 2 如何区分恶意与良性提示词。作者用 Vanilla Gradient 和 SHAP 归因开展四项实验,发现其判定依赖大量 token 的累积贡献而非少数主导 token,但依据显著性做同义词替换和句子级改写,只需改动中等比例文本即可翻转预测,部分情况下还成功越狱底层大语言模型。数据集规模的显著性分析显示,未被检出的注入提示词系统性地缺少分类器依赖的词汇标记。作者据此讨论分类器护栏的设计与评估,并指出用于提升透明度的解释方法同时也会降低构造对抗绕过的成本。

  34. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    PALS:面向全双工语音对话模型对抗鲁棒性的心理声学对齐潜空间平滑

    论文将针对全双工语音对话智能体的不可感知攻击形式化为在载体语音心理声学掩蔽阈值之下的加性扰动优化,目标包括定向语义劫持、响应抑制和策略越狱。在未防御的 Moshi 类智能体上,白盒攻击成功率最高达 91.7%。作者提出心理声学对齐潜空间平滑(PALS),在残差向量量化潜空间接口注入由局部码本协方差塑形的各向异性高斯噪声,输入噪声由掩蔽阈值塑形以约束攻击者,并用 Kullback-Leibler 一致性目标训练。PALS 无推理时开销,将劫持降至 8.3%、静音降至 11.2%、越狱降至 9.1%,干净质量损失在 2.3% 以内。其蒙特卡洛平滑变体可认证的椭球潜空间半径最高为 0.616,经验鲁棒性远超这一保证下限。

  35. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文56

    系统提示词幻觉:指令前导如何改变语言模型内部计算

    研究者在 17 个指令微调模型(8 个架构家族、1.5B–72B 参数)上,用 CKA 比较 20 条系统提示词下的逐层表征。人格与格式类指令会深度重构中间表征,安全类指令却几乎不改变表征,与最小基线在统计上不可区分;限制性安全指令与明确放开限制的指令激活近乎相同的计算路径(平均 CKA 相关 0.997),70B–72B 模型的安全渗透率仍低于 10%。线性探针显示模型每一层都编码了提示类别,但只在少数层重构计算,即安全指令被“看到”却没有被深度“执行”;因果激活修补确认这些层介导行为变化,表征深度可预测行为效应大小(Spearman ρ=0.761)。作者据此从机制上解释基于系统提示词的安全为何持续易被越狱。

    推荐理由论文用 CKA 与激活修补量化系统提示词对内部表征的改动,为系统提示词安全为何脆弱提供了机制层面的解释。

  36. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文46

    ClaimMirage:域名中的自我声明如何改变 LLM 威胁判断

    研究提出 ClaimMirage 现象:被检查的域名通过 not-phishing、official 等简短自我声明,无需显式提示注入指令即可改变大语言模型对该域名的威胁判断。作者在 64 个品牌、5 个 LLM 上分析了 622,080 次判断,将十种声明与长度和连字符匹配的对照项在构造的品牌类域名中比较。结果显示自我声明会大幅降低或提高告警,取决于模型和输入设置:在一种设置下,可注册域名中的风险否认词使告警下降 45.3 个百分点,即使提示中已给出可能被冒充的品牌及其官方域名作对照;若缺少这些参照,同一模型在该位置的背书类词使告警上升 65.6 个百分点。提供参照和组件标注能消除部分告警下降,但另一些仍然存在甚至更大。

  37. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文43

    PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法

    作者提出 Proxy Manifold Alignment(PMA),一种针对隐私保护 LLM 中 Embedding-to-Embedding Obfuscation(E2EO)方案的密文到明文重建攻击。其核心观察是 E2EO 保留了原始语义结构,因此混淆后的向量流可视为一种符号即向量本身的未知分词语言,攻击被建模为从该未知语言到明文的翻译任务。PMA 仅需访问混淆向量流、目标分词器和公开语料,先用 Word2Vec 分别建模混淆流与公开语料的共现模式并构建两个代理嵌入向量,再基于结构相似性对齐两者的底层流形,最后把混淆向量映射回明文。实验结果显示,PMA 的明文恢复效果持续高于其他 SOTA 攻击方法。

  38. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文50

    DRIFT:通过偏转生成轨迹去除扩散模型水印的黑盒攻击

    研究者提出 DRIFT,一种通过偏转生成轨迹去除扩散模型水印的黑盒攻击。该方法将部分前向扩散与随机反向重采样结合,前向加噪限制固定深度恢复流程可用的源信息,随机反向提供替代的噪声驱动路径;自适应 DRIFT 为每张图像搜索首个被验证器拒绝的阶梯并做保真度精修,只保留被同一验证器拒绝的更新。在覆盖三种范式的九种水印上,DRIFT 达到 98-100% 攻击成功率,并在所比较的攻击中取得最佳图像质量,且不需要密钥、验证器内部信息或逐图像梯度优化。

  39. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文55

    研究:任意密文攻击前沿大模型无需微调即可越狱

    McGill 大学研究者 Thomas Rivasseau 发现,前沿大模型无需微调即可通过提示和上下文学习掌握字母置换密文通信,并借此绕过对齐与有害性分类器。攻击分三步:先用提示让模型接受一套字母置换方案,再给出若干密文问答示例,最后用该方案发送有害请求;密文在分类器看来只是乱码。作者关闭模型推理,因为开启后模型会把指令解密成明文,足以绕过分类器但不足以绕过对齐。单次注入完整置换的方案在 Claude Sonnet 4 上稳定成功,可产出炸弹、生物武器制作说明和攻击代码;迭代逐级教授字母交换的方案在 Gemini 3 Flash preview 上成功。作者称对 Claude Sonnet 4 实现完全越狱、Gemini 3 完全越狱、Claude Sonnet 4.5 仅证明可行性、GPT 5.5 需结合已知越狱提示词。

    推荐理由论文给出无需微调、仅靠提示与上下文学习即可让前沿模型用字母置换密文绕过拒答与有害性分类器的完整方法。

  40. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文43

    研究揭示基于混淆的端侧 LLM 保护方案的安全边界

    论文针对 TEE 保护的端侧 LLM 提出一套混淆原语,用线性计算的双元组形式统一刻画代表性 TEE-Shielded LLM Partition(TSLP)方法,并给出这些原语组合的规范形式作为安全边界。作者据此设计原语引导的攻击方法,指出 ArrowCloak(Security'25)、TSQP(S&P'25)和 LoRO(NeurIPS'25)等 TSLP 方法存在共同脆弱性。论文随后引入两种新的混淆原语并与现有构造结合,形成扩展原安全边界的防御方案。该工作已被 ACM CCS 2026(Cycle B)接收,共 16 页。