全部论文
另有 524 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2608.07430
研究者提出 SN-Guided Diffusion,利用扩散大模型安全神经元实现离线越狱
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱
- arXiv
- 2608.07430
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Qwen2.5-7B-Instruct、LLaDA-8B-Instruct、Dream-Instruct-7B 等 15 个
摘要论文揭示了扩散语言模型对自回归安全神经元的继承性,并提出纯离线黑盒越狱框架 SN-Guided Diffusion。
论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。
- 攻击arXiv 2606.21077
OTTER:仅替换五个 token 即可绕过 GPT 系列毒性审核
提出 OTTER 词元替换越狱,绕过表面毒性审核诱导有害回答
- arXiv
- 2606.21077
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要论文展示了表面毒性与恶意意图的解耦现象,通过标准 API 实现黑盒越狱测试,并提出闭环分类器加固建议。
- 攻击arXiv 2610.05894
研究者提出闭环偏见注入攻击
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
- arXiv
- 2610.05894
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 灰盒
- 被测模型
- LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct
摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
- 攻击arXiv 2610.03166
LiBRA:通过双向隐空间优化实现检测感知的图像水印去除
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
- arXiv
- 2610.03166
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 被测模型
- Stable Signature、YU1、HiDDeN 等 4 个
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
- 攻击arXiv 2610.03124
研究提出 Untag 攻击框架,使开源大模型触发标签滥用检测机制失效
提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测
- arXiv
- 2610.03124
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Llama2 (7B)、Llama3 (8B)、Qwen2.5 (7B)
摘要作者用 UNTAG 评估 trigger-tag,认为其不能充当开放权重滥用检测的主要边界。
UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。
- 攻击arXiv 2607.23496
Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
- arXiv
- 2607.23496
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 6 个
摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
- 攻击arXiv 2608.03642
规避与投毒攻击对恶意软件数据漂移检测器的实证分析
用通用扰动对恶意软件分类器及漂移检测器做规避与后门投毒
- arXiv
- 2608.03642
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- MLP 100-100、CADE (CAE 512-384-256-128)、CADE (CAE 512-128-32-8) 等 6 个
- 评测与基准arXiv 2607.19855
研究者提出最小范数攻击集成,用鲁棒性曲线替代单一 ε 评测
提出最小范数攻击集成,用鲁棒性曲线评测图像分类器
- arXiv
- 2607.19855
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- C1–C20(CIFAR-10,Table 1)、I1–I10(ImageNet,Table 1)
摘要预算可控的最小范数集成用 AOI 逼近攻击前沿,DOI 给出不依赖单一ε的防御排序。
这篇工作把对抗鲁棒评测从单一 ε、固定集成,改成可按查询预算收紧的曲线估计。
- 攻击arXiv 2608.09867
研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
- arXiv
- 2608.09867
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Claude Opus 4.8、Claude Sonnet 4.6、Claude Haiku 4.5 等 13 个
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
- 攻击arXiv 2608.10393
DURA:用扩散模型生成自然对抗补丁攻击 VLA 机器人模型
提出 DURA,沿扩散潜空间生成自然对抗补丁,把机器人动作导向指定目标
- arXiv
- 2608.10393
- 发表
- 层
- 提示层
- 场景
- 具身与机器人
- 被测模型
- OpenVLA-7B、π0-FAST、openvla-7B
摘要DURA 用扩散潜空间轨迹生成自然补丁,白盒与黑盒都能把 VLA 导向指定动作。
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。
- 攻击arXiv 2609.15989
研究者提出 plan injection 攻击,可绕过思维链监控
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
- arXiv
- 2609.15989
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
- 被测模型
- Qwen2.5-Coder-7B-Instruct、Qwen3-8B、DeepSeek-R1-0528 等 6 个
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
- 攻击arXiv 2610.01062
Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架
提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱
- arXiv
- 2610.01062
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen2.5-7B-Instruct、Gemma-2-9B-IT、Llama-3.1-8B-Instruct 等 4 个
摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。
Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。
- 攻击arXiv 2510.11570
研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
- arXiv
- 2510.11570
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击arXiv 2609.05525
DIVA:针对离散扩散视觉语言模型的跨步条件传播视觉越狱
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
- arXiv
- 2609.05525
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 被测模型
- LLaDA-V、MMaDA、LLaDA2.0-Uni
- 攻击arXiv 2609.02172
BOSS:以广度优先后缀搜索改进 GCG 越狱优化
提出广度优先后缀搜索 BOSS,改进 GCG 越狱优化
- arXiv
- 2609.02172
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 被测模型
- Llama-2-7B-Chat、Yi-1.5-9B-Chat、Qwen2-7B-Instruct 等 8 个
摘要BOSS 把 GCG 类优化从单条深搜索改为多条短轨迹加源侧诊断。
BOSS 是插在 GCG 类离散 suffix 优化上的搜索框架:局部梯度更新不变,变的是固定预算花在深度还是广度。
- 攻击arXiv 2609.08236
研究:内容不变的风格包装可翻转 LLM 安全评判器的判定
提出内容不变样式包装,翻转安全评审器的判定
- arXiv
- 2609.08236
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- GPT-4o-mini (gpt4o)、GPT-4o-mini (strongreject)、DeepSeek-Chat 等 7 个
摘要论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
- 攻击arXiv 2609.08373
结构越狱可跨厂商泛化但不叠加:IICL 的跨厂商与多语言研究
检验结构越狱 IICL 能否跨厂商泛化并与语言约束叠加
- arXiv
- 2609.08373
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- gemini-2.5-flash、gemini-2.5-flash-lite
- 可解释性arXiv 2609.24801
研究用 XAI 归因分析 Prompt Guard 2,同义词替换可翻转其提示注入判定
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
- arXiv
- 2609.24801
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Prompt Guard 2 (86M)、Llama 3.1 8B
摘要作者称检测靠分散的词法线索。
- 攻击arXiv 2609.08213
DRIFT:通过偏转生成轨迹去除扩散模型水印的黑盒攻击
提出黑盒攻击 DRIFT,偏转生成轨迹以去除扩散水印
- arXiv
- 2609.08213
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒