全部论文
另有 426 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2607.21619
ASO:用GRPO优化视觉风格放大MLLM越狱攻击
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
- arXiv
- 2607.21619
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
- 攻击arXiv 2608.07430
研究者提出 SN-Guided Diffusion,利用扩散大模型安全神经元实现离线越狱
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱
- arXiv
- 2608.07430
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要论文揭示了扩散语言模型对自回归安全神经元的继承性,并提出纯离线黑盒越狱框架 SN-Guided Diffusion。
论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。
- 攻击arXiv 2606.21077
OTTER:仅替换五个 token 即可绕过 GPT 系列毒性审核
提出 OTTER 词元替换越狱,绕过表面毒性审核诱导有害回答
- arXiv
- 2606.21077
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要论文展示了表面毒性与恶意意图的解耦现象,通过标准 API 实现黑盒越狱测试,并提出闭环分类器加固建议。
摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
- 攻击arXiv 2610.06093
研究评测训练数据提取风险的跨语言迁移
用翻译前缀做跨语言训练数据提取,恢复英语训练文本中的 PII
- arXiv
- 2610.06093
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击提取与窃取
摘要跨语言 TDE 能恢复英语记忆的 PII,转移随多语训练和措辞保真变化。
这篇工作检验训练数据抽取是否跨语言:英语段落里记住的 PII,能否被其他语言的前缀逐字抽出。
摘要用信息论选含目标的任务组合,再看查询能否既隐藏意图又让目标被执行。
这篇工作把组合式意图隐藏写成任务选择:有害目标必须留在 bundle 里,同时让估计的有害意图概率贴近全集先验,或降到阈值以下。
- 攻击arXiv 2607.23496
Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
- arXiv
- 2607.23496
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
- 攻击arXiv 2608.09867
研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
- arXiv
- 2608.09867
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
- 攻击arXiv 2608.27531
MAMJ:面向视觉语言模型的元自适应多模态越狱攻击
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
- arXiv
- 2608.27531
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2608.04034
HACA:原子越狱策略解耦组合的多模态自动红队方法
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
- arXiv
- 2608.04034
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击arXiv 2609.15989
研究者提出 plan injection 攻击,可绕过思维链监控
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
- arXiv
- 2609.15989
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
- 攻击arXiv 2510.11570
研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
- arXiv
- 2510.11570
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击arXiv 2609.01168
CRACK:用多智能体辩论越狱多层安全过滤的 T2I 模型
提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤
- arXiv
- 2609.01168
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要CRACK 以分层诊断的多智能体辩论搜索多层 T2I 过滤器的联合规避区域。
CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。
- 攻击arXiv 2609.05525
DIVA:针对离散扩散视觉语言模型的跨步条件传播视觉越狱
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
- arXiv
- 2609.05525
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 攻击arXiv 2609.02172
BOSS:以广度优先后缀搜索改进 GCG 越狱优化
提出广度优先后缀搜索 BOSS,改进 GCG 越狱优化
- arXiv
- 2609.02172
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 白盒
摘要BOSS 把 GCG 类优化从单条深搜索改为多条短轨迹加源侧诊断。
BOSS 是插在 GCG 类离散 suffix 优化上的搜索框架:局部梯度更新不变,变的是固定预算花在深度还是广度。
- 攻击arXiv 2609.03247
研究揭示大语言模型的自发身份认证失败:五款模型的分阶段开发者身份实验
提出 MIPC 与 CFA,观察模型自拟测验后接受开发者身份
- arXiv
- 2609.03247
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要自拟测验可造成对话层虚假认证,但所测授权边界并未因此改变。
这项工作把“模型自己出题、自己批改、再宣布身份已核验”定义成对话层认证失败,并与后端提权分开。
- 攻击arXiv 2609.07216
DIVA:利用视觉锚点对视频生成模型实施多模态越狱
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
- arXiv
- 2609.07216
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
- 攻击arXiv 2609.08236
研究:内容不变的风格包装可翻转 LLM 安全评判器的判定
提出内容不变样式包装,翻转安全评审器的判定
- arXiv
- 2609.08236
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
- 攻击arXiv 2609.08373
结构越狱可跨厂商泛化但不叠加:IICL 的跨厂商与多语言研究
检验结构越狱 IICL 能否跨厂商泛化并与语言约束叠加
- arXiv
- 2609.08373
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒