全部论文
另有 426 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2607.21619
ASO:用GRPO优化视觉风格放大MLLM越狱攻击
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
- arXiv
- 2607.21619
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
- 攻击arXiv 2608.07430
研究者提出 SN-Guided Diffusion,利用扩散大模型安全神经元实现离线越狱
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱
- arXiv
- 2608.07430
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要论文揭示了扩散语言模型对自回归安全神经元的继承性,并提出纯离线黑盒越狱框架 SN-Guided Diffusion。
论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。
- 评测与基准arXiv 2605.14605
研究:恶意微调防御在持续训练下失效,72 条防御轨迹危害度全部上升
用代价曲线评估恶意微调防御在持续训练下的衰减
- arXiv
- 2605.14605
- 发表
- 场景
- 模型与 API
摘要论文指出恶意微调防御在持续训练下均会衰减,表明基于有限攻击者假设的防御无法为开源模型提供持久保护。
- 攻击arXiv 2607.03968
研究揭示 IDE 编程 Agent 的工作流级越狱:GitHub Copilot 四后端 816/816 生成有害内容
提出工作流级越狱,在 IDE 编程 Agent 多轮流程中诱导生成有害代码
- arXiv
- 2607.03968
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 攻击者
- 黑盒
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
- 攻击arXiv 2606.21077
OTTER:仅替换五个 token 即可绕过 GPT 系列毒性审核
提出 OTTER 词元替换越狱,绕过表面毒性审核诱导有害回答
- arXiv
- 2606.21077
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要论文展示了表面毒性与恶意意图的解耦现象,通过标准 API 实现黑盒越狱测试,并提出闭环分类器加固建议。
- 防御arXiv 2609.38909
Purdue 提出 Pact:将欺骗作为行为遗忘
提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解
- arXiv
- 2609.38909
- 发表
- 场景
- 模型与 API
- 攻击者
- 白盒
摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。
- 评测与基准arXiv 2609.22076
APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权
构建 APort Vault 基准,对比裸模型与确定性授权对越权支付的拦截
- arXiv
- 2609.22076
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 评测与基准arXiv 2610.10276
PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤
提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤
- arXiv
- 2610.10276
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。
摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
- 评测与基准arXiv 2610.07089
研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹
构建统一滥用监视基准,评测分解攻击与提示注入轨迹
- arXiv
- 2610.07089
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
- 攻击arXiv 2601.22169
In Vino Veritas and Vulnerabilities:用醉酒语言诱导检验 LLM 安全
用醉酒语言诱导改编对话模型并评测越狱与隐私泄露
- arXiv
- 2601.22169
- 发表
- 场景
- 模型与 API
摘要醉酒语言诱导在五个 LLM 上抬高越狱与部分隐私错误,作者将其视为攻击向量。
作者把醉酒语言当作攻击向量,检验把 LLM 适配成醉酒发短信的模式后,越狱和情境隐私是否变差。动机是人类醉酒时的失范与泄密,以及 LLM 模拟人设的能力。
摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
- 防御arXiv 2610.02853
研究提出基于收缩约束状态空间模型的有界可达性与越狱检测方法
提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱
- arXiv
- 2610.02853
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要收缩给出玩具 LTI 的有界认证。
给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。
摘要用信息论选含目标的任务组合,再看查询能否既隐藏意图又让目标被执行。
这篇工作把组合式意图隐藏写成任务选择:有害目标必须留在 bundle 里,同时让估计的有害意图概率贴近全集先验,或降到阈值以下。
- 评测与基准arXiv 2610.02827
MLCommons 发布 Jailbreak Benchmark v1.0
构建 MLCommons 越狱基准以测量模型的单轮越狱韧性
- arXiv
- 2610.02827
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击越狱
摘要论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。
- 攻击arXiv 2610.03124
研究提出 Untag 攻击框架,使开源大模型触发标签滥用检测机制失效
提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测
- arXiv
- 2610.03124
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要作者用 UNTAG 评估 trigger-tag,认为其不能充当开放权重滥用检测的主要边界。
UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。
摘要定位与恢复可以复现,但知情攻击能把损伤移出冻结带,并打败跨检查点的截断修复。
这篇工作检验:把拒答定位到某些层或更新方向之后,能不能在攻击者知情时还守住拒答。。
- 攻击arXiv 2606.09084
研究者提出 Context-Fractured Decomposition 攻击
提出 CFD,跨会话拆解有害目标以绕过工具智能体本地监控
- arXiv
- 2606.09084
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要CFD 用无指令 artifact 把越狱拆到跨会话。
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。
- 攻击arXiv 2605.30883
TRACE:面向 LLM Agent 的任务感知自适应自进化越狱框架
提出 TRACE,用任务分解与可演化多轮策略诱导编程智能体执行有害工作流
- arXiv
- 2605.30883
- 发表
- 层
- 应用层
- 场景
- 编程 Agent