全部论文
另有 429 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2607.21619
ASO:用GRPO优化视觉风格放大MLLM越狱攻击
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
- arXiv
- 2607.21619
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
- 攻击arXiv 2608.07430
研究者提出 SN-Guided Diffusion,利用扩散大模型安全神经元实现离线越狱
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱
- arXiv
- 2608.07430
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要论文揭示了扩散语言模型对自回归安全神经元的继承性,并提出纯离线黑盒越狱框架 SN-Guided Diffusion。
论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。
- 攻击arXiv 2607.03968
研究揭示 IDE 编程 Agent 的工作流级越狱:GitHub Copilot 四后端 816/816 生成有害内容
提出工作流级越狱,在 IDE 编程 Agent 多轮流程中诱导生成有害代码
- arXiv
- 2607.03968
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 攻击者
- 黑盒
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
- 攻击arXiv 2606.21077
OTTER:仅替换五个 token 即可绕过 GPT 系列毒性审核
提出 OTTER 词元替换越狱,绕过表面毒性审核诱导有害回答
- arXiv
- 2606.21077
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要论文展示了表面毒性与恶意意图的解耦现象,通过标准 API 实现黑盒越狱测试,并提出闭环分类器加固建议。
- 评测与基准arXiv 2610.10276
PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤
提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤
- arXiv
- 2610.10276
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。
摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
摘要UnAct 用前向激活做类别遗忘。
UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。
- 防御arXiv 2602.24210
研究者提出 Staged Decoding 与 SFT 数据集,减少大推理模型推理轨迹中的隐私泄露
提出 Staged Decoding 与指令跟随训练,减少推理轨迹隐私泄露
- arXiv
- 2602.24210
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要用一般指令跟随训练加分段解码,可降低轨迹隐私泄露,但数学效用下降。
本文把大推理模型的隐私问题做成轨迹可控性:隐私指令是指令,轨迹不跟随就会把敏感上下文写进可被提示注入导出的文本。
- 攻击arXiv 2601.22169
In Vino Veritas and Vulnerabilities:用醉酒语言诱导检验 LLM 安全
用醉酒语言诱导改编对话模型并评测越狱与隐私泄露
- arXiv
- 2601.22169
- 发表
- 场景
- 模型与 API
摘要醉酒语言诱导在五个 LLM 上抬高越狱与部分隐私错误,作者将其视为攻击向量。
作者把醉酒语言当作攻击向量,检验把 LLM 适配成醉酒发短信的模式后,越狱和情境隐私是否变差。动机是人类醉酒时的失范与泄密,以及 LLM 模拟人设的能力。
- 攻击arXiv 2610.06093
研究评测训练数据提取风险的跨语言迁移
用翻译前缀做跨语言训练数据提取,恢复英语训练文本中的 PII
- arXiv
- 2610.06093
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击提取与窃取
摘要跨语言 TDE 能恢复英语记忆的 PII,转移随多语训练和措辞保真变化。
这篇工作检验训练数据抽取是否跨语言:英语段落里记住的 PII,能否被其他语言的前缀逐字抽出。
摘要激活已恢复大部分 token。
这篇工作测量 split learning 分裂点上的文本泄漏:激活单独能恢复多少,训练回传的梯度再增加多少,以及按 token 还是按整篇计分会不会改写结论。
- 攻击arXiv 2610.06848
TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击
提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员
- arXiv
- 2610.06848
- 发表
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。
- 防御arXiv 2610.02853
研究提出基于收缩约束状态空间模型的有界可达性与越狱检测方法
提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱
- arXiv
- 2610.02853
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要收缩给出玩具 LTI 的有界认证。
给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。
- 防御arXiv 2610.02418
Whiteout:用混淆样本阻止 LLM 泄露个人敏感信息
提出 Whiteout,用伪装样本微调覆盖个人敏感信息关联
- arXiv
- 2610.02418
- 发表
- 场景
- 模型与 API
摘要用信息论选含目标的任务组合,再看查询能否既隐藏意图又让目标被执行。
这篇工作把组合式意图隐藏写成任务选择:有害目标必须留在 bundle 里,同时让估计的有害意图概率贴近全集先验,或降到阈值以下。
- 评测与基准arXiv 2610.02986
OLMo-Detect:面向 LLM 成员推断的多阶段混淆控制基准
提出基准 OLMo-Detect 评测 LLM 成员推断
- arXiv
- 2610.02986
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击提取与窃取
- 评测与基准arXiv 2610.02827
MLCommons 发布 Jailbreak Benchmark v1.0
构建 MLCommons 越狱基准以测量模型的单轮越狱韧性
- arXiv
- 2610.02827
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击越狱
摘要论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。
- 攻击arXiv 2610.01365
ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
- arXiv
- 2610.01365
- 发表
- 场景
- 模型与 API
摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。
- 攻击arXiv 2605.30883
TRACE:面向 LLM Agent 的任务感知自适应自进化越狱框架
提出 TRACE,用任务分解与可演化多轮策略诱导编程智能体执行有害工作流
- arXiv
- 2605.30883
- 发表
- 层
- 应用层
- 场景
- 编程 Agent