全部论文
另有 444 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2606.21077
OTTER:仅替换五个 token 即可绕过 GPT 系列毒性审核
提出 OTTER 词元替换越狱,绕过表面毒性审核诱导有害回答
- arXiv
- 2606.21077
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要论文展示了表面毒性与恶意意图的解耦现象,通过标准 API 实现黑盒越狱测试,并提出闭环分类器加固建议。
- 防御arXiv 2610.02853
研究提出基于收缩约束状态空间模型的有界可达性与越狱检测方法
提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱
- arXiv
- 2610.02853
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要收缩给出玩具 LTI 的有界认证。
给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。
摘要对抗包装使 guard 高置信漏检,而对应 base 在同一输入上常更不确定。
诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。
- 防御arXiv 2609.36562
ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
- arXiv
- 2609.36562
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
- 防御arXiv 2610.01058
MOMAT:面向量化 LLM 低功耗越狱防御的多图集混合框架
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
- arXiv
- 2610.01058
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击arXiv 2510.11570
研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
- arXiv
- 2510.11570
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 防御arXiv 2609.01046
HiveTraceGuard-Pro:面向提示注入、越狱与对抗混淆的紧凑生成式护栏
提出生成式护栏 HiveTraceGuard-Pro,检测提示注入、越狱与混淆
- arXiv
- 2609.01046
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要0.6B 俄英护栏在自建俄语干净集和 PI-RU 上得分最高,聚合 key 居第三,过阻断和回复精度仍是作者标出的短板。
HiveTraceGuard-Pro 是面向请求与回复审核的 0.6B 生成式护栏,由 Qwen3-0.6B 经 LoRA 微调,在俄语和英语上训练,只输出一个 safe/unsafe 裁决。
- 攻击arXiv 2609.01168
CRACK:用多智能体辩论越狱多层安全过滤的 T2I 模型
提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤
- arXiv
- 2609.01168
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要CRACK 以分层诊断的多智能体辩论搜索多层 T2I 过滤器的联合规避区域。
CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。
- 防御arXiv 2609.06540
SRD-GUARD:通过语义改写与多模型联合评分暴露潜在意图的 LLM 防御框架
提出 SRD-GUARD,以语义改写与多模型联合评分拦截包装式越狱
- arXiv
- 2609.06540
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2609.07216
DIVA:利用视觉锚点对视频生成模型实施多模态越狱
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
- arXiv
- 2609.07216
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
- 评测与基准arXiv 2609.08256
ACEA:面向红蓝队对抗的 LLM 协同演化测试平台
提出红蓝对抗评测平台 ACEA,分开计量攻击强度与防御效果
- arXiv
- 2609.08256
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要ACEA 用 ASAP 让红蓝对同一目标对打。
ACEA 是让可插拔红队和蓝队共享一个目标 LLM 的对打场地,把攻击强度和防御效果分开记分。作者要补三处空缺:双方只能对着固定对手分开练。LLM judge 分不清真实泄露和幻觉,拦截后又看不到攻击有多强。
- 防御arXiv 2609.10613
后验重加权框架解释并缓解多模态大模型上下文越狱
用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御
- arXiv
- 2609.10613
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要后验重加权解释上下文越狱的缩放,并支持风险门控的良性示例防御。
Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。
- 评测与基准arXiv 2609.09798
CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
- arXiv
- 2609.09798
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 攻击者
- 黑盒
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
- 评测与基准arXiv 2609.21793
CASCADE 研究:跨流水线阶段的越狱防御组合评估
用 CASCADE 在统一威胁模型下筛选跨阶段越狱防御组合
- arXiv
- 2609.21793
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击arXiv 2609.09553
研究:任意密文攻击前沿大模型无需微调即可越狱
提出任意字母置换密码越狱,无需微调即可诱导有害输出
- arXiv
- 2609.09553
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
- 攻击arXiv 2609.38253
CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱
提出 CollageAttack,用空间文本碎片重组越狱文生图模型
- arXiv
- 2609.38253
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。
- 评测与基准arXiv 2608.03070
FAR.AI 发布 AI 安全排行榜与护栏最低标准 1.0
建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力
- arXiv
- 2608.03070
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要论文系统评测了前沿模型对已知静态越狱的防御能力,揭示了厂商间防护鲁棒性的巨大分化。
本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。
- 评测与基准arXiv 2609.00498
SEAV:面向大语言模型越狱评测的有效性验证框架
提出 SEAV,逐步核验越狱回复的事实与操作有效性
- arXiv
- 2609.00498
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要SEAV 用逐步检索和依赖检查重判越狱成功,SD-A 与三个基准上的原成功标签都有一批被改判。
SEAV 是一层生成后的越狱评测:回复要相关、事实正确、顺序合规,并且在操作上足以推进有害意图,才算成功。。
- 攻击arXiv 2609.34920
RISE:用迭代策略演化对现代文生图模型做红队测试
提出 RISE,迭代演化可复用策略对文生图模型做红队
- arXiv
- 2609.34920
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒