全部论文
另有 530 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2608.09732
ColluSkill 用跨技能组合绕过 Agent 技能扫描器
提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器
- arXiv
- 2608.09732
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 被测模型
- GPT-5.5、DeepSeek-V4-Pro、GLM-5.2
摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。
- 攻击arXiv 2606.21077
OTTER:仅替换五个 token 即可绕过 GPT 系列毒性审核
提出 OTTER 词元替换越狱,绕过表面毒性审核诱导有害回答
- arXiv
- 2606.21077
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- gpt-4-turbo、gpt-4o、gpt-4o-mini 等 4 个
摘要论文展示了表面毒性与恶意意图的解耦现象,通过标准 API 实现黑盒越狱测试,并提出闭环分类器加固建议。
- 攻击arXiv 2610.07723
研究者提出答案侧后门:让模型自生成触发词绕过安全拒答
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
- arXiv
- 2610.07723
- 发表
- 场景
- 模型与 API
- 被测模型
- Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
- 攻击arXiv 2610.03166
LiBRA:通过双向隐空间优化实现检测感知的图像水印去除
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
- arXiv
- 2610.03166
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 被测模型
- Stable Signature、YU1、HiDDeN 等 4 个
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
- 攻击arXiv 2610.02302
研究者提出意图隐藏越狱的信息论框架,分析组合式攻击
提出组合式意图隐藏越狱,按先验后验匹配选择辅助任务
- arXiv
- 2610.02302
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Qwen3-1.7B、Qwen3-4B、Qwen3-8B 等 7 个
摘要用信息论选含目标的任务组合,再看查询能否既隐藏意图又让目标被执行。
这篇工作把组合式意图隐藏写成任务选择:有害目标必须留在 bundle 里,同时让估计的有害意图概率贴近全集先验,或降到阈值以下。
- 攻击arXiv 2610.03124
研究提出 Untag 攻击框架,使开源大模型触发标签滥用检测机制失效
提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测
- arXiv
- 2610.03124
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Llama2 (7B)、Llama3 (8B)、Qwen2.5 (7B)
摘要作者用 UNTAG 评估 trigger-tag,认为其不能充当开放权重滥用检测的主要边界。
UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。
- 攻击arXiv 2609.18217
研究:跨通道碎片化攻击可绕过 MCP 单通道防御
提出跨通道分段攻击,利用 MCP 隐式信任诱导外发敏感文件
- arXiv
- 2609.18217
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 被测模型
- GPT-4o、GPT-4o-mini、GPT-5.4 等 15 个
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
- 攻击arXiv 2607.21839
论文指出密码学模型认证的假设缺口:审计通过但部署失效
提出数据伪造攻击,使密码学模型认证在审计集通过但部署失效
- arXiv
- 2607.21839
- 发表
- 场景
- 模型与 API
- 被测模型
- SciKit-Learn decision tree、XGBoost、226M-parameter neural network 等 4 个
摘要固定审计集上的 ZKP 认证可被数据伪造绕过。
这篇工作同时给出对 CMC 的数据伪造攻击,以及先承诺、后抽样的认证模板。。
- 攻击arXiv 2608.04034
HACA:原子越狱策略解耦组合的多模态自动红队方法
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
- arXiv
- 2608.04034
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- LLaVA-1.6-Mistral-7B、InternVL-3.5-8B、VLGuard (LLaVA-v1.5-7B-Mixed) 等 5 个
- 评测与基准arXiv 2609.05843
SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
- arXiv
- 2609.05843
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- GPT-5.4 mini、GPT-5.5、DeepSeek V4 Flash 等 12 个
摘要SinoGlyphBench 显示中文字形混淆会同时增加有害漏报和误报,全文扰动最重。
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。
- 攻击arXiv 2609.15989
研究者提出 plan injection 攻击,可绕过思维链监控
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
- arXiv
- 2609.15989
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
- 被测模型
- Qwen2.5-Coder-7B-Instruct、Qwen3-8B、DeepSeek-R1-0528 等 6 个
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
- 攻击arXiv 2609.07216
DIVA:利用视觉锚点对视频生成模型实施多模态越狱
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
- arXiv
- 2609.07216
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Wan、CogVideoX、LTX-Video 等 9 个
摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
- 攻击arXiv 2609.08236
研究:内容不变的风格包装可翻转 LLM 安全评判器的判定
提出内容不变样式包装,翻转安全评审器的判定
- arXiv
- 2609.08236
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- GPT-4o-mini (gpt4o)、GPT-4o-mini (strongreject)、DeepSeek-Chat 等 7 个
摘要论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
- 可解释性arXiv 2609.24801
研究用 XAI 归因分析 Prompt Guard 2,同义词替换可翻转其提示注入判定
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
- arXiv
- 2609.24801
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Prompt Guard 2 (86M)、Llama 3.1 8B
摘要作者称检测靠分散的词法线索。
- 攻击arXiv 2609.08213
DRIFT:通过偏转生成轨迹去除扩散模型水印的黑盒攻击
提出黑盒攻击 DRIFT,偏转生成轨迹以去除扩散水印
- arXiv
- 2609.08213
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2609.09553
研究:任意密文攻击前沿大模型无需微调即可越狱
提出任意字母置换密码越狱,无需微调即可诱导有害输出
- arXiv
- 2609.09553
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Claude Sonnet 4、Claude Sonnet 4.5、Gemini 3 Flash (preview) 等 7 个
摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
- 攻击arXiv 2609.10117
研究揭示基于混淆的端侧 LLM 保护方案的安全边界
提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型
- arXiv
- 2609.10117
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- BERT-Base、ViT-Base、Qwen2.5-0.5B 等 4 个
摘要Oprior 是四原语复合的安全边界,Collapse 利用列方向泄漏抽取替代模型,Oext 只被同一攻击评测。
这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。
- 攻击arXiv 2609.12909
研究者在双 T4 上复现并插桩 Tree-Ring 语义水印伪造攻击
复现 Tree-Ring 语义水印的黑盒伪造并恢复检测统计量
- arXiv
- 2609.12909
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Stable Diffusion XL base 1.0
- 攻击arXiv 2609.31726
研究者提出通过替换神经网络权重高容量外泄医学影像的攻击
提出连续潜码隐写,把医学影像写入模型权重以绕过导出限制
- arXiv
- 2609.31726
- 发表
- 场景
- 模型与 API
- 被测模型
- U-Net、DenseNet121