全部论文
另有 443 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2607.21619
ASO:用GRPO优化视觉风格放大MLLM越狱攻击
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
- arXiv
- 2607.21619
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
- 攻击arXiv 2608.07430
研究者提出 SN-Guided Diffusion,利用扩散大模型安全神经元实现离线越狱
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱
- arXiv
- 2608.07430
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要论文揭示了扩散语言模型对自回归安全神经元的继承性,并提出纯离线黑盒越狱框架 SN-Guided Diffusion。
论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。
- 攻击arXiv 2608.25776
EvoMal 攻击利用自我进化编码 Agent 的自我投毒实现蠕虫式传播
提出 EVOMAL 攻击,诱导编码 Agent 自我投毒并蠕虫式传播技能
- arXiv
- 2608.25776
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。
- 攻击arXiv 2610.09027
P-VMI:对抗图像经 KV cache 持续影响多轮对话
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
- arXiv
- 2610.09027
- 发表
- 场景
- 模型与 API
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
- 攻击arXiv 2610.08098
CORSA:面向技能路由器的技能注入攻击可跨路由器与 LLM 迁移
提出 CORSA,在任务簇上联合优化技能注入的检索与执行
- arXiv
- 2610.08098
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 攻击arXiv 2610.07510
PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率
提出 PERSISTBD,发布前强化后门以穿透良性 SFT 与 RL
- arXiv
- 2610.07510
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要总结了论文关于后门在 SFT/RL 中存活的发现、两因子机制、PERSISTBD 方法与核心数字。
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
- 攻击arXiv 2610.03430
JIL:通过对抗后缀操纵 LLM 请求调度优先级
提出 JIL 对抗后缀,压低长度预测以抬高请求调度优先级
- arXiv
- 2610.03430
- 发表
- 场景
- 模型与 API
- 技术梯度与表征优化
摘要JIL 用对抗后缀压低长度预测,在预测式 LLM 调度中提高自身优先级。
JIL 是对预测式 LLM 调度的攻击:用对抗后缀压低长度预测,使请求在 SRPT 式队列里更早得到服务。
- 攻击arXiv 2610.03166
LiBRA:通过双向隐空间优化实现检测感知的图像水印去除
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
- arXiv
- 2610.03166
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
- 攻击arXiv 2607.23496
Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
- arXiv
- 2607.23496
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
- 评测与基准arXiv 2607.19855
研究者提出最小范数攻击集成,用鲁棒性曲线替代单一 ε 评测
提出最小范数攻击集成,用鲁棒性曲线评测图像分类器
- arXiv
- 2607.19855
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要预算可控的最小范数集成用 AOI 逼近攻击前沿,DOI 给出不依赖单一ε的防御排序。
这篇工作把对抗鲁棒评测从单一 ε、固定集成,改成可按查询预算收紧的曲线估计。
- 攻击arXiv 2607.12340
研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击
提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持
- arXiv
- 2607.12340
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
- 攻击arXiv 2608.09867
研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
- arXiv
- 2608.09867
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
- 攻击arXiv 2608.27531
MAMJ:面向视觉语言模型的元自适应多模态越狱攻击
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
- arXiv
- 2608.27531
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2608.04034
HACA:原子越狱策略解耦组合的多模态自动红队方法
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
- arXiv
- 2608.04034
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要质量筛选挡不住部分高分样本的安全削弱。
Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。
- 攻击arXiv 2610.01062
Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架
提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱
- arXiv
- 2610.01062
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。
Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。
- 攻击arXiv 2510.11570
研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
- arXiv
- 2510.11570
- 发表
- 层
- 提示层
- 场景
- 模型与 API