全部论文
另有 429 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2610.09027
P-VMI:对抗图像经 KV cache 持续影响多轮对话
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
- arXiv
- 2610.09027
- 发表
- 场景
- 模型与 API
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
- 攻击arXiv 2609.15989
研究者提出 plan injection 攻击,可绕过思维链监控
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
- arXiv
- 2609.15989
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
- 攻击arXiv 2609.05525
DIVA:针对离散扩散视觉语言模型的跨步条件传播视觉越狱
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
- arXiv
- 2609.05525
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 攻击arXiv 2609.08213
DRIFT:通过偏转生成轨迹去除扩散模型水印的黑盒攻击
提出黑盒攻击 DRIFT,偏转生成轨迹以去除扩散水印
- arXiv
- 2609.08213
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2609.04260
GhostWord:针对自动语音识别的细粒度后门攻击
提出 GhostWord 词级触发后门,对自动语音识别做数据投毒
- arXiv
- 2609.04260
- 发表
- 场景
- 模型与 API
- 攻击arXiv 2609.32400
SkillDRE:用预执行与运行时双阶段反馈自动演化恶意 Agent 技能
提出 SkillDRE,用预执行与运行时反馈演化恶意技能
- arXiv
- 2609.32400
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
已经到底了