全部论文
另有 429 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2608.25776
EvoMal 攻击利用自我进化编码 Agent 的自我投毒实现蠕虫式传播
提出 EVOMAL 攻击,诱导编码 Agent 自我投毒并蠕虫式传播技能
- arXiv
- 2608.25776
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。
- 攻击arXiv 2604.02623
论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
- arXiv
- 2604.02623
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
- 攻击arXiv 2610.05453
研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
- arXiv
- 2610.05453
- 发表
- 场景
- 模型与 API
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
- 攻击arXiv 2609.01222
研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响
提出 M-CPE 与 X-CPE 两类上下文特权提升攻击
- arXiv
- 2609.01222
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 攻击arXiv 2609.15989
研究者提出 plan injection 攻击,可绕过思维链监控
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
- arXiv
- 2609.15989
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
- 攻击arXiv 2609.01168
CRACK:用多智能体辩论越狱多层安全过滤的 T2I 模型
提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤
- arXiv
- 2609.01168
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要CRACK 以分层诊断的多智能体辩论搜索多层 T2I 过滤器的联合规避区域。
CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。
- 攻击arXiv 2609.07216
DIVA:利用视觉锚点对视频生成模型实施多模态越狱
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
- arXiv
- 2609.07216
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
- 攻击arXiv 2609.08213
DRIFT:通过偏转生成轨迹去除扩散模型水印的黑盒攻击
提出黑盒攻击 DRIFT,偏转生成轨迹以去除扩散水印
- arXiv
- 2609.08213
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2609.39047
BadAction:通过动作引导触发器对交互式视频生成模型实施后门攻击
提出 BadAction,通过动作触发器给交互式视频生成植入后门
- arXiv
- 2609.39047
- 发表
- 场景
- 模型与 API
- 攻击arXiv 2609.38253
CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱
提出 CollageAttack,用空间文本碎片重组越狱文生图模型
- arXiv
- 2609.38253
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。
- 攻击arXiv 2608.06862
SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化
提出 SYNCHAIN,诱导计算机使用 Agent 自合成潜伏技能并跨任务触发
- arXiv
- 2608.06862
- 发表
- 层
- 应用层
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
- 攻击arXiv 2609.06094
AdvPIE:面向文生图模型隐式漏洞的自动红队框架
提出 AdvPIE,在黑盒下搜索表面无害却生成有害图像的提示
- arXiv
- 2609.06094
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2609.31032
TempQ-Jail:面向文生视频越狱的查询受限候选排序方法
提出 TempQ-Jail,以查询受限候选排序越狱文生视频模型
- arXiv
- 2609.31032
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要待补读全文。
待补读全文。
- 攻击arXiv 2609.32400
SkillDRE:用预执行与运行时双阶段反馈自动演化恶意 Agent 技能
提出 SkillDRE,用预执行与运行时反馈演化恶意技能
- arXiv
- 2609.32400
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 攻击arXiv 2609.34920
RISE:用迭代策略演化对现代文生图模型做红队测试
提出 RISE,迭代演化可复用策略对文生图模型做红队
- arXiv
- 2609.34920
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒