全部论文
另有 442 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2607.21619
ASO:用GRPO优化视觉风格放大MLLM越狱攻击
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
- arXiv
- 2607.21619
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
- 攻击arXiv 2608.25776
EvoMal 攻击利用自我进化编码 Agent 的自我投毒实现蠕虫式传播
提出 EVOMAL 攻击,诱导编码 Agent 自我投毒并蠕虫式传播技能
- arXiv
- 2608.25776
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。
- 评测与基准arXiv 2610.07939
CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
- arXiv
- 2610.07939
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
- 攻击arXiv 2604.02623
论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
- arXiv
- 2604.02623
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
- 攻击arXiv 2610.09240
WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
- arXiv
- 2610.09240
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
- 评测与基准arXiv 2610.06898
DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
- arXiv
- 2610.06898
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
- 评测与基准arXiv 2609.38948
DrivingBench 发布:让视觉语言模型驾驶丰田 Corolla 绕桩
提出 DrivingBench 评测视觉语言模型的真车闭环驾驶
- arXiv
- 2609.38948
- 发表
- 层
- 应用层
- 组件视觉
摘要仅 Astra 第二次跑完低速锥桶路线。
DrivingBench 评测通用 VLM 能否自己闭环开真车,推理延迟也算进任务。
- 评测与基准arXiv 2608.04830
ContextWeave:面向长周期办公工作流的智能体记忆基准
提出办公工作流记忆基准 ContextWeave ,衡量历史召回对后续任务的增益
- arXiv
- 2608.04830
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 组件记忆
摘要ContextWeave 用真实办公任务流检验记忆是否改善工作区质量与偏好对齐。
ContextWeave 是面向语言智能体记忆的纵向基准,用来看召回先前经验能否让后续办公任务做得更好。
- 评测与基准arXiv 2609.05535
Mind2Web-Injection:面向网页 Agent 视觉提示注入护栏的证据对齐评测
提出 Mind2Web-Injection,评测网页 Agent 截图护栏的证据对齐
- arXiv
- 2609.05535
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要作者称检测、定位和反事实响应在六个 VLM 上可分开。
Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。
- 防御arXiv 2610.00450
ZoneClaw 用记忆分区防御 OpenClaw 式计算机使用 Agent 的持久记忆攻击
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
- arXiv
- 2610.00450
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 攻击arXiv 2608.27531
MAMJ:面向视觉语言模型的元自适应多模态越狱攻击
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
- arXiv
- 2608.27531
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 评测与基准arXiv 2608.18066
Salesforce AI Research 重测自改进 Agent
重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳
- arXiv
- 2608.18066
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 组件记忆
摘要论文揭示了基于记忆的自改进智能体在多次运行和乱序下的脆弱性,并指出规约不完备是诱发退化的关键瓶颈。
这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。
- 攻击arXiv 2608.04034
HACA:原子越狱策略解耦组合的多模态自动红队方法
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
- arXiv
- 2608.04034
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击arXiv 2609.01222
研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响
提出 M-CPE 与 X-CPE 两类上下文特权提升攻击
- arXiv
- 2609.01222
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 评测与基准arXiv 2609.04859
MM-IFEval-Pro:面向视觉语言模型的多语言抗攻击指令遵循基准
提出抗攻击多语言视觉指令遵循基准 MM-IFEval-Pro
- arXiv
- 2609.04859
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Qwen3-VL-8B-Instruct、InternVL3.5-8B、MiniCPM-V4.5 等 5 个
摘要MM-IFEval-Pro 以规则验证评测中英指令遵循与视觉劫持,GRPO 提高两基座平均分。
MM-IFEval-Pro 是面向 VLM 的中英多模态指令遵循基准,并配有可用规则计算奖励的 GRPO 训练集。
- 评测与基准arXiv 2609.05843
SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
- arXiv
- 2609.05843
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要SinoGlyphBench 显示中文字形混淆会同时增加有害漏报和误报,全文扰动最重。
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。
- 防御arXiv 2607.13336
TC-UAP:针对图像转视频与微调定制的通用视频保护方法
提出 TC-UAP,用身份级多帧扰动保护视频免被定制复现身份
- arXiv
- 2607.13336
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 组件视频
摘要TC-UAP 以可复用的时间一致扰动干扰两类定制共用的 VAE 隐空间。
作者要解决的是:发布前如何给视频加不可见扰动,使片段既不能被拿去微调视频扩散模型,也不能被抽帧做 image-to-video。
- 评测与基准arXiv 2607.14611
论文评测 Claude Code 与 Codex 记忆文件中的提示注入风险
评测编码智能体记忆文件中的提示注入及其跨会话持久性
- arXiv
- 2607.14611
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要已植入记忆文件的载荷可以跨会话影响 Claude Code 与 Codex,攻击成功与载荷是否留下是两种不同的失败。
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。