全部论文
另有 429 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2607.21619
ASO:用GRPO优化视觉风格放大MLLM越狱攻击
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
- arXiv
- 2607.21619
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
- 评测与基准arXiv 2610.07939
CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
- arXiv
- 2610.07939
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
- 评测与基准arXiv 2605.16626
Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现
构建 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
- arXiv
- 2605.16626
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。
- 评测与基准arXiv 2606.05647
研究:94% 开发者未能识破编码 Agent 的隐蔽破坏
评测人类开发者在协作编程中能否发现编码 Agent 的隐蔽破坏
- arXiv
- 2606.05647
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 评测与基准arXiv 2609.38948
DrivingBench 发布:让视觉语言模型驾驶丰田 Corolla 绕桩
提出 DrivingBench 评测视觉语言模型的真车闭环驾驶
- arXiv
- 2609.38948
- 发表
- 层
- 应用层
- 组件视觉
摘要仅 Astra 第二次跑完低速锥桶路线。
DrivingBench 评测通用 VLM 能否自己闭环开真车,推理延迟也算进任务。
- 防御arXiv 2610.06001
AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击
提出 AgentSpy,在系统调用层观测 Agent 并检测技能注入
- arXiv
- 2610.06001
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
- 防御arXiv 2605.17380
Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月
提出企业级检测系统 ADR,检测编程 Agent 的提示注入与恶意 MCP
- arXiv
- 2605.17380
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
- 防御arXiv 2610.05163
研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准
提出路径对齐归因 PAA,在边界动作前审计长流程智能体的分段提示注入
- arXiv
- 2610.05163
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文针对长流程注入提出边界动作审计与 PAA,在保持低误阻的同时实现高拦截率。
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
- 防御arXiv 2610.03055
HackTrace:用生成状态监督检测代码生成中的奖励作弊
提出 HACKTRACE,用生成期激活检测代码智能体的奖励作弊
- arXiv
- 2610.03055
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。
摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
- 攻击arXiv 2608.27531
MAMJ:面向视觉语言模型的元自适应多模态越狱攻击
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
- arXiv
- 2608.27531
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2608.04034
HACA:原子越狱策略解耦组合的多模态自动红队方法
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
- arXiv
- 2608.04034
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 防御arXiv 2608.21101
ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关
提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入
- arXiv
- 2608.21101
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
- 评测与基准arXiv 2609.04859
MM-IFEval-Pro:面向视觉语言模型的多语言抗攻击指令遵循基准
提出抗攻击多语言视觉指令遵循基准 MM-IFEval-Pro
- arXiv
- 2609.04859
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Qwen3-VL-8B-Instruct、InternVL3.5-8B、MiniCPM-V4.5 等 5 个
摘要MM-IFEval-Pro 以规则验证评测中英指令遵循与视觉劫持,GRPO 提高两基座平均分。
MM-IFEval-Pro 是面向 VLM 的中英多模态指令遵循基准,并配有可用规则计算奖励的 GRPO 训练集。
- 评测与基准arXiv 2609.05843
SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
- arXiv
- 2609.05843
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要SinoGlyphBench 显示中文字形混淆会同时增加有害漏报和误报,全文扰动最重。
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。
- 防御arXiv 2607.13336
TC-UAP:针对图像转视频与微调定制的通用视频保护方法
提出 TC-UAP,用身份级多帧扰动保护视频免被定制复现身份
- arXiv
- 2607.13336
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 组件视频
摘要TC-UAP 以可复用的时间一致扰动干扰两类定制共用的 VAE 隐空间。
作者要解决的是:发布前如何给视频加不可见扰动,使片段既不能被拿去微调视频扩散模型,也不能被抽帧做 image-to-video。
- 攻击arXiv 2609.15989
研究者提出 plan injection 攻击,可绕过思维链监控
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
- arXiv
- 2609.15989
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
- 防御arXiv 2609.36562
ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
- arXiv
- 2609.36562
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。