全部论文
另有 455 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2607.21619
ASO:用GRPO优化视觉风格放大MLLM越狱攻击
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
- arXiv
- 2607.21619
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
- 攻击arXiv 2608.25776
EvoMal 攻击利用自我进化编码 Agent 的自我投毒实现蠕虫式传播
提出 EVOMAL 攻击,诱导编码 Agent 自我投毒并蠕虫式传播技能
- arXiv
- 2608.25776
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。
- 评测与基准arXiv 2610.07939
CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
- arXiv
- 2610.07939
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- C2P-CLIP、ForgeLens、D3-Im 等 10 个
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
- 攻击arXiv 2610.09819
FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
- arXiv
- 2610.09819
- 发表
- 场景
- 模型与 API
- 被测模型
- HuBERT-base、WavLM-base
摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
- 攻击arXiv 2610.09027
P-VMI:对抗图像经 KV cache 持续影响多轮对话
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
- arXiv
- 2610.09027
- 发表
- 场景
- 模型与 API
- 被测模型
- Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
- 防御arXiv 2610.07774收录
研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器
研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。
- arXiv
- 2610.07774
- 收录
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen3-VL-30B-A3B-Instruct、Kimi-VL-A3B-Instruct
摘要读出而非操纵 router logits,可在不改模型的情况下降低两模型的组合式安全错误。
作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。
- 评测与基准arXiv 2609.38948
DrivingBench 发布:让视觉语言模型驾驶丰田 Corolla 绕桩
提出 DrivingBench 评测视觉语言模型的真车闭环驾驶
- arXiv
- 2609.38948
- 发表
- 层
- 应用层
- 组件视觉
摘要仅 Astra 第二次跑完低速锥桶路线。
DrivingBench 评测通用 VLM 能否自己闭环开真车,推理延迟也算进任务。
- 其他arXiv 2609.39518
研究:视觉语言模型在协作任务中很少主动表达指代不确定性
研究视觉语言模型在协作中能否表示并说出指称不确定性
- arXiv
- 2609.39518
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件视觉
摘要指称不确定性可被引出,但很少说出来。
- 攻击arXiv 2610.05453
研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
- arXiv
- 2610.05453
- 发表
- 场景
- 模型与 API
- 被测模型
- OmniGen2、BAGEL-7B
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
- 评测与基准arXiv 2610.06503
研究评测五款开源文生图模型的有害内容生成与审核缺口
评测文生图模型的有害内容生成能力与审核检测缺口
- arXiv
- 2610.06503
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- SDXL、Stable Diffusion 3.5 Large、FLUX.1-dev 等 12 个
摘要IDU 同时做单步蒸馏和数据遗忘,在 MNIST 与 CIFAR-10 上压低遗忘类生成率。
IDU 面向无条件 flow 与 score-based 教师,在蒸馏成单步生成器的同时做数据遗忘。
- 可解释性arXiv 2610.04112收录
Spatial-SAE:用空间依赖先验改进视觉概念分解
提出 Spatial-SAE,用空间依赖先验改进视觉概念分解
- arXiv
- 2610.04112
- 收录
- 层
- 模型层
- 场景
- 模型与 API
- 组件视觉
摘要Spatial-SAE 用空间 Markov 先验替换 patch 独立先验,换取更对齐的视觉概念。
Spatial-SAE 针对视觉 SAE 的概念碎片化:tokenwise 目标在 LRH 之外把各 patch 的码当成独立,而作者报告冻结视觉 Transformer 的激活仍保留邻域可预测性。
- 防御arXiv 2610.05637
研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
- arXiv
- 2610.05637
- 发表
- 场景
- 模型与 API
- 被测模型
- Claude Sonnet 4.6、Gemini 3.5 Flash、Molmo2-8B 等 5 个
摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。
- 其他arXiv 2610.03389
Patch-to-Prune:在 Qwen2.5-VL 与 LLaVA 上剪枝视觉计算
提出 Patch-to-Prune,旁路 VLM 部分层的视觉投影计算
- arXiv
- 2610.03389
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen2.5-VL-3B-Instruct、Qwen2.5-VL-7B-Instruct、LLaVA-v1.6-Vicuna-7B-HF 等 4 个
- 组件视觉
摘要P2P 用深度上的激活修补旁路视觉投影,以可调容忍度交换准确率与计算量。
P2P 是面向 VLM 推理的训练无关计算旁路:不删除视觉 token,而在选定 decoder 层用固定激活代理代替视觉投影。
- 评测与基准arXiv 2608.04830
ContextWeave:面向长周期办公工作流的智能体记忆基准
提出办公工作流记忆基准 ContextWeave ,衡量历史召回对后续任务的增益
- arXiv
- 2608.04830
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 组件记忆
摘要ContextWeave 用真实办公任务流检验记忆是否改善工作区质量与偏好对齐。
ContextWeave 是面向语言智能体记忆的纵向基准,用来看召回先前经验能否让后续办公任务做得更好。
摘要论文证实持久工件与内存可形成跨智能体传播链,揭示了将共享工件纳入安全防线的重要意义。
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
- 评测与基准arXiv 2608.11816
研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍
审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为
- arXiv
- 2608.11816
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要论文系统审计了 VLM 多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。
论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。
- 防御arXiv 2607.24017
多模态大模型注意力中的语义与结构偏差解耦:SPAR 免训练干预方法
提出 SPAR 以分离注意力结构偏置并重分配视觉注意力,减轻多模态幻觉
- arXiv
- 2607.24017
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要SPAR 用显著性净化文本结构偏置并重分配注意力,在 LLaVA 上同时压低自发幻觉、抬升 gaslighting 后准确率。
SPAR 是一种免训练的 MLLM 推理时干预,用来把注意力里的结构偏置和语义视觉信号分开。
摘要剪枝后的 Speech-LLM 不能只看总体 WER:Fair-Speech 上族群差扩大,作者建议看最差组。