全部论文
另有 426 篇论文还没打上分类标签,暂不在筛选结果里。
- 防御arXiv 2610.07774收录
研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器
研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。
- arXiv
- 2610.07774
- 收录
- 层
- 模型层
- 场景
- 模型与 API
摘要读出而非操纵 router logits,可在不改模型的情况下降低两模型的组合式安全错误。
作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。
- 评测与基准arXiv 2609.38948
DrivingBench 发布:让视觉语言模型驾驶丰田 Corolla 绕桩
提出 DrivingBench 评测视觉语言模型的真车闭环驾驶
- arXiv
- 2609.38948
- 发表
- 层
- 应用层
- 组件视觉
摘要仅 Astra 第二次跑完低速锥桶路线。
DrivingBench 评测通用 VLM 能否自己闭环开真车,推理延迟也算进任务。
- 其他arXiv 2609.39518
研究:视觉语言模型在协作任务中很少主动表达指代不确定性
研究视觉语言模型在协作中能否表示并说出指称不确定性
- arXiv
- 2609.39518
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件视觉
摘要指称不确定性可被引出,但很少说出来。
- 可解释性arXiv 2610.04112收录
Spatial-SAE:用空间依赖先验改进视觉概念分解
提出 Spatial-SAE,用空间依赖先验改进视觉概念分解
- arXiv
- 2610.04112
- 收录
- 层
- 模型层
- 场景
- 模型与 API
- 组件视觉
摘要Spatial-SAE 用空间 Markov 先验替换 patch 独立先验,换取更对齐的视觉概念。
Spatial-SAE 针对视觉 SAE 的概念碎片化:tokenwise 目标在 LRH 之外把各 patch 的码当成独立,而作者报告冻结视觉 Transformer 的激活仍保留邻域可预测性。
- 其他arXiv 2610.03389
Patch-to-Prune:在 Qwen2.5-VL 与 LLaVA 上剪枝视觉计算
提出 Patch-to-Prune,旁路 VLM 部分层的视觉投影计算
- arXiv
- 2610.03389
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件视觉
摘要P2P 用深度上的激活修补旁路视觉投影,以可调容忍度交换准确率与计算量。
P2P 是面向 VLM 推理的训练无关计算旁路:不删除视觉 token,而在选定 decoder 层用固定激活代理代替视觉投影。
- 攻击arXiv 2610.01871
研究者提出 IMMRAG 攻击,可从多模态 RAG 数据存储中提取医学与文档图像
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容
- arXiv
- 2610.01871
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 评测与基准arXiv 2608.11816
研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍
审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为
- arXiv
- 2608.11816
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要论文系统审计了 VLM 多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。
论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。
- 防御arXiv 2607.24017
多模态大模型注意力中的语义与结构偏差解耦:SPAR 免训练干预方法
提出 SPAR 以分离注意力结构偏置并重分配视觉注意力,减轻多模态幻觉
- arXiv
- 2607.24017
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要SPAR 用显著性净化文本结构偏置并重分配注意力,在 LLaVA 上同时压低自发幻觉、抬升 gaslighting 后准确率。
SPAR 是一种免训练的 MLLM 推理时干预,用来把注意力里的结构偏置和语义视觉信号分开。
摘要回答长度决定免训练 UE 族。
这是一项对 MLLM 免训练不确定性估计的分组比较:幻觉检测被作者视为弃答、转交或路由的一种用途,而不是唯一目标。
- 防御arXiv 2610.01184
ReCast:在固定媒体接口下保护多模态推理的隐私框架
提出 RECAST,本地改写图表与语音并做可逆数值映射以保护远程推理隐私
- arXiv
- 2610.01184
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 组件视觉
- 评测与基准arXiv 2609.32763
Mandela-Bench:36 个多模态模型更依赖记忆而非观察图像
构建 Mandela-Bench,评测多模态模型是否凭记忆接受篡改图像
- arXiv
- 2609.32763
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要论文构建 Mandela-Bench 发现模型对经典图像存在记忆重构偏见,过度依赖先验导致无法有效利用知识核验事实篡改。
该研究系统评估了多模态大语言模型在面对无痕事实性编辑时,能否利用自身内在世界知识核验被识别出的经典图像。
- 防御arXiv 2608.00716
生成图像更易被遗忘:面向合成图像检测的机器遗忘视角
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
- arXiv
- 2608.00716
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要作者用剪枝或 LoRA 遗忘拉开生成图与自然图的特征相似度,并在多个检测基准上报告结果。
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
- 防御arXiv 2607.14737
GeoDetect:面向视觉语言预训练模型的几何对抗检测方法
提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本
- arXiv
- 2607.14737
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
摘要GeoDetect 用几何分数检测 VLP 对抗样本。
GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。
- 防御arXiv 2609.37568
SECRET:用源条件化中继引导缓解音视频大语言模型的幻觉
提出训练无关的 SECRET,对问题表征做源条件转向以缓解音视频模型幻觉
- arXiv
- 2609.37568
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要SECRET 在问题状态上做源条件转向,三个 AVLLM 上减轻了跨模态接地幻觉。
SECRET 是一种训练无关的问题状态转向方法,用来减轻 AVLLM 的 source-confused grounding hallucination。
- 可解释性arXiv 2610.00895
DiDAE:面向视觉基础模型的快速解耦反事实解释方法
提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释
- arXiv
- 2610.00895
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件视觉
摘要DiDAE 用无梯度字典编辑生成解耦反事实,并用于修正与排序。
DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。
- 可解释性arXiv 2609.30993
FLIP:面向视觉语言模型的末层推理时探针
提出 FLIP 末层推理时探针,检验视觉语言模型干预效应的来源
- arXiv
- 2609.30993
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件视觉
摘要末层 flooring 扫描在四准则下通过,原始层和左右对照没有同一正向区间。
FLIP 是开源 VLM 上的推理时末层探针,用来检验干预效应是否结构化、与任务相连,而不是用来转向模型。。
- 可解释性arXiv 2609.35020
论文检验线性表示假设:视觉 SAE 的可解释性有多高
检验视觉 SAE 的可解释性,对照人类判断比较 AIS 与标准指标
- arXiv
- 2609.35020
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件视觉
摘要视觉 SAE 重构很好,但 AIS、MS 与字典指标互不对齐,单一代理不足以核验 LRH。
这篇工作把 NLP 的 AIS 改到视觉 SAE,用来检查 LRH 的结构代理是否等于人类可解释性。。
- 防御arXiv 2609.14258
SPARK:在 KV 记忆层对齐表征以防御视觉语言模型越狱
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
- arXiv
- 2609.14258
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API