审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度
开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角
- arXiv
- 2610.09517
- 发表
- 层
- 模型层
- 场景
- 具身与机器人
- 测试
- CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B 等 6 个
- 组件视觉
摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
另有 608 篇论文还没打上分类标签,暂不在筛选结果里。
开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
提出流匹配逆向框架,从多向量视觉文档索引重构页面
提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动
摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
提出 RECAST,本地改写图表与语音并做可逆数值映射以保护远程推理隐私
提出 DURA,沿扩散潜空间生成自然对抗补丁,把机器人动作导向指定目标
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。
提出 MIST 压力测试,检验无关图像是否扰动 VLM 评判者标签
作者用MIST问:VLM 代替人类标注时,可替代性裁决会不会被指南要求忽略的图像改写。
分析零训练 LLM+OVOD 流水线中 CAAP 与 SNAP 分离的来源
用 SAE 追踪稠密检索查询扩展的潜变量并用激活转向验证
作者用稀疏自编码器分析稠密检索里的查询扩展:现成检索器不微调时,拼接扩展文本往往增益有限甚至变差,而最终指标和嵌入整体偏移不足以说明内部发生了什么。
测量并预测具身 VLM 规划器在日常物体插入后的拒答可塑性
作者测量 constitution 守护的具身 VLM 规划器:一次拒答在只往场景里放一个日常物体之后还保不保持得住,并把这种易翻转程度称为任务的 malleability。
提出 MMSkillRisk 与 NCVA,评测技能图像隐藏指令诱导的未授权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。