审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度
开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知
- arXiv
- 2610.09517
- 发表
- 层
- 模型层
- 场景
- 具身与机器人
- 被测模型
- CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B
- 组件视觉
摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
另有 535 篇论文还没打上分类标签,暂不在筛选结果里。
开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
提出 Inspect Robots,在真实机器人上评测具身模型的能力与拒答
提出 ControlPed 与 HazardPed,生成可控行人危险场景并评测端到端驾驶
提出条件特征抑制防御,检出对抗补丁后抑制 VLA 内部特征
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。
提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性
SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。
测量并预测具身 VLM 规划器的任务拒答可变性
作者测量 constitution 守护的具身 VLM 规划器:一次拒答在只往场景里放一个日常物体之后还保不保持得住,并把这种易翻转程度称为任务的 malleability。
提出 DrivingBench,评测通用视觉语言模型能否闭环驾驶真车
DrivingBench 评测通用 VLM 能否自己闭环开真车,推理延迟也算进任务。
提出 NAVSAFE-∞ 写真闭环基准,评测端到端驾驶策略的闭环安全
NAVSAFE-∞ 用写真、事件级闭环仿真检查端到端驾驶策略的安全,而不是只看开环轨迹分数。
提出 SafeStage 基准,分阶段评测视觉语言机器人操作的物理安全
提出 DriveMCP 框架,将感知、交规检索与车辆遥测接成可审计驾驶辅助层
DriveMCP 是面向高级驾驶辅助的模块化智能体框架,把感知、合规、车辆状态和安全仲裁拆开并留下审计轨迹。
提出评估合同,检验合规监测数据能否支持比较性安全主张
作者给出的是评测效度立场:部署后的运行数据要支持比较主张,必须先写明测量与主张如何对齐。
提出 S³,用 guard agent 编排阶段安全技能防御智能体多阶段风险