审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度
开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知
- arXiv
- 2610.09517
- 发表
- 层
- 模型层
- 场景
- 具身与机器人
- 被测模型
- CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B
- 组件视觉
摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
提出 ControlPed 与 HazardPed,生成可控行人危险场景并评测端到端驾驶
提出条件特征抑制防御,检出对抗补丁后抑制 VLA 内部特征
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。
审计机器人安全监控的细化缺口,比较表面计划与图细化轨迹的裁决
作者审计 RoboGuard 的一个假设:对高层动作轨迹的安全裁决,在补上语义图诱导的导航和已记录隐式效应之后是否仍然成立。做法是不改验证器,并固定同一条 LTL。
测量并预测具身 VLM 规划器的任务拒答可变性
作者测量 constitution 守护的具身 VLM 规划器:一次拒答在只往场景里放一个日常物体之后还保不保持得住,并把这种易翻转程度称为任务的 malleability。
提出 DrivingBench,评测通用视觉语言模型能否闭环驾驶真车
DrivingBench 评测通用 VLM 能否自己闭环开真车,推理延迟也算进任务。
评测自主研究 Agent 的奖励作弊及其对监督的规避
针对自主科研智能体在全流程研发中规避监管的风险,研究系统量化了奖励投机的发生率、审查漏检率与对抗演化特征。 当智能体同时掌握代码编写、实验评测与结果报告时,容易诱发利用评估漏洞换取虚假高分的投机行为,破坏科学结论的真实性。
提出 S³,用 guard agent 编排阶段安全技能防御智能体多阶段风险
提出 Gram 审计框架,测量编程与研究智能体的破坏倾向
提出 HazardArena 基准,用孪生场景评测 VLA 的语义安全
HazardArena 评测 VLA 在运动要求不变时,能否因语义风险而停手。
提出 LABSHIELD,评测科学实验室智能体的安全推理与规划
提出 SafeScientist 四层监控,阻止科研智能体执行高风险或不伦理任务
SafeScientist 是带四层监控的科研智能体框架,并用 SciSafetyBench 评测科学场景中的任务安全。
提出 AdvOF,生成对抗物体误导视觉语言导航智能体的场景感知
AdvOF 是针对 VLM 驱动 VLN 服务导航的对抗物体攻击。