跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 1 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 3 篇还没打标签,不在筛选结果里。

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv:2610.05637 ·

    研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点

    提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口

    测试
    Claude Sonnet 4.6、Gemini 3.5 Flash、Molmo2-8B 等 5 个训练与数据层
    摘要论文揭示了VLM定位安全落后于VQA的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。
    • 定位与核心问题:论文系统研究了多模态大模型在视觉定位(点和边界框坐标)这一可执行输出通道上的安全对齐问题,指出模型在面对相同有害意图时,拒绝自由文本提问却遵从空间定位请求的普遍对齐失效现象。
    • 方法与数据构建:作者将直接危害(VLSU)、社会偏见(BBQ-V)和情境安全(Asimov-2.0)三个基准重构成15,401对图文意图严格匹配的VQA与定位测试样本,并提出了融合定位拒答、通用定位能力以及自蒸馏良性数据的三成分微调训练方案,支持纯文本(SFT-plain)和占位符坐标(SFT-placeholder)两种拒答格式。
    • 基座模型安全差距:五款主流VLM在无系统提示下,定位模式的平均拒答率在VLSU、BBQ-V和Asimov-2.0上分别仅为19.4%、16.7%和12.7%,落后于VQA模式的62.9%、75.9%和43.8%(Table 6),且引入安全系统提示词无法有效消除该差距。
    • 安全微调成效:微调使Qwen3-VL-8B和VisionReasoner-7B在VLSU上的定位拒答率分别由9.7%和3.9%提升至96.5%和97.4%(SFT-plain,Table 3),在完全未见的情境安全域Asimov-2.0上分别提升至68.9%和85.4%,且通用定位成功率保持在基座水平(65.4%与64.1%)。
    • 对齐机制与启示:消融实验显示仅依赖VQA文本拒答数据无法迁移至定位安全,而定位拒答数据能提升双模式拒答;内部表征分析表明微调将有害定位请求的残差流表征大幅推向拒答方向。作者认为,随着定位输出被智能体与物理系统广泛采纳,安全对齐必须明确覆盖空间输出通道。
    完整解读
已经到底了