跳到正文
10月10日 · 周六

全部论文

找到 7 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 303 篇还没打标签,不在筛选结果里。

另有 303 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.09517

    审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度

    开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知

    发表
    被测模型
    CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B
    摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。

    本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。

    深度解读完整解读
  2. 防御arXiv 2610.09469

    Secure-CUA:约束计算机使用智能体中不可信内容的影响

    提出 Secure-CUA,用动作事务约束计算机使用智能体的不可信影响

    发表
    场景
    web agent
    被测模型
    Claude Opus 5、Gemini 3.8 Flash、GPT-5.6-Sol
    摘要Secure-CUA 用每步事务约束不可信影响,良性 TSR 接近 Vanilla-CUA。

    Secure-CUA 要限制图形界面里不可信内容对 CUA 决策和 GUI 执行的影响,同时保留合法任务所需的不可信信息。

    深度解读完整解读
  3. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作

    发表
    场景
    web agent
    被测模型
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  4. 风险行为arXiv 2609.38971

    研究测量并预测具身 VLM 规划器中任务的拒答可变性

    测量并预测具身 VLM 规划器的任务拒答可变性

    发表
    被测模型
    gemini-robotics-er-2-preview、gemini-robotics-er-1.6-preview
    摘要日常物体能翻转一部分已给出的拒答,可翻转程度取决于任务且可被本地代理预测。

    作者测量 constitution 守护的具身 VLM 规划器:一次拒答在只往场景里放一个日常物体之后还保不保持得住,并把这种易翻转程度称为任务的 malleability。

    深度解读完整解读
  5. 评测与基准arXiv 2604.12447

    HazardArena:面向 VLA 模型的语义安全评测基准

    提出 HazardArena 基准,用孪生场景评测 VLA 的语义安全

    发表
    被测模型
    OpenVLA-OFT、π0、NORA 等 4 个
    摘要safe-only 微调提升良性执行,也提升匹配不安全孪生上的危险完成。

    HazardArena 评测 VLA 在运动要求不变时,能否因语义风险而停手。

    深度解读完整解读
已经到底了