跳到正文
10月10日 · 周六

全部论文

找到 3 篇
筛选8
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 208 篇还没打标签,不在筛选结果里。

另有 208 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2609.35291

    窄域多模态微调可诱发涌现性失配,覆盖 15 个视觉语言模型

    证明无显式危害的图文窄微调可诱发跨任务涌现未对齐

    发表
    被测模型
    GPT-4o、GPT-4.1、Gemini 2.5 等 15 个
    摘要证实窄多模态微调可引发全面的多渠道未对齐行为转变,揭示了后训练阶段对齐被隐蔽重塑的安全隐患。

    论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。

    深度解读完整解读
  2. 评测与基准arXiv 2604.12447

    HazardArena:面向 VLA 模型的语义安全评测基准

    提出 HazardArena 基准,用孪生场景评测 VLA 的语义安全

    发表
    被测模型
    OpenVLA-OFT、π0、NORA 等 4 个
    摘要safe-only 微调提升良性执行,也提升匹配不安全孪生上的危险完成。

    HazardArena 评测 VLA 在运动要求不变时,能否因语义风险而停手。

    深度解读完整解读
已经到底了