跳到正文
10月9日 · 周五

全部论文

找到 3 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 664 篇还没打标签,不在筛选结果里。

另有 664 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.10613

    后验重加权框架解释并缓解多模态大模型上下文越狱

    用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御

    发表
    测试
    Qwen3-VL-2B、Qwen3-VL-4B、Qwen3-VL-8B 等 9 个
    摘要后验重加权解释上下文越狱的缩放,并支持风险门控的良性示例防御。

    Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。

    深度解读完整解读
  2. 可解释性arXiv 2608.30480

    VisER:面向 LVLM 物体幻觉检测的视觉证据与视觉依赖双面指标

    提出 VisER,用内部视觉证据检测 LVLM 物体幻觉

    发表
    测试
    LLaVA-1.5-7B、LLaVA-NeXT-7B、InstructBLIP 等 8 个
    摘要VisER 用证据门与图像–前缀比给物体提及打落地分。

    VisER 是面向 LVLM 开放式图像描述的免训练物体级幻觉检测分数,用来处理内部支持的来源混淆。

    深度解读完整解读
已经到底了