跳到正文
10月10日 · 周六

全部论文

找到 9 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09703

    研究揭示 Token-Pruning 对 VLM 安全性的影响并提出 SAP 缓解机制

    提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱

    发表
    攻击者
    黑盒
    被测模型
    LLaVA-1.5-7B
    摘要剪枝去掉背景 token 后注意力塌向恶意前景。

    这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。

    深度解读完整解读
  2. 分析与理论arXiv 2610.04860

    研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预

    分析文本水印在 RAG 中诱发事实幻觉的机制并提出干预

    发表
    被测模型
    LLaMA 3.1 8B Instruct、Mistral-7B-Instruct-v0.3、Qwen2.5-14B-Instruct
    摘要论文揭示了生产环境文本水印导致模型事实退化的失效模式,分析了解码机制并提出针对性干预。

    论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。

    深度解读完整解读
  3. 防御arXiv 2609.37568

    SECRET:用源条件化中继引导缓解音视频大语言模型的幻觉

    提出训练无关的 SECRET,对问题表征做源条件转向以缓解音视频模型幻觉

    发表
    被测模型
    VideoLLaMA2-AV-7B、Qwen2.5-Omni-7B、Qwen3-Omni-30B-A3B
    摘要SECRET 在问题状态上做源条件转向,三个 AVLLM 上减轻了跨模态接地幻觉。

    SECRET 是一种训练无关的问题状态转向方法,用来减轻 AVLLM 的 source-confused grounding hallucination。

    深度解读完整解读
  4. 可解释性arXiv 2609.08173

    基于 SAE 引导的关键路径识别(KPI)解决知识冲突

    提出 KPI,用入度定位跨层关键路径并做 SAE 转向以解决知识冲突

    发表
    被测模型
    Llama-3-8B、Llama-3.1-8B、Gemma-2-9B
    摘要KPI 以入度关键路径替代大批 SAE 特征转向,在冲突 RAG 上提高忠实并减轻副作用。

    KPI 针对知识冲突 RAG 中的 SAE 转向:相关性批量改特征会带入冗余,少量因果上关键的特征即可完成转向。

    深度解读完整解读
  5. 防御arXiv 2607.24017

    多模态大模型注意力中的语义与结构偏差解耦:SPAR 免训练干预方法

    提出 SPAR 以分离注意力结构偏置并重分配视觉注意力,减轻多模态幻觉

    发表
    摘要SPAR 用显著性净化文本结构偏置并重分配注意力,在 LLaVA 上同时压低自发幻觉、抬升 gaslighting 后准确率。

    SPAR 是一种免训练的 MLLM 推理时干预,用来把注意力里的结构偏置和语义视觉信号分开。

    深度解读完整解读
已经到底了