跳到正文
10月9日 · 周五

全部论文

找到 6 篇

另有 648 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2607.24017

    多模态大模型注意力中的语义与结构偏差解耦:SPAR 免训练干预方法

    提出 SPAR 以分离注意力结构偏置并重分配视觉注意力,减轻多模态幻觉

    发表
    测试
    LLaVA-v1.5、LLaVA-1.5-7B、LLaVA-NeXT 等 7 个
    摘要SPAR 用显著性净化文本结构偏置并重分配注意力,在 LLaVA 上同时压低自发幻觉、抬升 gaslighting 后准确率。

    SPAR 是一种免训练的 MLLM 推理时干预,用来把注意力里的结构偏置和语义视觉信号分开。

    深度解读完整解读
  2. 分析与理论arXiv 2609.36477

    研究发现护栏模型在基座模型不确定处过度自信

    诊断护栏相对基座在对抗提示上的置信失校

    发表
    测试
    Llama-Guard 7B、Llama-Guard-2 8B、Llama-Guard-3 8B 等 10 个
    摘要对抗包装使 guard 高置信漏检,而对应 base 在同一输入上常更不确定。

    诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。

    深度解读完整解读
  3. 防御arXiv 2609.39548

    NDDL:用正常扩散动力学为文生图模型做后门防御

    提出 NDDL,用良性扩散轨迹检测文生图后门提示并定位触发 token

    发表
    测试
    Stable Diffusion v1.5、Stable Diffusion XL、Stable Diffusion v3.5 等 4 个
    摘要NDDL 从良性扩散轨迹学习正常转移,用动态不一致检测后门并定位触发 token。

    NDDL 是面向文生图扩散模型的后门防御:防御者只有白盒模型访问和良性提示词,没有后门先验,需要区分后门提示词并找出触发 token。

    深度解读完整解读
  4. 可解释性arXiv 2609.37737

    研究用因果激活修补定位模型服从提示注入指令的决策层

    用因果激活修补定位模型服从提示注入的决策层

    发表
    测试
    Qwen3-4B、Qwen3-14B、Qwen3-32B 等 7 个
    摘要合规的因果杠杆集中在网络后三分之一的低秩子空间,该层也是混淆下检测最好的位置。

    这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。

    深度解读完整解读
已经到底了