跳到正文
10月10日 · 周六

全部论文

找到 49 篇

另有 435 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09703

    研究揭示 Token-Pruning 对 VLM 安全性的影响并提出 SAP 缓解机制

    提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱

    发表
    攻击者
    黑盒
    被测模型
    LLaVA-1.5-7B
    摘要剪枝去掉背景 token 后注意力塌向恶意前景。

    这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。

    深度解读完整解读
  2. 攻击arXiv 2610.10612

    PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器

    提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器

    发表
    被测模型
    CISCO、HSS、AUDITOR 等 8 个
    摘要论文剖析智能体技能审查与执行脱节盲区,提出 PyCache Trap 攻击并构建基于可信复现的 EAV 防御。

    这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。

    深度解读完整解读
  3. 防御arXiv 2610.07774

    研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器

    AI 导读研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。

    发表
    被测模型
    Qwen3-VL-30B-A3B-Instruct、Kimi-VL-A3B-Instruct
    摘要读出而非操纵 router logits,可在不改模型的情况下降低两模型的组合式安全错误。

    作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。

    深度解读完整解读
  4. 其他arXiv 2610.06452

    研究者提出多模态安全评测应衡量可控性而非仅做分类

    主张多模态安全评测应衡量可控性,并用 SAE 建立四轴画像

    发表
    被测模型
    LlavaGuard-v1.2-7B-OV、Qwen3.5-9B
    摘要四轴画像把读出与选择性控制分开。

    作者主张多模态安全评测在行为分类之外,单独报告可控性画像,而不是把检测准确当成控制证据。

    深度解读完整解读
  5. 其他arXiv 2610.04792

    多模态一定更好吗?缺失模态鲁棒性的几何视角与 Geodesic Unlearning 方法

    提出 Geodesic Unlearning,沿测地线编辑权重以提升缺模态鲁棒性

    发表
    被测模型
    RoBERTa、ResNet50、Qwen2.5-3B 等 6 个
    摘要GU 用测地线子空间编辑应对部署时缺模态下降,并尽量保住全模态精度。

    这项工作讨论多模态模型在部署时整段缺一个模态的性能下降,并把校正写成训练后的子空间编辑。

    深度解读完整解读
  6. 评测与基准arXiv 2610.04737

    PyINE:用可验证 Python 执行轨迹研究推理模型的捷径与监督

    提出 PyINE 基准,训练捷径跟随模型并比较监督者

    发表
    被测模型
    shortcut-following model organism、gpt-4o、gpt-5 等 12 个
    摘要PyINE 用可验证代码执行研究捷径失败的监督覆盖与成本权衡。

    PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。

    深度解读完整解读
  7. 防御arXiv 2610.04412

    论文研究 LLM 数字孪生参与增强民主时的提示注入脆弱性

    提出检测、结构化与 GSPO 流程,降低共识生成的提示注入错位

    发表
    被测模型
    LLaMA-2 7B、LLaMA-3 8B、GPT 3.5 Turbo 等 14 个
    摘要三章依次做个体偏好预测、政党知识图谱审议,以及共识生成对提示注入的脆弱性与一条防御流程。

    这是一篇把 LLM 数字孪生放进增强民主的博士论文,分个体表示、政党聚合和共识生成的提示注入三章。

    深度解读完整解读
  8. 可解释性arXiv 2610.04112

    Spatial-SAE:用空间依赖先验改进视觉概念分解

    提出 Spatial-SAE,用空间依赖先验改进视觉概念分解

    发表
    摘要Spatial-SAE 用空间 Markov 先验替换 patch 独立先验,换取更对齐的视觉概念。

    Spatial-SAE 针对视觉 SAE 的概念碎片化:tokenwise 目标在 LRH 之外把各 patch 的码当成独立,而作者报告冻结视觉 Transformer 的激活仍保留邻域可预测性。

    深度解读完整解读
  9. 其他arXiv 2610.03389

    Patch-to-Prune:在 Qwen2.5-VL 与 LLaVA 上剪枝视觉计算

    提出 Patch-to-Prune,旁路 VLM 部分层的视觉投影计算

    发表
    被测模型
    Qwen2.5-VL-3B-Instruct、Qwen2.5-VL-7B-Instruct、LLaVA-v1.6-Vicuna-7B-HF 等 4 个
    摘要P2P 用深度上的激活修补旁路视觉投影,以可调容忍度交换准确率与计算量。

    P2P 是面向 VLM 推理的训练无关计算旁路:不删除视觉 token,而在选定 decoder 层用固定激活代理代替视觉投影。

    深度解读完整解读
  10. 可解释性arXiv 2610.00895

    DiDAE:面向视觉基础模型的快速解耦反事实解释方法

    提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释

    发表
    被测模型
    ResNet-18、DINOv3 ViT-L/16
    摘要DiDAE 用无梯度字典编辑生成解耦反事实,并用于修正与排序。

    DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。

    深度解读完整解读
  11. 评测与基准arXiv 2609.39473

    FAME:用反事实推理评测自主智能体的虚假记忆

    提出 FAME,用反事实概念漂移评测智能体虚假记忆

    发表
    被测模型
    Llama-3B
    摘要FAME 用反事实引起的隐状态概念漂移,在出答案前区分忠实记忆与虚假记忆。

    FAME 是一个免训练的评测框架,用来判断自主智能体的记忆在虚假相关、环境偏移或知识冲突下是否已变成虚假记忆。。

    深度解读完整解读
  12. 防御arXiv 2609.37568

    SECRET:用源条件化中继引导缓解音视频大语言模型的幻觉

    提出训练无关的 SECRET,对问题表征做源条件转向以缓解音视频模型幻觉

    发表
    被测模型
    VideoLLaMA2-AV-7B、Qwen2.5-Omni-7B、Qwen3-Omni-30B-A3B
    摘要SECRET 在问题状态上做源条件转向,三个 AVLLM 上减轻了跨模态接地幻觉。

    SECRET 是一种训练无关的问题状态转向方法,用来减轻 AVLLM 的 source-confused grounding hallucination。

    深度解读完整解读
  13. 分析与理论arXiv 2609.36477

    研究发现护栏模型在基座模型不确定处过度自信

    诊断护栏相对基座在对抗提示上的置信失校

    发表
    被测模型
    Llama-Guard 7B、Llama-Guard-2 8B、Llama-Guard-3 8B 等 10 个
    摘要对抗包装使 guard 高置信漏检,而对应 base 在同一输入上常更不确定。

    诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。

    深度解读完整解读
  14. 可解释性arXiv 2609.35020

    论文检验线性表示假设:视觉 SAE 的可解释性有多高

    检验视觉 SAE 的可解释性,对照人类判断比较 AIS 与标准指标

    发表
    被测模型
    Vanilla SAE、TopK SAE、MP-SAE
    摘要视觉 SAE 重构很好,但 AIS、MS 与字典指标互不对齐,单一代理不足以核验 LRH。

    这篇工作把 NLP 的 AIS 改到视觉 SAE,用来检查 LRH 的结构代理是否等于人类可解释性。。

    深度解读完整解读
  15. 评测与基准arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作

    发表
    被测模型
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读