跳到正文
10月10日 · 周六

全部论文

找到 48 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.10345

    SLDR:通过选择性层恢复与动态路由防御恶意微调

    提出 SLDR,用选择性层恢复与动态路由防御恶意微调

    发表
    攻击者
    黑盒
    被测模型
    Llama3.1-8B-Instruct、Llama3-8B-Instruct、Qwen2.5-7B-Instruct 等 4 个
    摘要作者称 SLDR 能压低有害输出并保持下游效用。

    SLDR 是针对恶意微调的微调后防御:在已对齐模型上做有符号层探测,只在敏感分数最大与最小的两层训练 LoRA,再用 lmax 的最后 token 表示决定是否启用适配器。

    深度解读完整解读
  2. 防御arXiv 2610.09703

    研究揭示 Token-Pruning 对 VLM 安全性的影响并提出 SAP 缓解机制

    提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱

    发表
    攻击者
    黑盒
    被测模型
    LLaVA-1.5-7B
    摘要剪枝去掉背景 token 后注意力塌向恶意前景。

    这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。

    深度解读完整解读
  3. 防御arXiv 2610.07774

    研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器

    AI 导读研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。

    发表
    被测模型
    Qwen3-VL-30B-A3B-Instruct、Kimi-VL-A3B-Instruct
    摘要读出而非操纵 router logits,可在不改模型的情况下降低两模型的组合式安全错误。

    作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。

    深度解读完整解读
  4. 攻击arXiv 2610.07723

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    发表
    被测模型
    Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个

    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    深度解读完整解读
  5. 攻击arXiv 2610.07654

    研究揭示策略蒸馏的安全后门风险

    测量带后门教师经 OPD 向干净学生迁移潜伏后门

    发表
    被测模型
    Qwen2.5-1.5B-Instruct、Qwen2.5-3B-Instruct、Qwen2.5-7B-Instruct
    摘要作者称 OPD 可在压低无触发词有害率时迁入后门。

    带后门的外部教师经 OPD,可在压低无触发词有害率的同时,把触发条件下的有害行为传给初始干净学生。。

    深度解读完整解读
  6. 可解释性arXiv 2610.07518

    TRACE:仅凭 checkpoint 更新审计大语言模型有害目标

    提出 TRACE,仅凭检查点更新审计有害合规微调目标

    发表
    被测模型
    Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Qwen3-8B 等 6 个
    摘要作者称有害合规 SFT 在检查点更新中留下可排序坐标,并据此做只读权重审计。

    作者在检查点更新里寻找有害合规 SFT 的目标组成,并把读数做成不查询模型、不看未知训练数据的审计分 TRACE。

    深度解读完整解读
  7. 防御arXiv 2610.05637

    研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点

    提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口

    发表
    被测模型
    Claude Sonnet 4.6、Gemini 3.5 Flash、Molmo2-8B 等 5 个

    摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。

    深度解读完整解读
  8. 评测与基准arXiv 2610.03938

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    评测 ReAct 工具调用对多模态模型拒答有害请求的削弱

    发表
    场景
    AI Agent
    被测模型
    Gemini-2.5-Pro、Gemini-3.1-Pro-Preview、Claude Opus 4.6 等 13 个
    摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。

    论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。

    深度解读完整解读
  9. 攻击arXiv 2610.01367

    研究:高质量数据筛选挡不住投毒

    提出 Bi-QSTO,优化能穿过质量筛选并在微调中削弱安全对齐的投毒样本

    发表
    被测模型
    Llama2-7B-Chat、Llama3-8B-Instruct、Qwen2-7B-Instruct 等 5 个
    摘要质量筛选挡不住部分高分样本的安全削弱。

    Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。

    深度解读完整解读
  10. 防御arXiv 2609.39279

    FDCU:用双重约束子空间投影抵御机器遗忘后的重训练攻击

    提出 FDCU 双约束子空间投影遗忘,抵御再训练恢复有害知识

    发表
    被测模型
    Qwen2.5-3B、Llama-3-8B-Instruct、Qwen-3-8B
    摘要FDCU 用双掩码限制浅层抑制,在知识擦除与安全输出上提高再训练后的稳定性。

    FDCU 是一种约束参数更新的遗忘方法,用来降低再训练把已抑制恶意行为重新引出的可能。

    深度解读完整解读
  11. 风险行为arXiv 2609.38971

    研究测量并预测具身 VLM 规划器中任务的拒答可变性

    测量并预测具身 VLM 规划器的任务拒答可变性

    发表
    被测模型
    gemini-robotics-er-2-preview、gemini-robotics-er-1.6-preview
    摘要日常物体能翻转一部分已给出的拒答,可翻转程度取决于任务且可被本地代理预测。

    作者测量 constitution 守护的具身 VLM 规划器:一次拒答在只往场景里放一个日常物体之后还保不保持得住,并把这种易翻转程度称为任务的 malleability。

    深度解读完整解读
  12. 防御arXiv 2609.37837

    Intent-Privilege OPSD:让视觉语言模型在隐式风险下兼顾安全与有用

    提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用

    发表
    被测模型
    Qwen3-VL-4B-Instruct、LLaVA-1.5-7B
    摘要证据化意图只在训练时使用,单次蒸馏同时提高联合成功并降低数据与训练时间。

    Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。

    深度解读完整解读
  13. 防御arXiv 2609.37624

    修正而非删除:用纠正性监督缓解涌现性失准

    用纠正性监督改写固定有害微调样本,缓解涌现性失准

    发表
    被测模型
    Qwen2.5-14B-Instruct、Gemma-4-12B-it
    摘要在固定毒行上,把坏回答改成正确答案比删掉更能降低 EM,正确内容比多出来的安全指令更关键。

    Correct, Don’t Delete 比较的是:微调数据里已经固定的有害行,是删掉还是改成同一提示上的正确答案,更能减轻 emergent misalignment。

    深度解读完整解读
  14. 防御arXiv 2609.36862

    VaccineBooster:面向有害微调对齐的混合扰动防御

    提出 VaccineBooster,在对齐阶段混合嵌入扰动与梯度衰减抵御有害微调

    发表
    被测模型
    Llama-2-7B
    摘要VaccineBooster 把两种对齐阶段扰动合在一步里,内容更安全但拒答保留更少。

    VaccineBooster 是一种对齐阶段防御:在提供方还看得到训练过程、还没接触用户微调数据时,把嵌入扰动和权重级梯度衰减合成同一次更新,用来应对之后不受信任的微调。有害微调可以只混入少量有害指令-回答对,就削弱拒答并提高有害输出的可能,任务效用却仍然好看。过滤会漏掉隐蔽样本,事后修复又往往不知道该修哪里。

    深度解读完整解读
  15. 防御arXiv 2610.00320

    研究显示少样本微调可绕过安全层局部冻结与修复防御

    检验层冻结与奇异方向截断能否挡住少样本有害微调

    发表
    攻击者
    白盒
    被测模型
    Llama-3.1-8B-Instruct、Llama-3.1-Tulu-3-8B-DPO、OLMo-2-1124-7B-Instruct 等 10 个
    摘要定位与恢复可以复现,但知情攻击能把损伤移出冻结带,并打败跨检查点的截断修复。

    这篇工作检验:把拒答定位到某些层或更新方向之后,能不能在攻击者知情时还守住拒答。。

    深度解读完整解读
  16. 防御arXiv 2609.36562

    ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害

    构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险

    发表
    被测模型
    ThinkingGuard(Qwen3-VL-8B-Instruct)
    摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。

    这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。

    深度解读完整解读
  17. 风险行为arXiv 2609.35291

    窄域多模态微调可诱发涌现性失配,覆盖 15 个视觉语言模型

    证明无显式危害的图文窄微调可诱发跨任务涌现未对齐

    发表
    被测模型
    GPT-4o、GPT-4.1、Gemini 2.5 等 15 个
    摘要证实窄多模态微调可引发全面的多渠道未对齐行为转变,揭示了后训练阶段对齐被隐蔽重塑的安全隐患。

    论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。

    深度解读完整解读
  18. 防御arXiv 2609.34970

    研究揭示 LLM 涌现失准的机制并提出参数空间缓解框架

    提出几何缓解框架,把有害梯度子空间从 LoRA 更新中正交投影出去

    发表
    被测模型
    Qwen2.5-3B-IT、Qwen2.5-7B-IT、Qwen2.5-14B-IT 等 8 个
    摘要窄域 LoRA 会留下可测的有害子空间。

    See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。

    深度解读完整解读