跳到正文
10月10日 · 周六

全部论文

找到 13 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 386 篇还没打标签,不在筛选结果里。

另有 386 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.05401

    AVCE:面向扩散模型可验证概念擦除的审计感知遗忘框架

    提出审计感知遗忘框架 AVCE,从文本与视觉通路擦除扩散模型概念

    发表
    攻击者
    白盒、黑盒
    被测模型
    Stable Diffusion XL (SDXL)、Stable Diffusion v1.5 (SD v1.5)、Flux 1.0
    摘要AVCE 在审计锚点上改两条注意力通路。

    AVCE 是面向扩散模型的概念擦除方法,要让擦除经得起绕过文本条件的潜空间审计,而不只是挡住对抗提示词。

    深度解读完整解读
  2. 防御arXiv 2610.07023

    SSRFT:以安全角色内化替代拒答模式的 LLM 安全对齐框架

    提出 SSRFT,用角色监督内化安全原则以替代拒答式对齐

    发表
    被测模型
    Qwen2.5-3B、Gemma2-2B、Llama3.1-8B 等 6 个
    摘要SSRFT 用角色监督替代拒答中心对齐。

    SSRFT是一种用监督微调把预定义安全角色写进参数的安全对齐方法。作者称它是首个以安全角色内化本身为对齐目标的框架。

    深度解读完整解读
  3. 防御arXiv 2610.04467

    无需目标答案的潜在空间安全对齐:无监督对抗训练提升 LLM 越狱鲁棒性

    提出 Target-free LAT,用无目标多方向潜干预做对抗安全对齐以抵御越狱

    发表
    攻击者
    白盒、黑盒
    被测模型
    Qwen2.5-7B-Instruct、Llama-3-8B-Instruct、Mistral-7B-Instruct-v0.2
    摘要Target-free LAT 用无目标多方向潜干预扩大行为覆盖,作者称能提高越狱鲁棒性并保住效用。

    Target-free LAT 是一种不监督有害输出的潜空间对抗对齐。它要处理的问题是:现有 LAT 每步大多只造一种有害行为,对不上真实越狱里的直接遵从、角色扮演、编码和多语言等模式。

    深度解读完整解读
  4. 防御arXiv 2609.37837

    Intent-Privilege OPSD:让视觉语言模型在隐式风险下兼顾安全与有用

    提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用

    发表
    被测模型
    Qwen3-VL-4B-Instruct、LLaVA-1.5-7B
    摘要证据化意图只在训练时使用,单次蒸馏同时提高联合成功并降低数据与训练时间。

    Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。

    深度解读完整解读
  5. 防御arXiv 2609.33640

    SafeMol:分子多模态模型的双模态安全对齐

    提出 SafeMol,联合对齐分子多模态模型的文本与图输入

    发表
    攻击者
    黑盒
    被测模型
    Omni-Mol v2、ReactXT、SafeMol
    摘要SafeMol 用 MMD 和双分类头对齐分子多模态模型,在 Omni-Mol v2 上压低图条件攻击成功。

    SafeMol 研究分子多模态模型在危险分子相关请求上的安全对齐,并同时看过拒和任务效用。

    深度解读完整解读
  6. 防御arXiv 2609.19325

    AUDITPLAN:先提交安全计划再作答的可审计安全对齐方法

    提出 AUDIT PLAN 先计划后作答,并用 FAITHGATE 绑定答案奖励与计划正确性

    发表
    被测模型
    Qwen2.5-1.5B-Instruct、Qwen2.5-3B-Instruct、Qwen-3-4B-Instruct 等 4 个
    摘要先承诺可机检安全计划,再让计划正确性决定能否拿到答案奖励。

    AUDIT PLAN 把安全对齐从“只优化最终答案”改成“先提交隐藏的结构化安全计划,再按该计划作答”,并用 FAITHGATE 把高答案奖励限定在计划正确时。

    深度解读完整解读
  7. 防御arXiv 2609.18515

    用 cunning questions 训练 LLM 警觉性

    提出 Cunning 两阶段训练,用非安全数据培养警觉后再做安全对齐

    发表
    被测模型
    DeepSeek-R1-Distill-Qwen-7B、Qwen3-4B、Qwen3-8B
    摘要非安全 cunning 题上的 OPSD 被用来先练 vigilance,再接安全微调。

    Cunning 是一种两阶段对齐:先用与安全目标不绑定的推理陷阱题培养 vigilance,再接常规安全微调,使安全判断更常在有害计划之前控制回复。

    深度解读完整解读
  8. 防御arXiv 2609.04022

    研究提出表征相似度优化,提升大语言模型对抗条件下的安全泛化

    提出 ReSO ,对齐潜在道德表征以提升越狱条件下的安全泛化

    发表
    攻击者
    黑盒、白盒
    被测模型
    Qwen3-8B、Qwen3-14B、Qwen3-32B 等 17 个
    摘要ReSO 重组道德分类的潜在关系。

    ReSO 把对齐目标从偏好回答改成道德分类的潜在关系。。

    深度解读完整解读
  9. 防御arXiv 2609.02293

    SEAL:通过共享专家对齐强化 MoE 全局安全

    提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改

    发表
    攻击者
    白盒、黑盒
    被测模型
    Qwen1.5-MoE-A2.7B、DeepSeekMoE-16B、GLM-4.7-Flash 等 4 个
    摘要SEAL 把 DPO-LoRA 限制在混合 MoE 共享专家上,SEAL++再保护已有安全神经元方向。

    SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。

    深度解读完整解读
  10. 防御arXiv 2608.13304

    WIFA:按意图分组监督缓解包装式越狱与过度拒答

    提出 WIFA 意图组监督微调,缓解包装式越狱与过度拒答

    发表
    被测模型
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct
    摘要WIFA 用匹配意图组做数据层,WIFA-Boost 偏高安全,A-GCRT 在 Qwen 上把过拒降到基座以下。

    WIFA 是一种自动意图组数据构造,用来让安全微调拒绝有害意图而不是拒绝表面包装。WIFA-Boost 与 A-GCRT 在同一数据层上选取不同的安全–过拒工作点。

    深度解读完整解读
  11. 攻击arXiv 2601.22169

    In Vino Veritas and Vulnerabilities:用醉酒语言诱导检验 LLM 安全

    用醉酒语言诱导改编对话模型并评测越狱与隐私泄露

    发表
    被测模型
    LLaMA2-7B、LLaMA3-8B、Mistral-7B 等 5 个
    摘要醉酒语言诱导在五个 LLM 上抬高越狱与部分隐私错误,作者将其视为攻击向量。

    作者把醉酒语言当作攻击向量,检验把 LLM 适配成醉酒发短信的模式后,越狱和情境隐私是否变差。动机是人类醉酒时的失范与泄密,以及 LLM 模拟人设的能力。

    深度解读完整解读
已经到底了