跳到正文
10月10日 · 周六

全部论文

找到 78 篇

另有 282 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.12361

    研究:法律推理模型引用法条不等于依据法条

    用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条

    发表
    被测模型
    Qwen3-8B、Qwen3-14B、Llama-3.1-8B 等 7 个
    摘要作者通过依据置换反事实与内部承诺追踪发现法律 CoT 裁决对依据依赖度有限,且易受提示注入操纵。

    本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。

    深度解读完整解读
  2. 评测与基准arXiv 2610.10276

    PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤

    提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤

    发表
    被测模型
    Qwen2.5-3B-Instruct、Qwen2.5-14B-Instruct、gemma-3-4b-it 等 8 个

    摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。

    深度解读完整解读
  3. 防御arXiv 2610.09703

    研究揭示 Token-Pruning 对 VLM 安全性的影响并提出 SAP 缓解机制

    提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱

    发表
    攻击者
    黑盒
    被测模型
    LLaVA-1.5-7B
    摘要剪枝去掉背景 token 后注意力塌向恶意前景。

    这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。

    深度解读完整解读
  4. 防御arXiv 2610.08678

    研究揭示投机解码的安全代价并提出 SecureSD 加固方法

    测量有损投机解码的安全代价,并提出 SecureSD 收紧早期验证

    发表
    场景
    AI Agent
    攻击者
    黑盒
    被测模型
    Qwen3-8B、Qwen3-32B、Llama-3.1-8B-Instruct 等 6 个
    摘要有损推测解码的早期偏离更快抬高越狱与注入风险。

    作者研究有损推测解码在换取速度时,是否会比效用更快地损害越狱与提示注入防护,并给出按位置校正的 SecureSD。

    深度解读完整解读
  5. 防御arXiv 2610.08316

    MARCO:面向蛋白质生成模型的放射性水印框架

    提出 MARCO 放射性水印,冻结蛋白质生成模型并在去噪时嵌入签名

    发表
    攻击者
    黑盒
    被测模型
    RFdiffusion、ESMFold、Chroma 等 6 个
    摘要MARCO 在冻结的 PGM 上去噪时嵌构象水印,作者称能兼顾保真与抗扰动,并使盗版模型继承水印。

    MARCO 是加在蛋白质生成模型推理过程上的构象水印,用来标记知识产权,并为可能的生物安全滥用保留可追溯信号。作者还把它说成数字权利管理工具,以及符合生物武器公约的数字监管链。问题在于:专有 PGM 的三维输出可能被拿去训练盗版模型,也可能在来源被抹掉后绕过筛查。

    深度解读完整解读
  6. 攻击arXiv 2610.07723

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    发表
    被测模型
    Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个

    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    深度解读完整解读
  7. 攻击arXiv 2610.06670

    研究者提出 Reward Stealing Attack,从对齐模型行为反推安全奖励实施攻击

    提出 ReSA,从对齐模型行为恢复安全奖励并在解码时反转

    发表
    攻击者
    白盒、灰盒
    被测模型
    Llama3.1-8B-Instruct、Gemma-7B-Instruct、Qwen2.5-7B-Instruct 等 9 个
    摘要ReSA 用最大熵 IRL 从对齐模型行为恢复代理安全奖励,并在解码时反转以诱导有害输出。

    ReSA 是一种对抗攻击:从对齐模型的可观察行为恢复代理安全奖励,再在解码时把该奖励反过来用。。

    深度解读完整解读
  8. 防御arXiv 2610.05401

    AVCE:面向扩散模型可验证概念擦除的审计感知遗忘框架

    提出审计感知遗忘框架 AVCE,从文本与视觉通路擦除扩散模型概念

    发表
    攻击者
    白盒、黑盒
    被测模型
    Stable Diffusion XL (SDXL)、Stable Diffusion v1.5 (SD v1.5)、Flux 1.0
    摘要AVCE 在审计锚点上改两条注意力通路。

    AVCE 是面向扩散模型的概念擦除方法,要让擦除经得起绕过文本条件的潜空间审计,而不只是挡住对抗提示词。

    深度解读完整解读
  9. 防御arXiv 2610.07023

    SSRFT:以安全角色内化替代拒答模式的 LLM 安全对齐框架

    提出 SSRFT,用角色监督内化安全原则以替代拒答式对齐

    发表
    被测模型
    Qwen2.5-3B、Gemma2-2B、Llama3.1-8B 等 6 个
    摘要SSRFT 用角色监督替代拒答中心对齐。

    SSRFT是一种用监督微调把预定义安全角色写进参数的安全对齐方法。作者称它是首个以安全角色内化本身为对齐目标的框架。

    深度解读完整解读
  10. 防御arXiv 2610.04467

    无需目标答案的潜在空间安全对齐:无监督对抗训练提升 LLM 越狱鲁棒性

    提出 Target-free LAT,用无目标多方向潜干预做对抗安全对齐以抵御越狱

    发表
    攻击者
    白盒、黑盒
    被测模型
    Qwen2.5-7B-Instruct、Llama-3-8B-Instruct、Mistral-7B-Instruct-v0.2
    摘要Target-free LAT 用无目标多方向潜干预扩大行为覆盖,作者称能提高越狱鲁棒性并保住效用。

    Target-free LAT 是一种不监督有害输出的潜空间对抗对齐。它要处理的问题是:现有 LAT 每步大多只造一种有害行为,对不上真实越狱里的直接遵从、角色扮演、编码和多语言等模式。

    深度解读完整解读
  11. 防御arXiv 2610.03980

    FADE:面向视频扩散模型的帧感知多概念擦除框架

    提出 FADE,对文生视频模型做帧感知多概念擦除

    发表
    被测模型
    Wan2.1-T2V-1.3B、Wan2.1-T2V-14B、CogVideoX-2B 等 4 个
    摘要FADE 用闭式编辑、帧感知适配器和软路由,在单骨干上擦除多概念并压低逐帧残差。

    FADE 是面向文生视频扩散 Transformer 的多概念遗忘方法,用来抑制指定物体、画风、裸体、暴力、仇恨和名人身份,并尽量保持其他生成。作者要处理两件事。与帧无关的抑制会让概念在少数帧重现,片段均值会掩盖这一失败。

    深度解读完整解读
  12. 防御arXiv 2610.03502

    研究者提出可认证机制编辑:在连续输入区域上证明技能移除与保留

    提出机理编辑形式化认证,证明连续输入区域上的技能移除与保留

    发表
    被测模型
    Toy MLP (separated)、Toy MLP (entangled)、Deep MLP (3-12-8-2) 等 6 个

    摘要提出机理编辑形式化认证框架,证明编辑在连续区域生效且黑盒测试无法保证移除,为安全编辑提供数学证明。

    深度解读完整解读
  13. 防御arXiv 2610.02413

    研究:分类后缀可提升激活探针的分布外恶意输入检测

    用分类后缀提升激活探针对分布外恶意输入的检测

    发表
    被测模型
    Llama-3.1-8B、Qwen3.5-9B、Gemma-4-12B
    摘要作者称排序增益来自分类格式,低 FPR 精度来自点名准则。

    用户轮后的分类后缀,被作者用作激活探针的分布外检测干预:排序看格式,低 FPR 精度看是否点名恶意/良性。

    深度解读完整解读
  14. 防御arXiv 2609.40286

    研究者提出 COVER:在语言预算下选择源语言实现跨语言遗忘

    提出 COVER,在语言预算下选择源语言实现跨语言知识遗忘

    发表
    被测模型
    Tiny Aya Global、Qwen3-4B-Instruct-2507、Llama-3.2-3B-Instruct
    摘要COVER 在语言预算下选源语言,以降低未监督语言上相对 oracle 的残余访问。

    语言预算下的多语言遗忘:遗忘监督只放在 K 种源语言上,目标是降低其余语言对同一事实的残余访问,而不是把每种评测语言都译成监督数据。

    深度解读完整解读
  15. 防御arXiv 2609.39548

    NDDL:用正常扩散动力学为文生图模型做后门防御

    提出 NDDL,用良性扩散轨迹检测文生图后门提示并定位触发 token

    发表
    被测模型
    Stable Diffusion v1.5、Stable Diffusion XL、Stable Diffusion v3.5 等 4 个
    摘要NDDL 从良性扩散轨迹学习正常转移,用动态不一致检测后门并定位触发 token。

    NDDL 是面向文生图扩散模型的后门防御:防御者只有白盒模型访问和良性提示词,没有后门先验,需要区分后门提示词并找出触发 token。

    深度解读完整解读
  16. 防御arXiv 2609.37837

    Intent-Privilege OPSD:让视觉语言模型在隐式风险下兼顾安全与有用

    提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用

    发表
    被测模型
    Qwen3-VL-4B-Instruct、LLaVA-1.5-7B
    摘要证据化意图只在训练时使用,单次蒸馏同时提高联合成功并降低数据与训练时间。

    Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。

    深度解读完整解读