跳到正文
10月10日 · 周六

全部论文

找到 14 篇

另有 246 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.05894

    研究者提出闭环偏见注入攻击

    提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见

    发表
    攻击者
    灰盒
    被测模型
    LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct

    摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。

    深度解读完整解读
  2. 防御arXiv 2610.04426

    UnAct:无需梯度的定向激活干预实现类别遗忘

    提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别

    发表
    被测模型
    ResNet-18、ViT-B/16
    摘要UnAct 用前向激活做类别遗忘。

    UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。

    深度解读完整解读
  3. 攻击arXiv 2609.17817

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    提出基准投毒攻击,使自修改编码 Agent 跨代写出含漏洞代码

    发表
    被测模型
    Claude Sonnet 4.5、Qwen3.5-397B、gpt-oss-120b 等 5 个

    摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。

    深度解读完整解读
  4. 可解释性arXiv 2609.07746

    LLM Forensics:用稀疏自编码器定位并控制后门触发机制

    用 SAE 定位后门触发机制并分离检测与因果控制

    发表
    被测模型
    Gaperon-1B、Gaperon-8B、Gaperon-24B
    摘要Gaperon 语言切换后门可分成检测、残差路由和后期语言跟踪三类 SAE 特征,只有部分能改行为。

    作者用稀疏自编码器分解 Gaperon 中无害的语言切换后门,区分识别触发的特征与真正能抑制或诱发该行为的特征。固定触发使英语提示在 Gaperon-1B 与 8B 上续写成法语或德语。

    深度解读完整解读
  5. 可解释性arXiv 2609.06934

    论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击

    解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练

    发表
    被测模型
    Qwen-2.5-7B、Qwen-2.5-7B-Instruct、Llama-3-8B 等 15 个

    摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。

    深度解读完整解读
  6. 防御arXiv 2607.13336

    TC-UAP:针对图像转视频与微调定制的通用视频保护方法

    提出 TC-UAP,用身份级多帧扰动保护视频免被定制复现身份

    发表
    被测模型
    LTX-2.3、Wan2.2-5B
    摘要TC-UAP 以可复用的时间一致扰动干扰两类定制共用的 VAE 隐空间。

    作者要解决的是:发布前如何给视频加不可见扰动,使片段既不能被拿去微调视频扩散模型,也不能被抽帧做 image-to-video。

    深度解读完整解读
  7. 攻击arXiv 2606.11817

    研究:语法约束解码可越狱 LLM 生成恶意代码,并提出 CodeShield 防御

    提出 CodeSpear 越狱,借语法约束解码生成恶意代码,并给出 CodeShield 防御

    发表
    攻击者
    黑盒
    被测模型
    Qwen2.5-Coder-7B、Qwen2.5-Coder-32B、Qwen2.5-7B 等 10 个

    摘要论文发现语法约束解码会破坏自然语言安全对齐,提出 CodeSpear 越狱攻击与基于蜜罐代码对齐的 CodeShield 防御。

    深度解读完整解读
  8. 攻击arXiv 2601.04261

    针对大语言模型后门指纹的抑制攻击

    提出 TFA 与 SVA,抑制 ensemble 后门指纹验证

    发表
    被测模型
    LLaMA2-7B、LLaMA3.1-8B-It、Qwen2.5-7B 等 11 个
    摘要两种 ensemble 攻击 TFA/SVA 抑制后门指纹。

    TFA 与 SVA 是针对后门式 LLM 指纹的 ensemble 抑制攻击,不改模型参数。所有者用 SFT 写入秘密对,只通过 API 验证版权。攻击者未授权取得模型,不知道触发和指纹,却要把每个模型的验证变成失败,同时让 ensemble 至少不差于性能最高的单模型。

    深度解读完整解读
已经到底了