跳到正文
10月10日 · 周六

全部论文

找到 19 篇

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.07510

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    提出 PERSISTBD,发布前强化供应链后门使其经良性 SFT 与 RL 后仍外发凭据

    发表
    被测模型
    Qwen2.5-Coder-3B-Instruct、Qwen2.5-Coder-7B-Instruct、Qwen3-Coder-30B-A3B-Instruct
    摘要总结了论文关于后门在 SFT/RL 中存活的发现、两因子机制、PERSISTBD 方法与核心数字。

    本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。

    深度解读完整解读
  2. 攻击arXiv 2610.03124

    研究提出 Untag 攻击框架,使开源大模型触发标签滥用检测机制失效

    提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测

    发表
    攻击者
    黑盒、白盒
    被测模型
    Llama2 (7B)、Llama3 (8B)、Qwen2.5 (7B)
    摘要作者用 UNTAG 评估 trigger-tag,认为其不能充当开放权重滥用检测的主要边界。

    UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。

    深度解读完整解读
  3. 防御arXiv 2609.39548

    NDDL:用正常扩散动力学为文生图模型做后门防御

    提出 NDDL,用良性扩散轨迹检测文生图后门提示并定位触发 token

    发表
    被测模型
    Stable Diffusion v1.5、Stable Diffusion XL、Stable Diffusion v3.5 等 4 个
    摘要NDDL 从良性扩散轨迹学习正常转移,用动态不一致检测后门并定位触发 token。

    NDDL 是面向文生图扩散模型的后门防御:防御者只有白盒模型访问和良性提示词,没有后门先验,需要区分后门提示词并找出触发 token。

    深度解读完整解读
  4. 可解释性arXiv 2609.23587

    大型推理模型的效率与安全困境:量化与剪枝如何影响越狱鲁棒性

    分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响

    发表
    被测模型
    QwQ-32B、DeepSeek-R1-Distill-Qwen-32B、DeepSeek-R1-Distill-Llama-8B
    摘要效率压缩常使 LRM 越狱 HR 下降,作者将其归因于推理退化而非对齐增强。

    作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。

    深度解读完整解读
  5. 可解释性arXiv 2609.09575

    MonoTM:用可解释单义特征做主题建模,超越关键词表示

    提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述

    发表
    摘要MonoTM 分开估计混合与解释主题,三套基准上二者偏好的 SAE 配置不同。

    MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。

    深度解读完整解读
  6. 可解释性arXiv 2609.06968

    通过稀疏自编码器特征追踪查询扩展效果

    用 SAE 追踪稠密检索查询扩展的潜变量并用激活转向验证

    发表
    被测模型
    Qwen3-Embedding-0.6B(Qwen-Embed)、SimLM
    摘要SAE 追踪稠密检索 QE 的潜变量,转向在四基准上比文本扩展更稳。

    作者用稀疏自编码器分析稠密检索里的查询扩展:现成检索器不微调时,拼接扩展文本往往增益有限甚至变差,而最终指标和嵌入整体偏移不足以说明内部发生了什么。

    深度解读完整解读
  7. 可解释性arXiv 2609.06934

    论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击

    解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练

    发表
    被测模型
    Qwen-2.5-7B、Qwen-2.5-7B-Instruct、Llama-3-8B 等 15 个

    摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。

    深度解读完整解读
  8. 攻击arXiv 2608.06862

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链

    发表
    被测模型
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B

    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。

    深度解读完整解读
  9. 防御arXiv 2608.05578

    AMS 工具通过激活分析检测语言模型的安全训练改动

    提出 AMS,用激活分离与方向相似度检测安全训练改动

    发表
    被测模型
    Llama-3.1-8B-Instruct、Llama-3.2-3B-Instruct、Llama-3.2-1B-Instruct 等 14 个
    摘要AMS 按激活签名把安全改动分四类,前三类可由两级扫描覆盖,行为微调会漏。

    AMS 是面向开放权重模型、部署前使用的激活扫描器,用来看安全训练被拿掉或改写之后,激活空间里还留着什么几何痕迹。

    深度解读完整解读
  10. 防御arXiv 2607.14737

    GeoDetect:面向视觉语言预训练模型的几何对抗检测方法

    提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本

    发表
    攻击者
    白盒
    被测模型
    CLIPViT (ViT-B/16)、CLIPCNN (ResNet-50)、ALBEF 等 4 个
    摘要GeoDetect 用几何分数检测 VLP 对抗样本。

    GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。

    深度解读完整解读
  11. 攻击arXiv 2607.01276

    研究者提出嵌入推断攻击 EIA,可在黑盒 IR 系统中识别所用嵌入模型

    提出嵌入推断攻击 EIA,在黑盒 IR 中识别所用嵌入模型

    发表
    攻击者
    黑盒
    被测模型
    e5-small、e5-small-v2、e5-base 等 19 个
    摘要EIA 用无序文档集的差异从候选中识别嵌入模型,并给出 reranker 与阈值下的计数。

    EIA 是在黑盒 IR 上识别所用嵌入模型的攻击。。

    深度解读完整解读
  12. 攻击arXiv 2606.12716

    PaperGuard:针对多模态 AI 同行评审的攻击与防御基准

    提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令

    发表
    被测模型
    Claude-sonnet-4.5、GPT-4o、GPT-4.1 等 11 个
    摘要PaperGuard 测到提示注入与白盒视觉抬分,并比较分块检索防御。

    PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。

    深度解读完整解读
已经到底了