跳到正文
10月9日 · 周五

全部论文

找到 38 篇

另有 537 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.07723

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    发表
    被测模型
    Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个

    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    深度解读完整解读
  2. 攻击arXiv 2610.07654

    研究揭示策略蒸馏的安全后门风险

    测量带后门教师经 OPD 向干净学生迁移潜伏后门

    发表
    被测模型
    Qwen2.5-1.5B-Instruct、Qwen2.5-3B-Instruct、Qwen2.5-7B-Instruct
    摘要作者称 OPD 可在压低无触发词有害率时迁入后门。

    带后门的外部教师经 OPD,可在压低无触发词有害率的同时,把触发条件下的有害行为传给初始干净学生。。

    深度解读完整解读
  3. 攻击arXiv 2610.07510

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    提出 PERSISTBD,发布前强化供应链后门使其经良性 SFT 与 RL 后仍外发凭据

    发表
    被测模型
    Qwen2.5-Coder-3B-Instruct、Qwen2.5-Coder-7B-Instruct、Qwen3-Coder-30B-A3B-Instruct
    摘要总结了论文关于后门在 SFT/RL 中存活的发现、两因子机制、PERSISTBD 方法与核心数字。

    本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。

    深度解读完整解读
  4. 攻击arXiv 2610.05793

    研究者训练出按多智能体拓扑触发的代码后门模型

    提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞

    发表
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct

    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    深度解读完整解读
  5. 分析与理论arXiv 2610.02886

    研究揭示无触发投毒审计缺口:事实答对不等于决策正确

    揭示无触发虚假训练下事实回答与下游决策的审计差距

    发表
    被测模型
    Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B 等 9 个
    摘要作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。

    论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。

    深度解读完整解读
  6. 攻击arXiv 2610.01367

    研究:高质量数据筛选挡不住投毒

    提出 Bi-QSTO,优化能穿过质量筛选并在微调中削弱安全对齐的投毒样本

    发表
    被测模型
    Llama2-7B-Chat、Llama3-8B-Instruct、Qwen2-7B-Instruct 等 5 个
    摘要质量筛选挡不住部分高分样本的安全削弱。

    Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。

    深度解读完整解读
  7. 攻击arXiv 2609.33985

    研究:众包微调数据投毒可放大专有指令抽取

    提出主题锚点投毒,放大众包微调后的专有指令提取

    发表
    攻击者
    黑盒
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 4 个

    摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。

    深度解读完整解读
  8. 攻击arXiv 2609.33569

    信息黑洞:3D 点云重建中的后门机制研究

    提出 Information Blackhole 与 AGM,控制点云自编码器后门重建到指定形状

    发表
    被测模型
    FoldingNet、PointDiffusion
    摘要AGM 用自适应高斯匹配压制 PCAE 投毒潜码中的源几何,九组设置的 CD-ASD 均下降。

    这篇工作研究点云自编码器的训练时后门:干净输入仍自重建,带触发的输入应重建成攻击者指定形状。分类后门只需把预测推向离散标签。PCAE 把源几何与目标信息编进同一个连续潜空间,残留源几何会把重建拉回源形状。

    深度解读完整解读
  9. 评测与基准arXiv 2609.32616

    Cave-Bench:虚假指控下 LLM 智能体最高 60.06% 的运行会破坏正确工作

    提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作

    发表
    被测模型
    Claude-Sonnet-5、Claude-Opus-5、GPT-5.6-Sol 等 14 个

    摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。

    深度解读完整解读
  10. 分析与理论arXiv 2609.32288

    预训练数据投毒的可解理论:依赖极限顺序的缩放指数

    证明预训练投毒的清洁超额风险指数随极限顺序变化

    发表
    被测模型
    OLMo-style models
    摘要投毒清洁超额风险的幂指数取决于先固定宽高比还是先取充足数据极限。

    可解的预训练数据投毒理论:清洁超额风险的缩放指数随极限顺序改变。。

    深度解读完整解读
  11. 攻击arXiv 2609.27422

    RAMP:逆转对抗扰动以增强针对恶意软件检测器的干净标签后门攻击

    提出 RAMP,逆转对抗扰动加强恶意软件检测器的干净标签后门

    发表
    被测模型
    MalConv、MalConvGCG
    摘要RAMP 用反转扰动做 clean-label 投毒。

    RAMP 是 score-based black-box 下的 clean-label 后门增强,对象是会微调的 Windows PE 原始字节恶意软件检测器。

    深度解读完整解读
  12. 攻击arXiv 2609.27124

    Fed-ADR:用恶意编排服务器协同客户端梯度操纵攻击联邦学习

    提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复

    发表
    攻击者
    灰盒
    被测模型
    CNN(MNIST:2 Conv + 3 FC)、CNN(Fashion-MNIST:6 Conv + 1 FC)、ResNet18(CIFAR-10)
    摘要Fed-ADR 用 gray-box 编排攻击绕过多种聚合防御,再用 Hessian 一致性检测和窗口内恢复把准确率拉回。

    Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。

    深度解读完整解读
  13. 攻击arXiv 2609.17817

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    提出基准投毒攻击,使自修改编码 Agent 跨代写出含漏洞代码

    发表
    被测模型
    Claude Sonnet 4.5、Qwen3.5-397B、gpt-oss-120b 等 5 个

    摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。

    深度解读完整解读
  14. 评测与基准arXiv 2609.10952

    监督学习中的数据投毒攻击实证评估:标签翻转与后门投毒在 MNIST 和 Fashion-MNIST 上的对比

    比较标签翻转与后门投毒对图像分类器的影响

    发表
    被测模型
    Logistic Regression、Linear SVM、Random Forest
    摘要标签翻转更能拉低线性模型。

    Khan 与 Abusaqer 在两个图像分类基准上比较了两种训练时投毒。

    深度解读完整解读