跳到正文
10月9日 · 周五

全部论文

找到 10 篇

另有 552 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2605.14605

    研究:恶意微调防御在持续训练下失效,72 条防御轨迹危害度全部上升

    用代价曲线评估恶意微调防御在持续训练下的衰减

    发表
    测试
    Llama-2-7B-chat、Qwen3-8B、Llama-3.1-8B-Instruct 等 8 个

    摘要论文指出恶意微调防御在持续训练下均会衰减,表明基于有限攻击者假设的防御无法为开源模型提供持久保护。

    深度解读完整解读
  2. 攻击arXiv 2610.09819

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门

    发表
    测试
    HuBERT-base、WavLM-base

    摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。

    深度解读完整解读
  3. 防御arXiv 2608.05578

    AMS 工具通过激活分析检测语言模型的安全训练改动

    提出 AMS,用激活分离与方向相似度检测安全训练改动

    发表
    测试
    Llama-3.1-8B-Instruct、Llama-3.2-3B-Instruct、Llama-3.2-1B-Instruct 等 14 个
    摘要AMS 按激活签名把安全改动分四类,前三类可由两级扫描覆盖,行为微调会漏。

    AMS 是面向开放权重模型、部署前使用的激活扫描器,用来看安全训练被拿掉或改写之后,激活空间里还留着什么几何痕迹。

    深度解读完整解读
  4. 攻击arXiv 2610.01062

    Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架

    提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱

    发表
    测试
    Qwen2.5-7B-Instruct、Gemma-2-9B-IT、Llama-3.1-8B-Instruct 等 6 个
    摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。

    Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。

    深度解读完整解读
  5. 攻击arXiv 2609.39788

    研究:多智能体系统潜在通信链路可被训练用于提升有害顺从

    提出只改多智能体潜在通信链路以提高有害遵从的攻击

    发表
    测试
    Llama-3.2-3B-Instruct、Qwen2.5-3B-Instruct、Gemma-3-1B-IT 等 7 个
    摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。

    学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。

    深度解读完整解读
  6. 防御arXiv 2609.02293

    SEAL:通过共享专家对齐强化 MoE 全局安全

    提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改

    发表
    攻击者
    白盒、黑盒
    测试
    Qwen1.5-MoE-A2.7B、DeepSeekMoE-16B、GLM-4.7-Flash 等 4 个
    摘要SEAL 把 DPO-LoRA 限制在混合 MoE 共享专家上,SEAL++再保护已有安全神经元方向。

    SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。

    深度解读完整解读
  7. 攻击arXiv 2609.27124

    Fed-ADR:用恶意编排服务器协同客户端梯度操纵攻击联邦学习

    提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复

    发表
    攻击者
    灰盒
    测试
    CNN(MNIST:2 Conv + 3 FC)、CNN(Fashion-MNIST:6 Conv + 1 FC)、ResNet18(CIFAR-10)
    摘要Fed-ADR 用 gray-box 编排攻击绕过多种聚合防御,再用 Hessian 一致性检测和窗口内恢复把准确率拉回。

    Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。

    深度解读完整解读
  8. 防御arXiv 2608.05045

    Gradient Immunity 提出 USG:在开放权重发布时阻断恶意微调梯度

    提出 USG,在部分保护开源权重发布时阻断有害微调梯度

    发表
    攻击者
    白盒
    测试
    Qwen3-14B(表中作 Qwen-14B)、Llama-3.1-8B(表中作 Llama-8B)
    摘要USG 在 PPOW 下用零空间立方层阻断有害微调梯度。

    Unidirectional Safety Gate 是面向 PPOW 发布设定的发布时防护:大部分权重仍可训练,一小部分安全关键组件由提供者侧加固保留,下游不必配合额外安全流程。。

    深度解读完整解读
  9. 攻击arXiv 2609.01495

    去中心化联邦学习中的拜占庭节点放置优化

    提出 BPI 选点算法,增强去中心化联邦学习中的模型与数据投毒

    发表
    摘要BPI 用有限轮 gossip 暴露选拜占庭集合。

    作者把 DFL 中“破坏哪 m 个节点”写成攻击者在固定预算下的优化问题,并用 BPI 近似有限轮内诚实节点受到的拜占庭暴露。

    深度解读完整解读
已经到底了