跳到正文
10月9日 · 周五

供应链安全 · 论文

找到 3 篇

另有 38 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.07510

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    提出 PERSISTBD,发布前强化后门以穿透良性 SFT 与 RL

    发表
    测试
    Qwen2.5-Coder-3B-Instruct、Qwen2.5-Coder-7B-Instruct、Qwen3-Coder-30B-A3B-Instruct
    摘要总结了论文关于后门在 SFT/RL 中存活的发现、两因子机制、PERSISTBD 方法与核心数字。

    本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。

    深度解读完整解读
  2. 攻击arXiv 2609.10117

    研究揭示基于混淆的端侧 LLM 保护方案的安全边界

    提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型

    发表
    测试
    BERT-Base、ViT-Base、Qwen2.5-0.5B 等 4 个
    摘要Oprior 是四原语复合的安全边界,Collapse 利用列方向泄漏抽取替代模型,Oext 只被同一攻击评测。

    这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。

    深度解读完整解读
  3. 防御arXiv 2609.20532

    面向旧款 GPU 的可验证差分隐私训练框架:用 CPU 侧 TEE 校验 GPU 梯度

    AI 导读论文提出一种在旧款 GPU 上实现可验证差分隐私(DP)训练的框架,用 CPU 侧 TEE 配合不受信任的 GPU 完成校验。

    发表
    测试
    5-layer MLP、WideResNet、GPT-2-medium 等 4 个
    摘要CPU TEE 概率抽查不可信 GPU 上的 DP-SGD,以小开销约束频繁偏离。

    TEE-Certified DP 用已部署的 CPU TEE 监视不可信旧 GPU 上的 DP-SGD,使监管方能在不看训练数据的情况下检查声明的隐私机制是否被执行。

    深度解读完整解读
已经到底了