跳到正文
10月10日 · 周六

全部论文

找到 44 篇

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09981

    研究:LLM 路由决策日志可推断用户医疗、自伤等敏感话题

    提出利用路由元数据推断敏感话题的侧信道攻击

    发表
    被测模型
    RouteLLM (BERT router)、notdiamond-0001、Vela (vLLM Semantic Router)

    摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。

    深度解读完整解读
  2. 攻击arXiv 2610.06848

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员

    发表
    攻击者
    黑盒
    被测模型
    BERT (4.4M-340M)、ViT (22M-307M)、Pythia (70M-2.8B) 等 5 个

    摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。

    深度解读完整解读
  3. 防御arXiv 2610.06636

    差分隐私混合公共数据集提升隐私学习效果

    提出 DP-MixMin,私有学习公开数据混合并做差分隐私微调

    发表
    被测模型
    ResNet-18、GPT-2 Medium
    摘要DP-MixMin 私下学公开混合再 DP 微调,胸片 macro AUC 与邮件困惑度优于均匀混合。

    DP-MixMin 是一条端到端的差分隐私训练流程:先私下决定多个公开数据集的预训练混合,再预训练并在敏感数据上 DP 微调。作者称这是首个这样的流程。

    深度解读完整解读
  4. 攻击arXiv 2610.05601

    Tracer 框架可从遗忘后的扩散模型中识别被擦除概念

    提出 TRACER,从权重差识别扩散模型被擦除概念

    发表
    攻击者
    白盒
    被测模型
    Stable Diffusion v1.5、Stable Diffusion 3、FLUX.1 等 5 个
    摘要TRACER 用权重足迹识别未披露擦除概念并估计个数,作者称数秒内完成且准确率高于对照。

    TRACER 针对的是遗忘扩散模型上的目标识别:提供者从公开基座 W 用已发表方法擦掉未知集合 S⋆,只发布 W′。攻击者还有假定包含这些概念的词表,但不知擦了谁、擦了几个、用了什么算法。

    深度解读完整解读
  5. 攻击arXiv 2610.05453

    研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私

    提出 PLW,用微调把先前对话敏感触发编码进后续生成图像

    发表
    被测模型
    OmniGen2、BAGEL-7B

    摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。

    深度解读完整解读
  6. 防御arXiv 2610.04426

    UnAct:无需梯度的定向激活干预实现类别遗忘

    提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别

    发表
    被测模型
    ResNet-18、ViT-B/16
    摘要UnAct 用前向激活做类别遗忘。

    UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。

    深度解读完整解读
  7. 攻击arXiv 2610.04128

    研究显示拆分学习中的梯度可提升客户端文本重建率

    衡量分裂学习中梯度相对激活对客户文本重建的额外贡献

    发表
    被测模型
    GPT-2 (openai-community/gpt2, 124M)、Qwen3-0.6B
    摘要激活已恢复大部分 token。

    这篇工作测量 split learning 分裂点上的文本泄漏:激活单独能恢复多少,训练回传的梯度再增加多少,以及按 token 还是按整篇计分会不会改写结论。

    深度解读完整解读
  8. 攻击arXiv 2610.01365

    ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联

    提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联

    发表
    攻击者
    白盒、灰盒
    被测模型
    GPT-2 Small、GPT-2 Medium、GPT-2 Large 等 6 个

    摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。

    深度解读完整解读
  9. 防御arXiv 2609.40286

    研究者提出 COVER:在语言预算下选择源语言实现跨语言遗忘

    提出 COVER,在语言预算下选择源语言实现跨语言知识遗忘

    发表
    被测模型
    Tiny Aya Global、Qwen3-4B-Instruct-2507、Llama-3.2-3B-Instruct
    摘要COVER 在语言预算下选源语言,以降低未监督语言上相对 oracle 的残余访问。

    语言预算下的多语言遗忘:遗忘监督只放在 K 种源语言上,目标是降低其余语言对同一事实的残余访问,而不是把每种评测语言都译成监督数据。

    深度解读完整解读
  10. 防御arXiv 2609.37858

    存储不等于策略:面向 LLM 遗忘的状态条件支持控制

    提出 Intervention Score 与 DIR-R,按干预效果选择并修订遗忘参数支持

    发表
    被测模型
    Llama 3 8B、Gemma 2 2B、Qwen2.5-7B 等 4 个
    摘要作者把局部化遗忘拆成初始干预选择和检查点修订,并在三个设置里分别给证据和边界。

    Storage Is Not Strategy 研究局部化 LLM 遗忘里两个常被混在一起的决定:一开始该更新哪些参数,以及优化改变模型之后这个选择要不要改。

    深度解读完整解读
  11. 攻击arXiv 2609.36941

    研究者提出针对黑盒 LLM 的实用密钥提取框架

    提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据

    发表
    攻击者
    黑盒
    被测模型
    DeepSeek-Coder-7B、LLaMA-3-8B、Qwen2.5-Coder-7B 等 6 个

    摘要论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。

    深度解读完整解读
  12. 攻击arXiv 2609.36331

    无需参考模型:用邻居样本校准单轮成员推理攻击

    提出用邻居分数替代参考模型的单轮成员推断

    发表
    攻击者
    黑盒
    被测模型
    目标分类模型(架构与训练流程遵循 Aerni et al.)
    摘要邻居查询在单模型上恢复逐样本校准,合成邻居加早期检查点最接近 LiRA。

    本文研究 one-round 成员推断:只有一个目标模型、不能再训练参考模型时,如何仍做逐样本校准,并用于单次运行的 DP 审计。

    深度解读完整解读
  13. 攻击arXiv 2609.35699

    论文:蒸馏防御在蒸馏后强化学习下易被攻破

    提出用 API 推理摘要重建轨迹再蒸馏加强化学习,攻破蒸馏防御

    发表
    攻击者
    黑盒
    被测模型
    Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B 等 12 个
    摘要更现实的蒸馏攻击是蒸馏后再 RL。

    这篇工作修订蒸馏攻击的威胁模型:攻击者经合法 API 收集闭源推理数据,先蒸馏自有模型,再做强化学习。作者认为只在蒸馏后评估防御,会漏掉后续 RL,从而高估防御。

    深度解读完整解读
  14. 防御arXiv 2609.34591

    TULIP:按输入定位层级的定向大模型遗忘方法

    提出 TULIP,按输入定位形成层并去除目标 token 对齐以实现定向遗忘

    发表
    被测模型
    Llama-3.1-8B、Llama-3.2-3B、Llama-3.2-1B 等 7 个
    摘要TULIP 在形成结束的层去掉遗忘目标对齐,多数设置下 FQ 更高,4-bit 下 FQ 下降。

    TULIP 是一种逐输入选择层的表示级遗忘方法,目标是去掉遗忘答案的形成、留下读出。输出级方法可能只压低特定回答的似然。RMU、LUNAR 等则对全部遗忘样本共用一层。

    深度解读完整解读
  15. 攻击arXiv 2609.33985

    研究:众包微调数据投毒可放大专有指令抽取

    提出主题锚点投毒,放大众包微调后的专有指令提取

    发表
    攻击者
    黑盒
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 4 个

    摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。

    深度解读完整解读
  16. 分析与理论arXiv 2609.33898

    研究揭示训练效率与模型脆弱性的权衡:高效训练更易受对抗与隐私攻击

    比较高效与高成本训练的对抗和隐私脆弱性并分析损失几何

    发表
    被测模型
    ResNet-18、Swin Transformer、Qwen2.5-Math-7B-Instruct 等 7 个
    摘要效用匹配下,三种高效训练都伴随更高的隐私与对抗脆弱性及更尖的损失几何。

    作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。比较在任务效用接近的前提下进行。视觉侧用 KNN-Shapley 的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练。

    深度解读完整解读