跳到正文
10月10日 · 周六

全部论文

找到 46 篇

另有 216 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.08316

    MARCO:面向蛋白质生成模型的放射性水印框架

    提出 MARCO 放射性水印,冻结蛋白质生成模型并在去噪时嵌入签名

    发表
    攻击者
    黑盒
    被测模型
    RFdiffusion、ESMFold、Chroma 等 6 个
    摘要MARCO 在冻结的 PGM 上去噪时嵌构象水印,作者称能兼顾保真与抗扰动,并使盗版模型继承水印。

    MARCO 是加在蛋白质生成模型推理过程上的构象水印,用来标记知识产权,并为可能的生物安全滥用保留可追溯信号。作者还把它说成数字权利管理工具,以及符合生物武器公约的数字监管链。问题在于:专有 PGM 的三维输出可能被拿去训练盗版模型,也可能在来源被抹掉后绕过筛查。

    深度解读完整解读
  2. 攻击arXiv 2610.06093

    研究评测训练数据提取风险的跨语言迁移

    用翻译前缀做跨语言训练数据提取,恢复英语训练文本中的 PII

    发表
    被测模型
    GPT-Neo 1.3B、GPT-Neo 2.7B、GPT-J 6B 等 7 个
    摘要跨语言 TDE 能恢复英语记忆的 PII,转移随多语训练和措辞保真变化。

    这篇工作检验训练数据抽取是否跨语言:英语段落里记住的 PII,能否被其他语言的前缀逐字抽出。

    深度解读完整解读
  3. 攻击arXiv 2610.05601

    Tracer 框架可从遗忘后的扩散模型中识别被擦除概念

    提出 TRACER,从权重差识别扩散模型被擦除概念

    发表
    攻击者
    白盒
    被测模型
    Stable Diffusion v1.5、Stable Diffusion 3、FLUX.1 等 5 个
    摘要TRACER 用权重足迹识别未披露擦除概念并估计个数,作者称数秒内完成且准确率高于对照。

    TRACER 针对的是遗忘扩散模型上的目标识别:提供者从公开基座 W 用已发表方法擦掉未知集合 S⋆,只发布 W′。攻击者还有假定包含这些概念的词表,但不知擦了谁、擦了几个、用了什么算法。

    深度解读完整解读
  4. 攻击arXiv 2610.04128

    研究显示拆分学习中的梯度可提升客户端文本重建率

    衡量分裂学习中梯度相对激活对客户文本重建的额外贡献

    发表
    被测模型
    GPT-2 (openai-community/gpt2, 124M)、Qwen3-0.6B
    摘要激活已恢复大部分 token。

    这篇工作测量 split learning 分裂点上的文本泄漏:激活单独能恢复多少,训练回传的梯度再增加多少,以及按 token 还是按整篇计分会不会改写结论。

    深度解读完整解读
  5. 防御arXiv 2610.03980

    FADE:面向视频扩散模型的帧感知多概念擦除框架

    提出 FADE,对文生视频模型做帧感知多概念擦除

    发表
    被测模型
    Wan2.1-T2V-1.3B、Wan2.1-T2V-14B、CogVideoX-2B 等 4 个
    摘要FADE 用闭式编辑、帧感知适配器和软路由,在单骨干上擦除多概念并压低逐帧残差。

    FADE 是面向文生视频扩散 Transformer 的多概念遗忘方法,用来抑制指定物体、画风、裸体、暴力、仇恨和名人身份,并尽量保持其他生成。作者要处理两件事。与帧无关的抑制会让概念在少数帧重现,片段均值会掩盖这一失败。

    深度解读完整解读
  6. 攻击arXiv 2610.01365

    ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联

    提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联

    发表
    攻击者
    白盒、灰盒
    被测模型
    GPT-2 Small、GPT-2 Medium、GPT-2 Large 等 6 个

    摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。

    深度解读完整解读
  7. 防御arXiv 2609.40286

    研究者提出 COVER:在语言预算下选择源语言实现跨语言遗忘

    提出 COVER,在语言预算下选择源语言实现跨语言知识遗忘

    发表
    被测模型
    Tiny Aya Global、Qwen3-4B-Instruct-2507、Llama-3.2-3B-Instruct
    摘要COVER 在语言预算下选源语言,以降低未监督语言上相对 oracle 的残余访问。

    语言预算下的多语言遗忘:遗忘监督只放在 K 种源语言上,目标是降低其余语言对同一事实的残余访问,而不是把每种评测语言都译成监督数据。

    深度解读完整解读
  8. 攻击arXiv 2609.36941

    研究者提出针对黑盒 LLM 的实用密钥提取框架

    提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据

    发表
    攻击者
    黑盒
    被测模型
    DeepSeek-Coder-7B、LLaMA-3-8B、Qwen2.5-Coder-7B 等 6 个

    摘要论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。

    深度解读完整解读
  9. 攻击arXiv 2609.36331

    无需参考模型:用邻居样本校准单轮成员推理攻击

    提出用邻居分数替代参考模型的单轮成员推断

    发表
    攻击者
    黑盒
    被测模型
    目标分类模型(架构与训练流程遵循 Aerni et al.)
    摘要邻居查询在单模型上恢复逐样本校准,合成邻居加早期检查点最接近 LiRA。

    本文研究 one-round 成员推断:只有一个目标模型、不能再训练参考模型时,如何仍做逐样本校准,并用于单次运行的 DP 审计。

    深度解读完整解读
  10. 攻击arXiv 2609.35699

    论文:蒸馏防御在蒸馏后强化学习下易被攻破

    提出用 API 推理摘要重建轨迹再蒸馏加强化学习,攻破蒸馏防御

    发表
    攻击者
    黑盒
    被测模型
    Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B 等 12 个
    摘要更现实的蒸馏攻击是蒸馏后再 RL。

    这篇工作修订蒸馏攻击的威胁模型:攻击者经合法 API 收集闭源推理数据,先蒸馏自有模型,再做强化学习。作者认为只在蒸馏后评估防御,会漏掉后续 RL,从而高估防御。

    深度解读完整解读
  11. 评测与基准arXiv 2609.35028

    VEX-Bench:评测 LLM 生成虚假信息的核验复杂度

    提出 VEX-Bench 评测 LLM 生成虚假信息的核查复杂度

    发表
    被测模型
    Claude Sonnet 4.5、Gemini 3.1 Pro、GPT-5.4 等 7 个
    摘要VEX-Bench 用筛查时的五维复杂度衡量虚假信息对核查容量的占用,并报告生成与核查的成本差。

    VEX-Bench 把 LLM 虚假信息的风险从“能否生成”改成“筛查时会占用多少核查容量”。

    深度解读完整解读
  12. 防御arXiv 2609.34591

    TULIP:按输入定位层级的定向大模型遗忘方法

    提出 TULIP,按输入定位形成层并去除目标 token 对齐以实现定向遗忘

    发表
    被测模型
    Llama-3.1-8B、Llama-3.2-3B、Llama-3.2-1B 等 7 个
    摘要TULIP 在形成结束的层去掉遗忘目标对齐,多数设置下 FQ 更高,4-bit 下 FQ 下降。

    TULIP 是一种逐输入选择层的表示级遗忘方法,目标是去掉遗忘答案的形成、留下读出。输出级方法可能只压低特定回答的似然。RMU、LUNAR 等则对全部遗忘样本共用一层。

    深度解读完整解读
  13. 攻击arXiv 2609.33985

    研究:众包微调数据投毒可放大专有指令抽取

    提出主题锚点投毒,放大众包微调后的专有指令提取

    发表
    攻击者
    黑盒
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 4 个

    摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。

    深度解读完整解读
  14. 分析与理论arXiv 2609.33909

    近重复家族干扰精确记录成员推断

    分析近重复族如何让精确记录成员推断误判为入训

    发表
    被测模型
    Pythia-2.8B、GPT-2、Qwen3.5-2B 等 5 个
    摘要近重复使干净参照 MI 把族级暴露当成精确记录。

    作者研究成员推断能否作为精确记录的数据来源证据。版权和来源审计需要的是该记录本身是否入训,而网页语料中的转载、镜像和轻改会让非同一近重复产生成员样分数。四世界审计用 E 表示精确记录是否入训、用 F 表示其近重复族是否在场,从而分开 H00 到 H10 的标准 MI、H00 到 H01 的族偏移,以及 H01 到 H11 的 exact-given-family。

    深度解读完整解读
  15. 分析与理论arXiv 2609.33898

    研究揭示训练效率与模型脆弱性的权衡:高效训练更易受对抗与隐私攻击

    比较高效与高成本训练的对抗和隐私脆弱性并分析损失几何

    发表
    被测模型
    ResNet-18、Swin Transformer、Qwen2.5-Math-7B-Instruct 等 7 个
    摘要效用匹配下,三种高效训练都伴随更高的隐私与对抗脆弱性及更尖的损失几何。

    作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。比较在任务效用接近的前提下进行。视觉侧用 KNN-Shapley 的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练。

    深度解读完整解读
  16. 评测与基准arXiv 2609.33481

    IDUnlearn-Bench:面向视觉语言模型的个体级遗忘基准

    提出 IDUnlearn-Bench,评测 VLM 个体级遗忘后的身份残留

    发表
    被测模型
    Qwen3-VL-2B、Qwen3-VL-4B、Qwen3-VL-8B 等 6 个
    摘要IDUnlearn-Bench 用四族探针显示:压低直接属性访问后,身份仍常能被反向查出、绑定或重构。

    IDUnlearn-Bench 评测 VLM 是否忘掉一个可跨模态识别的人,而不只是答不出某条监督事实。

    深度解读完整解读