跳到正文
10月9日 · 周五

全部论文

找到 29 篇

另有 608 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09981

    研究:LLM 路由决策日志可推断用户医疗、自伤等敏感话题

    提出利用路由元数据推断敏感话题的侧信道攻击

    发表
    测试
    RouteLLM (BERT router)、notdiamond-0001、Vela (vLLM Semantic Router) 等 6 个

    摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。

    深度解读完整解读
  2. 攻击arXiv 2610.06848

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员

    发表
    攻击者
    黑盒
    测试
    BERT (4.4M-340M)、ViT (22M-307M)、Pythia (70M-2.8B) 等 5 个

    摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。

    深度解读完整解读
  3. 防御arXiv 2608.00716

    生成图像更易被遗忘:面向合成图像检测的机器遗忘视角

    提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图

    发表
    测试
    DINOv2 ViT-S/14、DINOv2 ViT-B/14、DINOv2 ViT-L/14 等 9 个
    摘要作者用剪枝或 LoRA 遗忘拉开生成图与自然图的特征相似度,并在多个检测基准上报告结果。

    这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。

    深度解读完整解读
  4. 防御arXiv 2607.14737

    GeoDetect:面向视觉语言预训练模型的几何对抗检测方法

    提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本

    发表
    攻击者
    白盒
    测试
    CLIPViT (ViT-B/16)、CLIPCNN (ResNet-50)、ALBEF 等 4 个
    摘要GeoDetect 用几何分数检测 VLP 对抗样本。

    GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。

    深度解读完整解读
  5. 防御arXiv 2609.27399

    GUARD:在 CosyVoice2 上做说话人身份遗忘以阻止重识别

    提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别

    发表
    测试
    CosyVoice2-0.5B、F5-TTS、FireRedTTS
    摘要GUARD 用门控激活转向把退出说话人推向冒充相似度,以抑制再识别并保住音质。

    GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。

    深度解读完整解读
  6. 防御arXiv 2609.31056

    SCALPEL:用对比稀疏自编码器实现选择性表征层遗忘

    提出 SCALPEL,用对比 SAE 在表征层选择性遗忘特定事实

    发表
    测试
    Qwen2.5-1.5B-Instruct、Llama-3.2-1B-Instruct、Gemma-2-2B-it
    摘要SCALPEL 以对比稀疏特征做窄目标表征遗忘,在 TOFU 上与优化基线相当且可检查。

    SCALPEL 是不改基座权重的表征层遗忘方法,面向与保留数据重叠的窄目标。

    深度解读完整解读
  7. 攻击arXiv 2609.10117

    研究揭示基于混淆的端侧 LLM 保护方案的安全边界

    提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型

    发表
    测试
    BERT-Base、ViT-Base、Qwen2.5-0.5B 等 4 个
    摘要Oprior 是四原语复合的安全边界,Collapse 利用列方向泄漏抽取替代模型,Oext 只被同一攻击评测。

    这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。

    深度解读完整解读
  8. 防御arXiv 2609.23586

    VidMark:面向视频生成模型知识产权保护的高效水印方案

    提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权

    发表
    测试
    Stable Video Diffusion (SVD)、Open-Sora、Wan
    摘要VidMark 加解码器引导微调,把模型签名写入 VGM 输出并用于两项核验。

    Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。

    深度解读完整解读
  9. 防御arXiv 2609.03629

    EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除

    提出 EraseSAE,在文生视频模型中局部擦除指定概念

    发表
    测试
    CogVideoX-5B、HunyuanVideo、Flux.1 [dev]
    摘要EraseSAE 用单义特征局部擦除。

    EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。

    深度解读完整解读
  10. 防御arXiv 2609.34744

    现代图像后置水印信道的优化与安全:SNW 方案

    提出带密钥的 SNW,抵御事后图像水印的身份伪造

    发表
    测试
    PixelSeal、VideoSeal、TrustMark 等 4 个
    摘要SNW 用密钥与满秩各向同性投影提高事后水印的 Shannon 容量,并对 PCA 完全安全。

    Gesny 与 Giboulot 针对生成内容追溯所依赖的多比特事后图像水印,批评端到端 DNN 方案既无容量理论、又无密钥。

    深度解读完整解读
  11. 防御arXiv 2609.36372

    TTMark:超越单 token 熵的成对无失真水印

    提出成对无失真水印 TTMARK,增强低熵下的机器文本检测

    发表
    测试
    Llama3.2-3B-Instruct、Mistral-v0.3-7B-Instruct、Qwen2.5-7B-Instruct 等 4 个
    摘要TTMARK 用水印化相邻 token 对利用条件熵,在多种无失真方案上提高检测并保持生成质量。

    TTMARK 是一种成对、无失真的文本水印:对相邻 token 的联合分布重加权,而不是逐 token 独立重加权。

    深度解读完整解读
  12. 攻击arXiv 2609.00873

    研究提出 Q-Skew:利用 token 级记忆不对称对微调扩散语言模型做成员推断

    提出 Q-SKEW,利用 token 级记忆不对称推断微调扩散语言模型的成员

    发表
    攻击者
    灰盒
    测试
    LLaDA-8B-Base、LLaDA-8B-Instruct、Dream-Base-7B 等 4 个
    摘要Q-SKEW 用 token 损失差的右偏区分微调 DLM 成员,并可辅助 PII 排序。

    Q-SKEW 是针对微调扩散语言模型的 gray-box 成员推断指标,依据是 token 记忆增益随掩码率下降而增大、成员序列因此右偏。。

    深度解读完整解读
  13. 攻击arXiv 2609.01723

    研究者提出针对微调 TTS 模型的黑盒成员推断攻击

    提出针对微调 TTS 的黑盒成员推断攻击

    发表
    攻击者
    黑盒
    测试
    CosyVoice2、F5-TTS、XTTS-v2
    摘要黑盒 TTS 成员推断以 recitation 加分层语音表示为分数,说话人级强于记录级,DP-SGD 可压到随机附近。

    作者给出一个针对微调文本转语音模型的黑盒成员推断框架,分别审计说话人是否进入微调集,以及某一条文本–音频记录是否进入微调集。微调 TTS 以合成文本和参考语音双条件生成,既有生成模型 MIA 的单条件查询和图像/文本上的逐点比较不能直接套用。作者用 scorable extent 与 memorization elicitation 比较五种查询,认为只有 recitation(用目标转写和干净目标语音要求模型复现)同时满足两条,并把它作为主查询。

    深度解读完整解读
  14. 防御arXiv 2609.14257

    DenMark:面向扩散语言模型的鲁棒语义水印

    提出 DenMark,在扩散语言模型去噪时注入可抵抗保义编辑的语义水印

    发表
    测试
    LLaDA-8B、LLaDA1.5-8B、LLaDA2.0-mini 等 8 个
    摘要DenMark 用 rollout 在 DLM 去噪中累积语义水印,扫描检测以抵抗保义编辑。

    DenMark 是面向扩散语言模型的语义水印:在去噪的局部更新里注入密钥相关语义信号,并在编辑改变 token 边界后仍检测。现有句子级语义水印要先完成整个语义单元再打分取舍,而 DLM 以任意顺序更新掩码,中间单元不完整。DenMark 把续写划成固定 token 区域,对每个局部候选做不提交的 rollout 补全,按语义分 gb 的平均选择更新,从而沿轨迹累积证据。

    深度解读完整解读