跳到正文
10月10日 · 周六

全部论文

找到 24 篇

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09981

    研究:LLM 路由决策日志可推断用户医疗、自伤等敏感话题

    提出利用路由元数据推断敏感话题的侧信道攻击

    发表
    被测模型
    RouteLLM (BERT router)、notdiamond-0001、Vela (vLLM Semantic Router)

    摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。

    深度解读完整解读
  2. 防御arXiv 2610.08316

    MARCO:面向蛋白质生成模型的放射性水印框架

    提出 MARCO 放射性水印,冻结蛋白质生成模型并在去噪时嵌入签名

    发表
    攻击者
    黑盒
    被测模型
    RFdiffusion、ESMFold、Chroma 等 6 个
    摘要MARCO 在冻结的 PGM 上去噪时嵌构象水印,作者称能兼顾保真与抗扰动,并使盗版模型继承水印。

    MARCO 是加在蛋白质生成模型推理过程上的构象水印,用来标记知识产权,并为可能的生物安全滥用保留可追溯信号。作者还把它说成数字权利管理工具,以及符合生物武器公约的数字监管链。问题在于:专有 PGM 的三维输出可能被拿去训练盗版模型,也可能在来源被抹掉后绕过筛查。

    深度解读完整解读
  3. 攻击arXiv 2610.06848

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员

    发表
    攻击者
    黑盒
    被测模型
    BERT (4.4M-340M)、ViT (22M-307M)、Pythia (70M-2.8B) 等 5 个

    摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。

    深度解读完整解读
  4. 防御arXiv 2610.04426

    UnAct:无需梯度的定向激活干预实现类别遗忘

    提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别

    发表
    被测模型
    ResNet-18、ViT-B/16
    摘要UnAct 用前向激活做类别遗忘。

    UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。

    深度解读完整解读
  5. 分析与理论arXiv 2610.02504

    HXAI:分布式能源系统中的分层隐私保护可解释 AI 框架

    提出 HXAI 分层隐私解释框架,本地保留细解释并只发布加噪摘要

    发表
    被测模型
    gradient-boosted tree regression models
    摘要HXAI 把无噪声局部 SHAP 留在家庭内,只聚合差分隐私摘要。

    HXAI 是面向分布式能源系统的分层隐私保护解释框架,服务规划、监测与诊断,而不是实时控制。

    深度解读完整解读
  6. 攻击arXiv 2609.36941

    研究者提出针对黑盒 LLM 的实用密钥提取框架

    提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据

    发表
    攻击者
    黑盒
    被测模型
    DeepSeek-Coder-7B、LLaMA-3-8B、Qwen2.5-Coder-7B 等 6 个

    摘要论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。

    深度解读完整解读
  7. 攻击arXiv 2609.36331

    无需参考模型:用邻居样本校准单轮成员推理攻击

    提出用邻居分数替代参考模型的单轮成员推断

    发表
    攻击者
    黑盒
    被测模型
    目标分类模型(架构与训练流程遵循 Aerni et al.)
    摘要邻居查询在单模型上恢复逐样本校准,合成邻居加早期检查点最接近 LiRA。

    本文研究 one-round 成员推断:只有一个目标模型、不能再训练参考模型时,如何仍做逐样本校准,并用于单次运行的 DP 审计。

    深度解读完整解读
  8. 防御arXiv 2609.31056

    SCALPEL:用对比稀疏自编码器实现选择性表征层遗忘

    提出 SCALPEL,用对比 SAE 在表征层选择性遗忘特定事实

    发表
    被测模型
    Qwen2.5-1.5B-Instruct、Llama-3.2-1B-Instruct、Gemma-2-2B-it
    摘要SCALPEL 以对比稀疏特征做窄目标表征遗忘,在 TOFU 上与优化基线相当且可检查。

    SCALPEL 是不改基座权重的表征层遗忘方法,面向与保留数据重叠的窄目标。

    深度解读完整解读
  9. 可解释性arXiv 2609.11780

    用权重谱密度预测隐私泄露:WeightWatcher 谱指标可作为成员推理攻击脆弱性的代理

    检验权重谱度量能否代理成员推断泄漏

    发表
    被测模型
    MLP-1×4096、MLP-2×1024、MLP-2×2048 等 11 个
    摘要作者认为谱度量与泛化差距互补,有望用于无数据的模型级筛查。

    作者在 MLP 上检查 WeightWatcher 谱统计是否与 online LiRA 同向,以便不看数据、不训练 shadow 模型就做模型级成员风险筛查。放出前的审计要知道训练成员会不会被认出来。LiRA 依赖大量 shadow 模型,候选一多就难以逐个跑。

    深度解读完整解读
  10. 攻击arXiv 2609.09865

    CGMIA:用成员推理攻击检测代码生成基准的数据泄漏

    提出 CGMIA,检测代码生成基准样本是否泄漏进训练集

    发表
    攻击者
    灰盒
    被测模型
    Qwen2.5-Coder (3B)、CodeGemma (2B)、DeepSeek-Coder (1.3B) 等 5 个
    摘要CGMIA 融合相似度、通过率、困惑度与 CodeBERT,在模拟泄漏上优于八个 MIA 基线。

    CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。

    深度解读完整解读
  11. 攻击arXiv 2609.10611

    WPMIA:面向严格黑盒大模型的词级概率成员推断攻击

    提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员

    发表
    攻击者
    黑盒
    被测模型
    OPT-6.7B、Pythia-6.9B、LLaMA-13B 等 12 个
    摘要WPMIA 从续写估计词级似然并对比前缀,黑盒上多数优于所列基线。

    WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。

    深度解读完整解读
  12. 攻击arXiv 2609.05702

    量子原生访问下量子机器学习(QML)的隐私风险刻画

    证明量子原生访问会增强量子模型的成员推断优势

    发表
    被测模型
    4-qubit 24-parameter QNN(PennyLane 模拟,目标与影子模型同结构)
    摘要量子原生访问使 QNN 成员推断优势按 C⪯M⪯Q 增加,有限影子模型留下可上界的经验差距。

    作者研究 量子原生访问下 QNN 的成员推断:对手不再只拿到固定测量的经典比特。

    深度解读完整解读