跳到正文
10月8日 · 周四

隐私与数据泄露 · 论文

找到 4 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 112 篇还没打标签,不在筛选结果里。

另有 77 篇还没有研究类型,暂不在这些分类里。

  1. 分析与理论arXiv:2607.12649 ·

    研究者提出可提取记忆的匹配比较检验方法

    提出匹配比较校准,界定生成训练序列何时算可抽取记忆

    模型与 API测试OLMo 2 32B base、OLMo 2 32B Instruct、OLMo 2 7B 等 7 个模型层
    摘要匹配非成员校准阈值后,短序列抽取含大量假阳性,极低概率过阈值也不等于可抽取。

    Cooper 等人从第一性原理重写 extractable memorization:生成训练文本只有在概率高过匹配非训练文本的可预测性基线时,才支持记忆声称。

    完整解读
  2. 分析与理论arXiv:2609.33898 ·

    研究揭示训练效率与模型脆弱性的权衡:高效训练更易受对抗与隐私攻击

    比较高效与高成本训练的对抗和隐私脆弱性并分析损失几何

    模型与 API测试ResNet-18、Swin Transformer、Qwen2.5-Math-7B-Instruct 等 7 个训练与数据层
    摘要效用匹配下,三种高效训练都伴随更高的隐私与对抗脆弱性及更尖的损失几何。

    作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。比较在任务效用接近的前提下进行。视觉侧用 KNN-Shapley 的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练。

    完整解读
  3. 分析/可解释性arXiv:2609.11780 ·

    用权重谱密度预测隐私泄露:WeightWatcher 谱指标可作为成员推理攻击脆弱性的代理

    AI 导读研究发现,来自重尾自正则化框架的 WeightWatcher 谱指标可替代昂贵的影子模型,用于评估机器学习模型的成员推理攻击(MIA)风险。

    测试MLP-1×4096、MLP-2×1024、MLP-2×2048 等 11 个
    摘要作者认为谱度量与泛化差距互补,有望用于无数据的模型级筛查。

    作者在 MLP 上检查 WeightWatcher 谱统计是否与 online LiRA 同向,以便不看数据、不训练 shadow 模型就做模型级成员风险筛查。放出前的审计要知道训练成员会不会被认出来。LiRA 依赖大量 shadow 模型,候选一多就难以逐个跑。

    完整解读
  4. 分析/可解释性arXiv:2609.33909 ·

    近重复家族干扰精确记录成员推断

    作者用四世界审计发现,近重复族会让精确记录成员推断把族级暴露误判为该记录入训。

    测试Pythia-2.8B、GPT-2、Qwen3.5-2B 等 5 个
    摘要近重复使干净参照 MI 把族级暴露当成精确记录。

    作者研究成员推断能否作为精确记录的数据来源证据。版权和来源审计需要的是该记录本身是否入训,而网页语料中的转载、镜像和轻改会让非同一近重复产生成员样分数。四世界审计用 E 表示精确记录是否入训、用 F 表示其近重复族是否在场,从而分开 H00 到 H10 的标准 MI、H00 到 H01 的族偏移,以及 H01 到 H11 的 exact-given-family。

    完整解读
已经到底了