TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击
提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员
另有 112 篇论文还没打上分类标签,暂不在筛选结果里。
提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员
提出校准重合成认证,仅当已知生成器都不能保真重构时签发真实图像证书
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
揭示拆分训练返回梯度以零支撑暴露诱饵行并泄露训练内容
这是一项关于双节点大语言模型拆分训练系统的系统安全案例研究,揭示了评估工具遗漏反向信道所导致的静默隐私失效。
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
提出功能标准判断模型权重是否构成作品副本
Lemley 与 Cooper 认为,生成式模型的权重是否构成受保护作品的版权法“副本”,取决于该作品能否被直接了当地从输出中提取。。
提出匹配比较校准,界定生成训练序列何时算可抽取记忆
Cooper 等人从第一性原理重写 extractable memorization:生成训练文本只有在概率高过匹配非训练文本的可预测性基线时,才支持记忆声称。
比较高效与高成本训练的对抗和隐私脆弱性并分析损失几何
作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。比较在任务效用接近的前提下进行。视觉侧用 KNN-Shapley 的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练。
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
完整解读提出时间步感知目标条件化,改善差分隐私能源时序插补效用
作者研究固定阈值 DP-SGD 训练的扩散模型,如何在余弦调度的后期低 SNR 时间步避免 ε-prediction 产生易被裁剪的大梯度,从而做能源时序缺失值恢复。
提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据
提出主题锚点投毒,放大众包微调后的专有指令提取