防御arXiv:2610.05870 · 10月5日MBZUAI 提出可校准的真实图像认证方法提出校准重合成认证,仅当已知生成器都不能保真重构时签发真实图像证书模型与 API攻击者白盒·测试SD2.1、SD3、SD3.5 等 10 个·模型层检测与过滤检测规避图像生成摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。完整解读
攻击arXiv:2610.01365 · 10月1日ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联模型与 API攻击者白盒灰盒·测试GPT-2 Small、GPT-2 Medium、GPT-2 Large 等 6 个·训练与数据层提取与窃取微调与开源权重摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。完整解读
攻击arXiv:2609.04382 · 9月4日研究揭示 split-LLM 训练中返回梯度泄露真实行,前向隐私门仍通过揭示拆分训练返回梯度以零支撑暴露诱饵行并泄露训练内容模型与 API攻击者白盒·测试Qwen3-0.6B、35B-A3B·训练与数据层提取与窃取摘要论文揭示拆分训练中反向梯度零支撑完全暴露诱饵行,联合视图突破门控,裁剪加噪可有效缓解。这是一项关于双节点大语言模型拆分训练系统的系统安全案例研究,揭示了评估工具遗漏反向信道所导致的静默隐私失效。完整解读