防御arXiv 2608.29030
研究者提出自蒸馏方法让 LLM 遵循上下文水印指令
提出 SDLP 与 GRPO,训练模型遵循上下文水印指令
- arXiv
- 2608.29030
- 发表
- 场景
- 模型与 API
- 测试
- GPT-5.4、GPT-5.4-mini、GPT-5.4-nano 等 14 个
提出 SDLP 与 GRPO,训练模型遵循上下文水印指令
比较高效与高成本训练的对抗和隐私脆弱性并分析损失几何
作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。比较在任务效用接近的前提下进行。视觉侧用 KNN-Shapley 的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练。
提出 BoundStyle 与 StyleAT,对抗训练防御人脸识别语义攻击
StyleAT 用可调的 StyleGAN3 潜空间攻击 BoundStyle 对人脸识别做对抗训练,以抵抗一般语义编辑,并在评测中面对训练时未见的 DiffPrivate。
提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复
Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。