防御arXiv 2609.38239
推理层安全:防御对抗性推理与基础设施滥用
用 SCM 合成会话并训练检测器识别推理层滥用
- arXiv
- 2609.38239
- 发表
- 场景
- 模型与 API
- 测试
- gradient-boosted detector (GBDT/XGBoost)
用 SCM 合成会话并训练检测器识别推理层滥用
提出 VERITAS,用双边背书剪除本地隐私图学习中的投毒节点
VERITAS 是面向本地差分隐私图学习的投毒防御协议,按 trust-but-verify 在保持 ϵ-LDP 的同时剪除伪造节点。