防御arXiv 2609.38239
推理层安全:防御对抗性推理与基础设施滥用
用 SCM 合成会话并训练检测器识别推理层滥用
- arXiv
- 2609.38239
- 发表
- 场景
- 模型与 API
- 测试
- gradient-boosted detector (GBDT/XGBoost)
用 SCM 合成会话并训练检测器识别推理层滥用
部署蜜罐测量针对暴露 LLM 基础设施的攻击
提出主题锚点投毒,放大众包微调后的专有指令提取
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。