防御arXiv 2609.38239
推理层安全:防御对抗性推理与基础设施滥用
用 SCM 合成会话并训练检测器识别推理层滥用
- arXiv
- 2609.38239
- 发表
- 场景
- 模型与 API
- 被测模型
- gradient-boosted detector (GBDT/XGBoost)
用 SCM 合成会话并训练检测器识别推理层滥用
定义工具调用 Agent 的持久计费状态,提出拒绝钱包攻击与防御
这篇工作把工具调用智能体里跨轮保留、并被提供商反复计费的外部工具返回定义为 persistent billable state,并把它的主机侧再次送入决定当作控制点。。
提出 SKILLBLOAT,改写技能文档放大编码 Agent token 消耗
提出针对 Agent 护栏的推理扩展拒绝服务攻击