防御arXiv 2609.38239
推理层安全:防御对抗性推理与基础设施滥用
用 SCM 合成会话并训练检测器识别推理层滥用
- arXiv
- 2609.38239
- 发表
- 场景
- 模型与 API
- 被测模型
- gradient-boosted detector (GBDT/XGBoost)
用 SCM 合成会话并训练检测器识别推理层滥用
定义工具调用 Agent 的持久计费状态,提出拒绝钱包攻击与防御
这篇工作把工具调用智能体里跨轮保留、并被提供商反复计费的外部工具返回定义为 persistent billable state,并把它的主机侧再次送入决定当作控制点。。
提出 SKILLBLOAT,改写技能文档放大编码 Agent token 消耗
提出 RolePlay 框架,用人设条件放大 LLM 单次推理开销
提出针对 Agent 护栏的推理扩展拒绝服务攻击
提出层级遗传算法 HGA,扰动题目逻辑结构诱发推理模型过度思考
摘要HGA 在黑盒推理模型上用逻辑扰动拉长输出,作者称可从小代理迁移,查询成本是其局限。