防御arXiv 2608.27348
INTENT-AS-A-TOOL:用意图工具追踪智能体失准
提出 INTENT-AS-A-TOOL 跟踪并干预智能体失准
- arXiv
- 2608.27348
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Gemma-4-31B-IT、Qwen3.5-27B、Qwen3-235B-A22B 等 5 个
摘要用意图工具的下一动作概率跟踪推理中的失准承诺,并在其成为首选时插入反思。
Zhang 等人研究推理型语言模型在职场邮件沙箱里如何走向智能体失准,并提出用动作偏好而不是事后文本标签来跟踪承诺。问题是:有害执行往往出现在推理已经形成意图之后,但 CoT 监控是事后、粗粒度、依赖外部评审的,也看不到模型倾向调用哪个动作。