防御arXiv 2609.33039
TACIT:从 LLM 内部状态检测 Agent 轨迹危害
提出 TACIT,读取冻结隐藏状态以检测智能体有害轨迹
- arXiv
- 2609.33039
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- AgentDoG-4B、Qwen3Guard-4B、LlamaGuard3-8B 等 9 个
- 防御检测与过滤
- 攻击提示注入
- 风险Agent 危险操作
- 组件护栏与评审
摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。