两阶段智能体轨迹审计框架:用门控规则加 LLM 审计降低监控成本
两阶段智能体轨迹审计
AI 导读
研究者提出两阶段智能体轨迹审计框架,第一阶段用单事件与轨迹序列规则筛选待检动作,第二阶段由 LLM 审计智能体结合前序轨迹在执行前审查每个被选动作,并用训练数据联合优化门控规则与审计指令。在公开基准 OpenAgentSafety 上,该框架将每次运行的 LLM 审计次数从 8.15 降至 2.33、token 用量从 47.8k 降至 14.6k,检测率为 72.8%,而全量审计为 81.5%。在两个模拟多智能体案例中,框架标记出全部恶意轨迹,同时将审计 token 用量减少超过 80%。