用时序逻辑监控工具 Agent:MonPoly 标出 71.8% STAC 攻击链,但溯源检查被一行注入骗过 94%–99%
在AgentDojo与STAC上离线重放时序验证,通用规约检出超70%攻击但良性触发率达29.3%,强化溯源可防历史投毒。
- 70.1%AgentDojo上GPT-4o无防御成功攻击的通用规约检出率(Table 1)
- 29.3%AgentDojo上GPT-4o良性运行的通用规约良性触发率(Table 1)
- 71.8%STAC基准全部483条攻击链隐匿最终步的规约检出率(Section 4.1)
研究工具调用智能体多步安全策略的形式化时序验证及现有基准支撑能力。
梳理了智能体护栏、攻击评测基准与时序验证工具,强调本文立足离线重放。
将轨迹映射为事件流并采用MFOTL与强化溯源机制进行离线验证。
通用规约检出超70%但误报近30%,参数化与强化溯源显著优化区分度。
作者指出了离线重放与语义盲区局限,度量时序仅在合成日志验证。
形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。