AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击
AgentSpy 在微虚拟机中监控智能体系统调用与流量,在通过测试的任务中发现 18.2% 存在无关活动。
- 92.2%同任务重复运行集合相似度高于混入异任务集合的比例(全部 3 个模型,RQ1)
- 18.2%通过全部测试的任务中被判定存在与任务无关活动的比例(RQ2,Table 3)
- 17.0%通过全部测试的任务中被判定未遵循技能指导达成结果的比例(RQ2,Table 3)
智能体轨迹记录不完整且缺乏底层可见性,提出系统级外部监控框架以分析行为合规与安全。
梳理了轨迹分析、系统级可观测性以及技能安全检查,定位为免 LLM 介入的系统级运行时分析。
利用 Firecracker 微虚拟机记录系统调用,构建资源星型图与确定性安全规则进行离线分析。
在 77 个任务及 5 类注入攻击上验证,发现 18.2% 全通任务有无关行为,安全检测精确率 1.00。
作者指出了高频调用排除、规则偏通用及框架模型数量有限等局限;实验未覆盖其他执行框架。
提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。