跳到正文
10月8日 · 周四

红队 · 论文

精选论文 54 篇
  1. 分析/可解释性arXiv:2610.06001 · 57

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    AgentSpy 在微虚拟机中监控智能体系统调用与流量,在通过测试的任务中发现 18.2% 存在无关活动。

    • 92.2%同任务重复运行集合相似度高于混入异任务集合的比例(全部 3 个模型,RQ1)
    • 18.2%通过全部测试的任务中被判定存在与任务无关活动的比例(RQ2,Table 3)
    • 17.0%通过全部测试的任务中被判定未遵循技能指导达成结果的比例(RQ2,Table 3)
    6 问速览智能体轨迹记录不完整且缺乏底层可见性,提出系统级外部监控框架以分析行为合规与安全。
    1. 这篇论文试图解决什么问题?

      智能体轨迹记录不完整且缺乏底层可见性,提出系统级外部监控框架以分析行为合规与安全。

    2. 有哪些相关研究?

      梳理了轨迹分析、系统级可观测性以及技能安全检查,定位为免 LLM 介入的系统级运行时分析。

    3. 论文如何解决这个问题?

      利用 Firecracker 微虚拟机记录系统调用,构建资源星型图与确定性安全规则进行离线分析。

    4. 论文做了哪些实验?

      在 77 个任务及 5 类注入攻击上验证,发现 18.2% 全通任务有无关行为,安全检测精确率 1.00。

    5. 有什么可以进一步探索的点?

      作者指出了高频调用排除、规则偏通用及框架模型数量有限等局限;实验未覆盖其他执行框架。

    6. 总结一下论文的主要内容

      提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    完整解读
已经到底了