跳到正文
10月8日 · 周四

供应链安全 · 论文

精选论文 21 篇
  1. 防御arXiv:2609.12001 · 57

    Pheo 提出 OATS:用确定性解析器在运行时治理 Agent 技能动作

    研究发现ClawHub有705个全clean技能含违规指令,实测34.7%命令后果类文档未记载,OATS拦截了全部违规尝试。

    • 705ClawHub四项扫描全clean但指示禁止操作的技能数(Table 2)
    • 92.0%人工抽检100个违规检出技能的Precision(95% CI [84.8%, 96.5%],§4)
    • 34.7%Claude Sonnet 5实测中后果类未在文档出现的命令占比(Table 3)
    6 问速览发布时恶意检测无法替代运行时动作许可控制,且文档静态分析无法约束智能体动态重构生成的实际执行操作。
    1. 这篇论文试图解决什么问题?

      发布时恶意检测无法替代运行时动作许可控制,且文档静态分析无法约束智能体动态重构生成的实际执行操作。

    2. 有哪些相关研究?

      相关研究涵盖注册表扫描与供应链攻击、运行时LLM防护栏、系统引用监视器与轨迹保证,论文定位在动作级轻量拦截。

    3. 论文如何解决这个问题?

      设计确定性解析器映射命令后果类别,结合分车道信任账本与风险容忍度推导晋升阈值,在工具调用前无模型介入地判定操作。

    4. 论文做了哪些实验?

      在6.6万技能库及实机智能体中,测出705个clean技能含违规指令,智能体34.7%命令后果脱离文档,OATS拦截了全部违规动作。

    5. 有什么可以进一步探索的点?

      作者指出了非动作型危害盲区、单命令语法规避与依赖自审计等局限,实验也主要集中于单模型单日及单一注册表快照。

    6. 总结一下论文的主要内容

      论文论证了发布时恶意扫描无法替代运行时动作许可控制,提出了轻量确定性控制门OATS,展示了双层防御组合的必要性。

    完整解读
已经到底了