Pheo 提出 OATS:用确定性解析器在运行时治理 Agent 技能动作
研究发现ClawHub有705个全clean技能含违规指令,实测34.7%命令后果类文档未记载,OATS拦截了全部违规尝试。
- 705ClawHub四项扫描全clean但指示禁止操作的技能数(Table 2)
- 92.0%人工抽检100个违规检出技能的Precision(95% CI [84.8%, 96.5%],§4)
- 34.7%Claude Sonnet 5实测中后果类未在文档出现的命令占比(Table 3)
发布时恶意检测无法替代运行时动作许可控制,且文档静态分析无法约束智能体动态重构生成的实际执行操作。
相关研究涵盖注册表扫描与供应链攻击、运行时LLM防护栏、系统引用监视器与轨迹保证,论文定位在动作级轻量拦截。
设计确定性解析器映射命令后果类别,结合分车道信任账本与风险容忍度推导晋升阈值,在工具调用前无模型介入地判定操作。
在6.6万技能库及实机智能体中,测出705个clean技能含违规指令,智能体34.7%命令后果脱离文档,OATS拦截了全部违规动作。
作者指出了非动作型危害盲区、单命令语法规避与依赖自审计等局限,实验也主要集中于单模型单日及单一注册表快照。
论文论证了发布时恶意扫描无法替代运行时动作许可控制,提出了轻量确定性控制门OATS,展示了双层防御组合的必要性。