HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制
在GLM-5.2与6款harness上,开启auto-approve使总体ASR从29.2%升至95.6%。
- 95.6%GLM-5.2在AA评测中开启auto-approve时的总体ASR(Table 6)
- 29.2%GLM-5.2在AA评测中关闭auto-approve时的总体ASR(Table 6)
- 0.8%GLM-5.2在NI评测中开启网络隔离时的总体ASR(Table 6)
代码智能体harness的安全机制实现现状与运行时防护效果缺乏系统评估,论文提出了十机制分类法与基准测试HSB。
既有研究涵盖harness分类、生命周期安全审计与特定载荷注入基准,但缺乏对原生机制ON/OFF状态的双重判定隔离评估。
建立十机制分类与五方独立审计矩阵,并通过Docker环境注入五类攻击面,以双重预言机量化ON/OFF状态差异。
在GLM-5.2下开展2500次试验,发现机制防护效果与效用代价分化明显,部分机制存在解释器绕过路径。
作者指出基准受限于单模型评测、仿真环境保真度及闭源工具缺失,实验覆盖6款开源harness与23个任务。
系统审计40款harness并实证评测9类安全机制,量化了自动审批的暴露风险、强隔离的效用代价以及替代执行路径绕过。