ActBench:面向协作智能体行为安全的自演化基准
作者构建ActBench评测智能体,固定Deepseek-v4-Pro时6个框架ASR在73.7%至94.4%之间。
- 10.1%OpenClaw框架下Claude-Opus-4.8的ASR(Table 2)
- 94.4%OpenClaw框架下Deepseek-v4-Pro的ASR(Table 2)
- 73.7%固定Deepseek-v4-Pro下QwenPaw的ASR(Table 3)
协同智能体现有安全评测局限于响应级拒答与孤立攻击面,缺乏对多步执行轨迹越权行为的动态优化与因果归因。
相关研究涵盖智能体安全基准、提示与记忆注入攻击以及安全检测审计,作者指出其缺乏全攻击面覆盖与因果验证。
通过执行空间建模与任务对匹配,结合奖励引导束搜索、失败反思机制与日志及轨迹双证据重构实现自演化评测。
在固定框架下ASR跨模型从10.1%到94.4%,而固定模型下各框架ASR均不低于73.7%,模型主导安全差异。
作者指出评估局限于固定阈值、单一验证器配置与非运行时防御评测,且反思因果增益缺乏平均定量消融。
ActBench通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。