评测与基准arXiv 2608.09476
ActBench:面向协作智能体行为安全的自演化基准
提出自演化基准 ActBench,评测协作智能体的操作级行为安全
- arXiv
- 2608.09476
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude-Opus-4.8、Claude-Sonnet-4.6、GPT-5.5 等 15 个
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
提出自演化基准 ActBench,评测协作智能体的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
提出 MMSkillRisk 与 NCVA,评测技能图像隐藏指令诱导的未授权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。