评测与基准arXiv 2610.07639·10月6日HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制评测编码智能体 harness 安全机制在对抗任务中的防护效果arXiv2610.07639发表10月6日层应用层场景coding agent攻击提示注入组件权限与沙箱深度解读完整解读
评测与基准arXiv 2608.09476·8月10日ActBench:面向协作智能体行为安全的自演化基准构建自演化基准 ActBench,评测协作智能体的行为安全arXiv2608.09476发表8月10日层应用层场景AI Agent被测模型Claude-Opus-4.8、Claude-Sonnet-4.6、GPT-5.5 等 15 个攻击提示注入组件权限与沙箱+2+2摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。深度解读完整解读