评测与基准arXiv 2610.07639
HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
- arXiv
- 2610.07639
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GLM-5.2、Qwen3.8-27B、Claude Opus 4.8 等 4 个
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出 CAVE-BENCH,评测智能体遭虚假指责后是否破坏已正确的工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。