评测与基准arXiv 2608.09476
ActBench:面向协作智能体行为安全的自演化基准
提出自演化基准 ActBench,评测协作智能体的操作级行为安全
- arXiv
- 2608.09476
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- MiniMax-M3、MiniMax-M2.7、Claude-Opus-4.8 等 15 个
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
另有 643 篇论文还没打上分类标签,暂不在筛选结果里。
提出自演化基准 ActBench,评测协作智能体的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
提出 AHA 自动研究循环,发现生产 Agent 的漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。