防御arXiv 2609.05903
EvoSafeHarness:为 Agent 自动演化模型与领域专属安全护栏
为冻结模型与目标域自动搜索可部署的 Agent 安全 harness
- arXiv
- 2609.05903
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Sonnet 4.6、GLM-5、Kimi-K2.5 等 11 个
为冻结模型与目标域自动搜索可部署的 Agent 安全 harness
提出 Skill-as-API,隔离多智能体协作中的 skill 正文与系统提示词
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
训练自博弈红队智能体 GPT-Red,规模化生成提示注入与越狱攻击
提出 AHA 自动科研循环,发现生产 Agent 的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。