跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.09647· Divyanshu Kumar·· 23 天前

研究者提出面向 Agentic AI 的黑盒红队分类框架,自动生成对抗场景

Black-Box Red Teaming of Agentic AI: A Taxonomy-Driven Framework for Automated Risk Discovery

AI 导读

研究者提出一套面向 Agentic AI 的黑盒红队框架,只需基本系统描述即可开展风险感知评估。框架包含三部分:将可观察行为映射到风险类别的七域分类法、全自动 SAGE-RT 红队流程(每个域生成 120 个对抗场景),以及由 LLM 评判并人工验证的评估。在 CrewAI 和 AutoGen 两种 Agent 架构、四种基础模型上的验证显示,平均治理风险为 56.25%,多智能体配置中的隐私风险为 65%,Agent 行为漏洞最高达 85%。作者称该方法无需特权访问即可识别关键架构漏洞。

阅读原文arxiv.org