评测与基准arXiv 2609.27336
CART:面向大语言模型的闭环自适应红队框架
提出闭环自适应红队框架 CART,评测模型与工具 Agent 的风险面
- arXiv
- 2609.27336
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Opus 4.8、GPT-5.5、Grok 4.3 等 7 个
- 攻击越狱
摘要CART 把红队做成可审计的闭环搜索,在三类评测上比静态回放发现更多失败与更高平均风险。
CART 把自动红队从一次清单式打分,改成带预算、可追溯的闭环搜索。
提出闭环自适应红队框架 CART,评测模型与工具 Agent 的风险面
CART 把自动红队从一次清单式打分,改成带预算、可追溯的闭环搜索。
提出 JailbreakSkill,用可演化技能自动搜索并复用越狱提示