评测与基准arXiv 2609.28335
研究者发布面向 EU AI Act 行为准则的系统性风险指数与仪表盘
构建 Systemic Risk Index 流水线,把公开基准映到四类系统风险并评测
- arXiv
- 2609.28335
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 测试
- Gemini 3.6 Flash、Gemma 4 31B、Claude Sonnet 5 等 15 个
- 风险危险能力
构建 Systemic Risk Index 流水线,把公开基准映到四类系统风险并评测
提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。