评测与基准arXiv 2609.28335
研究者发布面向 EU AI Act 行为准则的系统性风险指数与仪表盘
构建 Systemic Risk Index 流水线,把公开基准映到四类系统风险并评测
- arXiv
- 2609.28335
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 测试
- Claude Sonnet 5、Claude Haiku 4.5、GPT-5.6 Luna Pro 等 15 个
- 风险危险能力
构建 Systemic Risk Index 流水线,把公开基准映到四类系统风险并评测
提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力