评测与基准arXiv 2609.28335·9月24日研究者发布面向 EU AI Act 行为准则的系统性风险指数与仪表盘构建 Systemic Risk Index 流水线,把公开基准映到四类系统风险并评测arXiv2609.28335发表9月24日层模型层场景AI Agent测试Claude Sonnet 5、Claude Haiku 4.5、GPT-5.6 Luna Pro 等 15 个风险危险能力+1+1深度解读完整解读