其他arXiv 2609.10630
论文提出 AI 安全设计保障架构:结合 Scientist AI 模型级监督与系统级控制
提出结合模型级监督与系统级控制的智能体保障架构
- arXiv
- 2609.10630
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 风险Agent 危险操作
- 组件监控器
摘要作者梳理事件中的多层失效,主张监督模型、系统控制与证据治理并用。
Lu 与 Bengio 给出的是一套可逐层上移的保障架构和一组事件归类,不是已测量的防御系统。
提出结合模型级监督与系统级控制的智能体保障架构
Lu 与 Bengio 给出的是一套可逐层上移的保障架构和一组事件归类,不是已测量的防御系统。
主张开展嵌入式评估,审查内部智能体监控、权限与模型对齐
嵌入式评估是一种第三方评估:独立评估者在前沿 AI 开发者现场获得接近员工的系统、人员与文档访问,用来审查依赖内部系统与实践的风险。