跳到正文
原文
arXiv:危险能力与安全评测· arXiv:2609.26419· Grant Molnar·· 9 天前

AI 控制中的可靠性理论:以 Google DeepMind 防失控部署为例

Reliability Theory for AI Control

AI 导读

可靠性理论的正式工具尚未在前沿 AI 控制中成为标准,研究者将其应用于 Google DeepMind 针对失控部署的防御。同一控制栈的罕见失效抑制能力可呈三次、二次或线性,取决于其失效域划分;Birnbaum 重要性可识别哪些组件改进对名义可靠性收益最大,而预防则改变需要恢复的对象群体。这些结果给出了该分离、改进、测量和测试什么的具体指引。

阅读原文arxiv.org