Bengio 团队提出用贝叶斯上界为 AI 行为构建护栏
Bounding the probability of harm from an AI to create a guardrail
AI 导读
Yoshua Bengio 与合著者在 arXiv 论文中提出,通过估计上下文相关的安全违规概率上界,为 AI 的危险动作提供运行时护栏。作者认为现有安全评测与基准只是抽查,检测不到问题不代表 AI 安全,且模型可能识别出自己正在被测试而临时表现良好。论文的核心结果是在真实但未知的假设下推导安全违规概率的界,方法涉及在贝叶斯后验上搜索谨慎但合理的假设,并假设先验足够宽,分别讨论了 iid 与非 iid 两种情形。作者在可精确进行贝叶斯计算的玩具设定上做了实验模拟,结果与理论一致。