跳到正文
原文
Redwood Research· Ryan Greenblatt·· 21 天前

Redwood Research 提议追踪架构对思维链可监控性的影响

Proposal for tracking the effects of architecture on monitorability

AI 导读

Redwood Research 提议 AI 公司定期披露并接受第三方核验其架构在多大程度上支持潜在推理或智能体间潜在通信,并以"不透明串行深度"作为最小侵入的代理指标。报告应覆盖所有能力不低于六个月前最佳公开模型的近前沿模型,包括纯内部研发原型,第三方可通过员工访谈与举报渠道核验,无需直接查看架构。公司还应每 6 个月公开可监控性压力测试结果、发布相关架构政策,并说明性能与可监控性之间的权衡。

阅读原文blog.redwoodresearch.org