研究者提出理解审计机制,以缓解自动化 AI 研究带来的风险
研究者提出理解审计(comprehension audits)这一开发流程保障机制,要求负责研发的人员向审计员解释其研发贡献以证明其理解程度,审计独立开展并出具分级报告,未通过则暂停该贡献的开发直至整改,重复失败将面临升级后果。作者指出,前沿 AI 实验室的代码已大部分由 AI 编写,若人类监督不足会带来安全风险,而现有工作提出的最低理解阈值与无辅助检查尚不足以构成保障。对领先开源 AI 项目的分析显示,代码产出增加的同时每行代码的人工评审评论率下降,自动化账号的评审率更低。作者主张实验室应配备嵌入式独立审计员来实施该机制。