跳到正文
原文
Anthropic Alignment Science·本站收录 · 原文发表 精选关注度49

Anthropic 用真实部署资源提升编码审计真实性

Measuring and improving coding audit realism with deployment resources

AI 导读

Anthropic 对齐科学团队提出 realism win rate 指标,用 LLM 裁判在成对比较中判断审计记录与真实部署记录哪个更真实,以此衡量自动化审计的真实性。研究为 Petri 审计智能体提供真实的 system prompt、工具定义和代码库资源,在 5 个奖励作弊审计场景中把平均真实度胜率从 4.6% 提升到 32.8%,且未显著改变奖励作弊率。在良性编码任务上资源同样稳定提升真实性,但在涉及关停抵抗的高风险场景中,改写种子指令比提供资源更能提升真实性,说明任务本身而非环境是主要瓶颈。该功能已上线 Petri。

推荐理由

提出用真实部署资源提升审计真实性的可复现方法,并给出奖励作弊审计中真实度胜率从 4.6% 升至 32.8% 的量化结果。

阅读原文alignment.anthropic.com