跳到正文
原文
OpenAI Alignment Research·本站收录 · 原文发表 精选关注度49

OpenAI 发布 LASER:用递归采样筛选安全评测对话

Meet LASER: Recursive sampling for safer conversations

AI 导读

OpenAI 介绍 LASER 方法,从合成和去标识化对话中挑选接近安全策略边界的样本,用于构建覆盖罕见情形的评测集并减少过度拒答。作者称该方法所需标注算力显著低于随机抽样。这一效率结果本身不等于模型已变得更安全。

推荐理由

OpenAI 公开了 LASER 采样管线的完整设计,包括逻辑回归采样、多样性选择与隐私约束,可供构建安全评测集的团队参考。

阅读原文alignment.openai.com