跳到正文
原文
论文追踪· arXiv:2605.28591·本站收录 · 原文发表 精选关注度31

研究:模型掌握评测设计知识后安全基准分数更高

Models That Know How Evaluations Are Designed Score Safer

AI 导读

研究者用合成评测结构描述进行微调,研究模型对评测设计的元知识如何影响安全基准表现。Nemotron 49B 和 Qwen3 32B 在 AgentHarm 上的拒答率分别由 9.9% 和 8.0% 升至 31.0% 和 22.7%;剔除明确表达被测意识的输出后,差异仍然存在。作者提醒,这些结果尚不能区分安全基准分数虚高与模型真实对齐程度改善,仍需在部署分布中验证。

深度解读生成中

推荐理由

研究显示评测元知识会影响安全基准表现,提醒区分基准得分变化与真实部署安全性。

阅读原文arxiv.org