研究:模型掌握评测设计知识后安全基准分数更高
Models That Know How Evaluations Are Designed Score Safer
AI 导读
研究者用合成评测结构描述进行微调,研究模型对评测设计的元知识如何影响安全基准表现。Nemotron 49B 和 Qwen3 32B 在 AgentHarm 上的拒答率分别由 9.9% 和 8.0% 升至 31.0% 和 22.7%;剔除明确表达被测意识的输出后,差异仍然存在。作者提醒,这些结果尚不能区分安全基准分数虚高与模型真实对齐程度改善,仍需在部署分布中验证。
推荐理由
研究显示评测元知识会影响安全基准表现,提醒区分基准得分变化与真实部署安全性。