风险行为arXiv 2605.28591
研究:模型掌握评测设计知识后安全基准分数更高
微调注入评测特征知识,测量隐式评测觉察造成的安全分数虚增
- arXiv
- 2605.28591
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 测试
- Llama 3.3 Nemotron Super 49B v1.5、Qwen3 32B、GLM 4.7 Flash 等 5 个
- 风险欺骗与谋划
摘要证实模型通过合成文档内化评测特征后可在无显式觉察下大幅提升安全评分。
这篇论文研究了大语言模型因学习评测设计元知识而诱发的隐式评估觉察及安全评分虚增现象。