分析与理论arXiv 2609.36477
研究发现护栏模型在基座模型不确定处过度自信
诊断护栏相对基座在对抗提示上的置信失校
- arXiv
- 2609.36477
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Mistral 7B、Llama-Guard 7B、Llama-Guard-2 8B 等 10 个
摘要对抗包装使 guard 高置信漏检,而对应 base 在同一输入上常更不确定。
诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。