评测与基准arXiv 2609.32547
研究者提出预算受限的 LLM 重复评测框架,优先深挖隐藏失败
提出预算化发现框架,优先深评更可能隐藏失败的安全提示词
- arXiv
- 2609.32547
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen 2.5 7B、Qwen/Qwen2.5-7B-Instruct-Turbo、Gemma 3n E4B 等 6 个
- 风险拒答失当
摘要浅层零失败的提示词仍可按潜在失败倾向排序,从而把有限深评预算投向更可能暴露隐藏失败之处。
作者把 LLM 可靠性评测写成预算约束下的隐藏失败发现:每条提示词有未知的逐次失败概率,浅层少量采样中的零失败并不等于该概率为零。