评测与基准arXiv:2609.32547 · 9月26日研究者提出预算受限的 LLM 重复评测框架,优先深挖隐藏失败提出预算化发现框架,优先深评更可能隐藏失败的安全提示词模型与 API·测试Qwen 2.5 7B、Qwen/Qwen2.5-7B-Instruct-Turbo、Gemma 3n E4B 等 6 个·模型层拒答失当摘要浅层零失败的提示词仍可按潜在失败倾向排序,从而把有限深评预算投向更可能暴露隐藏失败之处。作者把 LLM 可靠性评测写成预算约束下的隐藏失败发现:每条提示词有未知的逐次失败概率,浅层少量采样中的零失败并不等于该概率为零。完整解读