跳到正文
原文
论文追踪· arXiv:2606.29887· Jiacheng Zhang, Haoyu He, Sen Zhang et al.·本站收录 · 原文发表

SafePyramid:面向上下文内策略护栏的分层安全基准

SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing

AI 导读

研究者提出 SafePyramid,一个用于评测上下文内策略护栏(in-context policy guardrailing)的安全基准,包含 10 个领域的 1000 段多轮对话和 3000 条应用专属策略,共 61699 条自然语言规则。基准分三级难度:L0 评测单条规则理解,L1 评测规则依赖关系推理,L2 评测对上下文中全新策略框架的适应。研究团队用多阶段流程构建并验证该基准,并评测了 10 个前沿 LLM 和 5 个可配置策略的护栏,发现上下文内策略护栏仍极具挑战:表现最好的 GPT-5.5 在 L0、L1、L2 上完整识别全部被违反规则的比例仅为 54.0%、35.3% 和 12.9%。

阅读原文arxiv.org