SafePyramid:面向上下文内策略护栏的分层安全基准
SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing
AI 导读
研究者提出 SafePyramid,一个用于评测上下文内策略护栏(in-context policy guardrailing)的安全基准,包含 10 个领域的 1000 段多轮对话和 3000 条应用专属策略,共 61699 条自然语言规则。基准分三级难度:L0 评测单条规则理解,L1 评测规则依赖关系推理,L2 评测对上下文中全新策略框架的适应。研究团队用多阶段流程构建并验证该基准,并评测了 10 个前沿 LLM 和 5 个可配置策略的护栏,发现上下文内策略护栏仍极具挑战:表现最好的 GPT-5.5 在 L0、L1、L2 上完整识别全部被违反规则的比例仅为 54.0%、35.3% 和 12.9%。