跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.03434· Bijeeta Pal, Sridhar Reddy Maddireddy, Muhaimin Bin Munir, Zoltan Puha, Max Zhurovich, Adi Raghavendra, Sean Tout·本站收录 · 原文发表

Persona Guardrail:面向智能体系统的生产级防御框架

Persona Guardrail: A Production-Grade Defense Framework for Agentic Systems

AI 导读

作者提出 Persona Guardrail,通过基于智能体预定功能的输入输出校验限定其行为范围。摘要报告,在 PAGE 评测中,相较通用 LLM 护栏,整体准确率、域外检测率和误放行率均有改善。作者称该框架已用于生产部署并满足延迟预算;这些是论文摘要中的自报结果,本条没有独立复现,不能推及未测场景或普遍安全保证。

阅读原文arxiv.org