跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.02127· Jun He·· 2026-09-02

论文提出带类型溯源与断言护栏,防止持久化 AI Agent 把不可信输入当作自身历史

Stored Is Not Supported: Typed Provenance and Assertion Guardrails for Persistent AI Agents

AI 导读

论文针对持久化 AI Agent 提出带类型溯源与断言护栏,要求关于 Agent、用户或具名关系的陈述满足已接受证据、时效性和披露策略。方法用带类型溯源图区分来源、依赖谱系、认知角色、有效性和披露范围,由 resolver 评估授权状态投影并返回证据状态、冲突、过期和保留标志,再由 generate-verify-revise 中介在发布前检查候选语义单元。在 24 个手工编写的一致性用例中,带类型中介未放行 19 个不安全机会中的任何一个,同时保留全部 5 个受支持控制;扁平/先验规则和来源标签规则分别放行了 19/19 和 18/19 的不安全候选。

阅读原文arxiv.org