跳到正文
原文
arXiv:Agent 与 MCP 安全· arXiv:2609.21088· Yuxuan Zhang·· 14 天前

Provenance-Aware Transformers:用来源感知架构分离可信边界以防御间接提示注入

Origin Is All You Need: Provenance-Aware Transformers for Structural Trust-Boundary Separation

AI 导读

论文提出 Provenance-Aware Transformers,一种让应用提供的来源标签在模型内部生效的防御方法,用于应对大语言模型的间接提示注入问题。作者指出标准 Transformer 缺乏来源权威性的架构概念,检索文档、用户输入与系统指令都经过同一套注意力机制处理,模型只能从措辞推断该服从什么、该把什么当作数据。该方法为每个输入 token 分配编码其来源的 ring ID,并加入 origin embedding、可学习的 origin attention bias 和可学习的 origin scale,以在归一化过程中保留来源信息,从而在生成时对权威与非权威来源施加结构性边界。

阅读原文arxiv.org