防御arXiv 2608.30041
SkillGuard:面向间接提示注入的 LLM Agent 能力限制机制
提出 SkillGuard,用可达性切断污染后通往禁止状态的技能调用
- arXiv
- 2608.30041
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Llama3.3-70B、Gemini 2.5 Flash
提出 SkillGuard,用可达性切断污染后通往禁止状态的技能调用
提出 VAC,用真实操作参数与来源隔离保护智能体浏览器确认
提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入
证明保留词元表示放大模板注入并验证分词缓解
摘要对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。