防御arXiv 2608.30041
SkillGuard:面向间接提示注入的 LLM Agent 能力限制机制
提出 SkillGuard,用可达性切断污染后通往禁止状态的技能调用
- arXiv
- 2608.30041
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Gemini 2.5 Flash、Llama3.3-70B
提出 SkillGuard,用可达性切断污染后通往禁止状态的技能调用
提出卡点评测框架,以实参级谓词审计间接提示注入评测的测量偏差
摘要论文揭示了 IPI 评测中导致指标虚高的系统性缺陷,通过构建有效评测框架纠正了多项安全与模型能力结论。