防御arXiv 2610.04504
论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证
提出 VAL 框架并用确认门与参数沙箱约束高风险工具调用
- arXiv
- 2610.04504
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- DeepSeek-chat、Meta Llama 3.1 8B、Kimi
提出 VAL 框架并用确认门与参数沙箱约束高风险工具调用
提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出 SCOPE 联合后训练计算机使用智能体的任务执行与安全决策
提出 SkillSecurer,检测定位并修补智能体技能中的提示注入
提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。