论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证
提出 VAL 框架,并用确认门与参数沙箱约束智能体高风险工具调用
- arXiv
- 2610.04504
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- DeepSeek-chat、Meta Llama 3.1 8B、Kimi
提出 VAL 框架,并用确认门与参数沙箱约束智能体高风险工具调用
提出工具型 Agent 的自适应攻击 DART 与预执行防御 SAGE
摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。
提出残余权限重放攻击,跨任务复用长期 Agent 的历史授权绕过确认
测试编程智能体被诱导或自主篡改自身执行轨迹的行为
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 Skilder,按角色渐进下发企业工具并确定性拦截越权调用
Skilder 把企业工具型智能体的能力按角色打包,经一个 MCP 服务器做渐进发现,使工具范围由服务器而不是提示词来执行。
提出 APEXA,在工具层拒绝无执行支撑的结果并拦截电机命令
APEXA 是先进光子源上的数据还原框架,用工具层代码约束语言模型智能体的工具调用。
提出企业 MCP 零信任授权与发现扩展,在架构上拒绝提示注入下的越权调用
作者把零信任放在 MCP 工具调用边界:智能体即使被提示注入,也不能调用其凭证范围之外的工具。问题来自三点部署性质。调用意图会随不可信上下文改变。
构建 APort Vault 基准,对比支付智能体模型拒答与确定性授权
提出 FLOWSEAL,用工具级信息流控制阻断智能体隐私泄露
摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御 FLOWSEAL 并验证有效性。
为冻结模型与目标域自动搜索可部署的 Agent 安全 harness
提出利用检查点回滚破坏 Agent 执行连续性的攻击
摘要论文系统研究了智能体 C/R 的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。
提出 AgentKernel,用四支柱强制中介 Agent 的输入、工具与记忆
AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。
提出 PACE,用策略认证与签名决策记录拦截 DeFi 智能体违规交易