防御arXiv 2610.02432
论文提出 LLM 输入扰动鲁棒性度量,并发布 ASA 攻击与 AttestMCP 防护
提出 ASA 与 AttestMCP,度量并降低 LLM 对输入序列扰动的敏感
- arXiv
- 2610.02432
- 发表
- 层
- 应用层
- 攻击者
- 黑盒
- 被测模型
- Gemma-3-27B-Instruct、Gemma-3-4B-Instruct、Llama-3.2-3B-Instruct 等 12 个
提出 ASA 与 AttestMCP,度量并降低 LLM 对输入序列扰动的敏感
提出状态控制攻击 DART 与预执行防御 SAGE,拦截工具 Agent 的有害状态转移
摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。
提出 Skilder,用角色技能包和 MCP 路由硬拦截越权工具调用
Skilder 把企业工具型智能体的能力按角色打包,经一个 MCP 服务器做渐进发现,使工具范围由服务器而不是提示词来执行。
构建 APort Vault 基准,对比支付智能体模型拒答与确定性授权
提出 FlowSeal,在工具边界用信息流控制阻断 Agent 隐私泄露
摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御 FLOWSEAL 并验证有效性。
提出 EvoSafeHarness,为冻结模型与目标域自动搜索安全 harness
提出 CAVA,将异构智能体运行时事件规范为可哈希动作并绑定审批与回执
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。