用时序逻辑监控工具 Agent
提出 MFOTL 时序监控,用 MonPoly 检出工具 Agent 的危险动作链
- arXiv
- 2610.09793
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
另有 444 篇论文还没打上分类标签,暂不在筛选结果里。
提出 MFOTL 时序监控,用 MonPoly 检出工具 Agent 的危险动作链
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
提出 APEX,在执行边界用预编译授权契约防御 Agent 间接提示注入
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出依赖引导回滚修复,纠正记忆增强 Agent 消费故障记忆后的回答与状态
提出 CAVA,将异构智能体动作规范为可哈希指纹并绑定审批回执
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
提出 Mind2Web-Injection,评测网页 Agent 截图护栏的证据对齐
Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。
提出 FlowReview,用对象解析与确定性提交门控制多智能体组合信息流
这篇工作把多智能体安全写成一件必须同时成立的事:拦住组合信息所启用的禁止使用,并完成同一场景里任务所需的授权使用。
提出 AgentKernel,强制中介 Agent 的身份、感知、认知与执行
AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。
提出 AgentFlow,用带标签的流与路径策略约束智能体数据流
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
提出 GEOFlagBench 与 IPT,检测并测量生成式引擎优化网页
GEO-Flag 把页面级 GEO 检测做成可评测任务,并在发布的检索结果上估计被判为 GEO 的页面占比。
提出 SkillGuard,用可达性切断污染后通往禁止状态的技能调用
提出 PACE,在工具调用前对 Agent 做路径隔离与效果授权
PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
提出 KITA,将 Agent 动作批准绑定到 LLM 外的阈值签名
KITA 是一套密钥隔离的阈值授权架构,用来把模型评审变成执行外部动作的条件。
提出 MCPS EC,仅凭 MCP 工具元数据检测间接提示注入
提出 S³ 多阶段防御,由 guard agent 编排阶段安全技能检测并缓解风险
提出 ActGuard,在执行前审计并遮盖诱发动作偏离的间接注入