用时序逻辑监控工具 Agent
提出 MFOTL 时序监控,用 MonPoly 检出工具 Agent 的危险动作链
- arXiv
- 2610.09793
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GPT-4o、Sonnet-3.5
摘要形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
另有 273 篇论文还没打上分类标签,暂不在筛选结果里。
提出 MFOTL 时序监控,用 MonPoly 检出工具 Agent 的危险动作链
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
提出 APEX,在执行边界用预编译授权契约防御 Agent 间接提示注入
提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出自演化基准 ActBench,评测协作智能体的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
提出 PACE,在工具调用前对 Agent 做路径隔离与效果授权
PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
提出 MCPS EC,仅凭 MCP 工具元数据检测间接提示注入
提出 ActGuard,在执行前审计并遮盖诱发动作偏离的间接注入
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全
提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。