用时序逻辑监控工具 Agent
提出 MFOTL 离线时序验证以监控工具 Agent 的危险动作链
- arXiv
- 2610.09793
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 黑盒
摘要形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
提出 MFOTL 离线时序验证以监控工具 Agent 的危险动作链
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击
DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。
提出 PAA 方法,在边界动作前审计长流程智能体的分阶段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出 VAL 框架,并用确认门与参数沙箱约束智能体高风险工具调用
构建 EvoRiskBench 评测工作区 Agent 的运行时安全风险
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
提出 DART,用去噪表征转移检测多轮智能体攻击并注入提醒
提出免训练框架 SED,将有害智能体轨迹蒸馏为可检索安全策略
提出 Pictionary,将不可信文本渲染成图像以防御提示注入
提出跨独立 Agent 的记忆跳跃攻击,经共享工件在助手间自传播
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全失败
用 MMPIBench 评测多模态提示注入对 Agent 框架的影响
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
提出 ClawSentry 多层监控网关,在技能准入和运行时拦截恶意技能与隐藏指令
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化
构建自演化基准 ActBench,评测协作智能体的行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
提出 S³,用 guard agent 编排阶段安全技能防御智能体多阶段风险
提出 Janus 前瞻守卫,在长程智能体执行有害动作前拦截潜在风险
提出 Agent MechSuits,对多轮 CLI Agent 做步级检测与子空间转向
Agent MechSuits 是面向多轮 CLI 智能体的白盒、步级表示防御,并配有可执行轨迹基准 MAS。