防御arXiv 2610.09793
用时序逻辑监控工具 Agent
提出 MFOTL 离线时序验证以监控工具 Agent 的危险动作链
- arXiv
- 2610.09793
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 黑盒
摘要形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
提出 MFOTL 离线时序验证以监控工具 Agent 的危险动作链
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
用通用扰动对恶意软件分类器及漂移检测器做规避与后门投毒
提出 CAVA,将异构智能体运行时事件规范为可哈希动作并绑定审批与回执
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
提出 TFA 与 SVA,抑制 ensemble 后门指纹验证
TFA 与 SVA 是针对后门式 LLM 指纹的 ensemble 抑制攻击,不改模型参数。所有者用 SFT 写入秘密对,只通过 API 验证版权。攻击者未授权取得模型,不知道触发和指纹,却要把每个模型的验证变成失败,同时让 ensemble 至少不差于性能最高的单模型。