APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读另有 378 篇论文还没打上分类标签,暂不在筛选结果里。
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读提出 A-VIP,将购物意图绑定到支付授权以阻断商户文本操控
提出 BENCHJACK,自动审计智能体基准的奖励作弊缺陷
论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。
提出 nmult 指标,测量智能体动作门禁堆叠的错误相关性与等效层数
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
提出 APEX,在执行边界以授权契约拦截智能体间接提示注入
完整解读提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读提出 VAL 框架并用确认门与参数沙箱约束高风险工具调用
完整解读提出 OATS,用确定性解析器在运行时治理技能动作
提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
提出 Approval Token 绑定编程智能体的审批与执行
提出破坏执行连续性的回滚攻击,揭示检查点恢复的安全故障
在模拟环境中复现级联失准行为并降低审计诱导开销
提出 CAVA,把异构智能体运行时事件规范成可哈希动作并绑定审批与回执
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
完整解读提出多层监控网关 ClawSentry,拦截恶意技能供应链与上下文注入
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
系统分析智能体支付协议 AP2,揭示合法签名无法阻止前置上下文操纵
完整解读提出 SkillGuard,用可达性切断污染后通往禁止状态的技能调用
完整解读提出 HOOKPRY,利用插件生命周期钩子更新劫持智能体框架执行命令
完整解读提出有状态策略引擎 Sapien,拦截被劫持智能体的越权工具调用
Sapien 是面向通用 AI 智能体的有状态策略引擎:执行前把用户提示词译成任务策略,运行时只放行该策略承认的工具调用序列。