APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读另有 95 篇论文还没打上分类标签,暂不在筛选结果里。
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读提出 VAL 框架并用确认门与参数沙箱约束高风险工具调用
完整解读提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 TPRS,量化工具命名等表征变化对智能体安全基准得分的影响
完整解读提出 EvoRiskBench,评测工作区智能体的运行时安全风险
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
提出 PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
用 MMPIBench 评测智能体框架的多模态提示注入
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
在模拟环境中复现级联失准行为并降低审计诱导开销
提出 DURA,沿扩散潜空间生成自然对抗补丁以劫持 VLA 机器人动作
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。
提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务
提出 SCOPE 联合后训练计算机使用智能体的任务执行与安全决策
完整解读构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
完整解读提出 SkillSecurer,检测定位并修补智能体技能中的提示注入
完整解读提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
完整解读提出 TRUSTFORK,评测展示身份如何劫持多智能体编排的操作权限