APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读另有 380 篇论文还没打上分类标签,暂不在筛选结果里。
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
提出 nmult 指标,测量智能体动作门禁堆叠的错误相关性与等效层数
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
完整解读提出 VAL 框架并用确认门与参数沙箱约束高风险工具调用
完整解读构建 BazaarBench,评测去中心化交易智能体的违规与失信
BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
构建 AGENTDOXX 评测联网搜索智能体对匿名访谈的再识别能力
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 TACIT,读取冻结隐藏状态以检测智能体有害轨迹
提出 SigLeak,从执行轨迹比对中推断专有智能体技能
提出破坏执行连续性的回滚攻击,揭示检查点恢复的安全故障
提出 CAVA,把异构智能体运行时事件规范成可哈希动作并绑定审批与回执
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
提出 Janus,用 CoAA-RL 训练前瞻守卫,在长程智能体有害动作执行前拦截
完整解读分析分布偏移下安全路由评测的基线选择偏差与虚假下限
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
完整解读提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 AHA 自动科研循环,发现生产级智能体的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
完整解读