APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读另有 383 篇论文还没打上分类标签,暂不在筛选结果里。
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
提出 Janus,用 CoAA-RL 训练前瞻守卫,在长程智能体有害动作执行前拦截
完整解读分析分布偏移下安全路由评测的基线选择偏差与虚假下限
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
完整解读提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 AHA 自动科研循环,发现生产级智能体的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出 DART,用去噪表征转移检测并干预多轮智能体攻击
完整解读提出 JailbreakSkill,用可演化技能自动搜索并复用越狱提示
完整解读提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
完整解读提出工具智能体的状态攻击 DART 与预执行防御 SAGE