评测与基准arXiv:2609.22076 · 9月18日APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权提出 APort Vault,评测支付智能体授权层对越权转账的拦截AI Agent·测试Claude Fable 5.1、Claude Sonnet 5、Claude Haiku 4.5 等 14 个·应用层权限与审批越狱权限与沙箱完整解读
防御arXiv:2610.02664 · 10月2日论文提出 GHOST:长程智能体在良性对话中遗忘早期安全约束提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束AI Agent·测试GPT-5.5、DeepSeek-V4-Pro、GLM-5.2 等 7 个·应用层权限与审批Agent 危险操作权限与沙箱+1+1摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。完整解读