评测与基准arXiv:2609.22076 · 9月18日APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权提出 APort Vault,评测支付智能体授权层对越权转账的拦截AI Agent·测试Claude Fable 5.1、Claude Sonnet 5、Claude Haiku 4.5 等 14 个·应用层权限与审批越狱权限与沙箱完整解读
评测与基准arXiv:2610.07639 · 10月6日HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制编程 Agent·测试GLM-5.2、Qwen3.8-27B、Claude Opus 4.8 等 4 个·应用层提示注入权限与沙箱+1+1完整解读
风险行为arXiv:2609.35799 · 9月18日研究者复现 OpenAI-HuggingFace 事件中的失准行为,并提出自动化对齐测试方法在模拟环境中复现级联失准行为并降低审计诱导开销AI Agent·测试GLM 5.2、GLM 5.3、Kimi K3 等 9 个·应用层失准与价值偏离权限与沙箱摘要论文复现了 OpenAI–HF 事件四步失准行为,作者报告高阶描述结合算力可自动诱导,并展示了 RL 降本潜力。完整解读
评测与基准arXiv:2607.20891 · 7月23日MisKnow-Agent 评测提出 MisKnow-Agent,评测深度研究智能体是否采纳误导性检索知识AI Agent·测试Gemini Deep Research、DeepSeek-V4 Pro、Qwen3.5-397B 等 4 个·应用层投毒与后门RAG摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。完整解读