评测与基准arXiv:2610.03448 · 10月2日研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现重评提示注入检测器,检验基准分数对智能体部署的预测力AI Agent·测试Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个·应用层检测与过滤提示注入护栏与评审摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。完整解读
评测与基准arXiv:2609.08258 · 9月8日研究实测五套 Agent 记忆系统均不执行撤销标记评测智能体记忆软撤回是否生效,并提出陈旧检索防护AI Agent·测试GPT-5.5、Grok-4、DeepSeek-V4-Flash 等 9 个·应用层检测与过滤Agent 危险操作记忆摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。完整解读