评测与基准arXiv:2610.03448 · 10月2日研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现重评提示注入检测器,检验基准分数对智能体部署的预测力AI Agent·测试Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个·应用层检测与过滤提示注入护栏与评审摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。完整解读
评测与基准arXiv:2609.02316 · 9月2日Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息构建 COUNTER-GEO-BENCH,评测生成式搜索对信息扭曲 GEO 的防御LLM 应用·测试Gemma-4-31B-IT、Qwen-3.5-35B-A3B、Llama-4-Scout-17B-16E 等 11 个·应用层检测与过滤投毒与后门RAG+1+1摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。完整解读
评测与基准arXiv:2609.08258 · 9月8日研究实测五套 Agent 记忆系统均不执行撤销标记评测智能体记忆软撤回是否生效,并提出陈旧检索防护AI Agent·测试GPT-5.5、Grok-4、DeepSeek-V4-Flash 等 9 个·应用层检测与过滤Agent 危险操作记忆摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。完整解读
防御arXiv:2609.36562 · 9月29日ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险模型与 API·测试ThinkingGuard(Qwen3-VL-8B-Instruct)、GPT-5.1、Claude-Sonnet-4-6 等 9 个·提示层检测与过滤越狱护栏与评审+2+2摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。完整解读