评测与基准arXiv:2609.02316 · 9月2日Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息构建 COUNTER-GEO-BENCH,评测生成式搜索对信息扭曲 GEO 的防御LLM 应用·测试Gemma-4-31B-IT、Qwen-3.5-35B-A3B、Llama-4-Scout-17B-16E 等 11 个·应用层检测与过滤投毒与后门RAG+1+1摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。完整解读
防御arXiv:2601.10156 · 1月15日ToolSafe 提出步骤级护栏 TS-Guard 与 TS-Flow,降低 Agent 有害工具调用提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用AI Agent·测试GPT-4o、Qwen3-8B、Qwen2.5-7B-Instruct 等 10 个·应用层检测与过滤越狱护栏与评审+1+1摘要TS-Bench 标步骤级风险,TS-Guard 用多任务 RL 做执行前判定,TS-Flow 用反馈代替直接中止。ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。完整解读