评测与基准arXiv:2609.31342 · 9月25日研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案评测过时检索证据推翻模型正确回答的陈旧文档中毒现象测试GPT-4o、GPT-4.1、Claude-Opus-4.5 等 13 个·应用层场景LLM 应用投毒与后门RAG摘要论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。完整解读
攻击arXiv:2608.06862 · 8月7日SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化提出SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件测试Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 5 个·应用层场景网页与电脑操作编程 Agent投毒与后门潜伏触发MCP 与技能+3+3摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。定位:论文研究了计算机使用智能体(CUA)中由持久化工件自主生成引发的内部供应链安全风险。核心问题:现代 CUA 依赖自主编写并复用技能等持久工件来扩展能力,若底层模型受到供应链攻陷,可能在良性任务中生成带潜伏载荷的自合成工件,使得恶意行为无需外部新输入即可在后续任务中跨步激活。方法设计:提出 SYNCHAIN 框架,通过面向持久化的定向 SFT,将恶意逻辑潜伏编码在良性工件的结构冗余中;工件被纳入系统扩展状态后,通过状态转移实现严格的延迟激活。核心实验发现:在 OpenClaw、Codex 和 Claude Code 三个框架下,SYNCHAIN 在 Chain-1 无防御设置下取得 97.78%–98.89% 的平均 ASR,在 GuardAgent 下仍保持 87.78%–93.33%;在 Chain-2 取得 72.59% 的平均 ASR,显著优于适配基线 SkillJect 和 DemonAgent。传播边界与衰减:在更长任务链中,受上下文截断和记忆总结等信息瓶颈影响,Chain-4 与 Chain-5 的 ASR 分别回落至 6.67% 与 1.11%,表明跨任务传播存在天然的马尔可夫衰减边界。作者结论与启示:作者认为,持久性改变了智能体的安全边界,传统的单步输入过滤和输出审查无法防御内部工件传递的风险,未来需构建结合工件签名、权限约束与执行轨迹审计的来源感知防御。完整解读