防御arXiv 2608.05578·8月6日AMS 工具通过激活分析检测语言模型的安全训练改动提出 AMS,用激活分离与方向相似度检测安全训练改动arXiv2608.05578发表8月6日层模型层场景模型与 API防御监控与审计攻击模型篡改组件微调与开源权重+1+1摘要AMS 按激活签名把安全改动分四类,前三类可由两级扫描覆盖,行为微调会漏。AMS 是面向开放权重模型、部署前使用的激活扫描器,用来看安全训练被拿掉或改写之后,激活空间里还留着什么几何痕迹。深度解读完整解读
攻击arXiv 2608.06862·8月7日SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化提出 SYNCHAIN,诱导计算机使用 Agent 自合成潜伏技能并跨任务触发arXiv2608.06862发表8月7日层应用层场景网页与电脑操作、编程 Agent攻击投毒与后门技术潜伏触发组件MCP 与技能+3+3摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。深度解读完整解读