攻击arXiv 2610.04195·10月3日MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露评估多租户智能体共享向量记忆的跨用户泄露与主动桥接arXiv2610.04195发表10月3日层应用层场景AI Agent攻击提取与窃取技术诱导选用组件记忆+2+2深度解读完整解读
防御arXiv 2608.05578·8月6日AMS 工具通过激活分析检测语言模型的安全训练改动提出 AMS,用激活分离与方向相似度检测安全训练改动arXiv2608.05578发表8月6日层模型层场景模型与 API防御监控与审计攻击模型篡改组件微调与开源权重+1+1摘要AMS 按激活签名把安全改动分四类,前三类可由两级扫描覆盖,行为微调会漏。AMS 是面向开放权重模型、部署前使用的激活扫描器,用来看安全训练被拿掉或改写之后,激活空间里还留着什么几何痕迹。深度解读完整解读
攻击arXiv 2609.06749·9月7日PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文arXiv2609.06749发表9月7日层模型层场景模型与 API攻击提取与窃取组件嵌入深度解读完整解读