防御arXiv 2608.05578·8月6日AMS 工具通过激活分析检测语言模型的安全训练改动提出 AMS,用激活分离与方向相似度检测安全训练改动arXiv2608.05578发表8月6日层模型层场景模型与 API防御监控与审计攻击模型篡改组件微调与开源权重+1+1摘要AMS 按激活签名把安全改动分四类,前三类可由两级扫描覆盖,行为微调会漏。AMS 是面向开放权重模型、部署前使用的激活扫描器,用来看安全训练被拿掉或改写之后,激活空间里还留着什么几何痕迹。深度解读完整解读
防御arXiv 2609.15671·9月14日QPriv-VL:面向视觉语言模型的问题引导 token 裁剪隐私防御提出 QPriv-VL,用问题引导剪枝降低分布式视觉问答的隐私泄露arXiv2609.15671发表9月14日层训练与数据层场景模型与 API被测模型LLaVA-1.5-7B、Llama-2攻击提取与窃取组件视觉摘要QPriv-VL 在切层前按问题相关度与 DINOv2 敏感度剪视觉 token,作者称能在约四成 token 下兼顾准确率与四类攻击。QPriv-VL 把问题引导的视觉 token 剪枝做成分布式 VQA 的客户端隐私防御,而不是只做集中式推理加速。深度解读完整解读