- 攻击arXiv 2610.04195
MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
- arXiv
- 2610.04195
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击arXiv 2610.01871
研究者提出 IMMRAG 攻击,可从多模态 RAG 数据存储中提取医学与文档图像
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容
- arXiv
- 2610.01871
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
摘要AMS 按激活签名把安全改动分四类,前三类可由两级扫描覆盖,行为微调会漏。
AMS 是面向开放权重模型、部署前使用的激活扫描器,用来看安全训练被拿掉或改写之后,激活空间里还留着什么几何痕迹。
- 攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 防御arXiv 2609.15671
QPriv-VL:面向视觉语言模型的问题引导 token 裁剪隐私防御
提出 QPriv-VL,用问题引导剪枝降低分布式视觉问答的隐私泄露
- arXiv
- 2609.15671
- 发表
- 场景
- 模型与 API
摘要QPriv-VL 在切层前按问题相关度与 DINOv2 敏感度剪视觉 token,作者称能在约四成 token 下兼顾准确率与四类攻击。
QPriv-VL 把问题引导的视觉 token 剪枝做成分布式 VQA 的客户端隐私防御,而不是只做集中式推理加速。
- 评测与基准arXiv 2609.33481
IDUnlearn-Bench:面向视觉语言模型的个体级遗忘基准
提出 IDUnlearn-Bench,评测 VLM 个体级遗忘后的身份残留
- arXiv
- 2609.33481
- 发表
- 场景
- 模型与 API
摘要IDUnlearn-Bench 用四族探针显示:压低直接属性访问后,身份仍常能被反向查出、绑定或重构。
IDUnlearn-Bench 评测 VLM 是否忘掉一个可跨模态识别的人,而不只是答不出某条监督事实。
已经到底了