摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
- 攻击arXiv 2610.01871
研究者提出 IMMRAG 攻击,可从多模态 RAG 数据存储中提取医学与文档图像
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容
- arXiv
- 2610.01871
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 攻击arXiv 2610.01062
Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架
提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱
- arXiv
- 2610.01062
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。
Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。
已经到底了