摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
全部论文
另有 444 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2610.06049
研究者提出仅修改 SAE 解码器的后门攻击,可在不改动语言模型的情况下植入行为
提出只改 SAE 解码器的后门,在冻结语言模型上植入代码插入
- arXiv
- 2610.06049
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要只改解码器的 SAE 可带上代码插入后门,且若干常规质量指标变化不大。
只改 SAE 解码器、冻结编码器与语言模型,即可把代码插入行为放进推理时的辅助组件。作者把这视为 SAE 供应链问题:checkpoint 一旦替换某一层激活,就参与后续计算,而不只是解释工具。
- 攻击arXiv 2610.03166
LiBRA:通过双向隐空间优化实现检测感知的图像水印去除
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
- arXiv
- 2610.03166
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
摘要论文证实持久工件与内存可形成跨智能体传播链,揭示了将共享工件纳入安全防线的重要意义。
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
- 攻击arXiv 2610.00392
A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型
提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据
- arXiv
- 2610.00392
- 发表
- 层
- 应用层
摘要A2A-TIBA 一次植入后绕过智能体,GDA 用四类结果定位防线,ELA-ITL 把信封标注列为第三层。
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
- 攻击arXiv 2610.01062
Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架
提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱
- arXiv
- 2610.01062
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。
Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。
- 攻击arXiv 2609.38270
VirusCascade:劫持 LLM 推荐智能体的协同反思机制
提出 VirusCascade,劫持推荐智能体协同反思以定向推广物品
- arXiv
- 2609.38270
- 发表
- 层
- 应用层
- 场景
- 多智能体
已经到底了