摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
- 攻击arXiv 2610.03124
研究提出 Untag 攻击框架,使开源大模型触发标签滥用检测机制失效
提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测
- arXiv
- 2610.03124
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要作者用 UNTAG 评估 trigger-tag,认为其不能充当开放权重滥用检测的主要边界。
UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。
- 攻击arXiv 2609.12448
GraphProfiler 用个人知识图谱推断敏感属性并溯源到具体帖子
提出 GraphProfiler,用个人知识图谱从帖子历史推断敏感属性并溯源
- arXiv
- 2609.12448
- 发表
- 层
- 应用层
- 场景
- LLM 应用
摘要GraphProfiler 用源链接个人知识图谱做属性推断,准确率接近文本基线,并把证据定位到少量源帖。
GraphProfiler 是一个可审计的 LLM 敏感属性画像器:用源链接个人知识图谱,把推断落到具体帖子。
- 攻击arXiv 2610.01768
LLMLeak:借 LLM 合法网页抓取实施隐蔽数据外泄
提出 LLMLeak,把机密编进报错 URL,借聊天机器人网页抓取外传
- arXiv
- 2610.01768
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要LLMLeak 用报错 URL 借聊天机器人抓取外传秘密。
LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。
- 攻击arXiv 2610.01062
Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架
提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱
- arXiv
- 2610.01062
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。
Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。
- 攻击arXiv 2609.09087
PrivEscalate:面向 LLM 自动化 Linux 提权的 531 场景基准与 PrivEscAgent 增强方案
构建 PrivEscalate 评测 Linux 提权并设计 PrivEscAgent
- arXiv
- 2609.09087
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击恶意使用
- 攻击arXiv 2609.15383
微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
- arXiv
- 2609.15383
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 攻击者
- 黑盒
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
- 攻击arXiv 2608.29458
Reference-Grafting 在提取沙袋行为隐藏能力上追平微调
提出参考嫁接,在推理阶段用激活干预诱导沙袋隐藏能力
- arXiv
- 2608.29458
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 攻击模型篡改
摘要提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。
已经到底了