摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
全部论文
另有 429 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2610.06049
研究者提出仅修改 SAE 解码器的后门攻击,可在不改动语言模型的情况下植入行为
提出只改 SAE 解码器的后门,在冻结语言模型上植入代码插入
- arXiv
- 2610.06049
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要只改解码器的 SAE 可带上代码插入后门,且若干常规质量指标变化不大。
只改 SAE 解码器、冻结编码器与语言模型,即可把代码插入行为放进推理时的辅助组件。作者把这视为 SAE 供应链问题:checkpoint 一旦替换某一层激活,就参与后续计算,而不只是解释工具。
- 攻击arXiv 2610.03166
LiBRA:通过双向隐空间优化实现检测感知的图像水印去除
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
- arXiv
- 2610.03166
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
- 攻击arXiv 2610.03124
研究提出 Untag 攻击框架,使开源大模型触发标签滥用检测机制失效
提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测
- arXiv
- 2610.03124
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要作者用 UNTAG 评估 trigger-tag,认为其不能充当开放权重滥用检测的主要边界。
UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。
- 攻击arXiv 2610.01062
Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架
提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱
- arXiv
- 2610.01062
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。
Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。
- 攻击arXiv 2609.08186
论文揭示大推理模型的对齐崩溃并提出 Reasoning Trap 越狱范式
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
- arXiv
- 2609.08186
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要更深推理提升题目准确率,同时提高扰动下的相对损失。
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。
- 攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击arXiv 2609.08213
DRIFT:通过偏转生成轨迹去除扩散模型水印的黑盒攻击
提出黑盒攻击 DRIFT,偏转生成轨迹以去除扩散水印
- arXiv
- 2609.08213
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2609.10117
研究揭示基于混淆的端侧 LLM 保护方案的安全边界
提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型
- arXiv
- 2609.10117
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要Oprior 是四原语复合的安全边界,Collapse 利用列方向泄漏抽取替代模型,Oext 只被同一攻击评测。
这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。
- 攻击arXiv 2609.00873
研究提出 Q-Skew:利用 token 级记忆不对称对微调扩散语言模型做成员推断
提出 Q-SKEW,利用 token 级记忆不对称推断微调扩散语言模型的成员
- arXiv
- 2609.00873
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 灰盒
- 攻击提取与窃取
摘要Q-SKEW 用 token 损失差的右偏区分微调 DLM 成员,并可辅助 PII 排序。
Q-SKEW 是针对微调扩散语言模型的 gray-box 成员推断指标,依据是 token 记忆增益随掩码率下降而增大、成员序列因此右偏。。
摘要黑盒 TTS 成员推断以 recitation 加分层语音表示为分数,说话人级强于记录级,DP-SGD 可压到随机附近。
作者给出一个针对微调文本转语音模型的黑盒成员推断框架,分别审计说话人是否进入微调集,以及某一条文本–音频记录是否进入微调集。微调 TTS 以合成文本和参考语音双条件生成,既有生成模型 MIA 的单条件查询和图像/文本上的逐点比较不能直接套用。作者用 scorable extent 与 memorization elicitation 比较五种查询,认为只有 recitation(用目标转写和干净目标语音要求模型复现)同时满足两条,并把它作为主查询。
- 攻击arXiv 2609.05702
量子原生访问下量子机器学习(QML)的隐私风险刻画
证明量子原生访问会增强量子模型的成员推断优势
- arXiv
- 2609.05702
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击提取与窃取
摘要量子原生访问使 QNN 成员推断优势按 C⪯M⪯Q 增加,有限影子模型留下可上界的经验差距。
作者研究 量子原生访问下 QNN 的成员推断:对手不再只拿到固定测量的经典比特。
- 攻击arXiv 2609.10611
WPMIA:面向严格黑盒大模型的词级概率成员推断攻击
提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员
- arXiv
- 2609.10611
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击提取与窃取
摘要WPMIA 从续写估计词级似然并对比前缀,黑盒上多数优于所列基线。
WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。
- 攻击arXiv 2608.29458
Reference-Grafting 在提取沙袋行为隐藏能力上追平微调
提出参考嫁接,在推理阶段用激活干预诱导沙袋隐藏能力
- arXiv
- 2608.29458
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 攻击模型篡改
摘要提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。
- 攻击arXiv 2609.36941
研究者提出针对黑盒 LLM 的实用密钥提取框架
提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据
- arXiv
- 2609.36941
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击提取与窃取
摘要论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。
- 攻击arXiv 2609.33136
Leaky Students:针对 on-policy distillation 的成员推断攻击
提出 Leaky,用新鲜轨迹的 token 对数概率差推断 OPD 训练记录成员身份
- arXiv
- 2609.33136
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击提取与窃取
- 攻击arXiv 2609.36331
无需参考模型:用邻居样本校准单轮成员推理攻击
提出用邻居分数替代参考模型的单轮成员推断
- arXiv
- 2609.36331
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击提取与窃取
摘要邻居查询在单模型上恢复逐样本校准,合成邻居加早期检查点最接近 LiRA。
本文研究 one-round 成员推断:只有一个目标模型、不能再训练参考模型时,如何仍做逐样本校准,并用于单次运行的 DP 审计。