摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。
全部论文
另有 426 篇论文还没打上分类标签,暂不在筛选结果里。
摘要UnAct 用前向激活做类别遗忘。
UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。
- 攻击arXiv 2610.06848
TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击
提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员
- arXiv
- 2610.06848
- 发表
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。
- 攻击arXiv 2610.05089
研究者披露 LiteLLM 网关跨租户干扰攻击 Cooldown Landmines
提出利用共享冷却的跨租户干扰攻击,并设计租户隔离机制
- arXiv
- 2610.05089
- 发表
- 场景
- LLM 应用
摘要揭示网关共享冷却漏洞,提出来源检查与租户隔离防御。
摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
- 防御arXiv 2610.00348
NEEDLE:通过权重正交化移除 LLM 后门
提出 NEEDLE,用权重正交化在已知触发器时去除大模型后门
- arXiv
- 2610.00348
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要NEEDLE 用闭式权重编辑去掉已知触发器的后门,并保住拒绝子空间。
- 可解释性arXiv 2609.06934
论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击
解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练
- arXiv
- 2609.06934
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。
- 攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 防御arXiv 2609.00786
MROP:针对 Deep JSCC 后门攻击的掩码区域优化净化方法
提出 MROP,在发射端推理时纯化输入以抵御训练投毒后门
- arXiv
- 2609.00786
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要MROP 不重训练,在发射端纯化补丁后门。
MROP 是 deep JSCC 无线图像传输上的推理时输入纯化,对象是矩形补丁后门。
- 可解释性arXiv 2609.07746
LLM Forensics:用稀疏自编码器定位并控制后门触发机制
用 SAE 定位后门触发机制并分离检测与因果控制
- arXiv
- 2609.07746
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击投毒与后门
摘要Gaperon 语言切换后门可分成检测、残差路由和后期语言跟踪三类 SAE 特征,只有部分能改行为。
作者用稀疏自编码器分解 Gaperon 中无害的语言切换后门,区分识别触发的特征与真正能抑制或诱发该行为的特征。固定触发使英语提示在 Gaperon-1B 与 8B 上续写成法语或德语。
- 分析与理论arXiv 2609.29757
OllamaDrama:用蜜罐测量暴露 LLM 基础设施遭受的攻击
部署蜜罐测量针对暴露 LLM 基础设施的攻击
- arXiv
- 2609.29757
- 发表
- 场景
- 模型与 API
已经到底了