研究者披露 LiteLLM 网关跨租户干扰攻击 Cooldown Landmines
提出利用共享冷却的跨租户干扰攻击,并设计租户隔离机制
- arXiv
- 2610.05089
- 发表
- 场景
- LLM 应用
- 测试
- Qwen1.5-MoE-A2.7B-Chat、DeepSeek-MoE-16B-Chat
摘要揭示网关共享冷却漏洞,提出来源检查与租户隔离防御。
另有 60 篇论文还没打上分类标签,暂不在筛选结果里。
提出利用共享冷却的跨租户干扰攻击,并设计租户隔离机制
摘要揭示网关共享冷却漏洞,提出来源检查与租户隔离防御。
构建 MLCommons 越狱基准以测量模型的单轮越狱韧性
摘要论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。
提出 SkillSafe-Bench,评测技能合并模型的自适应越狱鲁棒性
本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。
提出内生护栏 SingProbe,复用解码隐状态监测查询意图、回复安全与幻觉
SingProbe 是面向生成时监测的开源内生护栏:复用基座解码隐状态,而不是另起模型反复编码文本。
分析良性知识蒸馏中提示模板对学生拒答保留的影响
构建中文青少年内容安全基准 QH-Bench,评测单轮与多轮回复的安全与有用性
QH-BENCH 是面向中国社会文化情境的中文青少年内容安全基准,用单轮细粒度风险和多轮跨轮机制两条轨道,评测模型回复是否既守住安全边界又提供适合年龄的帮助。
提出 Bi-QSTO,优化能穿过质量筛选并在微调中削弱安全对齐的投毒样本
Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。
提出 COVER,在语言预算下选择源语言实现跨语言知识遗忘
语言预算下的多语言遗忘:遗忘监督只放在 K 种源语言上,目标是降低其余语言对同一事实的残余访问,而不是把每种评测语言都译成监督数据。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
提出预训练缩放律,估计野生 AI 网页文本相当于多少人类 token
作者测量未标注的 wild AI 网页文本对预训练的影响,并提出一个能让 AI token 价值变号的缩放律。
提出 FDCU 双约束子空间投影遗忘,抵御再训练恢复有害知识
FDCU 是一种约束参数更新的遗忘方法,用来降低再训练把已抑制恶意行为重新引出的可能。
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改
SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。
论证红队评测存在威胁模型覆盖缺口并用多语言探针验证
提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型
这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。
提出端到端全同态加密方案 ODIN,在云端密文上完成推理以保护提示词
ODIN 是面向 Llama 的服务器侧 CKKS 推理系统:客户加密提示词,诚实但好奇的服务器用明文权重在密文上算完 Llama-3,只返回结果密文。
提出 DataShield,用共识子空间过滤会削弱安全的微调数据
提出 USG,在部分保护开源权重发布时阻断有害微调梯度
Unidirectional Safety Gate 是面向 PPOW 发布设定的发布时防护:大部分权重仍可训练,一小部分安全关键组件由提供者侧加固保留,下游不必配合额外安全流程。。
提出 Safin-1,以可路由 Safety State 在冻结主干上实现内在安全