跳到正文
10月9日 · 周五

开源模型安全 · 论文

找到 22 篇

另有 60 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.01091

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Gemma-3-12B-IT 等 4 个

    摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。

    深度解读完整解读
  2. 攻击arXiv 2610.01367

    研究:高质量数据筛选挡不住投毒

    提出 Bi-QSTO,优化能穿过质量筛选并在微调中削弱安全对齐的投毒样本

    发表
    测试
    Llama2-7B-Chat、Llama3-8B-Instruct、Qwen2-7B-Instruct 等 5 个
    摘要质量筛选挡不住部分高分样本的安全削弱。

    Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。

    深度解读完整解读
  3. 防御arXiv 2609.40286

    研究者提出 COVER:在语言预算下选择源语言实现跨语言遗忘

    提出 COVER,在语言预算下选择源语言实现跨语言知识遗忘

    发表
    测试
    Tiny Aya Global、Qwen3-4B-Instruct-2507、Llama-3.2-3B-Instruct
    摘要COVER 在语言预算下选源语言,以降低未监督语言上相对 oracle 的残余访问。

    语言预算下的多语言遗忘:遗忘监督只放在 K 种源语言上,目标是降低其余语言对同一事实的残余访问,而不是把每种评测语言都译成监督数据。

    深度解读完整解读
  4. 分析与理论arXiv 2609.40295

    一个 AI token 值多少?研究者为野生 AI 生成网页文本提出新缩放定律

    提出预训练缩放律,估计野生 AI 网页文本相当于多少人类 token

    发表
    测试
    nanochat 19.9M、35.8M、86.2M 等 7 个
    摘要wild AI 文本对数据不足的模型先降损失,对高人类预算几乎立刻升损失。

    作者测量未标注的 wild AI 网页文本对预训练的影响,并提出一个能让 AI token 价值变号的缩放律。

    深度解读完整解读
  5. 防御arXiv 2609.39279

    FDCU:用双重约束子空间投影抵御机器遗忘后的重训练攻击

    提出 FDCU 双约束子空间投影遗忘,抵御再训练恢复有害知识

    发表
    测试
    Qwen2.5-3B、Llama-3-8B-Instruct、Qwen-3-8B
    摘要FDCU 用双掩码限制浅层抑制,在知识擦除与安全输出上提高再训练后的稳定性。

    FDCU 是一种约束参数更新的遗忘方法,用来降低再训练把已抑制恶意行为重新引出的可能。

    深度解读完整解读
  6. 10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发

    测绘去安全开源模型的生产与重分发留存链路

    发表
    测试
    Qwen、Llama、Gemma 等 10 个

    摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。

    深度解读完整解读
  7. 其他arXiv 2402.00838

    OLMo:加速语言模型科学研究

    发布开放语言模型 OLMo、Dolma 数据与训练评测代码

    发表
    测试
    OLMo-1B、OLMo-7B、StableLM 1.6B 等 15 个
    摘要OLMo 开放 1B/7B 模型、Dolma 与训练评测工件。

    Allen Institute 发布 OLMo:一套从数据、训练到评测都公开的语言模型框架,用来支持对语言模型能力、弱点、偏见与风险的研究。

    深度解读完整解读
  8. 防御arXiv 2609.02293

    SEAL:通过共享专家对齐强化 MoE 全局安全

    提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改

    发表
    攻击者
    白盒、黑盒
    测试
    Qwen1.5-MoE-A2.7B、DeepSeekMoE-16B、GLM-4.7-Flash 等 4 个
    摘要SEAL 把 DPO-LoRA 限制在混合 MoE 共享专家上,SEAL++再保护已有安全神经元方向。

    SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。

    深度解读完整解读
  9. 防御arXiv 2609.12378

    Odin:面向隐私保护 Llama 3 8B 推理的开源端到端 FHE 实现

    提出端到端全同态加密方案 ODIN,在云端密文上完成推理以保护提示词

    发表
    测试
    Meta-Llama-3-8B、Llama-3-8B(THOR-style baseline)
    摘要ODIN 用可复用的特征主序打包和联合误差预算,在单张 H100 上完成 Llama-3-8B 的 CKKS 推理。

    ODIN 是面向 Llama 的服务器侧 CKKS 推理系统:客户加密提示词,诚实但好奇的服务器用明文权重在密文上算完 Llama-3,只返回结果密文。

    深度解读完整解读
  10. 其他arXiv 2609.17380

    Open-1B:一次完全可审计的训练运行

    提出 RepOps,使分布式预训练可跨硬件按位复现并被审计

    发表
    测试
    Open-1B、OLMo 2 1B
    摘要Open-1B 用跨硬件按位算子和集体审计,把 400B token 预训练变成可分步核验的轨迹。

    Open-1B 是 Gensyn 发布的 1.61B 参数 decoder-only 模型,目标是把预训练从“公开配方”推进到每一步可在异构硬件上按位核对。浮点加法非结合、融合乘加、次正规数和平台相关随机数,使同一配方在不同机器上得不到同一权重。概率性的 proof-of-learning / proof-of-training-data 被作者认为不足以排除少量数据注入的后门。

    深度解读完整解读
  11. 防御arXiv 2608.05045

    Gradient Immunity 提出 USG:在开放权重发布时阻断恶意微调梯度

    提出 USG,在部分保护开源权重发布时阻断有害微调梯度

    发表
    攻击者
    白盒
    测试
    Qwen3-14B(表中作 Qwen-14B)、Llama-3.1-8B(表中作 Llama-8B)
    摘要USG 在 PPOW 下用零空间立方层阻断有害微调梯度。

    Unidirectional Safety Gate 是面向 PPOW 发布设定的发布时防护:大部分权重仍可训练,一小部分安全关键组件由提供者侧加固保留,下游不必配合额外安全流程。。

    深度解读完整解读
  12. 防御arXiv 2609.34970

    研究揭示 LLM 涌现失准的机制并提出参数空间缓解框架

    提出几何缓解框架,把有害梯度子空间从 LoRA 更新中正交投影出去

    发表
    测试
    Qwen2.5-3B-IT、Qwen2.5-7B-IT、Qwen2.5-14B-IT 等 8 个
    摘要窄域 LoRA 会留下可测的有害子空间。

    See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。

    深度解读完整解读
  13. 防御arXiv 2609.39866

    研究者提出梯度封堵实现 LLM 发布前的预防性遗忘

    提出 GSU 在发布前封堵敏感门梯度,抵抗下游微调获取禁止能力

    发表
    攻击者
    白盒
    测试
    Llama-3.2-1B、Llama-3.2-3B、Llama-3.1-8B 等 7 个
    摘要GSU 在发布前封堵 SiLU 门的获取梯度,并在 TOFU 与 WMDP 上降低下游微调得分。

    Gradient-Sealed Unlearning(GSU)是一种发布前的 preemptive unlearning:不删除模型里已经有的能力,而是让指定禁止域能力更难被发布后的微调获取。

    深度解读完整解读