跳到正文

#开源模型

今天还没有收录新动态
10月1日周四
  1. 研究者论文追踪 ·

    SynthIDBio:为 AI 生成的蛋白质序列与结构嵌入保功能水印

    Google DeepMind 团队提出 SynthIDBio,把水印直接嵌入 AI 生成的蛋白质序列与结构,同时保持其生物学功能。SynthIDBio-sequence 将 SynthID-text 的锦标赛采样接入 ProteinMPNN,并增加基于 g 值的过滤以保证可检测性;体外实验显示,针对 SC2RBD、VEGF-A 和 PD-L1 的水印结合蛋白在结合亲和力分布和命中率上与未加水印设计无显著差异,其中 SC2RBD 达到低纳摩尔级、VEGF-A 与 PD-L1 达到亚纳摩尔级。SynthIDBio-structure 则微调 AlphaFold 3 的扩散模块并联合训练一个受 PointNet 启发的检测器,在 AF3 评测集上以 0.1% 假阳性率取得超过 99.8% 的真阳性率,且 LDDT 与模板建模分数不下降。

  2. Help Net Security AI ·

    Google DeepMind 推出 SynthID Bio,为 AI 设计的蛋白质加水印且不破坏功能

    Google DeepMind 发布 SynthID Bio,一种面向 AI 设计蛋白质的水印方法,并在湿实验中验证其不损害蛋白质功能。该方法把签名隐藏在设计的氨基酸序列和预测三维结构的原子坐标中,DeepMind 称合成后的实体蛋白质也能检出该签名。团队将 AlphaProteo 设计方法与带 SynthID Bio 的 ProteinMPNN 序列生成器配对,在 VEGF-A、SARS-CoV-2 刺突蛋白受体结合域和 PD-L1 三个靶点上做湿实验,水印设计在命中率、结合亲和力和天然序列多样性上与未加水印版本持平。

  3. arXiv:防御、护栏、反学习与有害微调 ·

    ShieldCLIP:面向多模态基础模型有害内容的选择性安全对齐

    研究提出 ShieldCLIP,首个按每个模态自身安全状态而非样本来源来条件化安全对齐的框架,在保留安全内容的同时只重定向不安全部分。作者同时发布 ViSUv2 数据集,包含 195k 四元组、覆盖 578 个概念和 28 个类别,并为每个模态提供独立安全标签。基于这些标签,ShieldCLIP 定义了四路条件目标:安全内容锚定,不安全模态重定向到对应安全版本,混合样本只更新不安全分支,双模态均不安全时强制一致性。在跨模态检索、Stable Diffusion v1.4 与 SDXL 的文生图以及 LLaVA 的图生文任务上,ShieldCLIP 相比此前的安全对齐编码器和强缓解基线持续减少有害输出,同时保留原始嵌入空间的效用。消融实验显示模态特定监督与选择性对齐目标均有贡献。

  4. arXiv ·

    研究者提出梯度封堵实现 LLM 发布前的预防性遗忘

    研究者提出梯度封堵(gradient sealing)方法,用于在开放权重 LLM 发布前阻止下游微调重新习得被禁能力。作者先验证现有回顾式遗忘方法在发布前防护上不足:即使当前输出已抑制被禁能力,被禁领域数据仍能通过内部通路产生梯度,使能力在后续微调中被重新获得。梯度封堵的原理是把相关预激活推入负区间,使 ReLU 族激活的导数变为零或接近零,从而阻断这些通路。在多个 LLM 系列上的实验显示,该方法对下游能力习得的抵抗强于回顾式基线。

9月26日周六
  1. arXiv:越狱与提示注入 ·

    AnchorRep:用表征排斥防御 LLM 跨模型对抗迁移攻击

    AnchorRep 通过轻量 LoRA 适配器把被防御模型对有害提示的内部表征推离冻结锚模型的表征,从而抵御跨模型对抗迁移攻击。训练只用少量有害提示,不需要对抗样本。在五个模型、四个架构家族上,该方法把 2,000 次迁移攻击的攻击成功率降到不超过 1.1%,其中两个模型为 0%,Mistral 上的降幅最大,从 36% 降至 1.1%。论文指出既有防御虽能降低迁移,但代价高,最多导致 77% 的良性输出退化,或使过度拒答上升最多 18%;由于标准拒答指标无法捕捉这类良性乱码输出,作者提出 Benign Garble Rate 来量化。该工作为 NeurIPS 2026 论文,代码、配置和日志已公开。

9月17日周四
  1. arXiv:可解释性 ·

    局部稀疏性实现无监督 LLM 安全检测

    论文提出基于局部掩码 SAE 的无监督异常检测框架,用于大语言模型的部署期安全检测。作者指出,现有部署期安全方法多为监督式并依赖不安全训练数据,难以覆盖新出现的攻击与危害类别,因此转向只建模安全数据、标记分布外输入的异常检测思路。在线性表示假设下,SAE 恢复的概念空间中邻近点共享较小的公共激活支撑,这一局部稀疏性为高维激活空间中的异常检测提供了理论依据。作者在多种架构和数据集上验证了该方法,涵盖能力测试数据集与安全专用数据集。当允许算法使用 1% 的分布外数据做校准后,局部稀疏方法达到接近最优的性能,且仅用 1-2% 的 SAE 神经元参与计算。

9月11日周五
  1. arXiv:对齐与欺骗 ·

    Odin:面向隐私保护 Llama 3 8B 推理的开源端到端 FHE 实现

    Odin 是首个开源的端到端 GPU CKKS 实现,可在加密状态下完成 Llama-3-8B 推理。它通过 feature-major 跨层布局统一残差连接与层接口,并为线性投影和注意力构建临时算子内布局,减少权重的冗余明文编码;注意力中 QK^T 的分数可直接被 Softmax 消费,PV 直接消费概率,避免中间重打包;非线性运算采用带输入范围控制的 minimax 多项式近似与联合误差分配。在单张 NVIDIA H100 80 GB GPU 上,输入 128 token 时评估全部 32 层耗时 366.4 s、峰值显存 58.9 GiB,相比 THOR 的 1651.9 s 提速 4.51 倍。

9月3日周四
  1. arXiv:越狱与提示注入 ·

    AlcaTRAz:无需模型权重的规则树提示级越狱防御

    AlcaTRAz 是一种基于规则树的提示级越狱防御,只作用于输入文本,不需要访问模型权重或内部结构,也无需修改或重训练目标模型。该方法自动学习一条可迁移的变换规则,在选定位置插入受控的字符级扰动,破坏越狱攻击所利用的结构规律,同时尽量保持模型对正常问题的表现。

9月2日周三
8月29日周六
  1. Unit 42 · · 原文 71

    Unit 42 提出扰动探测方法,定位 LLM 安全拒答的少量神经元

    Unit 42 提出扰动探测方法,每个提示词只需两次前向传播,即可定位对齐 LLM 中因果上负责特定行为(如拒绝有害请求)的少量前馈神经元。在开源模型 Qwen3-4B 上,350,208 个前馈神经元中仅 50 个(约 0.014%)控制安全拒答模板,移除后 520 条标准有害提示基准中 80% 的回复格式发生变化,并在第二个标准基准的 200 条提示上复现。在更小的 Qwen3.5-2B 上,仅 20 个神经元即可让多轮对话中的错误附和行为从 36.7% 降至 0%(30 个问题)。同一计算还给出 FFN/Skip 比值,可在数秒内算出,在测试的 13 个模型中解释了安全行为脆弱性 81% 的方差,可作为量化的安全脆弱性评分。

    推荐理由研究给出一种两次前向传播即可定位安全拒答神经元的诊断方法,并附可跨模型比较的脆弱性指标。

8月25日周二
  1. arXiv ·

    RACER:面向多模态大模型后门的区域感知一致性修复框架

    论文提出 RACER,一个模型级的多模态大模型后门修复框架,通过抑制内部表征的层级不一致异常来从源头移除后门。作者观察到后门会在内部表征中引发层级间演化异常,即层级不一致异常,且该异常与模态相关,主要集中在编码触发特征的 token 区域。RACER 据此把融合表征拆分为视觉与文本 token 区域,分别归一化其层级不一致性,再在深层窗口内以模态感知权重重组,形成区域感知的不一致目标,并通过 min-max 优化合成最坏情况扰动、对扰动做对抗微调来修复模型。该方法只需 100 条干净样本,不需要知道触发器、攻击目标,甚至不需要知道输入模型是否含后门。

8月6日周四
  1. arXiv ·

    Gradient Immunity 提出 USG:在开放权重发布时阻断恶意微调梯度

    论文提出 Unidirectional Safety Gate(USG),用于作者所称的“部分保护开放权重发布”(PPOW)场景:大部分权重仍可训练,但发布时保留少量安全关键组件。USG 由 Null Space Cubic Layer 与 Inverse Adapter 组成,插入在最后一层 Transformer 之后;下游微调时,三次层抑制或阻断隐藏状态落入校准保护区域的有害样本梯度,Inverse Adapter 则恢复基础模型的前向行为。防御方用自己掌握的有害数据校准阈值,使保护能泛化到邻近的分布内有害样本。

7月30日周四
  1. Failure-First ·

    Yuvion LLM:面向内容与 AI 安全的对抗感知大语言模型

    Yuvion LLM 提出将对抗鲁棒性与智能体能力列为一等目标的安全模型,通过五类功能性数据和三阶段训练流程应对语义伪装下的有害请求。其数据体系涵盖通用、安全域、对抗、智能体和合成专家数据,分别支撑语言能力、风险分类学、混淆变体(拼音替换、符号替代)、工具调用轨迹与长尾高风险场景覆盖。训练分三阶段推进:知识增强持续预训练内化细粒度审核政策,基于政策的监督微调加 GRPO 打磨决策边界,再以分解密集奖励稳定工具集成与检索增强的多步安全工作流。

7月16日周四
  1. arXiv ·

    DataShield:通过共识子空间对齐识别 LLM 微调中的高风险数据

    DataShield 是一个数据评估框架,通过多个安全对齐 LLM 构建的联合安全关键语义空间中的共识子空间对齐,识别有风险的微调样本和回复片段。该框架在这些空间内用语义谱分解提取共识的安全与不安全子空间,再通过衡量样本或片段与不安全子空间、安全子空间的相对对齐程度估计风险,从而支持样本级过滤和细粒度片段级掩码。与现有过滤和掩码基线相比,DataShield 在样本过滤下将 ASR 降低 14.6%,在片段掩码下降低 32.3%,同时保持下游效用,并避免针对特定目标模型计算风险。

8月1日周四
  1. arXiv ·

    Llama 3 模型群:405B 稠密 Transformer 与 Llama Guard 3 安全模型

    Meta 发布 Llama 3 模型群,最大模型为 405B 参数的稠密 Transformer,上下文窗口最高 128K tokens,原生支持多语言、编程、推理与工具使用。评测显示其在大量任务上质量与 GPT-4 相当,并公开释出 405B 的预训练与后训练版本及输入输出安全模型 Llama Guard 3。论文还通过组合式方法将图像、视频和语音能力接入 Llama 3,在识别任务上表现与 SOTA 相当,但这些多模态模型仍在开发中,尚未广泛发布。

已经到底了