跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.02844· Jisheng Dang, Yushuo Zhao, Dewei Liu, Junfeng Fang, Bimei Wang, Tiantian Rao, Hong Peng, Bin Hu, Tat-Seng Chua·本站收录 · 原文发表

DNAlign:面向 LLM 的动态零空间安全对齐框架

DNAlign: Dynamic Null-Space Safe Alignment for LLMs

AI 导读

DNAlign 是一种轻量级安全对齐框架,将控制论优化与零空间投影结合,把 LLM 视为动态系统并施加可控扰动以引导生成走向安全行为。其投影模块将扰动限制在由中性隐藏状态导出的有害相关子空间内,从而保留通用知识与回答质量;基于人类偏好数据训练的价值函数自适应优化控制信号。在多个 LLM 基座上的评测显示,该框架持续减少有害输出,同时保持流畅性、连贯性与事实效用,整体表现优于既有对齐基线且未牺牲生成多样性。

阅读原文arxiv.org