跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.05219· Akash Das, Ishan Roy·本站收录 · 原文发表 日期未标

AURA:用正交适配缓解 LLM 推理与安全对齐的子空间干扰

Safe Context Switching for Agents in the Wild: Mitigating Subspace Interference via Orthogonal Adaptation

AI 导读

研究揭示大语言模型的"序列子空间干扰"现象:在多步数学与代码生成等逻辑任务上做标准微调,会对齐基准造成 23.3% 的干扰惩罚,削弱模型安全先验,且现有适配方法难以捕捉这种"推理漂移"。为此提出谱正则化框架 AURA(Adaptive Unique Residual Allocation),通过估计对齐流形的零空间并将推理更新约束在其正交补上,强制推理与安全之间的谱独立性。实验显示 AURA 挽回 23.0% 的损失性能,同时保持对安全状态大于 0.98 的余弦保真度。

阅读原文arxiv.org