跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.36657· Adam S. Lowet·· 3 天前

Constitutional adapters:用推理期干预防御越狱与失准

Constitutional adapters: Inference-time interventions for misalignment and misuse

AI 导读

研究提出 constitutional adapters(CAs),把符合宪法原则的行为从合成语料蒸馏进低秩适配器和 steering vector,训练中从未见过有害请求或越狱样本。用宪法训练对象减去对照训练对象后,越狱防御成功率和测得对齐度提升,在长上下文和多轮攻击下优于提示词与 steering 基线。CAs 可在基座模型上训练、零样本迁移到后训练 checkpoint,并在推理时缩放以在防御与良性合规之间可预测地权衡。作者将其定位为 API 部署中轻量、可移植、可调的干预手段,论文共 38 页、14 图、10 表。

阅读原文arxiv.org