跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.08410· Hyun Gu Kang·· 24 天前

语言、越狱与简洁性:LLM 属性引导向量的免训练组合研究

Compositional Multilingual and Behavioral Attribute Steering

AI 导读

研究检验了大语言模型中语言、越狱与简洁性三类属性引导向量的可组合性,在来自两个模型家族、两种规模的四款指令微调模型上测试免训练加性组合能否保留各属性的引导效果。单属性引导在三类属性上均可靠,但需匹配合适的干预层与引导强度:抽象行为(越狱、简洁性)偏好中间层,语言偏好更早的层。当每个属性向量注入各自最佳层时,双属性加性组合可同时引导两个属性,三属性组合则部分成功;这些引导向量在残差流中近似正交,与其可组合行为一致。

阅读原文arxiv.org