AIMES:通过因果激活引导实现 LLM 自适应多价值观控制
Adaptive Multi-Value Control in LLMs via Causal Activation Steering
AI 导读
AIMES 是一个面向 LLM 的自适应多价值观激活引导框架,为道德基础价值观构建分层双极方向,并以中间层词表读出作为在线观察者,在每个解码步动态调整各价值观干预强度。在多个指令微调模型系列、价值观组合和干预深度上,多价值观可控性随组合与干预位置而变化;相比固定联合引导和基于提示词的引导,AIMES 表现出依赖深度的优势,且实际激活空间干预更小、回复质量相当。