跳到正文
原文
arXiv:可解释性· arXiv:2609.30405· Payel Bhattacharjee·· 7 天前

AIMES:通过因果激活引导实现 LLM 自适应多价值观控制

Adaptive Multi-Value Control in LLMs via Causal Activation Steering

AI 导读

AIMES 是一个面向 LLM 的自适应多价值观激活引导框架,为道德基础价值观构建分层双极方向,并以中间层词表读出作为在线观察者,在每个解码步动态调整各价值观干预强度。在多个指令微调模型系列、价值观组合和干预深度上,多价值观可控性随组合与干预位置而变化;相比固定联合引导和基于提示词的引导,AIMES 表现出依赖深度的优势,且实际激活空间干预更小、回复质量相当。

阅读原文arxiv.org