跳到正文
原文
arXiv:可解释性· arXiv:2609.15654· JuHeon Ha·· 17 天前

共情可被激活引导但呈多轴结构:LLM 中的机制几何与人格效应

Empathy Is Steerable but Multi-Axial: Mechanism Geometry and Persona Effects in LLMs

AI 导读

基于 EPITOME 框架(将支持性共情分解为情绪反应、解释与探索三个维度),研究者在三个指令微调 LLM 上发现,对比激活添加能在中间层产生稳定干预并一致改变 EPITOME 代理分数,但恢复出的方向仅部分可分,引导一个方向会引发非目标偏移。人格提示词会显著改变 EPITOME 分数,而配对激活偏移分解显示,恢复的子空间在第 15 层仅捕获约 3% 的人格诱导激活偏移平方幅度。在该定义下,LLM 表达的共情可被引导但呈多轴结构,控制人格条件下的共情需要针对超出单个机制方向的结构。

阅读原文arxiv.org