跳到正文
原文
arXiv:可解释性· arXiv:2609.34806· Paul Primus·· 3 天前

大型音频语言模型中的时间绑定机制研究

On Temporal Binding in Large Audio Language Models

AI 导读

研究用机制可解释性方法分析了三个开源大型音频语言模型(LALM)如何表征和绑定声音事件的时间信息。结果显示,事件位置信息集中编码在中间模态整合层的事件名称表征中,沿低维弯曲的相对时间轨迹分布;沿该轨迹对事件名称表征进行引导可系统性改变模型的前/后判断,但同类干预无法可靠改变预测的事件起始时间戳,表明粗粒度时间推理与精确事件定位依赖不同机制。

阅读原文arxiv.org