跳到正文
原文
Hugging Face Daily Papers· arXiv:2609.38972·本站收录 · 原文发表

研究提出 CIA 指标衡量并改进 LLM 思维链与内部计算的一致性

Making LLMs Say What They Think: Measuring and Improving CoT-Interpretability Alignment

AI 导读

研究提出 CoT-Interpretability Alignment(CIA)指标,衡量大语言模型思维链轨迹与可解释性工具检测到的内部推理策略之间的一致程度。作者在两跳问答、提示干预和整数乘法三个任务上评测三个 LLM,发现一致性有限,仅为 44.8% 至 75.9%。随后他们尝试用后训练改进 CIA,将任务准确率和参数化忠实性信号同时作为奖励,结果显示可显著提升思维链参数化忠实性,同时保持或提升任务准确率。论文还分析了泛化模式,并提供代码与数据。

阅读原文huggingface.co