可解释性arXiv:2610.08559 · 10月6日研究:LLM 潜在空间去偏方向主要编码置信度而非公平性分析激活引导去偏方向,发现其编码的是置信度而非公平性模型与 API·测试Llama-3.1-8B、Llama-3.1-8B-Instruct、Falcon3-7B-Base 等 8 个·模型层推理时干预偏见与歧视摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。完整解读
分析与理论arXiv:2609.37312 · 9月29日研究:隐蔽推理必然留下信息痕迹,但思维链未必可读分析隐蔽推理在思维链中的信息足迹与不可读性模型与 API·测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个·模型层监控与审计欺骗与谋划推理链+1+1摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。完整解读