分析与理论arXiv 2609.37312
研究:隐蔽推理必然留下信息痕迹,但思维链未必可读
分析隐蔽推理在思维链监控下的信息足迹下界与不可读性
- arXiv
- 2609.37312
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个
摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。
分析隐蔽推理在思维链监控下的信息足迹下界与不可读性
摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。
审计 Active Inference Agent 上 LLM 解释器的监督叙述失败
作者审计的是挂在智能体上的运行时解释器,而不是智能体本身。操作员读到的是信念与动作的自然语言叙述。作者要问哪些可复现触发会让这段叙述失败,以及失败痕迹是什么样。
把口头评测感知分成能力与安全框架并检验对服从的预测
作者分析 Qwen3-32B 在安全评测中的口头 eval-awareness,认为它不是单一、行为上均匀的量。