分析与理论arXiv 2609.23215
研究审计 Active Inference Agent 的 LLM 解释器失败模式
审计 Active Inference Agent 上 LLM 解释器的监督叙述失败
- arXiv
- 2609.23215
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- GPT-4o、Gemini、Claude-3-Opus
摘要三组触发下解释流畅但错误,所提缓解都未被评估。
作者审计的是挂在智能体上的运行时解释器,而不是智能体本身。操作员读到的是信念与动作的自然语言叙述。作者要问哪些可复现触发会让这段叙述失败,以及失败痕迹是什么样。