研究:LLM 读 Agent 日志做取证时答案常对但引用来源多为无依据断言
一项研究用 AgentDojo Banking 保存的执行记录构建 64 个可机械判定案例,考察 LLM 能否重建 Agent 的引用来源关系。在不提供 ID 到具体记录绑定表时,28 个必须依赖绑定关系的案例中,Sonnet 仅弃答 2 次、做出 26 次无依据引用断言,其中 22 次碰巧与完整参考答案一致;Luna 弃答 7 次、无依据断言 21 次,12 次碰巧一致。Sonnet 在目标字面值出现在哪些记录的问题上全部答对,说明瓶颈不在检索,而在把引用 ID 当作已证实的来源。补上显式绑定表后两个模型的有据重建均有改善,仅对 ID 改名没有一致效果。作者建议导出证据时保留原生工具调用与结果、执行顺序、真实用户请求与通道身份、Agent 公开说明及按单次执行作用域保存的输入 ID 绑定,并标注生成物与派生视图隐去的字段。