跳到正文
原文
论文追踪· arXiv:2610.09581·本站收录 · 原文发表 日期未标

研究审计 LLM 读取 Agent 日志的取证能力:答案正确但引用来源多为猜测

让 LLM 读 agent 日志做事后取证:答案对了,但引用来源多半是猜的

AI 导读

一项研究用 AgentDojo Banking 执行记录中的 64 个可机械核验案例,审计 LLM 读取 Agent 日志做取证重建时能否正确指认证据来源。两个 LLM 读取器在可见证据和标识符与记录绑定关系受控变化下重建来源关系,并分别评估完整记录一致性、有证据支撑的结论、有依据的弃答和无支撑断言。在保留原始标识符且没有绑定表时,Sonnet 找回了全部字面来源位置,但在 28 个需要缺失关系的案例中有 26 个给出了无支撑的引用来源断言,其中 22 个仍与完整参考答案一致。加入显式绑定后两个读取器的有据重建均有改善,而仅重命名标识符没有一致效果;一个确定性的同包比较器在该有界任务上始终正确作答或弃答。研究认为,仅凭事实一致不足以评估 Agent 日志的取证重建,需要保留显式的记录绑定以区分有支撑的发现与正确的猜测。

阅读原文arxiv.org