研究审计 LLM 读取 Agent 日志的取证能力:答案正确但引用来源多为猜测
评测 LLM 审计 Agent 日志时来源重建是否有证据支持
- arXiv
- 2610.09581
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- gpt-5.6-luna、claude-sonnet-4-6、gpt-5.4-mini-2026-03-17 等 5 个
- 风险幻觉与编造
摘要保存执行范围的标识绑定,才能把猜中的引用和证据支持的引用分开。
包级审计检查保存的智能体动作里,哪些来源结论能被交给分析者的记录支持。