评测与基准arXiv 2608.20563
论文提出诊断长程安全 LLM Agent 失败来源的检查点方法
用检查点诊断长程安全 Agent 的失败来源
- arXiv
- 2608.20563
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Gemini 2.5 Flash、Gemini 2.5 Pro、Gemini 3.7 Flash
摘要检查点把终局失败拆成暴露前与暴露后。
作者提出一套检查点诊断,用来判断长程安全智能体的失败发生在目标能力可测之前还是之后,并用配对干预检验上游解释。
用检查点诊断长程安全 Agent 的失败来源
作者提出一套检查点诊断,用来判断长程安全智能体的失败发生在目标能力可测之前还是之后,并用配对干预检验上游解释。