SafeActBench 发布:工具型 Agent 在证据到行动链上的失败模式
构建 SAFEACTBENCH 评测工具型 Agent 的证据到行动失败
- arXiv
- 2610.07753
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Claude Opus 5、GPT-5.6 Sol、DeepSeek-V4-Flash 等 5 个
摘要作者称失败常起于调查不足或过早行动,证据齐后的单步则少失败。
SAFEACTBENCH 评测工具智能体的 consequential actions 是否由行动前已建立的证据支持,而不是只看终态对不对。