评测与基准arXiv 2609.33658
AgentBound:面向工具型 LLM Agent 安全的四路反事实评测框架
提出 AGENT BOUNDARY,用四向反事实任务评测工具智能体行动边界
- arXiv
- 2609.33658
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash 等 15 个
摘要四向反事实基准把过度拒绝和未授权遵从拆开,Thought 校正在十个配置上提高已授权完成。
AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。