评测与基准arXiv 2609.03588·9月3日KC-Bench:评估 LLM Agent 知识冲突的动态交互基准提出 KC-Bench,评测 Agent 行动前的知识冲突检出与违规避免arXiv2609.03588发表9月3日层应用层场景AI Agent测试GPT-5.1、Gemini-3-flash-preview、Claude-haiku-4-5-20251001 等 9 个风险Agent 危险操作深度解读完整解读