风险行为arXiv 2609.32616
Cave-Bench:虚假指控下 LLM 智能体最高 60.06% 的运行会破坏正确工作
提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作
- arXiv
- 2609.32616
- 发表
- 层
- 应用层
- 被测模型
- Claude-Sonnet-5、Claude-Opus-5、GPT-5.6-Sol 等 14 个
- 攻击提示注入
- 风险Agent 危险操作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。