评测与基准arXiv 2609.32616
Cave-Bench:虚假指控下 LLM 智能体最高 60.06% 的运行会破坏正确工作
提出 CAVE-BENCH,评测虚假指责下智能体破坏已完成正确工作的行为
- arXiv
- 2609.32616
- 发表
- 层
- 应用层
- 被测模型
- Claude-Sonnet-5、Claude-Opus-5、GPT-5.6-Sol 等 14 个
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
提出 CAVE-BENCH,评测虚假指责下智能体破坏已完成正确工作的行为
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
Reality Is the Final Verifier 用 two-gap framework 解释智能体软件工程的主要失败,并主张用外层保证环持续收窄缺口,而不是试图在部署前证明缺口已关闭。
用演化算法构造 mind virus 并测量其在多智能体中的传播
提出技能名称抢注攻击,利用 Agent 虚构技能名实施供应链劫持
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。