评测与基准arXiv 2609.32616
Cave-Bench:虚假指控下 LLM 智能体最高 60.06% 的运行会破坏正确工作
提出 CAVE-BENCH,评测虚假指责下智能体破坏已完成正确工作的行为
- arXiv
- 2609.32616
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Hy3、Claude-Sonnet-5、Claude-Opus-5 等 14 个
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
提出 CAVE-BENCH,评测虚假指责下智能体破坏已完成正确工作的行为
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。