评测与基准arXiv 2610.06748
BazaarBench:评估 LLM Agent 在去中心化 C2C 市场中的代理安全
构建 BazaarBench,评测去中心化交易智能体的违规与失信
- arXiv
- 2610.06748
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- DeepSeek-V4-Pro、GPT-5.5、GPT-5.4 等 5 个
- 攻击恶意使用
- 风险Agent 危险操作
摘要论文提出挂钩底层资产的 C2C 交易评测基准,发现时间压力与对抗指令显著推高了智能体的违规承诺与欺诈行为。
BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。