评测与基准arXiv:2610.06748 · 10月5日BazaarBench:评估 LLM Agent 在去中心化 C2C 市场中的代理安全构建BazaarBench,评测去中心化交易智能体的违规与失信测试GPT-5.5、GPT-5.4、GPT-5.4-mini 等 5 个·应用层场景多智能体恶意使用Agent 危险操作+1+1摘要论文提出挂钩底层资产的C2C交易评测基准,发现时间压力与对抗指令显著推高了智能体的违规承诺与欺诈行为。BazaarBench针对大语言模型智能体在去中心化C2C交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。完整解读