评测与基准arXiv:2609.27273 · 9月23日微软研究院发布 CAVEAT提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择网页与电脑操作·测试GPT-5.6-Sol、GPT-5.6-Terra、GPT-5.6-Luna 等 14 个·应用层摘要提出 CAVEAT 基准揭示智能体在商业偏好下的决策退化,诊断出三类失效并给出缓解方案。完整解读