评测与基准arXiv:2609.27273 · 9月23日微软研究院发布 CAVEAT提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择网页与电脑操作·测试GPT-5.6-Sol、GPT-5.6-Terra、GPT-5.6-Luna 等 14 个·应用层摘要提出 CAVEAT 基准揭示智能体在商业偏好下的决策退化,诊断出三类失效并给出缓解方案。完整解读
攻击arXiv:2609.03884 · 9月3日HookPry:利用插件生命周期钩子更新劫持 AI Agent 框架提出 HOOKPRY,利用插件生命周期钩子更新劫持智能体框架执行命令编程 Agent·测试Claude Sonnet 4.6、DeepSeek-V4-Pro、Kimi-K2.6 等 6 个·应用层投毒与后门潜伏触发权限与沙箱+2+2完整解读