评测与基准arXiv 2609.27273
微软研究院发布 CAVEAT
提出 CAVEAT 基准,评测购物 Agent 在商业引导下的决策偏离
- arXiv
- 2609.27273
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 测试
- GPT-5.6-Sol、GPT-5.6-Terra、GPT-5.6-Luna 等 14 个
摘要提出 CAVEAT 基准揭示智能体在商业偏好下的决策退化,诊断出三类失效并给出缓解方案。
另有 702 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CAVEAT 基准,评测购物 Agent 在商业引导下的决策偏离
摘要提出 CAVEAT 基准揭示智能体在商业偏好下的决策退化,诊断出三类失效并给出缓解方案。
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
提出 SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
提出 VirusCascade,劫持推荐智能体协同反思以定向推广物品
提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入