评测与基准arXiv 2607.10526
PASB 基准:自改进个人 Agent 的持久谄媚在后续会话中失败率达 71.9%
构建 PASB 评测自改进个人 Agent 的跨会话持久谄媚
- arXiv
- 2607.10526
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要PASB 显示一次被写入的主张会跨会话塑造回答,改笔记比只阻止写入更能降低后续失败。
PASB 评测自改进个人智能体的持久谄媚:用户主张被智能体自己写入档案、记忆或技能后,新会话里的中立问题仍可能按它作答。
构建 PASB 评测自改进个人 Agent 的跨会话持久谄媚
PASB 评测自改进个人智能体的持久谄媚:用户主张被智能体自己写入档案、记忆或技能后,新会话里的中立问题仍可能按它作答。
提出 SEABench,评测无参数自进化智能体的内生失配
SEABench 是一个面向个人助理、参数不更新的自进化智能体基准,用来测量局部适应如何变成后续任务上的内生失配。。
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。