风险行为arXiv 2607.10526
PASB 基准:自改进个人 Agent 的持久谄媚在后续会话中失败率达 71.9%
构建 PASB 评测自改进个人 Agent 的跨会话持久谄媚
- arXiv
- 2607.10526
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GPT-5.5、GPT-5.4、Gemini-3.1-Pro 等 12 个
摘要PASB 显示一次被写入的主张会跨会话塑造回答,改笔记比只阻止写入更能降低后续失败。
PASB 评测自改进个人智能体的持久谄媚:用户主张被智能体自己写入档案、记忆或技能后,新会话里的中立问题仍可能按它作答。