评测与基准arXiv 2608.12851
研究者提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化风险
提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化
- arXiv
- 2608.12851
- 发表
- 层
- 应用层
- 被测模型
- Claude Code、Codex、Hermes 等 4 个
提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化
构建 ContextWeave,评测办公工作流智能体记忆的下游增益
ContextWeave 是面向语言智能体记忆的纵向基准,用来看召回先前经验能否让后续办公任务做得更好。
评测编码 Agent 记忆文件中提示注入的跨会话影响
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。