事件观察中
VarOps 发布企业级 Agent 记忆系统设计与基准
先了解这件事
AI 综述
VarOps 公布了一套面向全公司范围 Agent 的记忆系统设计与基准结果,主张把记忆当作受治理的记录而非文本堆砌。系统把每条观察蒸馏成 claim,记录谁在何时说了什么、有效区间以及来源片段,丢弃原始记录。在 LongMemEval 的 500 道长对话历史问题上,正确证据仍有 99.8% 进入前十条结果,摄取约 3500 万 token 花费 8.24 美元,使用 CPU 与免费本地嵌入模型。作者用 Gemma 4(310 亿参数)进行测试。
AI 根据报道生成 · 1 天前更新
最新进展10月8日 22:32
VarOps 公布企业级 Agent 记忆系统设计,称在 LongMemEval 上正确证据 99.8% 进入前十条。后续时间线
10月8日
- tessl.ioVarOps 发布企业级 Agent 记忆系统设计与基准:把观察蒸馏为带证据的 claim
VarOps 公布了一套面向全公司范围 Agent 的记忆系统设计与基准结果,主张把记忆当作受治理的记录而非文本堆砌。系统把每条观察蒸馏成 claim,记录谁在何时说了什么、有效区间以及来源片段,丢弃原始记录;在 LongMemEval 的 500 道长对话历史问题上,正确证据仍有 99.8% 进入前十条结果,摄取约 3500 万 token 花费 8.24 美元,使用 CPU 与免费本地嵌入模型。作者用 Gemma 4(310 亿参数开源权重模型)在单张租用 GPU 上重建全部记录,写下的 claim 数量与前沿模型提取器接近,答案质量只差 1 到 2 分。系统不覆写旧事实,新事实取代旧事实但两者都带日期保留,并把每个问题解析为已回答、检索无结果或超出系统所知三种状态;去掉拒答能力后整体分数仅从 88.0 降到 87.2,但 30 次诚实拒答变成了 30 条编造答案。
相关讨论
关注度走势
每天新增来源
- 10月8日 新增 1 个来源(1 家媒体、0 个账号)
- 10月9日 新增 0 个来源(0 家媒体、0 个账号)
- 10月10日 新增 0 个来源(0 家媒体、0 个账号)