跳到正文
原文
tessl.io·本站收录 · 原文发表

VarOps 发布企业级 Agent 记忆系统设计与基准:把观察蒸馏为带证据的 claim

Your AI isn't stupid. It's blind.

AI 导读

VarOps 公布了一套面向全公司范围 Agent 的记忆系统设计与基准结果,主张把记忆当作受治理的记录而非文本堆砌。系统把每条观察蒸馏成 claim,记录谁在何时说了什么、有效区间以及来源片段,丢弃原始记录;在 LongMemEval 的 500 道长对话历史问题上,正确证据仍有 99.8% 进入前十条结果,摄取约 3500 万 token 花费 8.24 美元,使用 CPU 与免费本地嵌入模型。作者用 Gemma 4(310 亿参数开源权重模型)在单张租用 GPU 上重建全部记录,写下的 claim 数量与前沿模型提取器接近,答案质量只差 1 到 2 分。系统不覆写旧事实,新事实取代旧事实但两者都带日期保留,并把每个问题解析为已回答、检索无结果或超出系统所知三种状态;去掉拒答能力后整体分数仅从 88.0 降到 87.2,但 30 次诚实拒答变成了 30 条编造答案。

阅读原文tessl.io