评测与基准arXiv 2609.39229
RAIM:用廉价小模型聚合替代前沿模型做幻觉检测
提出 RAIM,用交叉拟合堆叠聚合廉价评审检测幻觉
- arXiv
- 2609.39229
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Llama、Qwen、Mistral 等 10 个
摘要十个廉价评审的堆叠在可采纳区间接近 Sonnet,代价主要是一次域内校准。
提出 RAIM,用交叉拟合堆叠聚合廉价评审检测幻觉
摘要十个廉价评审的堆叠在可采纳区间接近 Sonnet,代价主要是一次域内校准。
提出 DERIVAUDIT 审计长期 Agent 记忆是否由交互历史导出
DERIVAUDIT 审计长期智能体的持久记忆是否由写入时可获得的交互历史支持,而不是只看以后能否被召回。
分析外部记忆对智能体处理不可回答问题的影响
这份研究在同一智能体框架里检查外部记忆会不会让不可回答问题的处理更稳,以及稳来自哪一种存储内容。