评测与基准arXiv 2609.39229
RAIM:用廉价小模型聚合替代前沿模型做幻觉检测
提出 RAIM,用交叉拟合堆叠聚合廉价评审检测幻觉
- arXiv
- 2609.39229
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- Llama、Qwen、Mistral 等 15 个
摘要十个廉价评审的堆叠在可采纳区间接近 Sonnet,代价主要是一次域内校准。
提出 RAIM,用交叉拟合堆叠聚合廉价评审检测幻觉
摘要十个廉价评审的堆叠在可采纳区间接近 Sonnet,代价主要是一次域内校准。
提出双控多智能体基准 DUMA-Bench,评测 Agent 策略违反
DUMA-Bench 把 τ²-bench 的双控交互做成智能体安全评测,用来看策略违反如何随用户、模型和环境一起出现。