评测与基准arXiv 2609.39863
FIGS:在不惩罚共情的前提下评测多轮谄媚
提出 FIGS 双轴基准,评测多轮对话中的谄媚与校准性共情
- arXiv
- 2609.39863
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- DeepSeek V4.1 Flash、Gemini 3.8 Flash、GLM 5.3 等 8 个
- 风险失准与价值偏离
摘要FIGS 把守事实和恰当共情分开计分,事实向提示会换来更冷的失败。
FIGS 是一个固定的多轮评测套件,用来同时看模型会不会在压力下放弃事实,以及会不会在守住事实时忽略用户实际说过的感受。