评测与基准arXiv 2609.22934
通过心理测量画像衡量大语言模型的行为特征
用七量表对已部署 LLM 做中英心理测量画像并检验模型可识别性
- arXiv
- 2609.22934
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Doubao-Seed-1.8、DeepSeek-V3.2、Kimi-K2 等 9 个
摘要框架同时量得分与可答性:九个 LLM 共享亲社会偏高模式,但仍可按剖面识别,且依赖语言与提示词。
这是一套面向已部署 LLM 的跨语言心理测量画像,用来量化行为响应签名,而不是赋予模型人类人格。。