跳到正文
原文
arXiv:可解释性· arXiv:2609.19831· Noah Mamié·· 15 天前

复现透明可审查推荐:通过自然语言用户画像探索开放权重模型

Reproducing Transparent and Scrutable Recommendations: Exploring Open-Weight Models via Natural-Language User Profiles

AI 导读

一项复现研究验证了自然语言用户画像推荐(UPR)在 Amazon Movies & TV、TripAdvisor 上能达到原论文所称的竞争性重排序性能,并提升推荐透明度。研究用五个随机种子做稳定性检验,并用 nnsight 框架做机制可解释性分析,发现扰动自然语言画像虽会改变预测评分,但各类型均匀偏移、无类型选择性效应,排序不变,即便直接做激活引导也如此。作者将原因归于评分回归目标而非画像接口,排序目标模型在该任务上明显更优。

阅读原文arxiv.org