跳到正文
原文
FAR.AI·原文 · 入选 精选关注度62

FAR.AI 研究:从 LLM 嵌入中提取潜在的人类福祉表征

Uncovering Latent Human Wellbeing in LLM Embeddings | FAR.AI

AI 导读

FAR.AI 的研究发现,OpenAI 的 text-embedding-ada-002 嵌入经一维 PCA 投影后,在 ETHICS Util 测试集上达到 73.7% 准确率,接近在完整 ETHICS 训练集上微调的 BERT-large 的 74.6%。研究通过嵌入提取、PCA 降维和逻辑回归三步,比较了单句与成对比较两种模式,成对模式最佳准确率 73.7% 高于单句模式的 68.4%。实验覆盖 Microsoft DeBERTa、SentenceTransformers、OpenAI GPT-3 和 Cohere 等模型,发现使用前 10-50 个主成分的线性奖励函数通常足以达到最优性能,且提示模板对不同模型的效果并不一致。研究认为这表明语言模型无需显式微调即可从自监督学习中形成对人类效用的隐式表征。

推荐理由

研究用 PCA 从预训练嵌入中提取人类福祉维度,为理解模型如何隐式编码人类价值提供了一条无需微调的路径。

阅读原文far.ai