跳到正文
原文
AI Alignment Forum· camilablank·· 9 天前

WorkspaceBench:评测可解释性方法读取模型全局工作区的能力

WorkspaceBench: Evaluating Interpretability Methods for the Global Workspace

AI 导读

作者发布 WorkspaceBench,用于评测激活到文本工具读取模型全局工作区内容的能力,即前向传播中的中间变量。该基准包含 27 个评测族共 3,356 道题,覆盖安全、逻辑推理和多跳计算等主题,并设有单 token 输出工具子集和针对模型幻觉的评测。

阅读原文alignmentforum.org