AI Alignment Forum· camilablank·2026-09-23 14:58· 9 天前WorkspaceBench:评测可解释性方法读取模型全局工作区的能力WorkspaceBench: Evaluating Interpretability Methods for the Global WorkspaceAI 导读作者发布 WorkspaceBench,用于评测激活到文本工具读取模型全局工作区内容的能力,即前向传播中的中间变量。该基准包含 27 个评测族共 3,356 道题,覆盖安全、逻辑推理和多跳计算等主题,并设有单 token 输出工具子集和针对模型幻觉的评测。阅读原文alignmentforum.org#安全评测#可解释性#思维链