Import AI 469:DiG-bench 游戏发现基准、RSI 模拟器与扎克伯格的技术悲观主义
DiG-bench(Discovery in Games)发布,用 70 款规则与目标均隐藏、需靠交互探索的文本游戏评测 AI 的发现能力,其中 21 款已公开。
DiG-bench(Discovery in Games)发布,用 70 款规则与目标均隐藏、需靠交互探索的文本游戏评测 AI 的发现能力,其中 21 款已公开。
METR 研究发现 AI 对科学发现的加速并不均衡:2026 年 cURL、OpenSSL、Firefox 等项目的漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速,AI 研究本身则无可测量的加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境与求解,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线提升 8.1。
Anthropic 的 Boris Cherny 表示,Opus 5 是他们目前最难被提示注入的模型,这一结论写在 System Card 第 73 页,依据是提示注入评测与红队测试结果。他认为这一信息在 System Card 中被埋得较深,但比各项评测分数更令他兴奋。
作者发布 WorkspaceBench,一套评估激活到文本工具能否读取模型全局工作区(前向传播中的中间变量)的基准,共 3356 道题、27 个评测族,覆盖安全、逻辑推理与多跳计算,并包含面向单 token 输出工具的子集和专门的幻觉评测。基准基于 Qwen-3.6-27B 开发,作者预期可用于更大模型,但更小或更弱的模型可能需要调整。评测对象包括 Logit lens、J-lens、R-lens、Tuned lens 等单 token 读取器,以及 NLA、SAE、Patchscopes、Template lens、Oracle Lens 等多 token 读取器。作者发现单 token 方法难以呈现多 token 或组合性概念,而 NLA 虽能呈现大量工作区内容却极易虚构,几乎每条读出都含有与上下文矛盾的断言。