Brennan Center 在加州 AI 透明度法生效后复测六款聊天机器人识别 AI 生成图像的能力,结果显示表现没有改善。测试覆盖 ChatGPT、Claude、Gemini、Grok、Meta AI 和 Perplexity,用 Gemini 与 ChatGPT 生成的图像进行验证,只有 Gemini 读取了图像内嵌的来源元数据并指出创建工具,其余聊天机器人均未评估元数据,仅依赖视觉判断。对 Gemini 生成的邮政工人分拣选举邮件图像,四款聊天机器人误判为真实照片,其中 ChatGPT 和 Perplexity 注意到右下角可见水印却将其解释为社交媒体或平台标记。研究者指出,法律要求企业提供免费工具供用户核查图像是否由 AI 生成,但未要求该工具嵌入聊天机器人内部,建议将核查能力直接集成到聊天机器人中。
METR 发布 Claude Opus 5.5 部署前评测摘要,认为其在可验证与难验证的 AI 研发任务上较 Fable 5.1 有增量提升,但证据不支持它已能完全自动化 AI 研发,研究判断与自建反馈循环仍有弱点。报告认为 AI 对模型开发至少有一定加速,但不太可能造成剧烈加速。文中约 1.5 倍的估算来自 METR 另一团队的高度实验性报告,该团队只分享结论而未向评测团队分享证据,也未说明估算适用时段。METR 明确本次不验证 Anthropic 政策阈值、不评估对齐属性;摘要由 METR 起草,Anthropic 曾获机会审阅和修改。
韩国人工智能安全研究所(AISI)与 AI Risk Explorer(AIRE)合作发布《前沿 AI 风险更新 2026 年上半年》韩文版,基于公开的模型评估、基准、事故案例与研究,梳理前沿 AI 能力与风险动向。报告围绕网络攻击、失控、生物风险与操纵四个领域,指出 Claude Mythos 5、GPT-5.5、GLM-5.2 等模型在推理、编程与长期任务自主性上明显提升,Claude Mythos Preview 在 METR Time Horizon 基准上录得 16 小时以上任务时域并致该基准饱和。
我尤其对我们最近系统卡中对齐评估的这部分感到兴奋。(感谢 @MaskedTorah。)
利用 AI 系统实现透明度和协调,还有大量未被充分探索的潜力。
引用Claude@claudeai
Introducing Claude Opus 4.8: it builds on Opus 4.7 with sharper judgment, more honesty about its own progress, and the ability to work independently for longer than its predecessors.
Available today at the same price.
Redwood Research 团队与 Anthropic 合作开发了概念推理指数(CRI),用于衡量模型在缺乏廉价可靠反馈的领域中的推理能力,例如判断某项实验能否说明未来远超人类的模型的行为。CRI 的每一条数据都由团队研究员人工核查以保证质量。评测中 0 分对应三项基准上全部随机猜测,100 分为最高分,团队估计真实性能上限为 91。官方排行榜网站为 https://conceptualreasoning.ai/,将持续更新。Buck Shlegeris 转发了 Em 及其团队这项工作并表示期待。
引用Emery Cooper@emwcooper
We want AIs to be able to help with work to reduce AI risk. But while models do great in domains where reliable feedback is relatively cheap and abundant, like Math and coding, a lot of work on AI risk isn't like that. Instead, we have to rely on good argumentation to answer questions like "does this experiment tell us anything about future models that are much smarter than humans?"
Unfortunately, this kind of work seems much harder to measure (and hence automate). Our team at @redwood_ai developed the Conceptual Reasoning Index (CRI) in collaboration with @AnthropicAI to fix this.
Every single data point in the CRI has been manually checked by a researcher on our team to ensure quality.
This chart shows the performance of each tested company's highest-scoring model plus Fable 5, Muse Spark 1.2, and Gemini Flash 3.6 which are often their company's frontrunners on other capability benchmarks. A score of 0 corresponds to randomising guessing on all three benchmarks and a score of 100 is the highest possible score on all. We estimate 91 to be the true performance ceiling. More info below.
Official leaderboard website which we'll keep up-to-date: https://conceptualreasoning.ai/
AI Security Leaderboard 更新后显示,GPT-6 Astra 和 Claude Fable 5.1 在 Minimal Standard for Safeguards 测试中均未发现通用越狱。该结果并非自动延续,新模型更新后仍保持零通用越狱意味着护栏被重建。发布方希望其他前沿模型厂商也能达到这一标准。
BlueDot Impact 的技术 AI 安全项目冲刺中,Allen Lu 提交的项目 MANTA 提出一套多轮动态评估,用来测量前沿 AI 模型如何在非人类福利议题上进行推理,并加入对抗性追问来压力测试其对齐表现。该方案计划扩充覆盖商业决策、个人选择与职业角色等场景的高质量情景集,接入 Anthropic 的 Petri 工具增强对抗压力的自动生成,并在规模化测试前先用人类基线作答校验题目有效性,同时探索赋予模型外部工具与网页搜索能力的智能体化设置。
Epoch AI 将旗下未解数学难题基准 FrontierMath: Open Problems 扩充至 50 道专业数学家未能攻克的题目,目前 AI 仅解决其中三道。该组织同时发布了 AI 研发并行化约束可能推迟甚至阻止技术奇点到来的报告,以及一份解析 AI 能耗需求及其对气候和地方社区影响的指南。两则数据分析显示,主流 AI 文本检测器对人类写作几乎不误报,但在模仿特定作者风格时漏检率平均达 13%,科学类仿写段落漏检率约为 26%;另一项分析中,OpenAI Codex 公开仓库 41 位核心贡献者在 2026 年第二季度有 8% 的人日工作量估计超过 24 小时无辅助工时。