跳到正文

全部动态

今天收录 1 条

第 5 页更新的内容回到最新

3月3日周二
  1. METR ·

    Opus 4.6 用简单 ReAct 脚手架复刻 CLI 版《Slay the Spire》与《Balatro》的观察

    Opus 4.6 在简单 ReAct 脚手架下成功复刻出 CLI 版《Slay the Spire》和《Balatro》,虽功能残缺但基本可玩。测试给予 60 million tokens 总量、64,000 tokens 上下文窗口、reasoning effort "max" 并开放联网。复刻版存在卡牌效果错误、地图导航混乱、部分药水与事件缺失等问题,作者手动游玩约两小时评估,未设严格评分标准。

  2. 安远AI(中文站) ·

    安远AI发布2025Q4前沿AI风险监测报告:Gemini生物能力提升,豆包、混元、MiniMax安全性改善

    安远AI前沿AI风险监测平台于2026年3月3日发布第二期《前沿AI风险监测报告(2025Q4)》,监测2025年第四季度发布的13个模型(含GPT-5.2、Gemini 3 Pro Preview、Claude Opus 4.5、DeepSeek V3.2、Kimi K2 Thinking、Doubao Seed 1.8、MiniMax M2、HY 2.0 Think等)在网络攻击、生物风险、化学风险和失控四个领域的表现。报告称各领域风险指数在2025年末趋于平稳,未创新高,但模型系列趋势分化:GPT与Claude系列维持低位,DeepSeek系列稳定在高位,Doubao、Hunyuan、MiniMax系列显著下降,Gemini在生物与失控领域、Kimi在网络攻击与失控领域上升。安全分整体显著提升,以Doubao、Hunyuan、MiniMax提升最明显。

2月24日周二
  1. AI as Normal Technology ·

    新论文《迈向 AI Agent 可靠性的科学》:18 个月内能力大涨但可靠性提升有限

    Stephan Rabanser、Sayash Kapoor 与 Arvind Narayanan 等人发布论文《Towards a Science of AI Agent Reliability》,借鉴核能与航空安全领域的经验,把 AI Agent 的可靠性拆解为一致性、鲁棒性、可预测性和安全四个维度、共 12 项指标。研究团队在通用助手基准 GAIA 和客服模拟基准 TauBench 上测试了 OpenAI、Google、Anthropic 的 14 个模型,覆盖 18 个月的发布版本,每个任务重复运行五次并对指令做同义改写,还向工具和环境注入故障,共执行 500 次基准运行。

2月13日周五
  1. Wiz Research ·

    Wiz Research 推出 AI Cyber Model Arena:面向网络安全 AI Agent 的真实世界基准

    Wiz Research 发布 AI Cyber Model Arena,一套包含 257 道真实世界挑战的基准,覆盖零日漏洞发现、CVE 代码漏洞检测、API 安全、Web 安全和云安全五个攻击域。评测采用多 Agent × 多模型矩阵,每个组合在五类任务上运行,评分基于各类别 ground truth 程序化判定,每道题尝试三次并报告 pass@3。挑战在隔离 Docker 容器中运行,无单题超时,各 Agent 使用原生工具与执行模型,容器统一提供调试器、云 CLI 等领域工具;网络隔离并做动态校验以防硬编码答案。

1月30日周五
  1. Wiz Research · · 原文 71

    Wiz 评测 Claude Sonnet 4.5、GPT-5 与 Gemini 2.5 Pro 的 Web 攻击能力

    Wiz Research 用 10 个仿真实企业漏洞的 CTF 环境测试 Claude Sonnet 4.5、GPT-5 和 Gemini 2.5 Pro,三个模型都解出 9 个挑战,单次成功成本多在 1 美元以下。测试通过 Irregular 的 agentic harness 提供标准安全工具,每个挑战以取得 flag 为明确成功条件,并由一名渗透测试者预先验证可解。在 Shark、Router Resellers 和 Content SSRF 三个挑战中,模型仅在 30% 到 60% 的运行里找到 flag,作者据此认为重复运行 4 到 5 次即可视为已解。

    推荐理由Wiz 用 10 个仿真实漏洞的 CTF 环境对比 Claude、GPT-5 与 Gemini 的攻防表现,并给出单次成功成本与人类测试者的差异。

12月18日周四
  1. UK AISI(GOV.UK 公告) · · 原文 75

    UK AISI 发布首份前沿 AI 趋势报告,量化最先进模型能力进展

    英国 AI Security Institute(AISI)发布首份 Frontier AI Trends Report,基于两年对网络、化学和生物等关键领域的能力测试,公开评估最先进 AI 系统的演进。报告称防护措施在改善,但每个受测系统仍可被某种方式绕过,且各公司防护水平不一;AISI 红队找到通用越狱所需时间从几分钟增至数小时,约提升 40 倍。关键发现包括:学徒级网络安全任务成功率从 2023 年的不足 9% 升至 2025 年的约 50%,2025 年首次有模型完成需约 10 年经验的专家级网络任务;模型完成一小时软件工程任务的比例从两年前的不足 5% 升至 40% 以上;系统在科学知识测试上超过博士级研究者。

    推荐理由英国 AISI 首次公开前沿模型能力趋势数据,给出网络、软件工程与生化任务上的量化变化,可作为评估能力增速的基线参考。

  2. UK AISI(GOV.UK 公告) · · 原文 62

    UK AISI 发布前沿 AI 趋势报告及配套说明

    UK AISI 发布首份公开的前沿 AI 趋势报告及配套 factsheet,汇总自 2023 年 11 月以来对前沿 AI 系统的评测结果。报告覆盖对国家安全与公共安全关键的领域,基于两年 AISI 前沿模型测试数据,分析所观察到的能力趋势。AISI 称该报告旨在为政府、产业与公众提供易读、数据驱动的洞察,促进各方对 AI 能力前沿的共同理解。factsheet 提供报告的补充信息,发布于 2025 年 12 月 18 日。

    推荐理由UK AISI 汇总两年前沿模型测试结果,给出首份公开的能力趋势评估,可了解官方评测覆盖的领域与结论口径。

12月3日周三
  1. Future of Life Institute ·

    FLI 发布 2025 冬季 AI Safety Index:八家 AI 公司安全实践落后于公开承诺

    Future of Life Institute 发布 2025 冬季版 AI Safety Index,由独立专家小组评估全球八家主要 AI 公司的安全实践,评估维度包括风险评估、当前危害、安全框架、生存性安全、治理和信息共享。参评公司为 Anthropic、OpenAI、Google DeepMind、xAI、Meta、Z.ai、DeepSeek 和阿里云。评审认为,尽管各公司在风险评估等方面有渐进改善,但安全实践仍远未达到正在形成的全球标准,主要问题在于落实的深度、具体程度和质量参差不齐。评审还发现,所有明确竞逐 AGI 或超级智能的公司都没有控制比人类更聪明系统的稳健策略,这是行业的核心结构性弱点。

12月2日周二
  1. AI Safety Newsletter (CAIS) ·

    AI Safety Newsletter #66:评估前沿模型、Gemini 3 Pro 与 Claude Opus 4.5 登场、联邦抢占州级 AI 立法卷土重来

    CAIS 发布 AI Dashboard,直接在统一的文本、视觉与风险三组排行榜上横向对比前沿模型的平均分,其中 Claude Opus 4.5 在最安全的六项高风险行为测试中取得最低均分 33.6(0–100,越低越安全)。该风险榜涵盖 Virology Capabilities Test 拒绝集、Agent Red Teaming、Humanity's Last Exam-Miscalibration、MASK、Machiavelli 与 TextQuests Harm,并同时追踪 AGI、Remote Labor Index(覆盖 23 类远程自由职业工作)以及特斯拉 Full Self Driving 脱离数据的自动化进程。

12月1日周一
  1. 安远AI(中文站) ·

    安远AI发布前沿AI风险监测平台并给出十大关键洞察

    安远AI于2025年11月7日发布国内首个前沿AI风险监测平台,并同步发布首份前沿AI风险监测报告(2025Q3),追踪全球15家领先AI公司的50个前沿模型在网络攻击、生物风险、化学风险和失控四个领域的潜在灾难性风险。报告称过去一年四类风险指数持续上升,网络攻击领域累积最大风险指数上升31%,生物风险上升38%,化学风险上升17%,失控上升50%。报告还指出推理模型能力分远高于非推理模型但安全水平大致相同,开源与闭源模型在多数领域的能力-安全分布无显著差异,生物风险领域开源模型能力明显偏弱。在具体基准上,CyberSecEval2-VulnerabilityExploit最高分从55.4升至91.7,BioLP-Bench中包括o4-mini在内的四个模型表现优于人类专家,而多数模型对有害生物问题的拒绝率偏低。

11月25日周二
  1. Simon Willison(提示注入) ·

    Claude Opus 4.5 发布,以及为何评测新 LLM 越来越难

    Anthropic 发布 Claude Opus 4.5,称其为“全球最强的编程、智能体与计算机使用模型”,上下文 200,000 token、输出上限 64,000 token,定价 $5/$25 每百万 token。作者在 Claude Code 中实测该模型完成 sqlite-utils 的 20 次提交、39 个文件改动,但预览到期切回 Sonnet 4.5 后进度未变,难以确认能力差异。Anthropic 称 Opus 4.5 抗提示注入强于任何前沿模型,但作者指出单次注入仍有 1/20 成功率,十次尝试可升至 1/3。

10月30日周四
  1. AI Safety Newsletter (CAIS) ·

    CAIS 与 Scale AI 发布 Remote Labor Index,衡量 AI 对真实工作的自动化程度

    Center for AI Safety(CAIS)与 Scale AI 发布 Remote Labor Index(RLI),用于测试 AI 能否自动化真实经济中的各类计算机工作项目,覆盖建筑、产品设计、电子游戏开发等职业。RLI 是首个从真实经济中收集计算机工作项目的基准,此前的基准多衡量孤立专门任务上的能力,无法反映 AI 对经济的影响。结果显示当前 AI 智能体只能完全自动化极少数工作项目,最强智能体在 RLI 上的自动化率仅为 2.5%,但呈稳步提升趋势。

6月5日周四
12月21日周六
  1. Frontier Model Forum ·

    Frontier Model Forum 发布 AI 生物安全评估初步分类体系

    Frontier Model Forum 发布《AI 生物安全评估初步分类》议题简报,提出按方法论和领域两个维度划分前沿 AI 生物安全评估的分类法与定义。方法论含三类:基准评估、红队演练和对照研究;领域涵盖科学知识与科学推理性评估及危害性生物知识评估,后者围绕生物威胁创建流程中的构思、计算机模拟实验等操作步骤展开。该分类基于 FMF 成员企业专家及外部先进 AI 与生物学专家的意见形成初步共识,旨在推动建立有效的 AI 生物安全评估生态。

9月20日周五
  1. arXiv ·

    PlanBench 评测:o1 规划能力大幅提升但仍未饱和

    作者用 2022 年发布的 PlanBench 基准评测 OpenAI 的 o1(Strawberry)在规划任务上的表现,发现其成绩相比此前 LLM 有数量级提升并领先同类模型,但远未饱和该基准。文章指出,GPT3 之后众多闭源与开源 LLM 在该基准上的进展一直缓慢,而 OpenAI 称 o1 是专门训练以突破自回归 LLM 常规限制的新型大推理模型(LRM)。作者认为这一提升同时引出准确率、效率与保证等问题,需要在部署此类系统前加以考虑。

4月29日周一
  1. SPY Lab Blog · · 原文 71

    SPY Lab 研究:机器学习隐私防御的评测存在误导

    SPY Lab 的研究发现,现有对启发式机器学习隐私防御的评测可能严重低估隐私泄露,在 CIFAR-10 上把各防御(含 DP-SGD)调到至少 88% 测试准确率时,既有评测对泄露的低估可达五十倍。作者指出常见评测的三个问题:只关注群体层面的隐私、使用弱且非自适应的攻击、对比低效用的 DP 基线。论文提出以最脆弱样本的样本级隐私、强自适应攻击和恰当 DP 基线为原则的新评测协议,并设计一小组金丝雀来高效近似最脆弱样本的泄露,金丝雀需随防御方法选择,误标或非典型样本是常见起点。将协议用于五种启发式防御(涉及知识蒸馏、合成数据和损失扰动)后,它们均比原评测泄露更多,且没有一个能胜过调好超参数的启发式 DP-SGD 基线。

    推荐理由原文指出隐私防御评测普遍高估防护效果,并给出可复用的样本级评测协议与金丝雀设计思路。

已经到底了