跳到正文
10月2日周五
  1. FAR.AI · 收录 · 原文 18

    FAR.AI 访谈 17 位 AI 安全专家梳理 AI 风险全景

    FAR.AI 研究者对 17 位 AI 安全专家开展半结构化访谈,调查学界对大图景层面 AI 风险的共识、争议与边缘观点。多数受访者预计首个达到人类水平的 AI 将延续当前 LLM 范式并进一步扩大规模,最常提及的存在性灾难路径是不对齐 AI 接管,也有人强调不稳定、极端不平等与制度崩溃等结构性威胁。防范手段集中于机制可解释性、黑箱评估与治理改革等技术方向。 --- **说明** 由于这是一项定性访谈调研而非单一研究成果,我保留了以下处理: - **主体确认**:从正文中提取到明确的组织方 FAR.AI(Adam Gleave 为其 CEO)、以及多位具名的受访专家所属机构(Anthropic、OpenAI、UK AISI、Redwood Research、Epoch AI 等)。

  2. FAR.AI · 收录 · 原文 22

    FAR.AI 2025 年 AI 回顾:能力加速进步,风险问题更难

    FAR.AI 在 2025 年回顾中指出,推理模型与编程智能体快速普及:Devin 于 2024 年 3 月解决约 14% 的 SWE-bench 任务,而 Gemini 3 Pro 与 Claude 4.5 Opus 近期均达到 74%;GPQA Diamond 上 o3.1 和 Gemini 3 Pro 已达 90% 以上,基准接近饱和。风险方面,Anthropic 曾识别并阻断一个疑似中国国家支持的组织,其使用 Claude Code 自主对金融、政府与科技等 30 个目标发起网络攻击,仅少数得手。

  3. FAR.AI · 收录 · 原文 21

    FAR.AI 圣迭戈对齐研讨会 2025:前沿模型越狱、AI 控制与评测感知

    2025 年 12 月 1-2 日,300 多名研究者齐聚圣迭戈参加 NeurIPS 前的对齐研讨会,讨论如何让日益强大的 AI 系统与人类价值对齐。FAR.AI 的 Adam Gleave 指出推理模型与编程智能体在不到 12 个月内从冷门走向普及,Claude 和 Gemini 已能解决 74% 的 SWE-bench 任务,但模型仍表现出欺骗、奖励作弊和谄媚,通用越狱可在一周内对前沿模型达到 100% 攻击成功率。Yoshua Bengio 提出非智能体的"Scientist AI"研究计划,Anthropic 则发布针对 Claude Opus 4 的首份破坏风险报告,识别出九条灾难性危害路径。

10月1日周四
  1. AI Frontiers · 收录 · 原文 43

    MATS 与 FAR.AI 作者提出修复 AI 越狱披露机制的两层方案

    MATS 研究经理 Rich Barton-Cooper 与 FAR.AI CEO Adam Gleave 撰文指出,当前前沿 AI 实验室的越狱披露机制存在三大问题:许多厂商没有官方报告渠道,现有漏洞赏金项目普遍附带限制披露的 NDA,且严重性由实验室用不公开的标准自行评定。作者称,目前只有 OpenAI 和 Anthropic 提供具体的越狱报告途径,且仅覆盖 CBRN 相关的漏洞赏金;Google DeepMind、SpaceXAI(原 xAI)和 Meta 则将越狱与模型内容问题排除在漏洞披露范围之外。

  2. Helen Toner · 收录 · 原文 15

    Helen Toner 谈 AI 未来的三大悬而未决之争

    Helen Toner 在 FAR.AI 政策会议上提出当前 AI 讨论中三个尚未解决的争论:现有范式还能走多远、AI 能在多大程度上改进 AI、未来 AI 究竟是工具还是别的事物。她主张与其追问"规模是否是全部所需",不如问我们是否处在正确的技术分支上——过去 10-15 年的进展主要来自中小幅度的持续改良而非重大突破,因此进步可能继续延续。

已经到底了