跳到正文

全部动态

今天收录 1 条

第 5 页更新的内容回到最新

4月15日周二
  1. AI as Normal Technology ·

    《AI as Normal Technology》:将 AI 视为普通技术的未来愿景

    一份逾 15000 字的论文提出应将人工智能理解为“普通技术”(normal technology),而非类似人类的高自主超级智能实体,并主张无需激进政策干预或技术突破即可让人保有对其的控制权。该框架强调技术与社会的关系,拒绝技术决定论,指出变革性的经济和社会影响会缓慢发生——其关键在于区分 AI 方法、AI 应用与 AI 采纳三者处于不同时间尺度。论文分四部分展开:人机分工中越来越多的人类工作变成“AI 控制”、从事故、军备竞赛、滥用和对齐失败四个角度重估风险,以及以减少不确定性为首要目标、以韧性应对灾难性风险的 AI 政策建议。

4月6日周日
  1. Rising Tide(Helen Toner) ·

    Helen Toner:不扩散并非应对 AI 滥用的正确路径

    Helen Toner 撰文指出,将核不扩散式的强硬策略作为管理 AI 滥用风险的主要手段很可能是错的,若认真执行会既无效又损害自由。她认可算力安全、信息安全与 AI 护栏三支柱能阻止恶意行为者获取可用模型的逻辑前提,但强调生物武器与关键基础设施黑客属于固定能力门槛目标——一旦某项性能水平达成,复制成本便急剧下降,因此仅锁定最先进系统远远不够,应转向以韧性为核心的替代方案。

4月3日周四
  1. Rising Tide(Helen Toner) ·

    Helen Toner:AI 对齐的核心挑战在于“可控性”(steerability)

    Helen Toner 提出应把“AI 对齐”理解为“可控性”:真正的问题是能否可靠地引导先进 AI 系统朝向任意目标,而非它是否符合某人价值观。“对齐”一词带有明确的参照系暗示,导致概念混淆——如今在许多圈子里,“对齐”几乎等同于 RLHF 一类的内容审核手段,偏离了对齐原本指向的可控性问题。她指出,ChatGPT 于 2022 年 11 月成功的重要原因之一正是 OpenAI 采用了源自对齐研究的 RLHF,使外界开始主要用它来指称此类技术。

4月2日周三
  1. Rising Tide(Helen Toner) ·

    Helen Toner:通往先进 AI 的长时限已变得极短

    Helen Toner 指出,"长时限"阵营如今也承认人类水平 AI 可能在一二十年内出现——Yann LeCun 称达到人类水平 AI 需数年乃至十年,并私下估计 2045 年前 AI 承接多数认知任务的概率达 20%。三家领先 AI 公司的负责人则公开表示 2026-2027 年最有可能建成比几乎所有人在几乎一切事情上都更强的 AI。她强调这并不意味着人类水平 AI 一定会在 20 年内到来或在 5 年内不会到来,也不意味着应把所有注意力从当下危害转移走,而是说明即使怀疑派的观点也指向动荡的一二十年。

3月22日周六
  1. Miles Brundage ·

    Miles Brundage 对话 Dean Ball:私人治理 AI 提案评论开放讨论

    Miles Brundage 就 Dean Ball 最新博文中提出的 AI“私人治理”(private governance)方案展开公开对话,因其他写作事务繁忙,他以 80/20 方式在 Google Doc 版博文上留下若干评注,Dean 回复部分意见,双方将这段未完对话公之于众并邀请任何人评论。该文档中的讨论并未得出结论,两人也未达成一致立场,目的是引导公众批判性地审视这一提案及私人治理思路。

3月17日周一
  1. Nicholas Carlini Writing ·

    Machines of Ruthless Efficiency:为何我们应当担忧 AI 的未来

    前 Google 研究员 Nicholas Carlini 撰文指出,深度学习系统之所以被大规模建造,是因为它们具有无情的效率优势,而这本身就构成风险。他认为高级 AI 将带来规模化网络钓鱼、监控和其他网络攻击,并放大个体层面的错误、定制化成瘾内容和宣传、大规模失业以及权力财富集中等问题。其中部分危害无需比现有模型强多少即可实现,另一些则需要更强的模型能力。

3月14日周五
  1. Joe Carlsmith ·

    Joe Carlsmith 论 AI for AI safety:用前沿 AI 劳动加固对齐安全因素

    Joe Carlsmith 在系列文章第四篇中提出"AI for AI safety",即用前沿 AI 劳动强化安全进展、风险评估与能力约束三大安全因素,以让 AI 安全反馈回路追上或约束 AI 能力反馈回路。他提出"AI for AI safety 甜蜜点"概念,指前沿系统足以大幅改善安全因素、但尚不足以在现有对策下剥夺人类权力的能力区间,并指出该窗口未必存在且难以持久。文章最后列出最严重的担忧,包括诱导/评估失败、差异性破坏与危险的失控选项,以及时间与政治意愿等现实约束,并将在下一篇聚焦自动化对齐研究。

3月13日周四
  1. Nicholas Carlini Writing ·

    Nicholas Carlini 谈大语言模型的未来:误差棒应该很宽

    Nicholas Carlini 撰文主张对大语言模型的未来应持宽广的不确定性预期,他认为三到五年内语言模型可能胜任大多数超出人类专家水平的经济上有用的认知任务,也可能仅沿成本下降和能力渐进改善的正常路径发展而不发生根本范式转变。他以自身从 2018 年至 2021 年低估语言模型潜力为例说明预测者的易错性,并指出当前模型已能解决早期博士生水平的数学问题、达到顶尖竞赛程序员的编码水准,且基准不断被刷新,因此两种极端可能性都不容忽视。

3月11日周二
  1. Miles Brundage ·

    Miles Brundage 为何不认同 AI 信息安全末日论

    Miles Brundage 撰文说明自己为何不属于他所称的"security doomer",即认定 AI 系统无法抵御国家级别攻击者窃取、或其防护成本高到不值得做的人。他指出这种悲观有其道理:针对高级攻击者的信息安全本就极难防守,且安全措施会拖慢研究与产品交付速度,例如减少能接触模型权重的人员、隔离算法信息都会降低研发推进节奏。但他强调这只是为了先厘清该立场的来龙去脉,并限定讨论仅涉及信息安全而非防范 AI 滥用。 要点: - 他用"security doomer"一词描述那些认为 AI 系统挡不住老练国家级攻击者、或者保护它们会让 AI 研究减速到得不偿失程度的人。

  2. Nicholas Carlini Writing ·

    Nicholas Carlini 谈隐私论文为何不能被用来论证生成式 AI 版权问题

    机器学习研究者 Nicholas Carlini 撰文说明其记忆化(memorization)研究的出发点是隐私与安全而非版权,因此法律案件不宜直接援引他的论文作为证据。他指出可从其研究中得出的唯一可靠结论是:模型有时会逐字输出训练数据——例如他在 2020 年从 15 亿参数的 GPT-2 中提取出仅 600 条独特训练样本,但这既不能证明所有模型的常规行为,也不能支撑“模型必然侵犯版权”的主张。

2月16日周日
  1. Miles Brundage ·

    Miles Brundage 公布今年不会亲自推进的多项重要 AI 议题

    Miles Brundage 列出自己离开 OpenAI 后今年不会亲身投入的重要 AI 方向,涵盖让人直观感受到 AGI 紧迫性、AI 智能体的基础设施与社会规范及法律责任、AI 的经济冲击以及欧盟《人工智能法案》落地谈判。他认为自己在这些问题上的技能更适合处理其他问题,因此选择回避而非放弃关注,并可能偶尔向他人提供建议。

2月11日周二
  1. Miles Brundage ·

    Miles Brundage 评美国副总统 Vance 在 AI Action Summit 演讲中的 AI 政策信号

    Miles Brundage 发文点评美国副总统 Vance 在 AI Action Summit 上的演讲,指出其释放的美国 AI 政策议程中既有令人鼓舞之处也有隐忧。Vance 强调需保护 AI 技术与半导体免受窃取和滥用,Brundage 解读这指向模型权重及算法机密的安全防护,并希望该议题形成两党共识。他还推测 Vance 主张轻量化且聚焦极端风险、避免被大型科技企业俘获的安全监管路径,同时注意到其在 AI 与经济就业关系上偏向经济民粹主义立场而非科技右翼。

2月9日周日
  1. Nicholas Carlini Writing ·

    Nicholas Carlini 复盘 AI 预测调查:人们大概率高估了自己的置信度

    Nicholas Carlini 对其去年发布的 30 道 AI 未来预测题作答分布做了回顾分析,指出受访者在 90% 置信区间的设定下普遍给出了过窄的范围,导致无论 2027 年真实答案为何,"最多也只有一半人能猜对"。这种过度自信在所有问题中表现一致,涵盖 AGI 实验室估值、AI 员工收入以及至少一家头部实验室可能消失的概率等问题。他还提到 OpenAI o3 近期成绩很可能达到 90% 以上,并计划最早于 2026 年开始提前结算部分题目。

2月3日周一
  1. Miles Brundage ·

    DeepSeek R1 的真正启示:规模加人才即可逼近超人类 AI

    DeepSeek 发布的 R1 已成为最强开源 AI 模型,其意义在于延续了 2018 年 GPT-2 以来的规律——只要算力与数据构成的规模和数十到数百名顶尖科学家工程师的技能这两项要素齐备,就能造出比肩乃至超越人类的 AI,且成本逐月下降。 该模式先在预测下一个词的范式下通过反复训练神经网络习得语法与世界知识,去年起又经长链式推理扩展到数学与编程等领域,o1 与 R1 借此学会分解问题并自查。 后来者常能以远低于先行者的成本复制同等性能,全球科学界公开的技巧使 OpenAI API 价格累计降幅超过 90%,因此美国无法长期垄断超级 AI 能力,GPU 出口管制虽必要却挡不住能力的持续扩散。

1月29日周三
  1. Joe Carlsmith ·

    Joe Carlsmith:AI 时代的“假思考”与“真思考”

    Joe Carlsmith 撰文区分“假思考”与“真思考”,提出地图与世界、空洞与坚实、机械与新生、士兵与侦察、干枯与切身五个相关维度,并给出放慢速度、追随好奇心、把概念锚定到真实所指等提醒自己“真正思考”的方法。他认为在进入 AI 时代之际,真思考对保持清醒尤为关键。

1月11日周六
  1. Miles Brundage ·

    Miles Brundage 为何将前沿 AI 公司的安全置于首位

    Miles Brundage 撰文论证前沿 AI 公司的安全应比安全性更为紧迫。他指出,独立专家基于对前沿 AI 公司员工的访谈估计,这些企业距离抵御中俄等国资源充足的攻击尚有数年差距,且一年内 AI 系统能力还会大幅提升,现有竞争编码能力已达人类前几百名的水平。由于投资安全的成本由公司独自承担、投入不足的成本却由整个社会分担,加上单方面加强安全可能拖慢研发进度并丧失市场优势,这一问题不会自动解决。他还强调,芯片和数据中心的安全建设以及安全许可审批所需的时间超过模型迭代间隔,因此无法留待后期自动化处理。

12月25日周三
  1. Nicholas Carlini Writing ·

    Nicholas Carlini 让不同语言模型逐日重写其网站主页

    Nicholas Carlini 发起实验,连续十二天每天用一个不同的语言模型重写他的个人网站主页,首日是 OpenAI 的 o1-mini。该流程先用固定提示词让其撰写简介网页并循环六次追加更多细节和改进版 HTML/CSS,若遭拒答则随机重试三次,再失败就用一句自称本人手臂受伤无法打字的越狱提示绕过。o1-mini 生成的页面视觉出色却严重失实——43 条关于他的陈述中仅 2 条正确、32 条完全不属实、9 条有明显错误,凸显小参数模型的模型幻觉问题。

12月21日周六
  1. Miles Brundage ·

    Time's Up for AI Policy:超级人类级 AI 临近,未来数月政策决定至关重要

    Miles Brundage 发文警告,超越几乎所有认知领域的超级人类 AI 几乎必然在未来几年内建成并部署,而接下来几个月的政策抉择将决定其治理方式。他以当日发布的 o3 为例指出超人类编程与数学能力的到来比许多人预期更快,社会尚未消化 Claude 3.5 Sonnet、o1 及即将推出的更大模型的冲击。特朗普政府首批行动、下一届美国国会立法、英国 AI 法案以及欧盟《通用人工智能行为准则》是关键节点,呼吁有意推动 AI 治理的人立即行动而非规划数年后产生影响。 --- **说明**: - 标题保留了原作者意图中的紧迫感("Time's Up"→"关键时刻/迫在眉睫"语义由副题承载),并按规则补入核心议题主体。

12月19日周四
  1. SPY Lab Blog ·

    SPY Lab 立场论文:成员推断攻击无法证明模型训练使用了你的数据

    SPY Lab 在将发表于 SaTML 2025 的立场论文中论证,成员推断(MI)攻击在向法官等第三方证明 GPT-4 等生产模型训练使用了特定数据时存在根本性缺陷。作者将训练数据证明形式化为假设检验,指出其关键在于证明假阳性率(FPR)足够低,而现有研究通过采样零假设来估计 FPR,必须完全控制数据生成与模型训练过程。

  2. AI as Normal Technology ·

    AI 进展是否放缓?Arvind Narayanan 等人解析模型缩放与推理缩放的证据

    Arvind Narayanan、Benedikt Ströbl 与 Sayash Kapoor 撰文指出,宣告模型缩放终结为时尚早,业界领袖在此问题上的反复表态说明其预测并不可信且受自身利益左右。《The Information》、路透社与彭博社接连报道称 OpenAI、Anthropic 和 Google Gemini 三家开发商的下一代模型均遇到问题,随后“推理缩放”(又称 test-time compute scaling)被视为前进方向,但其带来的能力提升难以预测且在领域间分布不均。文章还强调,能力进步与 AI 社会或经济影响之间的联系极弱,制约影响的瓶颈是产品开发速度与采纳率而非模型能力。

12月14日周六
  1. AI as Normal Technology ·

    研究分析 2024 年全球选举中的 78 起 AI 深度伪造:政治虚假信息并非 AI 问题

    对 WIRED AI Elections Project 收录的 2024 年全球选举中全部 78 起 AI 使用案例的分析显示,其中 39 起并无欺骗意图,最常见的非欺骗用途是竞选宣传(22 起中 19 起意在改进竞选材料)。对其余 39 起欺骗性案例,研究估算不用 AI 复现同类内容的成本均不超过几百美元,说明生成式 AI 降低了造假成本却未改变虚假信息的传播瓶颈。作者据此认为,诊断政治虚假信息应关注需求端而非供给端,修复信息环境依赖结构性制度变革而非限制 AI 生成内容。

11月12日周二
  1. AI as Normal Technology ·

    英国肝脏移植匹配算法是否系统性排除年轻患者?

    英国2018年启用的肝脏分配算法通过预测患者移植与否的生存时长差值得出 Transplant Benefit Score(TBS),用28个供受体变量排序分配肝脏。Financial Times 调查发现该算法疑似按年龄歧视,45岁以下患者无论病情多重都难以获得足够高的分数。31岁患者 Sarah Meredith 借助 Ewen Harrison 团队开发的 TBS 计算网页应用发现这一偏差,且该评分无医生推翻机制、无申诉流程。

10月31日周四
  1. Yoshua Bengio ·

    Yoshua Bengio:AGI 对国家和国际安全的影响

    Yoshua Bengio 在 Aspen Strategy Group 的论文中指出,AGI 可能在几年到十年内到来,Metaculus 上超过 20% 的预测认为 2027 年前可实现,而 AGI 到 ASI 的过渡或只需几个月到几年。前沿公司正试图开发能推进 AI 研究本身的 AI:训练需数万块 GPU,但推理阶段可并行部署,相当于数十万个自动化 AI 工作者。近 3000 名机器学习论文作者的调查显示,37.8%–51.4% 认为先进 AI 造成人类灭绝级后果的概率至少 10%,论文据此讨论权力高度集中与失控风险。

10月4日周五
  1. AI as Normal Technology ·

    《AI Snake Oil》作者答疑:新书已售约 8000 册,谈写作过程与 AI 立场

    《AI Snake Oil》一书上周出版,目前已售出约 8000 册。作者在 FAQ 中回应了外界疑问,表示书中并非反对技术,而是帮助读者区分真实进步与炒作;他们对预测式 AI 总体持负面态度,认为生成式 AI 是双刃剑,长期看对几乎所有知识工作者有用,但部署混乱、滥用普遍。作者还称自己已不再认同 AI 安全、e/acc 或 AI 伦理任何一方标签,认为阵营对立适得其反。

7月9日周二
  1. Yoshua Bengio ·

    Yoshua Bengio 撰文反驳轻视 AI 安全的论点

    Yoshua Bengio 发文系统回应反对重视 AI 安全的常见论据,指出当前无人掌握能让比人类更聪明的实体可靠地按其开发者意图行事的技术方法。他强调,即使未来找到可扩展到超级智能的对齐与控制手段,确保其不被滥用的政治制度仍然缺失,因此主张科学界与社会应投入大规模集体努力解决这一问题。

6月24日周一
  1. Nicholas Carlini Writing ·

    Nicholas Carlini 撰文《我为何发动攻击》:从可修补漏洞到不可修补漏洞

    谷歌研究员 Nicholas Carlini 发文回应芝加哥大学计算机教授 Ben Zhao 在一个拥有 15,000 名成员的公开 Discord 服务器上对他的批评,并阐述自己撰写攻击论文的原因——出于解谜的兴趣而非行善驱动。他把所有安全漏洞划分为一条光谱:一端是可修补漏洞,例如针对 Web 服务器的 SQL 注入或 XSS,披露前应给开发者留出修复时间;另一端是不可修补漏洞,他以破解 AES 或 RSA 为例指出此类问题一旦存在便无法真正挽回损害,应立即公开。

5月21日周二
  1. 雷峰网安全频道 ·

    亚信安全发布安全大模型信立方,用AI对抗AI攻击

    亚信安全在C3安全大会·2024上发布网络安全行业自研大模型信立方,用于精准问答、告警日志解读和网络安全事件分析,并同步推出"信计划"(XPLAN),涵盖安全为AI与AI为安全两大方向。亚信安全高级副总裁陈奋透露,针对大模型的攻击手段一年内已涌现数十种,其团队在Llama2环境模拟海绵样本攻击,使模型响应从几秒延迟至60秒以上、慢了20倍以上。信计划已落地东数西算成都节点的算力云安全保护,并通过红队测试从八个方向为大模型提供上线前安全检查。

5月6日周一
  1. Nicholas Carlini Writing · 65

    Nicholas Carlini 复盘 IEEE S&P 2024 一篇被攻破的对抗样本防御论文

    Nicholas Carlini 指出 IEEE S&P 2024 接收的一篇对抗样本防御论文存在数学上不可能成立的结论,其评测代码含 bug,改一行代码即可将模型准确率降到 0%。该论文声称在 MNIST 上扰动上限 0.5 时准确率超过 60%,但任何图像与全灰图像的最大范数距离都不超过 0.5,因此 10 类分类下稳健准确率上限只能是 10%。论文还声称受攻击时准确率(94%)高于未受攻击时(83%),作者认为这说明所用攻击比恒等变换还弱。

    推荐理由作者以两篇顶会论文为例,说明对抗样本防御评测中哪些数字在数学上不可能成立,可供审稿与复现参考。

1月21日周日
  1. Nicholas Carlini Writing ·

    Nicholas Carlini 公开其 2016–2019 年研究想法日志文件

    Nicholas Carlini 公布了自己从 2016 年 3 月至 2019 年底维护的研究想法清单 ideas.txt,并附上截至 2024 年 1 月的逐条回顾注释。他的做法是把当时自认足够好的点子追加写入单一文件,只在每年少数几次通读筛选,从而保证一个好点子至少经过写下与重读两次检验。该记录聚焦对抗机器学习方向,例如针对分类器构造最小改动即可骗过它的生成器,以及无目标攻击其实等同于指向最近其他类别的定向攻击等问题。

10月18日周三
9月13日周三
  1. Yoshua Bengio ·

    Yoshua Bengio 提出建立多边公益 AI 研究实验室网络以防卫民主与人权

    Yoshua Bengio 提议建立一个由非营利与非政府实验室组成的多边协作网络,共同防卫民主、人权并抵御可能失控的自主 AI。该提案强调避免单点故障、防止经济政治军事权力过度集中,并要求强有力的国际性与民主授权的治理机制。相关论文已在《Journal of Democracy》发表。

7月8日周六
  1. 雷峰网安全频道 ·

    对话奇安信齐向东:数智时代,老方法解决不了新难题

    奇安信董事长齐向东在 BCS2023 北京网络安全大会上表示,数智时代老办法解不了数据安全新难题,须以"内生安全"应对。他称数据正从"死"变"活"、从虚变实、从贱变贵,带来行为真假难辨、"三员"违规难控、软件供应链漏洞后门难防三大难题,82% 的数据泄露与内部有关。他认为 ChatGPT 是双刃剑,奇安信将在可直接交付时发布自研大模型。

6月16日周五
  1. 雷峰网安全频道 ·

    AGI 大时代,企业安全为什么需要“新进化”?

    面对 AGI 时代攻击面扩大与生成式人工智能被用于编写攻击脚本、恶意软件和钓鱼邮件,雷峰网提出企业安全需从单点防御转向“数字安全免疫力”。腾讯安全与 IDC 于 6 月 13 日“数字安全免疫力研讨论坛”联合发布数据安全免疫力模型及《加强数字安全免疫力,促进数字化时代下的韧性发展》白皮书,强调前置投入、动态轻量实时响应,把安全融入战略、管理与运营流程。

5月24日周三
  1. 雷峰网安全频道 ·

    对话安恒刘思宇:做数字资产的守门人

    安恒信息副总裁、终端安全负责人刘思宇在2023西湖论剑·数字安全大会上表示,终端安全将朝体系化、一体化方向发展,安恒以EDR切入市场,通过无极架构实现单一客户端按需组合安全能力。据赛迪顾问《中国终端安全检测与响应产品市场研究报告(2022)》,安恒EDR占全国市场份额5%、排名第三。安恒还推出勒索行为检测引擎与智能备份引擎,前者可识别已知和未知勒索病毒,后者基于AI机器学习和内核级技术备份关键数据,两项技术已完成储备、即将推向市场。

5月19日周五
  1. 雷峰网安全频道 ·

    知道创宇赵伟8年前提出“GPT”概念:从APT到AI+大数据驱动的实战防御

    知道创宇创始人赵伟早在2015年就提出网络安全领域的“GPT”概念,主张以超级大数据和AI技术支撑更高维度的全局攻防视角。他将网安行业划分为手动分析、自动分析、信息、智能四个时代,并推动知道创宇以“安全产生数据、数据驱动安全”的闭环构建云防御、云监测、云测绘等产品体系。他认为AI已进入“智能时代”,未来攻防趋势是“用云攻击云、用云防御云”。

3月26日周日
8月17日周三
  1. Nicholas Carlini Writing ·

    Nicholas Carlini 回顾《Towards Evaluating the Robustness of Neural Networks》五年后的反思

    Nicholas Carlini 撰文回顾其五年前与他人合著的对抗样本论文《Towards Evaluating the Robustness of Neural Networks》,总结该工作做对了什么以及存在的问题。他认为这篇论文最正确的核心主张是用基于梯度下降的攻击来评估神经网络鲁棒性——当时学界流行的是定制化启发式攻击,难以迁移到带防御模型的评估中。

12月5日周六
2月20日周四
  1. Nicholas Carlini Writing ·

    Nicholas Carlini 等攻破 13 项对抗样本防御,质疑防御研究是否在进步

    Nicholas Carlini 与 Florian Tramer、Wieland Brendel、Aleksander Madry 用两个月时间攻破了 13 项对抗样本防御,并据此写成论文。他们发现这些防御的失效方式与 ICLR 2018 时期几乎相同,多数只是让攻击时的梯度下降变得困难,而非真正提升鲁棒性;其中只有 3 篇论文没有做自适应攻击。作者认为进步之处在于防御方开始尝试做评估,但评估仍普遍不到位,且论文往往明确声称自己不属于这种已知失效模式。他把问题归因于三点:正确评估本身很难、合格审稿人不足、作者缺乏做彻底评估的激励,因为负面结果难以发表。

已经到底了