跳到正文

#观点/讨论

今天收录 3 条

第 8 页更新的内容回到最新

10月31日周四
  1. Yoshua Bengio ·

    Yoshua Bengio:AGI 对国家和国际安全的影响

    Yoshua Bengio 在 Aspen Strategy Group 的论文中指出,AGI 可能在几年到十年内到来,Metaculus 上超过 20% 的预测认为 2027 年前可实现,而 AGI 到 ASI 的过渡或只需几个月到几年。前沿公司正试图开发能推进 AI 研究本身的 AI:训练需数万块 GPU,但推理阶段可并行部署,相当于数十万个自动化 AI 工作者。近 3000 名机器学习论文作者的调查显示,37.8%–51.4% 认为先进 AI 造成人类灭绝级后果的概率至少 10%,论文据此讨论权力高度集中与失控风险。

10月4日周五
  1. AI as Normal Technology ·

    《AI Snake Oil》作者答疑:新书已售约 8000 册,谈写作过程与 AI 立场

    《AI Snake Oil》一书上周出版,目前已售出约 8000 册。作者在 FAQ 中回应了外界疑问,表示书中并非反对技术,而是帮助读者区分真实进步与炒作;他们对预测式 AI 总体持负面态度,认为生成式 AI 是双刃剑,长期看对几乎所有知识工作者有用,但部署混乱、滥用普遍。作者还称自己已不再认同 AI 安全、e/acc 或 AI 伦理任何一方标签,认为阵营对立适得其反。

7月9日周二
  1. Yoshua Bengio ·

    Yoshua Bengio 撰文反驳轻视 AI 安全的论点

    Yoshua Bengio 发文系统回应反对重视 AI 安全的常见论据,指出当前无人掌握能让比人类更聪明的实体可靠地按其开发者意图行事的技术方法。他强调,即使未来找到可扩展到超级智能的对齐与控制手段,确保其不被滥用的政治制度仍然缺失,因此主张科学界与社会应投入大规模集体努力解决这一问题。

6月27日周四
  1. SPY Lab Blog ·

    SPY Lab 称 Glaze 防护可被绕过,并批评其安全实践

    SPY Lab 发布论文与博客,称用于保护艺术家风格不被模型模仿的扰动工具 Glaze 可被绕过,并批评 Glaze 团队在安全实践上的做法。作者指出,Glaze 团队拒绝向研究社区提供源码,使第三方难以评估其鲁棒性;在作者公开论文后,Glaze 团队基于论文信息自行重实现其去噪方案并据此发布 Glaze v2.1,作者实测后称其多数结论不成立,自己的去噪器对 Glaze 2.1 在卡通风格等多种风格上仍然有效。作者还称,仅更换微调脚本就能显著削弱 Glaze 的保护,并指出 Glaze 无法被有意义地修补:已发布到网上的图片可被下载留存,后续补丁无法追溯保护,且 Glaze 失效时不会留下可检测的痕迹。

6月24日周一
  1. Nicholas Carlini Writing ·

    Nicholas Carlini 撰文《我为何发动攻击》:从可修补漏洞到不可修补漏洞

    谷歌研究员 Nicholas Carlini 发文回应芝加哥大学计算机教授 Ben Zhao 在一个拥有 15,000 名成员的公开 Discord 服务器上对他的批评,并阐述自己撰写攻击论文的原因——出于解谜的兴趣而非行善驱动。他把所有安全漏洞划分为一条光谱:一端是可修补漏洞,例如针对 Web 服务器的 SQL 注入或 XSS,披露前应给开发者留出修复时间;另一端是不可修补漏洞,他以破解 AES 或 RSA 为例指出此类问题一旦存在便无法真正挽回损害,应立即公开。

6月20日周四
  1. Yoshua Bengio ·

    Bengio 介绍《先进 AI 安全国际科学报告》中期版

    Yoshua Bengio 作为主席介绍了《先进 AI 安全国际科学报告》,该报告源于 2023 年 11 月英国 Bletchley Park AI 安全峰会上一项由 30 个国家及 EU、UN 代表推动的决议,中期报告已于 2024 年 5 月 22 日首尔 AI 峰会上提交,最终版将在明年 2 月法国 AI 行动峰会上发布。报告由 70 多位专家参与撰写,其中包括各国提名的 32 位专家和 26 位高级顾问,综合科学文献并附 40 页引用,按要求不提出政策建议。

5月21日周二
  1. 雷峰网安全频道 ·

    亚信安全发布安全大模型信立方,用AI对抗AI攻击

    亚信安全在C3安全大会·2024上发布网络安全行业自研大模型信立方,用于精准问答、告警日志解读和网络安全事件分析,并同步推出"信计划"(XPLAN),涵盖安全为AI与AI为安全两大方向。亚信安全高级副总裁陈奋透露,针对大模型的攻击手段一年内已涌现数十种,其团队在Llama2环境模拟海绵样本攻击,使模型响应从几秒延迟至60秒以上、慢了20倍以上。信计划已落地东数西算成都节点的算力云安全保护,并通过红队测试从八个方向为大模型提供上线前安全检查。

5月6日周一
  1. Nicholas Carlini Writing · · 原文 65

    Nicholas Carlini 复盘 IEEE S&P 2024 一篇被攻破的对抗样本防御论文

    Nicholas Carlini 指出 IEEE S&P 2024 接收的一篇对抗样本防御论文存在数学上不可能成立的结论,其评测代码含 bug,改一行代码即可将模型准确率降到 0%。该论文声称在 MNIST 上扰动上限 0.5 时准确率超过 60%,但任何图像与全灰图像的最大范数距离都不超过 0.5,因此 10 类分类下稳健准确率上限只能是 10%。论文还声称受攻击时准确率(94%)高于未受攻击时(83%),作者认为这说明所用攻击比恒等变换还弱。

    推荐理由作者以两篇顶会论文为例,说明对抗样本防御评测中哪些数字在数学上不可能成立,可供审稿与复现参考。

3月8日周五
2月27日周二
1月21日周日
  1. Nicholas Carlini Writing ·

    Nicholas Carlini 公开其 2016–2019 年研究想法日志文件

    Nicholas Carlini 公布了自己从 2016 年 3 月至 2019 年底维护的研究想法清单 ideas.txt,并附上截至 2024 年 1 月的逐条回顾注释。他的做法是把当时自认足够好的点子追加写入单一文件,只在每年少数几次通读筛选,从而保证一个好点子至少经过写下与重读两次检验。该记录聚焦对抗机器学习方向,例如针对分类器构造最小改动即可骗过它的生成器,以及无目标攻击其实等同于指向最近其他类别的定向攻击等问题。

10月18日周三
9月13日周三
  1. Yoshua Bengio ·

    Yoshua Bengio 提出建立多边公益 AI 研究实验室网络以防卫民主与人权

    Yoshua Bengio 提议建立一个由非营利与非政府实验室组成的多边协作网络,共同防卫民主、人权并抵御可能失控的自主 AI。该提案强调避免单点故障、防止经济政治军事权力过度集中,并要求强有力的国际性与民主授权的治理机制。相关论文已在《Journal of Democracy》发表。

8月16日周三
  1. 雷峰网安全频道 ·

    ISC 2023:360 智脑支持的 AI 数字人如何成为大模型入口

    ISC 2023 第十一届互联网安全大会以"安全即服务,开启人工智能时代数字安全新范式"为主题,打造全球首场 AI 数字安全峰会,开幕式由 360 智脑驱动的数字主持人"可心"全程主持。大会还开设线上数字小镇,50 位企业家、学者与技术专家以 AI 数字人身份围绕漏洞检测、威胁流量检测、数据安全等话题展开 50 余场演讲。周鸿祎称 AI 数字人是大模型最重要的应用入口,360 将借此降低 prompt 使用门槛,推动大模型在消费级与企业级场景落地。

7月8日周六
  1. 雷峰网安全频道 ·

    对话奇安信齐向东:数智时代,老方法解决不了新难题

    奇安信董事长齐向东在 BCS2023 北京网络安全大会上表示,数智时代老办法解不了数据安全新难题,须以"内生安全"应对。他称数据正从"死"变"活"、从虚变实、从贱变贵,带来行为真假难辨、"三员"违规难控、软件供应链漏洞后门难防三大难题,82% 的数据泄露与内部有关。他认为 ChatGPT 是双刃剑,奇安信将在可直接交付时发布自研大模型。

6月30日周五
  1. SPY Lab Blog ·

    ChatGPT 时代的对抗样本:聊天机器人攻击为何不同于传统对抗攻击

    SPY Lab 撰文指出,传统对抗样本研究的两条基本原则(扰动不可感知、依赖梯度优化)在针对聊天机器人的攻击中基本不成立。越狱攻击由用户自己发起,提示注入中的第三方文本用户通常看不到,因此攻击文本无需保持不可感知;当前最强的越狱手段是手工试错的社会工程式指令,而非优化算法。作者在近期论文中测试了 ARCA 和 GDBA 两种优化攻击,针对 GPT-2、LLaMa 和经过拒答微调的 Vicuna,结果显示优化攻击对无防御模型部分有效,但对 Vicuna 多数失败,且即使存在可触发目标输出的提示词也找不到。

6月16日周五
  1. 雷峰网安全频道 ·

    AGI 大时代,企业安全为什么需要“新进化”?

    面对 AGI 时代攻击面扩大与生成式人工智能被用于编写攻击脚本、恶意软件和钓鱼邮件,雷峰网提出企业安全需从单点防御转向“数字安全免疫力”。腾讯安全与 IDC 于 6 月 13 日“数字安全免疫力研讨论坛”联合发布数据安全免疫力模型及《加强数字安全免疫力,促进数字化时代下的韧性发展》白皮书,强调前置投入、动态轻量实时响应,把安全融入战略、管理与运营流程。

5月24日周三
  1. 雷峰网安全频道 ·

    对话安恒刘思宇:做数字资产的守门人

    安恒信息副总裁、终端安全负责人刘思宇在2023西湖论剑·数字安全大会上表示,终端安全将朝体系化、一体化方向发展,安恒以EDR切入市场,通过无极架构实现单一客户端按需组合安全能力。据赛迪顾问《中国终端安全检测与响应产品市场研究报告(2022)》,安恒EDR占全国市场份额5%、排名第三。安恒还推出勒索行为检测引擎与智能备份引擎,前者可识别已知和未知勒索病毒,后者基于AI机器学习和内核级技术备份关键数据,两项技术已完成储备、即将推向市场。

  2. Transformer Circuits(Anthropic 可解释性) ·

    Anthropic 的机械可解释性愿景:从叠加问题到自动化可解释性与安全性

    Anthropic 的可解释性研究者 Chris Olah 发表《Interpretability Dreams》,阐述机械可解释性的长期目标——当前聚焦解决叠加(superposition)难题并奠定认识论基础,未来希望扩展到大规模神经网络分析与普适特征电路的研究。 文中提出若攻克叠加问题,便可识别模型中正确的特征与回路,进而搭建更高层的抽象结构,类似解剖学中的器官或神经科学中的脑区;同时指出许多特征与回路具有普适性,在不同网络上跨模型迁移,使单一模型的洞见可为未来模型提供立足点。

5月19日周五
  1. 雷峰网安全频道 ·

    知道创宇赵伟8年前提出“GPT”概念:从APT到AI+大数据驱动的实战防御

    知道创宇创始人赵伟早在2015年就提出网络安全领域的“GPT”概念,主张以超级大数据和AI技术支撑更高维度的全局攻防视角。他将网安行业划分为手动分析、自动分析、信息、智能四个时代,并推动知道创宇以“安全产生数据、数据驱动安全”的闭环构建云防御、云监测、云测绘等产品体系。他认为AI已进入“智能时代”,未来攻防趋势是“用云攻击云、用云防御云”。

5月4日周四
  1. Transformer Circuits(Anthropic 可解释性) ·

    Anthropic 解读分布式表征中的组合与叠加

    Anthropic 的可解释性团队在一篇非正式笔记中提出,"分布式表征"其实混合了两个不同概念——特征组合(composition)与叠加(superposition)。两者在泛化能力和线性可分函数上有截然不同的性质,且存在根本性的权衡张力。文中借用 Thorpe(1989) 的形状—颜色神经元编码例子说明,局部码虽无叠加却能灵活地线性选取任意刺激集合,而组合式编码则大幅减少所需神经元并带来统计效率优势。

3月26日周日
8月17日周三
  1. Nicholas Carlini Writing ·

    Nicholas Carlini 回顾《Towards Evaluating the Robustness of Neural Networks》五年后的反思

    Nicholas Carlini 撰文回顾其五年前与他人合著的对抗样本论文《Towards Evaluating the Robustness of Neural Networks》,总结该工作做对了什么以及存在的问题。他认为这篇论文最正确的核心主张是用基于梯度下降的攻击来评估神经网络鲁棒性——当时学界流行的是定制化启发式攻击,难以迁移到带防御模型的评估中。

6月27日周一
  1. Transformer Circuits(Anthropic 可解释性) ·

    Anthropic 解读机械可解释性中的变量与可解释基

    Anthropic 的可解释性团队提出将神经网络逆向工程类比于编译二进制程序的逆向工程,主张寻找并理解可解释神经元——相当于程序中的变量——才是机械可解释性的中心任务而非众多问题之一。该观点指出参数本身就是神经网络的有限描述,因此不必穷举高维输入空间即可理解网络行为,但也意味着这项工作的难度至少等同于逆向大型复杂程序,不应期待简单答案或固定流程。

12月5日周六
2月20日周四
  1. Nicholas Carlini Writing ·

    Nicholas Carlini 等攻破 13 项对抗样本防御,质疑防御研究是否在进步

    Nicholas Carlini 与 Florian Tramer、Wieland Brendel、Aleksander Madry 用两个月时间攻破了 13 项对抗样本防御,并据此写成论文。他们发现这些防御的失效方式与 ICLR 2018 时期几乎相同,多数只是让攻击时的梯度下降变得困难,而非真正提升鲁棒性;其中只有 3 篇论文没有做自适应攻击。作者认为进步之处在于防御方开始尝试做评估,但评估仍普遍不到位,且论文往往明确声称自己不属于这种已知失效模式。他把问题归因于三点:正确评估本身很难、合格审稿人不足、作者缺乏做彻底评估的激励,因为负面结果难以发表。

已经到底了