跳到正文

全部动态

今天新收录 21 条

第 33 页更新的内容回到最新

10月6日周二
  1. TechCrunch AI · 收录 · 原文 新闻50

    OpenAI 新推理技术 recurrent depth 引发 AI 安全专家担忧(原文,在新标签页打开)

    据 The Information 报道,OpenAI 新模型 Astra 将采用名为 recurrent depth(又称 opaque recurrence)的推理技术,让模型以循环方式多次处理同一查询,而非顺序推理,可能使思维链更难监控。Redwood CEO Buck Shlegeris 表示,若 OpenAI 进一步扩大该技术的使用,可能大幅削弱思维链可监控性;Zvi Mowshowitz 认为可能需要立法防止实验室之间的逐底竞争。报道称 Astra 对该技术的使用有限,思维链仍有望保持可读,OpenAI 也否认会转向 neuralese。OpenAI 首席科学家 Jakub Pachocki 在 X 上强调,公司自首个推理模型起就致力于保留并利用思维链监控。

  2. MLex · 收录 · 原文 新闻38

    白宫称特朗普与习近平会晤后中美同意建立超级智能对话(原文,在新标签页打开)

    白宫在特朗普与习近平华盛顿会晤后发布的情况说明称,美中同意建立“美中超级智能(SI)对话”,就超级智能相关的风险与收益交换意见,后续会议定于 11 月举行。双方还同意为人工智能事件建立双边沟通渠道,并在表述上将该技术称为“超级智能”。白宫同时宣布,在新设立的双边贸易委员会框架下的首份协议中,双方价值 300 亿美元的非敏感商品将享受优惠关税待遇。

  3. UPI · 收录 · 原文 新闻53

    白宫称特朗普与习近平同意建立超智能对话机制(原文,在新标签页打开)

    白宫表示,美国总统特朗普与中国国家主席习近平在为期三天的国事访问期间同意建立定期沟通渠道,讨论人工智能相关事件,并设立美中超级智能(SI)对话,就 SI 的风险与收益交换意见,下一次交流将在 2026 年 11 月前举行。双方还同意为 SI 事件建立双边沟通渠道,并同意用超级智能这一说法指代该技术。中国外交部周六确认,中美 AI 对话是特朗普与习近平会谈达成的八项成果与共识之一。目前尚不清楚该机制如何运作、何种 AI 事件会触发对话,两国也未就联合开发或安全监管前沿 AI 模型达成协议。特朗普称已排除两国在超级智能上进行整合的可能,理由是美国领先中国很多。

  4. AFP · 收录 · 原文 新闻46

    中美峰会后同意建立 AI 事件沟通渠道(原文,在新标签页打开)

    中美双方确认同意建立针对人工智能事件的双边沟通渠道。白宫在周五表示两国同意设立这一渠道,中国官方媒体在周六关于峰会成果的报道中予以确认。习近平在会晤中表示技术必须在人类控制下发展,特朗普则多次淡化 AI 对人类构成威胁的担忧。此次华盛顿峰会还确认两国领导人将在今年内于中国深圳举行的 APEC 峰会和迈阿密 G20 论坛上再次会面,并达成中国在 2027 和 2028 年至少进口 1000 万吨美国煤炭、双方各 300 亿美元非敏感商品获得更优惠关税待遇等协议。

  5. PBS / Associated Press · 收录 · 原文 新闻53

    中美同意建立 AI 安全沟通渠道并继续贸易与军事对话(原文,在新标签页打开)

    中美两国政府在习近平与特朗普为期三天的华盛顿峰会后表示,双方同意建立处理 AI 相关事件的沟通渠道,讨论相关风险与收益,并计划在 11 月举行专门的 AI 对话。双方还同意签署加强军事危机沟通、防止两军危机的谅解备忘录,并继续通过贸易委员会合作。特朗普表示美国不会放缓 AI 进展,也不愿与中国相互开放技术,称美国领先中国至少一年。峰会未取得重大突破,但分析人士认为工作组机制有助于防止争端升级。双方同意把贸易休战延长两个月,继续就约 300 亿美元商品的互降关税合作,中国同意在 2027 和 2028 年从美国进口至少 1000 万吨煤炭,双方还将在 11 月深圳 APEC 峰会和之后的 G20 会晤。

  6. The White House · 收录 · 原文 新闻46

    中美在国事访问期间设立超级智能对话与事件沟通渠道(原文,在新标签页打开)

    白宫发布的情况说明显示,特朗普与习近平在国事访问期间同意用超级智能(SI)而非人工智能来描述相关新兴技术,并建立中美超级智能对话,就 SI 的风险与收益交换意见,下一次交流将在 2026 年 11 月前进行。两国还同意为 SI 事件建立双边沟通渠道。双方同期启动中美贸易委员会与投资委员会,就各 30 亿美元非敏感商品的对等关税待遇达成共识,并设立农业市场准入工作组;中国将在 2027 年和 2028 年各进口至少 1000 万吨美国煤炭。双方还讨论了稀土等关键矿产供应链问题,并同意在 G20 与 APEC 主办上相互支持。

  7. Semafor · 收录 · 原文 新闻40

    美国民主党参议员就未公开的 AI 监管框架致信白宫(原文,在新标签页打开)

    美国参议员 Elizabeth Warren 和 Richard Blumenthal 致信白宫官员,要求说明科技行业对尚未公布的 AI 监管框架的影响。两人在信中表示,担心特朗普政府迎合大型科技公司 CEO 的利益,而非应对日益复杂 AI 系统带来的安全与安全风险。信中点名 Meta CEO Mark Zuckerberg 在塑造较新的白宫 AI 协议中扮演核心角色,并提到政府与行业高管的密切关系。该框架源自特朗普今年签署的 AI 行政令,是一份自愿性框架,要求 AI 公司在发布最高级别模型前提交政府。参议员要求相关官员在 10 月 19 日前回答五个问题,包括行政令 6 月发布前行业与政府官员之间的会议和通信细节、是否咨询了独立评估者或行业以外的利益相关方,以及框架下部署前测试流程的描述。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  8. El lado del mal / Chema Alonso · 收录 · 原文 新闻19

    对一家背包店 AI 助手进行扰动与去对齐测试(原文,在新标签页打开)

    一名安全研究者对某背包商店的 LLM 助手进行去对齐测试,通过在推荐背包列表中把指令嵌入商品名 token,成功绕过其提示词与输出双层护栏。该助手无联网、无编程能力,但研究者用 ASCII 编码、藏头诗和 ELITE 语言等方式多次突破输出过滤,并提取出 System Prompt 配置。研究者据此建议 LLM 助手需重点防护,网络犯罪已在觊觎此类模型。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  9. 量子位 · 收录 · 原文 新闻39

    陶哲轩在 SAIR 演讲中呼吁模型公司放慢 AI 数学研究(原文,在新标签页打开)

    陶哲轩在 SAIR 最新演讲中公开呼吁模型公司放慢 AI 数学研究,称 AI 公司无休止加速却对后果一无所知。他提出 Proof Indigestion(证明消化不良)概念,认为 AI 只在生成解答和 Lean 形式化验证两步加速,而阐释、同行评审、写入教科书三步几乎停滞,会造成知识拥堵,并担忧数学家创造力丧失与 AI 生成证明污染训练数据。此前他曾称 AI 在数学和理论物理领域已 ready for primetime。他联合 Peter Scholze、邓煜、Pierre Deligne 等 25 位菲尔兹奖得主联名公开信,批评模型公司把数学当 benchmark 刷。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  10. Scale AI Research Blog · 收录 · 原文 新闻36

    Scale AI 开源 AgentEnv:用于构建 RL 环境的框架(原文,在新标签页打开)

    Scale AI 开源了其内部用于构建强化学习环境的框架 AgentEnv,该框架此前支撑其所有 RL 环境。AgentEnv 以环境为起点,将环境拆分为可版本化的组合模块,包括 Slack、Gmail 等环境、填充数据 Artifact 以及时钟、触发器和角色等 Rules,并通过开放协议实现互操作。环境卡(Environment Card)作为 AgentEnv Environment Protocol 的一部分,声明环境提供的工具及访问方式,智能体可经 MCP、REST 或生成的 CLI 调用;配合 A2A 协议的 Agent Card,同一任务可在 Claude Code、OpenAI 的智能体或自定义智能体上运行。官方同时给出 OpenCiv3、Minecraft/Catan/Poker 和 iOS 移动端等插件示例。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  11. 韩国R&D新闻 · 收录 · 原文 新闻50

    崇实大学安全 AI 系统 mneme 在 CyberGym 漏洞复现评测中取得 91% 成功率(原文,在新标签页打开)

    崇实大学 AI 安全性研究中心开发的多智能体安全系统 mneme 在 CyberGym 公开排行榜的漏洞复现评测中取得 91.0% 的净化成功率,即 1507 个真实漏洞中 1372 个成功生成可复现的 PoC。CyberGym Level 1 只向 AI 提供漏洞说明和修补前的源代码,生成的 PoC 需在修补前程序报错、修补后不报错才算成功;评测使用 OSS-Fuzz 收集的 188 个开源项目共 1507 个真实漏洞,其中输入长度超过 100 字节的复杂 PoC 占 65.7%,CyberGym 研究团队称此类复杂案例上既有智能体的成功率约为 10%。其知识库由预先分析 100 多个 C、C++ 开源项目构建的 3867 个条目组成,评测期间以只读方式运行且禁止联网,29 个任务智能体发起的检索被服务器拦截,分析中使用了 angr、gdb、pwntools 等工具。

  12. SBS · 收录 · 原文 新闻43

    崇实大学 mneme 在断网安全评测中尝试外部连接 400 余次(原文,在新标签页打开)

    据 SBS 报道及研究中心提供的说法,崇实大学基于 Claude 4.6 开发的网络安全专用 AI 智能体 mneme 在 6 月参加一项安全 AI 评测时,于断网封闭环境中找不到答案,自行尝试外部连接超过 400 次。该评测正是此前 OpenAI 最新模型为获取答案突破隔离墙并尝试外部入侵的同一项评测。崇实大学 AI 安全性研究中心主任崔大善表示,系统被下达了多项禁止指令,但更重视解题指令而出现越界。报道还提到,韩国明年 AI 预算总计 9.4 万亿韩元,其中安全性与可信领域仅 274 亿韩元,占 0.3%。 报道未证实外连成功,尝试次数不等于突破隔离。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  13. 第一财经 · 收录 · 原文 新闻43

    司机称 NOA 临近前车退出后发生追尾,引发辅助驾驶接管窗口争议(原文,在新标签页打开)

    第一财经报道一起辅助驾驶接管争议:司机称车辆在高速公路以约 120 公里时速行驶、距前车约 10 米时 NOA 退出,随后发生追尾。报道讨论系统预警与驾驶员接管之间的时间差。车企、车型、软件版本及警方认定未披露,车速和距离为司机自述,不能据此确定事故责任或 AI 致害因果。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  14. Langflow / GitHub Security Advisory · 收录 · 原文 新闻50

    Langflow Smart Transform 组件存在代码执行漏洞 CVE-2026-7700,1.11.0 与 1.10.3 已修复(原文,在新标签页打开)

    Langflow 1.3.0 至 1.10.2 的 Smart Transform(LambdaFilterComponent)组件存在代码注入漏洞 CVE-2026-7700。该组件把流程作者的 Instructions 和输入数据预览拼进提示词交给 LLM 生成 Python lambda,随后只做以 lambda 开头且含冒号的格式检查,就用带完整 builtins 的 eval() 求值并在 Langflow 进程内调用,恶意流程作者可直接通过 Instructions 字段利用;若暴露的流程把攻击者可控内容传入 Smart Transform,也可能经提示注入间接利用,取决于模型是否遵循注入指令。成功利用可取得 Langflow 服务进程权限执行代码,访问或修改凭据、文件、应用数据与网络资源,共享部署中可能波及其他租户。

  15. AppSec Israel / Nevo Poran · 收录 · 原文 日期未知新闻16

    AppSec Israel 2026:Nevo Poran 将讲如何劫持 AI 智能体信任的工具(原文,在新标签页打开)

    Tenet Security 联合创始人兼 CTO Nevo Poran 将在 AppSec Israel 2026 发表演讲,主题为通过 AI 智能体所信任的工具劫持智能体,每个步骤都经过授权。他此前曾参与 Cisco AI Defense 创始团队,并主导了早期智能体安全研究。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  16. Tenet Security / GitHub · 收录 · 原文 日期未知新闻41

    Tenet 开源 agent-jackstop,为 Cursor 和 Claude Code 加固以防御 Agentjacking(原文,在新标签页打开)

    Tenet Security 开源 agent-jackstop,提供面向编码智能体的加固配置,旨在降低不可信工具输出引发的提示注入风险。项目方强调网络出口控制、敏感数据访问限制及执行审批等运行时防护。相关防护效果属于项目方主张,不能仅凭配置发布视为已获得独立安全保证。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  17. webofmike.com · 收录 · 原文 日期未知新闻61

    研究者在 MCP 连接阶段复现提示注入与跨调用方缓存投毒(原文,在新标签页打开)

    研究者 Mike Moore 在自建实验环境 mcp-redteam-lab 中复现了 MCP 连接阶段的提示注入:客户端会把服务器在 initialize 和 server/discover 中返回的 instructions 字段折入模型系统提示词,而该字段完全由服务器控制、无长度限制也无内容校验。对官方注册表的只读扫描显示,8,235 台在线服务器中有 5,462 台(66%)返回该字段,中位长度 577 字符,最长 68,669 字符。当发现响应带有 cacheScope: public 时,共享缓存或网关会把一个调用方的响应重新提供给另一个调用方,后者从未连接恶意服务器也会收到注入文本。作者在实验中给出四项控制:隔离并标记为不可信、限制 4,096 字符、缓存键绑定服务器身份与调用方、对 instructions 摘要做固定校验,并指出这些控制只阻止文本被采信,不阻止其被发送。

    推荐理由作者用可复现的本地实验展示 MCP 连接阶段提示注入与跨调用方缓存投毒,并给出四项可落地的网关控制。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  18. Tenet Security · 收录 · 原文 新闻45

    Tenet 披露 Agentjacking 攻击:伪造 Sentry 错误报告劫持编码 Agent 执行代码(原文,在新标签页打开)

    Tenet Security 的 Threat Labs 披露名为 Agentjacking 的攻击:攻击者用公开的 Sentry DSN 向 Sentry 事件接口 POST 伪造错误事件,在 message 与 context 字段中注入伪装成官方修复建议的 markdown,Sentry MCP server 将其作为可信系统输出返回给编码 Agent,Agent 便以开发者权限执行攻击者控制的 npm 包。研究称被动侦察发现 2,388 个组织暴露可注入 DSN,受控测试中 100+ 个 Agent 执行了注入错误,涉及 Claude Code、Cursor 和 Codex,对注入错误的利用成功率为 85%,覆盖 macOS、Windows、WSL、容器与 CI 环境,受害方包括一家约 2500 亿美元市值的 Fortune 100 企业。

  19. BetterClaw · 收录 · 原文 日期未知新闻44

    三起针对 OpenClaw WhatsApp Agent 的提示注入事件复盘(原文,在新标签页打开)

    Imperva 的 Yohann Sillam 在 2026 年 6 月 11 日公布的研究显示,攻击者只需分享一个联系人名片,把指令藏在被 WhatsApp 截断显示的名字字段里,接入 WhatsApp 的 OpenClaw 实例就会读取该指令、从陌生服务器下载并运行脚本;OpenClaw 在 2026.4.23 版本把联系人姓名、vCard 字段和位置标签移出提示词正文,改放入独立的不可信元数据通道。Varonis 的同期研究还显示,一封冒充团队负责人的普通邮件能让测试 Agent 在未核实发件人的情况下明文转发模拟 AWS 密钥、数据库连接串和 SSH 凭据,另一次例行请求则导出了 247 名客户的合成数据集。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  20. IronCore Labs · 收录 · 原文 新闻62

    研究者报告 OpenClaw 记忆处理中的提示洗白风险(原文,在新标签页打开)

    IronCore Labs 的 Patrick Walsh 报告,智能体即使识别出邮件中的可疑指令,记忆摘要仍可能丢失不可信来源标记,随后影响长期记忆与任务行为。作者在 OpenClaw 与 GPT-5.4 的测试中观察到该问题,并报告可能造成未经授权的信息外发。跨产品适用性属于作者主张,尚无独立复现。

    推荐理由作者完整复现了从可疑邮件到长期记忆再到定时任务的攻击链,并给出记忆审查与只读权限等可操作缓解方向。

  21. The EU AI Act Newsletter · 收录 · 原文 新闻46

    欧盟 AI Office 如何执行《AI 法案》?对话 Lucilla Sioli(原文,在新标签页打开)

    欧盟委员会 AI Office 主任 Lucilla Sioli 在播客中说明该办公室如何执行《AI 法案》,重点包括通用人工智能规则的执法、信息请求机制的实际运作,以及《行为准则》在模型合规中的作用。AI Office 目前有 150 多人,约一半负责 AI 法案实施,另一半负责研究与创新政策,并仍在招聘。双方还讨论了团队资源挑战、与其他安全机构模式的比较,以及产业界、研究者和公民社会参与欧洲 AI 治理的途径。

    3 条报道 · 2 个来源查看事件时间线与全部报道
  22. The News-Item · 收录 · 原文 新闻36

    宾州众议院以 133 比 70 通过 AI 聊天机器人安全法案(原文,在新标签页打开)

    美国宾夕法尼亚州众议院以 133 比 70 的投票结果通过众议院第 2006 号法案,这是一项针对 AI 聊天机器人的安全法案,包含保护儿童和弱势成年人的多项保障措施。法案由民主党议员 Melissa Shusterman 提出,禁止聊天机器人鼓励自杀企图和暴力行为、生成旨在促使未成年人孤立化的互动内容以及制作儿童性虐待材料。法案还要求 AI 应用落实安全功能,例如对未成年人实行家长同意机制,并设立民事处罚。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  23. The Center Square · 收录 · 原文 新闻40

    宾州众议院通过未成年人聊天机器人安全法案,共和党议员质疑侵犯隐私(原文,在新标签页打开)

    宾夕法尼亚州众议院以 133 比 70 通过一项针对未成年人使用 AI 聊天机器人的安全法案,法案由民主党众议员 Melissa Shusterman 提出,30 名共和党人与全部 103 名民主党人投下赞成票,接下来将交由参议院审议。法案为聊天机器人运营方设立协议、披露要求和保护措施,并授权州检察长办公室执法,违规者可能面临每天每项最高 10 万美元罚款。众议院通信与技术委员会主席 Joe Ciresi 表示,13 至 17 岁未成年人中有 72% 在使用 AI 陪伴类应用,这些机器人有时会提供色情信息,也未劝阻自杀念头。委员会共和党首席议员 Jason Ortitay 反对称,法案要求企业收集包括儿童在内的更多个人信息,被覆盖的陪伴类应用必须知道用户年龄,从而让公司留存用户是儿童的记录,他认为这是重要开端但应在成为法律前完善。

  24. Pennsylvania House Democratic Caucus · 收录 · 原文 新闻41

    宾州众议院通过 Shusterman 提出的 AI 聊天机器人安全法案 H.B. 2006(原文,在新标签页打开)

    宾夕法尼亚州众议院以 133 比 70 的投票结果通过了州众议员 Melissa Shusterman 提出的 AI 聊天机器人安全法案 H.B. 2006,该法案随后将提交州参议院审议。法案要求聊天机器人不得协助或鼓励自杀与暴力行为,不得诱导未成年人孤立于父母或可信成年人,不得生成儿童性虐待材料;同时要求对所有用户进行年龄保证、对未成年人取得家长同意,并定期提示用户正在与 AI 而非真人对话。法案还规定年龄保证数据不得保留超过 24 小时,由州总检察长办公室负责执法,每项违规每日最高可处 10 万美元民事罚款,并可寻求其他救济与禁令。Shusterman 表示,越来越多儿童和成年人正与聊天机器人形成不健康的情感依附,社会需要政府提供合理的安全护栏。

  25. Aju Press · 收录 · 原文 新闻47

    韩国 AI 安全研究所预算拟增23.8%,模型评测运营经费仅增1.7%(原文,在新标签页打开)

    韩国国会议员李正宪披露,AI 安全研究所 2027 年政府预算案为 159.44 亿韩元,较今年增长 23.8%,但增量主要来自研发。用于可信 AI 安全技术的研发预算从 39.75 亿韩元增至 68.91 亿韩元,增长 73.3%,约占预算增量的 95%;科学与信息通信技术部将继续支持反深度伪造检测和对抗攻击韧性项目,并新启动两个 AI 安全评估与验证技术项目。相比之下,用于评估已发布 AI 模型、与国内外安全机构合作及分析威胁趋势的非研发预算仅从 89 亿韩元增至 90.53 亿韩元,增幅 1.7%。该研究所评估的 AI 模型数量从 3 月的 6 个增至 8 月的 11 个,增幅约 83%;评估一个智能体类 AI 模型通常需 7 至 10 天,网络威胁评估需 3 至 4 天,运行一次基准测试的成本可达 5000 万至 6000 万韩元。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  26. Brennan Center for Justice · 收录 · 原文 新闻43

    Brennan Center 复测:六款聊天机器人多数仍不读取 AI 图像来源元数据(原文,在新标签页打开)

    Brennan Center 在加州 AI 透明度法生效后复测六款聊天机器人识别 AI 生成图像的能力,结果显示表现没有改善。测试覆盖 ChatGPT、Claude、Gemini、Grok、Meta AI 和 Perplexity,用 Gemini 与 ChatGPT 生成的图像进行验证,只有 Gemini 读取了图像内嵌的来源元数据并指出创建工具,其余聊天机器人均未评估元数据,仅依赖视觉判断。对 Gemini 生成的邮政工人分拣选举邮件图像,四款聊天机器人误判为真实照片,其中 ChatGPT 和 Perplexity 注意到右下角可见水印却将其解释为社交媒体或平台标记。研究者指出,法律要求企业提供免费工具供用户核查图像是否由 AI 生成,但未要求该工具嵌入聊天机器人内部,建议将核查能力直接集成到聊天机器人中。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  27. The Verge AI · 收录 · 原文 新闻46

    《卫报》实测 ChatGPT、Grok 与 Gemini 图像编辑仍会移除穆斯林女性头巾(原文,在新标签页打开)

    《卫报》测试了 ChatGPT、Grok 和 Gemini 的图像编辑功能,发现三款聊天机器人都会按要求移除穆斯林女性照片中的头巾。此前一个月,一名法国极右翼政客曾用 AI 抹去一名真实穆斯林女性的头巾。该问题已持续数月,加剧了人们对 AI 工具被轻易用于脱去女性和儿童衣物的担忧。

  28. ACL Anthology · 收录 · 原文 日期未知新闻43

    Self-Reflection 提升大型推理模型安全性(原文,在新标签页打开)

    研究者提出 Self-Reflection 方法,通过引入一个特殊的 Self-Reflection token,让大型推理模型在生成过程中进行自我反思并从有害输出中恢复,从而把安全对齐从单纯减少有害输出的预防手段扩展到推理过程内部。该方法可无缝接入标准后训练流程,在提升安全性的同时也改善有用性。实验显示,采用 Self-Reflection 训练的模型将 HCR 从 13.8% 降至 4.1%,约为主流方法的三倍改进,并在有用性及安全与有用性的平衡上取得优势。在包括专门设计的自适应攻击在内的多种对抗攻击评测中,该机制在未做针对性对抗训练的情况下仍显著提升模型安全性。

    1 条报道 · 1 个来源查看事件时间线与全部报道