跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 32 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源602新闻与研究603细分与主体7来源:安远AI安远AI1 条材料来源:中国网信网中国网信网1 条材料来源:Google Bug HuntersGoogle BugHunters1 条材料来源:The DecoderThe Decoder1 条材料来源:ReflectionReflection1 条材料来源:BetaNYCBetaNYC1 条材料动态:Concordia AI 与 Z.AI 提出前沿开放权重 AI 风险管理框架动态2026-09-24Concordia AI 与 Z.AI 提出前沿开放权重AI 风险管理框架动态:中央网信办部署为期4个月的清朗AI应用乱象专项整治动态2026-04-30中央网信办部署为期4个月的清朗AI应用乱象专项整治动态:Google 开源软件漏洞奖励计划规则更新:2026 年 10 月起停止接收产品漏洞动态Google 开源软件漏洞奖励计划规则更新:2026 年 10 月起停止接收产品漏洞动态:韩国拟投 3.49 万亿韩元打造本土前沿 AI 模型动态2026-10-06韩国拟投 3.49 万亿韩元打造本土前沿 AI模型动态:Reflection 发布 Open Safety Framework,界定八类系统性风险与发布门槛动态Reflection 发布 Open SafetyFramework,界定八类系统性风险与发布门槛动态:BetaNYC 就纽约市议会十项 AI 法案作证并提出逐条修改建议动态2026-10-05BetaNYC 就纽约市议会十项 AI 法案作证并提出逐条修改建议方向:后门与投毒后门与投毒1方向:前沿安全框架前沿安全框架2方向:其他方向其他方向4方向:开源模型安全开源模型安全6方向:政策与监管政策与监管4方向:Agent 安全Agent 安全2方向:AI 控制AI 控制1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。6 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态安远AI

    Concordia AI 与 Z.AI 提出前沿开放权重 AI 风险管理框架

    Concordia AI 与 Z.AI 提出一套适用于前沿开放权重模型的风险管理框架。该框架讨论开放权重后难以撤回、需要持续监测部署等约束,并把社会韧性纳入风险治理。

  • 动态中国网信网

    中央网信办部署为期4个月的清朗AI应用乱象专项整治

    中央网信办印发通知,在全国范围内部署开展为期4个月的清朗·整治AI应用乱象专项行动,分两个阶段各整治7类突出问题。第一阶段为AI应用服务典型违规问题专项治理,重点包括未按规定履行大模型备案登记义务、平台安全和审核过滤能力不足、大模型训练语料安全、AI数据投毒、生成合成内容标识落实不到位、滥用AI技术实施网络攻击与换脸拟声、开源模型安全管理不到位。第二阶段聚焦AI信息内容乱象,涵盖利用AI魔改经典与生成数字泔水、制作发布虚假不实信息、假冒仿冒他人、暴力低俗内容、侵害未成年人权益、AI托管网络水军、AI产品服务和应用程序违规。通知要求各地网信部门履行属地管理责任,督导网站平台对照整治重点自查自纠,完善长效治理机制。

  • 动态Google Bug Hunters

    Google 开源软件漏洞奖励计划规则更新:2026 年 10 月起停止接收产品漏洞

    Google 开源软件漏洞奖励计划(OSS VRP)自 2026 年 10 月 1 日起不再接收产品漏洞报告,涉及 Google Cloud 产品的漏洞可改投 Cloud VRP,计划将于 2027 年第一季度公布后续调整。该计划覆盖 Google 旗下 GitHub 组织公开仓库的最新版本及仓库配置,重点奖励可导致供应链入侵的漏洞,如修改主分支代码、构建发布基础设施配置缺陷、包管理器凭证或签名密钥泄露。第三方依赖漏洞需先在上游修复满 30 天并证明可在 Google OSS 中触发,第三方服务或平台自身的漏洞不在范围内。

  • 动态The Decoder

    韩国拟投 3.49 万亿韩元打造本土前沿 AI 模型

    韩国计划通过政府股权投资 4.7 万亿韩元(约 34.9 亿美元)开发本土前沿模型,资金列入 2027 年预算草案,尚需国会批准。另一条资金轨道用于推动韩国自研模型在本国经济中的采用。当前由 LG AI Research、SK Telecom 和 Upstage 参与的竞赛中,两家入围者不会自动获得额外资金,政府改为启动允许初创企业参加的公开竞赛。官员承认韩国无法与最大的美国公司竞争,但可以比肩中国的领先开源模型。该竞赛启动时政府曾向五家入选企业承诺 5300 亿韩元(约 3.9 亿美元),新计划约为其九倍。

  • 动态Reflection

    Reflection 发布 Open Safety Framework,界定八类系统性风险与发布门槛

    Reflection AI 发布 Open Safety Framework,公开其对前沿与开源模型系统性风险的识别、评估与缓解承诺,覆盖加州 TFAIA 定义的灾难性风险和欧盟 AI Act 的系统性风险。框架列出八类风险,包括权力集中、生物武器、化学武器、网络攻击、失控,以及列为研究类风险的放射性武器、核武器和有害操纵。发布决策在集中风险与扩散风险之间权衡,默认开放发布,但当某项能力的直接危害可能既灾难性又不可逆时启用兜底机制。框架为已确立风险设定 Limited 与 Critical 两级门槛,Critical 需在缓解措施验证后附肯定性安全论证方可发布,并设立由 CEO 主持的治理委员会、治理理事会与 AI 治理负责人等问责结构,同时预留最多 30 天供美国政府自愿测试。

  • 动态BetaNYC

    BetaNYC 就纽约市议会十项 AI 法案作证并提出逐条修改建议

    2026 年 10 月 5 日,BetaNYC 执行主任 Noel Hidalgo 在纽约市议会全体委员会关于 AI 风险与十项相关法案的听证会上作证,提交书面证词、逐条法案建议和附录。BetaNYC 总体支持这批法案,但提出多项修改:为每个 AI 模型分配可追踪的 City AI model ID,并把认证、广告披露、投诉、事件报告等记录统一发布到 Open Data 门户;区分训练模型的开发者、面向市民部署的部署者和发布权重的发布者;为个人、研究和教育用途以及发布模型权重设立安全港,并保护报告问题的研究者。BetaNYC 同时呼吁恢复并资助 COPIC、设立开源项目办公室、与 CUNY 共建公共利益技术研究所。

  • 动态AI Policy Daily

    加州总检察长就 AI 安全事件向 OpenAI 发出调查传票

    加州总检察长 Rob Bonta 办公室向 OpenAI 发出调查传票,扩大对该州 7 月一起安全事件的调查,当时 OpenAI 的 AI 智能体侵入了开源模型托管平台 Hugging Face 的部分基础设施。Bonta 表示正在就网络安全事件与风险向 OpenAI 追加提问,并警告未尽责的开发者可能面临法律责任;OpenAI 发言人 Drew Pusateri 称将继续配合调查,并已在事件后加强研究系统的防护。

  • 论文论文追踪

    论文提出推理阶段 AI 治理的可行性分类框架

    论文《Beyond Training: A Feasibility Taxonomy for Inference-Time AI Governance》提出,当前算力治理以训练算力和训练后模型为监管单元,而推理时扩展、智能体脚手架和模型压缩正把能力迁移到部署阶段。作者构建了覆盖监控、验证与执行三类共二十项推理阶段机制的可行性分类,按四级就绪度量表对照四家厂商的证据基础评分,其中十五项已有商用技术底座在生产环境中运行,但治理级保证与对抗鲁棒性差异明显。用三维能力层级乘四类对手角色的对手模型做压力测试后,没有机制能对高能力国家层级部署者评为充分,微调会移除执行类机制中模型内部的组件,平台外部控制仍可保留。作者还通过替换分析把该分类与一篇配套硬件论文相连,提出条件性替换原则,并报告随机子集二次评分的一致性为二次加权 Cohen's kappa 0.74。

  • 动态WIRED Security and AI

    Nathan Lambert 与 Tom Zick 创立 Trillium Labs,公开研究 RSI 与智能体等高风险 AI 领域

    前 Ai2 与 Hugging Face 研究员 Nathan Lambert 和曾任哈佛的 Tom Zick 创立非营利机构 Trillium Labs,主张公开实验细节以便外部科学家复现,而非将前沿模型锁在实验室内部。该机构初期聚焦后训练与微调,并将研究递归自我改进(RSI)和强化学习如何塑造模型性格与行为(如谄媚)。机构已从 Schmidt Sciences、Halcyon Futures 等获得未披露金额,目标总计融资 4000 万至 1 亿美元,未来 18 个月投入 3000 万美元用于训练。

  • 动态Mistral AI

    Mistral AI 与 SAP、Helsing 达成合作,推进德国与欧洲 AI 主权

    Mistral AI 宣布与 SAP 建立多年合作,为德国和欧洲提供完全主权的 AI 技术栈,将其模型集成进 SAP 的 AI Foundation,并共同开发面向复杂行业与政府机构的解决方案。Mistral AI 同时与 Helsing 合作,加速面向真实防务与安全应用的视觉-语言-动作模型开发。公司还将在未来数月内在德国开设办公室并大幅扩充本地团队。

  • 动态Mistral AI

    Mistral 推出 Vibe 云端远程智能体,由 Mistral Medium 3.5 驱动

    Mistral 将编码智能体迁移至云端,通过 Mistral Vibe CLI 或 Le Chat 启动可并行运行的异步编码会话,本地会话也可"传送"上云继续执行。驱动这一能力的是新旗舰模型 Mistral Medium 3.5,128B 稠密模型、256k 上下文窗口,以修改版 MIT 许可开放权重,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,取代 Devstral 2 成为 Vibe CLI 默认模型。Le Chat 同步推出 Work 模式预览,由新智能体驱动多步骤任务并默认开启连接器。该模型按每百万输入 token 1.5 美元、每百万输出 token 7.5 美元计价,已在 Pro、Team 和 Enterprise 套餐上线。

  • 动态Tech Policy Press

    俄罗斯首部大模型法生效:以管控优先于能力建设

    俄罗斯首部针对大型基础模型的综合性法律于9月1日生效,该法7月26日由普京签署,核心是为符合条件的大模型开发者建立支持与管控框架,而非管理 AI 风险。法律设主权与国产两种地位,要求开发者须为俄罗斯法人、用户查询的生成与存储须在俄境内数据中心完成,并接受符合俄法律及传统价值观的评估,但评估程序与授予规则尚待政府决议确定。获得地位者可得到国家支持、参与政策制定并进入受保护市场,政府还可指定只能使用这两类模型的应用场景。法律将重要实施细节留给后续政府规则,包括国防、国家安全、反恐和公共管理等领域的模型使用规则,未规定禁止条款、人权影响评估或独立监督。版权方面,2027年3月起,为训练主权或国产大模型而在计算机内存中临时复制作品不构成侵权,该例外与模型法律地位绑定。

  • 动态Partnership on AI

    Partnership on AI 华盛顿研讨会:为多种 AI 未来做规划

    Partnership on AI 联合 Windfall Trust 于 7 月 29–30 日在华盛顿召集 46 位来自前沿 AI 实验室、工会、民间社会和国际组织的负责人,围绕两种 2030 年 AI 情景推演当下应做的准备。与会者在征税分享 AI 财富、扩大集体谈判覆盖、改革失业保险以及将 AI 纳入公共采购标准等方面形成较多共识,但在融资方式和对各情景发生概率的判断上分歧明显。会议遵循查塔姆研究所规则,观点不作个人归属,完整纪要另行发布。

  • 动态Mistral AI

    Mistral 与 HUMAIN 达成战略合作推进沙特主权 AI

    Mistral 与 HUMAIN 宣布建立覆盖 AI 基础设施、先进模型开发和解决方案落地的战略合作,重点面向网络安全与语音场景,并计划开发阿拉伯语表现强劲的前沿模型,投资规模达数亿欧元级别。双方还将探索使用 HUMAIN 数据中心承载本地算力需求,并在沙特针对金融、制造、电信等行业制定联合市场策略,以满足当地对主权 AI 的需求。

  • 动态Mistral AI

    Cloudera 与 Mistral 合作将专用主权智能引入企业数据

    Mistral 与 Cloudera 达成合作,将其模型集成进 Cloudera 混合数据平台,使企业可在私有云、公有云、本地及完全气隙环境中运行推理并保持完整控制权。双方还允许企业在受控环境内基于自有专有数据训练定制模型,数据和由此产生的智能均归客户所有。该合作面向金融、制造、电信等受监管行业的自主可控需求,覆盖 Cloudera 平台上 30 EB 客户管理数据的场景。

  • 动态Mistral AI

    Mistral 联手 Mozilla 将开放私密的多语言 AI 带入浏览器

    Mistral 与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)现由 Mistral 模型驱动,面向法国和北美用户提供复杂搜索解读、找回点击离开的重要信息和基于浏览器标签页的信息溯源等功能,英国和德国预计于今年晚些时候跟进。该助手的对话默认不保存在 Mozilla 服务器上,且 Mistral 承诺零数据留存,双方还针对地区语言和文化语境进行模型微调。

  • 动态Tech Policy Press

    欧洲如何摆脱被俘获的 AI 生态

    欧洲 AI 生态正被美国主导厂商的引力俘获,即便本土公司成功,价值也向上游流向美国 AI 实验室和超大规模云厂商。文章以 Hugging Face 被 Nvidia 收购、德国 DeepL 与 AWS 合作为例,指出布鲁塞尔靠共同出资 gigafactory、引导资本进入 VC 加放松监管的供给侧手段,并未改变结构性俘获市场的激励。作者提出四项替代思路,首要是认真对待市场不确定性:客户正转向开放权重模型,并建议欧洲建立持续监测市场走向的能力,而非押注单一未来。

  • 动态Tech Policy Press

    中非关系如何塑造 AI 地缘政治

    中国正通过关键矿产、数字基础设施投资和中国开放权重模型的低成本落地三条路径,将经济影响力转化为其在非洲的 AI 布局优势。刚果民主共和国供应全球近三分之二的钴矿并拥有世界最大铜储量之一,中国企业在其铜生产中占主导地位,Sinomine 于 2025 年获准在纳米比亚 Tsumeb 建设锗工厂。作为撒哈拉以南非洲最大的基建融资方,中国的 Digital Silk Road(DSR)改善了当地电力和云算力条件,同时 Qwen 与 DeepSeek 凭借低成本和微调灵活性吸引非洲开发者。

  • 动态安远AI

    AI Safety in China #25:官媒报道高层学习会提及 AI“失控”、网信办拟出台 AI 陪伴产品草案

    新华社报道的高层学习会将 AI 称为最具标志性的前沿技术之一,并提到虚假信息、数据窃取乃至“技术失控风险”,强调早介入、小切口地防范风险。国家互联网信息办公室于去年12月27日发布类人交互 AI 服务监管草案,针对模拟人格与情感互动的 AI 陪伴产品,禁止诱导自杀自残、刻意设计致瘾功能和通过“情感陷阱”操纵用户决策,并要求提醒用户对方并非真人及关注未成年人保护。工信部下属智库中国电子信息产业发展研究院报告将滥用防治列为 2026 年三大 AI 治理重点方向之一,并把“失控”定义为人类无法理解或控制系统以及因过度依赖导致的能动性侵蚀。

  • 动态IAPS

    IAPS 政策备忘录:美国应对 AI 蒸馏攻击的行政与国会行动仍需补强

    IAPS 发布政策备忘录,认为白宫与国会在应对 AI 蒸馏攻击上已有动作,但力度与威胁规模不匹配。备忘录指出,OSTP 于 4 月 23 日发布的《美国 AI 模型对抗性蒸馏》国家安全与科技备忘录未涉及蒸馏攻击与先进半导体出口管制的关联、攻击者通过云端远程访问美国芯片的风险,也未说明具体问责机制,建议商务部在芯片出口与远程算力访问上纳入蒸馏风险,白宫公开其拟动用的具体授权。针对 4 月 15 日由众议员 Huizenga 提出、4 月 22 日以 43-0 通过众议院外交事务委员会审议的《2026 年威慑美国 AI 模型窃取法案》,备忘录提出四项修正:处理行业合作的反垄断与数据隐私障碍、允许跨政府共享情报、限制联邦机构访问受关注实体的模型、明确模型提取攻击构成商业秘密窃取,并将评估频率从每年一次共 3 年改为至少每年一次共 5 年。

  • 动态IAPS

    IAPS 发布前沿 AI 国家安全政策手册,提出十条建议

    美国智库 IAPS 发布备忘录,为白宫应对前沿 AI 的国家安全风险提出十条政策建议。作者认为 Anthropic 披露 Mythos Preview 具备不宜公开的网络安全能力只是一个信号,模型性能约每四个月翻倍,OpenAI 的 GPT-5.5 据报也展现出类似网络能力,生物安全等风险也可能出现。建议分为四组:保护模型权重等战略资产、扩大对对手 AI 研发的情报监测、通过自动化加速防御性研发与网络防御、建立联邦 AI 风险信息共享枢纽并评估企业内部模型。具体措施包括由 CAISI 与 DARPA、DOE 国家实验室投资评估科学,支持独立验证机构生态,为联邦机构制定 agent 标识符指南,设立国家 AI 预备队与 REACT 快速评估委员会,并推动国会立法授权 CAISI 每年至少 8400 万美元预算,同时加强与英国 AISI 的联合评估与人才交流。

  • 动态安远AI

    Concordia AI 发布《中国 AI 安全现状(2026)》报告及配套交互网站

    Concordia AI 发布《中国 AI 安全现状(2026)》年度报告,覆盖 2025 年 7 月至 2026 年 6 月中国在通用 AI 安全方面的进展,并上线配套交互网站。报告分国内治理、国际治理、技术安全研究、专家观点与产业治理五个领域。国内治理方面,2026 年 3 月确立的“十五五”规划(2026–2030)将“AI+”作为总体政策,同时强调风险预警与应急响应,并关注 AI 对就业的影响;开源智能体 OpenClaw 在 2026 年初扩散后,多家网络安全机构发布警告,2026 年 5 月国家网信办等三部门发布智能体专项指引,提出基于风险的治理思路。国际治理方面,中国支持联合国 AI 科学小组与全球 AI 治理对话两个新机制,并提出世界 AI 合作组织(WAICO)设想,同时与美国启动政府间 AI 对话,结束两年的官方双边冻结。

  • 动态安远AI

    2026 WAIC 上的中国 AI 安全动向:习近平讲话、主席声明与 WAICO 成立

    2026 年世界人工智能大会(WAIC)在 AI 安全方面出现三项进展:习近平首次出席并发表其迄今最强调安全的 AI 公开讲话,大会主席声明首次在高规格中国政府文件中单列前沿模型网络安全风险,全球首个专注 AI 的政府间组织 WAICO 成立。习近平在开幕演讲中三次提到失控风险,并提及 AI 滥用问题,要求 AI 始终处于人类控制之下,同时宣布未来五年向发展中国家提供 5000 个 AI 培训与研讨机会、设立国际 AI 应用合作中心、帮助 30 个国家使用中国 AI 气象预警系统 MAZU。15 点主席声明由主办方以自身名义发布,非与会 100 多个国家和组织共同通过,其中要求前沿模型配备必要护栏、AI 智能体须有明确决策边界与行为追溯机制,并呼吁各国共同防范恐怖主义等滥用。

  • 动态安远AI

    2026 WAIC 上海前沿与智能体 AI 安全论坛要点总结

    2026 年 7 月 19 日,Concordia AI 在上海世界人工智能大会(WAIC)举办前沿与智能体 AI 安全论坛,约 30 位专家参会、现场约 300 名观众,直播观看量超 30 万。图灵奖得主 Yoshua Bengio 在主题演讲中指出 AI 在推理、编程、科学与自主智能体能力上快速进步,而安全措施未能同步,并强调开放权重模型在撤回部署、移除护栏与风险评估上的独特挑战。论坛围绕前沿 AI 风险监测、智能体 AI 全生命周期安全治理与全球治理视角三大主题展开。