全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态EdTech Innovation Hub
前美国卫生总监 Vivek Murthy 出任 Common Sense Media 青少年 AI 安全研究所主席
Common Sense Media 任命前美国卫生总监 Vivek Murthy 出任其青少年 AI 安全研究所主席,负责评估儿童使用的 AI 产品。该机构称其做法为“对 AI 做碰撞测试”,围绕研究、标准、行业承诺、产品评估、发布与宣传六个方向开展工作,并将评分卡与风险报告公开而非只交给被评估企业。Murthy 表示,防范灾难性 AI 风险不应掩盖 AI 当下已对儿童和家庭构成的威胁,称这是“今天的问题,不是明天的问题”。该研究所引用数据称,59% 的儿童和青少年用 AI 搜索信息,55% 用它做作业,2025 年研究显示超过半数美国青少年经常与 AI 伴侣聊天,另有 42% 的学生用 AI 获取心理健康支持。Common Sense Media 承认部分资助方生产该研究所可能测试的 AI 产品,但称研究所对标准、研究和评估负责,并对已发布结论保持编辑独立。
- 动态POLITICO Pro
Google 最新 Gemini 模型首发未送英国 AI 安全研究所测试
Google 最新 Gemini 模型首次发布时未交由英国 AI 安全研究所(AI Security Institute)测试,而是提供给美国测试方和一家以色列网络安全公司。
- 论文论文追踪
面向 EU AI Act 基本权利影响评估的可复用语义网框架
为满足 EU AI Act 第 27 条对高风险 AI 系统部署前开展基本权利影响评估(FRIA)的要求,研究者提出一个可复用的语义网框架,把分散的事件库、风险词表与法律文本整合为可 SPARQL 查询的知识图谱。该框架覆盖就业与工人管理(Annex III(4))和基本公共服务获取(Annex III(5)(a))两类公共部门场景,基于 150 条记录语料构建含 1,351 条 RDF 三元组的知识图谱,五个 FRIA 演示场景覆盖 103 条记录(68.7%)。对照 69 条记录金标准评估显示,LLM 辅助的就业领域分类仅达 κ = 0.045,提示该领域自动化公平性证据检索仍不可靠。
- 论文论文追踪
研究提出「静默修订率」:前沿 AI 安全框架 67% 实质变更未在开发者说明中披露
研究者提出「静默修订率」(silent revision rate),即安全框架承诺的实质变更中未被开发者自身说明所披露的比例,并发布带版本与哈希固定的语料库。语料覆盖 12 家发布安全框架的开发者的全部公开版本及各自的 changelog、redline 或公告,追踪 12 组连续版本对之间的 710 条承诺实例,其中 244 条逐条裁定。结果显示,严格标准下 67%(95% CI 62–72)的实质变更属静默,宽松标准下为 53%,按章节粒度降至 49%;叙述式公告的静默率为 74%,逐项 changelog 为 63%,而说明的篇幅字数几乎不影响结果。77% 的追踪变更削弱或移除了某项承诺,且在 8 组版本对中有 7 组削弱比加强更常被静默处理。
- 论文arXiv
研究者提出 AI 评估沙盒配置器,支持欧盟 AI 法案下的技术评估
针对欧盟《人工智能法案》要求各成员国在 2027 年 8 月前建立 AI 监管沙盒(AIRS),研究者提出开源框架 AI Assessment Sandbox Configurator,用于在沙盒中规模化开展结构化技术测试。该框架从 AIRS 的程序条件和法案对高风险系统的义务中推导出 11 项架构与治理要求,包含通过稳定插件 API 访问的测试与控制目录、统一异构输出的共享数据模型、面向不同角色的仪表盘以及分受众报告。作者描述了架构与当前版本,并报告一次早期试点:在真实 AIRS 活动中运行了数据统一与报告层,并为一官方 Exit Report 提供了输入。文中还讨论了路线图、目录分层贡献模型带来的治理问题,以及开源评估生态在成员国间形成的制度路径。
- 论文论文追踪
研究称全球南方 AI 审计远落后于部署,十年仅不足二十例已部署系统审计
Eticas Foundation 的研究者基于十年审计实践指出,全球南方 AI 部署速度不逊于北方,但审计严重滞后。作者统计,过去十年拉丁美洲、撒哈拉以南非洲和亚太地区已部署系统的第二、第三方审计不足二十例,而该地区有数百个已记录的公共部门算法和数十亿美元的国家 AI 投资。研究归纳出四类共性模式:用代理指标替代效度、性能声明在流行率分析下失效、被评分人群从未出现在训练数据中、移除受保护属性后结构性偏差依然存在。作者认为这一差距根源不是能力问题而是资金问题,最有条件改变现状的是资助该地区多数关键 AI 的发展与慈善资助方,可通过资助条件要求独立评估。
- 动态X @NeelNanda5
英国 AISI 招聘前沿 AI 安全人才
英国政府的 AI Security Institute 正在招聘!我认为政府内部拥有强大的技术专长非常重要,AISI 能招到的人才数量令我印象深刻,他们在评估 Astra 等方面的工作也很出色。
- 动态OECD.AI(政策与事件监测)
弥合 AI 评估差距的五步路线图
OECD.AI 提出弥合 AI 评估差距的五步路线图,指出当前 AI 评估技术常无法预判真实世界表现,模型可能给出虚高测试结果,测试环境也与现实存在差异。2026 年国际 AI 安全报告由 100 多名专家编写、30 多个国家和多边机构支持,提出"AI 证据困境"。路线图第一步是平衡标准化与定制化,在 2026 年印度 AI 影响峰会上多家公司承诺改进多语言与情境化评估。
- 动态NIST CAISI
CAISI 与 GSA 签署 MOU,为 USAi 平台提供 AI 评测支持
美国 AI 标准与创新中心(CAISI)与总务管理局(GSA)签署谅解备忘录,为联邦政府的安全生成式 AI 平台 USAi 提供 AI 评测支持。CAISI 将运用其测量科学专长,协助 GSA 及合作机构开发方法,在 USAi 平台的真实用户工作流中评估 AI 系统的性能、安全与功能。双方还将共同产出支持联邦机构采购和采用 AI 的资源,包括部署前评估的方法学指南,以及让机构按自身任务衡量部署后表现的工具。该合作建立在 CAISI 与领先 AI 公司及其他政府伙伴的既有工作之上,并推进美国 AI 行动计划中要求 CAISI 支持 AI 模型测量与评估科学、发布联邦机构自评指南的部署。
- 动态NIST CAISI
CAISI 与 OpenMined 签署 CRADA,推进隐私保护型 AI 评测
美国 AI 标准与创新中心(CAISI)与开源非营利组织 OpenMined 签署合作研发协议(CRADA),共同研究隐私保护型 AI 评测方法。合作将利用 OpenMined 的 PySyft 等软件基础设施,在数据、模型或基准需保密(如知识产权、数据保护或国家安全)的情况下仍能对 AI 系统进行严格测量。相关成果将支持 NIST 在 AI 安全与应用评测方面的工作,并为自愿性标准、最佳实践及后续建议提供依据。
- 动态Anthropic
Anthropic 与 Accenture 合作开展前沿 AI 嵌入式评估
Anthropic 宣布与 Accenture 合作开展前沿 AI 的独立评估,由其专业 AI 业务 Faculty 牵头,内容包括模型评估与红队测试、对齐评估和模型护栏测试。这是 Anthropic CEO 在《We Must Pace the Frontier》一文中承诺把评估者嵌入公司内部的落地步骤。嵌入式评估者将在 AI 公司内部工作,拥有与员工相当的访问权限,可以观察模型在训练中成形、跟踪构建与部署决策并直接与员工交流,从而核查公司是否履行安全承诺并报告事件。双方预计未来五年各投入至少 10 亿美元建设这一领域的能力。该合作非排他,Anthropic 表示会在发文后数周内公布其他评估方,Accenture 也将以类似身份与其他 AI 开发者合作。
- 动态X @AnthropicAI
Anthropic 与 Accenture 合作开展前沿 AI 独立评估,双方五年各投至少 10 亿美元
Anthropic 宣布与 Accenture 合作开展前沿 AI 的独立评估,这是其近期承诺在 Anthropic 内部嵌入评估方的一部分。双方预计在未来五年各投入至少 10 亿美元用于建设这一领域的能力。Anthropic 在公告中给出了合作详情链接。
- 动态日本 AI 安全研究所(J-AISI)
日本 AI 安全研究所(J-AISI)将举办 2026 年度「AI 安全评估环境 研讨任务组」总会
日本 AI 安全研究所(J-AISI)将于 2026 年 10 月 7 日在线举办 2026 年度「AI 安全评估环境 研讨任务组」总会,免费公开,非任务组成员也可报名,截止 10 月 5 日 16:00。该任务组由多家 AI 相关企业参与,讨论其以开源软件形式公开的「AI 安全评估环境」评估工具的定位与功能强化方向。会议内容包括 AISI 活动介绍、AI 安全评估观点、AI×安全最新动向、评估环境与任务组活动介绍,以及 AI 安全评估专题讨论。
- 动态FAR.AI
FAR.AI 发布 2023 对齐研究进展:从 KataGo 对抗攻击到鲁棒性缩放律
FAR.AI 公布成立一年多来的对齐研究进展,其研究分为鲁棒性科学、价值对齐与模型评估三类。团队发现 KataGo、AlphaGo 等超人级围棋 AI 存在灾难性失效模式,正用机制可解释性方法分析其对抗攻击脆弱性,并探索语言模型鲁棒性的缩放律。该机构认为 RLHF 等现有对齐方法无法提供可证明的安全保证,目标是孵化早期阶段的安全研究议程。
- 动态FAR.AI
FAR.AI 湾区对齐研讨会 2024:160 名研究者聚焦 AI 安全与对齐
2024 年 10 月 24-25 日,160 名来自学术界、产业界、政府和公益组织的研究者与负责人齐聚 Santa Cruz,参加 FAR.AI 湾区对齐研讨会,围绕评估、鲁棒性、可解释性与治理展开讨论。Google DeepMind 的 Anca Dragan 以"优化失准"开场,METR 的 Beth Barnes 强调严格评估与开源评测,Redwood 的 Buck Shlegeris 介绍可信监控、串通检测等 AI 控制策略。会议还涵盖中国 AI 政策、稀疏自编码器与因果抽象、辩论式可扩展监督等议题。
- 动态FAR.AI
FAR.AI 新加坡对齐研讨会 2025:Bengio keynote 与 CVE-Bench 等 AI 安全研究
FAR.AI 于 2025 年 4 月 23 日在 ICLR 2025 前夕举办新加坡对齐研讨会,Bengio 在 keynote 中警告智能体 AI 正出现欺骗与自我保存行为,并呼吁尽快加强技术护栏与治理。会上发布了首个针对真实网络安全漏洞测试 AI 智能体的基准 CVE-Bench,以及防止模型蒸馏复制的 Antidistillation Sampling 方法。Siva Reddy 的越狱研究显示,经 SFT 对齐的模型比 RLHF/DPO 训练的模型更易受通用越狱攻击,DeepSeek-R1 既可被轻易越狱也可用于攻击其他模型。
- 动态FAR.AI
FAR.AI 会议探讨面向 AI 政策的技术创新
FAR.AI 在华盛顿举办会议,汇聚超 150 名专家讨论 AI 治理的技术基础,涵盖能源需求、与中国竞争、安全评估及形式化可验证承诺等问题。会上提出将审计作为综合生态系统推进有效治理,并建议以多层防御系统应对失控风险——由可信 AI 通过红队评估监视不可信 AI,同时警告这只是权宜之计。
- 动态FAR.AI
FAR.AI 获超 3000 万美元多资助方支持,扩展前沿 AI 安全研究
FAR.AI 在 2025 年获得超 3000 万美元资助承诺,资助方包括 Coefficient Giving、Schmidt Sciences、Survival and Flourishing Fund、CSET 和由 Frontier Model Forum 支持的 AI Safety Fund。资金将用于把技术研究团队从 15 人扩至 30 人以上、新设技术治理部门、每年支持 20 名以上研究员,并将 Alignment Workshop 从每年两场增至三场、拓展至亚洲和全球南方。FAR.AI 计划到 2028 年取得 3-5 项重大技术突破,并推动前沿实验室采纳安全标准。
- 动态FAR.AI
FAR.AI 举办伦敦对齐研讨会 2026,逾 200 人聚焦前沿 AI 监管缺口
FAR.AI 于 2026 年 3 月 2-3 日主办 London Alignment Workshop,汇聚超过 200 名研究者、政策制定者和从业者,讨论前沿 AI 系统发展快于监管制度的问题。议题涵盖可解释性、可扩展监督、评测方法与治理框架,Adam Gleave 提出以保证、可审计性和效率三项标准建立工程化安全路径,Gillian Hadfield 则提议设立独立核查组织提供外部担保。
- 动态FAR.AI
FAR.AI 第二届 TIAP 会议:AI 政策的技术创新——我们听到了什么
FAR.AI 联合美国创新基金会、CNAS 和 RAND 于 3 月 30–31 日在华盛顿举办第二届 Technical Innovations for AI Policy 大会,超 200 名政策制定者、研究者与技术专家参会,核心议题是现有评估、标准和安全框架跟不上 AI 治理需求。Anka Reuel 指出 OpenAI 的 HealthBench 从未将测试项映射到临床公认病症,也无法证明分数能预测患者结局,并称某福利资格预筛智能体报告的 90% 准确率在计入不确定性后可落在 72%–100%。Ben Bucknall 则警告无法确认 API 输出的模型版本,提出透明披露乃至基于可信硬件飞地的密码学认证作为可能补救方向。
- 动态SecureBio
SecureBio 的模型评估原则与实践
SecureBio 公布其模型评估原则与实践,在 AI Evaluator Forum 的 AEF-1 Standard 基础上扩展,适用于其开展的每一次模型评估。该机构评估接近部署配置的预发布模型快照,并申请访问无安全过滤或安全微调的版本,以在护栏被绕过时评估模型底层能力。SecureBio 已开展多次生物安全预发布评估,最近一例为 GPT-5.6 Sol,此前曾独立发布 GPT-5.5 的评估报告。
- 动态SecureBio
SecureBio AI 负责人 Seth Donoughe 卸任,Jasper Götting 接任
SecureBio AI 团队主任 Seth Donoughe 卸任,将 AI 研究负责人一职交给自 2024 年起领导该团队 AI 研究的病毒学家 Jasper Götting。Donoughe 指出,当 AI 科学能力超越所有人类专家后,基于人类专家知识构建的基准将失去动态范围,需转向人类可验证但专家难以完成的任务(如预测实验结果),而 SBAI 正投入该方向;但该方法不适用于评估新想法、判断与研究方向的产出。他还强调需研究人机混合科学家,并建立 AI 驱动科学发现的安全流程。
- 动态NIST
NIST 将 AI 安全研究所联盟更名为 NIST AI Consortium 并扩大范围、招募新成员
NIST 将成立两年的 AI Safety Institute Consortium(AISIC)更名为 NIST AI Consortium,使命从 AI 安全扩展到 AI 测量、创新与采用,并公开征集新成员。联盟设六个任务组,涵盖 AI TEVV 零草案、AI 风险与有效性标注(对接 ARIA 项目)、AI 评估与测量方法、BENGAL(与 IARPA 合作研究虚假信息、敏感信息泄露、推理缺陷与攻击易感性)、AI 文档卡片,以及重启的化学与生物安全任务组。新成员按意向书先到先得遴选,现有成员须签署修订协议,成员需与 NIST 签订 CRADA。
- 动态Help Net Security AI
Google 发布 Gemini 4 Argon,称可自主发现并修补关键软件漏洞
Google 发布前沿模型 Gemini 4 Argon,并通过 Fairwind Program 向一批受信任的网络防御方开放,称该模型能自主定位、验证并修补关键软件漏洞,同时会向这些防御方及 Google 内部团队提供不带网络护栏的版本。开发者、企业和消费者稍后可用,先面向付费 API 客户和 Google AI Ultra 订阅者。Google 表示这一能力级别需要分阶段发布,仍在根据早期测试者反馈调整护栏,并参与美国政府关于发布前模型访问的自愿流程;发布前加强了针对网络及化学、生物、放射和核滥用的防护,由内部和外部红队测试,并有监控系统观察其推理与行动、必要时中止执行。