GIRAI 2026 报告:135 国负责任 AI 治理评估发布
Global Index on Responsible AI: 2026 Report
GIRAI 2026 评测 135 个国家的负责任 AI 治理:全球均分约 35/100,框架落地证据仅覆盖 55% 的活跃框架案例(全球南方 45%)。
- 负责任 AI 治理在扩张,但许多框架不可执行、实施弱,且与保护人们所需的机构脱节。指数要衡量的是承诺是否变成对权利、救济和监督的实际保护。
- 第 2 版以人权路径、参照 UNESCO《人工智能伦理建议书》,在 135 个国家评估五个维度。评分来自 AI Policy、CSO Engagement、Enabling Conditions 共 38 项指标,并对政府使用不可接受风险 AI 施加 URAI 罚分。数据期为 2023 年 11 月 1 日至 2025 年 9 月 30 日。
- 全球均分约 35/100。活跃框架中仅 55% 有实施证据,全球南方为 45%。全球南方主题覆盖从 2.5 升至 4.7,但 78% 框架案例非约束性(北方 42%)。仅 18% 的国家要求披露政府算法系统;35 国有政府使用不可接受风险 AI 的可信证据。
- 数据止于 2025 年 9 月 30 日,晚于该日的进展留待第 3 版。指数不直接评估单个 AI 系统或公司行为。作者承认 URAI 指标可能未充分反映国家滥用的规模或严重程度,并计划在后续版本细化方法。
- 基准
- Global Index on Responsible AI 2026 (2nd Edition)135 countries and jurisdictions1 November 2023–30 September 2025
- 指标
- GIRAI score (out of 100)framework coverageimplementation evidence ratebinding vs non-binding shareURAI penalty
全球负责任 AI 指数(GIRAI)2026 报告基于 UNESCO 等人权框架,评估各国如何把负责任 AI 承诺转化为可执行的保护、机构能力与救济机制。评估覆盖 135 个国家的 68,138 个数据点、38 项指标,分政府 AI 政策与实施(17 项)、公民社会参与(5 项)、使能条件(15 项)及政府部署不可接受风险 AI 系统的记录案例,数据区间为 2023 年 11 月至 2025 年 9 月。结果显示,135 国中有 126 国至少有一项政府 AI 政策或举措,但往往未转化为实质保护:全球南方国家自首版以来新增 306 项框架指标案例中的 203 项,其中 78% 的框架不具约束力,全球北方为 42%。透明与可解释性是表现最好的指标之一,58% 的国家有相关框架,但仅 18% 要求公开政府算法;35 国存在政府部署不可接受风险 AI 系统的可信证据。
深度解读
这篇论文试图解决什么问题?
衡量 135 国负责任 AI 治理是停留在书面承诺,还是形成可执行的保护。
核心问题是:各国政府是否只是采纳负责任 AI 框架,还是在以保护权利、促进公共利益、服务最易受伤害者的方式治理 AI。
- 场景与重要性:作者认为 AI 已进入课堂、工作场所、诊所、福利机构、边境、法庭和银行。它可以协助服务,也可以剥夺机会、错误分类、扩大监控并再现歧视。作者称,没有测量,负责任 AI 就停留在抽象承诺;测量才能看出治理在推进、停滞,还是尚未开始。
- 现有讨论的不足:作者称,全球证据不均衡,辩论多由欧洲和北美洲塑造,非洲、南美和中美洲、加勒比、亚洲和中东的数据常常碎片化或缺失,从而扭曲全球图景。
- 核心观察:执行摘要称,负责任 AI 治理在扩张,但扩张得不够快、不够深、也不够公平,跟不上 AI 的开发与部署。许多框架仍不可执行、实施弱,并与保护人们所需的机构脱节。
- 本文提出什么:第 2 版 Global Index on Responsible AI(GIRAI) 用基于人权的方法,参照 UNESCO《人工智能伦理建议书》,在 135 个国家/司法管辖区评估框架、机构、实践和使能条件。指数不直接评估单个 AI 系统,也不评估科技公司的行为、投资或影响。
- 它要回答的问题:全球负责任 AI 处于什么状态;各国做了哪些承诺与行动;框架与实施之间的差距;保护是否可执行;公民社会组织(CSO)扮演什么角色;区域与全球趋势;以及主要能力缺口。
有哪些相关研究?
指数把 UNESCO 伦理建议和既有全球数据缺口当作测量负责任 AI 的参照,而不是与模型安全基准对比。
全球规范与测量参照
- UNESCO Recommendation on the Ethics of Artificial Intelligence:作者称指数以基于人权的方法为基础,并受该建议书及其他相关全球协定和承诺的启发,用来建立跨国可比的负责任 AI 治理基准。
- UN M49:报告用联合国统计用标准国家或地区代码,把发展中经济体称为 Global South、发达经济体称为 Global North。
作者用来说明扩散与事件规模的外部数据
- Stanford AI Index 2026(Sajadieh 等):作者引用其关于生成式 AI 人口采用率和全球企业 AI 投资的数字,用来说明扩散快于治理,而不是作为本指数的评分输入。
- AI Incident Database(Responsible AI Collective):作者引用其 2025 年报告的 AI 事件增幅,以及相对 2023 年的增幅,用来说明已记录事件背后仍有大量因报告机制不可及和系统不透明而隐蔽的伤害。
- Okolo(2023):作者引用其对全球南方 AI 机会与治理包容性的讨论,用来描述大型科技公司、基层组织和本地倡议在农业、医疗和教育中的扩展。
基线与数据集
- 基线是 GIRAI 第 1 版(2024 年发布)。第 2 版用同一指数的前后覆盖比较主题数量、新增框架案例和性别等相关变化。
- 本版数据集覆盖 2023 年 11 月 1 日至 2025 年 9 月 30 日的公开政府框架、实施活动、CSO 参与和不可接受风险部署;次级数据包括法治、平等、网络安全、低碳能源使用、劳工权利合规、数字技能和公共信息获取等使能条件。
作者把本文定位为目前收集全球、国家级负责任 AI 证据的最大努力:重点不是模型或公司行为,而是政府承诺是否通过机构、资源和实施变成对人们的保护,并补上欧洲和北美洲以外常常缺失的国家级证据。
论文如何解决这个问题?
用五维度、三支柱和 38 项指标把公开证据打成分数,再以 URAI 罚分调整国家总分。
GIRAI 第 2 版把国家级公开证据整理成可比较分数:先看政府是否建立并实施框架,再看公民社会能否参与和问责,以及更广泛的制度条件是否支持尊重权利的治理。
测量对象与不做的事
- 五个维度:Inclusion and Diversity;Ethics and Sustainability;Labour and Skills;Trust and Safety;AI Use in Public Service。它们是组织原则,分别对应边缘化与伤害、伦理和生态条件、劳动与技能、防止伤害和维持信任,以及公共权力通过技术系统行使时的权利与问责。
- 三支柱:AI Policy 测量政府框架和倡议的存在、质量与实施;CSO Engagement 测量公民社会活动和纳入机制;Enabling Conditions 用结构性条件补充前两者。
- 指标构成:执行摘要称,17 项指标评估 AI Policies,另有每维的情境指标共 15 项,以及 1 项记录政府部署不可接受风险 AI 系统(URAI)的可信证据。正文又称分数来自 38 项指标。
- 明确不测量:不直接评估单个 AI 系统是否符合负责任 AI 标准;不评估主要科技公司和开发者在各国的行为、投资或影响。
证据与时间范围
- 一手数据:135 名国家级研究者通过专家 Global Survey 收集。问卷按指标类型使用不同模板,覆盖政府 AI 政策框架与倡议、公民社会参与、政府纳入 CSO 的机制,以及不可接受风险部署。四套模板合计最多 382 个问题,许多按证据类型和可得性条件触发。全球质量评估团队复核全部数据。
- 数据期:活动日期为 2023 年 11 月 1 日至 2025 年 9 月 30 日。调查设计写的是 2023 年 11 月至 2025 年 10 月之间各国推进负责任 AI 的行动。2025 年 10 月 1 日至 2027 年 9 月 30 日的进展计划由第 3 版捕捉。
- 规模:研究者识别并评估了 376 个负责任 AI 框架、828 项推进负责任 AI 的政府倡议、615 项 CSO 驱动的倡议,合计 68,138 个数据点,并辅以次级使能条件数据。
计分与 URAI 罚分
- 聚合:一手数据按 Figure 1 的结构计分,再对五个维度取平均,得到最终 GIRAI 分数(满分 100)。
- URAI penalty:单独指标记录公开记录或可信报告,即政府使用对人权、法治或民主治理构成不可接受风险的 AI。它作为问责罚分调低最终国家分数。类别包括生物特征监控、刑事司法与执法误用、社会评分、AI 驱动的网络攻击、虚假信息或影响行动、AI 武器或武装冲突中的 AI 使用、歧视性公共服务系统;研究者还可在 “Others” 下报告未覆盖的案例。
- 框架如何编码:AI Policy 指标同时看文件类型、可执行性(binding/non-binding)、监管范围(horizontal 或 vertical)、利益相关方磋商、业务化(实施机构与计划、预算、监测评估)、主题覆盖,以及在没有框架时的政府主导实施倡议。
- 作者对呈现方式的选择:报告主要用描述性统计和直接计数(例如有框架的国家数),而不是只报告指标均分。作者称,打分使用了更多变量,但本报告为了可行动和透明,避免复杂的分数计算。
作者承认的方法边界
- 作者承认,把 URAI 并入指数的方式可能没有充分反映此类误用的规模或严重程度:一个存在严重侵犯的国家仍可能在其他治理维度上得分相对较高。作者称,指数意图是追踪政府承诺与进展、识别缺口并促进问责,并计划与研究界和人权界对话以细化方法。
- 作者称,任何指数都受数据可得性和可及性约束,也受文化和政治偏见影响,可能使某些维度和主题的表现不完整。
论文做了哪些实验?
135 国均分约 35/100;活跃框架仅 55% 有实施证据,要求披露政府算法系统的国家仅 18%。
实验设置
- 被评估对象:135 个国家/司法管辖区的政府。报告把 “countries” 与 “jurisdictions” 互换使用,并称部分司法管辖区存在争议,命名不代表立场。
- 时间与证据:公开政府框架、实施活动、CSO 参与和不可接受风险部署,活动窗口主要为 2023 年 11 月 1 日至 2025 年 9 月 30 日;质量评估团队复核国家级研究者提交的数据。
- 比较基线:GIRAI 第 1 版。Global South/Global North 按 UN M49 的发展中/发达经济体划分。
- 主要指标:满分 100 的 GIRAI 分数;框架覆盖的国家数或比例;活跃框架案例中有实施证据的比例;binding 与 non-binding 的份额;主题覆盖的平均个数;URAI 的国家计数及罚分调整。
- 评审方式:国家级专家按问卷编码公开证据,再由全球质量评估者复核。本报告正文优先报告国家计数和案例比例,分数分布放在附录图(Figure A1–A19)。
- 规模:376 个框架、828 项政府倡议、615 项 CSO 倡议、68,138 个数据点。论文未在正文给出每个条件的重复次数。
主结果
据执行摘要,全球与分项覆盖如下。
指标 结果 出处 GIRAI 全球平均分 约 35/100 执行摘要要点 1 活跃框架案例中有实施证据 55%;Global South 45% 执行摘要要点 1 Global North vs Global South 平均分 55 vs 27 执行摘要要点 10 要求披露政府算法系统 18% 的国家 执行摘要要点 4 政府使用 URAI 的可信证据 35/135 国 执行摘要要点 3 有国家 AI 政策或等效框架 73/135(54%) 执行摘要要点 10 CSO 参与的运作机制 36 国(27%) 执行摘要要点 10 - 作者的解读:承诺语言与保护体系之间存在距离。作者称,框架、原则和战略在增加,但把它们转成对人们问责的制度能力没有跟上采用速度。Vilas Dhar 的前言称,135 国中约 126 国显示某种承诺,但全球平均仅 35 分。
- 南北差异:作者称,自第 1 版以来,Global South 框架覆盖的 GIRAI 主题平均数从 2.5 升至 4.7(作者注:未四舍五入为从 2.547 到 4.653,增幅 83%);Global North 从 8.2 升至 11.1(增幅 35%)。Global South 占第 1 版以来 306 个新的“指标被框架覆盖”国家案例中的 203 个。
- 软法为主:这些国家中 78% 的负责任 AI 框架案例是 non-binding,Global North 为 42%。前言称,在活跃框架覆盖被审政策领域的全部案例中,Global South 有 22% 由约束性文书处理,Northern 为 58%;并称 EU AI Act 单独约占第 1 版以来新增可执行保护的三分之二。
安全、公共部门与性别
- 安全被当成技术问题:作者称 AI safety and security 是增长最快的治理领域之一,但很多聚焦技术性保障。只有 49 国(36%) 有框架处理 AI 助长的虚假信息和暴力。同时 35/135 国有政府使用不可接受风险 AI 的可信证据。
- 透明与自我披露分裂:Transparency and Explainability 是表现最强的指标,58% 的国家有某种框架,但实施落后于框架存在。Public Disclosure of Government Algorithmic Systems 是 AI Use in Public Service 中最弱指标,仅 18% 的国家要求披露政府 AI 系统。前言称独立监督机构只有 28 个国家建立。
- 性别:自第 1 版以来新增 29 个国家处理性别与 AI,但 55 个已有性别相关框架的国家里只有 24 个有实施证据。作者称,对性别化 AI 伤害的保护仍然有限。
劳动、儿童、环境与语言
- 技能强于保护:AI Literacy 是表现最强的指标之一:71 国(53%) 有某种框架,106 国有该领域的某种活动证据。对照之下,只有 55 国(41%) 有处理儿童在 AI 中权利的框架,其中 27 国有实施证据。
- 劳动:劳动保护框架只存在于 39 国(29%),再培训与技能提升框架有 72 国(53%)。作者称,很少国家处理工人针对 AI 驱动的工作场所变化而组织起来和集体谈判的权利。前言称只有 39 个国家保护工人。
- 环境与语言:仅 27% 的国家有处理 AI 环境影响的框架,其中 83% 为 non-binding;很少政府要求披露能源、用水或环境影响。52 国(39%) 有政府主导的本地语言技术与文化包容倡议;只有 47 国(35%) 有处理文化与语言多样性的框架,很少要求开发者使用多样化数据集或使系统适应当地情境。全球实施记录中多利益相关方磋商只出现 31 次;近期 215 个 AI 相关框架中有 164 个为 non-binding。
其他消融与分析
- 报告正文用描述性计数,附录用 Figure A1–A19 给出国家、区域、维度、支柱、可执行性和从框架到实施的分布;正文摘录未给出这些图的逐格数值。
- 生成式 AI 使用扩散被作者引为外部背景:53% 的全球人口使用过生成式 AI 工具(执行摘要;正文将 53% 归于 Stanford AI Index 2026 的人口采用率)。
- 作者称,低实施分不应只被读成缺乏雄心;Robert Opp 的前言把实施缺口在许多情境中称为发展缺口,涉及基础设施、融资、技术评估能力、制度带宽和在全球 AI 生态中的议价能力。
- 第 2 版更新了方法与计分,以便更好捕捉现有框架和政府主导倡议的细节;作者未在摘录正文中报告与第 1 版逐指标的分数重构公式。
- URAI 罚分施加于最终国家分,而不是替代其他维度得分;作者明确说严重违规国家仍可能在其他维度得分较高。
- 亮点案例(Bright Spots)在 Part 3 各节展示各国推进负责任 AI 的做法;摘录未保留这些案例的国别数字,故不转写。
有什么可以进一步探索的点?
作者把下一阶段界定为从承诺转到保护,并写明数据窗口、URAI 计分和指数不测系统与公司。
作者指出的局限与后续方向
- 数据窗口(Scope of the 2nd Edition):数据不反映 2025 年末或 2026 年初的进展。2025 年 10 月 1 日至 2027 年 9 月 30 日的进展将由第 3 版捕捉。
- 可得数据与偏见(Scope):任何指数都受数据可得性和可及性约束,也受文化和政治偏见影响,可能使特定维度和主题的表现不完整。
- 呈现简化(Scope):作者称,把指标的全部变量变成分数涉及多项方法论决定,这些概念选择对所有利益相关方不一定清楚;本报告因此避免复杂分数计算。他们也知道计分系统反映了更多用于给国家赋分和定位的变量。
- URAI 的纳入方式(What the Index Measures):作者承认,该指标的纳入方式可能未充分反映国家误用的规模或严重程度。作者称将与更广泛的研究和人权社群对话,细化方法。
- 下一阶段的十条优先事项(Part 4 / 执行摘要):从承诺转向保护,包括提高公共部门 AI 标准、建设监督与执法机构、在高风险领域建立约束性底线、把救济放在中心、把劳动与环境伤害纳入治理、资助独立公共利益能力、使参与有意义、围绕权利而非仅围绕系统形成全球汇合、把监测和证据当作治理基础设施,以及推进 South–South 合作以便全球南方国家协商互操作性而不是进口标准。
- 不直接评估的对象(What the GIRAI does not directly assess):指数不评估单个 AI 系统是否按负责任 AI 标准设计、开发或部署,也不评估主要科技公司与 AI 开发者的行为、投资或影响。这是测量范围的明文边界。
实验覆盖范围
- 评估单位是 135 个国家/司法管辖区的国家级治理条件,证据由国家级研究者收集并经全球质量评估复核;活动主要落在 2023 年 11 月 1 日至 2025 年 9 月 30 日。
- 比较对象是本指数第 1 版,并按 UN M49 划分 Global South 与 Global North;区域分数分布放在 Part 2 和附录 Figure A2–A5。
- 覆盖三个支柱和五个维度,并单独记录 URAI 罚分。执行摘要报告了安全、公共部门披露、性别、儿童权利、劳动、环境、本地语言和 CSO 参与的国家计数。
- 论文未报告每个国家问卷的应答完成率、编码者间一致性,或 URAI 各类别的分国计数。
- 附录 Figure A1、A6–A19 计划呈现国家总分、维度与支柱、框架覆盖、可执行性、政府主导倡议以及从框架到实施的全球、维度和区域平均数;这些图的逐格数字未进入本次正文摘录。
总结一下论文的主要内容
GIRAI 第 2 版用 135 国公开证据显示,负责任 AI 的书面覆盖在增加,可执行保护和公共部门问责仍然少。
GIRAI 2026 第 2 版是一份国家级治理测量报告,不是模型安全实验。它问的是政府承诺有没有变成对人的保护。
- 问题:作者认为 AI 已进入公共服务和日常决策,伤害可以规模化、跨境且难以争辩。欧洲和北美洲以外的治理证据往往碎片化,因此需要一套基于人权、可跨国比较的测量。
- 做法:在 135 个国家,于五个维度和三个支柱下编码公开框架、实施、CSO 参与和使能条件,形成满分 100 的分数,并用政府部署不可接受风险 AI 的 URAI 罚分调整总分。时间窗口主要是 2023 年 11 月 1 日至 2025 年 9 月 30 日。研究者评估了 376 个框架、828 项政府倡议和 615 项 CSO 倡议,共 68,138 个数据点。
- 结果:全球均分约 35/100;Global North 平均 55,Global South 平均 27。活跃框架案例里只有 55% 有实施证据,全球南方为 45%。全球南方主题覆盖平均数从 2.5 升到 4.7,但这些国家 78% 的框架案例是 non-binding,北方为 42%。
- 分裂的治理:Transparency and Explainability 有 58% 的国家具备某种框架,但只有 18% 要求披露政府自己的算法系统。AI 素养活动出现在 106 国,劳动保护框架只有 39 国(29%),处理 AI 环境影响的国家只有 27%,且其中 83% 的框架非约束性。35/135 国有政府使用不可接受风险 AI 的可信证据;只有 49 国(36%)的框架处理 AI 助长的虚假信息与暴力。
- 作者的结论:负责任 AI 治理在增长,但下一阶段应按可执行保护、公共部门披露、救济途径和可问责机构来判断,而不是按原则文本的数量。作者计划由第 3 版覆盖 2025 年 10 月至 2027 年 9 月的进展,并继续细化 URAI 的纳入方法。