全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文论文追踪
论文提出 AI Agent 声明的可审计性框架
论文提出,要让关于 AI Agent 的声明可被核查,必须先明确其政策、范围、可据以判定的记录以及由谁记录,并在任何结论之前固定这些要素和决策规则。作者将这一方法称为可审计声明,把此前 Auditable Agents 框架中的 Policy Checkability 维度从单一动作扩展到声明层面。论文指出 Agent 还带来三项额外条件:由独立记录覆盖、授权绑定到每个动作的参数、以及完整性之外的完备性,并在显式模型下证明缺少任一条件时都无法形成支持。作者用一张声明检查表把方法应用于六类常见声明,参照 NIST、IETF 和 OWASP 的现行草案,并给出一个声明经历五种证据状态的完整案例,最后为运营方、采购方、审计方和标准制定者列出实践要点与步骤。
- 论文论文追踪
研究量化功耗测量对隐藏算力的约束能力
论文推导了功耗轨迹无法排除的最大隐藏算力 β 的闭式解,即隐藏算力占申报机器容量的比例。在 NVIDIA A100 GPU 上的测量显示,最坏情况下 β = 1.16,而对抗性等能量策略至少可隐藏 β = 0.41 的算力。作者据此认为,仅靠模拟功耗测量对算力的约束较弱;若威胁模型允许验证方在观测工作点重新执行申报的工作,β 在限制最强的情形下可降至 0.059。该结果为前沿 AI 算力限制协议的外部核查提供了定量估计。
- 论文论文追踪
研究分析英国 112 例 AI 生成虚假信息,识别八类危害风险
一项针对英国 AI 生成或 AI 篡改虚假信息的研究分析了 2025 年 1 月 1 日至 2026 年 3 月 31 日期间在英国被浏览数千万次的 112 个样本。研究识别出八个存在实质危害风险的领域,包括引发严重社会动荡和私刑暴力、直接损害健康、造成网络诈骗类严重财务损失,以及影响公众与警察和司法系统互动、助长可能造成直接伤害的虚假阴谋论、长期改变社会和政治态度等。超过五分之四的样本加剧了公众对信息的不信任,使其被视为实质虚假或误导而非仅仅不准确。作者指出该数据集并非该时期全部 AI 虚假信息的完整样本,而是展示部分潜在影响的快照。
- 论文论文追踪
论文梳理 AI 风险建模的开放问题:从 22 位专家研讨会提炼研究议程
一篇 arXiv 论文探讨如何为先进 AI 系统的社会风险评估设计稳健的风险模型,指出监管提案日益要求系统性风险评估,但缺乏严谨的量化方法。作者梳理了五种相关研究传统:概率风险评估、灾难性 AI 风险分析、网络安全风险量化、贝叶斯因果推断和基于阈值的治理,并比较了基于情景的风险估计与基于贝叶斯网络的阈值设定两种主流方案。基于一场有 22 位专家参与的研讨会及后续分析,论文提出了涵盖模型结构、范围、证据整合、验证和治理的开放问题清单,并主张进展取决于将量化建模与独立评估、透明分级披露以及能够长期维护和更新风险模型的机构结合起来。
- 论文论文追踪
研究用 LLM 分析 9821 份英国年报,量化企业 AI 风险披露
论文用LLM辅助分类分析1362家英国上市公司的9821份年报,主要覆盖2020至2025年,并以474段人工标注文本验证。2025年41.2%的年报提及AI风险,但实质性讨论约占4.3%;披露程度在行业与市场板块之间存在差异,标签一致性仍有限。全语料只有7份报告披露实际危害,这反映公开报告中的披露情况,不能解释为实际只发生7起危害或企业整体风险很低。
- 论文论文追踪
非洲 AI 政策优先事项与治理分析:各国高度关注 AI 机遇却较少重视 AI 安全
一项基于非洲各国演讲、新闻稿、公开声明及国家 AI 战略与框架的分析指出,非洲各国政府高度关注 AI 带来的经济转型机遇,但对 AI 安全的关注相对不足。研究认为,非洲在前沿 AI 领域主要是消费者而非生产者,加之面临紧迫的发展挑战,使其在全球 AI 讨论中相对被忽视。
- 论文论文追踪
撒哈拉以南非洲自主 AI 诊断智能体的负责任部署:患者知情与问责缺口
论文指出,撒哈拉以南非洲 eHealth 平台正以快于治理基础设施的速度部署自主 AI 诊断智能体,即无需强制实时人工复核即可分析患者临床数据并给出诊断或分诊决策的系统。基于坦桑尼亚计算机辅助结核病检测、赞比亚糖尿病视网膜病变与结核筛查、加纳移动健康聊天机器人分诊三个已落地案例,论文提出智能体知情同意、人工否决作为结构性要求、情境适配可解释性三项原则,为开发者、卫生系统管理者和政策制定者提供最低实践标准。
- 论文论文追踪
研究对照美国联邦 AI 治理覆盖与行业脆弱性评估
一项研究评估了 684 份美国联邦 AI 治理文件对 14 个行业和 24 类 AI 风险的覆盖情况,并以广度和深度两个维度衡量。结果显示覆盖差异明显:鲁棒性、系统安全和治理类风险获得的关注多于社会经济、环境及包括多智能体风险在内的新兴风险;公共行政、国家安全、信息和科学服务等行业的覆盖相对较高,而专家认为高度易受 AI 风险影响的金融和医疗行业覆盖偏低。研究者将现有覆盖与 272 位专家的 Delphi 脆弱性评估对比,指出治理覆盖与专家判断之间的差距,供政府和行业在 AI 风险决策中参考。
- 论文论文追踪
面向 EU AI Act 基本权利影响评估的可复用语义网框架
为满足 EU AI Act 第 27 条对高风险 AI 系统部署前开展基本权利影响评估(FRIA)的要求,研究者提出一个可复用的语义网框架,把分散的事件库、风险词表与法律文本整合为可 SPARQL 查询的知识图谱。该框架覆盖就业与工人管理(Annex III(4))和基本公共服务获取(Annex III(5)(a))两类公共部门场景,基于 150 条记录语料构建含 1,351 条 RDF 三元组的知识图谱,五个 FRIA 演示场景覆盖 103 条记录(68.7%)。对照 69 条记录金标准评估显示,LLM 辅助的就业领域分类仅达 κ = 0.045,提示该领域自动化公平性证据检索仍不可靠。
- 论文论文追踪
研究提出「静默修订率」:前沿 AI 安全框架 67% 实质变更未在开发者说明中披露
研究者提出「静默修订率」(silent revision rate),即安全框架承诺的实质变更中未被开发者自身说明所披露的比例,并发布带版本与哈希固定的语料库。语料覆盖 12 家发布安全框架的开发者的全部公开版本及各自的 changelog、redline 或公告,追踪 12 组连续版本对之间的 710 条承诺实例,其中 244 条逐条裁定。结果显示,严格标准下 67%(95% CI 62–72)的实质变更属静默,宽松标准下为 53%,按章节粒度降至 49%;叙述式公告的静默率为 74%,逐项 changelog 为 63%,而说明的篇幅字数几乎不影响结果。77% 的追踪变更削弱或移除了某项承诺,且在 8 组版本对中有 7 组削弱比加强更常被静默处理。
- 论文arXiv
研究者提出 AI 评估沙盒配置器,支持欧盟 AI 法案下的技术评估
针对欧盟《人工智能法案》要求各成员国在 2027 年 8 月前建立 AI 监管沙盒(AIRS),研究者提出开源框架 AI Assessment Sandbox Configurator,用于在沙盒中规模化开展结构化技术测试。该框架从 AIRS 的程序条件和法案对高风险系统的义务中推导出 11 项架构与治理要求,包含通过稳定插件 API 访问的测试与控制目录、统一异构输出的共享数据模型、面向不同角色的仪表盘以及分受众报告。作者描述了架构与当前版本,并报告一次早期试点:在真实 AIRS 活动中运行了数据统一与报告层,并为一官方 Exit Report 提供了输入。文中还讨论了路线图、目录分层贡献模型带来的治理问题,以及开源评估生态在成员国间形成的制度路径。
- 论文论文追踪
报告提出 AI 保险栈蓝图,主张 2030 年前实现数十亿美元级 AI 智能体承保
一份 arXiv 报告提出,到 2030 年可为 AI 智能体提供限额达数十亿美元的明确承保,但前提是行业协同。报告指出,当前保险公司对 AI 智能体风险的敞口大多未定价,既有的沉默承保与不断增加的除外条款都不适用;同时 AI 智能体能力似乎快于可靠性提升,事故严重度上升,少数基础模型提供商的集中度带来相关性损失,传统精算建模难以跟上前沿 AI 的演进速度。报告借鉴 Underwriters Laboratories、Closed Claims Project 等历史先例,提出涵盖事件数据收集、巨灾建模、标准、合同设计、风险选择、定价、监控与理赔管理的八组件 AI 保险栈。报告还讨论了针对前沿 AI 灾难性风险的承保(AI CAT),涉及 CBRN、关键基础设施崩溃与失控场景,认为应对这些尾部风险需要专门工具,可能包括前沿模型开发者互助组织、巨灾债券、定制责任制度与政府兜底。
- 论文论文追踪
2026 新加坡 AI 安全研究优先级共识:聚焦社会韧性与自主 AI 智能体风险
2026 新加坡共识(The 2026 Singapore Consensus)由第二届 AI 安全国际科学交流会议产出,汇集 13 个国家逾 100 位贡献者,来自前沿开发者、政府安全机构、学术界与公民社会。该报告在 2025 年报告基础上,提出全球对最高优先级技术 AI 安全研究问题的共识,并专门聚焦社会韧性以及管理日益自主的 AI 智能体所带来的风险。
- 论文论文追踪
论文盘点 AI 事件治理中的开放问题
一篇被 ICML Technical AI Governance Research workshop 2026 接收的论文考察了监管机构与独立项目现有的 AI 事件治理框架,指出这些框架虽描述了各项职能如何执行,但在事件定义、分类、监测和报告上缺乏一致性。作者认为,这种不一致体现在所收集和报告的事件数据类型、分类方式上,进而影响可开展分析的深度、代表性和准确性。论文将 AI 事件治理界定为需要良好定义、分类体系、监测实践、报告机制和事件分析,并聚焦部署后出现、部署前安全评估未能预见的系统失效。
- 论文论文追踪
印度《消费者保护法》能否覆盖 AI 产品损害?工作论文指出归责缺口
一篇工作论文评估印度《2019 年消费者保护法》是否足以应对缺陷 AI 产品与服务造成的损害,以及能否在 AI 价值链上按比例分配责任。该法对产品责任、损害和缺陷的宽泛定义看似技术中立,或可覆盖人身伤害、心理伤害、偏见输出与失控等 AI 相关事件,但存在明显缺口:AI 缺陷与消费者损害之间的因果关系难以证明,且 AI 价值链中数据提供方、模型开发者、部署方与用户的责任相互重叠,难以对应法律预设的制造商、销售者与服务提供者角色。论文认为现行责任框架缺乏按比例归责机制,执法还需厘清与行业专门规则的交叉。
- 论文论文追踪
研究称全球南方 AI 审计远落后于部署,十年仅不足二十例已部署系统审计
Eticas Foundation 的研究者基于十年审计实践指出,全球南方 AI 部署速度不逊于北方,但审计严重滞后。作者统计,过去十年拉丁美洲、撒哈拉以南非洲和亚太地区已部署系统的第二、第三方审计不足二十例,而该地区有数百个已记录的公共部门算法和数十亿美元的国家 AI 投资。研究归纳出四类共性模式:用代理指标替代效度、性能声明在流行率分析下失效、被评分人群从未出现在训练数据中、移除受保护属性后结构性偏差依然存在。作者认为这一差距根源不是能力问题而是资金问题,最有条件改变现状的是资助该地区多数关键 AI 的发展与慈善资助方,可通过资助条件要求独立评估。
- 论文论文追踪
美国隐私岗位招聘分析:AI 治理职责如何嵌入隐私职位
一项对 LinkedIn 和 Indeed 上 1,143 条美国隐私岗位招聘信息的计算分析发现,隐私岗位普遍呈混合形态,同时要求法律知识、技术技能与人际能力。AI 相关表述出现在超过一半的招聘信息中,并分布于合规、法律、治理与安全等主题;研究据此指出,AI 治理职责常被嵌入既有隐私岗位,催生出混合职位与专职 AI 治理岗位并存的格局。
- 论文论文追踪
论文提出推理阶段 AI 治理的可行性分类框架
论文《Beyond Training: A Feasibility Taxonomy for Inference-Time AI Governance》提出,当前算力治理以训练算力和训练后模型为监管单元,而推理时扩展、智能体脚手架和模型压缩正把能力迁移到部署阶段。作者构建了覆盖监控、验证与执行三类共二十项推理阶段机制的可行性分类,按四级就绪度量表对照四家厂商的证据基础评分,其中十五项已有商用技术底座在生产环境中运行,但治理级保证与对抗鲁棒性差异明显。用三维能力层级乘四类对手角色的对手模型做压力测试后,没有机制能对高能力国家层级部署者评为充分,微调会移除执行类机制中模型内部的组件,平台外部控制仍可保留。作者还通过替换分析把该分类与一篇配套硬件论文相连,提出条件性替换原则,并报告随机子集二次评分的一致性为二次加权 Cohen's kappa 0.74。
- 论文论文追踪
论文梳理二十个 AI 中等强国司法辖区的 GPAI 治理条款
论文《Mapping General-Purpose AI Governance in Twenty AI Middle-Power Jurisdictions》以单条条款为单位,梳理了包括欧盟在内的二十个未设前沿开发者的 AI 中等强国司法辖区在 GPAI 治理上的立法情况,覆盖系统风险评估、评估与验证、带监测与检测的禁止条款、严重事件报告四个领域,并将确认缺失也作为数据记录。研究发现各辖区在形式上趋同但在约束力上分化:十六个辖区至少涉及四个领域中的三个,但仅约五分之一的条款位于有约束力的法律中,且四分之三具有约束力的文书未定义 GPAI。制度基础设施呈现相似形态,五分之四被梳理的治理主体其授权早于 GPAI 出现,义务落在既有制度已覆盖的应用层而非模型层;这些国家触及模型层时更多是建设观察能力而非对开发者施加义务,几乎所有评估机构在设立时都没有依据评估结果采取行动的权力。
- 论文论文追踪
无架构师的架构?分裂世界中的全球 AI 治理
针对全球 AI 治理规则碎片化、代表性不均且多为非约束性的困境,Simon Chesterman 在评论 Matthijs Maas《Architectures of Global AI Governance》时指出,制度设计无法与权力分配分离。Maas 以社会技术变迁、治理中断与机制复杂性为框架,反对技术决定论和单一制度蓝图;但 Chesterman 认为其常提的"我们"掩盖了国家、国际机构与科技公司间的差异,前沿 AI 的关键决策集中于少数私营公司,全球 AI 治理更像是多方权力与激励分歧下形成的架构。
- 论文论文追踪
GIRAI 2026 报告:135 国负责任 AI 治理评估发布
全球负责任 AI 指数(GIRAI)2026 报告基于 UNESCO 等人权框架,评估各国如何把负责任 AI 承诺转化为可执行的保护、机构能力与救济机制。评估覆盖 135 个国家的 68,138 个数据点、38 项指标,分政府 AI 政策与实施(17 项)、公民社会参与(5 项)、使能条件(15 项)及政府部署不可接受风险 AI 系统的记录案例,数据区间为 2023 年 11 月至 2025 年 9 月。结果显示,135 国中有 126 国至少有一项政府 AI 政策或举措,但往往未转化为实质保护:全球南方国家自首版以来新增 306 项框架指标案例中的 203 项,其中 78% 的框架不具约束力,全球北方为 42%。透明与可解释性是表现最好的指标之一,58% 的国家有相关框架,但仅 18% 要求公开政府算法;35 国存在政府部署不可接受风险 AI 系统的可信证据。
- 论文论文追踪
论文提出面向 AI 智能体的事件报告要素框架
一篇 arXiv 论文比较 AI 系统与 AI 智能体,并综合 23 位学术界与产业界专家的意见,梳理出报告 AI 智能体安全事件所需的信息要素。论文提出的潜在报告要素包括智能体记忆与记忆访问、实际与潜在的自主性水平以及工具使用情况。作者据此列出若干开放研究问题,例如如何高效记录事件、如何判断漏洞与事件是否具有泛化性。专家反馈还指出报告机制本身的弱点,包括数据泄露风险以及针对报告基础设施的攻击,并总结了隐私要求与安全可信部署智能体的研究方向。
- 论文论文追踪
研究梳理88个AI非自愿私密影像网站依赖的基础设施供应商
Sarah Morgan、Hany Farid 与 Sophie J. Nightingale研究公开分发AI生成非自愿私密影像的网站及其基础设施。他们在六周检索窗口内找到400个URL,筛出88个相关网站,再分析托管、内容分发、DNS、域名及其他服务。研究认为少数大型供应商在其中扮演重要角色,并呼吁识别违规服务、停止支持和加强治理。样本不代表全网,CDN或代理服务不等同于直接托管,服务关联也不证明供应商知情协助。
- 论文arXiv:危险能力与安全评测
尼日利亚金融科技 AI 系统部署前评估的监管框架:基于 SafeAlert 的上下文感知评测
针对尼日利亚及非洲大陆尚无监管文件规定金融科技 AI 系统采购前须做何种部署前评估的空白,研究者提出上下文感知的监管框架。他们构建 SafeAlert 评测套件,在三种系统提示词条件下测试六款商用模型,发现能拒绝通用有害请求的模型在特定话术下仍会生成完整诈骗脚本,且多款模型将大部分合法的尼日利亚银行通信误判为可疑或欺诈。论文建议 CBN、NITDA、SEC 和 AU 引入部署前评估要求,并指出该缺口源于监管规范缺失而非技术或资金不足。