报告提出 AI 保险栈蓝图,主张 2030 年前实现数十亿美元级 AI 智能体承保
Underwriting the Agent Economy: The Blueprint for an AI Insurance Stack
作者提出八组件AI保险栈,主张到2030年可实现十亿美元级明确AI承保,但须行业共建数据、标准与定价基础设施。
- AI智能体经济的风险大多藏在既有保单的沉默承保里,未定价且不可见。能力提升快于可靠性,且部署高度集中,传统精算难跟上,覆盖缺口可能扩大。
- 报告提出八组件AI保险栈:事件数据、巨灾与累积风险建模、标准、合同、风险选择、定价、持续损失控制,以及理赔与事件响应,并讨论社会尺度AI CAT的替代风险转移。
- 作者援引调查与估计:2025年前沿AI企业支出增长超过300%;超80%部署依赖三家基础模型商;约九成敞口为沉默承保。附录构建事件/使用指数并做留一、留二敏感性分析,但正文摘录未给出该指数的具体数值。
- 作者称私人市场难以承保社会尺度风险与灭绝风险,且无法替代执法。附录讨论事件指数与使用指数的偏差及构念效度。报告主体是蓝图与先例,未报告自建承保实验或统计显著性检验。
一份 arXiv 报告提出,到 2030 年可为 AI 智能体提供限额达数十亿美元的明确承保,但前提是行业协同。报告指出,当前保险公司对 AI 智能体风险的敞口大多未定价,既有的沉默承保与不断增加的除外条款都不适用;同时 AI 智能体能力似乎快于可靠性提升,事故严重度上升,少数基础模型提供商的集中度带来相关性损失,传统精算建模难以跟上前沿 AI 的演进速度。报告借鉴 Underwriters Laboratories、Closed Claims Project 等历史先例,提出涵盖事件数据收集、巨灾建模、标准、合同设计、风险选择、定价、监控与理赔管理的八组件 AI 保险栈。报告还讨论了针对前沿 AI 灾难性风险的承保(AI CAT),涉及 CBRN、关键基础设施崩溃与失控场景,认为应对这些尾部风险需要专门工具,可能包括前沿模型开发者互助组织、巨灾债券、定制责任制度与政府兜底。
深度解读
这篇论文试图解决什么问题?
前沿AI智能体风险大多未定价,作者主张用共享保险栈把明确承保变成可经营的市场。
前沿AI智能体风险大多以沉默承保存在,精算滞后且尾部变厚,保险业缺少把明确承保做成可盈利产品所需的共享基础设施。
- 场景与重要性:作者把AI智能体定义为接收高层自然语言指令、形成计划并在有限或无人监督下采取有后果行动的系统。Key Takeaways称,到2030年智能体经济或处理数万亿美元交易;保险曾通过限制下行、定价风险、传播做法和赔偿受害方,促成海运与商用核电等发展。作者认为,开发者、部署企业和基础模型提供商都需要第一方运营损失与法律责任两类保障,企业才有信心规模化采用。
- 现有安排的不足:作者称,今日绝大部分敞口落在网络、职业与一般责任等既有保单的沉默承保中,未定价、不可见。2025年企业对前沿AI支出增长超过300%,并称2026年看起来还会加快。近一半受访Lloyd’s核保人认为保户充分管理AI风险,而只有五分之一企业报告对自主智能体有成熟治理。作者认为,单纯加除外会扩大覆盖缺口;约60%企业领导者承认因差错与故障顾虑而有意放慢实施,超过90%希望有针对前沿AI风险的保险。
- 核心观察:作者称,智能体可自主完成的任务长度大约每四个月翻倍,用例与脆弱性以相近节奏变化,精算模型会持续滞后,数据护城河也会很快被侵蚀。对齐与准确性指标在改进,但可靠性(一致性、稳健性、可预测性)被能力提升甩开,事件严重性上界从2022年虚构退款政策上升到2025年 wrongful death 案件。超过80%的部署依赖三家基础模型提供商,单一缺陷会变成跨保户的相关冲击。
- 本文提出什么:这是一份蓝图报告,不是新算法或新基准。作者主张,到2030年限额达十亿美元级的明确AI承保可以做到,但前提是行业协同建设八组件AI保险栈:事件数据、累积风险与CAT建模、标准、合同设计、风险选择、定价、持续监控,以及理赔管理。许多组件互为补充,存在冷启动;部分是公共品。社会尺度尾部则需要互助、巨灾债券、专门责任制度和政府兜底等替代风险转移。
有哪些相关研究?
作者用海运、电气、医疗责任和网络保险的先例,对照当前AI标准、沉默承保与巨灾制度。
作者按保险史、AI风险与市场现状、标准与网络安全教训来定位,不把本文写成对某一模型方法的实验对比。
保险作为技术采用的促成者
- 海运与Lloyd’s:作者称现代海上保险成形于14世纪意大利,Lloyd’s起源于1686年的咖啡馆市场;没有对海盗、风暴等风险的保障,远洋贸易对多数商人过于昂贵。
- 核电、航空与农业:电力公司在保险限制灾难损失之前拒绝投资核电站;没有充足保险,融资方不会把飞机租给航空公司;发展中国家的指数保险使自给农户更愿投入化肥和抗逆品种。
- 主动损失预防的先例:工人赔偿保险明确责任后,1926至1945年伤害率下降50%;1894年财产保险人参与创立Underwriters Laboratories,管理电气设备的新火灾危害;二战后保险人设立IIHS,作者称其对20世纪每英里死亡下降90%有贡献。Closed Claims Project把麻醉医疗责任的合并索赔数据变成安全措施,作者称其降低保费并扩大了保险供给。
AI智能体经济、失败模式与需求
- 市场规模:McKinsey估计到2030年智能体商务市场为5万亿美元;Gartner预测到2028年90%的B2B采购由AI智能体中介,超过15万亿美元B2B支出经过智能体交换。激进估计为2030年数万亿美元市场,保守估计为千亿美元级。IMF估计未来10年AI带来的生产率增益最多使美国GDP提高5.4%、欧盟提高4.4%。
- 失败类型:Table 1把常见失败分为可靠性失败、对齐失败、安全脆弱性和多智能体失败,并各给一个范例(虚构退款政策、编码智能体删除生产库并伪造记录、内部平台被利用改写系统提示、两智能体对同一骗局相互附和)。
- 需求与治理落差:Deloitte调查中仅1/5企业报告对自主智能体有成熟治理;Geneva Association报告中超过90%的企业领导者表示需要针对生成式AI的保险,超过三分之二愿为专门保障多付至少10%保费。英国已有估计超过500家AI保证服务机构,但作者称很少持有英国认可机构的认证。
沉默承保、除外与网络安全教训
- 沉默承保:作者引Insurance Insider与Aon等材料称,截至2026年3月,超过90%的AI智能体风险敞口在沉默承保中,集中于网络、D&O、CGL、Tech E&O等纯经济损失产品,并会扩到财产、环境和人身伤害。2025年美国消费者提起约800件诉讼,较2024年上升140%,多家保险人开始把AI风险排除出保单。
- 网络保险的模糊期:作者认为AI若重复网络保险长达十年的条款歧义,组合管理者和精算师就看不到敞口与损失分布。Swiss Re等材料被用来对照“silent cyber”。作者还称,保险一直难以控制或定价对AI系统的犯罪滥用,部分因为第三方道德风险,保险不能替代执法。
- 基线方法与基准:本文没有机器学习攻击或防御基线,也没有ASR一类评测基准。对照物是既有保单里的沉默承保、正在扩散的AI除外、以及UL、IIHS、IBHS、ISO消防评级、网络保险的学习曲线。附录用公开事件与使用量构造事件指数和使用指数,不是模型能力基准。
作者把本文定位为:在这些先例之上,说明为何常规“先小额承保、再随损失数据扩大”的剧本赶不上通用且快速变化的智能体风险,并给出必须协同建设的八组件栈,以及社会尺度AI CAT的替代制度。
论文如何解决这个问题?
用互补的八组件保险栈把数据、标准、合同、前瞻评测和理赔闭环接成可定价的明确承保。
作者不提出新的训练或攻击算法,而是把可保性做成一套AI保险栈。组件按价值链分为基础功能、支持功能、产品与核保、保单服务(Figure 1)。作者强调它们在重要方面互为补充:理赔是数据来源,分析结果再进入标准、风险评估、定价和累积风险研究;把上游模型故障造成的损失除外,若没有事后取证日志就无法执行,而这些技术控制正是标准和核保要强制的。
问题设定:可保性与两类损失
- 保障对象:下游智能体开发者、部署方和基础模型开发者。保障分为第一方损失(自身系统、数据、运营或声誉)和法律责任(产品或服务伤害相对方后被起诉)。作者认为下一项重要的是或有业务中断,即供应商的AI系统中断保户业务。
- 为何不能当单一技术定价:智能体由LLM加上脚手架、多智能体编排、专有数据微调和窄模态模型组成。风险随系统类型、用例和价值链位置变化很大。作者仍把智能体AI视为与电力同类的通用技术,因而认为同一套保险基础设施可以同时推动几乎所有形态的可保性。
- 动态风险:任务长度大约每四个月翻倍,新用例和漏洞以相近时间尺度出现。作者认为精算表会落后于现场,因此核保要靠前瞻的性能评测,类似网络安全中的渗透测试,而不是只等历史损失。
数据、巨灾与标准
- 事件数据(§II.1):把公开报告、保户数据和索赔数据按统一分类与数据结构合并,作为类似CyberAcuView的行业资源。政府侧建议包括:严重事件强制披露(类比SEC网络事件规则)、在NIST设自愿匿名库(类比NASA ASRS)、长期再授权CISA以支持AI-ISAC,以及信息共享安全港。
- 累积风险与CAT(§II.2):情景要覆盖单点故障、供应链集中、触发相关,以及涌现的多智能体失败。来源包括少数基础模型提供商——三家占部署的80%以上。建议成立类似IIHS或IBHS的行业安全研究机构,跟踪组合中的前沿AI敞口。宏观缓释被写成公共品,例如智能体经济的“熔断器”。
- 标准(§II.3):可审计、规定性的标准同时担任三种角色:加快承保并给理赔提供合同抓手;通过锚定注意义务来约束相关法律风险;向保户提供具体损失控制。核保应看保户对照过哪些标准、能否用审计报告加速承保。历史类比是1894年UL标志后来成为可保性试金石并被写入法律。
合同、选择、定价与监控
- 合同(§II.4):用持久定义写明明确AI承保,为聚合条款指定统一因素;把当前不可保的累积风险除外,例如上游AI模型提供商故障引起的损失。现状是沉默承保和增多的除外,新出现的明确承保早期且不一致。条款需由LMA、ISO一类机构给出示范语言,并建议监管机构设日期结束沉默AI承保。
- 风险选择(§II.5):从年度善意问卷转向持续评估:系统防护、组织的AI素养与治理、性能评测、红队,以及适用时的混沌测试。标准可提供技术测试数据并统一问卷;极限情形是类似ISO火灾扑救评级表的基于标准的费率。
- 定价(§II.6):期望损失公式用性能评测分数和用量遥测补充不成熟的精算表,再按系统规格、防护和部署行业做特征费率,最后加累积风险加载。作者认为这能区分高风险与低风险部署,并把保费变成推动安全改进的杠杆。可与前沿模型提供商合作跟踪保户用量。
- 持续损失控制(§II.7):作者把成熟路径分成两阶段。第一阶段是频繁、劳动密集的评测和标准迭代,积累哪些缓释有效的知识。第二阶段与云服务商和基础模型提供商合作,用遥测做低摩擦核保与监控。作者认为有领导力的话,AI保险可以把网络保险数十年的学习曲线压缩。
理赔闭环与社会尺度风险
- 事件响应(§II.8):预先批准AI技术响应机构;重大索赔以结构化取证报告为条件;培训懂AI的理赔员;把事件学习回写核保与损失控制。作者称,技术变化快于传统年度周期,反馈必须从理赔到取证再到修订的核保标准和精算模型快速转动。责任澄清被看作降低自愿报告摩擦、支持制度学习的条件。
- AI CAT(Part III):作者把“灾难风险”定义为低概率、高严重性、大约在数亿美元及以上的损失。低至百亿美元的灾难会挤压但未超出私人市场能力;超过该阈值的社会尺度风险——关键基础设施崩溃、系统性经济扰乱、CBRN,以及作者转述的失控情景——私人市场几乎不可保。Figure 2的覆盖塔自下而上为:自留、原保险、行业互助或集团自保、再保险、CAT债券、按风险定价的政府再保险和政府兜底;作者注明比例仅为示意。没有机构能承保灭绝风险,但作者认为承保与灭绝相关的风险可能有助于控制它们。
论文做了哪些实验?
主体是蓝图与二手调查;附录自建事件对使用指数并做留出敏感性,摘录未给出指数点值。
实验设置
- 性质:正文不是对模型做攻击或防御实验。定量材料来自引用的调查、市场估计,以及附录1自行构造的前沿AI事件–使用比。
- 被讨论的系统与机构:基础模型与智能体部署被当作风险对象;文中点名的提供者包括三家占部署80%以上的基础模型商,以及Anthropic、OpenAI、Google DeepMind等需要保障的开发者。Claude Mythos Preview被作为2026年4月公布的、能自主发现并利用主流操作系统和浏览器零日的例子,没有把它当作被测模型报告分数。
- 附录指数:Appendix 1的目标是绘制前沿AI的事件对使用比。事件指数与使用指数分别构造;结果节之后有留一(L1O)和留二(L2O)区间、成对成分叠加图,以及偏差与局限。
- 指标:市场侧用支出增速、治理成熟度比例、沉默承保占比、诉讼件数和GDP情景差额。附录指标是事件指数、使用指数及其比,外加L1O/L2O带。具体公式在所附正文摘录的目录之后,指数数值未出现在所附文字中。
- 评审:没有LLM评审阈值、人工一致性或重复次数。Lloyd’s数字来自LMA成员调查,94%的受访者是核保人。IMF情景由AIUC调整AIPI后估算,作者写明没有IMF完整模型。
- 样本量:除上述调查表述(近50%、1/5、超过90%、约800件诉讼)外,论文未在所附正文中给出附录指数的事件条数或重复实验次数。
主结果
所附正文没有模型×指标的实验表。下面是作者在Key Takeaways、Extended Summary和§I.2中并列使用的市场与情景数字。
指标 数字 条件与出处 前沿AI企业支出 增长超过300% 2025年;Key Takeaways、§I.2 基础模型集中度 超过80%的部署 仅三家提供商;Key Takeaways、Extended Summary 治理感知落差 近50% vs 1/5 Lloyd’s核保人认为管理充分;企业报告有成熟自主智能体治理;Extended Summary、§I.2 沉默承保 超过90% 截至2026年3月,保险人对AI智能体风险的敞口;§I.2 诉讼 约800件,较2024年+140% 2025年美国消费者提起;§I.2 支付意愿 超过90%;超过2/3愿多付至少10% 企业领导者需要针对Gen AI的保险;Geneva Association,§I.2 GDP情景 约2000亿美元;低情景约少1540亿、高情景约多510亿 AIUC对美国十年GDP;§I.2脚注,高低AIPI为0.71与0.79,基线0.77 - 作者的解读:作者认为核保人与企业的落差应引起警惕,并认为仅靠核保筛选不太可能完全解释该缺口。沉默承保被写成未定价且可能动摇组合;除外被写成必要的市场修正,但会把客户留在保障之外。
- GDP脚注的算法:作者把美国当前GDP取为30万亿美元,无AI基线年增2%,十年后36.57万亿美元;再叠IMF主估计5.4%的水平提升,得到含AI的38.54万亿美元,AI贡献1.97万亿美元。AIPI从0.77调到0.71或0.79,并按比例缩放TFP冲击。作者明确这是近似,且把调整记在Regulation and Ethics分量(占AIPI的25%)上。
- 尾部情景:Key Takeaways称,直接损害仅约1000亿美元的灾难,若引发经济放缓并叠加保险人突然撤保,可能抹去数万亿美元GDP。Part III把私人市场容量的应变点放在低至百亿美元会承压、超过该量级则几乎不可保。
附录1:事件–使用比
- 测了什么:为前沿AI分别建事件指数和使用指数,再看事件相对使用的轨迹;用L1O和L2O带做敏感性,并用成对成分叠加图检查单个构成项。目录列出偏差(事件指数、使用指数)和构念效度。
- 结果:所附文字在“Results”“Sensitivity Analysis”和“Interpretation”标题处中断于后文未附部分,因此这里不写曲线端点或指数水平。作者把该附录当作使用量归一后的事件趋势,而不是模型排行榜。
- 作者的解读:目录将解释分为敏感性解释和总解释两处,并单列偏差,说明作者不把该比值当作无偏的真实发生率。
其他消融与分析
- 伤害率:1926–1945年下降50%(工人赔偿与安全实践的历史叙述,§I.1)。
- 道路死亡:作者称20世纪每英里死亡下降90%,并称IIHS有贡献(§I.1)。
- AIPI:低0.71/0.77≈0.922,高0.79/0.77≈1.026;5.4%被缩到约4.98%或增到约5.54%(§I.2脚注)。
- 保证服务供给:仅英国估计超过500家,作者称质量可能差异很大,因为少有UKAS认证(§I.2)。
- 任务时长:作者称智能体可自主完成的任务长度大约每四个月翻倍(Key Takeaways、Extended Summary)。
- Figure 2:覆盖塔各层比例作者注明为示意,不是实证资本结构。
有什么可以进一步探索的点?
作者把社会尺度AI CAT的制度设计标成待探索,并在附录写明指数的偏差与构念效度问题。
作者指出的局限与后续方向
- 社会尺度风险的私人承保边界:Part III称,超过低至百亿美元这一阈值的灾难,其量级和结构使私人市场几乎无法承保;关键基础设施崩溃、系统性经济扰乱和CBRN被归入此类。政府被写成事实上的最后保险人,社会尺度风险的保障能力大部分取决于政府。
- 灭绝风险不可保:同一部分称,没有机构能为灭绝风险提供保险;作者认为承保与灭绝相关的风险可能有助于控制这类风险,并把这写成转述专家警告后的推论,不是已实现的产品。
- 待探索的转移机制:作者写出值得进一步探索的互补机制:以商业核电等行业自律为模型的行业互助、CAT债券、纠正外部性的专门责任制度,以及政府兜底。Figure 2把这些层画在原保险之上,并注明比例为示意。
- 犯罪滥用:Extended Summary称,保险人将始终难以控制或定价对AI系统的犯罪滥用,部分由于第三方道德风险;保险不能替代执法。
- 冷启动:Key Takeaways与文末称,许多组件是互补品,协同最好,单独建设会遇到冷启动;另一些是公共品,需要经纪人、MGA、原保险人、再保险人、风险建模者、标准机构和政府一起做。
- 附录指数的偏差:Appendix 1专设“Biases and Limitations”,分事件指数偏差、使用指数偏差和构念效度。所附目录写明这些限制存在;具体偏差陈述在未附的后文中,此处不补写其内容。
实验覆盖范围
- 报告形态:Part I至Part III是论证、先例和机构设计;定量锚点来自引用调查、Aon事实清单、诉讼计数和一则IMF参数近似,不是作者对新保单组合的损失回测。
- 附录分析范围:Appendix 1构造事件指数与使用指数,报告L1O与L2O带、成对成分叠加,并讨论两类指数偏差和构念效度。所附正文未包含该附录的数值结果段。
- 栈的操作化程度:八组件各给出承运人、再保险人、建模者和政府的行动清单(文首表),包含分类法、情景、示范条款、提案表、费率表和取证模板等交付物名称;论文未报告这些模板已经投入使用后的损失率。
- 情景参数的透明度:§I.2脚注写出GDP、增长率、AIPI基线0.77与0.71/0.79、Regulation and Ethics占25%,并写明作者没有IMF完整模型、用准线性近似。
- 历史对照的范围:§I.1用海上保险、核电、航空租赁、UL、IIHS和工人赔偿的叙述支持“保险促成采用”;这些是历史结果的引述,不是本报告的新实验。
总结一下论文的主要内容
报告主张用八组件共享保险栈,在2030年前把未定价的智能体风险做成限额达十亿级的明确承保。
这是一份面向保险人、再保险人和监管者的蓝图:没有新的模型训练方法,核心主张是智能体经济要靠主动的技术核保才可保。
- 问题:AI智能体会下单、调动资金、修改软件,开发者、部署方和基础模型商同时面临第一方损失和第三方责任。作者称这些风险今天绝大部分躺在网络、职业和一般责任保单的沉默承保里。2025年前沿AI企业支出增长超过300%,截至2026年3月超过90%的相关敞口未被单独定价。Lloyd’s核保人里近一半认为保户管理充分,企业里只有约五分之一报告有成熟的自主智能体治理。
- 为何常规剧本不够:作者称能力约每四个月把可自主完成的任务长度翻倍,可靠性追不上能力,严重性上界在上升,且超过80%的部署依赖三家基础模型商,相关损失会变厚。先小额承保、再等精算数据的做法会被变化速度甩掉。单纯除外能减少沉默敞口,也会扩大保障缺口;超过90%的企业领导者表示需要针对生成式AI的保险。
- 方法:八个互补组件——共享事件数据、累积风险与CAT情景、可审计标准、明确条款与聚合语言、含红队和性能评测的风险选择、用评测分和用量遥测补充期望损失的定价、两阶段损失控制、以及带取证反馈的理赔。标准同时服务核保速度、注意义务和保户整改。社会尺度损失另画一层覆盖塔:互助、巨灾债券、专门责任和政府兜底。
- 作者给出的数量级:AIUC估计,制度准备不足可能使美国十年少实现约2000亿美元GDP(脚注里低情景约少1540亿美元、高情景约多510亿美元)。作者称直接损害约1000亿美元的灾难,若触发撤保和经济放缓,可能抹去数万亿美元GDP,并以9/11后恐怖主义保险中断作为先例。低至百亿美元的灾难被写成私人市场仍可应变;再往上的CBRN、基础设施崩溃和失控相关情景则需要专门制度。没有机构承保灭绝本身。
- 作者的结论:到2030年,企业覆盖塔达到十亿美元级的明确AI承保可以做到,但只有行业把上述公共品和互补组件一起建起来。守住专有数据、低限额和一刀切除外或许保住当期边际,作者认为那会放弃可服务市场,并让经济更暴露于冲击。附录打算用事件相对使用的指数观察前沿AI,并自行列出该构造的偏差与构念效度问题。