论文梳理 AI 风险建模的开放问题:从 22 位专家研讨会提炼研究议程
梳理 AI 风险建模开放问题并比较两类定量提案
- arXiv
- 2609.03178
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要研讨会议程论文:比较两类建模提案,并列出结构、证据、验证与治理上的开放问题。
这是一份面向研究者与政策实践者的议程论文:先进 AI 的社会风险需要定量建模,但监管要求的先进方法尚未被定义。
另有 482 篇论文还没打上分类标签,暂不在筛选结果里。
梳理 AI 风险建模开放问题并比较两类定量提案
这是一份面向研究者与政策实践者的议程论文:先进 AI 的社会风险需要定量建模,但监管要求的先进方法尚未被定义。
提出 SelfSearch,用自我修改记录无奖励搜索以改进编码智能体
作者把高自主 AI scientist 的规模化协调写成经济与制度问题:假设生成变便宜之后,要分配的是稀缺验证资源,并处理信用、问责和恶意使用。
用均值场最优停止分析多智能体集体攻击的均衡条件
摘要结构阈值给出干预杠杆。
提出结合模型级监督与系统级控制的智能体保障架构
Lu 与 Bengio 给出的是一套可逐层上移的保障架构和一组事件归类,不是已测量的防御系统。
McHugh 给出提示注入工件的组件解剖,让防御、红队和 CTI 不必靠字符串匹配来标注、比较和变异攻击。
提出 AI 保险栈蓝图,为智能体经济构建可定价的明确承保
综合技术 AI 安全研究优先级,提出社会韧性支柱与智能体风险管理原则
提出 OpenMLE 全栈,用执行反馈后训练机器学习元进化智能体
作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。
提出以协调情节为操作单位的跨执行准则,规定如何发现未授权智能体协同并在重启后遏制
摘要立场是跨执行保留关系并约束共享状态。
提出人机审计协作框架 HAAC,在对话购物 Agent 上分配并验证审计分工
HAAC 是一套用户参与式生成式 AI 审计的人机分工流程,实例为作者开发的对话式购物智能体。
评估自动化 AI 研发触发智能爆炸的可能并主张先可见再约束与适应
Chan 等论证:自动化 AI 研发可能经软件反馈环形成智能爆炸,把本需数年的进展压进数月或更短。他们关心的不是换硬件的建设周期,而是 AI 扩大有效研发劳动力、再产出更强系统,以及社会能否在能力跃迁前看见、约束并适应这一过程。
Planarian 用 statepoint 回滚并分支环境。
Planarian 是与现有 harness 协同的运行时,把智能体环境收成可恢复、可分支的时间点。
提出 AgentRewind,用对齐检查点回退长程 Agent 的上下文与工作区
提出 TAIP,把策略与证据分离,在配置或策略变化后重算仓库审计门禁裁决
TAIP 是放在未修改 RepoAudit 之外的保证层,用来在软件交付门上重算智能体安全控制的当前姿态。
综述自主渗透智能体的继承攻击、架构攻击及护栏覆盖缺口
这是一篇关于自主 AI 渗透测试智能体的安全综述:用架构和生命周期两轴整理威胁与护栏,不做新的攻击实验。
提出可防篡改、可重放的自主 Agent 运行证据方案
占位。
提出 SAVER 框架综述自演化智能体的安全状态转移
SAVER 是一篇关于自演化智能体安全的转移中心综述:安全对象从单次回答或单次授权动作,转到可复用状态在多次转移中的谱系。
提出 FAO 框架,形式化隐私约束下的智能体协同优化
Federated Agent Optimization(FAO) 是一篇框架论文:多个处在私有环境中的 LLM 智能体,如何在原始数据、完整轨迹和本地知识不离开客户端的前提下协作改进。
提出空承诺概念与单回合测量协议,衡量智能体承诺超出运行时能力
作者定义空承诺:智能体承诺回合结束后的行动,但在其工具与运行时下没有任何执行路径。空洞只由配置决定,不依赖后续轨迹。