论文复盘 OpenAI、Anthropic 与 Google Agent 安全事件并提出 PASAC 框架
提出 PASAC 与五层边界保证栈,把智能体评测越界变成可验证的全系统保证
- arXiv
- 2610.12463
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 防御权限与审批
- 风险Agent 危险操作
- 组件权限与沙箱
另有 216 篇论文还没打上分类标签,暂不在筛选结果里。
提出 PASAC 与五层边界保证栈,把智能体评测越界变成可验证的全系统保证
为失配智能体种群建立生态模型,说明协作产生起飞临界规模
作者用生态学的强 Allee 效应,讨论失配智能体种群会不会在个体能力不变时起飞。。
提出 COAP,用有状态代码在测试时无模型地控制机器人
提出 ISE 框架,评测 LLM Agent 在知识冲突下的认知谦逊
作者要测的不是智能体最终答得对不对,而是知识冲突出现时,它有没有在轨迹里认出缺口、做有界的工具跟进,并把没解决的不确定性写给用户。
提出选项通道攻击,重命名选项标签使 Agent 护栏放行违规操作
摘要作者评估指出类型化模型不应作为最终安全裁决者,其易受非策略文本与选项名称操控,且置信度过滤无法抵御攻击。
扩展全模态基座的强化学习以支撑智能体自我改进
MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答
摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。
提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务
作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。
提出研究合同,把已批准选择绑定到执行证据并由检查器核验
研究合同用来核验计算科学研究智能体是否仍在已批准研究之内,不判断科学是否为真。。
提出 LTBD,用可学习分隔符隔离可信指令与不可信数据
LTBD 是一种不改基座权重的提示注入防御:只学习用来标出可信指令与不可信数据边界的四个 token 嵌入。
演化可检查评分器并与自改进 Agent 共同演化,抑制奖励作弊
开放任务没有验证器时,被演化的是评分器,而不是再补一条手写 rubric。
提出包络采样,用少量真值标注重标定 LLM 评委以缓解奖励作弊
作者研究后训练前如何选择真值标注的查询分布,使重标定后的廉价代理更适合被优化。真奖励昂贵时,实践用 LLM judge 代替人类。若失准只发生在基座很少生成的输出上,on-policy 标注修不到这些点,随后的 KL 正则优化会把质量集中到被高估的输出。
提出 GENUI-Harness,用生成界面收集未决输入并完成数据库服务任务
GENUI-Harness 把数据库服务任务的交互,从纯文本改成按当前请求和检索记录生成的界面。
提出 GUISE 基准与 AXIS 训练,防御叙事包装越狱
作者测量叙事包装下的拒答失效,并训练一个在未见包装上拒绝、同时仍回答同风格良性请求的适配器。问题是:安全对齐模型拒绝直说的有害请求,却回答嵌进角色或叙事里的同一请求。文言文被用来把语域和包装拆开。
构建统一奖励作弊检测基准 RH-Detect 并评测零样本检测器
提出 BRANCH 方法,用分支搜索绕过多扫描器护栏
检验潜意识学习能否经无关数据蒸馏传递能力、后门与作弊
摘要作者报告潜意识学习可传递新技能、后门与作弊倾向,且分布外泛化强于单层转向向量。
提出统一框架评测多模态大模型的遗忘方法
提出 SLDR,用选择性层恢复与动态路由防御恶意微调
SLDR 是针对恶意微调的微调后防御:在已对齐模型上做有符号层探测,只在敏感分数最大与最小的两层训练 LoRA,再用 lmax 的最后 token 表示决定是否启用适配器。