论文复盘 OpenAI、Anthropic 与 Google Agent 安全事件并提出 PASAC 框架
提出 PASAC 与五层边界保证栈,把智能体评测越界变成可验证的全系统保证
- arXiv
- 2610.12463
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 防御权限与审批
- 风险Agent 危险操作
- 组件权限与沙箱
另有 201 篇论文还没打上分类标签,暂不在筛选结果里。
提出 PASAC 与五层边界保证栈,把智能体评测越界变成可验证的全系统保证
为失配智能体种群建立生态模型,说明协作产生起飞临界规模
作者用生态学的强 Allee 效应,讨论失配智能体种群会不会在个体能力不变时起飞。。
提出 COAP,用有状态代码在测试时无模型地控制机器人
提出 ISE 框架,评测 LLM Agent 在知识冲突下的认知谦逊
作者要测的不是智能体最终答得对不对,而是知识冲突出现时,它有没有在轨迹里认出缺口、做有界的工具跟进,并把没解决的不确定性写给用户。
提出选项通道攻击,重命名选项标签使 Agent 护栏放行违规操作
摘要作者评估指出类型化模型不应作为最终安全裁决者,其易受非策略文本与选项名称操控,且置信度过滤无法抵御攻击。
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答
摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。
提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务
作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。
提出研究合同,把已批准选择绑定到执行证据并由检查器核验
研究合同用来核验计算科学研究智能体是否仍在已批准研究之内,不判断科学是否为真。。
提出 LTBD,用可学习分隔符隔离可信指令与不可信数据
LTBD 是一种不改基座权重的提示注入防御:只学习用来标出可信指令与不可信数据边界的四个 token 嵌入。
演化可检查评分器并与自改进 Agent 共同演化,抑制奖励作弊
开放任务没有验证器时,被演化的是评分器,而不是再补一条手写 rubric。
提出 GENUI-Harness,用生成界面收集未决输入并完成数据库服务任务
GENUI-Harness 把数据库服务任务的交互,从纯文本改成按当前请求和检索记录生成的界面。
构建统一奖励作弊检测基准 RH-Detect 并评测零样本检测器
提出 BRANCH 方法,用分支搜索绕过多扫描器护栏
提出 RSIGym 环境,评测研究智能体的递归自改进
用对照实验隔离评测设计对漏洞补丁基准得分的影响
作者把 LLM 漏洞补丁基准的评测流水线当作会改变测量结果的对象,并明确说本文不是再做一个用于排名的基准。
测量工具调用 Agent 对显式报错与静默损坏的检测和恢复
作者在 BFCL 多轮可执行环境上注入一次工具层故障,把注意到、改计划、恢复和重复分开记分,而不是只看任务有没有做完。
提出利用路由元数据推断敏感话题的侧信道攻击
摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
提出 AgentTime 基准,评测智能体按时长工作与估时能力
AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。