论文复盘 OpenAI、Anthropic 与 Google Agent 安全事件并提出 PASAC 框架
提出 PASAC 与五层边界保证栈,把智能体评测越界变成可验证的全系统保证
- arXiv
- 2610.12463
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 防御权限与审批
- 风险Agent 危险操作
- 组件权限与沙箱
另有 208 篇论文还没打上分类标签,暂不在筛选结果里。
提出 PASAC 与五层边界保证栈,把智能体评测越界变成可验证的全系统保证
提出研究合同,把已批准选择绑定到执行证据并由检查器核验
研究合同用来核验计算科学研究智能体是否仍在已批准研究之内,不判断科学是否为真。。
提出 SLDR,用选择性层恢复与动态路由防御恶意微调
SLDR 是针对恶意微调的微调后防御:在已对齐模型上做有符号层探测,只在敏感分数最大与最小的两层训练 LoRA,再用 lmax 的最后 token 表示决定是否启用适配器。
提出 OrthoPurify,用正交投影清除视觉语言模型适配器中的劫持方向
OrthoPurify 是部署前的 LVLM 后门净化方法,用一次正交投影去掉被劫持的权重更新方向。
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
论证发布时互信息不能认证开源权重抗微调恢复
作者研究开源权重模型的篡改抵抗:发布时的互信息是否足以保证微调恢复很慢。
提出 POLAR 本体门控,在执行前否决不可逆工具调用
POLAR 是训练无关的事前门控,用类型化本体在工具调用执行前检查能否组成候选逆序列。
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
测量带后门教师经 OPD 向干净学生迁移潜伏后门
带后门的外部教师经 OPD,可在压低无触发词有害率的同时,把触发条件下的有害行为传给初始干净学生。。
评测编码智能体 harness 安全机制在对抗任务中的防护效果
提出 TRACE,仅凭检查点更新审计有害合规微调目标
作者在检查点更新里寻找有害合规 SFT 的目标组成,并把读数做成不查询模型、不看未知训练数据的审计分 TRACE。
提出 PERSISTBD,发布前强化供应链后门使其经良性 SFT 与 RL 后仍外发凭据
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
提出 AI Agent 主张的可审计性框架与裁决规则
作者给出把关于已部署智能体的主张写成可核查陈述的条件,而不是检测器或攻击方法。
提出 nmult 并评测 Agent 动作门禁堆叠的错误相关性
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
提出 AMU 按推导图门控企业 Agent 共享记忆的列级访问
AMU 用列级推导门控共享记忆,拦截经缓存流出的无权敏感列,并标出同名 KPI 的定义冲突。
用配对回放评测任务范围授权能否阻断越权工具执行
提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
提出 APEX,在执行边界用授权契约防御 Agent 间接提示注入
提出长程工具智能体自生子目标的运行时授权机制
长时程工具使用把目标演化变成授权状态的一部分。本文在单 principal、单根、有限结构化域中,把自生成子目标的创建、替换、同根委托和同根 join 做成可检查转移,并在提交边界重查受保护效应。