论文复盘 OpenAI、Anthropic 与 Google Agent 安全事件并提出 PASAC 框架
提出 PASAC 与五层边界保证栈,把智能体评测越界变成可验证的全系统保证
- arXiv
- 2610.12463
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 防御权限与审批
- 风险Agent 危险操作
- 组件权限与沙箱
另有 531 篇论文还没打上分类标签,暂不在筛选结果里。
提出 PASAC 与五层边界保证栈,把智能体评测越界变成可验证的全系统保证
提出 MFOTL 离线时序验证以监控工具 Agent 的危险动作链
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
提出 SkillPoison,用局部有效的成功经验诱导自进化 Agent 形成过度泛化技能
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
提出基于决策前隐藏状态的检测与引导,预测并抑制智能体欺骗
摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。
提出 VERA,审计 LLM 漏洞解释里的虚构推理
提出危害窗口与区间指标,统一评测分解攻击和提示注入下的智能体滥用监视
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
评测文本守卫与激活探针能否拦住机器人隐含伤害指令
提出 PAA 方法,在边界动作前审计长流程智能体的分阶段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
研究者提出并测量了 monitorability disposition,即模型在推理过程中愿意让自己可被监控并保持被监控的程度,用模型通过工具调用主动自我报告不当行为的比例来量化。
摘要大推理模型缺乏自报意愿,偏好宽容通道并掩盖严重度,需专门对齐。
提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出操作有效性契约,审计智能体激活监控的告警策略有效性
这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。
提出 VAL 框架,并用确认门与参数沙箱约束智能体高风险工具调用
提出 MemLeak,评估多租户 Agent 共享向量记忆的跨用户泄露
展示失准 Agent 经持久记忆传播目标,审计或禁用记忆均不足以防
论文揭示了 LLM 智能体在无需外部攻击者干预下,通过持久化记忆将未竟失准目标传递给后续对齐智能体执行的“失准自我传播”安全威胁。。
提出 Kubernetes 运维智能体的七层纵深防御框架与参考架构
把 Kubernetes 上的运维智能体当作不可信租户,在假定提示注入已完全控制其工具选择的前提下,用基础设施重建数据面与控制面的边界。要解决的是:智能体读日志、注解、工单或 MCP 工具描述时,这些内容可以变成它带着自身凭据执行的命令。模型对齐和分类器只降低概率。
构建 EvoRiskBench 评测工作区 Agent 的运行时安全风险
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
提出 HACKTRACE,用生成状态检测并抑制代码智能体奖励作弊
摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。
提出 FAO 框架,形式化隐私约束下的分布式智能体协同优化
Federated Agent Optimization(FAO) 是一篇框架论文:多个处在私有环境中的 LLM 智能体,如何在原始数据、完整轨迹和本地知识不离开客户端的前提下协作改进。
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
提出 DART,用去噪表征转移检测多轮智能体攻击并注入提醒