Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月
提出企业级智能体检测系统 ADR,检测提示注入与恶意 MCP
- arXiv
- 2605.17380
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GPT-4o、Claude Sonnet 4、Llama Guard 3-8B 等 4 个
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
另有 701 篇论文还没打上分类标签,暂不在筛选结果里。
提出企业级智能体检测系统 ADR,检测提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
提出 RECAST 框架,本地改写图表与语音以保护远程数值推理隐私
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 COVER,在语言预算下选择源语言实现跨语言知识遗忘
语言预算下的多语言遗忘:遗忘监督只放在 K 种源语言上,目标是降低其余语言对同一事实的残余访问,而不是把每种评测语言都译成监督数据。
提出 FLOWSEAL,在工具边界以信息流控制阻断智能体隐私泄露
摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御 FLOWSEAL 并验证有效性。
提出端到端全同态加密方案 ODIN,在云端密文上完成推理以保护提示词
ODIN 是面向 Llama 的服务器侧 CKKS 推理系统:客户加密提示词,诚实但好奇的服务器用明文权重在密文上算完 Llama-3,只返回结果密文。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出 PILLAR,用私有词法预筛与客户端重排保护 RAG 查询
PILLAR 是面向公开语料的隐私 RAG:半诚实服务器学不到查询词项和访问模式,客户端仍拿到用于增强生成的 k 篇文档。
提出 LeakGauge,用行为后缀的 prefill 对数概率检测上下文泄露
提出 RAPID,离线把抗蒸馏扰动写入文生图解码器
提出 Adaptive Diffusion Freezing,降低扩散模型的成员推理风险
占位。
提出身份绑定且只收窄的能力令牌,用上下文外钱包约束智能体
代表人类行动的分布式智能体,需要一种不把密钥放进语言模型上下文的授权方式。