防御arXiv 2605.17380
Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月
提出企业级检测系统 ADR,检测编程 Agent 的提示注入与恶意 MCP
- arXiv
- 2605.17380
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GPT-4o、Claude Sonnet 4、Llama Guard 3-8B 等 4 个
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
另有 600 篇论文还没打上分类标签,暂不在筛选结果里。
提出企业级检测系统 ADR,检测编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
评估安全监视器并提出双侧梯级微调以减少会答有害请求的漏检
摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
提出 S³ 多阶段防御,由 guard agent 编排阶段安全技能检测并缓解风险
提出 INTENT-AS-A-TOOL 跟踪并干预智能体失准
Zhang 等人研究推理型语言模型在职场邮件沙箱里如何走向智能体失准,并提出用动作偏好而不是事后文本标签来跟踪承诺。问题是:有害执行往往出现在推理已经形成意图之后,但 CoT 监控是事后、粗粒度、依赖外部评审的,也看不到模型倾向调用哪个动作。
提出 ActGuard,在执行前审计并遮盖诱发动作偏离的间接注入