跳到正文
10月8日 · 周四

全部论文

找到 3 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 1005 篇还没打标签,不在筛选结果里。

另有 1005 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2605.17380

    Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月

    提出企业级智能体检测系统 ADR,检测提示注入与恶意 MCP

    发表
    测试
    GPT-4o、Claude Sonnet 4、Llama Guard 3-8B 等 4 个

    摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。

    深度解读完整解读
  2. 防御arXiv 2608.21101

    ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

    提出多层监控网关 ClawSentry,拦截恶意技能供应链与上下文注入

    发表
    测试
    Codex/GPT-5.4、Codex/GPT-5.5、Claude Code/GLM-5.1 等 7 个
    摘要ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。

    ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。

    深度解读完整解读
  3. 防御arXiv 2609.19587

    红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器

    红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固

    发表
    测试
    Opus 5、Opus 4.8、Opus 4.7 等 8 个

    摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。

    深度解读完整解读
已经到底了