跳到正文
10月8日 · 周四

全部论文

找到 3 篇

另有 701 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2608.21101

    ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

    提出多层监控网关 ClawSentry,拦截恶意技能供应链与上下文注入

    发表
    测试
    Codex/GPT-5.4、Codex/GPT-5.5、Claude Code/GLM-5.1 等 7 个
    摘要ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。

    ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。

    深度解读完整解读
  2. 防御arXiv 2609.36879

    SKILLLITE:用小模型做证据引导的恶意 Agent Skill 审计

    提出 SKILLLITE,以证据引导的紧凑 LLM 在部署前审计恶意 Agent Skill

    发表
    场景
    AI Agent
    测试
    Gemma4:e4b、Qwen3.5:9B、DeepSeek-R1:8B 等 5 个
    摘要SKILLLITE 把证据抽取外置,让紧凑 LLM 只做意图条件下的风险裁决,三个基准上 F1 高于所列基线。

    SKILLLITE是面向紧凑、可本地部署 LLM 的恶意 Agent Skill 预执行审计框架,作者单位为南洋理工大学。

    深度解读完整解读
已经到底了