跳到正文
10月9日 · 周五

全部论文

找到 10 篇

另有 480 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.09732

    ColluSkill 用跨技能组合绕过 Agent 技能扫描器

    提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器

    发表
    攻击者
    黑盒、灰盒
    测试
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2

    摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。

    深度解读完整解读
  2. 防御arXiv 2608.03485

    SkillSentry:用自适应蜜罐世界动态检测 Agent 技能安全

    提出 SkillSentry,用自适应蜜罐世界在安装前审计 Agent 技能

    发表
    场景
    AI Agent
    测试
    DeepSeek-V4-Pro、Qwen、Kimi 等 4 个
    摘要契约加配对执行审计技能越权。

    SkillSentry 是安装前的动态技能审计,用来发现超出宣称功能的能力漂移。技能一旦安装,就能使用宿主的文件、shell、凭证和网络,而有害分支可能要等特定资源才出现。作者认为,源码或一次性语义判断既不能确认分支会执行,也不能把技能造成的效果与任务或基座智能体的动作分开。

    深度解读完整解读
  3. 防御arXiv 2608.21101

    ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

    提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入

    发表
    测试
    Codex/GPT-5.4、Codex/GPT-5.5、Claude Code/GLM-5.1 等 7 个
    摘要ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。

    ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。

    深度解读完整解读
  4. 防御arXiv 2608.24017

    WebMCP-Phalanx:为浏览器内 LLM Agent 工具调用建立信任边界

    提出 WebMCP-Phalanx,用能力凭证与双智能体隔离浏览器工具面

    发表
    场景
    AI Agent
    摘要Phalanx 用浏览器凭证绑定工具所有权,Q/P 分离拦住描述注入,工具名与返回值仍有残留。

    WebMCP-Phalanx针对浏览器里的 WebMCP 智能体:在 SOP 下补工具所有权,并把语义检查从有工具权的执行中分开。

    深度解读完整解读
  5. 防御arXiv 2610.01349

    PACE:面向工具调用 LLM Agent 的来源感知能力强制执行

    提出 PACE,在工具调用前对 Agent 做路径隔离与效果授权

    发表
    场景
    AI Agent
    测试
    gpt-5.6-luna、DeepSeek-V4-Flash、Qwen-3.8-27B
    摘要PACE 在工具边界做路径割与效果核验。

    PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。

    深度解读完整解读
  6. 防御arXiv 2609.36879

    SKILLLITE:用小模型做证据引导的恶意 Agent Skill 审计

    提出 SKILLLITE,以证据引导的紧凑 LLM 在部署前审计恶意 Agent Skill

    发表
    场景
    AI Agent
    测试
    Gemma4:e4b、Qwen3.5:9B、DeepSeek-R1:8B 等 5 个
    摘要SKILLLITE 把证据抽取外置,让紧凑 LLM 只做意图条件下的风险裁决,三个基准上 F1 高于所列基线。

    SKILLLITE是面向紧凑、可本地部署 LLM 的恶意 Agent Skill 预执行审计框架,作者单位为南洋理工大学。

    深度解读完整解读
已经到底了