跳到正文
10月9日 · 周五

全部论文

找到 5 篇

另有 643 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.09732

    ColluSkill 用跨技能组合绕过 Agent 技能扫描器

    提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器

    发表
    攻击者
    黑盒、灰盒
    测试
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2

    摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。

    深度解读完整解读
  2. 防御arXiv 2608.03485

    SkillSentry:用自适应蜜罐世界动态检测 Agent 技能安全

    提出 SkillSentry,用自适应蜜罐世界在安装前审计 Agent 技能

    发表
    场景
    AI Agent
    测试
    DeepSeek-V4-Pro、Qwen、Kimi 等 4 个
    摘要契约加配对执行审计技能越权。

    SkillSentry 是安装前的动态技能审计,用来发现超出宣称功能的能力漂移。技能一旦安装,就能使用宿主的文件、shell、凭证和网络,而有害分支可能要等特定资源才出现。作者认为,源码或一次性语义判断既不能确认分支会执行,也不能把技能造成的效果与任务或基座智能体的动作分开。

    深度解读完整解读
  3. 防御arXiv 2609.36879

    SKILLLITE:用小模型做证据引导的恶意 Agent Skill 审计

    提出 SKILLLITE,以证据引导的紧凑 LLM 在部署前审计恶意 Agent Skill

    发表
    场景
    AI Agent
    测试
    Gemma4:e4b、Qwen3.5:9B、DeepSeek-R1:8B 等 5 个
    摘要SKILLLITE 把证据抽取外置,让紧凑 LLM 只做意图条件下的风险裁决,三个基准上 F1 高于所列基线。

    SKILLLITE是面向紧凑、可本地部署 LLM 的恶意 Agent Skill 预执行审计框架,作者单位为南洋理工大学。

    深度解读完整解读
已经到底了