跳到正文
10月8日 · 周四

开源模型安全 · 论文

找到 4 篇

另有 90 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv:2608.21101 ·

    ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

    提出多层监控网关 ClawSentry,拦截恶意技能供应链与上下文注入

    编程 Agent测试Codex/GPT-5.4、Codex/GPT-5.5、Claude Code/GLM-5.1 等 7 个应用层
    摘要ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。

    ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。

    完整解读
已经到底了