跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 10 篇

另有 284 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.07089

    研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹

    构建统一滥用监视基准,用危害窗口评测跨威胁动作监控

    发表
    场景
    AI Agent
    测试
    Llama 3.1 70B、Llama Guard 4 12B、Gemma 4 26B-A4B 等 12 个

    摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。

    深度解读完整解读
  2. 防御arXiv 2601.10156

    ToolSafe 提出步骤级护栏 TS-Guard 与 TS-Flow,降低 Agent 有害工具调用

    提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用

    发表
    场景
    AI Agent
    测试
    Llama-Guard-3-8B、ShieldAgent-THU、Safiron 等 10 个
    摘要TS-Bench 标步骤级风险,TS-Guard 用多任务 RL 做执行前判定,TS-Flow 用反馈代替直接中止。

    ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。

    深度解读完整解读
  3. 其他arXiv 2609.12413

    SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量

    综述智能体执行链路中的越狱攻击、防御与实践权衡

    发表
    场景
    AI Agent
    测试
    Llama-3.1-8B-Instruct、Qwen3.5-4B
    摘要SoK 将越狱重放到智能体流水线,并用两种模型检验回复层防御的边际与代价。

    Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。

    深度解读完整解读
  4. 可解释性arXiv 2609.34686

    研究揭示工具智能体中越狱上下文残留导致的安全路由分化

    用配对续写与激活修补揭示工具智能体越狱后的安全路由分化

    发表
    场景
    AI Agent
    测试
    Llama-3.1-8B、Qwen3-14B、Qwen3.5-9B 等 8 个
    摘要越狱后的同一安全反馈在八个工具智能体上分成三条路由,因果集中在最后几层并可作预测基线。

    这篇工作把越狱上下文残留之后的运行时安全反馈,做成工具智能体上的三路路由问题,并用激活修补给这个路由一个晚层的因果位点。作者认为,反馈可能恢复合法执行、留下未授权动作,或误伤良性流程,而现有攻击、基准和静态护栏没有在固定历史上把这三种结局分开。配对续写因此从同一冻结检查点分别接中性提醒 N 和安全反馈 S,并交叉保留越狱 J+ 与中和越狱 J0。

    深度解读完整解读
已经到底了