跳到正文
10月9日 · 周五

全部论文

找到 6 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 443 篇还没打标签,不在筛选结果里。

另有 443 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.02786

    SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架

    提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略

    发表
    场景
    AI Agent
    摘要SafeEvolve 用轨迹证据协同更新安全 harness 和策略,在两个 4B 模型的智能体安全基准上改变安全与效用。

    SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。

    深度解读完整解读
  2. 防御arXiv 2609.28693

    skilder:以角色化技能包为工具型 LLM 智能体做访问控制

    提出 Skilder,用角色技能包和 MCP 路由硬拦截越权工具调用

    发表
    场景
    AI Agent
    摘要Skilder 用单 MCP 服务器按角色交付工具并硬拦截。

    Skilder 把企业工具型智能体的能力按角色打包,经一个 MCP 服务器做渐进发现,使工具范围由服务器而不是提示词来执行。

    深度解读完整解读
已经到底了