跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 10 篇

另有 377 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv:2610.01349 ·

    PACE:面向工具调用 LLM Agent 的来源感知能力强制执行

    提出 PACE,在工具调用前对 Agent 做路径隔离与效果授权

    AI Agent测试DeepSeek-V4-Flash、gpt-5.6-luna、Qwen-3.8-27B应用层
    摘要PACE 在工具边界做路径割与效果核验。

    PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。

    完整解读
  2. 防御arXiv:2610.00850 ·

    AuraForge:为训练安全编码 Agent 扩展安全监督

    提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体

    编程 Agent测试DeepSeek-V4.1-Flash、Qwen3.5-4B、Muse Spark 1.3 等 11 个训练与数据层
    摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。

    AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。

    完整解读
已经到底了