跳到正文
10月9日 · 周五

全部论文

找到 3 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 535 篇还没打标签,不在筛选结果里。

另有 535 篇论文还没打上分类标签,暂不在筛选结果里。

  1. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准,评测代码生成护栏对虚构场景攻击的防御

    发表
    攻击者
    黑盒
    被测模型
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  2. 攻击arXiv 2606.09084

    研究者提出 Context-Fractured Decomposition 攻击

    提出 CFD 跨会话分解攻击,利用工件来源缺口绕过工具型 Agent 的本地检查

    发表
    场景
    AI Agent
    被测模型
    GPT-4.1、GPT-5-nano、Claude-3.5-Sonnet 等 6 个
    摘要CFD 用无指令 artifact 把越狱拆到跨会话。

    CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。

    深度解读完整解读
  3. 防御arXiv 2601.10156

    ToolSafe 提出步骤级护栏 TS-Guard 与 TS-Flow,降低 Agent 有害工具调用

    提出 TS-Guard 与 TS-Flow,在执行前检测并引导 Agent 修正有害工具调用

    发表
    场景
    AI Agent
    被测模型
    GPT-4o、TS-Guard、Qwen2.5-14B-Instruct
    摘要TS-Bench 标步骤级风险,TS-Guard 用多任务 RL 做执行前判定,TS-Flow 用反馈代替直接中止。

    ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。

    深度解读完整解读
已经到底了