跳到正文
10月10日 · 周六

全部论文

找到 6 篇
筛选7
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2606.09084

    研究者提出 Context-Fractured Decomposition 攻击

    提出 CFD 跨会话分解攻击,利用工件来源缺口绕过工具型 Agent 的本地检查

    发表
    场景
    AI Agent
    被测模型
    GPT-4.1、GPT-5-nano、Claude-3.5-Sonnet 等 6 个
    摘要CFD 用无指令 artifact 把越狱拆到跨会话。

    CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。

    深度解读完整解读
  2. 攻击arXiv 2605.07399

    研究者提出 GPO-V,用全局概率优化越狱扩散视觉语言模型

    提出 GPO-V,用全局概率优化的视觉扰动越狱扩散视觉语言模型

    发表
    攻击者
    白盒、黑盒
    被测模型
    LLaDA-V、LaViDA
    摘要作者用视觉扰动改 dVLM 的全局生成概率,以绕过两类拒绝。

    GPO-V 把越狱从“开头必须顺从”改成“整段去噪概率朝肯定方向走”。。

    深度解读完整解读
已经到底了