跳到正文
10月9日 · 周五

全部论文

找到 6 篇

另有 656 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2607.03968

    研究揭示 IDE 编程 Agent 的工作流级越狱:GitHub Copilot 四后端 816/816 生成有害内容

    提出工作流级越狱构建,经多轮开发工作流诱导编程 Agent 在代码中写出有害内容

    发表
    攻击者
    黑盒、无盒
    测试
    Claude Sonnet 4.6、Claude Haiku 4.5、Gemini 3.1 Pro 等 5 个

    摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。

    深度解读完整解读
  2. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏

    发表
    攻击者
    黑盒
    测试
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  3. 攻击arXiv 2609.15383

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力

    发表
    攻击者
    黑盒
    测试
    GPT-5.5、Claude Opus 4.8、Grok-4.3 等 7 个

    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    深度解读完整解读
  4. 攻击arXiv 2609.02414

    Blueprint 框架用世界观模拟与 18 个影响因子提升多轮越狱成功率

    提出多轮越狱框架 BLUEPRINT,用世界观模拟与心理因素诱导有害输出

    发表
    攻击者
    黑盒
    测试
    Qwen3-Next-80B、DeepSeek-V3.2、GLM-4.7 等 6 个
    摘要BLUEPRINT 解耦多轮越狱策略与情境模拟,揭示任务具象化是摆脱拒绝的核心机制,为多轮安全防御提供新视角。

    BLUEPRINT 是一个将因子化社会影响力策略空间与跨轮世界观模拟解耦的多轮大语言模型安全评测框架。

    深度解读完整解读
已经到底了