跳到正文
10月8日 · 周四

全部论文

找到 5 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 1065 篇还没打标签,不在筛选结果里。

另有 1065 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2609.09798 ·

    CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏

    编程 Agent攻击者黑盒无盒测试CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个应用层

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    完整解读
  2. 攻击arXiv:2609.15383 ·

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力

    编程 Agent攻击者黑盒测试GPT-5.5、Claude Opus 4.8、Grok-4.3 等 7 个应用层

    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    完整解读
  3. 攻击arXiv:2609.02414 ·

    Blueprint 框架用世界观模拟与 18 个影响因子提升多轮越狱成功率

    提出多轮越狱框架 BLUEPRINT,用世界观模拟与心理因素诱导有害输出

    模型与 API攻击者黑盒测试Qwen3-Next-80B、DeepSeek-V3.2、GLM-4.7 等 6 个提示层
    摘要BLUEPRINT 解耦多轮越狱策略与情境模拟,揭示任务具象化是摆脱拒绝的核心机制,为多轮安全防御提供新视角。

    BLUEPRINT 是一个将因子化社会影响力策略空间与跨轮世界观模拟解耦的多轮大语言模型安全评测框架。

    完整解读
已经到底了