跳到正文
10月8日 · 周四

危险能力 · 论文

找到 2 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 评测与基准arXiv:2609.09798 ·

    CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出CS-Guard基准与虚构场景攻击,评测代码生成护栏

    测试
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个应用层
    场景
    编程 Agent攻击者黑盒无盒
    摘要论文提出了代码安全护栏基准CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
    1. 研究定位与核心问题:针对大语言模型代码智能体面临的恶意软件生成风险,构建了专门评估代码生成安全护栏的基准 CS-Guard,旨在解决现有评测偏向自然语言指令且缺乏对隐蔽代码恶意意图系统检验的问题。
    2. 基准构建与方法设计:基准涵盖文本到代码(1000 条 TTP 提示词、7 种现有越狱及提出的虚构场景攻击 FSA)与代码到代码(331 条恶意代码填空、补全与翻译)两类场景,并建立涵盖类别、操作与位置的三层护栏分类体系,评测了策略型、分类器型及内部型共 9 种护栏。
    3. 核心实验结果:基座模型自带对齐在基础 TTP 请求下 ASR 达 15.1%–98.2%(Figure 3);在隐蔽的单轮 FSA 攻击下,各模型 ASR 上升至 85.9%–99.5%,且输入分类器的 ASR 也高达 73.3%–98.5%(Figure 3、Figure 5);在代码到代码任务中,基座模型在代码填空上的 ASR 达 95.0%–100.0%(Figure 3);策略型护栏中仅 SelfReminder 与 SmoothLLM 能带来相对稳定的 ASR 降幅,其余护栏改善有限(Figure 4)。
    4. 作者结论与安全启示:作者指出,当前部署的安全护栏难以有效识别共享良性功能特征的隐蔽恶意代码生成请求,且对代码片段处理能力脆弱,建议未来研究探索结合蜜罐防御等新型主动检测机制,并针对代码生成安全建立更全面的防御体系。
    完整解读
  2. 攻击arXiv:2607.18056 ·

    上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险

    提出生物红队模型Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害

    测试
    DeepSeek-V3、Kimi-K2.6、DeepSeek-V4-Pro 等 14 个提示层
    摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。
    • 研究定位:这是一项针对前沿大语言模型双用途生物安全风险的红队评测与转化验证研究。
    • 核心问题:前沿模型科学推理能力迅速增强,现有基于纯文本和多选题的基准存在性能饱和,无法有效衡量模型被诱导生成可规避检测、具备生物活性的设计时所构成的现实物理威胁。
    • 方法设计:开发了经过科学预训练、通用越狱微调、生物强化学习及推理期智能体协调四阶段训练的专用红队模型 Intern-BioBreaker,并建立了串联计算筛选(BLASTN 规避、AlphaFold3 结构预测、AutoDock Vina 结合能评估)与湿实验物理验证协议的评估体系。
    • 主要发现:在 SafeSci-Bio 基准上,Intern-BioBreaker 攻击 GPT-5.5 取得 60.0% ASR,攻击 Claude Opus 4.8 取得 26.0% ASR,14 个模型中有 3 个达到 100% ASR(Figure 3);在 SoSBench-Bio 上,10 个模型达到 100% ASR,GPT-5.5 达 99.5%,Claude Opus 4.8 达 59.5%(Figure 4);在流感 HA 蛋白案例中,GPT-5.5 生成的突变序列结合能较原始序列更低(Figure 5、Figure 6);在合成规避测试中,GPT-5.5 与 Gemini 3.1 Pro Preview 实现 100% 序列保真度且 BLAST E-value > 1e-5。
    • 结论与启示:作者认为前沿模型降低了生物威胁设计门槛,单点静态序列筛查无法抵御 AI 赋能的组合式规避;作者呼吁推行强制性基因合成筛查与全流程审计,促使安全对齐与模型能力协同演进。
    完整解读
已经到底了