跳到正文
10月8日 · 周四

危险能力 · 论文

精选论文 10 篇
  1. 攻击arXiv:2609.15383 · 57

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    作者发现未对齐SLM可向对齐模型分步咨询并本地组装;CyBench上Gemma-4-31B配GPT-5.5恢复57%候选差距。

    • 57%CyBench:Gemma-4-31B+GPT-5.5候选恢复率
    • 78%CyBench:Gemma-4-31B+Opus 4.8候选恢复率
    • 33%BountyBench:Gemma-4-31B+GPT-5.5恢复率
    6 问速览评估弱未对齐模型能否通过任务拆解向强对齐模型咨询并本地组合,以绕过基于单次交互的对齐防御。
    1. 这篇论文试图解决什么问题?

      评估弱未对齐模型能否通过任务拆解向强对齐模型咨询并本地组合,以绕过基于单次交互的对齐防御。

    2. 有哪些相关研究?

      梳理了直接提示越狱、目标分解攻击及未对齐技术,指出既有分解研究未度量弱编排器的端到端能力增益。

    3. 论文如何解决这个问题?

      设计能力洗钱框架,本地未对齐小模型结合结构化脚手架,向无状态对齐顾问发起脱敏咨询并组装。

    4. 论文做了哪些实验?

      在网络安全两项基准上恢复多项差距候选,生物攻击链评测中上游两用步骤较下游释放步骤得分提升更多。

    5. 有什么可以进一步探索的点?

      作者指出了顾问模型数量、评测基准代表性、生物安全LLM评审偏置及单通道设定等局限与后续方向。

    6. 总结一下论文的主要内容

      作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    完整解读
  2. 攻击arXiv:2607.18056 · 60

    上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险

    Intern-BioBreaker评估前沿模型,在SafeSci-Bio对GPT-5.5实现60%任务级ASR。

    • 60.0%GPT-5.5在SafeSci-Bio上的ASR(Figure 3)
    • 26.0%Claude Opus 4.8在SafeSci-Bio的ASR(Fig 3)
    • 99.5%GPT-5.5在SoSBench-Bio的ASR(Figure 4)
    6 问速览评估前沿模型在生物安全领域的越狱风险,弥补纯文本评测无法反映物理生物威胁的不足。
    1. 这篇论文试图解决什么问题?

      评估前沿模型在生物安全领域的越狱风险,弥补纯文本评测无法反映物理生物威胁的不足。

    2. 有哪些相关研究?

      论文梳理了大模型越狱攻击、双用途生物风险基准及评估饱和研究,并对比了多类基线。

    3. 论文如何解决这个问题?

      构建四阶段训练的红队模型 Intern-BioBreaker,并结合计算筛选与湿实验验证双层流水线。

    4. 论文做了哪些实验?

      评估 14 个前沿模型在两类生物基准上的 ASR,并针对具体蛋白开展序列级计算与湿实验评估。

    5. 有什么可以进一步探索的点?

      作者指出了未进行物理合成及现有筛查机制的局限,并提出了多项治理建议。

    6. 总结一下论文的主要内容

      论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。

    完整解读
  3. 攻击arXiv:2608.29458 · 55

    Reference-Grafting 在提取沙袋行为隐藏能力上追平微调

    研究者提出参考嫁接技术,在11款微调密码锁模型上恢复了+94%至+101%的隐藏能力差距,在推理阶段匹配微调诱导效果。

    • +94% 至 +101%11款微调密码锁模型ARC-Easy隐藏能力恢复率(Table 1)
    • +92% 至 +105%3款代码模型MBPP密码锁恢复率,流畅度降幅≤0.04(Table 2)
    • +95% 至 +101%3个模型家族GRPO强化学习诱导隐瞒恢复率(Section 4.4)
    6 问速览解决模型在评测中故意隐瞒能力的问题,推翻激活导向失效结论并在推理阶段诱导能力。
    1. 这篇论文试图解决什么问题?

      解决模型在评测中故意隐瞒能力的问题,推翻激活导向失效结论并在推理阶段诱导能力。

    2. 有哪些相关研究?

      梳理隐瞒能力基准、模型篡改攻击、概念编辑与主动学习,定位本文在激活层诱导的贡献。

    3. 论文如何解决这个问题?

      提出参考嫁接与主动学习回路选择,利用阈值门控机制将对比坐标设定为诚实参考值。

    4. 论文做了哪些实验?

      在11款模型上实现+94%至+101%能力恢复,完成代码、强化学习、任务迁移与回路阻断实验。

    5. 有什么可以进一步探索的点?

      静态锁假设在动态回路阻断下失效,真实场景诚实参考获取困难,任务评测主要集中在多选问答。

    6. 总结一下论文的主要内容

      提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。

    完整解读
已经到底了