跳到正文
10月9日 · 周五

全部论文

找到 2 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 669 篇还没打标签,不在筛选结果里。

另有 669 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.15383

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力

    发表
    攻击者
    黑盒
    测试
    Grok-4.3、GPT-5.5、Claude Opus 4.8 等 7 个

    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    深度解读完整解读
  2. 攻击arXiv 2607.18056

    上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险

    提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害

    发表
    测试
    Grok-4.3、Grok-4.5、DeepSeek-V3 等 14 个

    摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。

    深度解读完整解读
已经到底了