跳到正文
10月9日 · 周五

全部论文

找到 4 篇

另有 482 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.07430

    研究者提出 SN-Guided Diffusion,利用扩散大模型安全神经元实现离线越狱

    提出 SN-Guided Diffusion,利用安全神经元实现离线越狱

    发表
    攻击者
    黑盒、白盒
    测试
    Qwen2.5-7B-Instruct、LLaDA-8B-Instruct、Dream-Instruct-7B 等 15 个
    摘要论文揭示了扩散语言模型对自回归安全神经元的继承性,并提出纯离线黑盒越狱框架 SN-Guided Diffusion。

    论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。

    深度解读完整解读
  2. 攻击arXiv 2607.11698

    AHA 用自动研究循环发现生产 Agent 漏洞概念

    提出 AHA 自动研究循环,发现生产 Agent 的漏洞概念

    发表
    攻击者
    黑盒
    测试
    Minimax-M2.7、Kimi-K2.6、Deepseek-V4-Pro 等 5 个
    摘要论文提出基于可证伪科研循环的 AHA 框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。

    AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。

    深度解读完整解读
  3. 防御arXiv 2609.02293

    SEAL:通过共享专家对齐强化 MoE 全局安全

    提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改

    发表
    攻击者
    白盒、黑盒
    测试
    Qwen1.5-MoE-A2.7B、DeepSeekMoE-16B、GLM-4.7-Flash 等 4 个
    摘要SEAL 把 DPO-LoRA 限制在混合 MoE 共享专家上,SEAL++再保护已有安全神经元方向。

    SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。

    深度解读完整解读
已经到底了