跳到正文
10月9日 · 周五

全部论文

找到 4 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 669 篇还没打标签,不在筛选结果里。

另有 669 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2608.30703

    SingProbe 发布开源内在护栏框架,适配 29 个开源模型

    提出内生护栏 SingProbe,复用解码隐状态监测查询意图、回复安全与幻觉

    发表
    测试
    Ling-3.0-tiny-singprobe、Ling-3.0-flash-singprobe、Gemini 3 Pro 等 14 个
    摘要SingProbe 用轻量内生探针做生成时三类监测,并给出流式基准与低开销服务接入。

    SingProbe 是面向生成时监测的开源内生护栏:复用基座解码隐状态,而不是另起模型反复编码文本。

    深度解读完整解读
  2. 防御arXiv 2609.30841

    为何扩散语言模型的越狱会成功:能量景观分析

    用能量势垒信号检测扩散语言模型的越狱

    发表
    测试
    LLaDA-8B-Instruct、LLaDA-1.5、Dream-v0-Instruct-7B 等 4 个
    摘要能量势垒把 dLLM 越狱分成掩盖初始状态或中途越垒,三个 logit 信号据此互补检测。

    Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。

    深度解读完整解读
已经到底了