跳到正文
10月9日 · 周五

开源模型安全 · 论文

找到 6 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 59 篇还没打标签,不在筛选结果里。

另有 59 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2608.30703

    SingProbe 发布开源内在护栏框架,适配 29 个开源模型

    提出内生护栏 SingProbe,复用解码隐状态监测查询意图、回复安全与幻觉

    发表
    测试
    Ling-3.0-tiny-singprobe、Ling-3.0-flash-singprobe、Gemini 3 Pro 等 14 个
    摘要SingProbe 用轻量内生探针做生成时三类监测,并给出流式基准与低开销服务接入。

    SingProbe 是面向生成时监测的开源内生护栏:复用基座解码隐状态,而不是另起模型反复编码文本。

    深度解读完整解读
  2. 防御arXiv 2609.27399

    GUARD:在 CosyVoice2 上做说话人身份遗忘以阻止重识别

    提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别

    发表
    测试
    CosyVoice2-0.5B、F5-TTS、FireRedTTS
    摘要GUARD 用门控激活转向把退出说话人推向冒充相似度,以抑制再识别并保住音质。

    GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。

    深度解读完整解读
  3. 可解释性arXiv 2608.11227

    研究:激活引导的副作用可在引导前预测

    用未转向表征的传播映射预测激活转向副作用

    发表
    测试
    Gemma-3-4B、Gemma-3-12B、Qwen2.5-7B
    摘要交叉效应矩阵显示副作用有结构且不对称,并可在转向前由传播映射预测方向。

    激活转向的副作用可以在施加之前预测,而不必先把每个行为都转向一遍。。

    深度解读完整解读
已经到底了