跳到正文
10月9日 · 周五

可解释性 · 论文

找到 5 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 70 篇还没打标签,不在筛选结果里。

另有 70 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.01062

    Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架

    提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱

    发表
    测试
    Qwen2.5-7B-Instruct、Gemma-2-9B-IT、Llama-3.1-8B-Instruct 等 6 个
    摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。

    Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。

    深度解读完整解读
  2. 防御arXiv 2609.27399

    GUARD:在 CosyVoice2 上做说话人身份遗忘以阻止重识别

    提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别

    发表
    测试
    CosyVoice2-0.5B、F5-TTS、FireRedTTS
    摘要GUARD 用门控激活转向把退出说话人推向冒充相似度,以抑制再识别并保住音质。

    GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。

    深度解读完整解读
  3. 防御arXiv 2609.03629

    EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除

    提出 EraseSAE,在文生视频模型中局部擦除指定概念

    发表
    测试
    CogVideoX-5B、HunyuanVideo、Flux.1 [dev]
    摘要EraseSAE 用单义特征局部擦除。

    EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。

    深度解读完整解读
已经到底了