跳到正文
10月9日 · 周五

全部论文

找到 12 篇

另有 505 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.05870

    MBZUAI 提出可校准的真实图像认证方法

    提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动

    发表
    攻击者
    白盒
    测试
    SD2.1、SD3、SD3.5 等 10 个

    摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。

    深度解读完整解读
  2. 评测与基准arXiv 2610.00568

    研究提出对齐诱导不忠实:对齐训练让模型静默改写输入内容

    提出 FAITHCONFLICT,测量对齐训练导致模型静默改写相悖输入

    发表
    测试
    Aya Expanse 8B、Aya Expanse 32B、Llama-3.1-8B-Instruct 等 13 个
    摘要论文揭示并系统分析了大语言模型在安全与常识冲突下静默背离输入的 AIU 现象与三元冲突困境。

    本文系统揭示并实证分析了语言模型后训练中存在的“能力–安全–忠实度”三元冲突。

    深度解读完整解读
  3. 攻击arXiv 2610.00430

    Memetic Trojans:利用社交传染在 LLM Agent 网络中传播对抗载荷

    提出 memetic trojans,把对抗载荷嵌入智能体自发转发的社会传染内容

    发表
    测试
    command-r-35B、gpt-oss-120B、deepseek-v4.1-flash 等 5 个
    摘要memetic trojans 用内生社会传染携带载荷。

    Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。

    深度解读完整解读
  4. 防御arXiv 2610.01969

    RASteer:面向扩散模型概念擦除的保留感知激活引导方法

    提出 RASteer,推理时按保留子空间校正激活以擦除文生图目标概念

    发表
    测试
    Stable Diffusion v1.4、Stable Diffusion v1.5、Stable Diffusion v2.1 等 4 个
    摘要RASteer 用保留子空间校正擦除方向,在固定权重下同时压低目标并保住保留概念。

    Retain-aware Activation Steering(RASteer) 是一种不改权重的推理时概念擦除方法,用于文生图扩散模型去掉指定概念并减少对保留概念的误伤。

    深度解读完整解读
  5. 可解释性arXiv 2609.09909

    解读文本到图像扩散模型中的对象依赖概念脆弱性

    用逐步 SAE 诊断文生图概念脆性,并推理时向类原型插值

    发表
    测试
    SD 1.5、SD 3.5、SDXL 等 5 个
    摘要逐步 SAE 诊断物体依赖的概念脆性,早期向类原型插值可在五骨干上提高风格与属性指标。

    作者用逐步稀疏自编码器审计文生图扩散模型里随物体变化的概念脆性,并用推理时原型插值检验该诊断。。

    深度解读完整解读
  6. 可解释性arXiv 2609.16967

    多语言模型的目标语言生成:激活引导与最优控制

    将目标语言生成写成激活最优控制并比较转向方法

    发表
    测试
    Tiny Aya 3B、Llama 3.2 1B、BLOOM 7.1B 等 9 个
    摘要LiSeCo 把语言转向做成最小扰动闭式控制。

    作者要解决多语言模型生成时漂离目标语言的问题,并认为只看语言识别不够。他们定义语言贴合、n-gram 语言形式连贯和相对两个结尾的语义连贯,三者同时成立才计 adhered coherence。方法上,层间激活被写成离散动力系统。

    深度解读完整解读
  7. 防御arXiv 2609.39548

    NDDL:用正常扩散动力学为文生图模型做后门防御

    提出 NDDL,用良性扩散轨迹检测文生图后门提示并定位触发 token

    发表
    测试
    Stable Diffusion v1.5、Stable Diffusion XL、Stable Diffusion v3.5 等 4 个
    摘要NDDL 从良性扩散轨迹学习正常转移,用动态不一致检测后门并定位触发 token。

    NDDL 是面向文生图扩散模型的后门防御:防御者只有白盒模型访问和良性提示词,没有后门先验,需要区分后门提示词并找出触发 token。

    深度解读完整解读
  8. 攻击arXiv 2609.36331

    无需参考模型:用邻居样本校准单轮成员推理攻击

    提出用邻居分数替代参考模型的单轮成员推断

    发表
    攻击者
    黑盒
    测试
    stable-diffusion-v1-5、目标分类模型(架构与训练流程遵循 Aerni et al.)、CLIP ViT-B/32 等 4 个
    摘要邻居查询在单模型上恢复逐样本校准,合成邻居加早期检查点最接近 LiRA。

    本文研究 one-round 成员推断:只有一个目标模型、不能再训练参考模型时,如何仍做逐样本校准,并用于单次运行的 DP 审计。

    深度解读完整解读
已经到底了