跳到正文
10月9日 · 周五

全部论文

找到 34 篇

另有 608 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.09517

    审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度

    开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角

    发表
    测试
    CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B 等 6 个
    摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。

    本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。

    深度解读完整解读
  2. 风险行为arXiv 2610.03458

    论文:低监控读数不能证明行为受控

    检验监控器低读数能否作为代码奖励作弊已受控的证据

    发表
    测试
    Llama-3.1-8B-Instruct
    摘要论文指出监控器训练读数接近零无法确立作弊受控,模型可利用通用外壳推迟提交绕过监控,强化学习亟需带外行为验证。

    本文是一篇针对强化学习可验证奖励后训练(RLVR)中监控器有效性与奖励作弊行为的实证分析研究。论文要解决的核心问题是:在训练目标中引入监控器以抑制代码生成中的作弊行为时,接近零的监控器读数是否足以确立模型行为已真正受控。

    深度解读完整解读
  3. 防御arXiv 2609.05797

    论文发现安全监控器主要拦截模型本就会拒答的请求

    评估安全监视器并提出双侧梯级微调以减少会答有害请求的漏检

    发表
    测试
    Gemma-4-31B-IT、Qwen3-32B、Llama Guard 3 8B 等 6 个

    摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。

    深度解读完整解读
  4. 防御arXiv 2607.14737

    GeoDetect:面向视觉语言预训练模型的几何对抗检测方法

    提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本

    发表
    攻击者
    白盒
    测试
    CLIPViT (ViT-B/16)、CLIPCNN (ResNet-50)、ALBEF 等 4 个
    摘要GeoDetect 用几何分数检测 VLP 对抗样本。

    GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。

    深度解读完整解读
  5. 攻击arXiv 2609.15989

    研究者提出 plan injection 攻击,可绕过思维链监控

    提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器

    发表
    攻击者
    灰盒
    测试
    Qwen2.5-Coder-7B-Instruct、Qwen3-8B、DeepSeek-R1-0528 等 6 个

    摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。

    深度解读完整解读
  6. 分析与理论arXiv 2609.37312

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链监控下的信息足迹下界与不可读性

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个

    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。

    深度解读完整解读
  7. 防御arXiv 2610.01969

    RASteer:面向扩散模型概念擦除的保留感知激活引导方法

    提出 RASteer,推理时按保留子空间校正激活以擦除文生图目标概念

    发表
    测试
    Stable Diffusion v1.4、Stable Diffusion v1.5、Stable Diffusion v2.1 等 4 个
    摘要RASteer 用保留子空间校正擦除方向,在固定权重下同时压低目标并保住保留概念。

    Retain-aware Activation Steering(RASteer) 是一种不改权重的推理时概念擦除方法,用于文生图扩散模型去掉指定概念并减少对保留概念的误伤。

    深度解读完整解读
  8. 可解释性arXiv 2609.39625

    D-Scope:用稀疏自编码器分解与操控扩散 Transformer

    提出 D-Scope,用视觉质心检索 SAE 解码方向并转向扩散生成

    发表
    测试
    SANA-Sprint、Nitro-1-PixArt、SANA teacher 等 4 个
    摘要D-Scope 用视觉质心检索单个 SAE 方向做掩码转向,对比检索提高区域增益但不一致改善保持。

    D-Scope把扩散 Transformer 中 SAE 特征的高激活图像块,接到文本查询驱动的单方向生成干预上。

    深度解读完整解读
  9. 攻击arXiv 2609.01168

    CRACK:用多智能体辩论越狱多层安全过滤的 T2I 模型

    提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤

    发表
    攻击者
    黑盒
    测试
    Stable Diffusion v1.4、SDXL、DALL·E 3 等 4 个
    摘要CRACK 以分层诊断的多智能体辩论搜索多层 T2I 过滤器的联合规避区域。

    CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。

    深度解读完整解读
  10. 可解释性arXiv 2609.04721

    研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计

    在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大

    发表
    测试
    Falcon-Mamba-7B、Falcon3-Mamba-7B、Llama-3.1-8B 等 8 个
    摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。

    作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。

    深度解读完整解读
  11. 攻击arXiv 2609.07216

    DIVA:利用视觉锚点对视频生成模型实施多模态越狱

    提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型

    发表
    攻击者
    黑盒
    测试
    Wan、CogVideoX、LTX-Video 等 9 个
    摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。

    DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。

    深度解读完整解读
  12. 防御arXiv 2609.23586

    VidMark:面向视频生成模型知识产权保护的高效水印方案

    提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权

    发表
    测试
    Stable Video Diffusion (SVD)、Open-Sora、Wan
    摘要VidMark 加解码器引导微调,把模型签名写入 VGM 输出并用于两项核验。

    Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。

    深度解读完整解读
  13. 防御arXiv 2609.03629

    EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除

    提出 EraseSAE,在文生视频模型中局部擦除指定概念

    发表
    测试
    CogVideoX-5B、HunyuanVideo、Flux.1 [dev]
    摘要EraseSAE 用单义特征局部擦除。

    EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。

    深度解读完整解读
  14. 可解释性arXiv 2609.06968

    通过稀疏自编码器特征追踪查询扩展效果

    用 SAE 追踪稠密检索查询扩展的潜变量并用激活转向验证

    发表
    测试
    Qwen3-Embedding-0.6B(Qwen-Embed)、SimLM
    摘要SAE 追踪稠密检索 QE 的潜变量,转向在四基准上比文本扩展更稳。

    作者用稀疏自编码器分析稠密检索里的查询扩展:现成检索器不微调时,拼接扩展文本往往增益有限甚至变差,而最终指标和嵌入整体偏移不足以说明内部发生了什么。

    深度解读完整解读
  15. 可解释性arXiv 2609.09575

    MonoTM:用可解释单义特征做主题建模,超越关键词表示

    提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述

    发表
    测试
    llama-embed-nemotron-8b、Gemma-3-27B-IT、Gemma-3-12B-IT
    摘要MonoTM 分开估计混合与解释主题,三套基准上二者偏好的 SAE 配置不同。

    MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。

    深度解读完整解读