跳到正文
今天10月8日周四
  1. 论文追踪 · 收录 · 原文 论文52

    BackdoorVLM:面向视觉语言模型后门攻击与防御的基准

    研究者提出 BackdoorVLM,一个针对视觉语言模型(VLM)后门攻击与防御的综合基准,覆盖图像描述和视觉问答等核心视觉语言任务。该基准把多模态后门威胁分为定向拒答、恶意注入、越狱、概念替换和感知劫持 5 类,用 12 种涵盖文本、图像和双模态触发器的攻击方法,在 2 个开源 VLM 和 3 个多模态数据集上评测,并对比 5 种代表性防御方法。分析显示 VLM 对文本指令高度敏感,双模态后门中文本触发器通常压过图像触发器;涉及文本模态的后门效力很强,投毒率低至 1% 时多数任务攻击成功率仍超过 90%。现有防御在不同触发器类型和后门场景间缺乏泛化能力,难以可靠防护跨模态、多形态的触发器。

10月1日周四
  1. arXiv · 收录 · 原文 论文32

    通过采样 BPE token 统计审计中文网页规模语料库

    Sampled-BPE 是一种轻量级 token 级审计流程,通过采样小规模子集并训练 BPE 分词器来暴露受污染 token,在污染类别上仅引入 4.25% 相对误差的同时实现 148.4 倍加速和 35.8 倍内存降低。研究将其应用于 11 个开源中文语料库和 2021 至 2026 年的 6 个中文 Common Crawl 快照,发现开源语料库中污染普遍存在但不均衡,中文网页内容污染严重且随时间变化。团队还发布了包含 66 万余条 token 记录的分层中文网页 token 数据集,每条记录带有网页上下文、类别和解释字段,并以树状结构组织以支持污染审查与溯源。

已经到底了