跳到正文
原文
Failure-First·· 2026-08-10

免训练概念定位方法提升 ViT 对文字排版攻击的鲁棒性

[Daily Paper] Towards Robustness against Typographic Attack with Training-free Concept Localization

AI 导读

Liu 等人的研究提出免训练方法,定位并抑制 Vision Transformer 中导致文字排版攻击的特定模块,从而提升模型对图像内干扰文字的鲁棒性。该方法基于线性表示假设,通过随机采样在 MHSA 瓶颈的低维子空间搜索与词汇概念对齐的“获奖向量”,并用基于梯度的归一化文本归因分数 nTAS 定位高脆弱性注意力头。干预方式有两种:在 CLIP 类骨干中重加权 patch token 影响,在缺少 class token 的 LVLM 中将脆弱模块输出置零。

阅读原文failurefirst.org