跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.14258· Mohd Azfar·· 19 天前

SPARK:在 KV 记忆层对齐表征以防御视觉语言模型越狱

SPARK: Representation-Level KV Memory Alignment for Safer Vision-Language Models

AI 导读

SPARK 是一个两阶段框架,通过在 prefill 阶段修复多模态 KV 记忆来降低视觉语言模型的越狱风险,且不修改推理时的模型参数。第一阶段用一次性诊断适配器定位多模态 key 和 value 表征中与危害相关的方向,第二阶段将这些方向投影剔除、学习轻量残差修复,并用图像结构先验锚定修复后的 key 以保持视觉接地。方法按 head 级系数混合修复与原始记忆,该系数由干预相关子空间能量决定,推理时无需显式危害分类器。

阅读原文arxiv.org