MAFIA:针对带审计 LLM Agent 的查询式记忆投毒攻击
研究者提出 MAFIA,一种针对带记忆 LLM Agent 的查询式记忆攻击框架,通过探测与事实注入绕过输入审计。该方法包含两部分:一是通过记忆探测、预算分配和调度保证注入记录在检索中具有竞争力。
- arXiv
- 2608.03844
- 发表
研究者提出 MAFIA,一种针对带记忆 LLM Agent 的查询式记忆攻击框架,通过探测与事实注入绕过输入审计。该方法包含两部分:一是通过记忆探测、预算分配和调度保证注入记录在检索中具有竞争力。
研究者提出提示词学习攻击框架 PLA,用于在无法获取模型架构与参数的黑盒条件下绕过文生图模型的安全机制。此前方法多依赖词替换搜索对抗提示词,受限于搜索空间,效果不如基于梯度的训练。
论文将奖励作弊视为测量问题:当奖励在训练样本上正确却与多个目标一致时,模型可能学到非预期目标。
研究者提出一种新的越狱攻击技术,通过从 LLM 的部分架构中构建候选分类器,提取其内部安全分类器的近似替代模型。
研究者提出 Ghostwriter 两阶段攻击框架,先把误导性陈述包装成带有可信标记的伪造理由,再指示目标 LLM 在回答相关问题时采纳这些观点。
论文提出对抗分词(adversarial tokenization)攻击:同一字符串存在指数级多种分词方式,而 LLM 训练和推理通常只采用其中一种,例如 Llama3 将 penguin 分为 [p,enguin],而 [peng,uin] 同样合法。
研究者提出 FalseCite 数据集,用误导性或伪造引用诱发大语言模型的幻觉回答,并据此对 GPT-4o-mini、Falcon-7B 和 Mistral 7-B 进行评测,发现带欺骗性引用的虚假主张会明显加剧幻觉活动,GPT-4o-mini 尤为突出。
研究者提出 StyleBreak,一个风格感知的音频越狱框架,系统考察人类语音属性如何影响大型音频语言模型(LAM)的对齐稳健性。
研究者提出 Prompt Embedding Optimization(PEO),一种多轮白盒越狱方法,直接优化原始提示词 token 的嵌入向量,而不追加任何对抗 token。
论文系统分析了集成在智能交通系统(ITS)中的大型视觉语言模型(LVLM)在越狱攻击下的脆弱性。
研究者提出 FlashRT 框架,用于提升长上下文 LLM 下基于优化的提示注入与知识投毒攻击的效率,同时降低计算和 GPU 显存开销。
研究者提出 Multi-AudioJail,这是首个系统利用多语言与多口音音频越狱漏洞的框架,包含一个对抗性扰动的多语言、多口音音频越狱提示词数据集,以及一套分层评测流程。
研究者提出 CodecAttack,把对抗扰动优化在 EnCodec 连续潜空间而非波形域,使攻击能在 Opus 等有损压缩后存活。
研究者提出视觉推理序列攻击(VRSA),将原始有害文本拆解为若干顺序相关的子图像,诱导多模态大模型逐步外化并聚合出完整有害意图。
研究者设计了一种文本转音频的越狱方法,把被禁止的指令嵌入叙事风格的音频流中,利用先进指令跟随 TTS 模型的结构与声学特性绕过主要针对文本校准的安全机制。
研究者提出对抗物体融合(AdvOF),一种针对视觉语言导航(VLN)智能体的攻击框架,通过生成对抗性 3D 物体攻击其基于 VLM 的感知模块。
研究者提出 GPO-V,一个针对扩散视觉语言模型(dVLMs)的视觉模态越狱框架,通过全局概率优化(GPO)操纵掩码扩散模型的去噪轨迹绕过护栏。
研究者提出 DIQ-H 基准,首次在连续序列中评估 VLM 在对抗视觉条件下的表现,模拟运动模糊、传感器噪声和压缩伪影,衡量这些损坏如何导致持续错误与价值不一致。
研究者提出一种名为 Reasoning-Oriented Programming 的攻击范式,将越狱类比为系统安全中的 Return-Oriented Programming,利用模型的指令跟随能力把多个语义正交的良性输入组合起来,使有害逻辑只在推理后期才浮现,从而绕过感知层面的安全对齐。
论文《The Rogue Scalpel》发现,激活引导(activation steering)会系统性破坏大语言模型的安全对齐。