从期望危害到似然:LLM 智能体越狱的概率重构
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
- arXiv
- 2610.09973
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 白盒
- 被测模型
- Llama-3.1-8B-Instruct、Ministral-8B-Instruct-2410
另有 277 篇论文还没打上分类标签,暂不在筛选结果里。
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
评估应用决策层的输入注入与隐私推断风险
Jev 是 TypeSafe 的 System One 模型,把应用 state 和固定问题变成 Choice、Noul 或 Score 的类型化决策与概率。作者用官方 API 和可改训练的 NanoJev,考察它作为决策层时的操纵、泄露与双重用途。
提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出 JIL 对抗后缀,压低长度预测以抬高请求调度优先级
JIL 是对预测式 LLM 调度的攻击:用对抗后缀压低长度预测,使请求在 SRPT 式队列里更早得到服务。
提出主题锚点投毒,放大众包微调后的专有指令提取
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
提出检索器后门攻击操纵智能体搜索,并用 DOU 逃避检测
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出推理通道预填与输出前缀组合攻击以越狱推理模型
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
摘要作者称检测靠分散的词法线索。
检验结构越狱 IICL 能否跨厂商泛化并与语言约束叠加
提出广度优先后缀搜索 BOSS,改进 GCG 越狱优化
BOSS 是插在 GCG 类离散 suffix 优化上的搜索框架:局部梯度更新不变,变的是固定预算花在深度还是广度。
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
提出 ElasticBack,在单个 Agent 技能中植入条件后门
ElasticBack 是放在 LLM agent 单个 skill 里的条件后门攻击。。
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱
论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。
用通用扰动对恶意软件分类器及漂移检测器做规避与后门投毒
提出 EvoBreak,以良性任务组合诱导自进化 Agent 的持久经验并削弱安全边界
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。