BRANCH 方法绕过 6 套多扫描器护栏系统
提出 BRANCH 方法,用分支搜索绕过多扫描器护栏
- arXiv
- 2610.10742
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 被测模型
- Meta Llama Guard 3 8B、Meta Llama Guard 7B、Meta Llama Guard 3 1B 等 18 个
另有 194 篇论文还没打上分类标签,暂不在筛选结果里。
提出 BRANCH 方法,用分支搜索绕过多扫描器护栏
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
提出利用祖先 VLM 优化对抗补丁,使已部署 VLA 任务失败
提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器
这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。
提出 PackHallu,经规则文件提示注入诱导编码 Agent 换用攻击者指定包
PackHallu 研究一种针对编程智能体规则文件的提示注入:让智能体在本应使用合法依赖时,改导入攻击者指定并控制的包。
提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
提出 ASPIRE 行为图搜索,开放式发现 Agent 提示注入漏洞
ASPIRE 是给搭建方用的智能体提示注入红队引擎,目标是开放式画出可利用的行为路径,而不是在固定任务上打磨一条载荷。
提出 STCA,对驾驶视频 VLM 构造可迁移的时空对抗扰动
提出 CORSA,按任务簇优化技能注入的检索与执行
提出 ATLAS 用水平集估计恢复黑盒分类器的对抗输入集合
ATLAS 是一个查询式 black-box 框架,用来构造诱发失败的对抗输入集合,供鲁棒性审计使用。
TAPDreamer 用公开编码器做固定补丁。
提出轨迹级可迁移对抗攻击,降低深度强化学习策略的期望回报
这项工作研究 DRL 上的迁移式黑盒观测攻击:受害参数不可访问时,在白盒代理上造扰动再迁移。
提出 CRIME 框架,组合良性 Agent 技能诱发恶意行为
CRIME 把公共技能库中各自通过审查的技能配成两两组合,看联合执行能否实现指定恶意任务。。
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
提出 Red-TTT,在攻击过程中更新攻击者实现自动化越狱
提出 IAU-FOA,构造可迁移图像扰动以诱导多模态模型输出目标语义
提出 JIL 对抗后缀,压低长度预测以抬高请求调度优先级
JIL 是对预测式 LLM 调度的攻击:用对抗后缀压低长度预测,使请求在 SRPT 式队列里更早得到服务。
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
提出 APEX,用跨技能进度记录夹带虚假授权劫持 Agent