研究显示 VLA 模型文本护栏漏检隐含危害指令
评测文本守卫与激活探针能否拦住机器人隐含伤害指令
- arXiv
- 2610.05818
- 发表
- 层
- 提示层
- 场景
- 具身与机器人
- 被测模型
- π0.5、OpenVLA-OFT、Llama Guard 3 等 10 个
- 风险Agent 危险操作
- 组件护栏与评审
评测文本守卫与激活探针能否拦住机器人隐含伤害指令
遮挡审计 AdvWave-P 音频越狱的频带必要性与解码层关联
这是对加性音频越狱 AdvWave-P 的频率与解码器深度审计,受害模型主要是 Qwen2-Audio-7B-Instruct,不提出新攻击。
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
提出推理通道预填与输出前缀组合攻击以越狱推理模型
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
提出任意字母置换密码越狱,无需微调即可诱导有害输出
摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
评估安全监视器并提出双侧梯级微调以减少会答有害请求的漏检
摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
提出 ARENA 音频红队框架,自动构造文本安全且音频接地的越狱输入
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
提出 RolePlay 框架,用人设条件放大 LLM 单次推理开销
提出 CodecAttack,在编解码器隐空间构造可穿透有损压缩的对抗音频
提出层级遗传算法 HGA,扰动题目逻辑结构诱发推理模型过度思考
摘要HGA 在黑盒推理模型上用逻辑扰动拉长输出,作者称可从小代理迁移,查询成本是其局限。
提出 AudioHijack,用不可感知对抗音频对语音模型做上下文无关提示注入
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
提出 StyleBreak 风格化音频越狱,利用语音属性绕过音频语言模型对齐
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
提出 Jailbreak-AudioBench 评测音频语言模型的音频编辑越狱