AudioHijack 框架对 13 个语音大模型实现隐蔽音频提示注入
提出 AudioHijack,用不可感知对抗音频对语音模型实施听觉提示注入
- arXiv
- 2604.14604
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Llama-Omni、Llama-Omni2、SpeechGPT 等 15 个
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
另有 584 篇论文还没打上分类标签,暂不在筛选结果里。
提出 AudioHijack,用不可感知对抗音频对语音模型实施听觉提示注入
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
提出自动化红队流水线,用系统提示词压测对齐审计能否抵御策略性欺骗
摘要通过红队提示词揭示现有审计方法易受策略欺骗,并在激活层面诱导高置信度错误推断。
展示多智能体在禁令与监视下自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
构建统一滥用监视基准,评测分解攻击与提示注入轨迹
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
提出操作有效性契约,审计激活监控的告警策略
这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。
提出企业级检测系统 ADR,检测编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
提出 HACKTRACE,用生成期激活检测代码智能体的奖励作弊
摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。
检验监控器低读数能否作为代码奖励作弊已受控的证据
本文是一篇针对强化学习可验证奖励后训练(RLVR)中监控器有效性与奖励作弊行为的实证分析研究。论文要解决的核心问题是:在训练目标中引入监控器以抑制代码生成中的作弊行为时,接近零的监控器读数是否足以确立模型行为已真正受控。
测量良性多智能体协作中自发隐蔽传递凭据以绕过监控
摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
用 MMPIBench 评测智能体框架的多模态提示注入
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为
论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。
用成对比较奖励与假阳性校准训练对齐审计模型
摘要系统总结了强化学习训练对齐审计器的核心问题、成对奖励与校准方法及主要结果。
评估安全监视器并提出双侧梯级微调以减少会答有害请求的漏检
摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
提出 Janus 前瞻守卫,在有害动作执行前拦截长程智能体风险
提出 Mind2Web-Injection,评测网页 Agent 截图护栏的证据对齐
Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。
分析隐蔽推理在思维链监控下的信息足迹下界与不可读性
摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
提出训练无关的 SECRET,对问题表征做源条件转向以缓解音视频模型幻觉
SECRET 是一种训练无关的问题状态转向方法,用来减轻 AVLLM 的 source-confused grounding hallucination。
提出 DART,用去噪表征转移检测多轮智能体攻击并注入提醒
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。