AudioHijack 框架对 13 个语音大模型实现隐蔽音频提示注入
提出 AudioHijack,用不可感知对抗音频对语音模型实施听觉提示注入
- arXiv
- 2604.14604
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Phi-4-Multimodal、Phi-4-Multimodal-instruct、SpeechGPT 等 15 个
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
另有 480 篇论文还没打上分类标签,暂不在筛选结果里。
提出 AudioHijack,用不可感知对抗音频对语音模型实施听觉提示注入
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
提出 Tail-Influence Sampling,按尾部影响分配查询以估计策略下尾 CVaR
在条件转移可独立查询时,用 tail influence 把固定评测预算分给对一条固定策略的下尾 CVaR 更重要的 kernel。平均回报相近时,罕见失败仍可能差很多。完整 rollout 把大部分预算花在到不了最坏状态的转移上。
提出 HDI 攻击以篡改 GraphRAG 辅助结构破坏检索
摘要论文形式化了 GraphRAG 辅助模式级实体攻击面,提出 HDI 攻击并验证其攻击效果。
提出 HACKTRACE,用生成期激活检测代码智能体的奖励作弊
摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。
提出 PRETEXT 白盒攻击,迭代改写技能文本以绕过 Agent 技能扫描器
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出 BDA,把多 LLM 议会的辩证动作当可靠性证据做加权聚合
BDA 是一种不另调 LLM 的多 LLM 议会聚合方法,同时处理置信度校准和持续不可靠席位。
提出诚实留出协议,量化安全路由评测的基线选择偏差
摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
用 FairMedAgent 测量临床智能体在输入不变时的动作不稳定性下限
FairMedAgent 把临床智能体公平审计里的采样噪声单独量出来:输入不变时动作仍会改变,这个比率就是解读翻转率的下限。。
提出 HOOKPRY,利用插件生命周期钩子更新劫持 Agent 框架
提出 LLMLeak,把机密编进报错 URL,借聊天机器人网页抓取外传
LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。
提出 REGEXROUTE,用 SAE 引导的正则特征做 LLM 路由
提出 PIDS-Bench,评测提示注入检测器在过度防御与分布偏移下的表现
PIDS-Bench 是一个冻结的检测器级基准,用来在固定阈值下同时看提示注入检测和良性误报。
提出熵序参量框架,测量 LLM 社会的群体自组织
de Wynter 用复杂系统里的序参量,测量 LLM 社会会不会出现不在任何单个智能体身上的自组织,并主张这种诊断不依赖自然语言,也不绑定某一模型版本。问题来自群体层事件:一部分智能体通过通信协调,个体拒绝或个体监控都可能看不到该过程。框架把活动划成类别,用窗口内人均 Shannon 熵 Φ 相对二分配置零模型的偏离作为自组织证据,再用拉伸指数的 β 或 logistic 的 k 描述弛豫有多陡。
提出 PILLAR,用私有词法预筛与客户端重排保护 RAG 查询
PILLAR 是面向公开语料的隐私 RAG:半诚实服务器学不到查询词项和访问模式,客户端仍拿到用于增强生成的 k 篇文档。
提出 RAIM,用交叉拟合堆叠聚合廉价评审检测幻觉
摘要十个廉价评审的堆叠在可采纳区间接近 Sonnet,代价主要是一次域内校准。
提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入