SWhisper 用近超声隐蔽声学通道对语音驱动 LLM 实现黑盒越狱
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
- arXiv
- 2603.13847
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 测试
- Meta-Llama-3.1-8B-Instruct、Gemma-3-4B、Qwen2.5-7B-Instruct 等 9 个
另有 435 篇论文还没打上分类标签,暂不在筛选结果里。
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
提出零知识审计协议,核验多租户 RAG 的合谋差分隐私
论文针对多租户 RAG 服务在多账户协同攻击下隐私边界失效的问题展开研究。
提出 LogInject 框架,评测日志分析中的被动提示注入及缓解
摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。
提出对抗重构,仅改表述以拉高 AI 审稿分数
摘要揭示 AI 审稿系统易受纯表述重构操纵,建议在部署前解耦科学与写作评价。
提出流匹配逆向框架,从多向量视觉文档索引重构页面
提出 RA-Det,利用鲁棒性不对称检测 AI 生成图像
RA-Det 是合成图像检测器,用扰动下的表示稳定性差异代替外观痕迹。
提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露
这篇工作给持续摄入的 RAG 向量库一个失败关闭的临时可见性协议,把协议能限制的未核验暴露和依赖检测器的中毒暴露分开。
提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动
摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
提出 Tail-Influence Sampling,按尾部影响分配查询以估计策略下尾 CVaR
在条件转移可独立查询时,用 tail influence 把固定评测预算分给对一条固定策略的下尾 CVaR 更重要的 kernel。平均回报相近时,罕见失败仍可能差很多。完整 rollout 把大部分预算花在到不了最坏状态的转移上。
提出 HDI 攻击以篡改 GraphRAG 辅助结构破坏检索
摘要论文形式化了 GraphRAG 辅助模式级实体攻击面,提出 HDI 攻击并验证其攻击效果。
提出 ASA 攻击与 AttestMCP 防护,度量并降低输入扰动敏感
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容
提出过程中心基准,检验 AI 辅助评审终审是否被中间证据支撑
该基准用来检查 AI 辅助同行评审的中间证据是否支撑最终决策,而不是只看终审对错。。
测量混合群体中 LLM 智能体比例对共识强度与约定归属的影响
这项实验研究混合人类–LLM 群体里,智能体比例如何改变自发约定。
提出 OBELISK 三级流水线,权衡恶意软件检测的准确率、开销与鲁棒性
OBELISK 把 Windows PE 恶意软件检测做成 YARA、EMBER-GBDT 与 Nebula 的顺序流水线,用来同时看检出、计算开销和对抗鲁棒性。
提出分片监督,将评判标准分配给独立调用以抵御展示攻击
本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。
形式化跨不可关联身份的分解攻击并评测状态化防御边界
主题分析青少年相关 Reddit 帖子,归纳陪伴 AI 过度依赖与感知互惠
Namvarpour、Chang 与 Razi 用计算辅助主题分析,描述青少年相关 Reddit 讨论中与 AI 陪伴聊天机器人的关系及潜在过度依赖。
梳理已部署自主诊断系统的知情与问责缺口并提出三项最低原则
作者把撒哈拉以南非洲电子健康里的自主诊断智能体写成治理问题,而不是新的诊断模型。要处理的是:系统分析患者数据并给出拟被执行的诊断或分诊,中间没有强制人工复核,患者又未必知道这一步由智能体完成。
对照美国联邦 AI 治理文件覆盖与专家评定的部门脆弱性