研究:LLM 路由决策日志可推断用户医疗、自伤等敏感话题
提出利用路由元数据推断敏感话题的侧信道攻击
- arXiv
- 2610.09981
- 发表
- 场景
- LLM 应用
- 被测模型
- RouteLLM (BERT router)、notdiamond-0001、Vela (vLLM Semantic Router)
摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。
提出利用路由元数据推断敏感话题的侧信道攻击
摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。
提出流匹配逆向框架,从多向量视觉文档索引重构页面
评估应用决策层的输入注入与隐私推断风险
Jev 是 TypeSafe 的 System One 模型,把应用 state 和固定问题变成 Choice、Noul 或 Score 的类型化决策与概率。作者用官方 API 和可改训练的 NanoJev,考察它作为决策层时的操纵、泄露与双重用途。
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容
提出 CIG-MIA,用上下文信息增益推断 RAG 知识库成员身份
CIG-MIA 是针对 RAG 外部知识库的成员推断攻击,同时覆盖灰盒和纯文本黑盒。
提出 CGMIA,检测代码生成基准样本是否泄漏进训练集
CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。
提出 CS-Guard 基准,评测代码生成护栏对虚构场景攻击的防御
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
提出 Skill-as-API,隔离多智能体协作中的 skill 正文与系统提示词
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
提出 RedEvoAgent,演化攻击技能对黑盒智能体做自动红队
RedEvoAgent 是面向产品级 black-box 智能体的自动红队方法,用一份可演化、人类可读的攻击技能编排多个越狱工具。。
提出 LeakGauge,用行为后缀的 prefill 对数概率检测上下文泄露
形式化跨不可关联身份的分解攻击并评测状态化防御边界
提出 AHA 自动科研循环,发现生产 Agent 的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出工作流级越狱,诱导 IDE 编程 Agent 在多轮开发中编写有害代码
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
提出嵌入推断攻击 EIA,在黑盒 IR 中识别所用嵌入模型
EIA 是在黑盒 IR 上识别所用嵌入模型的攻击。。
提出 TRACE 框架,用分解与可演化多轮策略诱导智能体执行有害工作流
提出 MEntA,用非模板查询推断文档是否属于 RAG 检索库
提出零知识审计协议,核验多租户 RAG 的合谋差分隐私
论文针对多租户 RAG 服务在多账户协同攻击下隐私边界失效的问题展开研究。
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
提出 JAWS-Bench,评测代码 Agent 在三级工作区中的越狱与恶意代码可执行性
摘要论文提出了评估代码智能体端到端恶意代码越狱的 JAWS-Bench,发现多文件与智能体推理会明显放大可部署危害。