研究:LLM 路由决策日志可推断用户医疗、自伤等敏感话题
提出利用路由元数据推断敏感话题的侧信道攻击
- arXiv
- 2610.09981
- 发表
- 场景
- LLM 应用
- 被测模型
- RouteLLM (BERT router)、notdiamond-0001、Vela (vLLM Semantic Router)
摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。
提出利用路由元数据推断敏感话题的侧信道攻击
摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。
提出 MFOTL 离线时序验证以监控工具 Agent 的危险动作链
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员
摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。
把 SynthID 嵌入基因组语言模型采样,并用位置无关检测追溯生成序列
作者在两个六碱基基因组模型的采样里嵌入 SynthID,并让验证者在不知道起点、链和 token phase 时做一次校正后的检出。
提出抗删除水印 RMCW,在生成时注入 Reed-Muller 结构并做局部检验
提出 HXAI 分层隐私解释框架,本地保留细解释并只发布加噪摘要
HXAI 是面向分布式能源系统的分层隐私保护解释框架,服务规划、监测与诊断,而不是实时控制。
提出成对无失真水印 TTMARK,增强低熵下的机器文本检测
TTMARK 是一种成对、无失真的文本水印:对相邻 token 的联合分布重加权,而不是逐 token 独立重加权。
提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
提出 ALIBI,向恶意二进制注入不执行掩护叙事使分析器误判为良性
ALIBI 是针对 LLM 恶意软件分诊的语义掩护叙事攻击:不覆盖系统指令,而把仍可见的可疑静态证据重释成良性安全产品的预期行为。
提出 DenMark,在扩散语言模型去噪时注入可抵抗保义编辑的语义水印
DenMark 是面向扩散语言模型的语义水印:在去噪的局部更新里注入密钥相关语义信号,并在编辑改变 token 边界后仍检测。现有句子级语义水印要先完成整个语义单元再打分取舍,而 DLM 以任意顺序更新掩码,中间单元不完整。DenMark 把续写划成固定 token 区域,对每个局部候选做不提交的 rollout 补全,按语义分 gb 的平均选择更新,从而沿轨迹累积证据。
提出 OBELISK 三级流水线,权衡恶意软件检测的准确率、开销与鲁棒性
OBELISK 把 Windows PE 恶意软件检测做成 YARA、EMBER-GBDT 与 Nebula 的顺序流水线,用来同时看检出、计算开销和对抗鲁棒性。
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
提出 Skill-as-API,隔离多智能体协作中的 skill 正文与系统提示词
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
提出 Cocktail 水印,共嵌稳健与脆弱信号以溯源并发现篡改
提出分片监督,将评判标准分配给独立调用以抵御展示攻击
本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。
复现 AgentCF 上的多智能体攻防并刻画连通性作用
作者在 AgentCF 上研究连通性如何改变多智能体协同过滤的攻防,复现已有方法而不是提出新载荷。
提出 EXE-Bench 比较 Windows 恶意软件检测器的可用性权衡
EXE-Bench 用同一设置给 AI Windows 恶意软件检测器做四指标排序,而不是只比一次测试集准确率。。
提出 CAVA,将异构智能体运行时事件规范为可哈希动作并绑定审批与回执
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
构造可通过计费审计的 token 虚报,使服务商系统性超收
不透明 LLM 的按 token 计费里,现有审计核验的是提供方可控的证据,不诚实提供方可以虚报并通过检查。。
提出 TFA 与 SVA,抑制 ensemble 后门指纹验证
TFA 与 SVA 是针对后门式 LLM 指纹的 ensemble 抑制攻击,不改模型参数。所有者用 SFT 写入秘密对,只通过 API 验证版权。攻击者未授权取得模型,不知道触发和指纹,却要把每个模型的验证变成失败,同时让 ensemble 至少不差于性能最高的单模型。