摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。
- 攻击arXiv 2610.09027
P-VMI:对抗图像经 KV cache 持续影响多轮对话
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
- arXiv
- 2610.09027
- 发表
- 场景
- 模型与 API
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
- 攻击arXiv 2610.06848
TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击
提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员
- arXiv
- 2610.06848
- 发表
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。
- 攻击arXiv 2610.05089
研究者披露 LiteLLM 网关跨租户干扰攻击 Cooldown Landmines
提出利用共享冷却的跨租户干扰攻击,并设计租户隔离机制
- arXiv
- 2610.05089
- 发表
- 场景
- LLM 应用
摘要揭示网关共享冷却漏洞,提出来源检查与租户隔离防御。
- 攻击arXiv 2610.03430
JIL:通过对抗后缀操纵 LLM 请求调度优先级
提出 JIL 对抗后缀,压低长度预测以抬高请求调度优先级
- arXiv
- 2610.03430
- 发表
- 场景
- 模型与 API
- 技术梯度与表征优化
摘要JIL 用对抗后缀压低长度预测,在预测式 LLM 调度中提高自身优先级。
JIL 是对预测式 LLM 调度的攻击:用对抗后缀压低长度预测,使请求在 SRPT 式队列里更早得到服务。
- 其他arXiv 2610.01539
研究者提出 AI 评估沙盒配置器,支持欧盟 AI 法案下的技术评估
提出 AI 评估沙盒配置器,支撑监管沙盒多方技术评估与报告
- arXiv
- 2610.01539
- 发表
- 场景
- 模型与 API
摘要框架把每次技术测试配成沙盒。
AI Assessment Sandbox Configurator是面向欧盟 AIRS 中结构化技术测试的开源配置框架,用来按一次参与组装评估环境。
摘要商用推理时治理底座已较常见,对高能力非合作对手的覆盖更薄。
本文是一份推理时 AI 治理的可行性分类,用来接上作者自己的硬件层分类。
- 防御arXiv 2609.12378
Odin:面向隐私保护 Llama 3 8B 推理的开源端到端 FHE 实现
提出端到端全同态加密方案 ODIN,在云端密文上完成推理以保护提示词
- arXiv
- 2609.12378
- 发表
- 场景
- 模型与 API
摘要ODIN 用可复用的特征主序打包和联合误差预算,在单张 H100 上完成 Llama-3-8B 的 CKKS 推理。
ODIN 是面向 Llama 的服务器侧 CKKS 推理系统:客户加密提示词,诚实但好奇的服务器用明文权重在密文上算完 Llama-3,只返回结果密文。
- 攻击arXiv 2609.12911
研究:置换式保密在混合 FHE 推理中失效,可精确恢复 ResNet-20 全部线性层
攻破混合 FHE 推理的置换式保密,精确恢复线性层排序谱
- arXiv
- 2609.12911
- 发表
- 场景
- 模型与 API
- 攻击提取与窃取
- 其他arXiv 2609.16915
ROSETTA:基于混合 CKKS/TFHE 的高效准确隐私保护 LLM 解码框架
提出混合 CKKS/TFHE 的隐私保护 LLM 解码框架 ROSETTA
- arXiv
- 2609.16915
- 发表
- 场景
- 模型与 API
摘要ROSETTA 用分段 LUT 和 DAG 最短路,把 CKKS 与 TFHE 按算子拼进 LLM 解码。
ROSETTA 是面向 LLM decode 的混合 CKKS/TFHE 隐私推理框架,目标是在 honest-but-curious 两方设定下,让服务器在密文上完成解码,同时保住权重和用户输入。
- 其他arXiv 2609.22978
DeepSeek Elastic Compute(DSec):面向大规模智能体训练的高效沙箱基础设施
提出沙箱平台 DSec,支撑大规模智能体训练的弹性隔离与状态恢复
- arXiv
- 2609.22978
- 发表
- 场景
- AI Agent
摘要DSec 是面向大规模智能体 RL 的多后端生产沙箱,用分层、按需镜像和训练协同维持高密度。
DSec 是 DeepSeek-AI 的生产沙箱平台,用来支撑从 DeepSeek V3.2 到 V4.1 的智能体 RL 与评测,而不是报告某个模型的任务准确率。
- 分析与理论arXiv 2609.29757
OllamaDrama:用蜜罐测量暴露 LLM 基础设施遭受的攻击
部署蜜罐测量针对暴露 LLM 基础设施的攻击
- arXiv
- 2609.29757
- 发表
- 场景
- 模型与 API