攻击arXiv 2610.09027
P-VMI:对抗图像经 KV cache 持续影响多轮对话
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
- arXiv
- 2610.09027
- 发表
- 场景
- 模型与 API
- 测试
- Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B 等 4 个
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员
摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。
本文是一份推理时 AI 治理的可行性分类,用来接上作者自己的硬件层分类。
提出端到端全同态加密方案 ODIN,在云端密文上完成推理以保护提示词
ODIN 是面向 Llama 的服务器侧 CKKS 推理系统:客户加密提示词,诚实但好奇的服务器用明文权重在密文上算完 Llama-3,只返回结果密文。
提出混合 CKKS/TFHE 的隐私保护 LLM 解码框架 ROSETTA
ROSETTA 是面向 LLM decode 的混合 CKKS/TFHE 隐私推理框架,目标是在 honest-but-curious 两方设定下,让服务器在密文上完成解码,同时保住权重和用户输入。
提出沙箱平台 DSec,支撑大规模智能体训练的弹性隔离与状态恢复
DSec 是 DeepSeek-AI 的生产沙箱平台,用来支撑从 DeepSeek V3.2 到 V4.1 的智能体 RL 与评测,而不是报告某个模型的任务准确率。
用 SCM 合成会话并训练检测器识别推理层滥用
部署蜜罐测量针对暴露 LLM 基础设施的攻击