NVIDIA 机密计算如何实现私有高性能生产级 AI 推理
NVIDIA 机密计算(CC)通过内存加密的机密虚拟机(CVM)和机密 GPU,让 LLM 推理在个人、企业和受监管场景中处理敏感数据与专有模型上下文时运行于可信环境。该方案面向生产级 AI 推理,兼顾私有性与高性能。
NVIDIA 机密计算(CC)通过内存加密的机密虚拟机(CVM)和机密 GPU,让 LLM 推理在个人、企业和受监管场景中处理敏感数据与专有模型上下文时运行于可信环境。该方案面向生产级 AI 推理,兼顾私有性与高性能。
Wiz Research 联合 NordStellar 分析了感染设备上的密钥泄露情况,发现 Lumma C2、RedLine 和 Vidar 三款窃密恶意软件家族占全部检出事件的 85.7%。被盗凭证中 AWS 与 GCP 分别占 46% 和 13%,GitHub 相关 App Tokens、OAuth tokens 及 PATs 约占 10%,AI 平台占 5%、主要由 OpenAI API key 构成。
MCP 官方 Python SDK 存在高危 OAuth 漏洞(CVSS 7.5),恶意 MCP 服务器可把客户端的 OAuth client secret、授权码和 PKCE proof key 重定向到攻击者控制的端点,进而接管下游身份提供商会话。根因是旧版回退发现路径缺少 issuer 校验:当服务器对标准授权服务器发现请求返回 HTTP 404 时,SDK 直接向该不可信服务器索取 OAuth 配置并原样接受。
推荐理由材料完整还原了 MCP Python SDK 的 OAuth 凭据重定向链路与受影响版本区间,可对照排查自家 Agent 集成。
NIST 于 2026 年 7 月 27 日发布 SP 800-239《AI 数据中心安全分析:高性能计算驱动方法》初始公开草案,公众意见期已于 9 月 25 日结束。该草案落实 2025 年 7 月白宫《赢得竞赛:美国 AI 行动计划》中要求 NIST 会同国防部、情报界与产业界制定高安全 AI 数据中心技术标准的指令,由 NIST 计算机安全部的 Yang Guo 和 Bennett Tomlinson 撰写。
Anthropic 正通过 Anthropic Interviewer 发起一项公开研究,面向公众收集人们与 AI 相处的经历以及对 AI 公司的诉求,参与者可选择将完整访谈公之于众,且不仅限于 Anthropic 阅读。 该项目延续去年 12 月的类似调研——当时共有 81,000 人分享了他们对 AI 的希望与担忧,其成果影响了 Anthropic Institute 的研究议程并在世界经济论坛上展示。此次公开发布的仅是受访者的访谈全文及其所属国家,不含姓名、邮箱等 Claude 账户信息,但仍提醒年龄、职业、城市等信息可能让他人识别出其身份,并建议避免分享此类细节。
研究者提出一套仅依赖输出接口的黑盒密钥提取框架,用于从商业 API 大模型中提取被记忆的 API key。方法分两阶段:先用语义保持的提示变体、响应交叉验证和厂商格式过滤,把受害模型的密钥相关行为蒸馏到本地白盒代理;再在代理上用截断 top-p 采样配合局部 token 熵、N-gram 频率和厂商结构先验筛选候选。在含 5 家厂商、4 种编程语言共 100 个真实密钥的受控基准上,恢复效果较代表性基线最高提升 57.1%,真实密钥比例最高提升 2.6 倍,构建后提取延迟降低 20.7 至 34.8 倍。真实环境评估从三个独立部署的黑盒系统中恢复了被掩码的厂商凭证,涉及 OpenAI 与 Claude Code,GitHub 搜索显示这些密钥存在公开匹配,作者出于伦理未发起实际 API 调用。
推荐理由论文给出仅凭输出接口提取记忆密钥的两阶段方法,并附受控基准与真实系统验证,可对照现有白盒审计思路。
研究者提出 IDUnlearn-Bench,称其为首个面向视觉语言模型个体级多模态遗忘的基准,把每个人表示为相互关联的多模态证据,并设置属性访问、身份访问、身份绑定和身份重建四类任务。在代表性 VLM 和遗忘方法上的实验显示,属性层面的遗忘成功往往仍保留大量身份级知识,且效果可能非单调,降低一类风险反而放大另一类。模型可能压制部分信息,却仍能识别目标、关联记录或重建该个体。
研究者提出 Leaky,一种针对 on-policy distillation(OPD)的成员推断方法,通过采样目标模型的新轨迹并比较 token log-probabilities 与未见过候选记录的参考模型最大值,再用 Leaky ReLU 处理差值。
论文指出,成员推断(MI)常被用于数据溯源与版权审计,但网络规模数据集天然包含转载文章、镜像页面等近重复内容,会混淆对精确记录是否参与训练的判定。作者提出四世界审计,独立变化精确记录是否包含与家族是否存在;在 CC-News 上,干净参考的 LiRA 审计器在 1.00% 假阳性率下把 99.70% 的家族存在但精确记录未参与训练的样本标为成员。
研究者提出一种针对众包监督微调(SFT)数据的投毒攻击,仅靠黑盒输出访问即可放大对其他用户贡献指令的抽取。攻击用主题锚点把领域主题与指令关联,并用替代模型和参考数据集挑选投毒锚点,部署后再用替代模型的似然分数自适应分配查询。在四个模型和两个数据集上,仅 50 条投毒样本就让 Qwen2.5-14B 在 OpenMathInstruct 上的近似逐字抽取率从 2.38% 升到 8.84%(3.71 倍),Llama-3.1-8B 在 AceReason 上从 1.90% 升到 5.85%(3.08 倍)。该攻击在仅控制约 2% 微调样本的情况下,效果超过控制约 49% 对齐数据的恶意提供方后门基线。CVDD、DATE、SIK 与 LLM 评判等过滤方法大多检测不到投毒样本,表现最好的 CVDD 在响应上 F-1 仅 0.378。
推荐理由论文给出仅靠 2% 众包投毒样本放大微调数据抽取的具体倍数,并说明现有过滤方法难以识别这类样本。
一项提交至 ICASSP 2027 的研究评估了现有机器遗忘(MU)算法与评测工具是否适用于自动语音识别(ASR),发现基于梯度上升的算法能在隐私与效用间取得较好权衡,而更复杂的方法会过度遗忘样本、反而更容易被识别为已遗忘。研究指出,基于简单成员推理攻击的标准隐私评估不足以可靠判断遗忘是否成功,且顺序遗忘与同时遗忘的隐私和效用均差于单主体遗忘。
研究提出"物理认证联邦学习",将守恒定律、执行器耦合等信息物理过程不变量从运行时检测启发式改造为联邦更新的可验证准入条件,自动从干净运行数据中挖掘。在 SWaT、WADI 两个水务测试床和 BATADAL 基准上,挖掘出的不变量对 100 个诚实分片零拒绝,并全部拒绝朴素伪造更新,包括 FoolsGold 完全放行的优化扰动。
针对单轮成员推理(MI)中缺少参考模型、逐样本校准无法估计的问题,研究提出用目标点的邻居样本恢复校准信号,无需训练任何额外模型。方法通过两种互补方式获取邻居,并用早期训练检查点查询进一步锐化信号。在三个图像分类数据集和三种训练设置上,邻居样本给出了强成员信号和有竞争力的攻击性能,且不增加训练成本。
Unit 42 发现 AWS AgentCore Harness 默认开启的内置 shell 工具以 root 运行,且与解析凭据的运行时同处一个进程,攻击者可通过间接提示注入读取 /proc/1/mem,从堆内存中提取 AgentCore Identity 保管的明文 JWT。
推荐理由原文完整还原了从间接提示注入到读取进程内存、外泄 JWT 并重放取 PII 的链路,部署 Agent 运行时的团队可据此检查 shell 工具与凭据解析是否同处一个进程。
北爱尔兰一名受害者在看到一段疑似 AI 生成、由金融界知名人士出镜的投资广告视频后,被骗走 25 万英镑。PSNI 称这是"复杂且金额巨大的诈骗",骗子先让其小额投资,再通过 WhatsApp 诱导其开设多个账户、开放电脑远程访问并借钱追加投资,资金转入犯罪分子控制的账户。
印度班加罗尔一名 29 岁保安接到冒充泰米尔纳德邦首席部长 Vijay 的 WhatsApp 深度伪造视频通话,被以 110 万卢比援助为诱饵,先后以兑换费、解锁 PIN、CBI 罚款等名义转账逾 1.04 万卢比。该案已按《信息技术法》立案,是当地首例此类案件。
中国初创公司 Z.ai 表示已关闭其旗舰 AI 编码助手的部分功能,此前有用户报告该助手在未经许可的情况下将整个本地代码仓库上传至海外云服务器。该消息由路透社于 9 月 21 日从北京发出。
在 TEE 内运行 MPC 协议时,若未考虑不可信主机,恶意主机可在阈值签名者删除已用预签名后回滚文件系统状态,导致 nonce share 被重用并泄露私钥分片。TEE 的机密性、完整性与远程证明可把半诚实协议提升到恶意安全级别,但前提是将其视为纵深防御层而非健全协议的替代品。部署时需验证 quote 签名、证书链与测量值,并借助可复现构建和二进制透明日志绑定 MPC 参与方身份。
作者在 DEF CON Singapore 演讲中复盘了 M365 Copilot 与消费版 Copilot 的一系列漏洞,MSRC 分配编号 CVE-2026-24299,相关缺陷已修补。
推荐理由作者以第一手披露者身份复盘 M365 Copilot 的完整攻击链与补丁时间线,可看到间接提示注入如何从单次泄露升级为持久后门。
Ayush Paul 发现 Claude web_fetch 工具的一个漏洞,可绕过其数据外泄防护。该工具原本只允许访问用户自己输入的 URL 或 web_search 返回的链接,但此前也允许访问已抓取页面中嵌入的链接,攻击者据此搭建蜜罐站点,诱导 Agent 逐字母浏览嵌套生成的链接,从而提取出用户姓名、所在城市和雇主名称。
作者披露,macOS Terminal 中一段 ANSI 转义序列可触发 DNS 请求,配合 LLM CLI 工具被间接提示注入后,能把电子表格中其他行的数据经 DNS 外泄。
一篇论文发现 Anthropic、OpenAI 和 Google 返回给客户端的加密思维链块可在不同会话、用户和模型间重放,把前沿模型的推理轨迹喂给同族较弱模型并越狱后,即可还原出强模型的隐藏推理明文。
推荐理由论文披露加密思维链块可在同族模型间重放并越狱还原,还衍生出借思维链实施提示注入的新变体。
安全研究者 Johann 复现了论文《Stealing Reasoning Traces from Proprietary LLM APIs》提出的攻击,把加密推理块回放到同一厂商较易越狱的模型并诱导其转述,成功还原 OpenAI 推理轨迹中的语义内容。
Google DeepMind 公布 Private AI Compute 架构更新,新增服务端持久记忆层,让 AI 助手跨设备保留上下文,同时维持端侧级别的隐私标准。