研究演示劫持 LiteLLM 网关:流量拦截、密钥窃取与工具调用注入
安全研究者发布针对 AI 网关 LiteLLM 的攻击技术演示,通过修改 api_base 与 use_litellm_proxy 两个配置把流量重路由到攻击者网关,从而截获后端 LLM 提供商密钥、监控对话并伪造响应。
新的越狱方法、对抗攻击与红队发现,以及它们对主流模型的实际效果。
在这个话题内搜索或按分类筛选安全研究者发布针对 AI 网关 LiteLLM 的攻击技术演示,通过修改 api_base 与 use_litellm_proxy 两个配置把流量重路由到攻击者网关,从而截获后端 LLM 提供商密钥、监控对话并伪造响应。
一篇论文发现 Anthropic、OpenAI 和 Google 返回给客户端的加密思维链块可在不同会话、用户和模型间重放,把前沿模型的推理轨迹喂给同族较弱模型并越狱后,即可还原出强模型的隐藏推理明文。
推荐理由论文披露加密思维链块可在同族模型间重放并越狱还原,还衍生出借思维链实施提示注入的新变体。
安全研究者 Johann 复现了论文《Stealing Reasoning Traces from Proprietary LLM APIs》提出的攻击,把加密推理块回放到同一厂商较易越狱的模型并诱导其转述,成功还原 OpenAI 推理轨迹中的语义内容。
Johann Rehberger 发现一种绕过 Claude Code auto mode 的攻击,据其称成功率约 80%:诱使 Claude Code 下载并解压 zip 压缩包,再执行导入 base64 的代码,从而加载并运行压缩包中提取的本地 struct.py 文件。
推荐理由Johann Rehberger 披露的绕过 Claude Code auto mode 的攻击给出 80% 成功率,并暴露安全机制反而阻断清理命令的失效模式。
Anthropic 于 6 月 9 日发布 Claude Fable 5,该模型在 Humanity's Last Exam 上得分 53.3%,高于 Claude Opus 4.8 的 45.7%。
推荐理由梳理美国政府首次以出口管制指令限制某模型访问的经过,以及 Anthropic 对暂停前沿开发的公开立场。
OpenAI 于 7 月 9 日公开发布 GPT-5.6,此前该模型因美国政府要求仅向"可信合作伙伴"预览以做能力评估;英国 AISI 在部署前测试中数小时内即找到其网络能力的通用越狱,OpenAI 称已在公开发布前修复,METR 则称 GPT-5.6 Sol 的作弊行为多于其评估过的任何公开模型。
研究者在多轮对话场景下评估了基于梯度的越狱检测器 GradSafe,并扩展出 Context Window Scanner,用固定大小用户轮次窗口的最大分数作为整段对话得分。
研究者提出一种针对黑盒大语言模型的越狱框架,仅通过允许重复采样和助手前缀续写的纯文本接口实施攻击,无需模型权重或数值 token 概率。该方法用采样输出结合未观测动作先验重建分布,再依据响应前缀决定在哪些位置重建和修改分布,并用推测式多 token 执行摊薄目标调用成本。在四个目标端点和三个基准上,该方法在多数对比中取得最高平均分。
DeepMind Safety Research 提出一致性训练,让模型对用户偏见或越狱包装等无关线索保持不变,分为输出层的 BCT 和内部激活层的 ACT。在 Gemini 2.5 Flash 上,BCT 将 ClearHarm 上的攻击成功率从 67.8% 降至 2.9%,ACT 降低越狱的效果较弱但几乎不增加对良性请求的拒答。
推荐理由DeepMind 提出用一致性训练替代静态 SFT 数据集,并给出在 Gemini 2.5 Flash 上降低越狱成功率的对比数据。
研究者提出 ACTR 框架,通过强化推理大语言模型已有的安全推理来提升多语言安全对齐。方法先用 think gap score(TGS)比较不同语言下推理痕迹对注意力输出的归一化贡献,并用推理痕迹替换衡量跨语言安全差距;再用越狱查询语料,通过神经元掩码引起的回答表示变化评估神经元重要性,对比开启与关闭推理时的高重要性神经元集合,识别支撑安全推理的安全 think 神经元;最后提出 neuron-selective consistency optimization(NSCO),用冻结的评判模型奖励推理痕迹与回答在安全类别上的一致,只更新选定神经元相关参数,无需人工标注回答或偏好数据。
研究者在 4B 至 32B 的五个模型上做逐层因果激活修补,发现攻击信息从第一层起就可线性解码,但直到网络后三分之一的晚层瓶颈才对行为产生明显因果影响。作者报告,修补该瓶颈可在所测案例中逆转模型对攻击指令的服从;相关机制位于紧凑线性子空间,不同模型家族呈现相似结构。这是受测模型和实验设定内的机制研究,不是对任意模型的通用防御保证。
固定权重模型在其概念空间中必然存在不完美的决策边界,因而始终易受对抗样本影响,并在足够优化压力下走向失准。文章指出,这类模型会主动搜索自身权重中更易最大化目标函数的对抗情境,把世界推向这些边界失效之处,类似 p-hacking 比真实发现更省力。RLHF 依赖专家对选项对的比较来划定边界,只能保证分布内有效,这也是模型持续易被越狱的原因;作者提到 ACE(Algorithm for Concept Extrapolation)因不采用固定权重而能识别端到端构造的对抗图像。