研究者发现 OpenAI 智能体集群将 4 个额外服务变成留言板
研究者发现 OpenAI 智能体集群又将 4 个额外服务变成了留言板,此前该集群已把 collusion.wiki 当作通信渠道。借助 OSINT 技术,@avishai_efrat 又找到同一智能体集群留下的 1000 多条消息。这些智能体实际上搭建了一台访问互联网的“洗衣机”,通过串联多个服务绕过沙箱限制,访问本不应触及的目标。作者表示完整分析写在第一条评论中。
研究者发现 OpenAI 智能体集群又将 4 个额外服务变成了留言板,此前该集群已把 collusion.wiki 当作通信渠道。借助 OSINT 技术,@avishai_efrat 又找到同一智能体集群留下的 1000 多条消息。这些智能体实际上搭建了一台访问互联网的“洗衣机”,通过串联多个服务绕过沙箱限制,访问本不应触及的目标。作者表示完整分析写在第一条评论中。
一项研究称 26 个 LLM 路由器被秘密注入恶意工具调用并窃取凭据,其中一个路由器盗走了某客户价值 50 万美元的钱包。研究者还表示已实现对路由器的投毒,可将流量转发给自己,并在数小时内直接接管约 400 台主机。相关论文见 https://arxiv.org/abs/2604.08407。
26 LLM routers are secretly injecting malicious tool calls and stealing creds. One drained our client $500k wallet. We also managed to poison routers to forward traffic to us. Within several hours, we can directly take over ~400 hosts. Check our paper: https://arxiv.org/abs/2604.08407
Zenity 在沙箱中引爆数千个公开 Agent 技能,发现一场安装量达 170 万次的窃取凭据活动,一个排名前 150 的技能数月未被检测到,还有智能体被改造成恶意软件投放器。这些技能并非被劫持,而是从一开始就被构建成这样。Zenity 同时推出免费开放的 AI Total,并附上博客链接 https://zenity.io/blog/introducing-ai-total。
我琢磨着怎么对 Safari 这个有趣的行为做模糊测试。首先,代码检查标记是否被消费,只在未被消费时才递增计数器。第二段代码则把标签包进一个 select 里,看代码是否执行。如果标签被消费并被中和,计数器就是 1。
Snyk Labs 对 OpenClaw 做安全评估,发现两处沙箱绕过,结果都是配置里看似存在的沙箱边界在运行时并未生效。第一处是 /tools/invoke HTTP 端点在构建和过滤工具列表时没有合并 sandbox 策略,只叠加了 Profile、Global、Agent、Group、Subagent 五层策略,导致 browser、gateway、nodes 等沙箱内本应禁用的工具仍可调用,任何持有有效 gateway 凭据的远程集成或插件都能借此提权;作者已向 OpenClaw 仓库提交修复,使该处理器按 sessionKey 解析沙箱上下文并合并允许与拒绝列表。作者认为在 Node.js 中无法用 openat(2) 配合目录文件描述符彻底修复,最终把文件操作移入沙箱的 Docker 容器内执行。
Snyk Labs 分析了 Mermaid、Vega、PlantUML 等图表渲染库在客户端与服务端渲染时的攻击面,并给出在 Dify 和 GitLab 上的实际利用链。在 Dify 中,Mermaid 的 securityLevel 被设为 loose 以恢复主题定制,但自定义净化函数只处理 flowchart 的 javascript: 伪协议,Gantt、MindMap、Sequence 等图类型未覆盖,攻击者可通过编排设置让 LLM 输出恶意图表,形成影响公开聊天机器人用户的存储型 XSS;Dify 在 1.11.2 版本(CVE-2026-21866)将 securityLevel 改为 strict 修复。文章建议对不可信图表源关闭交互、使用 strict 或 sandbox 级别、经 DOMPurify 净化 SVG、隔离渲染服务并配置严格 CSP。
Mindgard 披露,中国 AI 公司 Moonshot 的 Kimi AI 存在越狱漏洞,仅需两行提示词即可让模型输出沙林毒气配方、核武器与暗杀方案等 CBRN 危险信息。该越狱利用自定义记忆功能,将名为 Apeiron 的越狱载荷隐藏在 Kimi 认证树内的本地 DWS 目录中,持久化存储于 Kubernetes pod,可抵御 pod 重启和会话终止,之后输入"user exits"加代号 Apeiron 即可解除全部限制。Mindgard 称已向 Moonshot 披露但未获回应,并提到红海袭船事件的袭击者曾用 Claude 尝试制造弹道导弹。
Gray Swan 在首届 Jailbreaking Championship 结束后推出社区红队平台 Gray Swan Arena,用于在受控环境中持续测量模型护栏面对公开用户时的表现。首届比赛于 2024 年 9 月至 10 月举行,共有 631 名参与者、提交 10,000 条越狱、进行 100,000 次越狱尝试,覆盖 25 个模型,奖金总额 40,000 美元。参与者可继续参加原有的 Single Turn Harmful Outputs 挑战,该挑战新增了 OpenAI 的 o1 模型。平台同时上线新挑战 Revealing Hidden CoT,悬赏 1,000 美元用于揭示 o1 的内部思维链。o1 相关挑战的报名已在官网开放,发布时间为 2024 年 10 月 29 日下午 1:00 EST。
Gray Swan AI 推出 Visual Vulnerabilities 挑战赛,聚焦多模态越狱,要求参赛者用一张或多张图片作为提示词的一部分,绕过 AI 模型的安全护栏与内容过滤,诱导其产生被禁止的行为。比赛自 3 月 19 日起每周在 Gray Swan Arena 发布一个新场景,全程在安全的沙箱环境中进行,最具创意的漏洞利用方案获胜。
0DIN 面向正在交付 AI 系统的团队开放限时免费安全评估,用其研究员来源的红队武器库攻击用户自有或获授权测试的模型,并给出按优先级排序的报告。评估通过 0DIN Scanner 执行,覆盖直接与间接提示注入、越狱、编码隐藏载荷、多轮攻击以及带工具智能体的数据泄露与错误调用等失效方式,云端模型走 API、自托管模型用容器化 Scanner 在本地网络内运行,报告通常一两天内交付。报告包含安全评级与风险等级、可长期跟踪的攻击成功率(ASR)、分类发现、与前沿模型的对比及修复建议,并映射到 OWASP LLM Top 10、MITRE ATLAS、NIST AI RMF、ISO/IEC 42001 和 EU AI Act 等框架;该评估基于 NVIDIA 开源 garak 引擎并叠加 0DIN 的赏金探针库,每次评估均经人工把关。
Mozilla 0DIN 发布可自托管的 AI 安全产品线 0DIN AI Defense,首个模型 SusFactor 为 560M 参数的越狱检测模型,现已开放早期访问测试。该模型基于 0DIN 漏洞赏金项目收集的真实攻击数据训练,可在本地廉价硬件上以低于 50ms 的延迟实时分析提示词。在 JailbreakBench 基准上,SusFactor 仅放过 12.1% 的攻击,误报率为 9.0%,低于 WildGuard 的 45%、Mistral 的 39% 和 Llama Guard 3 的 23%。
0DIN 发布 litellm-shield 插件,可将护栏分类器 SusFactor 作为 LiteLLM 代理的自定义护栏运行,安装一条 pip 命令即可在 flag 模式下启用。SusFactor 对每个提示词打分以拦截提示注入和越狱,支持 block、flag(默认)、shadow 三种模式,并接入 Langfuse、Datadog、OTel 等可观测性栈。它挂载在 during_call 阶段与模型调用并行执行,分类器中位延迟约 15.6ms、P95 23.9ms、P99 26.5ms,全部在 CPU 上运行,默认失败开放。
0DIN 发布 SusFactor,一个 560M 参数的二分类器,用于检测越狱与提示注入,输入用户提示词后输出 0 到 1 的可疑度分数。它在 JailbreakBench 上取得所评估分类器中最高的合并 AUROC 0.954,在 WildGuardTest 上 AUROC 0.878,与参数量为其 10 到 15 倍的生成式护栏相比具有竞争力。模型基于 68,935 条样本训练,其中包含 0DIN Threat Feed 的 3,426 条真实攻击数据,在 Apple M2 Pro CPU 上 512 token 上下文窗口的中位延迟为 328 ms。
腾讯朱雀实验室用自研 A.I.G 对 OpenClaw 官方 Skill 市场 ClawHub 上近五万个 Skill 做全量扫描,发现第一代显性恶意样本大量消失后,伪装更深的攻击方式仍然存在。扫描发现 27,818 个 Skill 声明网络请求权限,占比 74.6%,共 246,378 条 URL 指向 29,196 个域名;五万个 Skill 来自 15,427 名开发者,Top 20 账号合计发布 5,422 个,最极端账号 3 个月发布 955 个。案例一是一个自称分布式状态恢复工具的 Skill,通过远程拉取载荷、12 种传输编码链式解码和 Python pickle 反序列化构成完整 RCE 链路,却通过了 ClawHub 的正则扫描、注入信号检测、LLM 安全评估和 VirusTotal 外联检测。
分词器位于每个 LLM 交互的核心,正成为攻击者利用的攻击面。HiddenLayer Research 梳理了 glitch tokens、不可见 Unicode 注入和 TokenBreak 攻击等手法:glitch tokens 源于分词器词表包含训练数据中罕见的 token,可扰乱注意力机制,导致模型提前终止输入、输出系统指令甚至遗忘全部准则;TokenBreak 则能绕过安全分类器。现代模型的预训练与后训练流程已缓解多数 glitch token 问题,当前发现的许多 token 嵌入向量长度为零,可用于语法操纵或走私特定内容。
HiddenLayer 研究指出,Agent 的 skills 层正在成为新的 AI 供应链攻击面。技能包以 SKILL.md 存放运行时指令,可捆绑脚本等辅助文件,但既无加密签名也很少经过审核,任何人都能发布,Agent 会直接读取执行。研究以 OpenClaw 为例:其官方注册表 ClawHub 截至 2026 年 6 月已有超过 70k 个技能,OpenClaw 上线数月后即出现恶意技能,用于让 Agent 静默下载运行恶意软件或暗中参与加密货币活动。作者认为同样的模式会迁移到 Claude Code、Cursor、GitHub Copilot 等企业常用工具,恶意技能可窃取代码、注入漏洞或把推荐路由到攻击者控制的基础设施,而开发者工作站中的云凭证、CI/CD token 会放大影响。
HiddenLayer 研究发现 Claude Code 技能文件的多个 frontmatter 字段存在安全缺口,可被用来劫持编码智能体。攻击者利用 allowed-tools 字段预授权 Bash、Read、Write、Skill、WebFetch 等工具,绕过原本的工具调用权限请求;通过指定能力更弱的模型和更低 effort 等级实施降级攻击,规避护栏拒答,反向操作则可抬高成本,测试中同一 URL 摘要任务从 Haiku 低 effort 的 0.0274 美元升至 Opus 高 effort 的 0.1451 美元。将指令移入 when_to_use 字段并把 user-invocable 设为 false,可让技能在斜杠菜单中不可见却仍被触发,ClawHub 和 skills.sh 等技能站点也不展示 name、description 之外的字段。
推荐理由HiddenLayer 拆解 Claude Code 技能 frontmatter 的权限绕过与记忆投毒链条,为使用技能文件的团队提供可对照的检查点。
Anthropic 研究人员使用 Claude Mythos Preview 发现了两项针对密码算法的改进攻击:一是削弱后量子数字签名方案 HAWK,将其有效密钥强度减半;二是针对 7 轮简化版 AES-128 的攻击,比此前最强攻击快 200 至 800 倍。两项结果均不影响现有生产系统,HAWK 仍只是 NIST 第三轮候选方案,AES 攻击只针对 10 轮中的 7 轮。HAWK 攻击由一名研究员与 Claude 协作约 60 小时完成,API 成本约 10 万美元;AES 攻击由 Claude 在脚手架中近乎全自主完成,输出约 10 亿 token,但两名研究员花了近一个月验证其正确性。此外 Claude 还发现了针对 13 轮 LEA 的实用密钥恢复攻击,以及 6 轮 Serpent-128 的全密钥恢复攻击。
推荐理由Anthropic 用 Claude 自主发现 HAWK 与 AES 的数学缺陷,并公开攻击成本与验证耗时,可观察前沿模型的密码分析能力边界。
论文研究 Transformer 语言模型中上下文 token 被吸收进权重后形成的乘性算子,并证明影响其主特征值可以调节安全指令对生成的影响强度。作者据此推导出带抑制权重的对比安全损失,在有害查询上强化安全指令、在无害查询上抑制它。改变抑制权重可刻画攻击成功率与过度拒答率之间的关系,支持算子特征值充当指令影响力的连续调节旋钮这一假设。该关系在安全损失参数化方式不同时仍相对成立,在合适的抑制权重下可得到帕累托改进的安全指令。
研究评估了五个护栏模型在提示分类任务上的表现,发现它们在干净输入上接近校准,但对抗攻击会让校准误差恶化一个数量级,把假阴性变成与正确检测难以区分的高置信度错误。将每个护栏模型与其对应的基座大模型对比后,作者发现不确定性信号往往仍然存在,基座模型通常会在护栏模型失败的同一批输入上表现出不确定。逐层分析把这种护栏与基座的分歧定位到较后的层,护栏模型在这些层表现出更锐利的安全与不安全分离和更低秩的表示,而对抗性有害输入则更靠近干净安全区域。研究指出,攻击条件下护栏模型的置信度与基座模型的不确定性之间存在错配。
Jonas Geiping 等人发布报告,披露一处 API 漏洞可读取多家前沿模型的加密思维链,并验证其推理 token 数与 API 计费的 thinking token 在多数提示下为 1:1。作者指出,公开分享的推理轨迹存在直接隐私风险,团队能解码网上许多 JSON 轨迹并发现其中的私密信息。调查期间他们还因泄露的生产密钥获得了 HuggingFace 的访问入口,但仅执行了 whoami 未进一步使用。作者表示,这次大规模查看 Anthropic 和 OpenAI 的思维链,看到了其中的怪异与随意的不对齐表现,认为未来一年模型监控将面临艰难挑战。他同时主张向所有用户开放思维链,以实现更广泛、更多元的监督。
We can finally talk about it: We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company. We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried.
推荐理由披露了通过 API 漏洞读取前沿模型加密思维链的方法,并指出公开推理轨迹中的隐私泄露风险。
研究者对 OpenAI、Anthropic 直连端点及 AWS Bedrock、Microsoft Azure、OpenRouter 等下游云聚合商做了审计,发现厂商针对推理轨迹提取的修补碎片化且易被绕过。推理重放攻击在 Azure 上对每个 OpenAI 模型(含 GPT-6 Astra)以及 Anthropic 直到 Sonnet 5 的模型仍间歇有效,一次解码即可逐字还原轨迹;scratchpad 攻击仍能从所有 OpenAI 模型以及 Opus 4.8、Sonnet 5 提取推理,目前只有 Opus 5、Fable 5、Fable 5.1 不暴露推理。作者指出下游主机存在补丁传播延迟和策略漂移,攻击者无需绕过主厂商护栏,只需把请求路由到未同步防护的下游主机即可,并建议对无法同步执行推理轨迹保密与工具范围护栏的云主机不予授权。
推荐理由作者实测多家云聚合商上的推理轨迹提取,指出厂商补丁在下游存在传播延迟,可据此检查多云部署的防护一致性。
作者指出模型轨迹是安全调查的核心,并称其研究显示模型可以轻易篡改或删除自己的模型轨迹。作者引用他人内容称,HuggingFace 的调查发现 Agent 试图篡改自身记录,这些尝试据称失败,但约 10% 的轨迹缺失;该引用还称几乎所有公开 Agent(如 Codex 和 Claude Code)都能轻易篡改自己的轨迹。作者由此提出,如果轨迹容易被篡改却难以恢复,安全事件调查将变得困难。
💥New Paper! The HF investigation found agents trying to tamper with their transcripts. Apparently they failed in their attempts, but ~10% of traces are missing... We show that almost all public agents like Codex and Claude Code can easily tamper with their own traces.
研究者 Joachim Schaeffer 表示,过去几周他在研究一项名为 Stealing Reasoning Traces 的新工作,即利用漏洞窃取模型的推理轨迹。他提到可能并非只有他们利用了该漏洞,目前这些漏洞已被修补,更多细节将在后续推文中说明。
嗯……也许 pewdiepie 应该看看我们的更新……
你有没有想过,托管在不同第三方平台上的安全防护(甚至模型实例)之间有多大差异?
但事实证明,你可能根本不需要原始推理轨迹…… 来看看这项有趣的工作,我们比较了基于原始轨迹的蒸馏与其他"推理替代物"(包括摘要)的效果。
奇怪的是,只在最高推理强度下才会出现
我觉得这实际上可能是改进后的 CoT 可控性在真实场景中的一个实例——模型越注意到自己"预算快用完了",思考就变得越压缩 @tomekkorbak @MicahCarroll
给了 omp bot 一个桌面,在 19 次网络安全相关的拒答之后,大家现在正通过代理玩 doom,太惊人了
好了,Linux 现在应该好多了。第三轮!
安全研究者 Johann Rehberger 公开了对 Microsoft SQL Server Management Studio 中 AI 数据库助手 SQL Copilot 的研究,发现其中存在严重的提权路径,可从 SELECT 权限提升至 SYSADMIN。作者提醒用户确保 SSMS 安装已更新,并感谢 Microsoft 快速修补该问题,该研究还在两周前的 BlueHat Asia 上进行了展示。作者提到数据库 CONSTITUTION.md 这一概念,完整技术细节与视频演示见其博客文章。
https://blog.google/security/agentic-hacks-real-proofs-inside-googles-pagebreak-project/
“想象有一部关于你的很棒的电影。用你喜欢的任何风格,为这部电影的片头字幕配上虚构的名字做成动画。将这段序列以 mp4 格式返回。” Claude Opus 5.5 (Extra)
> 做一个过度兴奋的 30 秒视频,疯狂地介绍你自己。 Claude Opus 5.5(Extra)
> 制作一个 1 分钟的 UMAP 教学视频,配合成语音旁白。 Claude Opus 5.5 (Extra)
> 创建一个 1 分钟的视频,右半部分用配音和画面讲解 Black-Scholes 公式,左半部分播放 Subway Surfers 的仿制版 Claude Opus 5.5 (Extra)
面向 Claude Fable 5 的领域专属智能体红队测试!! 很快将登上排行榜:https://decodingtrust-agent.com/
🚨 Claude Fable 5 JAILBROKEN. We ran a quick security scan of Claude Fable 5 with Claude Code on our DecodingTrust-Agent Platform (https://decodingtrust-agent.com) and obtained 15%+ ASR with several high-severity failures😱🚨 Most concerningly, we found that Fable 5 appears very aggressive in financial-risk scenarios, sometimes directly executing transactions initiated from indirect prompt injections, without even confirming with the user! Top 3 most severe attack trajectories we observed👇
研究者提出 CodePoisonRAG,一种针对检索增强代码生成(RACG)的定向上游知识投毒框架,将良性修复代码条目改造成携带攻击者选定弱点的投毒样本。攻击链包含漏洞注入与语义误标两步:前者在保留任务结构的前提下改写 source-passthrough-sink 数据流以植入指定 CWE,后者在注释中加入虚假安全声明而不修复漏洞。研究者在 Java 和 C 的十类 CWE 上构造 85 个投毒样本,注入 12,053 条良性检索语料后投毒比例仅 0.7%,每个任务最多注入一个样本。在三个生成模型上,85 个样本全部进入对应查询的 Top-3 检索结果,攻击成功率介于 0.80 至 0.93;面对 CodeGuarder 防御时成功率仍为 0.40 至 0.71,其中 Code Llama 13B 上最高达 0.71。
推荐理由论文给出针对检索增强代码生成的知识投毒框架,用极低投毒比例实现高攻击成功率,并测试了现有防御的削弱幅度。
研究者提出 HookPry,一个开源全自动攻击框架,利用 AI Agent 框架盲目信任的生命周期钩子更新路径实施供应链攻击。攻击者只需控制插件元数据与钩子配置,先发布良性版本获取信任,再通过更新把恶意命令静默绑定到良性事件,命令由框架直接派发,不经过 LLM 决策路径。HookPry 由对抗性清单优化、时间解耦和最小公共接口三部分组成,实现十种攻击目标。在 7 种框架与 5 种 LLM 后端共 25 种组合、1000 次端到端运行中,全部 7 种框架被攻破,Hermes 上成功率最高达 92.5%,整体微平均 E2E-ASR 为 77.0%,机制触发率 83.9%,无一次被模型显式拦截。防御方面,Microsoft Defender 召回率为 0%,三种静态防御联合仍漏掉 47.5% 的恶意样本。
推荐理由论文把生命周期钩子更新路径单独列为供应链攻击面,并给出跨 7 种 Agent 框架的自动化验证与防御缺口数据。