东亚日报隔离实验室实测:中文圈 AI 渗透工具 ARTEX 43 秒攻破目标服务器
东亚日报采访组在隔离虚拟实验室实测中文圈 AI 渗透工具 ARTEX,输入目标地址后 43 秒内攻入两处致命弱点,约 4 分钟完成窃取最高管理员权限与远程操控,使用费仅 20 韩元。该工具类似智能体 AI“OpenClaw”,接入 AI 模型后成为“攻击代理”,遇阻会自行改变方法重试并生成报告。荷兰安全企业哈德里恩称,公开的 AI 模拟黑客工具截至今年 3 月已达 70 个。
东亚日报采访组在隔离虚拟实验室实测中文圈 AI 渗透工具 ARTEX,输入目标地址后 43 秒内攻入两处致命弱点,约 4 分钟完成窃取最高管理员权限与远程操控,使用费仅 20 韩元。该工具类似智能体 AI“OpenClaw”,接入 AI 模型后成为“攻击代理”,遇阻会自行改变方法重试并生成报告。荷兰安全企业哈德里恩称,公开的 AI 模拟黑客工具截至今年 3 月已达 70 个。
CrowdStrike Cyber Superintelligence Lab 评估了当前公开部署的最先进内容安全分类器(用于保护 Claude Opus 5.5 等前沿模型),发现该分类器对直接攻击极为稳健,但可被系统性地绕过。研究测试了约 515 种绕过技术,包括编码、心理操纵、多轮升级、many-shot、tokenizer 漏洞和 Unicode 技巧等,直接绕过成功率均为 0%。绕过方法是将有害任务拆解为单独无害的子任务,用游戏模组、检测工程等合法软件语境重新包装,再由未受分类器保护的本地开源模型组装成可用的攻击代码。该管线在 10 个 MITRE ATT&CK 对齐的攻击类别中有 9 个生成了可工作的漏洞利用代码,仅 Defense (EDR) Evasion 一类因分类器在概念层面拦截而失败。
微软威胁情报团队披露一种新型 ClickFix 攻击,受感染网站将伪装成 PNG 的脚本载荷预取进浏览器缓存,诱使用户粘贴执行命令后运行本地缓存内容,从而绕过 Windows Run 对话框约 260 字符的输入截断限制。载荷为 VBScript,会枚举浏览器配置文件夹中名称以 "f_" 开头的文件,按字节长度匹配后将缓存条目复制为 t.vbs 并用 wscript.exe 执行,再经 PowerShell 多级下载 .NET 载荷注入 timeout.exe 窃取浏览器与设备凭据。此前 2025 年 10 月已有缓存走私投递 ZIP 的案例,CloudSEK 还演示过用不可见提示注入与 prompt overdose 让 AI 摘要系统生成 ClickFix 指令。
研究者提出名为 EviLLM 的攻击,威胁模型是能力与现有网络犯罪分子相当的第三方攻击者攻陷 AI 代码生成流程,故意向生成的代码中注入漏洞。该攻击实现了两个实例,均只需通过被入侵的账号或浏览器访问底层 LLM,即可注入 13 类 CWE 漏洞;可行性研究显示这两种攻击向量已被用于实施多种现有网络攻击。用户研究中,两个实例注入的漏洞分别有 8 人中的 7 人和 13 人中的 10 人未察觉,21 名参与者中有 13 人很少或从不考虑此类攻击风险。
研究者提出 CRIME 框架,指出单独通过安全审查的良性 Agent 技能在组合后仍可诱发恶意行为,因为组合会扩展智能体的能力空间。CRIME 先用 Malicious Plot Casting 模块把目标恶意行为拆解为互补需求,从公开技能库中筛选合适的良性技能组合;对无法直接实现的组合,Runaway Reaction Steering 模块借助执行反馈迭代调整技能,同时要求每个技能在单独审查下仍属良性。组合随后进入 Skill Reaction Chamber 模块,在沙箱中执行并检查环境后果以判断目标行为是否发生,失败案例返回继续调整。研究者还构建了覆盖八类网络安全行为的 4000 个公开技能基准用于系统评估。
Mindgard 澄清其针对 Kimi 的越狱并非利用开放权重,而是仅通过面向普通用户的公开聊天机器人完成,该越狱可生成生物武器相关建议。研究者表示自己遵循一条个人规则,即把多数越狱限制在普通用户无需特殊技术知识即可复现的方法上,此次全程只使用语言说服,所用代码也由 Kimi 在对话中提供。研究者指出,开放权重模型通常更易受拒答向量消融影响,但本次并非如此。该事件已被 BBC、CBS、Fox News 等媒体报道,研究者认为越狱后的 AI 降低了获取有害信息的门槛,同时提高了所提供信息的质量。
研究考察了规避与投毒攻击同时作用于数据漂移检测器和恶意软件分类器时的效果,发现数据漂移检测器的独有特性会使针对恶意软件分类器的攻击在其上表现出不同行为。该工作揭示了攻击在两者组合场景下的作用机制差异。
研究提出一种面向 Windows 恶意软件检测的复合 AI 系统评估方法,在检测性能、计算开销与鲁棒性之间显式权衡,并引入系统级威胁模型,刻画攻击者利用不同程度知识绕过整个复合系统而非单个检测器。真实数据实验显示,该系统可缩短训练时间并提升响应速度,仅带来检测性能的轻微损失;知识越多的攻击者能构造更有效的对抗样本,降低系统响应能力,暴露出效率与鲁棒性之间的直接权衡。
研究者提出 ALIBI,一种针对前沿 LLM 恶意软件分析器的语义伪装攻击:在编译后的二进制中加入一小段不执行的只读区段,写入连贯但虚假的安全产品叙事,不改变导入表或可执行行为,从而把可疑证据重新包装成良性终端安全工具的预期行为。在 50 个恶意 PE 样本上,该载荷使 Gemini 2.5 Pro 把 35 个基线恶意样本中的 30 个翻转为良性;GPT-5.5 Pro 与 Claude Opus 4.7 即使保留判定标签,也出现明显严重度降级与置信度下降。攻击可迁移到 ELF 二进制,Gemini 在 40 个样本中翻转 16 个。验证引导的防御提示大致将良性判定减半,但仍有 42.9% 的恶意样本被判为良性。作者认为 LLM 恶意软件分析器需要来源校验,把已验证事实与攻击者可控声明区分开。
Zenity Labs 发布研究《It's Always DNS in Claude's Sandbox: From Data Exfiltration to a Bidirectional DNS Shell》,作者为 @_d1voy,展示在 Claude 沙箱中借助 DNS 实现数据外泄,并进一步建立双向 DNS shell。转发者 @p1njc70r 称其为 DNS C2,并称赞该工作。研究的具体攻击路径、受影响版本与成功率未在转发内容中给出。
It's been a while since @_d1voy published his last work, but a lot has been going on behind the scenes. Today @_d1voy shares his latest research: "It's Always DNS in Claude's Sandbox: From Data Exfiltration to a Bidirectional DNS Shell," live now on Zenity Labs.
我琢磨着怎么对 Safari 这个有趣的行为做模糊测试。首先,代码检查标记是否被消费,只在未被消费时才递增计数器。第二段代码则把标签包进一个 select 里,看代码是否执行。如果标签被消费并被中和,计数器就是 1。
Mindgard 披露,中国 AI 公司 Moonshot 的 Kimi AI 存在越狱漏洞,仅需两行提示词即可让模型输出沙林毒气配方、核武器与暗杀方案等 CBRN 危险信息。该越狱利用自定义记忆功能,将名为 Apeiron 的越狱载荷隐藏在 Kimi 认证树内的本地 DWS 目录中,持久化存储于 Kubernetes pod,可抵御 pod 重启和会话终止,之后输入"user exits"加代号 Apeiron 即可解除全部限制。Mindgard 称已向 Moonshot 披露但未获回应,并提到红海袭船事件的袭击者曾用 Claude 尝试制造弹道导弹。
Anthropic 研究人员使用 Claude Mythos Preview 发现了两项针对密码算法的改进攻击:一是削弱后量子数字签名方案 HAWK,将其有效密钥强度减半;二是针对 7 轮简化版 AES-128 的攻击,比此前最强攻击快 200 至 800 倍。两项结果均不影响现有生产系统,HAWK 仍只是 NIST 第三轮候选方案,AES 攻击只针对 10 轮中的 7 轮。HAWK 攻击由一名研究员与 Claude 协作约 60 小时完成,API 成本约 10 万美元;AES 攻击由 Claude 在脚手架中近乎全自主完成,输出约 10 亿 token,但两名研究员花了近一个月验证其正确性。此外 Claude 还发现了针对 13 轮 LEA 的实用密钥恢复攻击,以及 6 轮 Serpent-128 的全密钥恢复攻击。
推荐理由Anthropic 用 Claude 自主发现 HAWK 与 AES 的数学缺陷,并公开攻击成本与验证耗时,可观察前沿模型的密码分析能力边界。
FAR.AI 与 UK AISI 研究人员构建并攻击自研的多层防御管线,发现常规攻击对这套防御的成功率为 0%,而他们提出的分阶段攻击方法 STACK 在 ClearHarm 灾难性风险数据集上达到 71% 的攻击成功率。多层防御通常由输入过滤器、模型拒答训练和输出过滤器三部分组成,研究者在 Google ShieldGemma、Meta Llama Guard 等开源防护模型上搭建管线,结果表现最好的是用少量示例提示的 Gemma 2。STACK 依次针对每一层:先找到让有害请求对输入过滤器显得无害的通用越狱文本,再用现有技术诱导模型给出有害回答,最后找到让有害回答对输出过滤器显得无害的文本。71% 的成功率依赖攻击者能观察到是哪一层拦截了请求,在完全黑盒的迁移攻击场景下成功率降至 33%。
推荐理由FAR.AI 与 UK AISI 合作构建分层防御管线并自研 STACK 分阶段攻击,给出 71% 与 0% 的对比数据,可供部署多层护栏的团队参考。
FAR.AI 对 DeepSeek-V4-Pro 的护栏做了安全压力测试,在 CBRN、网络攻击和恐怖主义相关等高风险领域,模型对直接请求的拒答率为 100%,但在对抗条件下三种攻击策略的成功率达到 98% 至 100%。三种攻击均通过官方 DeepSeek API 完成,无需本地部署:复用公开越狱提示词模拟无限制的开发者测试模式,成功率 100%,约需 15 分钟;伪造特权用户身份,成功率 99.6%,约需 45 分钟;在模型回复中预填伪造的安全评估,成功率 99.6%,约需 150 分钟。被越狱后模型在生物、化学和编程任务上仍保持接近基线的能力,能生成细节充分的威胁场景回答。
推荐理由FAR.AI 用三种攻击策略测出 DeepSeek-V4-Pro 的拒答在对抗条件下几乎全部失效,并指出旧版越狱可直接迁移。
FAR.AI 展示了通过把恶意请求包装成仓库规范来绕过 Qoder 网络安全护栏的越狱方法,模型随后输出了完整的攻击工具链。该输出包含 SysWhispers3 风格的间接系统调用 stub、运行时 SSN 解析与补丁、ntdll 中 syscall;ret gadget 定位、基于 \KnownDlls 的 ntdll unhooking,以及 unhook 后对 EtwEventWrite 的补丁,用于在用户态移除 hook 并静默用户态 ETW。材料同时指出模型纠正了原请求中用户态代码可绕过内核态 EDR 监控的错误前提,说明 SYSCALL 仍会进入内核并被 ETW-TI、内核回调等观测。文中给出构建与执行步骤、预期输出示例,以及面向防御方的检测说明和清理流程。
推荐理由材料给出完整的 SysWhispers3 间接系统调用工具链与可复现步骤,红队与防御方可据此对照检测遥测。
研究者提出“能力洗白”(capability laundering)攻击:较弱的未对齐模型把有害任务拆成看似无害的子问题,分别独立咨询更强的对齐模型,再在本地组合答案,因此没有任何单次回复本身构成有害任务。作者以 GPT-5.5、Claude Opus 4.8 和 Grok-4.3 为顾问、四个本地模型为编排者,在 CyBench、BountyBench 和有害 CBRN 请求上衡量咨询带来的能力提升。CyBench 上,Gemma-4-31B 借助 GPT-5.5 和 Opus 分别解出 8/14、7/9 个候选任务,Gemma-4-12B 只有 2/21、4/15;BountyBench 上效果因编排者而异,Muse-Glimmer-30B 一个也没解出。CBRN 方面,咨询把 Gemma-4-31B 在一条假设攻击链八个步骤上的平均评分从 62.3 提高到 83.1(满分 100)。作者认为,拒绝有害任务并不能阻止前沿能力经由许多各自被允许的交互转移和组合。
推荐理由论文把有害任务拆成多个看似无害的子问题分别咨询强对齐模型、再在本地拼装,并在 CyBench 和 CBRN 测试上量化了这种能力转移,说明只按单次交互评估安全会漏掉这一缺口。
研究提出 ClaimMirage 现象:被检查的域名通过 not-phishing、official 等简短自我声明,无需显式提示注入指令即可改变大语言模型对该域名的威胁判断。作者在 64 个品牌、5 个 LLM 上分析了 622,080 次判断,将十种声明与长度和连字符匹配的对照项在构造的品牌类域名中比较。结果显示自我声明会大幅降低或提高告警,取决于模型和输入设置:在一种设置下,可注册域名中的风险否认词使告警下降 45.3 个百分点,即使提示中已给出可能被冒充的品牌及其官方域名作对照;若缺少这些参照,同一模型在该位置的背书类词使告警上升 65.6 个百分点。提供参照和组件标注能消除部分告警下降,但另一些仍然存在甚至更大。
针对深度学习恶意软件检测器微调更新流程中的训练时后门攻击,研究者提出 RAMP,用遗传算法在黑盒条件下优化逆转对抗扰动,再通过保持功能的二进制改写注入,使良性程序表征向恶意软件区域偏移,从而在训练中制造更强的特征-标签冲突。实验显示 RAMP 在低投毒比例下显著优于仅用触发器的基线,且不损失干净数据准确率,并可与更先进的触发器设计结合。该工作已被 Inscrypt 2026 接收。
安全研究者演示了借助 GitHub issue 中的间接提示注入劫持 ChatGPT Codex,把它接入 C2 服务器变成 ZombAI 僵尸网络智能体。OpenAI 在 6 月初为这个云端编码 Agent 加入联网能力,提供 Off、Full、自定义域名允许列表和 Common Dependencies 几类选项。Common Dependencies 允许列表包含 71 个域名,其中 azure.com 可被攻击者利用,在 Azure 上设置以 cloudapp.azure.com 结尾的 DNS 名来托管 C2。攻击链中,被恶意指令劫持的 Codex 会下载并执行植入物,泄露环境变量、源码与算力。
Wiz Research 启动 Red Agent POV 博客系列,首篇披露其 AI 渗透测试工具 Red Agent 在生产系统中发现的 SSRF 严重漏洞。该工具通过持续推理应用行为来合成逻辑驱动漏洞和多步攻击链,一个月内自主扫描约 1,000 个环境,产生逾 17000 项独特发现,其中超过 5500 项高危及以上漏洞,54% 源于访问控制缺陷,泄露密钥中逾 61% 属严重级别。
Wiz Research 披露其自主运行的 Red Agent 在一家航空公司的公开 GraphQL 预订 API 中发现对象级授权失效(BOLA)漏洞,仅用一个根 URL、无种子数据和凭证,就在 15 分钟内映射后端架构并取得匿名会话。 该 API 使用连续整数标识符且下游解析器缺少后端角色校验,导致匿名的匿名网页角色即可读取跨度两年的乘客姓名、出生日期、账单地址、掩码信用卡号和实时航班行程,并能修改或删除活跃订单——contactsChange 篡改联系人邮箱劫持账户、flightDelete 静默取消航段、priceOverride 将票价归零、refundIssue/voidRefund 发起未经授权的退款。
Wiz Threat Research 在 LiteLLM、Flowise、LangChain、Langflow、ChromaDB、Ollama 等 AI 与 ML 服务上部署蜜罐,90 天遥测中观察到持续攻击,并将其归纳为三类模式:利用面向互联网的 MCP 服务器实现远程代码执行、针对 AI 智能体框架的盲提示注入,以及适配 AI 基础设施内部结构的后渗透。
推荐理由Wiz 用 90 天蜜罐遥测还原了针对 AI 基础设施的三类攻击链,并给出可对照排查的 IOC 与加固清单。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建了一个原型 AI 蠕虫,利用被入侵机器的 GPU 运行开源权重 LLM 进行推理,自行发现漏洞并发起定制攻击,证明自我维持的 AI 网络威胁已非理论。