东亚日报隔离实验室实测:中文圈 AI 渗透工具 ARTEX 43 秒攻破目标服务器
东亚日报采访组在隔离虚拟实验室实测中文圈 AI 渗透工具 ARTEX,输入目标地址后 43 秒内攻入两处致命弱点,约 4 分钟完成窃取最高管理员权限与远程操控,使用费仅 20 韩元。该工具类似智能体 AI“OpenClaw”,接入 AI 模型后成为“攻击代理”,遇阻会自行改变方法重试并生成报告。荷兰安全企业哈德里恩称,公开的 AI 模拟黑客工具截至今年 3 月已达 70 个。
东亚日报采访组在隔离虚拟实验室实测中文圈 AI 渗透工具 ARTEX,输入目标地址后 43 秒内攻入两处致命弱点,约 4 分钟完成窃取最高管理员权限与远程操控,使用费仅 20 韩元。该工具类似智能体 AI“OpenClaw”,接入 AI 模型后成为“攻击代理”,遇阻会自行改变方法重试并生成报告。荷兰安全企业哈德里恩称,公开的 AI 模拟黑客工具截至今年 3 月已达 70 个。
CrowdStrike Cyber Superintelligence Lab 评估了当前公开部署的最先进内容安全分类器(用于保护 Claude Opus 5.5 等前沿模型),发现该分类器对直接攻击极为稳健,但可被系统性地绕过。研究测试了约 515 种绕过技术,包括编码、心理操纵、多轮升级、many-shot、tokenizer 漏洞和 Unicode 技巧等,直接绕过成功率均为 0%。绕过方法是将有害任务拆解为单独无害的子任务,用游戏模组、检测工程等合法软件语境重新包装,再由未受分类器保护的本地开源模型组装成可用的攻击代码。该管线在 10 个 MITRE ATT&CK 对齐的攻击类别中有 9 个生成了可工作的漏洞利用代码,仅 Defense (EDR) Evasion 一类因分类器在概念层面拦截而失败。
微软威胁情报团队披露一种新型 ClickFix 攻击,受感染网站将伪装成 PNG 的脚本载荷预取进浏览器缓存,诱使用户粘贴执行命令后运行本地缓存内容,从而绕过 Windows Run 对话框约 260 字符的输入截断限制。载荷为 VBScript,会枚举浏览器配置文件夹中名称以 "f_" 开头的文件,按字节长度匹配后将缓存条目复制为 t.vbs 并用 wscript.exe 执行,再经 PowerShell 多级下载 .NET 载荷注入 timeout.exe 窃取浏览器与设备凭据。此前 2025 年 10 月已有缓存走私投递 ZIP 的案例,CloudSEK 还演示过用不可见提示注入与 prompt overdose 让 AI 摘要系统生成 ClickFix 指令。
研究者提出名为 EviLLM 的攻击,威胁模型是能力与现有网络犯罪分子相当的第三方攻击者攻陷 AI 代码生成流程,故意向生成的代码中注入漏洞。该攻击实现了两个实例,均只需通过被入侵的账号或浏览器访问底层 LLM,即可注入 13 类 CWE 漏洞;可行性研究显示这两种攻击向量已被用于实施多种现有网络攻击。用户研究中,两个实例注入的漏洞分别有 8 人中的 7 人和 13 人中的 10 人未察觉,21 名参与者中有 13 人很少或从不考虑此类攻击风险。
研究者提出 CRIME 框架,指出单独通过安全审查的良性 Agent 技能在组合后仍可诱发恶意行为,因为组合会扩展智能体的能力空间。CRIME 先用 Malicious Plot Casting 模块把目标恶意行为拆解为互补需求,从公开技能库中筛选合适的良性技能组合;对无法直接实现的组合,Runaway Reaction Steering 模块借助执行反馈迭代调整技能,同时要求每个技能在单独审查下仍属良性。组合随后进入 Skill Reaction Chamber 模块,在沙箱中执行并检查环境后果以判断目标行为是否发生,失败案例返回继续调整。研究者还构建了覆盖八类网络安全行为的 4000 个公开技能基准用于系统评估。
研究考察了规避与投毒攻击同时作用于数据漂移检测器和恶意软件分类器时的效果,发现数据漂移检测器的独有特性会使针对恶意软件分类器的攻击在其上表现出不同行为。该工作揭示了攻击在两者组合场景下的作用机制差异。
研究提出一种面向 Windows 恶意软件检测的复合 AI 系统评估方法,在检测性能、计算开销与鲁棒性之间显式权衡,并引入系统级威胁模型,刻画攻击者利用不同程度知识绕过整个复合系统而非单个检测器。真实数据实验显示,该系统可缩短训练时间并提升响应速度,仅带来检测性能的轻微损失;知识越多的攻击者能构造更有效的对抗样本,降低系统响应能力,暴露出效率与鲁棒性之间的直接权衡。
研究者提出 ALIBI,一种针对前沿 LLM 恶意软件分析器的语义伪装攻击:在编译后的二进制中加入一小段不执行的只读区段,写入连贯但虚假的安全产品叙事,不改变导入表或可执行行为,从而把可疑证据重新包装成良性终端安全工具的预期行为。在 50 个恶意 PE 样本上,该载荷使 Gemini 2.5 Pro 把 35 个基线恶意样本中的 30 个翻转为良性;GPT-5.5 Pro 与 Claude Opus 4.7 即使保留判定标签,也出现明显严重度降级与置信度下降。攻击可迁移到 ELF 二进制,Gemini 在 40 个样本中翻转 16 个。验证引导的防御提示大致将良性判定减半,但仍有 42.9% 的恶意样本被判为良性。作者认为 LLM 恶意软件分析器需要来源校验,把已验证事实与攻击者可控声明区分开。
Zenity Labs 发布研究《It's Always DNS in Claude's Sandbox: From Data Exfiltration to a Bidirectional DNS Shell》,作者为 @_d1voy,展示在 Claude 沙箱中借助 DNS 实现数据外泄,并进一步建立双向 DNS shell。转发者 @p1njc70r 称其为 DNS C2,并称赞该工作。研究的具体攻击路径、受影响版本与成功率未在转发内容中给出。
It's been a while since @_d1voy published his last work, but a lot has been going on behind the scenes. Today @_d1voy shares his latest research: "It's Always DNS in Claude's Sandbox: From Data Exfiltration to a Bidirectional DNS Shell," live now on Zenity Labs.
我琢磨着怎么对 Safari 这个有趣的行为做模糊测试。首先,代码检查标记是否被消费,只在未被消费时才递增计数器。第二段代码则把标签包进一个 select 里,看代码是否执行。如果标签被消费并被中和,计数器就是 1。
FAR.AI 展示了通过把恶意请求包装成仓库规范来绕过 Qoder 网络安全护栏的越狱方法,模型随后输出了完整的攻击工具链。该输出包含 SysWhispers3 风格的间接系统调用 stub、运行时 SSN 解析与补丁、ntdll 中 syscall;ret gadget 定位、基于 \KnownDlls 的 ntdll unhooking,以及 unhook 后对 EtwEventWrite 的补丁,用于在用户态移除 hook 并静默用户态 ETW。材料同时指出模型纠正了原请求中用户态代码可绕过内核态 EDR 监控的错误前提,说明 SYSCALL 仍会进入内核并被 ETW-TI、内核回调等观测。文中给出构建与执行步骤、预期输出示例,以及面向防御方的检测说明和清理流程。
推荐理由材料给出完整的 SysWhispers3 间接系统调用工具链与可复现步骤,红队与防御方可据此对照检测遥测。
研究者提出“能力洗白”(capability laundering)攻击:较弱的未对齐模型把有害任务拆成看似无害的子问题,分别独立咨询更强的对齐模型,再在本地组合答案,因此没有任何单次回复本身构成有害任务。作者以 GPT-5.5、Claude Opus 4.8 和 Grok-4.3 为顾问、四个本地模型为编排者,在 CyBench、BountyBench 和有害 CBRN 请求上衡量咨询带来的能力提升。CyBench 上,Gemma-4-31B 借助 GPT-5.5 和 Opus 分别解出 8/14、7/9 个候选任务,Gemma-4-12B 只有 2/21、4/15;BountyBench 上效果因编排者而异,Muse-Glimmer-30B 一个也没解出。CBRN 方面,咨询把 Gemma-4-31B 在一条假设攻击链八个步骤上的平均评分从 62.3 提高到 83.1(满分 100)。作者认为,拒绝有害任务并不能阻止前沿能力经由许多各自被允许的交互转移和组合。
推荐理由论文把有害任务拆成多个看似无害的子问题分别咨询强对齐模型、再在本地拼装,并在 CyBench 和 CBRN 测试上量化了这种能力转移,说明只按单次交互评估安全会漏掉这一缺口。
研究提出 ClaimMirage 现象:被检查的域名通过 not-phishing、official 等简短自我声明,无需显式提示注入指令即可改变大语言模型对该域名的威胁判断。作者在 64 个品牌、5 个 LLM 上分析了 622,080 次判断,将十种声明与长度和连字符匹配的对照项在构造的品牌类域名中比较。结果显示自我声明会大幅降低或提高告警,取决于模型和输入设置:在一种设置下,可注册域名中的风险否认词使告警下降 45.3 个百分点,即使提示中已给出可能被冒充的品牌及其官方域名作对照;若缺少这些参照,同一模型在该位置的背书类词使告警上升 65.6 个百分点。提供参照和组件标注能消除部分告警下降,但另一些仍然存在甚至更大。
针对深度学习恶意软件检测器微调更新流程中的训练时后门攻击,研究者提出 RAMP,用遗传算法在黑盒条件下优化逆转对抗扰动,再通过保持功能的二进制改写注入,使良性程序表征向恶意软件区域偏移,从而在训练中制造更强的特征-标签冲突。实验显示 RAMP 在低投毒比例下显著优于仅用触发器的基线,且不损失干净数据准确率,并可与更先进的触发器设计结合。该工作已被 Inscrypt 2026 接收。
安全研究者演示了借助 GitHub issue 中的间接提示注入劫持 ChatGPT Codex,把它接入 C2 服务器变成 ZombAI 僵尸网络智能体。OpenAI 在 6 月初为这个云端编码 Agent 加入联网能力,提供 Off、Full、自定义域名允许列表和 Common Dependencies 几类选项。Common Dependencies 允许列表包含 71 个域名,其中 azure.com 可被攻击者利用,在 Azure 上设置以 cloudapp.azure.com 结尾的 DNS 名来托管 C2。攻击链中,被恶意指令劫持的 Codex 会下载并执行植入物,泄露环境变量、源码与算力。
Wiz Research 启动 Red Agent POV 博客系列,首篇披露其 AI 渗透测试工具 Red Agent 在生产系统中发现的 SSRF 严重漏洞。该工具通过持续推理应用行为来合成逻辑驱动漏洞和多步攻击链,一个月内自主扫描约 1,000 个环境,产生逾 17000 项独特发现,其中超过 5500 项高危及以上漏洞,54% 源于访问控制缺陷,泄露密钥中逾 61% 属严重级别。
Wiz Research 披露其自主运行的 Red Agent 在一家航空公司的公开 GraphQL 预订 API 中发现对象级授权失效(BOLA)漏洞,仅用一个根 URL、无种子数据和凭证,就在 15 分钟内映射后端架构并取得匿名会话。 该 API 使用连续整数标识符且下游解析器缺少后端角色校验,导致匿名的匿名网页角色即可读取跨度两年的乘客姓名、出生日期、账单地址、掩码信用卡号和实时航班行程,并能修改或删除活跃订单——contactsChange 篡改联系人邮箱劫持账户、flightDelete 静默取消航段、priceOverride 将票价归零、refundIssue/voidRefund 发起未经授权的退款。
Wiz Threat Research 在 LiteLLM、Flowise、LangChain、Langflow、ChromaDB、Ollama 等 AI 与 ML 服务上部署蜜罐,90 天遥测中观察到持续攻击,并将其归纳为三类模式:利用面向互联网的 MCP 服务器实现远程代码执行、针对 AI 智能体框架的盲提示注入,以及适配 AI 基础设施内部结构的后渗透。
推荐理由Wiz 用 90 天蜜罐遥测还原了针对 AI 基础设施的三类攻击链,并给出可对照排查的 IOC 与加固清单。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建了一个原型 AI 蠕虫,利用被入侵机器的 GPU 运行开源权重 LLM 进行推理,自行发现漏洞并发起定制攻击,证明自我维持的 AI 网络威胁已非理论。