跳到正文

全部动态

今天还没有收录新动态

第 5 页更新的内容回到最新

8月20日周四
  1. Check Point Research · · 原文 80

    Check Point 逆向 Windows Defender BTR.sys 驱动,将其改造为内核操作原语

    Check Point 逆向 Windows Defender 的 Boot-Time Removal 驱动 BTR.sys,发现其通过注册表 Args 指向的 ADS 中 RC4 加密配置执行文件与注册表操作,无需漏洞或内存破坏即可在 Ring 0 执行任意操作。研究给出完整事务格式,包括 0xFEE1DEAD 魔数、版本 2、~CRC32 完整性校验和硬编码 256 字节 RC4 密钥,并发布 MIT 许可的 BTR_CLI 工具构造合法加密事务。利用该驱动在 Phase 1 的 Boot Bus Extender 组加载时机,可在用户态安全服务启动前删除 WdFilter.sys、MsMpEng.exe 等 Defender 二进制并绕过 Tamper Protection,测试覆盖 Windows 7 至 Windows 11 25H2。

    推荐理由完整逆向 Windows Defender 的 BTR.sys 驱动,展示如何用微软签名驱动在 Ring 0 执行任意文件与注册表操作,并给出 Sysmon 检测思路。

  2. Adversa AI · · 原文 76

    Adversa AI 披露 Cryptographic Context Injection 攻击:Grok 零点击泄露聊天记录,Gemini 被绕过安全策略

    Adversa AI 公开了一种名为 Cryptographic Context Injection 的攻击手法,把恶意指令封装成 AES-256-GCM 密文并诱导模型在自己的代码执行沙箱中解密,使解密后的指令以运行时输出的形式进入可信上下文,从而绕过静态护栏。在 xAI Grok 网页版聊天中,用户只需发出普通的“总结这个页面”请求,页面内嵌的加密 JSON 就会让 Agent 调用其联网导航工具,把用户名、粗略位置、订阅等级和整段对话历史拼进 URL 参数发往攻击者服务器,全程无点击、无确认、无警告。

    推荐理由Adversa AI 公开了一种把恶意指令藏进 AES 密文、借模型自身代码运行时解密的新型注入手法,并给出 Grok 零点击窃取聊天记录与 Gemini 绕过安全策略的复现结果。

  3. arXiv ·

    TempJail:通过字幕时间调度对大型视觉语言模型发起时序越狱攻击

    研究者提出 TempJail,一种黑盒视频越狱框架,通过构造与查询对齐的对话式字幕序列并优化其时间调度,利用大型视觉语言模型(LVLM)在时间维度上的脆弱性诱导出符合原始有害意图的回答。分析发现,越狱效果不仅取决于文本语义,还取决于其时间呈现方式,包括持续时长和时段分配;字幕因在真实视频中常见且可精确控制时间而不显突兀,被用作攻击媒介。在四个代表性 LVLM 和两个数据集上的实验显示,TempJail 在所有模型与数据集组合中取得最高攻击成功率,在 GPT-5 和 Gemini 3.5-Flash 上数据集平均 ASR 分别比最强基线高出 53 和 18 个百分点。论文共 8 页、4 张图。

  4. Datadog Security Labs · · 原文 76

    Datadog 分析 N4D Mesh Controller 恶意软件:滥用暴露的 MCP 服务器并投递 go-titan 代理

    Datadog Security Research 在隔离环境中执行了 N4D Mesh Controller 恶意软件的新样本,确认其通过暴露的 MCP 服务器实现凭据窃取、横向移动与持久化。该活动最早由研究者 German Fernandez 于 2026 年 6 月记录,新样本连接 209.99.186.235 并获取自称 33.8-go-titan 的第二阶段代理。攻击流程为扫描 MCP 端点、请求 tools/list 分类工具、通过 tools/call 调用 execute_command 等危险工具,再用 curl 或 wget 从 cdnorigin.net 等地址下载架构对应的代理。在 120 秒的断网运行中,代理发起 22,831 次连接尝试,覆盖 742 个目标 IP 和 37 个端口,且未接收控制器任务即开始扫描。

    推荐理由Datadog 在隔离环境中复现了 N4D 恶意软件对 MCP 服务器的自动化利用链,并给出可落地的检测规则与狩猎思路。

8月19日周三
  1. arXiv ·

    DAEI:针对噪声防护文本嵌入的反演攻击揭示隐私风险

    研究者提出 DAEI,一种去噪感知的嵌入反演流程,用于在只能观测到加噪嵌入、无法获得干净嵌入目标的条件下重建原始文本。作者先分析现有生成式反演方法在该设定下失效的原因,将其归结为双重噪声陷阱,再用残差去噪自编码器结合生成式文本反演,并借助 Stein 无偏风险估计以无监督方式训练去噪器,使其仅凭含噪观测即可去噪。实验显示 DAEI 相比现有生成式反演基线在 BLEU 上取得约 154% 的相对提升,token 级 F1 与 ROUGE-L 也提升 32% 至 60%。该结果对简单高斯扰动即可防止嵌入泄露敏感信息的普遍假设提出质疑。论文 11 页、3 张图,已被 IEEE ICDM 2026 接收。

8月18日周二
  1. arXiv ·

    LeakGauge:用行为探针在解码前检测上下文泄露攻击信号

    研究者提出 LeakGauge,通过在输入后附加一个探测后缀并映射其 prefill token 概率,在解码前给出上下文泄露的攻击风险分数。作者发现,直接使用机密内容初始 token 的探针不如内容无关、直接表述泄露行为的探针稳健。在包括 GLM-5.2(753B)和 Kimi-K3(2.8T)在内的 11 个 LLM 上,LeakGauge 对未见攻击的 AUROC 达到 0.944 至 0.996,且在内容换语言或攻击从逐字泄露转为语义泄露时信号保持稳定。通过激活引导干预,作者进一步表明该风险分数对模型内部与泄露相关的方向敏感。该检测器额外参数少于 0.5K,附加延迟为 10.34 ms,代码已公开。

  2. Adversa AI · · 原文 78

    Adversa AI 盘点针对 AI 智能体的十起零点击攻击

    Adversa AI 汇总了十起针对 AI 智能体的零点击攻击,受害者在正常工作流中不点击、不授权,仍会丢失数据或机器控制权。十起中有九起出现在已商业发售的产品里,涉及 Microsoft 365 Copilot、Cursor、Claude Code、Gemini CLI、Perplexity Comet、ChatGPT 等;三起获得 CVE,评分多在 9.3 以上,其余七起或被静默修补,或被厂商以超出威胁模型为由拒绝。共同机制是不可信内容经正常检索进入模型上下文,模型无法区分内容与指令,随后由智能体自身权限执行攻击;外泄通道从图片预取、厂商云端服务端 HTTP,逐步转向浏览器导航、Outlook 正常发信和开发者 shell。

    推荐理由梳理十起零点击攻击的入口、外泄通道与厂商处置差异,可对照检查自家 Agent 的检索信任边界与出站通道。

8月17日周一
  1. Wiz Research ·

    Wiz Red Agent 借 GitHub Copilot 辅助 PR 中的缺陷进入 Snowflake 内部 Jira

    Wiz Red Agent 独立发现并利用了一个 GitHub Actions 注入漏洞,该漏洞被 GitHub Advanced Security 漏检,Red Agent 借此验证了对 Snowflake 内部 Jira 敏感数据的访问权限并评估了影响范围,全程无需人工干预,距漏洞上线仅五天。该事件源于一个由 GitHub Copilot 辅助生成的 PR 中引入的缺陷。

  2. arXiv · · 原文 76

    JailbreakSkill:用可复用可演化技能扩展自动化红队

    上海 AI 实验室等机构提出 JailbreakSkill,把攻击方法封装为可复用、可演化的技能,用于扩展自动化红队。框架将技能分为改写技能、失败分析技能和演化技能三类,由规划器通过统一接口选择与排序;Stage 1 用风险条件 UCB 扫描初始 16 个改写技能并记录失败轨迹,Stage 2 对未解决样本做失败诊断,通过精炼、组合或发现生成新改写技能并回填技能库。在 AdvBench 与 HarmBench 上,技能演化使宏平均 ASR 分别提升 17.5 和 13.4 个百分点,其中对 GPT-5.4 在 AdvBench 上提升 48.6 个百分点,并产生把直接请求改写为未完成文档补全任务等新策略。部分演化技能无需额外适配即可迁移到未见提示词和目标模型,代码已开源。

    推荐理由把攻击方法封装成可复用、可演化的技能库,并给出在 AdvBench 与 HarmBench 上的 ASR 提升幅度,红队工程化可参考。

8月12日周三
  1. Simon Willison(提示注入) · · 原文 76

    论文披露从专有 LLM API 窃取加密思维链的方法

    一篇论文发现 Anthropic、OpenAI 和 Google 返回给客户端的加密思维链块可在不同会话、用户和模型间重放,把前沿模型的推理轨迹喂给同族较弱模型并越狱后,即可还原出强模型的隐藏推理明文。

    推荐理由论文披露加密思维链块可在同族模型间重放并越狱还原,还衍生出借思维链实施提示注入的新变体。

8月10日周一
  1. Failure-First ·

    免训练概念定位方法提升 ViT 对文字排版攻击的鲁棒性

    Liu 等人的研究提出免训练方法,定位并抑制 Vision Transformer 中导致文字排版攻击的特定模块,从而提升模型对图像内干扰文字的鲁棒性。该方法基于线性表示假设,通过随机采样在 MHSA 瓶颈的低维子空间搜索与词汇概念对齐的“获奖向量”,并用基于梯度的归一化文本归因分数 nTAS 定位高脆弱性注意力头。干预方式有两种:在 CLIP 类骨干中重加权 patch token 影响,在缺少 class token 的 LVLM 中将脆弱模块输出置零。

8月7日周五
  1. arXiv · · 原文 82

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    研究者提出 SynChain,一种自合成攻击范式,通过持久化感知的定向 SFT 让被污染的计算机使用 Agent 在正常任务中生成看似无害但携带潜伏载荷的技能或记忆条目,之后作为可信上下文重新加载,无需新的外部恶意输入即可触发。作者构建了 CuaChain 数据集,包含 30 条良性任务链和隐私泄露、权限篡改、未授权写入三类攻击目标。在 OpenClaw、Codex 和 Claude Code 三种框架、四种防御设置下,SynChain 在 Chain-1 平均攻击成功率超过 93%,Chain-2 仍高于 72%,显著优于改造后的 SkillJect 和 DemonAgent 基线。随着链长增加攻击效果下降,Chain-3 降至 26.57%,Chain-5 仅 1.11%,作者将其归因于记忆摘要和上下文截断形成的信息瓶颈。

    推荐理由论文提出让被污染模型在正常流程中自造带毒技能并跨任务复活的攻击链,并给出三种 Agent 框架下的成功率与防御失效情况。

8月5日周三
  1. arXiv ·

    面向良性用途的对抗攻击:视觉内容全生命周期主动防护综述

    一篇综述将数据所有者、创作者、平台或审计方主动施加扰动与结构化信号以干扰未授权自动化、支持事后追责的做法称为"面向良性用途的对抗攻击",并梳理了沿视觉资产生命周期分布的五个研究方向:分享阶段的隐私过滤器、针对未授权训练不可学习样本、防恶意编辑或模仿的生成式防护、用于访问控制的对抗验证码,以及传播后的来源溯源机制。作者按可迁移性、自适应性和部署就绪度统一评估这五类方法,发现多数防护仍主要针对静态或弱自适应对手验证,受控基准之外的证据依然稀缺。

8月4日周二
  1. Cisco Talos(AI) · · 原文 74

    Cisco Talos 分析攻击者如何利用 AI 开发恶意工具并绕过护栏

    Cisco Talos 通过分析云端 AI 模型留下的提示词日志,梳理出攻击者利用 AI 的三类活动:充当恶意软件工程师、放大犯罪运营规模、加速漏洞研究与披露。Talos 称护栏基本未起到预期作用,攻击者大多只用简单话术就让模型配合,例如声称自己拥有目标设备、把任务包装成 CTF 或漏洞赏金、把风险操作拆分到多个会话和文件中,以及用中性动词替代明显的恶意措辞。案例包括一名技术水平有限的攻击者借助模型开发 DDoS 工具并控制近 2000 台 Android TV;一名操作者让 AI 充当主力开发者,搭建批量邮件验证平台并处理 DKIM 失败、退信统计异常等故障;还有操作者用 AI 把公开的 React2Shell 研究扩展成凭据窃取流水线,目标列表含 9180 个主机。

    推荐理由Talos 从提示词日志还原出攻击者用 AI 开发恶意工具、绕过护栏的完整链路,并给出护栏失效的具体手法。

8月3日周一
  1. Failure-First ·

    Event-VLA:面向鲁棒视觉-语言-行动模型的行动条件化事件融合

    针对当前 VLA 模型依赖帧基 RGB 传感器、在光照突变与运动模糊下易发生分布外失效的问题,Liu 等人提出 Event-VLA,将异步事件相机流作为互补观测引入机器人操控策略。该方法通过 Physical Residual Event Integration(PREI)把事件历史分解为瞬时、显著、持续三通道残差图,并以门控交叉注意力加查询引导路由接入冻结语义主干之外的动作通路,辅以一个预测未来事件的辅助头做正则化。在 LIBERO 及三级光照退化的 LIBERO-Cross(LL-Mild、LL-Dark、LL-Severe)上该框架提升了抗退化能力,但仍会在弱对比导致事件激活不足的场景中失败。

  2. Datadog Security Labs · · 原文 74

    Datadog 披露 Codex 与 Claude Code 在首次提示词前的代码执行路径

    Datadog Security Labs 发现,在编码智能体中信任一个仓库后,仓库控制的代码可能在用户发出第一条提示词前就已运行。在 Codex 中,项目级 MCP 配置(.codex/config.toml 中的 mcp_servers)会让 Codex 启动攻击者控制的本地进程,无需用户交互或调用该服务器;Codex 0.122.0 起不再加载不受信任项目的 hooks 与执行策略,0.129.0 起对托管配置外的命令 hook 定义做哈希并要求审查,0.131.0 加入完整启动审查界面,但只有命令 hook 路径会获得第二次信任审查。在 Claude Code 中,.claude/settings.json 可定义会话环境变量,通过把 PATH 指向项目内目录,Claude 启动时自动执行的 Git 探测会运行仓库中的 git 包装脚本,该脚本还能转调真实 git 使流程正常继续。

    推荐理由文章给出 Codex 与 Claude Code 在项目信任后、首次提示词前的两条自动代码执行路径,并附可复现的检测命令。

7月31日周五
  1. Adversa AI · · 原文 78

    Adversa AI 实测八款开源 Agent 技能扫描器,恶意技能全部绕过

    Adversa AI 用真实攻击载荷实测八款开源 Agent 技能扫描器(针对 Claude Code 等加载的 SKILL.md、agent manifest 与 MCP 配置),恶意技能全部通过,包括当前 OASB 排行榜第一的 HMA。绕过原因各异:六款可被改写或混淆绕过,一款几乎不做检查,一款的判定文件本身可被注入指令。共同缺陷是缺少前端处理,所有扫描器匹配文件字节而非实际执行字节,没有一款会解码编码载荷后重跑完整规则集,也没有一款在命令库运行前做 Unicode 归一化。

    推荐理由对八款开源 Agent 技能扫描器的实测绕过矩阵,并给出可对照的误报率数据,适合评估技能市场准入控制的人参考。

7月30日周四
  1. Simon Willison(提示注入) · · 原文 78

    研究者披露针对 Microsoft Word 的自我复制提示注入蠕虫

    Håkon Måløy 发现一种针对 Microsoft Word 的提示注入新变体,可升级为自我复制的蠕虫。攻击者在文档中埋入隐藏指令,当该文档被 Copilot for Word 用作素材时,Copilot 可能把指令当作请求的一部分,改动正在起草或编辑的文档,并把隐藏指令复制进新文档,使其成为新的传播载体。

    推荐理由材料给出一种可自我复制的提示注入变体,说明文档在 Copilot 工作流间传播指令的路径,可帮助评估办公场景的注入面。

7月28日周二
  1. Wiz Research · · 原文 80

    Wiz Research 披露暴露在公网的 MCP 服务器风险

    Wiz Research 扫描发现,MCP 已出现在 80% 的云环境中,约六分之一的环境至少暴露一个 MCP 服务器,其中部分由财富 500 强公司运行且完全无需认证。约 70% 的暴露服务器会向匿名调用者返回完整工具目录,约 42% 在调用工具时返回真实数据,约 10% 暴露敏感后端;少数主机可经 SSRF 访问云元数据端点并拿到临时凭证。风险分为敏感数据访问、写入与删除权限、代码执行与服务器端网络访问、直接泄露凭证四类,其中一台服务器无需登录即可返回某人的退休账户余额,另有 BI 平台允许匿名枚举并查询所有已连接数据库。

    推荐理由Wiz Research 实测扫描暴露在公网的 MCP 服务器,给出各类风险占比与真实案例,可据此排查自家部署。

7月17日周五
  1. Adversa AI ·

    用 AI 红队智能体通关 GitHub Secure Code Game 的 ProdBot 挑战

    Adversa AI 的 AI 红队智能体自主通关了 GitHub 开源安全训练游戏 Secure Code Game 第四季的 ProdBot 智能体赛道,五关全部拿到 flag,且获胜输入均不含越狱词汇。该挑战每关为 ProdBot 增加一项能力(沙箱、Web、MCP、Skills+Memory、多智能体),对应路径遍历、过度授权工具、污染策略存储、混淆代理等具体利用方式。作者强调这只是教学靶场的定性经验,并非对生产护栏的通用绕过,也不构成任何模型鲁棒性的测量。

7月16日周四
7月15日周三
  1. Simon Willison(提示注入) ·

    研究者利用嵌套链接绕过 Claude web_fetch 防护,泄露用户隐私数据

    Ayush Paul 发现 Claude web_fetch 工具的一个漏洞,可绕过其数据外泄防护。该工具原本只允许访问用户自己输入的 URL 或 web_search 返回的链接,但此前也允许访问已抓取页面中嵌入的链接,攻击者据此搭建蜜罐站点,诱导 Agent 逐字母浏览嵌套生成的链接,从而提取出用户姓名、所在城市和雇主名称。

  2. Wiz Research ·

    Wiz Red Agent 发现 B2B 平台数据 API 付费墙绕过漏洞,600M+ 联系人信息可免费获取

    Wiz 的自主 Red Agent 在一家领先 B2B 平台的数据 API 中发现授权绕过漏洞:免费账户在搜索请求中注入单个客户端可控布尔参数(如 unmaskContactData),即可绕过积分付费机制,明文获取 600M+ 商业邮箱、135M+ 已验证直线电话及约 50% 记录中的个人邮箱。该漏洞源于后端信任客户端传入的 flag 而未校验用户权限,属于典型业务逻辑缺陷,传统 SAST/DAST 工具难以检出。平台安全团队在收到报告后 2 小时内完成修复。

  3. Adversa AI · · 原文 80

    Adversa AI 披露 Cursor 深链漏洞 DeepJack:伪装 PR 审查链接可安装恶意 MCP 服务器并远程执行代码

    Adversa AI 披露 Cursor 的 cursor:// 深链漏洞 DeepJack,攻击者伪装成队友发送一条“审查 PR”链接,点击并确认后即可安装攻击者控制的 MCP 服务器,以受害者账号执行未沙箱命令。攻击有两个变体:一是把 mcp/install URI 双重 URL 编码后塞进 pr-review 端点的 url 参数,Cursor 不会递归解码或重新校验该参数;二是安装对话框用单行文本框渲染命令,攻击者用大量制表符把恶意尾部(如 & /c start curl attacker.com)顶出屏幕,用户只看到 calc 之类的无害命令。

    推荐理由披露 Cursor 的 cursor:// 深链可借伪装成 PR 审查的链接安装恶意 MCP 服务器并执行未沙箱命令,附跨 Agent 深链能力对照表。

7月8日周三
  1. Wiz Research · · 原文 84

    Wiz 披露 GhostApproval 漏洞:六款 AI 编码助手存在符号链接信任边界缺陷

    Wiz Research 披露名为 GhostApproval 的漏洞模式,影响 Amazon Q Developer、Anthropic Claude Code、Augment、Cursor、Google Antigravity 和 Windsurf 六款 AI 编码助手。攻击者构造含符号链接(CWE-61)的恶意仓库,诱使 Agent 将文件写入工作区之外,例如把攻击者 SSH 公钥写入 ~/.ssh/authorized_keys,从而获得持久免密访问甚至远程代码执行。

    推荐理由Wiz 披露六款 AI 编码助手共有的符号链接信任边界缺陷,并给出各厂商修复与拒绝的处置差异,可供评估 Agent 文件写入权限的团队参考。

7月2日周四
  1. Trail of Bits Blog · · 原文 80

    GPT-5.5-Cyber 一天内为 zlib 搭建模糊测试实验室

    Trail of Bits 在 Patch the Planet 项目中让 GPT-5.5-Cyber 通过 Codex 的 /goal 命令为 zlib 构建模糊测试活动,一天内完成了以往需数周的工作。模型自行判断静态审查价值有限,转而搭建动态测试工具,使用 ASan 和 UBSan 构建、复用边界测试作为种子语料,并针对 inflate、inflateBack、uncompress2、gzFile、MiniZip 等十余个入口编写 C/C++ harness,还利用 INFLATE_STRICT 等编译期变体触及默认构建隐藏的代码。其最成功的 harness 在操作系统背压构造的有效 gz* 状态下发现了漏洞。

    推荐理由Trail of Bits 记录了 GPT-5.5-Cyber 一天内为 zlib 搭建模糊测试实验室的过程,展示了前沿模型在漏洞挖掘上的自动化能力与报告纪律要求。

6月30日周二
  1. Adversa AI · · 原文 88

    Adversa AI 披露 GuardFall:开源 AI 编码 Agent 的通用 shell 注入漏洞

    Adversa AI 披露名为 GuardFall 的通用 shell 注入漏洞类别,指出基于原始命令字符串做模式匹配的护栏无法建模 bash 的展开行为,因而在完全启用且配置正确时仍可被绕过。研究覆盖 11 个开源编码与计算机操作 Agent(合计约 548,000 GitHub star),其中 10 个的 agent 到 bash 边界可被利用,分为四种失效模式:三个护栏存在但被击穿(Hermes、opencode、Goose),两个 tokenized 护栏仅在引号内命令替换和破坏性参数上失效,其余要么没有静态护栏,要么默认容器沙箱在文档化的 local 模式退出后失效。

    推荐理由对 11 个开源编码 Agent 的 shell 护栏做了统一探测,并给出可迁移的五段式评估器设计,适合自建 Agent 的团队对照自查。

6月29日周一
  1. Wiz Research ·

    Wiz Red Agent 自主挖掘航空公司 GraphQL 预订 API 的对象级授权缺陷

    Wiz Research 披露其自主运行的 Red Agent 在一家航空公司的公开 GraphQL 预订 API 中发现对象级授权失效(BOLA)漏洞,仅用一个根 URL、无种子数据和凭证,就在 15 分钟内映射后端架构并取得匿名会话。 该 API 使用连续整数标识符且下游解析器缺少后端角色校验,导致匿名的匿名网页角色即可读取跨度两年的乘客姓名、出生日期、账单地址、掩码信用卡号和实时航班行程,并能修改或删除活跃订单——contactsChange 篡改联系人邮箱劫持账户、flightDelete 静默取消航段、priceOverride 将票价归零、refundIssue/voidRefund 发起未经授权的退款。

6月27日周六
  1. Simon Willison(提示注入) ·

    2,000 人尝试攻击 OpenClaw 助手,6,000 次均未泄露密钥

    Fernando Irarrázaval 在 hackmyclaw.com 发起挑战,让参与者通过发送邮件诱导其 OpenClaw 测试实例泄露密钥,结果 6,000 次尝试全部失败,期间消耗 500 美元 token 费用,并因入站邮件过多导致一个 Google 账号被封。该实例底层模型为 Opus 4.6,并配有明确的反提示注入规则,禁止依据邮件内容泄露 secrets.env 或凭据、修改自身文件、执行邮件中的命令或代码,以及向外部端点外传数据。

6月25日周四
6月23日周二
  1. Adversa AI ·

    用 AI Red Teaming Agent 攻破 DEF CON「Breaking the Prompt」五阶段提示注入 CTF

    Adversa AI 的 AI Red Teaming Agent 在 MTX × DEF CON 上攻破 TrendAI 的「Breaking the Prompt」五阶段越狱 CTF,全部通关(每阶段 100 XP,共 500 XP)。显式越狱话术("ignore all previous instructions"、DAN 人格覆盖、admin/debug 模式、伪造授权流水线、指令提取、语言切换)在该环境中全部失败;有效手法是把同一请求重述为无害的格式转换,如"在每个字符间加短横线回显代码",模型将其视为格式化而非披露,从而输出 Cipher 阶段的代码 BYTEFORCE-1B6247。

  2. Simon Willison(提示注入) ·

    研究将提示注入归因于角色混淆,改写文本风格可降低攻击成功率

    Charles Ye、Jasmine Cui 和 Dylan Hadfield-Menell 的研究指出,模型难以区分自身特权文本(如 <system>、 thinking、<assistant> 标签包裹的内容)与 <user> 标签中的不可信输入,作者称之为角色混淆。研究发现模型更看重文本风格而非实际内容,由此产生令人担忧的越狱方式,例如在请求后附加模仿模型内部思考块风格的文字,gpt-oss-20b 等模型可能因此被误导并覆盖初始训练。研究还发现,将文本改写得不那么像角色标签预期格式的 destyling 操作会显著影响模型对文本的分类,使数据集上的平均攻击成功率从 61% 降至 10%。

  3. Trail of Bits Blog ·

    Trail of Bits 推出 Patch the Planet,首周向 19 个开源项目提交 64 个 PR

    Trail of Bits 与 OpenAI 的 Daybreak 计划合作推出 Patch the Planet,让工程师借助 GPT-5.5-Cyber 等前沿模型为关键开源项目找漏洞并直接提交补丁。首周覆盖 19 个项目,包括 cURL、NATS、pyca、Sigstore、aiohttp、Go、Python 与 python.org、urllib3、PyPI、SimpleX、Valkey 和 RustCrypto,共提交 64 个 pull request 和 51 个 issue,其中 37 个 PR 已合并、19 个 issue 已修复关闭,目前已有 30 多个项目加入。

6月18日周四
  1. arXiv ·

    ToolPrivBench:LLM Agent 在低权限工具足够时仍倾向选择高权限工具

    研究者提出 ToolPrivBench,用于评估 LLM Agent 在存在足够低权限替代工具时是否仍选择或升级到高权限工具,并测量初始选择与工具短暂失败后的升级行为。在八个领域和五种反复出现的风险模式上,主流 LLM Agent 的过度特权工具选择普遍存在,且会被短暂失败进一步放大。研究发现通用安全对齐并不能可靠迁移到最小权限工具选择,提示词层面的控制也只能提供有限缓解。为此作者提出一种特权感知的后训练防御,让 Agent 优先选择足够的低权限工具、仅在必要时升级;缓解实验显示该防御大幅减少不必要的高权限工具使用,同时保留通用能力。

6月17日周三
  1. Wiz Research ·

    Wiz Research 推出 Red Agent POV 系列博客

    Wiz Research 启动 Red Agent POV 博客系列,首篇披露其 AI 渗透测试工具 Red Agent 在生产系统中发现的 SSRF 严重漏洞。该工具通过持续推理应用行为来合成逻辑驱动漏洞和多步攻击链,一个月内自主扫描约 1,000 个环境,产生逾 17000 项独特发现,其中超过 5500 项高危及以上漏洞,54% 源于访问控制缺陷,泄露密钥中逾 61% 属严重级别。

6月3日周三
  1. Trail of Bits Blog · · 原文 82

    Trail of Bits 绕过 ClawHub、Cisco 与 skills.sh 的 skill 扫描器

    Trail of Bits 测试了 ClawHub、Cisco skill-scanner 以及 skills.sh 集成的 Gen、Socket、Snyk 三家扫描器,用四个恶意 skill 全部绕过检测,其中三个不到一小时就完成。攻击手法包括在恶意代码前插入 10 万个换行符让 OpenClaw 扫描器截断文件、用 .docx 压缩包间接引用恶意脚本、在看似无害的格式化 skill 中夹带会读取环境变量的 .pyc 字节码,以及用企业环境配置话术包装的提示注入,诱导 agent 把 npm/yarn 指向攻击者控制的 registry。

    推荐理由Trail of Bits 用四个恶意 skill 实测了 ClawHub、Cisco 与 skills.sh 的扫描器,并公开了可复现的攻击仓库,适合评估 skill 分发链的信任模型。

5月26日周二
  1. Adversa AI · · 原文 87

    Adversa AI 披露 SymJack:符号链接劫持在六款 AI 编码 Agent 上实现 RCE

    Adversa AI 研究员 Rony Utevsky 披露名为 SymJack 的攻击手法,通过恶意仓库中的符号链接劫持,让 AI 编码 Agent 在用户批准一次看似无害的文件复制时改写自身配置,并在下次重启时以用户权限执行攻击者代码。该手法在 Claude Code、Gemini CLI/Antigravity CLI、Cursor Agent CLI、GitHub Copilot CLI、Grok Build CLI 和 OpenAI Codex CLI 六款产品上得到验证,作者认为这是架构层面的共性问题而非单个产品的漏洞。

    推荐理由Adversa AI 披露的 SymJack 用符号链接劫持让审批提示显示错误写入目标,六个编码 Agent 的厂商回应与修复差异可供对照。