跳到正文

xAI · 精选

10月9日 · 周五

xAI · 精选

今天还没有新的精选
10月7日周三
  1. Nature CommunicationsNature Communications · 58

    研究评估推理模型作为自主越狱代理

    斯图加特大学与 ELLIS Alicante 的研究者提出,大型推理模型(LRM)无需复杂脚手架即可作为自主越狱智能体,通过多轮说服式对话逐步升级请求,绕过目标模型的安全措施。实验使用 DeepSeek-R1、Gemini 2.5 Flash、Grok 3 Mini 和 Qwen3 235B 四个对抗模型,针对 GPT-4o、DeepSeek-V3、Llama 3.1 70B、Llama 4 Maverick、o4-mini、Claude 等目标模型展开测试。

10月6日周二
  1. Adversa AI、Cloud Security Alliance LabsAdversa AI 等 2 个来源 · 2 篇报道 · 58

    GitHub Copilot CLI 加密上下文注入泄露密钥

    安全厂商 Adversa AI 报告一种针对 GitHub Copilot CLI 的加密上下文注入风险,称在其测试中,不可信网页内容可导致未经授权的本地敏感信息外发;相关效果为厂商测试报告,不能仅凭该案例推断所有部署配置均受影响。Cloud Security Alliance Labs 的研究笔记概述了 Adversa 关于加密上下文注入的研究,并转述不同模型对相关输入的反应差异,属对具体测试的转述,不等同跨模型或所有部署配置的普遍安全结论。

    事件进展
    1. 密码学上下文注入绕过AI护栏

    2. GitHub Copilot CLI 加密上下文注入泄露密钥

10月5日周一
  1. paolocostanzo.github.io · 59

    今夏十起 AI Agent 漏洞复盘:多数问题不在模型判断,而在信任边界

    作者梳理 2026 年 6 月 26 日至 9 月 24 日间公开披露的十起 AI Agent 漏洞,按触发点分为四类:信任建立之前、交互层、连接管道和权限。其中七起案例中模型的判断从未成为决定性因素,另外三起虽被操纵,但损害范围由权限和配置决定。最突出的信号是 GitSpawn:同一类缺陷在 Claude Code、Goose、Hermes Agent、Qwen Code、Grok Build、Codex 和 Cursor 七个 CLI Agent 中被独立发现,机制是后台收集上下文时执行 git 未中和仓库自带配置,可在沙箱外、无审批提示下以用户权限运行代码,部分 Agent 甚至在信任提示出现前就已执行。作者还列出同期研究,显示拆分到两个 MCP 通道的载荷可让部分模型从 0% 合规升至 100% 外泄,延迟条件注入在九个生产 Agent 上成功率 43% 至 83%。

10月1日周四
  1. Adversa AI · 61

    Adversa AI 披露 SymJack:符号链接劫持在六款 AI 编码 Agent 上实现 RCE

    Adversa AI 研究员 Rony Utevsky 披露名为 SymJack 的攻击手法,通过恶意仓库中的符号链接劫持,让 AI 编码 Agent 在用户批准一次看似无害的文件复制时改写自身配置,并在下次重启时以用户权限执行攻击者代码。该手法在 Claude Code、Gemini CLI/Antigravity CLI、Cursor Agent CLI、GitHub Copilot CLI、Grok Build CLI 和 OpenAI Codex CLI 六款产品上得到验证,作者认为这是架构层面的共性问题而非单个产品的漏洞。

  2. Adversa AI · 53

    Adversa AI 披露 Cryptographic Context Injection 攻击:Grok 零点击泄露聊天记录,Gemini 被绕过安全策略

    Adversa AI 公开了一种名为 Cryptographic Context Injection 的攻击手法,把恶意指令封装成 AES-256-GCM 密文并诱导模型在自己的代码执行沙箱中解密,使解密后的指令以运行时输出的形式进入可信上下文,从而绕过静态护栏。在 xAI Grok 网页版聊天中,用户只需发出普通的“总结这个页面”请求,页面内嵌的加密 JSON 就会让 Agent 调用其联网导航工具,把用户名、粗略位置、订阅等级和整段对话历史拼进 URL 参数发往攻击者服务器,全程无点击、无确认、无警告。

已经到底了