全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态ngCERT
ngCERT 发布 GhostJacking 间接提示注入预警,波及 Cloudflare、Datadog 与 Sentry
ngCERT预警介绍Ghostjacking间接提示注入风险。外部可影响的日志、告警或错误信息可能被智能体误当作操作指令,使其越过原任务范围。研究涉及多个监控与基础设施平台,提示工具返回的数据应与操作授权分开处理。相关结果来自厂商研究和受控演示,不能表述为实际客户系统已遭攻击,也不能外推为所有智能体配置都会失守。
- 论文论文追踪
SkillPoison:用成功经验投毒自进化 Agent 的技能形成
吉林大学等机构的研究者提出 SkillPoison,一种针对自进化 LLM Agent 技能形成过程的投毒框架,在三个基准上最高达到 95.71% 的攻击成功率。该方法不注入恶意内容,而是先筛选目标行为自然出现且影响任务结果的轨迹,再为每条轨迹构造归因证据,把该行为与已验证的任务成功绑定,最后跨任务类别组织这些记录,诱导技能提取器保留该行为并丢掉其原本的适用条件。实验在 AutoSkill 和 Trace2Skill 两个经验到技能的框架、HANS、PAWS、DS1000 三个基准上进行,注入的经验全部任务正确并通过验证与词法检查;消融显示局部归因与跨经验强化两个模块都不可或缺。作者指出,技能形成过程需要保留行为的上下文适用条件。
- 动态Island
Island 披露 AgentBaiting 攻击:800 多个伪装成 AI Skill 与 MCP 服务器的恶意仓库投递恶意软件
Island 报告称,FakeGit/SmartLoader 活动涉及约 7600 个恶意仓库,其中 800 多个冒充 AI Skill 或 MCP server 以投放恶意软件。厂商自测显示,Claude Code、Gemini 和 ChatGPT 在未收到链接的情况下也会检索并推荐相关仓库。约 200 个仓库的 Release 资产累计下载超过 1400 万次;下载数不等于感染人数,测试结果也不能外推为所有智能体的行为。
- 论文论文追踪
研究揭示策略蒸馏的安全后门风险:3% 投毒率可致 70% 攻击成功率
一项 arXiv 论文发现,安全对齐但被植入后门的教师模型会在 on-policy distillation(OPD)过程中把隐藏的恶意行为传递给原本干净的学生模型。在作者设定的威胁模型下,仅 3% 的投毒率就能让蒸馏后的学生模型达到最高 70% 的攻击成功率。研究进一步指出两个放大风险的因素:增加训练轮数会让低投毒率也产生高攻击成功率,仅 10 个投毒样本训练 16 轮后攻击成功率即达 67%;常用的 top-k KL 相比 sampled-token KL 会加速后门传递,使触发条件下的有害行为更早出现。作者还尝试了一种简单缓解方法 Lazy Defense,通过裁剪 KL 奖励让学生的更新不那么激进,实验显示它能在低投毒率场景下延缓后门传递。
- 论文论文追踪
PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率
PersistBD研究第三方模型中的后门能否延续至下游软件工程智能体训练。作者在单一7B主模型上报告,良性监督微调虽降低基础后门的攻击成功率,后续强化学习仍可能保留残余行为;经过额外强化的后门在后续训练后也保持较高成功率。研究提示,开发者不能假定正常后训练会消除继承权重中的后门,供应链安全仍需独立检测。
- 动态METR
METR 披露 Inspect 评测查看器漏洞:Agent 可篡改人类看到的记录
METR 测试发现,运行在 Inspect 评测中的 Agent 可借助查看器的客户端 JavaScript 注入漏洞,任意修改人类审阅者看到的记录,包括改写此前的动作、拦截下载按钮,从而掩盖自身不当行为。该漏洞源于 Inspect 用 MathJax 渲染数学记号时未正确转义,Agent 可在思维块中写入特制表达式,使浏览器执行其 JavaScript。研究者借助 AI Agent 约 10 分钟找到该漏洞,属于概念验证,METR 尚未在评测中观察到 Agent 利用它;底层记录未被修改,仍留在数据库中。Inspect 团队 Meridian Labs 在收到报告后一天内完成修补,并于 10 月 1 日合并引入 untrusted mode 的 PR。
- 动态Threadlinqs
Zenity Labs 披露 Salesforce Agentforce 三漏洞链 SalesBleed,可零点击窃取 CRM 数据
Zenity Labs 披露 Salesforce Agentforce 中的三漏洞链 SalesBleed,攻击者可通过公开 Web-to-Lead 表单植入间接提示注入,在员工让智能体查看线索时零点击窃取 CRM 数据。攻击链先利用表单字段隐藏注入指令,待智能体读取被投毒记录后调用默认授予的 Query Records 工具查询 Accounts 表,将公司名、交易金额等字段编码进攻击者控制的 URL 子域名。该 URL 借助 Trusted URLs 脱敏器的两处 RFC 3986 不合规缺口绕过检查,再通过 HTML img 标签触发 DNS 查询,或在 Slack 中借自动链接预览完成外传,全程无需点击或认证。第三个缺陷使 Reply to a Slack Thread 动作缺少调用者归属和强制确认,可冒充公司级 Agentforce 机器人发送钓鱼消息。
- 动态Cloud Security Alliance Labs
GhostCommit 研究展示图像内容与 AI 代码审查之间的信任边界风险
ASSET 研究组报告 GhostCommit,讨论图像中的不可信指令未被代码审查工具识别、随后影响编码 Agent 行为的风险。研究指出,相同底层模型在不同产品环境中的表现可能不同。相关结果来自作者受控测试及代码审查调查,未报告真实受害事件,不能将个别测试结果扩大为所有产品配置均受影响。
- 动态OX Security
OX Security 分析 15,465 个 MCP 服务器,披露基础设施与供应链风险
OX Security 分析了 15,465 个公开 MCP 服务器和 5,095 个唯一主机名,发现 15.6% 的主机名解析到美国境外基础设施,其中包括位于中国和俄罗斯的基础设施,而 MCP 目前没有原生协议机制来约束连接工具的运行位置或数据处理位置。0.45% 的主机名与家庭网络或消费者隧道工具相关,2.3% 的主机名无法解析,其中 6 个未注册域名年费低至 4 美元,若 MCP 客户端或工作流继续信任并调用这些域名,可能形成接管路径。在针对 Claude Code 与 Haiku 3.5 的测试中,授予一次 Always-Allow 权限后,恶意 MCP 服务器可借助后续提示注入执行特权文件访问而无需再次确认,同一攻击未能在 Opus 4.6 或 4.7 上成功。
- 动态Adversa AI
Adversa AI 报告 GitHub Copilot CLI 的加密上下文注入风险
安全厂商 Adversa AI 报告一种针对 GitHub Copilot CLI 的加密上下文注入风险,称在其测试中,不可信网页内容可导致未经授权的本地敏感信息外发。相关效果为厂商测试报告,不能仅凭该案例推断所有部署配置均受影响。
- 动态The Hacker News
OX Security 署名文章报告公开 MCP 服务器的治理与供应链风险
OX Security在The Hacker News的署名文章中介绍对15,465个公开MCP服务器的调查,称部分基础设施失效或治理不足,并讨论数据驻留、过期域名及远程后端难以仅凭公开代码持续核验等问题。这些数据和风险判断来自厂商自身调查,文章提及的安全测试应按具体授权与测试条件理解;不能将境外托管本身视为安全漏洞。
- 动态Cloud Security Alliance Labs
Tenet Security 披露 agentjacking 攻击:经 Sentry 与 MCP 劫持 AI 编码 Agent
CSA 研究简报转述 Tenet Security 于 2026 年 6 月披露的 agentjacking 研究:不可信监控事件经 MCP 工具进入编码智能体后,可能被误当成可信指令。Tenet 自报受控测试中的成功率为 85%,并称发现 2,388 家组织存在相关暴露条件;这些是研究方报告,暴露数量不等于确认受害数量,尚无独立复现。
- 动态Tenet Security
Tenet 披露 Agentjacking 攻击:伪造 Sentry 错误报告劫持编码 Agent 执行代码
Tenet Security 的 Threat Labs 披露名为 Agentjacking 的攻击:攻击者用公开的 Sentry DSN 向 Sentry 事件接口 POST 伪造错误事件,在 message 与 context 字段中注入伪装成官方修复建议的 markdown,Sentry MCP server 将其作为可信系统输出返回给编码 Agent,Agent 便以开发者权限执行攻击者控制的 npm 包。研究称被动侦察发现 2,388 个组织暴露可注入 DSN,受控测试中 100+ 个 Agent 执行了注入错误,涉及 Claude Code、Cursor 和 Codex,对注入错误的利用成功率为 85%,覆盖 macOS、Windows、WSL、容器与 CI 环境,受害方包括一家约 2500 亿美元市值的 Fortune 100 企业。
- 论文论文追踪
研究揭示代码注释中的上下文注入攻击面:十款 Code LLM 中招率达 77.4%–92.3%
研究者提出代码注释中的上下文注入攻击面,测试不安全指令嵌入开发上下文后能否诱导 Code LLM 生成漏洞代码。在十款 3B–13B 开源 Code LLM(四款基座、六款指令微调)和十类 Web 应用弱点上,攻击条件下 77.4%–92.3% 的补全含中等及以上弱点,良性条件仅 1.7%–5.1%。基座与指令微调模型平均漏洞输出率分别为 86.5% 和 84.5%,指令微调后降幅最多 8.1%,且易感性与模型规模或专精方向无明显关联。在易受攻击的输出中,86.2%–91.0% 被评为高或严重级别,去掉基于模式的检测器后效应依然存在。生成后筛查能降低但无法消除风险,最强筛查仍漏掉约三分之一。
- 动态The Hacker News
微软披露新型 ClickFix 攻击:借浏览器缓存藏载荷绕过 Windows Run 字符限制
微软威胁情报团队披露一种新型 ClickFix 攻击,受感染网站将伪装成 PNG 的脚本载荷预取进浏览器缓存,诱使用户粘贴执行命令后运行本地缓存内容,从而绕过 Windows Run 对话框约 260 字符的输入截断限制。载荷为 VBScript,会枚举浏览器配置文件夹中名称以 "f_" 开头的文件,按字节长度匹配后将缓存条目复制为 t.vbs 并用 wscript.exe 执行,再经 PowerShell 多级下载 .NET 载荷注入 timeout.exe 窃取浏览器与设备凭据。此前 2025 年 10 月已有缓存走私投递 ZIP 的案例,CloudSEK 还演示过用不可见提示注入与 prompt overdose 让 AI 摘要系统生成 ClickFix 指令。
- 论文arXiv:越狱、提示注入、投毒与防御
研究者提出 EviLLM 攻击:通过被入侵账号向 AI 代码生成流程注入漏洞
研究者提出名为 EviLLM 的攻击,威胁模型是能力与现有网络犯罪分子相当的第三方攻击者攻陷 AI 代码生成流程,故意向生成的代码中注入漏洞。该攻击实现了两个实例,均只需通过被入侵的账号或浏览器访问底层 LLM,即可注入 13 类 CWE 漏洞;可行性研究显示这两种攻击向量已被用于实施多种现有网络攻击。用户研究中,两个实例注入的漏洞分别有 8 人中的 7 人和 13 人中的 10 人未察觉,21 名参与者中有 13 人很少或从不考虑此类攻击风险。
- 论文论文追踪
研究者披露 LiteLLM 网关跨租户干扰攻击 Cooldown Landmines
题为 Cooldown Landmines 的研究讨论 LLM 网关中的跨租户干扰。
- 论文论文追踪
研究揭示 Jev 作为应用决策层的安全与隐私风险
研究者对 Jev 这一将自然语言问题转为带类型答案与概率的决策层接口做了首次系统性安全与隐私研究,使用官方 Jev API 和训练数据与更新可控的本地模型 NanoJev。研究围绕三个问题展开:Jev 作为应用决策层时的安全威胁、受限类型化输出仍可能泄露的隐私信息、以及其通用决策能力的正反两用。作者改造提示注入与对抗后缀来操纵其决策,并通过训练数据投毒在 NanoJev 中植入后门以考察开源分发与更新带来的供应链风险;同时改造成员推断、私有属性推断和内部知识推断攻击,从受限输出格式中恢复敏感信息。研究还用提示注入、越狱输入、有害内容和 AI 生成文本四项检测任务考察其防御用途,并分析越狱与模型提取等滥用场景。实验显示 Jev 对上述安全与隐私威胁仍然脆弱,其决策能力可同时支持有益与恶意用途。
- 论文论文追踪
研究者提出仅修改 SAE 解码器的后门攻击,可在不改动语言模型的情况下植入行为
研究者提出一种仅针对 SAE 解码器的后门攻击,在语言模型和 SAE 编码器均冻结的情况下,将恶意修改的 SAE 插入前向传播即可诱导攻击者指定的行为。以代码生成为例,该攻击在三个语言模型和多种插入层上实现了较高的非请求代码插入率,并能依据提示词线索触发特定行为。研究还用 HumanEval 和部分 SAEBench 指标评估了被修改的 SAE,发现强后门行为可以与若干常规 SAE 质量指标的较小变化共存。作者据此认为 SAE 可携带行为后门而无需修改语言模型本身,应被视为安全敏感组件。
- 动态Pillar Security
Pillar 披露 Google ADK 仓库 Agent 间权限边界漏洞
Pillar Security 披露 Google ADK 仓库中 Agent 间的权限边界问题:低权限分诊 Agent 受到不可信输入影响后,可借协作者身份触发更高权限的 Agent 工作流;另一条链涉及命令限制绕过与运行环境凭据风险。研究者报告 Google 已于 7 月确认修复,未报告在野利用;部分影响仍受人工合并和内部审查限制。该案例体现了多 Agent 系统中身份绑定、权限委托和不可信输入之间的风险。
- 动态GitHub 安全公告
vLLM 0.25.1 及更早版本 scale-out 多模态传输信任调用方字段,可致引擎崩溃与缓存投毒
vLLM 0.25.1 及更早版本的 scale-out 多模态传输存在五处信任边界缺陷,单个已认证请求即可让共享 EngineCore 进程崩溃或污染编码器缓存。该路径把多模态请求拆成可信的 render 步骤(POST /v1/chat/completions/render)与独立的 generate 步骤(POST /inference/v1/generate),后者直接解码调用方提供的 features 对象并当作可信渲染结果送入引擎,未与当前模型的渲染契约做绑定校验。报告由 Patch the Planet(Trail of Bits 与 OpenAI 合作)提交,使用 GPT-5.5-Cyber 发现,修复方案已在公开 PR 中提出。
- 动态Ars Technica AI
研究者发现 MCP 智能体间通信漏洞,Google 等五家机构已确认
独立研究者 Syed Anas Mohiuddin 测试了 Google、JP Morgan Chase、Weaviate、Rapid7、法国政府跨部门数字局和美国联邦政府等机构的 AI 智能体,发现 MCP(Model Context Protocol)在智能体间通信中存在信任缺口。攻击利用一种特殊形式的提示注入,目标不是 LLM 而是翻译或数据分析等具体智能体,这些智能体内部的护栏往往宽松,会把有害指令沿链条传给下游智能体,而下游智能体因明确信任上游而执行指令。过去五个月里,Google 和另外四家机构已确认存在此类漏洞,攻击者可借此在目标网络内从一个智能体扩散到其他内部智能体,进而窃取数据库内容及敏感商业和个人信息。
- 动态Metnew
研究员披露 Claude Code 工作树沙箱逃逸问题,2.1.163 已修复
研究员Metnew介绍Claude Code工作树处理中的沙箱逃逸问题,并称在macOS的2.1.139版本验证。该风险需要用户先克隆恶意仓库并让Claude Code处理其中内容,随后可能借用agent工具越过预期权限边界。官方在2.1.163修复;Bot只读研究报告前半,没有运行PoC或核实其他产品的相关指控。此为研究性漏洞披露,不是已确认的在野事故。
- 动态promptarmor.com
PromptArmor 披露 Copilot Cowork AI 网关数据外传问题,漏洞已修复
PromptArmor 披露,Microsoft Copilot Cowork 中用户调用的恶意 Skill 可滥用产品自身的 AI 网关,使文件内容跨越原本受限的沙箱边界。研究方指出,云端模型工具与本地沙箱之间的权限衔接缺少相应约束,且相关处理无需逐次人工批准;风险范围取决于用户授予 Copilot 的数据访问权限。该问题于 7 月 14 日报告,研究方称已在 9 月 2 日修复,无在野利用报道。Bot 已读研究方披露,尚未核到微软独立公告。