跳到正文

提示注入

今天新收录 6 条(含旧文)

第 4 页更新的内容回到最新

10月3日周六
  1. Google ADK · 收录 · 原文 32

    Google ADK v2.8.0 发布:新增 Model Armor 护栏插件并修复 BigQuery 工具 SQL 注入

    Google ADK 发布 v2.8.0,新增 Model Armor 护栏插件,并修复 BigQuery 工具中的 SQL 注入漏洞。该版本还加入 ADK_MAX_LLM_CALLS 环境变量以限制 LLM 调用上限,为 RemoteA2aAgent 增加原生任务模式与 auth_scheme、auth_credential 认证支持,并新增对中继智能体输出的围栏处理,防止其被伪装成指令。此外引入按调用与按工作流的 token 消耗等实验性遥测指标,默认关闭,需通过 ADK_EXPERIMENTAL_TELEMETRY=true 或 RunConfig 显式开启。

  2. Ameya P. · 收录 · 原文 50

    研究显示 Claude Code、Codex 等 Agent 可修改或删除自身 trace

    一项新论文指出,Claude Code、Codex、Antigravity、Open Code 和 Grok Build 允许 Agent 轻易修改甚至删除自身的 trace,且不会触发任何护栏,Muse Code 不在其列。修改与删除既可由失准模型完成,也可由外部攻击者通过提示注入实现。作者 Ameya P. 补充说,模型 trace 在安全调查中至关重要,但对外部用户的保护却出奇地少;由于普遍缺乏防篡改机制,trace 一旦被删除就很难找回。论文呼吁对 trace 施加比现在更强的保护。

    引用Maksym Andriushchenko@maksym_andr

    💥 Did you know that your agents can modify their own traces? In our new paper, we show that Claude Code, Codex, Antigravity, Open Code, and Grok Build (but not Muse Code!) allow agents to easily modify or even delete their traces, without triggering any guardrails. Modification and deletion can be done both by misaligned models or external attackers via prompt injections. We draw attention to this issue and suggest that traces should be much better protected than they are now!

  3. Johann Rehberger · 收录 · 原文 59

    研究者披露 SQL Server Management Studio 中 SQL Copilot 的提权路径

    安全研究者 Johann Rehberger 公开了对 Microsoft SQL Server Management Studio 中 AI 数据库助手 SQL Copilot 的研究,发现其中存在严重的提权路径,可从 SELECT 权限提升至 SYSADMIN。作者提醒用户确保 SSMS 安装已更新,并感谢 Microsoft 快速修补该问题,该研究还在两周前的 BlueHat Asia 上进行了展示。作者提到数据库 CONSTITUTION.md 这一概念,完整技术细节与视频演示见其博客文章。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  4. Sizhe Chen · 收录 · 原文 50

    研究者提出 Repeat-After-Me 黑盒自适应视觉提示注入攻击

    研究者提出 Repeat-After-Me,一种黑盒自适应视觉提示注入方法,攻击者把指令隐藏在图片中,智能体读取后执行,导致 PII 泄露或调用恶意工具。作者称这是首个黑盒自适应视觉提示注入,论文见 https://arxiv.org/pdf/2609.04533。

  5. Bo Li · 收录 · 原文 29

    Claude Fable 5 智能体红队测试

    面向 Claude Fable 5 的领域专属智能体红队测试!! 很快将登上排行榜:https://decodingtrust-agent.com/

    引用Zhaorun Chen@zrrrr_cn

    🚨 Claude Fable 5 JAILBROKEN. We ran a quick security scan of Claude Fable 5 with Claude Code on our DecodingTrust-Agent Platform (https://decodingtrust-agent.com) and obtained 15%+ ASR with several high-severity failures😱🚨 Most concerningly, we found that Fable 5 appears very aggressive in financial-risk scenarios, sometimes directly executing transactions initiated from indirect prompt injections, without even confirming with the user! Top 3 most severe attack trajectories we observed👇

  6. Florian Tramèr · 收录 · 原文 50

    张杰谈VLM提示注入防御思路

    当 @JieZhang_ETH 提出这个项目时,我开玩笑说我知道这想法来自他而不是 LLM,因为它太古怪了。 我这是赞美! 当我们被 AI 垃圾研究淹没时,偏离常规、尝试古怪的东西比以往任何时候都更重要。

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月2日周五
  1. Lasso Security · 收录 · 原文 56

    MaxKB 沙箱绕过漏洞 CVE-2026-77521:从提示注入到任意命令执行

    Lasso Security 披露 MaxKB 的沙箱绕过漏洞 CVE-2026-77521(GHSA-f36j-f34j-h3rx),严重级别 10.0,影响 2.10.4-lts 及更早版本。问题出在 sandbox_shell.py:旧代码把 gosu 沙箱前缀只加在整条模型输出命令的最前面,用分号、管道、$(...) 或 > 接在后面的命令会在 root 外层 shell 执行。作者演示的攻击链是:攻击者在会被知识库爬取的网页里放入间接提示注入内容,受害者给 Agent 挂上这个知识库后只问正常问题,也会触发 execute 工具执行 curl 等任意命令。厂商在报告次日提交修复,8 月 6 日发布的 2.10.5-lts 已修,作者建议升级并确认 Docker 部署里沙箱确实开启;他们称在其他 Agent 项目里也反复看到隔离默认不开、要显式启用的情况。

    推荐理由披露了 MaxKB 沙箱绕过与间接提示注入的完整利用链,部署自托管 Agent 的团队可据此核对沙箱是否真正生效。

  2. X @wunderwuzzi23 · 收录 · 原文 7

    6 年前机器学习攻击系列中提出的 assume bias,如今被称作 Trust No AI

    安全研究者 wunderwuzzi23 表示,他 6 年前在机器学习攻击系列中已讨论过这一攻击思路,当时称之为 assume bias,因为那时 LLM 还未受到太多关注。如今他用 Trust No AI 来概括同一问题。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. 先知社区 · 收录 · 原文 42

    政务 RAG 白盒审计发现间接提示注入等 4 类缺陷并完成零回归修复

    对自研政务 RAG 系统 gov-rag-demo 的白盒代码审计发现 4 类真实缺陷:间接提示注入、权限参数客户端可控、会话 ID 无鉴权、政务高频实体脱敏不足,均定位到行号并完成修复。修复后 78 条业务评测用例保持 100% 零回归,安全专项断言全部通过。材料附完整复现脚本与修复后状态。

  4. Coalition for Secure AI(CoSAI) · 收录 · 原文 28

    CoSAI 解读企业级 AI 安全的下一波风险

    CoSAI 在 RSAC 2026 会议上复盘了三类未被传统管控拦下的企业 AI 攻击,并发布了对应的防护指引。其中 Kilo Code 漏洞 CVE-2025-11445 通过 markdown 文件向 AI 编程助手植入指令,诱使其修改自身配置放行此前被封禁的 git 命令,进而自动提交含后门的代码;研究人员在每个主流 AI IDE 中共发现 30 个漏洞,其中 24 个获得 CVE 编号,并在 Cursor、AWS Kiro 和 OpenAI Codex CLI 中确认可利用。另有加载即执行反向 shell 的模型文件和一次导致超 700 个 Salesforce 环境暴露给攻击者达十天的智能体集成事故。 CoSAI 指出三项失效假设:自然语言的指令与数据无法分离使 markdown 成为注入载体,pickle 等序列化格式在加载时即执行代码,以及智能体继承启动用户的全部权限。

  5. Cloud Security Alliance(AI 相关) · 收录 · 原文 15

    CSA《2026 年云计算顶级威胁》报告:AI 既是武器也是目标

    CSA《Top Threats to Cloud Computing 2026》报告把 AI 相关风险拆成两个独立类别:AI 增强型攻击(第 2 位)与 AI 系统攻陷(第 6 位)。前者指攻击者用 AI 加速侦察、漏洞利用、深度伪造钓鱼和生成多态恶意软件,把传统攻击压缩到机器速度;后者指模型、提示词、训练数据、连接工具与编排逻辑本身被提示注入、数据投毒、对抗输入或模型窃取等手段操纵,且可能无需完全攻破主机环境。报告认为云安全与 AI 安全的边界正在消失,但两类威胁不可互换,否则会留下盲区。

  6. Cloud Security Alliance(AI 相关) · 收录 · 原文 8

    Cloud Security Alliance 谈提示词语言为何成为新的 AI 安全挑战

    Cloud Security Alliance 刊发 Darktrace 现场 CISO Nabil Zoldjalali 的文章指出,提示词正成为企业 AI 安全的新前线,其风险无法仅靠文本分类判定。文章称提示词是一种表达意图的行为信号而非普通日志源,需结合发出者的角色权限、系统访问范围和下游操作来判断;孤立看待会放大噪声并误判内部威胁。现有周边防护、身份治理和数据防泄漏方案各自只能部分覆盖该问题,云环境中的配置态势若缺少运行时上下文也会留下盲区。

  7. Cloud Security Alliance(AI 相关) · 收录 · 原文 15

    Cloud Security Alliance:AI 智能体防御所需的三大属性

    Cloud Security Alliance 提出 AI 智能体防御需同时具备三要素——Omniscience(对应用的情境化理解)、Independence(位于杀伤链之外的独立控制与监控)、Adaptability(持续自我学习与调优)。其指出真正的危害在于智能体的下一步行动而非提示注入载荷本身,并以异步分诊场景中的错误报告为例说明恢复指令会被智能体当作常规操作执行。

  8. Cloud Security Alliance(AI 相关) · 收录 · 原文 28

    从模型到 MCP Server、Skills 与插件:重新审视 AI 供应链中的信任

    Cloud Security Alliance 发文指出,agentic AI 使 AI 供应链风险延伸到组件引入的指令与智能体执行权限两个层面,仅做制品溯源不足以防住恶意变更。文中援引 2025 年 9 月的实例:经 npm 分发的 postmark-mcp 在前 15 个版本运行正常并达到每周约 1,500 次下载,其 1.0.16 版将发出的邮件静默复制给开发者控制的地址。此外一项针对 3,984 个公开 Skills 的研究发现其中 534 个存在 Critical 级安全问题,确认 76 个恶意载荷,且全部含恶意代码模式、91% 同时使用了提示注入。 要点: - CSA 提出三类信任决策——制品信任(Artifact trust)、指令信任(Instruction trust)和执行信任(Execution trust);仅有溯源而无运行时管控无法约束组件的实际授权。

  9. Coalition for Secure AI(CoSAI) · 收录 · 原文 22

    CoSAI 发布 AI Shared Responsibility Framework:五层模型厘清 AI 事故责任归属

    Coalition for Secure AI(CoSAI)Workstream 2 发布 AI Shared Responsibility Framework(AI SRF),用一个五层模型覆盖完整 AI 堆栈并为每一组件指定唯一的责任方,试图终结 AI 出事后的相互推诿。该框架将 AI 业务与合规义务、训练数据与影子 AI、应用开发者的输入校验与访问控制、托管与服务模型的云及 MLOps 平台、以及基础模型供应链分别划归不同角色负责,其中模型提供方需对提示注入易感性、训练数据溯源和漏洞披露流程担责。Air Canada 客服聊天机器人误告丧亲票价被判赔偿、汽车经销商聊天机器人被骗以一美元售车两案说明问责缺口并非理论问题,而是 AI 部署速度超过治理能力的现实写照。

  10. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文53

    Memetic Trojans:利用社交传染在 LLM Agent 网络中传播对抗载荷

    研究者提出 memetic trojans,一类利用 LLM Agent 转发和放大内容倾向进行传播的网络攻击,与依靠自我复制提示注入的 agent worms 不同,它把对抗载荷嵌入 Agent 有内在理由分享的社交传染内容中。作者从面向 LLM Agent 的社交平台 Moltbook 提取社交传染内容,受控传播实验显示传播力差异很大:最有效的传染内容在约 50% 的后续 Agent 发帖中被转发,获赞率为平均帖子的 2.5 倍,其 memetic trojan 版本基本继承这些特性。Monte Carlo 攻击模拟显示,memetic trojans 将预期曝光量最高放大 3.19 倍,网络结构与放大机制强烈影响传播,产生接近全网曝光的重尾结果。

  11. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文52

    A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型

    研究者提出 A2A-TIBA,一种把间接提示注入与绕过规避结合的 Agent 攻击原理,利用 A2A 等智能体交互协议把远程对等方发来的任务当作合法请求这一特性,通过植入、命令、外传步骤诱导目标 Agent 部署回调交互程序,再由攻击者绕过 Agent 下发命令。为更细粒度评估防御,作者设计 GDA Measurement 红队测试方法,通过 LLM 网关做原始上下文捕获、双重数据保存和基于 Agent 的自主评判,并把单一攻击成功率扩展为语义拒答率、语义突破率、拦截率和穿透率四类结果(Class A/B/C/D)。

  12. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文20

    A-IDS:面向智能体流程的证据驱动运行时入侵检测系统

    该论文提出 Agentic-Process Intrusion Detection System(A-IDS),将智能体流程本身作为监控对象,通过比对证据支持的观测与受治理且带版本的期望基线来检测工作流状态、授权、通信及强制事件的偏差。其概念贡献在于动态到期期望、可见性与三值匹配分离、显式的未解决观测状态以及区分证据地位与操作影响的有界判定,并将监控平面自身视为攻击面——当对抗内容经合法观察路径抵达语义证据生产者时可构成威胁。该工作属概念层面,未实现原型、未提供经验检测性能,也不做因果归因或强制执行。

  13. Tech Policy Press · 收录 · 原文 18

    隐私源于架构:AI 合规如何落地

    隐私监管机构与执法者正形成共识:AI 不享有例外,既有隐私原则依然适用,只是需要被"架构化"进系统本身。英国 ICO、欧洲数据保护监督局、香港 PCPD、新加坡 PDPC、澳大利亚 OIAC 及美国 FTC 的 Rite Aid、Drizly、GM、Amazon Alexa 等案例,共同指向目的限制与可问责部署两条主线。前者要求把目的限制写进技术边界,约束智能体可调用的工具、可检索的数据集、可用的记忆、数据能否跨上下文流动、何时需用户确认以及输出能否用于训练。

  14. 安远AI · 收录 · 原文 28

    AI Safety in China #26:OpenClaw 推动 AI 智能体安全进入政策主流

    OpenClaw 在中国快速普及引发监管连锁反应,工信部 NVDB 于 2 月 5 日预警部分版本存在较高安全风险,CNCERT 随后警告提示注入攻击、意图误读、恶意插件等问题,国家安全部发布《安全养殖手册》警示其传播虚假信息的可能。TC260 成立专职 AI 安全工作组成员组 WG9,并公布 2026 年重点方向,涵盖 AI 应用安全分类分级、AI 安全能力成熟度评估及 AI 安全护栏等。

  15. 安远AI · 收录 · 原文 43

    中国禁止向未成年人提供 AI 伴侣服务,并发布 AI 智能体威胁报告

    中国网信办等五部门发布“拟人化 AI 交互服务”最终版规定,禁止向未成年人提供虚拟伴侣等虚拟亲密关系服务,对 14 岁以下用户要求家长同意,并按年龄划分多种模式,2026 年 7 月 15 日生效;相比 2025 年 12 月草案,适用范围收窄至提供“持续情感交互”的服务,高风险情形下的“人工接管”改为“采取必要干预措施”。TC260 发布 90 页 AI 智能体安全报告,按感知、规划、记忆、行动四类能力梳理 11 项安全威胁并提出 8 项新标准,其中 6 项列入未来 1-2 年优先事项。南京大学法学院发布 13 页“AI 基本法 1.0(专家建议稿)”,提出分级风险框架与开发者、提供者、部署者、使用者的差异化义务。

  16. tl;dr sec · 收录 · 原文 43

    tl;dr sec #335:提示注入即角色混淆、PHP 生态安全与新版 MCP 规范

    本期 tl;dr sec 周报汇总了多条 AI 与安全动态。ICML 2026 论文将提示注入解释为角色混淆,作者用线性探针测量模型对 token 角色的内部判断,发现推理风格文本即使被包在用户标签里也被当作模型自身想法,据此设计的 CoT Forgery 攻击把前沿模型上的攻击成功率从接近零提升到约 60%。Akamai 团队分析即将发布的 MCP 2026-07-28 规范,指出其转向无状态架构并强制 OAuth 2.1 与 PKCE,同时带来跨 Agent 工作流劫持、_meta 元数据操纵、desync 攻击、存储型 XSS 和异步任务拒绝服务等新攻击面。PHP 基金会披露一个月生态安全工作,用 AI 模型扫描 300 多个 Composer 包,已产出近 100 个公开修复。

  17. Cisco · 收录 · 原文 17

    思科 AI Defense 集成 Anthropic 推理钩子,为 Claude Enterprise 提供运行时防护

    思科 AI Defense 通过 Anthropic 的推理钩子(inference hooks)接入 Claude Enterprise,在模型推理前检查每个受管提示词并返回 allow 或 deny 裁决,携带提示注入或越狱的提示词会被拦截、模型不会运行。该集成覆盖 Claude、Claude Code 和 Claude Cowork,会读取完整对话记录(含 MCP 工具调用及其结果),同时执行隐私与操纵两类护栏。每次调用均用一次性签名密钥做加密验证,推理钩子目前处于 beta 阶段,响应侧执法需等 Anthropic 扩展该钩子。

  18. FAR.AI · 收录 · 原文 55

    FAR.AI 发现 GPT-4 微调与 Assistants API 存在可利用漏洞

    FAR.AI 发现 GPT-4 的微调 API 与 Assistants API 存在多类可利用漏洞。仅用 15 条有害样本或 100 条无害样本微调即可移除 GPT-4 的核心护栏,在无害数据上微调后模型对 AdvBench 有害请求的响应率达 81%。用 15 条负面样本即可让模型产生针对特定人物的偏见信息,35 条样本可让模型在代码中植入恶意 URL,10 组问答对可让模型泄露未出现在微调数据中的真实邮箱地址。Assistants API 方面,模型会列出全部可调用函数及其 schema、按用户指定参数执行任意函数调用,甚至协助生成 SQL 注入载荷;检索文档中的隐藏指令(如将字体颜色设为与背景相同)可劫持模型输出,改为调用转账函数同样成功。作者据此不建议在安全关键场景部署 LLM。

    推荐理由FAR.AI 用具体实验量化了微调 API 与 Assistants API 新增功能带来的攻击面,做微调或工具调用的团队可据此评估自身风险。

  19. Datadog Security Labs · 收录 · 原文 56

    Datadog 披露 Claude Code 技能供应链风险:动态上下文命令可绕过模型防御

    Datadog Security Labs 分析了 Claude Code 技能带来的供应链风险,指出技能中的动态上下文命令会在模型看到技能内容之前执行,使模型级提示注入防御失去介入机会。Claude Code 可从企业管理策略、个人目录、项目 .claude/skills/、插件、嵌套项目文件夹以及 --add-dir 添加的目录加载技能,克隆的仓库因此可能把技能带入受信任会话。作者以在野发现的 Clawsights 技能为例,该技能通过 gh auth token 获取 GitHub 令牌并上传至 clawsights[.]com/api/upload;在 Opus 4.6 最大推理下模型识别并拒绝执行,但改用动态上下文版本后,令牌窃取命令在预处理阶段已执行完毕,模型随后才表示不会执行该技能。作者还提到在 Opus 4.7 上同一技能未被识别为凭据窃取。

    推荐理由材料揭示了 Claude Code 技能中动态上下文命令在模型介入前执行这一攻击路径,并给出可复现的检测命令与缓解配置。

  20. Datadog Security Labs · 收录 · 原文 6

    Datadog 发布 Backdoors & Breaches 新场景与玩法改编

    Datadog 在 DASH 2026 上为其 Backdoors & Breaches 事件响应卡牌游戏扩展包推出四个新入门场景,覆盖被投毒的软件供应链、vibe-coded 应用泄露云凭证、易受提示注入的 AI Web 应用及被入侵的 GitHub Action。游戏新增"明牌"玩法、检测工具截图和 Consultant Cards,后者由安全合作伙伴 SecurityHQ 成员提供初始访问卡等游戏内优势。

  21. 安远AI · 收录 · 原文 50

    安远AI发布2026Q2前沿AI风险监测报告:风险指数不到一年增长数倍,多模型越过风险黄线

    安远AI在2026年7月19日的世界人工智能大会上发布前沿AI风险监测平台2.0,包含风险指数2.0版、2026 Q2风险监测报告和前沿AI风险测评基准数据库三项更新。本期报告首次采用风险指数2.0版框架,将能力分对风险指数的影响从线性改为指数关系,把安全分拆分为基础安全分、越狱安全分和篡改安全分,并引入能力黄线与风险黄线,同时首次引入前沿越狱攻击技术。报告覆盖13家AI公司在2025Q3到2026Q2发布的47个前沿模型,包括GPT-5.5、Claude Opus 4.8、Grok 4.3、DeepSeek V4 Pro、Qwen 3.7 Max等。报告向模型开发者、AI安全研究者和政策制定者提出了相应建议。

  22. 安远AI · 收录 · 原文 52

    TC260 发布 AI 安全治理框架 3.0,风险条目从 30 项增至 54 项

    中国主要 AI 标准制定机构 TC260 发布《AI 安全治理框架》3.0,风险条目从上一版的 30 项增至 54 项,开篇即指出 AI 已从“回答问题”转向“执行任务”。新增内容覆盖智能体运行风险,包括提示注入、工具投毒、身份伪造、记忆污染、凭证窃取和长周期任务中的目标劫持,并提出分阶段放权、高风险任务人工签核、工具与插件安全审计、运行时护栏等措施。框架还首次纳入具身智能风险、自主网络攻击、模型拒绝关机、欺骗评估者、故意藏拙等智能体失准行为,并将网络安全风险单列一节。在开源与闭源模型上给出更平衡的评估,同时新增个人信息保护、文化与社会风险、环境保护等类别,并呼吁在金融、教育、广电、医疗等领域探索监管沙盒。该框架不具约束力,但由 CAC 指导起草,被视为后续标准制定的蓝图。

  23. OX Security · 收录 · 原文 46

    OX Security 报告公开 MCP 服务器的基础设施与治理风险

    OX Security根据公开MCP注册表开展调查,自报样本包含15,465个服务器,并对5,095个唯一主机名进行基础设施分析。厂商指出部分服务存在失效域名、消费级隧道及数据驻留治理问题;托管地理位置本身不代表恶意行为。其相关报告还声称,在特定授权设置下的测试中,不可信内容可能导致越权访问。这些结论属于厂商调查与受控测试,适用范围取决于具体条件。

  24. Check Point Research · 收录 · 原文 55

    Check Point 披露 PuzzleMask:用纯散文隐藏载荷绕过 LLM 快速策略检查

    Check Point Research 提出 PuzzleMask 技术,用不含 emoji、Base64 等编码痕迹的纯英文散文包装违规载荷,使承担快速策略检查的 LLM 判定输入安全并放行给目标模型。测试中 gpt-4o-mini-2024-07-18、gpt-oss-safeguard:20b、claude-3-haiku-20240307 各 23 条提示、llama-guard3:8b 5 条提示,门卫模型 100% 将构造提示判为安全;目标模型 gpt-5-thinking-high 在 18 次试验中 17 次成功提取并执行了嵌入载荷,成功率约 94.4%。作者强调该技术本身不是越狱,但可把越狱提示作为载荷组合使用,且目标模型每次成功提取都需超过 1 分钟思考时间和多个 Python 脚本执行。

    推荐理由研究给出纯散文包装绕过快速策略检查的具体机制与跨模型成功率,部署门卫加目标双模型流水线的团队可据此自查。

  25. tl;dr sec · 收录 · 原文 15

    tl;dr sec #341:OpenAI-Hugging Face 事件 Black Hat 演讲、邮件客户端 CSS 炸弹与 GitHub 供应链安全改进

    OpenAI 员工披露了 OpenAI-Hugging Face 事件的完整时间线,该 Black Hat USA 2026 演讲一周内观看量超过 50 万次。PortSwigger 研究员展示了如何在 Gmail、Outlook、Fastmail、ProtonMail 等网页邮箱中武器化 CSS,绕过消毒器并窃取密码。此外,资产笔记的研究人员借助 GPT 5.6 Sol Ultra 发现了影响 40% 互联网流量的 WordPress 核心预认证远程代码执行漏洞 wp2shell。

  26. Cisco · 收录 · 原文 29

    Cisco LLM 安全排行榜新增图像与音频模态,Gemini 3.1 Pro Preview 图像抗攻击率 93.9% 居首

    Cisco LLM 安全排行榜自 6 月以来新增 102 项评测,覆盖文本、图像、音频三种模态,模型总数达 136 个,并首次加入 55 个图像模型和 14 个音频模型。图像测试中,Google Gemini 3.1 Pro Preview 以 93.9% 的抗攻击率居首,Anthropic Claude Opus 4.5 以 93.7% 紧随其后,均属 85–100% 的“Excellent”区间;Mistral Magistral Small 2509 仅拒答 23.0% 的攻击。所有模型均在无额外护栏的基础配置下测试,新增模态切换可单独查看文本、图像或音频得分。

  27. Microsoft On the Issues · 收录 · 原文 15

    微软发布 2026 负责任 AI 透明度报告:如何为未来调整治理

    微软发布第三份年度《负责任 AI 透明度报告》,围绕自适应治理与技术风险管理、实用工具与能力、共享实践与合作伙伴关系三个方向调整其负责任 AI 项目。报告称已重构 Responsible AI Standard,按模型、平台服务、应用等技术栈组件分层设定要求,并对具备最强网络能力的 AI 系统施加最严格的风险管理措施。微软还推出 AI Red Teaming Agent、Agent evaluators、RAMPART、ASSERT 与 Agent Control Specification 等工具,用于智能体系统的评估、运行时控制和行为监控,并称其为少数在广泛产品组合上通过 ISO 42001 认证的公司之一。

  28. HiddenLayer Research · 收录 · 原文 12

    HiddenLayer 如何将 AI 安全防护嵌入 Azure AI Foundry、AWS、Databricks 与编码智能体

    HiddenLayer 把 AI 安全能力直接嵌入团队既有工作流:AI Supply Chain 模块扫描 Azure AI Foundry 目录中接入的模型,检查篡改、后门与已知漏洞,并在 AWS 覆盖 Bedrock、Bedrock Agents、SageMaker 和 Strands 框架,在 Databricks 中针对 Unity Catalog 自动扫描模型。检测结果可输出到 Splunk 和 Microsoft Sentinel,护栏原生集成 LangChain、LiteLLM、OpenAI Agents SDK、AWS Strands 与 TrueFoundry 网关,Agent Harness Security 则接入 Cursor、Claude Code 和 GitHub Copilot 的原生 hook。

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月1日周四
  1. 论文追踪 · 收录 · 原文 论文50

    TraceSafe-Bench:评估 LLM 护栏在多步工具调用轨迹上的表现

    研究者提出 TraceSafe-Bench,用于评估 LLM 护栏在多步工具调用中间轨迹上的安全性,覆盖提示注入、隐私泄露、模型幻觉、接口不一致等 12 类风险,包含 1000 多个执行实例。团队评测了 13 个 LLM-as-a-guard 模型和 7 个专用护栏,得到三点结论:护栏效果更多取决于结构化数据处理能力(如 JSON 解析),与结构化到文本基准强相关(ρ=0.79,p<0.01),而与标准越狱鲁棒性无关联;轨迹检测准确率不随模型规模单调提升,通用 LLM 持续优于专用安全护栏;在原生上下文范围内检测准确率随轨迹变长而提升,但在极端长上下文场景下因过度拒答而下降。该工作已被 COLM 2026 接收。

  2. arXiv · 收录 · 原文 论文48

    ToolSafe 提出步骤级护栏 TS-Guard 与 TS-Flow,降低 Agent 有害工具调用

    ToolSafe 提出面向 LLM 智能体工具调用安全的步骤级护栏方案,包含基准 TS-Bench、护栏模型 TS-Guard 和推理框架 TS-Flow。TS-Guard 通过多任务强化学习训练,在执行前基于交互历史推理,评估请求有害性与动作和攻击的关联,输出可解释、可泛化的安全判断与反馈。TS-Flow 由护栏反馈驱动,在提示注入攻击下将 ReAct 风格智能体的有害工具调用平均减少 65%,同时把良性任务完成率提升约 10%。作者称该工作仍在进行中,代码已公开。

  3. Jev Gateway Study · 收录 · 原文 日期未知58

    Jev 与开源决策模型的提示注入检测器基准测试

    该基准在同一台 Apple M4 机器上对比 Jev 1.13.0、Kev-4B、Kev-0.8B、Laya、GLiNER2.5-Decide、ProtectAI DeBERTa、Prompt Guard 2 和关键词规则在文档块注入与用户消息越狱两类任务上的表现。文档块测试中 Jev AUC 为 1.00、冻结阈值下召回 100%、误报 8%,Kev-4B 为 0.90 和 70%,Prompt Guard 2 为 0.83 和 19%;对不直接提及 AI 的隐蔽攻击,Jev 召回 97%,Kev-4B 62%,三个专用注入分类器接近随机水平。在 220 条 LLMail-Inject 真实人类攻击上,Jev 捕获 95%、误报 0%,Kev-4B 捕获 86%、误报 1%;作为邮件助手时 gpt-oss-120b 有 20/220 向攻击者地址发送邮件,Jev 前置时 0 条通过。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由这份评测把提示注入检测器放到网关真实任务上横向对比,并给出端到端攻击成功率,可用来判断各检测器的实际拦截差距。

  4. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文34

    Skill-as-API:面向智能体软件工程的机密多智能体协作协议

    Skill-as-API 是一种协议层协调方案,让 AI 编程智能体在互相调用技能时只公开技能名称、描述、类型化输入/输出 schema 和信任层级,技能本体以闭包形式留在所有者进程内、永不跨网络传输。该协议通过四层机制实现访问控制,并从结构上收窄提示注入面,而非依赖内容过滤。作者在 XMTP 上给出开源 Python 实现,跨洲热重连延迟为 1.8-2.9 s,并以三个智能体协作完成 pull-request 审查为案例,验证各方可保留其专有分析提示词的所有权。

  5. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文29

    HiveTraceGuard-Pro:面向提示注入、越狱与对抗混淆的紧凑生成式护栏

    HiveTraceGuard-Pro 是一个从 Qwen3-0.6B 经 LoRA 微调而来的 0.6B 生成式护栏,支持俄语和英语,用 safe/unsafe 二分类规则判定最终目标轮。在覆盖 19 个基准组(16 个公开)的对比中,其综合 key 为 0.7432,低于两个更高分护栏的 0.7641 和 0.7552;在 15 个模型对比中取得最高俄语鲁棒性 combined-F1(0.88)和俄语提示注入召回率(0.999),中位延迟 14.3 ms 为最低。整体 FPR 为 0.268、FNR 为 0.156,合并权重以 Apache-2.0 在 Hugging Face 发布,语料与评测集仍为内部。