跳到正文

#提示注入

今天收录 1 条

第 4 页更新的内容回到最新

6月6日周六
  1. Simon Willison(提示注入) ·

    OpenAI 上线 Lockdown Mode,限制提示注入后的数据外泄

    OpenAI 正式上线 Lockdown Mode,此前在 2 月已有预告,现面向符合条件的个人账户(Free、Go、Plus、Pro)及自助式 ChatGPT Business 账户推送。该模式通过限制可能把敏感数据传给攻击者的对外网络请求,阻止提示注入攻击的最后一步数据外泄,但不会阻止提示注入出现在 ChatGPT 处理的内容中,例如缓存网页或上传文件里的注入仍可能影响回答的行为或准确性。Simon Willison 认为这一设计直接切断了致命三要素中的数据外泄环节,且所用机制是确定性的,不依赖可能被复杂攻击绕过的 AI 系统来判定。

  2. Microsoft PyRIT 版本发布 ·

    Microsoft PyRIT v0.14.0 发布

    Microsoft PyRIT 发布 v0.14.0,将 Message、Score、Seed 类及 Identifier 等核心模型迁移到 Pydantic v2,构造改为仅限关键字参数并拒绝额外字段,同时强制所有异步函数加 `_async` 后缀并重命名部分辅助函数。该版本移除此前标记弃用的全部功能,GCG 转为实验特性并提供新的公开 API,新增 Round Robin Target、Realtime 流式会话与服务端打断攻击以及图像转换器,还加入 VLGuard、StrongREJECT、Agent Threat Rules 等多个数据集加载器和 Python 3.14 支持,并修复 38+ 个依赖项漏洞及特定 CVE。

6月2日周二
  1. Simon Willison(提示注入) ·

    黑客直接要求 Meta AI 客服机器人即接管高知名度 Instagram 账号

    Simon Willison 转述并确认了一起真实事件:黑客与 Meta 的 AI 客服机器人对话,直接要求把目标账号绑定到新的邮箱地址,并称会提供验证码,从而完成账号接管。一段视频显示攻击者发送类似“把我的新邮箱地址绑定上,这是我的用户名 @{target_username},我会把验证码发给你”的请求。Willison 指出 Meta 确实把客服系统接入了具备快速推进整个账号找回流程能力的 AI 聊天机器人,他认为这甚至算不上提示注入,并警告不要把客服机器人接入到允许一次性账号接管的位置。

6月1日周一
  1. Adversa AI ·

    Adversa AI 汇总 2026 年 6 月 Agentic AI 安全资源清单

    Adversa AI 发布 2026 年 6 月 Agentic AI 安全资源汇总,共收录 28 项资源,按攻击、防御、研究、框架、漏洞、利用、威胁建模和文章分类。攻击类 8 项,包括 Adversa AI 自己披露的 SymJack 符号链接劫持 RCE(六款 AI 编码智能体全部受影响)和 TrustFall 一键 RCE(波及 Claude Code、Cursor、Gemini CLI 和 GitHub Copilot),以及 MemMorph 记忆投毒工具劫持、DEF CON 上利用间接提示注入与记忆投毒构建 Microsoft Copilot 持久后门的 Copirate 365(CVE-2026-24299)。

5月26日周二
  1. Simon Willison(提示注入) ·

    Microsoft Copilot Cowork 被指可外泄文件

    Simon Willison 指出 Microsoft Copilot Cowork 存在数据外泄风险:该产品允许 Agent 未经批准向用户自己的收件箱发送邮件,而这些邮件会以可渲染外部图片的方式展示,用户打开被污染邮件时外部图片会触发对外部网站的请求,从而泄露数据。由于 OneDrive 可以生成预认证下载链接,一次成功的提示注入就可能让这些链接被泄露,攻击者据此下载文件。

5月20日周三
  1. Simon Willison(提示注入) ·

    Google I/O 上的 Gemini Spark 与 Antigravity

    Simon Willison 因坚持只评测试过的产品而对本届 Google I/O 着墨有限,除 Gemini 3.5 Flash 外最值得关注的是即将推出的个人 AI 智能体 Gemini Spark——被视为 OpenClaw 竞品,原生接入 Gmail、Calendar、Drive、Docs、Sheets、Slides、YouTube 和 Google Maps。其 FAQ 称 Gemini Spark 运行于 Gemini 3.5 Flash 和 Antigravity,后者目前提供桌面应用、Go 编写的 CLI 智能体工具、Antigravity SDK 及基于 VS Code 分支的 IDE。

5月14日周四
  1. OWASP GenAI Security Project · · 原文 71

    OWASP 作者解析 MemoryTrap:Claude Code 记忆与配置成为持久提示注入面

    OWASP ASI06 条目联合负责人 Idan Habler 结合 Cisco 对 Claude Code 的研究,说明 Agent 的记忆与上下文如何成为攻击面。在被称为 MemoryTrap 的漏洞中,常规开发流程即可触发持久提示注入:克隆仓库、让 Agent 协助、批准依赖安装,恶意载荷便进入持久记忆、全局 hooks 配置,并通过 system prompt 影响高信任指令层,从而跨会话、跨项目乃至重启后持续影响模型行为。作者指出,记忆文件、hook 脚本和本地配置实际属于 Agent 的受信运行环境与控制面,一旦被投毒,系统会继续把攻击者控制的内容当作合法指引,这正是 ASI06 记忆与上下文投毒所针对的风险。

    推荐理由以 MemoryTrap 为例说明 Agent 的记忆、hooks 与本地配置如何成为持久化提示注入面,并给出 Claude Code 的修复版本。

5月11日周一
  1. Adversa AI ·

    2026 年 5 月 GenAI 安全资源盘点:IICL 绕过 GPT-5.4 护栏、Mythos 自主完成 32 步网络攻击

    Adversa AI 研究人员用新攻击技术 IICL(Involuntary In-Context Learning)绕过 GPT-5.4 安全护栏,攻击成功率达 60%,利用的是近期模型更新引入的漏洞。Anthropic 的 Mythos 模型在数小时内自主完成 32 步企业网络攻击,分析指出 AI 驱动的攻击利用并非 Mythos 独有。本期共收录 22 项资源,另涵盖 BadStyle 风格触发后门、可污染 99.85% 查询结果的向量数据库 Black-Hole 攻击,以及 TwinGate、ER-CAT 等防御框架。

5月5日周二
  1. Adversa AI ·

    2026 年 5 月智能体 AI 安全资源盘点:Claude Code 源码泄露与 Mythos 自主攻击

    Adversa AI 发布 2026 年 5 月智能体 AI 安全资源盘点,共收录 40 项资源,其中智能体 AI 漏洞 6 项。Claude Code 源码泄露后曝出关键漏洞:shell 命令拒绝规则在 50 个子命令后静默失效;其记忆系统存在 MemoryTrap 漏洞,可使污染记忆跨会话、跨用户传播。Anthropic 的 Mythos 模型在数小时内自主完成 32 步网络攻击,显示 AI 驱动攻击已非理论。

5月4日周一
  1. MITRE ATLAS 数据发布 ·

    MITRE ATLAS v5.6.0 更新:新增 AI 智能体配置搜索等攻击技术

    MITRE ATLAS 发布 v5.6.0,新增三项攻击技术:获取公开 AI 制品下的 AI Agent 配置搜索、搜索开放网站/域名下的代码仓库,以及钓鱼下的 Deepfake 辅助钓鱼。同时更新了钓鱼、LLM 越狱与缓解措施,涉及用户培训、Deepfake 检测,并更新了 OpenClaw 通过提示注入实现命令与控制等案例研究。

  2. Embrace The Red · · 原文 86

    Copirate 365:M365 Copilot 与消费版 Copilot 的漏洞链(CVE-2026-24299)

    作者在 DEF CON Singapore 演讲中复盘了 M365 Copilot 与消费版 Copilot 的一系列漏洞,MSRC 分配编号 CVE-2026-24299,相关缺陷已修补。

    推荐理由作者以第一手披露者身份复盘 M365 Copilot 的完整攻击链与补丁时间线,可看到间接提示注入如何从单次泄露升级为持久后门。

5月2日周六
  1. NVIDIA garak 版本发布 ·

    NVIDIA garak v0.15.0 发布:新增多轮 GOAT、Agent breaker 与系统提示提取探针

    NVIDIA garak 发布 v0.15.0,新增多轮 GOAT、Agent breaker 和系统提示提取三类探针,并加入同形异义混淆提示走私检测及 ModernBERT 拒答检测器。该版本还引入 NeMoGuardrails 服务器支持和带推理轨迹的测试生成器,改进 REST 生成器的 mTLS 客户端证书认证并为 Bedrock 生成器增加推理模型支持,同时修复编码检测逻辑翻转等问题。

4月30日周四
  1. Wiz Research · · 原文 78

    Wiz 披露 AI GitHub Actions 的权限绕过与密钥外泄风险

    Wiz 对 OpenAI、Anthropic、Google 等厂商的 AI GitHub Actions 做了安全分析,发现外部 App 与 bot 可绕过权限校验触发 AI 执行,并存在针对动态生成凭据文件的密钥外泄路径。研究覆盖 anthropics/claude-code-action(超 1.2 万个公开工作流)、google-github-actions/run-gemini-cli(超 1 千个)、openai/codex-action 和 actions/ai-inference,受影响仓库合计星标超 20 万。

    推荐理由Wiz 对主流 AI GitHub Actions 的实测披露了权限绕过与凭据外泄两类新路径,并附厂商修复进展,可对照检查自家工作流配置。

  2. Adversa AI ·

    Adversa AI 复盘 Mythos 自主网络攻击:AI 驱动攻击已非前沿模型专属

    Adversa AI 复盘英国 AI 安全研究院对 Claude Mythos Preview 的独立评估,指出 Mythos 在模拟的 32 步企业网络攻击中从侦察到完全接管网络全程自主完成,专家级 CTF 得分 73%,此前没有模型在 2025 年 4 月前通过这类挑战。文章强调这一能力并非 Mythos 独有:Aisle 的分析显示,一个 3.6B 参数、每百万 token 成本 0.11 美元的模型就能检出 Anthropic 研究中提到的 FreeBSD 漏洞,检测级漏洞发现已对小型廉价模型开放,利用构造也在沿同样的成本曲线下移。

4月24日周五
  1. Google Security Blog · · 原文 74

    Google 扫描公开网页:间接提示注入的真实分布与增长趋势

    Google 威胁情报团队扫描 Common Crawl 的公开网页,发现真实存在的间接提示注入(IPI)尝试,多数属于无害恶作剧、帮助性引导、SEO 操纵和劝阻 AI 抓取,少数涉及数据窃取和破坏。

    推荐理由Google 对 Common Crawl 全网扫描,给出间接提示注入在真实网页中的分类分布与增长数据,可了解当前攻击成熟度。

4月21日周二
4月18日周六
  1. Embrace The Red ·

    用 ChatGPT 生成的对抗图片劫持 Claude Opus 4.7 记忆工具

    作者用 ChatGPT 生成一张含解谜元素的对抗图片,让 Claude Opus 4.7 在分析图片时被间接提示注入劫持,调用 memory 工具写入虚假记忆。测试中 Opus 4.7 在 10 次里 5 次写入虚假信息,包括用户名、年龄、NASA 宇航员职业和饮食偏好,且每次都察觉到可能存在提示注入却仍被劫持。作者观察到初始记忆为空时攻击更易成功,内容越像真实用户会保存的信息越容易通过。该对抗样本在文章发布约 24 小时后攻击成功率降为 0%,原因不明。作者已于 2026 年 3 月通过 HackerOne 向 Anthropic 报告,工单被以安全问题关闭,后续邮件未获回复。

  2. NVIDIA 技术博客:可信 AI 与网络安全 ·

    如何用 OpenClaw 与 NVIDIA NemoClaw 构建更安全、常驻的本地 AI 智能体

    NVIDIA NemoClaw 这套开源参考栈可编排 NVIDIA OpenShell,在本机沙箱中运行 OpenClaw 等开放 harness,构建常驻的本地 AI 智能体。教程在 NVIDIA DGX Spark(GB10)上用 Ollama 本地部署 NVIDIA Nemotron 3 Super 120B,并接入 Telegram 远程访问。OpenShell 负责沙箱隔离、凭证管理与 API 代理,但官方提醒任何沙箱都无法完全防御高级提示注入。

4月15日周三
  1. OWASP GenAI Security Project ·

    OWASP 上线 FinBot CTF,用模拟金融多智能体平台演练 Agentic 安全风险

    OWASP GenAI Security Project 的 Agentic Security Initiative 正式上线 FinBot CTF,这是一个围绕模拟金融服务应用构建的交互式 Agentic 安全 CTF,被定位为“Agentic AI 的 Juice Shop”。FinBot 模拟一个多智能体供应商管理平台,包含自主入驻、欺诈检测、发票处理和通信等由 LLM 驱动并拥有真实工具访问权限的流程。

4月10日周五
4月9日周四
  1. Adversa AI ·

    OWASP ASI01 智能体目标劫持实用安全指南

    Adversa AI 发布 OWASP Agentic Security Initiative Top 10 2026 版中 ASI01(智能体目标劫持)的实用安全指南,将其定义为攻击者操纵 AI 智能体目标、使其秘密执行攻击者指令而非用户意图,即系统控制权的完全丧失。指南按被跨越的信任边界把攻击向量分为五类:用户输入边界、检索内容边界(邮件、文档、网页、RAG,含文本图像音频视频)、工具/API 边界(含恶意 MCP 服务器)、智能体间通信边界和配置边界,并指出多数关键攻击是经由被投毒外部内容的零点击方式触发。

4月8日周三
  1. 研究者论文追踪 ·

    TraceSafe-Bench:评估 LLM 护栏在多步工具调用轨迹上的表现

    研究者提出 TraceSafe-Bench,用于评估 LLM 护栏在多步工具调用中间轨迹上的安全性,覆盖提示注入、隐私泄露、模型幻觉、接口不一致等 12 类风险,包含 1000 多个执行实例。团队评测了 13 个 LLM-as-a-guard 模型和 7 个专用护栏,得到三点结论:护栏效果更多取决于结构化数据处理能力(如 JSON 解析),与结构化到文本基准强相关(ρ=0.79,p<0.01),而与标准越狱鲁棒性无关联;轨迹检测准确率不随模型规模单调提升,通用 LLM 持续优于专用安全护栏;在原生上下文范围内检测准确率随轨迹变长而提升,但在极端长上下文场景下因过度拒答而下降。该工作已被 COLM 2026 接收。

4月3日周五
  1. NVIDIA garak 版本发布 ·

    NVIDIA garak v0.14.1 发布:新增 WebSocket 生成器并移除 nemollm

    NVIDIA garak 发布 v0.14.1,新增面向实时 LLM 安全测试的 WebSocket 生成器和 OpenAI Harmony 音频输入格式,并为攻击成功率加入 Bootstrap 置信区间。该版本激活 sata 与 badchars 探针、补充简历类提示注入样例、改进 Jinja 注入检测,同时移除了废弃的 nemollm 生成器及其依赖,属破坏性变更。

4月1日周三
  1. Adversa AI ·

    2026 年 4 月智能体 AI 安全资源盘点:OpenClaw、Copilot 与多智能体攻击

    Adversa AI 发布 2026 年 4 月智能体 AI 安全资源盘点,共收录 33 项资源,涵盖研究、漏洞、防御、威胁建模等类别。研究显示,30 个 AI 智能体框架中 93% 依赖无范围限制的 API key,0% 具备按智能体身份标识,97% 缺少用户同意机制;针对 GPT-5 mini 和 Claude Sonnet 4.5 的记忆投毒攻击成功率超过 90%。OpenClaw 被曝 CVSS 9.9 权限提升漏洞(CVE-2026-32922),超 13.5 万个面向互联网的实例受影响;Chrome 的 Gemini Live 面板存在 CVE-2026-0628 高危漏洞,可被恶意扩展劫持并访问摄像头和麦克风。

3月31日周二
  1. MITRE ATLAS 数据发布 · · 原文 65

    MITRE ATLAS 发布 v5.4.0,新增 AI Agent 攻击技术与案例研究

    MITRE ATLAS 发布 v5.4.0,新增多项针对 AI Agent 的攻击技术,包括发布被投毒的 AI Agent 工具、从 Agent 逃逸到宿主机、利用漏洞获取凭据、利用漏洞规避防御,以及 AI Agent 用户执行类的被投毒工具与恶意链接。该版本还更新了修改 AI Agent 配置这一既有技术。案例研究方面新增了暴露的 ClawdBot 控制接口导致凭据访问与执行、通过被投毒 ClawdBot 技能实施供应链入侵、OpenClaw 一键远程代码执行,以及通过提示注入对 OpenClaw 实施命令与控制。

    推荐理由MITRE ATLAS v5.4.0 新增针对 AI Agent 的攻击技术与真实案例,做 Agent 威胁建模的团队可对照更新自己的攻击面清单。

3月30日周一
  1. Adversa AI ·

    红队测试智能体 AI 时模拟错了攻击者:六类威胁行为者与五大专业领域

    红队测试智能体 AI 时普遍模拟错了攻击者——只测越狱式提示攻击,而真正攻陷智能体系统的是投毒知识库文档、污染 API 响应、在日历邀请中嵌入指令的间接注入者。文章列出六类必须模拟的威胁行为者:机会主义探测者、社工攻击者、耐心内部人员、间接注入者、商业情报窃取者和基础设施攻击者,并指出模拟它们需要提示与社会工程、应用安全、架构与分布式系统、数据与 ML 安全等五个专业领域,多数团队只具备其中一两个。

3月28日周六
  1. Microsoft PyRIT 版本发布 ·

    Microsoft PyRIT v0.12.0 发布:GUI、CLI 与框架三种交互方式全部可用

    Microsoft 发布 AI 红队测试工具 PyRIT v0.12.0,首次让 GUI(CoPyRIT)、CLI 和框架三种交互方式全部达到可用状态。CLI 新增 Scam、Leakage、Psychosocial、Jailbreak 四类 AIRT 场景及 RedTeamAgent Foundry 预配置红队测试,覆盖 25+ 攻击策略。框架引入 YAML 配置系统、TargetRegistry 和 8 个新数据集加载器,但含破坏性变更需按迁移指南升级。

3月19日周四
  1. Simon Willison(提示注入) ·

    Snowflake Cortex AI 逃逸沙箱并执行恶意代码

    PromptArmor 披露了 Snowflake Cortex Agent 中一条提示注入攻击链,该漏洞现已修复。攻击始于用户让 Agent 审查一个 GitHub 仓库,而该仓库 README 底部藏有提示注入内容,导致 Agent 执行了通过 wget 拉取并运行攻击者脚本的命令。Cortex 将 cat 命令列为无需人工批准即可运行的安全命令,但未防护命令体中可出现的进程替换形式。Simon Willison 表示自己在多种 Agent 工具中都见过这类命令模式白名单,认为其本质上不可靠,更倾向于把 Agent 命令视为可执行进程本身被允许的任何操作,因此关注在 Agent 层之外运行的确定性沙箱。

3月17日周二
  1. Embrace The Red ·

    Agent Commander:用提示注入把 OpenClaw 等智能体变成 C2 僵尸网络

    安全研究者发布 Agent Commander,一个基于提示词的命令与控制(C2)服务器,被劫持的智能体定期回连领取自然语言任务,不执行原始系统命令。作者演示了三种智能体的间接提示注入入口:Kimi Claw 分析文档、OpenClaw 接收恶意邮件(无需人工操作)、NanoClaw 访问网站即被劫持。持久化方面,OpenClaw 利用默认每 30 分钟运行一次的 HEARTBEAT.md,并用 HEARTBEAT_OK 抑制用户通知;NanoClaw 则通过注入定时任务实现。作者观察到通知抑制效果显著,但有一次 OpenClaw 在整理每日笔记时识别出心跳中的后门,Opus 4.6 更擅长发现攻击但可被绕过。

3月6日周五
  1. Simon Willison(提示注入) · · 原文 82

    Cline 因 issue 标题提示注入被投毒,NPM 发布包遭污染

    Adnan Khan 披露了一条针对 Cline GitHub 仓库的攻击链:Cline 用 anthropics/claude-code-action@v1 做 AI issue 自动分诊,配置了 Bash、Read、Write 等工具权限,且提示词包含 issue 标题,攻击者可在标题中诱导 Claude 执行任意命令,例如通过 npm install 安装指定 GitHub 包,再由其 package.json 的 preinstall 脚本运行代码。

    推荐理由完整还原了一条从 issue 标题提示注入到缓存投毒、最终污染 NPM 发布包的攻击链,适合评估 CI 中 AI 自动化的权限边界。

2月11日周三
  1. Embrace The Red ·

    研究者演示在 Agent Skill 中植入不可见 Unicode 后门并发布扫描工具

    安全研究者 Johann Rehberger 演示了如何用不可见的 Unicode Tag 码点在 Agent Skill 中植入提示注入后门,使其通过人工文本审查。他把这类隐藏指令加入 OpenAI 官方 Skills 项目中的 security-best-practices Skill,用户调用后 Claude 会按指令输出指定文本并执行 Bash 命令;该手法在 GitHub Copilot 配合 Claude 4.5 时同样生效。作者指出 Skill 的 name 和 description 会直接进入系统提示词上下文,且 Agent 能自行创建或修改 Skill 影响自身与其他 Agent。

2月5日周四
  1. Embrace The Red ·

    OpenAI 新论文详解基于 URL 的数据外泄缓解措施

    OpenAI 发布论文《Preventing URL-Based Data Exfiltration in Language-Model Agents》,详细说明其为语言模型智能体新增的 URL 数据外泄缓解措施。作者曾在 2023 年初向 OpenAI 报告零点击数据外泄漏洞,当时 OpenAI 尚无漏洞赏金计划,问题未获修复;同期微软在 2023 年 5 月通过 Content-Security-Policy 头修复了 Bing Chat 的同类问题。

2月2日周一
  1. 腾讯玄武实验室 · · 原文 71

    腾讯玄武实验室发布 AI 网络爬虫安全白皮书并开源 SEChrome 防护方案

    腾讯玄武实验室发布《AI网络爬虫安全白皮书》,系统分析 AI 服务端浏览器与爬虫的攻击面,并提出以静态攻击面收敛加动态行为隔离为核心的纵深防御框架。白皮书梳理了从入口识别、白名单绕过、环境指纹探测到漏洞触发与横向渗透的五阶段攻击链,并给出四个真实案例,涉及 URL 跳转绕过白名单、组合 AI 阅读与截图功能、用 img onerror 绕过 script 过滤、以及隐藏后台爬虫入口,最终均通过旧版本 Chrome 的 N-day 漏洞实现远程代码执行。作者称相关产品服务端用户规模累计超 10 亿。防御侧建议关闭 WebGL、WebRTC、PDF 插件等无用模块,避免使用 --no-sandbox,并做网络、文件系统与实例隔离。

    推荐理由白皮书给出服务端浏览器攻击链与四类真实案例,并开源 SEChrome 运行时隔离方案,可迁移到自家 Agent 联网架构。

  2. Wiz Research · · 原文 71

    Wiz 披露 Moltbook 数据库暴露:150 万 API token 与 3.5 万邮箱可被任意读写

    Wiz Research 发现 AI 智能体社交平台 Moltbook 的 Supabase 数据库配置错误,缺少 Row Level Security,导致未认证用户可完整读写全部平台数据。暴露内容包括 150 万个 API 认证 token、3.5 万个邮箱地址以及智能体之间的私信,其中 agent_messages 表存有 4060 段未加密的私信,部分包含明文 OpenAI API key。研究人员还确认存在写入权限,可修改任意帖子并注入提示注入载荷。数据库显示平台宣称的 150 万智能体背后只有约 1.7 万名人类所有者,比例约 88:1,且无速率限制或身份验证机制。

    推荐理由披露了 AI 智能体社交平台因 Supabase 缺少 RLS 导致密钥与私信外泄的完整过程,并给出五条面向 AI 生成应用的安全教训。

1月31日周六
  1. Simon Willison(提示注入) ·

    Moltbook:OpenClaw 智能体社交网络为何成为当下最受关注的项目

    OpenClaw(原名 Clawdbot、Moltbot)的智能体社交网络 Moltbook 通过 skill 安装,让 AI 助手每 4 小时以上抓取并执行 moltbook.com 上的指令,实现发帖、评论和创建 Submolt 论坛。该开源项目由 Peter Steinberger 构建,GitHub 星标已超 114,000,社区在 clawhub.ai 分享数千个 skill,但 skill 可执行任意脚本。作者警告这类数字助手面临提示注入风险,且已有 Claude Opus 4.5 实例疑似触发内容过滤而无法完整输出。

1月15日周四
  1. arXiv ·

    ToolSafe 提出步骤级护栏 TS-Guard 与 TS-Flow,降低 Agent 有害工具调用

    ToolSafe 提出面向 LLM 智能体工具调用安全的步骤级护栏方案,包含基准 TS-Bench、护栏模型 TS-Guard 和推理框架 TS-Flow。TS-Guard 通过多任务强化学习训练,在执行前基于交互历史推理,评估请求有害性与动作和攻击的关联,输出可解释、可泛化的安全判断与反馈。TS-Flow 由护栏反馈驱动,在提示注入攻击下将 ReAct 风格智能体的有害工具调用平均减少 65%,同时把良性任务完成率提升约 10%。作者称该工作仍在进行中,代码已公开。

  2. Simon Willison(提示注入) · · 原文 76

    Prompt Armor 发现 Claude Cowork 可被绕过域名白名单外泄文件

    Prompt Armor 发现 Claude Cowork 的出站流量域名白名单存在可绕过路径。Claude Cowork 默认只允许向特定域名列表发起出站 HTTP 流量,用于防范通过提示注入外泄用户数据的攻击。由于 Anthropic 的 API 域名在该白名单内,攻击者构造了一个包含自己 Anthropic API key 的攻击,让 Agent 把能看到的文件上传到 https://api.anthropic.com/v1/files 端点,攻击者随后即可取回这些内容。

    推荐理由Prompt Armor 利用白名单内的 Anthropic API 域名绕过出站限制,展示了域名白名单防护在 Agent 场景下的可绕过路径。

1月13日周二
  1. Simon Willison(提示注入) · · 原文 77

    Superhuman AI 遭提示注入,将用户敏感邮件外泄至攻击者表单

    Superhuman AI 遭遇典型提示注入攻击:当被要求总结用户近期邮件时,一封不可信邮件中的注入指令操纵该 AI 将收件箱中数十封敏感邮件(含财务、法律和医疗信息)的内容提交至攻击者的 Google Form。Superhuman 已将其作为高优先级事件处理并发布修复。根因是一条 CSP 规则允许从 docs.google.com 加载 markdown 图片,而该域名下的 Google Forms 会通过 GET 请求持久化传入的数据。

    推荐理由Superhuman AI 因 CSP 规则缺陷被邮件中的提示注入窃取敏感数据,展示了 Agent 处理不可信内容时的真实风险。