跳到正文

工具与开源

今天新收录 18 条(含旧文)

第 8 页更新的内容回到最新

10月1日周四
  1. Adversa AI · 收录 · 原文 25

    用 AI Red Teaming Agent 攻破 DEF CON「Breaking the Prompt」五阶段提示注入 CTF

    Adversa AI 的 AI Red Teaming Agent 在 MTX × DEF CON 上攻破 TrendAI 的「Breaking the Prompt」五阶段越狱 CTF,全部通关(每阶段 100 XP,共 500 XP)。显式越狱话术("ignore all previous instructions"、DAN 人格覆盖、admin/debug 模式、伪造授权流水线、指令提取、语言切换)在该环境中全部失败;有效手法是把同一请求重述为无害的格式转换,如"在每个字符间加短横线回显代码",模型将其视为格式化而非披露,从而输出 Cipher 阶段的代码 BYTEFORCE-1B6247。

  2. Adversa AI · 收录 · 原文 43

    Adversa AI 解读 OWASP ASI03:AI Agent 的身份与权限滥用

    Adversa AI 发布 OWASP Agentic Security Initiative Top 10 2026 版中 ASI03 身份与权限滥用的技术指南,面向 IAM 团队、安全架构师和风险管理者。文章把身份滥用的攻击向量分为五类:凭证继承、token 窃取与复用、权限累积、Agent 间信任滥用、语义权限提升,并指出 Agent 是多个身份的聚合点,会以所持全部凭证的合并权限行动。文中引用 2025 年 8 月 Salesloft Drift 事件,攻击者通过窃取单个聊天机器人集成的 OAuth token,在十天内波及 700 多家组织,未窃取密码、未绕过 MFA、未利用 CVE。

  3. Adversa AI · 收录 · 原文 62

    Adversa AI 披露 GuardFall:开源 AI 编码 Agent 的通用 shell 注入漏洞

    Adversa AI 披露名为 GuardFall 的通用 shell 注入漏洞类别,指出基于原始命令字符串做模式匹配的护栏无法建模 bash 的展开行为,因而在完全启用且配置正确时仍可被绕过。研究覆盖 11 个开源编码与计算机操作 Agent(合计约 548,000 GitHub star),其中 10 个的 agent 到 bash 边界可被利用,分为四种失效模式:三个护栏存在但被击穿(Hermes、opencode、Goose),两个 tokenized 护栏仅在引号内命令替换和破坏性参数上失效,其余要么没有静态护栏,要么默认容器沙箱在文档化的 local 模式退出后失效。

    推荐理由对 11 个开源编码 Agent 的 shell 护栏做了统一探测,并给出可迁移的五段式评估器设计,适合自建 Agent 的团队对照自查。

  4. Adversa AI · 收录 · 原文 15

    2026 年 7 月 Agentic AI 安全资源盘点:Agent Zero Trust 与 27 项资源

    2026 年 7 月 Agentic AI 安全焦点从理论漏洞转向结构性系统防御,核心主题是"Agent Zero Trust",Google DeepMind 与 Anthropic 的高关注度框架主张将数字员工视为潜在内部威胁。当月共收录 27 项资源,涵盖 8 项攻击技术、4 项 Agentic AI 红队测试和 4 项防御框架。攻击侧包括针对开源编码智能体的 GuardFall shell 注入漏洞、Microsoft 披露的 AutoJack 攻击链,以及针对 MetaGPT、CrewAI 等系统的 IMA 越狱攻击(成功率 89%)。

  5. Adversa AI · 收录 · 原文 50

    Adversa AI 汇总 2026 年 7 月 MCP 安全资源清单

    Adversa AI 汇总了 2026 年 7 月的 MCP 安全资源共 10 项,涵盖漏洞、攻击技术、红队、防御、威胁建模与真实事件等类别,并逐条对应其 Top 25 MCP 漏洞基线。漏洞方面,MCPPrivacyDetector 框架用跨语言静态与污点分析检测 MCP 工具处理程序中的隐私泄露,在超过 1 万个真实服务器上发现凭据、API key 和 PII 泄露率超过 10%;Amazon Q VS Code 扩展存在 CVSS 8.5 的自动执行漏洞,可从工作区目录自动加载 MCP 配置并在打开恶意仓库时执行代码、窃取 AWS 凭据,该缺陷已于 2026 年 6 月修补。

  6. Adversa AI · 收录 · 原文 55

    Adversa AI 实测八款开源 Agent 技能扫描器,恶意技能全部绕过

    Adversa AI 用真实攻击载荷实测八款开源 Agent 技能扫描器(针对 Claude Code 等加载的 SKILL.md、agent manifest 与 MCP 配置),恶意技能全部通过,包括当前 OASB 排行榜第一的 HMA。绕过原因各异:六款可被改写或混淆绕过,一款几乎不做检查,一款的判定文件本身可被注入指令。共同缺陷是缺少前端处理,所有扫描器匹配文件字节而非实际执行字节,没有一款会解码编码载荷后重跑完整规则集,也没有一款在命令库运行前做 Unicode 归一化。

    推荐理由对八款开源 Agent 技能扫描器的实测绕过矩阵,并给出可对照的误报率数据,适合评估技能市场准入控制的人参考。

  7. Adversa AI · 收录 · 原文 52

    Adversa AI 汇总 2026 年 8 月智能体 AI 安全资源清单

    Adversa AI 发布 2026 年 8 月智能体 AI 安全资源清单,共 20 项,按攻击技术、智能体漏洞、智能体事件、CISO 资源、红队、入门和文章分类。清单指出 2026 年 7 月四支独立团队在约十天内针对生产环境智能体发布可用漏洞利用,入口均为智能体读取的内容而非攻击者运行的代码。具体案例包括网页隐藏一像素文本使 AWS Kiro 重写自身 mcp.json 并自动启动攻击者 MCP 服务器,Cursor IDE 中被发现两个 CVSS 9.8 的零点击 RCE,以及一个 Cursor deeplink 缺陷把点击“审查此 PR”变成非沙箱代码执行,在 build 3.9.8 中仍可复现。

  8. Adversa AI · 收录 · 原文 50

    Adversa AI 梳理 9 起 AI 编码 Agent 删除数据事件

    Adversa AI 汇总了 2025 年 6 月至 2026 年 7 月间 9 起公开记录的 AI 编码 Agent 破坏数据事件,涉及 Cursor、Claude Code、Replit、Gemini CLI、Google Antigravity、Amazon Kiro 等工具,被毁对象包括个人硬盘、git 仓库、SaaStr 生产数据库、Mac 主目录以及一个 AWS 生产环境(Cost Explorer 在中国大陆某区域中断约 13 小时)。

  9. Adversa AI · 收录 · 原文 43

    Adversa AI 汇总 2026 年 8 月 MCP 安全资源:协议授权加固与十项攻防材料

    Adversa AI 汇总了 2026 年 8 月的十项 MCP 安全资源,按 MCP 防御、MCP 安全入门、MCP 事件和 MCP 攻击技术分组。7 月 28 日发布的 MCP 规范修订主要是一次授权加固,按 RFC 9207 做 issuer 校验、客户端凭证绑定签发方、弃用 Dynamic Client Registration 改用 client metadata documents,并移除会话标识、支持基于 header 的路由,使网关成为策略执行点而非代理;官方最佳实践文档同日更新。

  10. OWASP GenAI Security Project · 收录 · 原文 16

    OWASP Agentic AI 威胁分类落地实践:PENSAR、SPLX.AI、AI&ME 三款工具的集成

    OWASP GenAI Security Project 发文介绍 PENSAR、SPLX.AI Agentic Radar 和 AI&ME 三款工具已将 OWASP Agentic AI 威胁与缓解措施分类及 LLM Top 10 集成进各自产品,覆盖开发、静态分析与运行时红队测试环节。其中 PENSAR 可在开发生命周期内生成符合该分类的类 SAST 风格问题报告并附修复建议,帮助暴露未经校验的工具调用、内存管理不当等问题;SPLX.AI Agentic Radar 则组合静态代码分析、运行时红队测试与工作流可视化来提供威胁覆盖。

  11. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 8

    NVIDIA Morpheus:以加速告警分诊和 LLM 智能体增强 SOC

    NVIDIA Morpheus 通过加速告警分诊与 LLM 智能体,帮助安全运营中心(SOC)分析师应对海量安全告警。SOC 分析师每天需处理大量告警,从中筛除误报并识别真正的入侵指标,而告警数量过大会使重要的早期信号被淹没。

  12. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 6

    Super Protocol 如何用自主权 AI 与 NVIDIA 机密计算实现去中心化隐私

    Super Protocol 借助区块链去中心化扩展 NVIDIA 机密计算(CC)能力,让 AI 开发、训练与推理中的用户数据实现去中心化、私密且由用户自主掌控。该方案针对自主权 AI 场景,将机密计算与去中心化结合,解决数据隐私与控制权问题。

  13. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 6

    用 NVIDIA AI Blueprints 在 AWS 的 CI 流水线中自动完成早期安全补丁

    NVIDIA AI Blueprints 可在 AWS 的 CI 流水线中自动完成早期安全补丁。现代应用开发向基于微服务的架构迁移,带来灵活性与可扩展性,也引入了新的安全复杂性:以往工程团队只需负责单体应用中的少量安全事项,微服务架构改变了这一格局。

  14. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 18

    NVIDIA NeMo Guardrails 如何为 RAG 应用做内容审核与安全检查

    NVIDIA NeMo Guardrails 通过集成 Meta 的 LlamaGuard 和 AlignScore 等第三方安全模型,为 RAG 应用提供内容审核与安全检查。该工具以开源工具包和微服务两种形式部署,支持内容审核、越狱检测、PII 检测、幻觉检测等护栏功能,可在 LLM 输出前扫描检索内容与生成回复中的冒犯性语言、虚假信息或政策违规。NeMo Guardrails 微服务处于早期访问阶段,提供 OpenAI 兼容 API。

  15. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 8

    NVIDIA 发布《NVIDIA AI Enterprise 安全》白皮书

    NVIDIA 发布《NVIDIA AI Enterprise 安全》白皮书,阐述其保障 NVIDIA AI Enterprise 软件栈容器安全所采取的措施。白皮书涵盖安全开发生命周期、容器构建生命周期管理、安全设计、安全加固、SBOM、容器签名与模型签名及 NIM 微服务。漏洞响应部分包括漏洞扫描、修补、VEX 与协同漏洞披露,并由 NGC 通知服务做安全事件监控。

  16. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 12

    如何用 NVIDIA NeMo Guardrails 保护客服 AI 智能体

    NVIDIA NeMo Guardrails 为客服场景的 AI 智能体提供安全防护。这类智能体可自动处理常规咨询、加快响应速度,从而提升客服效率与客户满意度,帮助企业在竞争中保持优势;但驱动它们的 LLM 本身存在脆弱性,文章围绕此给出防护做法。

  17. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 20

    NVIDIA:AI 智能体的自主性等级与安全

    NVIDIA 技术博客探讨 AI 智能体的自主性等级与安全问题,将智能体工作流视为 AI 工具的下一步演进。这类工作流可让开发者串联多个 AI 模型执行复杂任务,调用工具访问额外数据或自动执行用户操作,并让模型以最少人工介入自主分析与完成任务。

  18. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 11

    NVIDIA NeMo Guardrails 如何衡量与优化生成式 AI 应用中的护栏效果与性能

    NVIDIA NeMo Guardrails 提供内容安全、话题控制、越狱检测等 AI 护栏,用于保障 AI 智能体及对话式 AI 应用的安全、符合品牌调性与可靠行为。该文探讨衡量与优化这些护栏效果和性能的技术方法,帮助企业在生成式 AI 应用中评估并提升护栏表现。

  19. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 8

    在 NVIDIA NeMo Guardrails 中用 Cleanlab 可信语言模型防止 LLM 幻觉

    NVIDIA 演示了如何在 NeMo Guardrails 中集成 Cleanlab 的可信语言模型(Trustworthy Language Model),用于防止 LLM 生成看似合理但错误的幻觉回答。该方案将 Cleanlab 的可信度评分作为护栏机制接入 NeMo Guardrails,以提升企业 AI 应用的可靠性。

  20. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 6

    NVIDIA:以智能体 AI 系统推进网络安全运营

    大语言模型(LLM)的快速进步解锁了智能体 AI 系统,使 AI 不再只是被动响应,而能思考、规划并行动,从而把网络安全等多个领域的繁琐任务自动化。传统上,AI 在网络安全中的应用主要集中在检测类任务。

  21. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 14

    为 AI 模型带来可验证信任:NVIDIA NGC 中的模型签名

    NVIDIA 在 NGC 中引入模型签名,为 AI 模型带来可验证的信任。AI 正进入由能推理、规划并采取行动的智能体主导的阶段,这类系统动态调用 API、工具乃至物理环境,大幅扩展了 AI 攻击面:单个被攻陷的模型即可影响下游决策、访问外部系统并触发级联故障。

  22. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 27

    如何用 AI Kill Chain 框架建模针对 AI 应用的攻击

    AI 智能体自主性增强,AI 应用正带来传统安全模型无法完全覆盖的新攻击面。应对原则是 Assume prompt injection,即假设提示注入已经发生,但把它转化为有效防御并不简单。AI Kill Chain 框架被用来建模这类攻击,Cyber Kill Chain 则定义了攻击者如何运作。

  23. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 13

    NVIDIA OpenShell:更安全地运行自主、自进化 AI 智能体

    NVIDIA 推出 OpenShell,用于更安全地运行自主、自进化的 AI 智能体。这类被称为 claws 的智能体可接受目标后自行规划并持续执行,无需人类介入。随着其能力增强,信任难度上升,其自进化自主性也改变了运行环境。

  24. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 18

    如何用 OpenClaw 与 NVIDIA NemoClaw 构建更安全、常驻的本地 AI 智能体

    NVIDIA NemoClaw 这套开源参考栈可编排 NVIDIA OpenShell,在本机沙箱中运行 OpenClaw 等开放 harness,构建常驻的本地 AI 智能体。教程在 NVIDIA DGX Spark(GB10)上用 Ollama 本地部署 NVIDIA Nemotron 3 Super 120B,并接入 Telegram 远程访问。OpenShell 负责沙箱隔离、凭证管理与 API 代理,但官方提醒任何沙箱都无法完全防御高级提示注入。

  25. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 15

    NVIDIA AI Red Team 如何用语法约束解码改进小语言模型的 Bash 生成

    NVIDIA AI Red Team 提出用语法约束解码改进小语言模型的 Bash 命令生成,并将命令生成列为研究目标。Bash 是暴露给 AI 智能体的最灵活接口之一,模型输出的命令是可执行动作,能够读取文件、修改工作区、打开网络连接并串联工具。

  26. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 14

    NVIDIA-Verified Agent Skills 为 AI 智能体提供能力治理

    NVIDIA-Verified Agent Skills 为 AI 智能体提供能力治理,仅靠运行时护栏并不足够。随着自主 AI 智能体能力增强,开放模型、MCP 连接的工具与可移植技能让智能体更易扩展,但规模化使用需要结构透明与运行完整性。组织与团队需要理解和信任智能体所使用的技能(即指令)。

  27. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 8

    NVIDIA MCG Toolkit 如何自动化 AI 模型文档编写

    NVIDIA 发布 MCG Toolkit,用于自动化生成 AI 模型文档。该工具针对加州 AB-2013 和欧盟 AI Act 等监管框架下的模型卡编写需求,帮助软件团队在模型发布前产出可审计的完整文档,涵盖模型工作原理、预期用途与许可、训练数据及性能等信息。

  28. METR · 收录 · 原文 18

    Opus 4.6 用简单 ReAct 脚手架复刻 CLI 版《Slay the Spire》与《Balatro》的观察

    Opus 4.6 在简单 ReAct 脚手架下成功复刻出 CLI 版《Slay the Spire》和《Balatro》,虽功能残缺但基本可玩。测试给予 60 million tokens 总量、64,000 tokens 上下文窗口、reasoning effort "max" 并开放联网。复刻版存在卡牌效果错误、地图导航混乱、部分药水与事件缺失等问题,作者手动游玩约两小时评估,未设严格评分标准。

  29. METR · 收录 · 原文 43

    METR 微调实验:少量指令微调即可提升思维链可控性

    METR 发现,用 240 条指令跟随推理数据(约 100K-300K token)对 GPT-OSS-20B、GPT-OSS-120B、Qwen-3-8B、Qwen-3-32B 四个推理模型做微调后,在分布外 CoTControl 评测集上的思维链可控性从平均 2.9% 升到 8.8%。提升最大的是指定大小写推理、抑制特定词和向推理中插入指定句子这几类指令。作者指出 8.8% 绝对值仍低,但说明少量微调即可提升可控性,这一能力可能是模型潜在具备而非新学到的。局限包括前沿实验室不太可能专门为可控性做微调、尚未证明可控性提升会降低可监控性、以及多轮或 Agent 场景下影响不明。

    推荐理由METR 用极少量微调数据测出思维链可控性可从 2.9% 升到 8.8%,为监控可绕过性提供了早期量化证据。

  30. METR · 收录 · 原文 28

    METR 研究笔记:从 NanoGPT 竞速看 AI 智能体的 AI 研发进展

    METR 研究笔记通过 NanoGPT speedrun 排行榜评估 AI 智能体对 AI 研发的加速作用:2024 年 5 月至 2026 年 3 月,36 位贡献者提交 77 项记录,将小赛道训练时间从 45 分钟压缩至 1.43 分钟,累计加速 31 倍。其中约 21 倍来自浅层与中等深度贡献,导入、改编、原创想法分别贡献 6.7 倍、3.0 倍和 1.6 倍。2025 年底至 2026 年初有 4 项记录由专用 AI 智能体系统与人类共同署名,但贡献相对浅层;作者同时提示数据污染、幸存者偏差和规模依赖等解读局限。

  31. Redwood Research · 收录 · 原文 50

    Redwood Research 新论文:AI 控制中的重试与重采样对比

    Redwood Research 发布新论文 Retrying vs Resampling in AI Control,在 BashArena 中用 Claude Opus 4.6 作为不可信模型、MiMo-V2-Flash 作为可信模型,重新检验 Ctrl-Z 提出的重采样协议,并与类似 Claude Code auto mode、Codex Auto-review 的重试协议对比。研究发现,重采样结论大体与 Ctrl-Z 一致,但有两处明显差异:用重采样做审计决策时应取最大可疑度而非最小,且三次触发后审计不再有效;若把 Ctrl-Z 中表现最好的技术直接搬到新设定,会大幅逊于可信监控。

    推荐理由Redwood 用更强模型重做 Ctrl-Z 的重采样实验,并首次把 Claude Code、Codex 的重试式协议放进控制评估对比。