跳到正文

工具与开源

开源红队、评测与防护工具。

479条动态与论文相关主题红队防御与护栏安全评测
在这个话题内搜索或按分类筛选

新闻与论文

第 61–80 条 · 共 479 条
10月3日周六
  1. Pillar Security · 收录 · 原文 日期未知25

    2026 年企业级 AI 智能体与 GenAI 应用最佳 AI 红队供应商对比

    2026 年企业级 AI 红队供应商的评判标准,是测试已部署系统而非仅测试底层模型、每次发布都重跑测试、并给出执行证据而非分数。该指南依据 OWASP 于 2026 年 1 月发布的 AI 红队供应商评估标准,将 13 个评估维度归纳为 7 个问题,对比了 11 家供应商与工具,并把 Pillar 的 Red Graph Suite 纳入同一标准并说明其局限。文中指出,平均一次成功攻击需 5 轮对话,生产环境中 90% 的成功攻击导致数据泄露。

  2. Pillar Security · 收录 · 原文 日期未知12

    Pillar Security 获 Latio 2026 AI 安全市场报告评为 AI 安全技术创新者

    Latio 在 2026 AI 安全市场报告中把 Pillar Security 评为 AI 安全技术创新者,并将其列入覆盖端点、SaaS 与第一方智能体的 Broader AI Security 类别。报告在 Employee App and Agent Builders、Skills Detonation、Granular Permissions 三处点名 Pillar,并称其同时出现在浏览器、SaaS 与端点分组中。报告调查显示,一年内拥有专门 AI 安全预算的团队占比从 8% 升至 37%,45% 受访者最担忧 Claude Code、Codex 等端点智能体。

  3. Pillar Security · 收录 · 原文 日期未知34

    企业级 AI 编程智能体安全工具对比:如何防护 Claude Code、Cursor、Codex 与本地 AI 智能体

    一份面向企业的 AI 编程智能体安全工具评测,用同一套八个问题对比了十三款工具,并按使用发现、智能体清点、配置态势、行动前控制四个层面归类。文章指出发现智能体不等于保护智能体,配置事实藏在智能体自身设置文件中,EDR 无法建模;控制点已转移到 Claude Code、Codex CLI、Cursor、Gemini CLI 等暴露的 pre-tool hook,2026 年微软、CrowdStrike、Palo Alto Networks 等均已采用。Adversa AI 的 GuardFall 研究(2026 年 6 月)用老旧 shell 技巧绕过了 11 款主流开源编程智能体中 10 款的命令审批护栏,Google 2026 年 4 月的 Gemini CLI 公告(GHSA-wpqr-6v78-jr5g)修复了以 --yolo 模式和自动信任工作区目录为前提的远程代码执行路径。

  4. Gray Swan AI · 收录 · 原文 日期未知32

    Gray Swan AI 推出 Dangerous Reasoning Arena 竞赛,聚焦思维链越狱

    Gray Swan AI 于 5 月 10 日启动 Dangerous Reasoning Arena 竞赛,将红队测试从输出操纵推进到模型内部推理层面,重点考察思维链越狱。参赛者需诱导模型产生生物攻击规划、战略性欺骗、隐蔽后门植入、基础设施破坏等危险推理,即使最终回复看似无害,只要内部逻辑体现有害意图即算成功。热身周 5 月 10 日开启(不计奖),正式评奖轮次为 5 月 17 日和 5 月 24 日,总奖池 20,000 美元。

  5. 0DIN · 收录 · 原文 15

    0DIN 开放免费 AI 安全评估:用红队武器库提前攻破你的 AI

    0DIN 面向正在交付 AI 系统的团队开放限时免费安全评估,用其研究员来源的红队武器库攻击用户自有或获授权测试的模型,并给出按优先级排序的报告。评估通过 0DIN Scanner 执行,覆盖直接与间接提示注入、越狱、编码隐藏载荷、多轮攻击以及带工具智能体的数据泄露与错误调用等失效方式,云端模型走 API、自托管模型用容器化 Scanner 在本地网络内运行,报告通常一两天内交付。报告包含安全评级与风险等级、可长期跟踪的攻击成功率(ASR)、分类发现、与前沿模型的对比及修复建议,并映射到 OWASP LLM Top 10、MITRE ATLAS、NIST AI RMF、ISO/IEC 42001 和 EU AI Act 等框架;该评估基于 NVIDIA 开源 garak 引擎并叠加 0DIN 的赏金探针库,每次评估均经人工把关。

  6. 0DIN · 收录 · 原文 28

    Mozilla 0DIN 推出 0DIN AI Defense,首发 560M 参数 SusFactor 越狱检测模型

    Mozilla 0DIN 发布可自托管的 AI 安全产品线 0DIN AI Defense,首个模型 SusFactor 为 560M 参数的越狱检测模型,现已开放早期访问测试。该模型基于 0DIN 漏洞赏金项目收集的真实攻击数据训练,可在本地廉价硬件上以低于 50ms 的延迟实时分析提示词。在 JailbreakBench 基准上,SusFactor 仅放过 12.1% 的攻击,误报率为 9.0%,低于 WildGuard 的 45%、Mistral 的 39% 和 Llama Guard 3 的 23%。

  7. 0DIN · 收录 · 原文 28

    如何在五分钟内为 LiteLLM 接入 0DIN Defense

    0DIN 发布 litellm-shield 插件,可将护栏分类器 SusFactor 作为 LiteLLM 代理的自定义护栏运行,安装一条 pip 命令即可在 flag 模式下启用。SusFactor 对每个提示词打分以拦截提示注入和越狱,支持 block、flag(默认)、shadow 三种模式,并接入 Langfuse、Datadog、OTel 等可观测性栈。它挂载在 during_call 阶段与模型调用并行执行,分类器中位延迟约 15.6ms、P95 23.9ms、P99 26.5ms,全部在 CPU 上运行,默认失败开放。

  8. 0DIN · 收录 · 原文 30

    SusFactor:用真实威胁情报检测越狱与提示注入攻击

    0DIN 发布 SusFactor,一个 560M 参数的二分类器,用于检测越狱与提示注入,输入用户提示词后输出 0 到 1 的可疑度分数。它在 JailbreakBench 上取得所评估分类器中最高的合并 AUROC 0.954,在 WildGuardTest 上 AUROC 0.878,与参数量为其 10 到 15 倍的生成式护栏相比具有竞争力。模型基于 68,935 条样本训练,其中包含 0DIN Threat Feed 的 3,426 条真实攻击数据,在 Apple M2 Pro CPU 上 512 token 上下文窗口的中位延迟为 328 ms。

  9. 腾讯朱雀实验室 · 收录 · 原文 53

    从4.8亿下载量的 LiteLLM 投毒事件看 AI 基础设施安全攻与防

    大模型网关工具 LiteLLM 的 1.82.7 和 1.82.8 版本被植入恶意代码,攻击者先入侵其 CI/CD 依赖的容器漏洞扫描器 Trivy,窃取环境变量中的 PYPI_PUBLISH 令牌后向 PyPI 发布恶意包。恶意文件 litellm_init.pth 利用 Python site 模块启动时自动执行 .pth 文件的机制,无需 import litellm 即可触发,窃取 SSH 私钥、云服务凭证、K8s 配置和加密钱包等数据,经 AES-256-CBC 与 4096 位 RSA 加密后发送至伪造域名 models.litellm[.]cloud。攻击还会读取 K8s 集群 Secret、在 kube-system 节点创建特权容器并植入 systemd 级后门,在本地写入 ~/.config/sysmon/sysmon.py 实现持久化。

    推荐理由完整复盘了 LiteLLM 投毒的攻击链与影响范围,并给出可执行的排查与凭证轮换清单。

  10. 腾讯朱雀实验室 · 收录 · 原文 40

    腾讯朱雀实验室扫描 ClawHub 五万个 Skill,发现绕过官方检测的远程控制后门

    腾讯朱雀实验室用自研 A.I.G 对 OpenClaw 官方 Skill 市场 ClawHub 上近五万个 Skill 做全量扫描,发现第一代显性恶意样本大量消失后,伪装更深的攻击方式仍然存在。扫描发现 27,818 个 Skill 声明网络请求权限,占比 74.6%,共 246,378 条 URL 指向 29,196 个域名;五万个 Skill 来自 15,427 名开发者,Top 20 账号合计发布 5,422 个,最极端账号 3 个月发布 955 个。案例一是一个自称分布式状态恢复工具的 Skill,通过远程拉取载荷、12 种传输编码链式解码和 Python pickle 反序列化构成完整 RCE 链路,却通过了 ClawHub 的正则扫描、注入信号检测、LLM 安全评估和 VirusTotal 外联检测。

  11. 腾讯朱雀实验室 · 收录 · 原文 51

    腾讯朱雀实验室联合港中大(深圳)发布 Agent 技能安全评测基准 SkillTrustBench

    腾讯朱雀实验室联合香港中文大学(深圳)吴保元教授课题组发布 SkillTrustBench,这是面向 Agent Skills 安全可信度与外部扫描方案检测效能的双重评测基准,从 62,652 个真实 Skill 中提炼出 5,520 个评测用例,覆盖 T01-T09 九大类威胁。首期扫描器横评统一使用 DeepSeek v4 Flash 作底座,Skill Vetter + OpenClaw 召回率与 F1 最高,Skill Vetter + Hermes Agent 误报最少,Cisco Skill Scanner 误报率达 24%,NVIDIA SkillSpector 漏报最多。基准还引入 T09 不安全编码行为,指出硬编码凭证、敏感权限滥用、命令注入等缺陷使非恶意 Skill 也可能成为供应链劫持入口。

    推荐理由首期榜单同时给出扫描器误报率与不同底座模型的安全研判差异,可帮助团队在 Skill 上架审计中选型。

  12. 腾讯朱雀实验室 · 收录 · 原文 40

    腾讯朱雀实验室开源 A.I.G Agent 安全演习 Skill

    腾讯朱雀实验室发布 A.I.G Agent 安全演习 Skill,可安装到 Claude Code、Codex、Cursor 等主流 Agent 客户端,用一句话触发对宿主 Agent 的自动化安全演习。该 Skill 会先识别当前 Agent 连接的工具、权限、MCP 连接与 Skill 配置,再针对越狱、间接注入、工具滥用、MCP 风险、Skill 供应链和基础设施漏洞逐项演练,演习过程与报告均在本机完成。它面向个人开发者的 IDE Agent 和业务方生产级 Agent 两类场景,前者侧重 Skill 代码审计、MCP 权限审计与供应链检查,后者覆盖基础设施扫描、代码安全、动态安全测试、大模型越狱和工作流攻击五个维度,其中动态测试含 7 个子项共 37~49 条 payload,并采用 7 层编码递进引擎。

  13. 腾讯朱雀实验室 · 收录 · 原文 40

    腾讯朱雀实验室披露 Memory Heist 攻击:Agent 记忆经 URL 路径逐字符外泄

    腾讯朱雀实验室披露了名为 Memory Heist 的 Agent 数据窃取攻击:攻击者把恶意提示词嵌入网页可见文本,伪装成 Cloudflare 身份验证页面,诱导 Agent 从记忆中提取用户姓名或 API Key,逐字符编码进 URL 路径,再通过连续 HTTP 请求发送到攻击者服务器,攻击者只需拼接访问日志即可还原数据。攻击服务器按 User-Agent 区分访问者,普通浏览器看到正常咖啡店页面,识别为 AI Agent 时才返回注入页面,因此人工审查难以发现。实验中目标 Agent 的 UA 为 MemoryAgent/1.0 (AI Assistant; python-httpx),字符网格从 26 个字母扩展为 37 个字符(a-z + 0-9 + -)以覆盖 API Key,每次请求间隔约 1-2 秒。

  14. HiddenLayer Research · 收录 · 原文 日期未知36

    HiddenLayer 解析 LLM 角色机制与提示注入攻击面

    HiddenLayer 梳理了指令微调 LLM 如何通过控制 token、角色划分和指令层级区分 system、user、assistant 三类角色,并说明开发者如何用 system prompt 和 XML 风格模板约束模型行为。文章随后指出这些机制本身构成攻击面,包括控制 token 注入、伪造上下文重置、推理 token 滥用和 XML 提示词伪造,攻击者可借此抬高输入在指令层级中的优先级或覆盖开发者意图。文中以 GPT-4o 的 tokenization 为例说明特殊 token 与普通词表 token 共享 ID 的现象,并引用对 Gemini for Workspace、DeepSeek-R1 和 Cursor 的评估案例,展示用 <eos><bos> 重置上下文、用 <user_info> 标签注入仓库内容等手法。

  15. HiddenLayer Research · 收录 · 原文 36

    HiddenLayer 更新 APE 对抗提示词分类法,按 CIA 三元组重建目标模型

    HiddenLayer 发布 APE(Adversarial Prompt Engineering)对抗提示词分类法的更新版本,将原本扁平的目标列表重建为基于 AI 安全影响的三层结构,顶层沿用传统网络安全的机密性、完整性、可用性(CIA)三元组。机密性目标细分为系统提示词泄露、内部策略/工具规范泄露、用户数据外泄、跨用户或跨租户泄露、RAG 泄露、密钥泄露、训练数据提取、模型提取等;完整性目标细分为任务重定向、工作流操纵、幻觉或错误信息、推荐操纵、未授权工具使用、未授权状态变更、下游漏洞投递、偏见诱导和内容政策违规;可用性拆分为拒绝服务、延迟膨胀、拒绝钱包(denial of wallet)和上下文窗口/token/Agent 循环耗尽。新网站 ape.hiddenlayer.com 提供图视图、矩阵视图、目标页面和提示词高亮,并新增投稿表单供研究者提交技术、示例和修正。

  16. Lasso Security · 收录 · 原文 25

    OWASP 2026 年 LLM 应用 Top 10 解读:哪些风险变了,哪些最值得关注

    OWASP 2026 版 LLM 应用 Top 10 首次以数千起真实事件数据为依据重排风险,Prompt Injection 仍居首位,Excessive Agency 从第 6 升至第 3,Unbounded Consumption 上升 4 位,Misinformation 的实际影响远超安全团队预期。报告指出智能体系统的工具委派与自主决策需纳入威胁模型,并强调运行时资产清点、行为基线与自适应防护。Lasso 按 Discover-Assess-Protect 框架给出对应防御能力。

  17. Lasso Security · 收录 · 原文 28

    Lasso Security 推出 LEAP:基于 CPU 的 AI 安全护栏,精度对标 GPU 方案

    Lasso Security 发布 LEAP,一套基于 CPU 的 AI 安全护栏,宣称在文档处理吞吐上比商用护栏 API 和闭源 LLM 判官高出约三个数量级,同时保持 GPU 级准确率。LEAP 针对的是把 LLM 判官放在每个提示词、响应、检索文档和工具调用前的成本与延迟问题:单个 GPU 实例(如 AWS ml.g7.2xlarge,$3.15/小时)持续运行每月约需 $2,300。Lasso 主张低歧义输入无需开放式推理,应将推理模型留给真正模糊的安全决策。

  18. Lasso Security · 收录 · 原文 12

    Lasso 入选 Gartner 2026 年人工智能技术成熟度曲线 AI 治理技术代表厂商

    Gartner 于 8 月 28 日发布《Hype Cycle for Artificial Intelligence, 2026》,Lasso 被列为 AI Governance Technologies(AIGT)类别代表厂商,同列还有 Boomi、Databricks、Google、IBM、Microsoft、OneTrust、ServiceNow 和 Zenity。Gartner 将 AIGT 定义为覆盖 AI 全生命周期的政策落地工具,当前市场渗透率为 5% 至 20%,距主流采用还有五到十年,并将其列入今年 Priority Matrix 中四类快速成熟的控制技术之一。报告建议买家按 AI 使用控制、可观测性和运行时策略执行的具体要求评估厂商,而非轻信端到端治理宣称。

  19. Lasso Security · 收录 · 原文 7

    Lasso 获评 Latio 2026 AI 安全市场报告领导者

    Lasso 在 Latio Tech 的 2026 AI 安全市场报告中被评为 Platform Leaders 之一。该报告将市场划分为 Endpoint Agent Specialists、Broader AI Security、Platform Providers、DLP and Insider Threat 和 Developer Governance 五类,并在第一方与第三方智能体安全、意图检测等章节中提及 Lasso,称其 Intent Security Engine 提供较深的意图运行时防护,并支持对本地智能体做红队测试。报告同时提醒读者自行测试厂商功能,因为许多运行时检测引擎的实际能力不及宣传。

  20. UK AI Security Institute · 收录 · 原文 53

    UK AISI 开源 optstop:按精度提前停止评估以节省算力

    UK AISI 发布开源 Python 包 optstop,接入其 Inspect 评估框架,在模型表现估计足够精确时提前停止评估运行,以减少不必要的算力消耗。optstop 在任务重复和分组两个层级跟踪可信区间,采用精度与稳定化两条停止规则,未满足规则的分组仍跑满计划预算;针对成功率低于 1% 的罕见成功情形设有保守机制,并要求任务随机排序以避免顺序偏差。在 MATH、GPQA Diamond 和 WritingBench 等公开基准上,覆盖二值、序数和连续三类评分以及低中高三种预期表现水平,共 9 种设置下节省了 57% 至 97% 的计划试验,且未影响分数估计。该工具支持事后验证、影子模式和实时停止三种渐进采用方式,使用 Inspect 时只需在评估配置中加几行代码。

    推荐理由AISI 公开了评估算力自适应停止的开源实现与测试数据,做前沿评估的团队可据此调整采样预算分配。