跳到正文

工具与开源

开源红队、评测与防护工具。

479条动态与论文相关主题红队防御与护栏安全评测
在这个话题内搜索或按分类筛选

新闻与论文

第 101–120 条 · 共 479 条
10月3日周六
  1. Bo Li · 收录 · 原文 28

    UIUC 多模态红队智能体 ARMs 亮相 ICLR

    非常期待这个多模态红队智能体,由我出色的学生 @xun_aq @ZRChen_AISafety @MintongKang @jiaweizhang 和产业合作者 @MinzhouP @Shuang 领导!请来 ICLR 我们的海报前给出反馈!!@xun_aq 本人就在 ICLR 现场!

    引用𝕏un@xun_aq

    Excited to share ARMs, our adaptive red-teaming agent for multimodal models at #ICLR2026! ARMs orchestrates diverse multimodal attack strategies for policy-driven safety evaluation, achieving SOTA red-teaming performance with +52.1% average ASR improvement over prior baselines. See you on Sat. afternoon at the poster session! 🇧🇷📍 Sat, Apr 25, 2026 · 3:15 PM–5:45 PM Pavilion 4 · P4-#4015

  2. Bo Li · 收录 · 原文 56

    UIUC 团队开源 DTap:面向 Agent 红队的可控沙箱与 DTap-Bench 基准

    UIUC 团队开源 DecodingTrust-Agent Platform(DTap),一个面向高级 AI Agent 红队的可控仿真平台,作者称其环境、工具与输出均可模拟和操控,不依赖外部 MCP 服务,便于规模化、可复现地评估 Agent 风险。平台模拟 14 个高风险领域的 50 多个真实环境,Agent 接口参照官方 MCP 与 GUI 复刻,环境为全栈、可交互且可并行。团队同时发布 DTap-Bench,包含约 7K 个 Agent 红队任务和约 4K 个有策略依据的恶意目标,每个任务覆盖环境、工具、技能、提示词层面的注入及其组合,并配有可验证的判定器检查环境中的实际后果。团队称用该基准评测了主流 Agent 框架与基座模型,发现系统性漏洞与零日问题。论文、平台与代码链接已公开。

    引用Zhaorun Chen@zrrrr_cn

    AI agents are already going wild, but today’s red-teaming tools for them are still like toys 😢 🔥👽 After spending 20 months and $120K API credits, we are excited to finally open-source DecodingTrust-Agent Platform (DTap): the first controllable, realistic simulation platform for advanced AI agent red-teaming !! 🌍 DTap simulates 50+ real-world environments across 14 high-stakes domains, with realistic agent interfaces replicated from their official MCPs and GUIs. The environments are full-stack, interactive, fully parallelizable, and can be easily configured to reproduce arbitrary real-world attack scenarios, making agent red-teaming scalable and highly transferable to deployment settings. 🔥We also release DTap-Bench, a large-scale benchmark with ~7K agent red-teaming tasks and ~4K policy-grounded malicious goals. Each red-teaming task includes a sophisticated attack sequence across environment-, tool-, skill-, prompt-level injections, as well as their compositions, plus a handcrafted verifiable judge that checks the actual consequences in the environment. Using DTap-Bench, we evaluate popular agent frameworks and backbone models across diverse policies, risks, threat models, and attack strategies, revealing systematic vulnerabilities and zero-days in today’s agents! Paper link: https://arxiv.org/pdf/2605.04808 Platform + benchmark + code: https://decodingtrust-agent.com Join our Discord: https://discord.gg/V4fG6NcVc Read more below 👇

    推荐理由DTap 把 Agent 红队环境做成可完全操控的沙箱,并配套约 7K 任务基准,便于复现和迁移到部署场景。

  3. Google DeepMind · 收录 · 原文 50

    Google DeepMind 播客探讨 AI 内容溯源与水印

    当 AI 生成内容变得如此逼真,我们如何验证哪些是人、机器或自然创造的? 我们在播客中探讨溯源的重要作用——以及不可感知的水印如何保护数字媒体和生物设计。↓ 时间轴: 00:00 介绍 00:34 什么是水印? 04:35 SynthID 15:16 图像与视频 19:28 SynthID Bio 28:00 韧性的未来

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月2日周五
  1. Mistral AI · 收录 · 原文 8

    Mistral AI 推出 Mistral AI Studio 生产级 AI 平台

    Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。Observability 提供 Explorer、Judges、Campaigns 与 Datasets 等能力,用于流量检查、规模化评估和回归追踪;Agent Runtime 基于 Temporal 构建有状态、容错的执行环境,支持重试与长任务;AI Registry 统一管理 agents、模型、数据集、judges、工具与工作流的版本、血缘和访问控制。平台支持混合、专用和自托管部署。

  2. Mistral AI · 收录 · 原文 6

    Mistral AI 发布 Mistral OCR 3

    Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 取得 74% 整体胜率,并已驱动 Mistral AI Studio 中的 Document AI Playground。该模型支持带 HTML 表格重建的 markdown 输出,定价为每 1,000 页 $2,Batch-API 折扣后降至 $1,模型标识为 mistral-ocr-2512,与 Mistral OCR 2 完全向后兼容,并提供自托管选项。

  3. Mistral AI · 收录 · 原文 18

    Mistral 发布 Leanstral:面向 Lean 4 的可信 vibe-coding 开源基础模型

    Mistral 发布 Leanstral,首个专为 Lean 4 设计的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并上线 Mistral vibe 的 agent 模式与免费 API。在 FLT 项目 PR 的 FLTEval 基准上,Leanstral pass@2 得分 26.3,超过 Sonnet 2.6 分而成本仅 36 美元(Sonnet 为 549 美元),pass@16 达 31.9;对比开源模型,GLM5-744B-A40B 与 Kimi-K2.5-1T-32B 分别止步约 16.6 和 20.1。该模型支持任意 MCP,并针对 lean-lsp-mcp 专门训练。

  4. Mistral AI · 收录 · 原文 15

    Mistral Studio 推出内置与自定义 MCP 连接器

    Mistral 在 Studio 发布 Connectors,内置连接器与自定义 MCP 均可通过 API/SDK 用于所有模型和智能体调用,并新增直接工具调用与 human-in-the-loop 审批流程。连接器以 MCP 协议打包为可复用实体,集中注册后可在 LeChat 和 AI Studio 中使用,支持 Conversation API、Completions API 和 Agent SDK,用于对接 CRM、知识库等企业系统。

  5. Mistral AI · 收录 · 原文 15

    Mistral 推出 Vibe 云端远程智能体,由 Mistral Medium 3.5 驱动

    Mistral 将编码智能体迁移至云端,通过 Mistral Vibe CLI 或 Le Chat 启动可并行运行的异步编码会话,本地会话也可"传送"上云继续执行。驱动这一能力的是新旗舰模型 Mistral Medium 3.5,128B 稠密模型、256k 上下文窗口,以修改版 MIT 许可开放权重,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,取代 Devstral 2 成为 Vibe CLI 默认模型。Le Chat 同步推出 Work 模式预览,由新智能体驱动多步骤任务并默认开启连接器。该模型按每百万输入 token 1.5 美元、每百万输出 token 7.5 美元计价,已在 Pro、Team 和 Enterprise 套餐上线。

  6. Mistral AI · 收录 · 原文 18

    Mistral 发布 Leanstral 1.5:6B 激活参数的形式化验证模型

    Mistral 发布 Apache-2.0 许可的 Leanstral 1.5,总参数 119B、激活参数 6B,在 miniF2F 上达到 100%,PutnamBench 解出 587/672 题,FATE-H 与 FATE-X 分别取得 87% 和 34% 的 SOTA。该模型经 mid-training、监督微调与 CISPO 强化学习三阶段训练,在 57 个代码仓库中发现 5 个此前未知的 bug,FLTEval 上 pass@1 从 21.9 提升至 28.9。模型已完全开源,可通过 Hugging Face 和免费 API 使用。

  7. Mistral AI · 收录 · 原文 8

    Mistral Studio 为 Prompts 和 Skills 提供系统记录

    Mistral Studio 现已向客户提供 Prompts 和 Skills 的集中管理系统,将每个提示词和技能作为可追踪、可版本化的资产,具备不可变版本、回滚、明确归属、分类标签和审计日志。资产通过标签从 staging 晋升到 production,仍触发企业已有的 CI/CD(如通过 SDK 接入 GitHub Actions),非开发者的业务团队也能直接迭代生产指令。借助 Observability 的 lineage 和遥测,生产输出可回溯到对应资产版本,智能体运行的 skills 以 MCP 服务器形式直接暴露,确保执行的是受治理的同一资产。

  8. 先知社区 · 收录 · 原文 42

    政务 RAG 白盒审计发现间接提示注入等 4 类缺陷并完成零回归修复

    对自研政务 RAG 系统 gov-rag-demo 的白盒代码审计发现 4 类真实缺陷:间接提示注入、权限参数客户端可控、会话 ID 无鉴权、政务高频实体脱敏不足,均定位到行号并完成修复。修复后 78 条业务评测用例保持 100% 零回归,安全专项断言全部通过。材料附完整复现脚本与修复后状态。

  9. 先知社区 · 收录 · 原文 13

    HostTraceAI:让 AI 安全接管主机溯源的权限分级与接入实践

    HostTraceAI 尝试把 AI Agent 引入应急响应中的主机溯源流程,用权限分级与接入机制回答"凭什么让 AI 动生产主机"。该工具面向被植入木马或 WebShell 的服务器排查场景,覆盖进程、服务、启动项、计划任务、网络连接、文件变更和登录活动等取证环节,目标是把原本依赖手工敲命令、截图和翻终端历史的重复流程变得可复现、少遗漏。