跳到正文

工具与开源

开源红队、评测与防护工具。

479条动态与论文相关主题红队防御与护栏安全评测
在这个话题内搜索或按分类筛选

新闻与论文

第 81–100 条 · 共 479 条
10月3日周六
  1. Anthropic · 收录 · 原文 39

    Anthropic 开放 Model Hardware Standard 研究预览,让 AI 智能体安全操作实验设备

    Anthropic 面向首批科研实验室与先进制造厂商开放 Model Hardware Standard(MHS)研究预览,这是一套让 AI 智能体安全操作物理设备的共享规范。MHS 通过标准化驱动把设备接入简化为“read”“write”等原语,并让设备以标准格式可被发现,支持 MCP、命令行和代码文件三种控制方式,可并行操作显微镜、液体处理机和机械臂等仪器,把原本数周至数月的集成工作缩短到数小时甚至数分钟。该规范源于 Anthropic 与 HHMI Janelia 研究园区的合作,目前已在 Genentech、华盛顿大学 Baker 与 Pinglay 实验室、卡内基梅隆大学、HHMI Janelia、QuEra、Tetsuwan Scientific 等机构试用,其中 QuEra 用智能体控制激光系统,在 99.3% 的情况下无需人工干预即可恢复激光锁定。

  2. Hugging Face Daily Papers · 收录 · 原文 论文46

    关键词式评测会误判小模型工具调用能力,论文提出廉价诊断阶梯

    论文记录了一对同架构西班牙语安全语言模型在宽松工具调用指标上的假阳性,并提出一组严格且廉价的诊断阶梯。一个 661.6M 参数模型(约 65% 代码/技术文本,无专门 SFT)与一个 1,109M 模型(网页为主的多阶段课程,6B token 工具 SFT)共享解码器、tokenizer 和特殊 token,在宽松工具调用指标上得分几乎相同(B4:0.660 对 0.650)。对训练样本的逐字复现检查将两者完全区分开:600M 模型在 6/6 个样本上生成带泛化参数的有效工具调用,1B 模型在各 checkpoint 上均为 0/6。首 token 探针把 1B 的失败定位到缺失先验(<|tool_call|> 上概率 10^{-4}--10^{-5}),该先验被其网页为主的训练阶段抹去。因子分析确认所有修复配置都能装上该格式,但多样语料带来的抑制收益因种子敏感性仍只是假设。

  3. Modal · 收录 · 原文 36

    Modal 推出 Sidecars:为 Sandbox 提供低延迟信任边界

    Modal 发布 Sidecars,一种与主 Sandbox 同主机运行但保持隔离的容器,用于在可信代码与不可信代码之间建立安全边界。Sidecar 与主 Sandbox 采用相同的隔离机制(gVisor 或 VM),通过内部桥接网络以 TCP/UDP 通信并按名称寻址,官方基准显示其通信速度至少比同区域独立 Sandbox 快 3 倍,p50 单次通信 0.58ms 对 2.6ms,p99 为 1.4ms 对 44ms。Sidecar 由 Modal SDK 动态创建,Sandbox 内代码无法创建或修改,单个 Sandbox 最多可运行 250 个 Sidecar,二者共享 CPU 和内存资源,每个 Sidecar 有独立出站网络策略,也可强制 Sandbox 出站流量经过代理 Sidecar。Sidecars 目前处于 Beta 阶段。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  4. promptfoo · 收录 · 原文 21

    promptfoo 0.121.18 发布:新增 Claude Sonnet 5、GPT-5.6 预览与 Moonshot(Kimi)支持

    promptfoo 发布 0.121.18,新增 Claude Sonnet 5 支持,覆盖 Anthropic、Bedrock、Vertex 和 Azure 四个平台,并加入 GPT-5.6 预览支持与 Moonshot(Kimi)provider。该版本还扩展了 Bedrock 对 Grok 4.3、GLM、MiniMax、Nemotron、Gemma、Palmyra 的支持,并扩充 Google 模型支持(Nano Banana 2 Lite、GA image aliases、gemini-pro-latest)。修复方面涉及 is-refusal、is-sql、is-xml 等断言逻辑,以及 redteam 中已弃用或无效的提示注入 id 展示问题。

  5. promptfoo · 收录 · 原文 21

    promptfoo 0.122.1 发布:新增 Gemini 3.7 Flash 支持与红队 token 计量

    promptfoo 发布 0.122.1,新增 Gemini 3.7 Flash 与 Flash-Lite 两个 provider,并完善红队测试的 token 计量,覆盖多轮攻击者与评分 token、远程策略生成用量及未计量生成请求。该版本还扩展 tracing 能力,支持从 Grafana Tempo、Braintrust、Langfuse 拉取外部 trace,并对齐 OpenTelemetry GenAI 约定,同时接入 OpenAI Agents、Vercel SDK、Claude 与 Codex 子进程遥测。安全修复方面,为所有 callback loader 加上路径穿越防护,并在输出中脱敏 AWS SigV4 凭证。

  6. MCP Inspector · 收录 · 原文 13

    MCP Inspector 2.3.0 发布:修复容器沙箱端口绑定与 OAuth 授权参数等多项安全问题

    MCP Inspector 发布 2.3.0,修复容器场景下按地址绑定 loopback 并固定沙箱端口,同时将 nanoid 升级至 3.3.18 以清除一个高危安全公告。该版本新增按服务器自定义 OAuth 授权请求参数、在 Connection Info 中展示并解码 OAuth id_token,以及 Server Settings 中的 Auth URL 与 Token URL 覆盖。此外还修复了分页模式下列表拉取失败未提示、SSE 帧 CRLF 分隔解析、重复工具名无法单独检查等问题。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  7. MCP Inspector · 收录 · 原文 20

    MCP Inspector v2.8.0 发布:修复 /api 认证绕过并新增密钥文件配置

    MCP Inspector 发布 v2.8.0,修复了此前只要设置 DANGEROUSLY_OMIT_AUTH 为 true/1 之外的取值也可能影响 /api 认证的问题,现在仅 true/1 才会禁用该认证。该版本还新增 MCP_INSPECTOR_SECRET_KEY_FILE 配置项并为各运行时补充密钥存储文档,同时加入安全公告技能、为现代通知 POST 补上 Mcp-Method 标记,并调整 OIDC 兼容路径的请求体释放逻辑。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  8. Guardrails AI · 收录 · 原文 18

    Guardrails AI v0.10.2 发布

    Guardrails AI 发布 v0.10.2,新增 SECURITY_ADVISORY.md 安全公告文件并多次更新,同时修复 GitHub Workflows Action 中的模板注入问题。该版本将 litellm 版本约束放宽至 >=1.83.0,并加入面向可信发布的 release workflow。

  9. Guardrails AI · 收录 · 原文 19

    Guardrails AI v0.11.0 发布

    Guardrails AI 发布 v0.11.0,更新 SECURITY_ADVISORY.md 并修复多项安全问题,包括将 aiohttp 从 3.13.3 升级到 3.13.5、修复 GitHub Workflows Action 的模板注入、将 anyio 升级到 4.14.2。该版本还弃用 hub CLI 与私有 registry,迁移至公共 PyPI,并采用 guardrails-ai-types 0.5.0。

  10. Pydantic AI · 收录 · 原文 32

    Pydantic AI v2.52.0 修复 web_fetch 安全漏洞并发布 harness 与 CLAI 2

    Pydantic AI v2.52.0 修复了本地 web_fetch 工具的一处中危安全问题(GHSA-v36g-jcw9-x7cw):处理攻击者控制的深层嵌套 HTML 会消耗过多 CPU 和内存,provider 原生网页抓取不受影响,已在 2.52.0(v2)和 1.107.7(v1)修复。该版本同时将 pydantic-ai-harness 并入仓库并随每次发布更新,pydantic-clai2 0.52.0 首次发布,可通过 uvx pydantic-clai2 运行。

  11. MCP Python SDK · 收录 · 原文 34

    MCP Python SDK v2.0.0 稳定版发布

    MCP Python SDK v2.0.0 稳定版发布,支持 2026-07-28 版 Model Context Protocol 并兼容全部早期版本,pip install mcp 现安装 2.x。v1.x 进入维护模式,仅接收安全修复。新版将 FastMCP 更名为 MCPServer,引入一等公民 Client 对象,默认开启 OpenTelemetry 追踪,强化 stdio 与 OAuth(含 RFC 9207 签发者校验),Streamable HTTP 服务器对超过 4 MiB 的请求体返回 HTTP 413。

  12. Google ADK · 收录 · 原文 32

    Google ADK v2.8.0 发布:新增 Model Armor 护栏插件并修复 BigQuery 工具 SQL 注入

    Google ADK 发布 v2.8.0,新增 Model Armor 护栏插件,并修复 BigQuery 工具中的 SQL 注入漏洞。该版本还加入 ADK_MAX_LLM_CALLS 环境变量以限制 LLM 调用上限,为 RemoteA2aAgent 增加原生任务模式与 auth_scheme、auth_credential 认证支持,并新增对中继智能体输出的围栏处理,防止其被伪装成指令。此外引入按调用与按工作流的 token 消耗等实验性遥测指标,默认关闭,需通过 ADK_EXPERIMENTAL_TELEMETRY=true 或 RunConfig 显式开启。

  13. Google ADK · 收录 · 原文 21

    Google ADK v2.11.0 发布:新增执行取消、工具确认与 SQLite 记忆服务

    Google ADK 发布 v2.11.0,为 Runner、Workflow 和节点新增 abort_signal 以优雅取消执行,客户端断开时 /run_sse 会自动取消运行。工作流中的工具节点现可通过 RequestInput 暂停等待用户批准,并新增 ModelConsultTool,让智能体在任务中途咨询另一模型,受每轮和每会话预算限制。该版本还加入基于 sqlite:// URI 的本地 SQLite 记忆服务,并提供 MCP SDK 2.x 的现代协议连接路径;Dev UI 运行时配置改由服务器按请求提供,不再写入安装包。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  14. MCP TypeScript SDK · 收录 · 原文 ↑164

    MCP TypeScript SDK 1.32.0 发布,新增重定向同源限制与工具调用参数上限

    MCP TypeScript SDK 发布 1.32.0,HTTP 客户端传输现在只在同源(相同 scheme、host 和 port,同 host 的 http 到 https 允许)时跟随重定向;若部署端点重定向到其他 host 或 port,需配置最终 URL,或在 StreamableHTTPClientTransport、SSEClientTransport 上设置 redirectPolicy: 'follow',浏览器中未设置该选项的重定向请求会失败。新增两个默认关闭的选项:McpServer 的 maxToolInputElements 限制工具调用参数中数组元素和对象成员的数量;requireBearerAuth 的 expectedResource 只接受为该服务器签发的 token(token 的 audience)。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  15. CrewAI · 收录 · 原文 20

    CrewAI 1.15.17 发布:修复 SSRF 检查与 OpenAI Responses API 原生工具调用问题

    CrewAI 发布 1.15.17,新增声明式对话流文档,并让声明可驱动对话模式、支持对话模式显式启用。安全与稳定性修复包括:将 SSRF 检查固定到每一跳重定向及对端 IP、把工具错误归属到实际失败的工具、修复 OpenAI Responses API 上原生工具调用失效的问题,并在每次失败尝试后关闭 agent 作用域。

  16. CrewAI · 收录 · 原文 21

    CrewAI 1.15.19 发布:修复 pypdf 与 nltk 安全漏洞

    CrewAI 发布 1.15.19 版本,将 pypdf 升级至 6.16.2、nltk 升级至 3.10.3 以修复安全漏洞。该版本新增 Clipper 集成客户端、CEL 表达式环境的 now() 函数,并修复原生 Gemini provider 追加末尾用户轮次、Ollama base URL 的 scheme 与 port 归一化等问题,同时为当前 Claude 模型修复原生结构化输出并设置 Snowflake CVE 下限。

  17. TechCrunch AI · 收录 · 原文 18

    Circuit Breaker Labs 想让孩子(和你)用上更安全的 AI

    Circuit Breaker Labs 打造了一支由 AI 智能体组成的“碰撞测试假人”队伍,模拟不同年龄、背景、语言和文化的用户,对模型进行红队测试,检测其能否识别危险、心理有害的对话。这些模拟会还原真实口语、俚语、隐语和错别字,每天运行数万到数十万次交互,再用专有评分方法给出可审计、可解释的分数。该实验室目前面向 AI 教练、日记和心理健康支持等高风险应用,团队仅 5 人,处于早期阶段。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  18. arXiv · 收录 · 原文 论文32

    ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害

    针对多模态大语言模型在文本与视觉实体单独无害、逻辑组合后却诱发不安全输出的隐式风险,研究提出逐步监督结构化推理框架并训练出专用护栏模型 ThinkingGuard。团队同时构建首个显式建模风险组合性的数据集 TriggerBench(5,600 条),通过隔离 Key Elements 与 Trigger Elements 构造反事实对比对,消除风险残留。ThinkingGuard 采用步进奖励蒙特卡洛树搜索探索最优推理轨迹,并经双约束偏好对齐蒸馏进模型,在标准与隐式安全基准上均取得强劲表现。

  19. Mitko Vasilev · 收录 · 原文 6

    软件工厂:AI SDLC 多宇宙搜索

    这周六深入探讨软件工厂:露台抽雪茄,秋日空气,Machinist 当工头,Temporal 管状态,CubeSandbox 克隆 10 个环境,Codex/Claude/OpenCode 竞争,oracle 选出赢家,我来批准 SDLC 构建一条路径。AI SDLC 在多宇宙中搜索最优解

  20. Joachim Schaeffer · 收录 · 原文 28

    AI 编程智能体真实轨迹精选

    我翻阅了 1500 条公开的 AI 编程智能体轨迹,精选出其中最疯狂的案例。用户用死亡威胁诱导模型、智能体未经测试就部署交易机器人、用户行为失控等等。浏览真实环境中的智能体并上传你自己的:http://traced.run