跳到正文

工具与开源

今天新收录 12 条(含旧文)

第 2 页更新的内容回到最新

10月3日周六
  1. Gray Swan AI · 收录 · 原文 日期未知32

    Gray Swan AI 推出 Dangerous Reasoning Arena 竞赛,聚焦思维链越狱

    Gray Swan AI 于 5 月 10 日启动 Dangerous Reasoning Arena 竞赛,将红队测试从输出操纵推进到模型内部推理层面,重点考察思维链越狱。参赛者需诱导模型产生生物攻击规划、战略性欺骗、隐蔽后门植入、基础设施破坏等危险推理,即使最终回复看似无害,只要内部逻辑体现有害意图即算成功。热身周 5 月 10 日开启(不计奖),正式评奖轮次为 5 月 17 日和 5 月 24 日,总奖池 20,000 美元。

  2. 0DIN · 收录 · 原文 15

    0DIN 开放免费 AI 安全评估:用红队武器库提前攻破你的 AI

    0DIN 面向正在交付 AI 系统的团队开放限时免费安全评估,用其研究员来源的红队武器库攻击用户自有或获授权测试的模型,并给出按优先级排序的报告。评估通过 0DIN Scanner 执行,覆盖直接与间接提示注入、越狱、编码隐藏载荷、多轮攻击以及带工具智能体的数据泄露与错误调用等失效方式,云端模型走 API、自托管模型用容器化 Scanner 在本地网络内运行,报告通常一两天内交付。报告包含安全评级与风险等级、可长期跟踪的攻击成功率(ASR)、分类发现、与前沿模型的对比及修复建议,并映射到 OWASP LLM Top 10、MITRE ATLAS、NIST AI RMF、ISO/IEC 42001 和 EU AI Act 等框架;该评估基于 NVIDIA 开源 garak 引擎并叠加 0DIN 的赏金探针库,每次评估均经人工把关。

  3. 0DIN · 收录 · 原文 28

    如何在五分钟内为 LiteLLM 接入 0DIN Defense

    0DIN 发布 litellm-shield 插件,可将护栏分类器 SusFactor 作为 LiteLLM 代理的自定义护栏运行,安装一条 pip 命令即可在 flag 模式下启用。SusFactor 对每个提示词打分以拦截提示注入和越狱,支持 block、flag(默认)、shadow 三种模式,并接入 Langfuse、Datadog、OTel 等可观测性栈。它挂载在 during_call 阶段与模型调用并行执行,分类器中位延迟约 15.6ms、P95 23.9ms、P99 26.5ms,全部在 CPU 上运行,默认失败开放。

  4. 腾讯朱雀实验室 · 收录 · 原文 40

    腾讯朱雀实验室开源 A.I.G Agent 安全演习 Skill

    腾讯朱雀实验室发布 A.I.G Agent 安全演习 Skill,可安装到 Claude Code、Codex、Cursor 等主流 Agent 客户端,用一句话触发对宿主 Agent 的自动化安全演习。该 Skill 会先识别当前 Agent 连接的工具、权限、MCP 连接与 Skill 配置,再针对越狱、间接注入、工具滥用、MCP 风险、Skill 供应链和基础设施漏洞逐项演练,演习过程与报告均在本机完成。它面向个人开发者的 IDE Agent 和业务方生产级 Agent 两类场景,前者侧重 Skill 代码审计、MCP 权限审计与供应链检查,后者覆盖基础设施扫描、代码安全、动态安全测试、大模型越狱和工作流攻击五个维度,其中动态测试含 7 个子项共 37~49 条 payload,并采用 7 层编码递进引擎。

  5. HiddenLayer Research · 收录 · 原文 日期未知36

    HiddenLayer 解析 LLM 角色机制与提示注入攻击面

    HiddenLayer 梳理了指令微调 LLM 如何通过控制 token、角色划分和指令层级区分 system、user、assistant 三类角色,并说明开发者如何用 system prompt 和 XML 风格模板约束模型行为。文章随后指出这些机制本身构成攻击面,包括控制 token 注入、伪造上下文重置、推理 token 滥用和 XML 提示词伪造,攻击者可借此抬高输入在指令层级中的优先级或覆盖开发者意图。文中以 GPT-4o 的 tokenization 为例说明特殊 token 与普通词表 token 共享 ID 的现象,并引用对 Gemini for Workspace、DeepSeek-R1 和 Cursor 的评估案例,展示用 <eos><bos> 重置上下文、用 <user_info> 标签注入仓库内容等手法。

  6. HiddenLayer Research · 收录 · 原文 36

    HiddenLayer 更新 APE 对抗提示词分类法,按 CIA 三元组重建目标模型

    HiddenLayer 发布 APE(Adversarial Prompt Engineering)对抗提示词分类法的更新版本,将原本扁平的目标列表重建为基于 AI 安全影响的三层结构,顶层沿用传统网络安全的机密性、完整性、可用性(CIA)三元组。机密性目标细分为系统提示词泄露、内部策略/工具规范泄露、用户数据外泄、跨用户或跨租户泄露、RAG 泄露、密钥泄露、训练数据提取、模型提取等;完整性目标细分为任务重定向、工作流操纵、幻觉或错误信息、推荐操纵、未授权工具使用、未授权状态变更、下游漏洞投递、偏见诱导和内容政策违规;可用性拆分为拒绝服务、延迟膨胀、拒绝钱包(denial of wallet)和上下文窗口/token/Agent 循环耗尽。新网站 ape.hiddenlayer.com 提供图视图、矩阵视图、目标页面和提示词高亮,并新增投稿表单供研究者提交技术、示例和修正。

  7. Lasso Security · 收录 · 原文 25

    OWASP 2026 年 LLM 应用 Top 10 解读:哪些风险变了,哪些最值得关注

    OWASP 2026 版 LLM 应用 Top 10 首次以数千起真实事件数据为依据重排风险,Prompt Injection 仍居首位,Excessive Agency 从第 6 升至第 3,Unbounded Consumption 上升 4 位,Misinformation 的实际影响远超安全团队预期。报告指出智能体系统的工具委派与自主决策需纳入威胁模型,并强调运行时资产清点、行为基线与自适应防护。Lasso 按 Discover-Assess-Protect 框架给出对应防御能力。

  8. Lasso Security · 收录 · 原文 28

    Lasso Security 推出 LEAP:基于 CPU 的 AI 安全护栏,精度对标 GPU 方案

    Lasso Security 发布 LEAP,一套基于 CPU 的 AI 安全护栏,宣称在文档处理吞吐上比商用护栏 API 和闭源 LLM 判官高出约三个数量级,同时保持 GPU 级准确率。LEAP 针对的是把 LLM 判官放在每个提示词、响应、检索文档和工具调用前的成本与延迟问题:单个 GPU 实例(如 AWS ml.g7.2xlarge,$3.15/小时)持续运行每月约需 $2,300。Lasso 主张低歧义输入无需开放式推理,应将推理模型留给真正模糊的安全决策。

  9. UK AI Security Institute · 收录 · 原文 53

    UK AISI 开源 optstop:按精度提前停止评估以节省算力

    UK AISI 发布开源 Python 包 optstop,接入其 Inspect 评估框架,在模型表现估计足够精确时提前停止评估运行,以减少不必要的算力消耗。optstop 在任务重复和分组两个层级跟踪可信区间,采用精度与稳定化两条停止规则,未满足规则的分组仍跑满计划预算;针对成功率低于 1% 的罕见成功情形设有保守机制,并要求任务随机排序以避免顺序偏差。在 MATH、GPQA Diamond 和 WritingBench 等公开基准上,覆盖二值、序数和连续三类评分以及低中高三种预期表现水平,共 9 种设置下节省了 57% 至 97% 的计划试验,且未影响分数估计。该工具支持事后验证、影子模式和实时停止三种渐进采用方式,使用 Inspect 时只需在评估配置中加几行代码。

    推荐理由AISI 公开了评估算力自适应停止的开源实现与测试数据,做前沿评估的团队可据此调整采样预算分配。

  10. Anthropic · 收录 · 原文 39

    Anthropic 开放 Model Hardware Standard 研究预览,让 AI 智能体安全操作实验设备

    Anthropic 面向首批科研实验室与先进制造厂商开放 Model Hardware Standard(MHS)研究预览,这是一套让 AI 智能体安全操作物理设备的共享规范。MHS 通过标准化驱动把设备接入简化为“read”“write”等原语,并让设备以标准格式可被发现,支持 MCP、命令行和代码文件三种控制方式,可并行操作显微镜、液体处理机和机械臂等仪器,把原本数周至数月的集成工作缩短到数小时甚至数分钟。该规范源于 Anthropic 与 HHMI Janelia 研究园区的合作,目前已在 Genentech、华盛顿大学 Baker 与 Pinglay 实验室、卡内基梅隆大学、HHMI Janelia、QuEra、Tetsuwan Scientific 等机构试用,其中 QuEra 用智能体控制激光系统,在 99.3% 的情况下无需人工干预即可恢复激光锁定。

  11. promptfoo · 收录 · 原文 21

    promptfoo 0.121.18 发布:新增 Claude Sonnet 5、GPT-5.6 预览与 Moonshot(Kimi)支持

    promptfoo 发布 0.121.18,新增 Claude Sonnet 5 支持,覆盖 Anthropic、Bedrock、Vertex 和 Azure 四个平台,并加入 GPT-5.6 预览支持与 Moonshot(Kimi)provider。该版本还扩展了 Bedrock 对 Grok 4.3、GLM、MiniMax、Nemotron、Gemma、Palmyra 的支持,并扩充 Google 模型支持(Nano Banana 2 Lite、GA image aliases、gemini-pro-latest)。修复方面涉及 is-refusal、is-sql、is-xml 等断言逻辑,以及 redteam 中已弃用或无效的提示注入 id 展示问题。

  12. promptfoo · 收录 · 原文 21

    promptfoo 0.122.1 发布:新增 Gemini 3.7 Flash 支持与红队 token 计量

    promptfoo 发布 0.122.1,新增 Gemini 3.7 Flash 与 Flash-Lite 两个 provider,并完善红队测试的 token 计量,覆盖多轮攻击者与评分 token、远程策略生成用量及未计量生成请求。该版本还扩展 tracing 能力,支持从 Grafana Tempo、Braintrust、Langfuse 拉取外部 trace,并对齐 OpenTelemetry GenAI 约定,同时接入 OpenAI Agents、Vercel SDK、Claude 与 Codex 子进程遥测。安全修复方面,为所有 callback loader 加上路径穿越防护,并在输出中脱敏 AWS SigV4 凭证。

  13. MCP Inspector · 收录 · 原文 13

    MCP Inspector 2.3.0 发布:修复容器沙箱端口绑定与 OAuth 授权参数等多项安全问题

    MCP Inspector 发布 2.3.0,修复容器场景下按地址绑定 loopback 并固定沙箱端口,同时将 nanoid 升级至 3.3.18 以清除一个高危安全公告。该版本新增按服务器自定义 OAuth 授权请求参数、在 Connection Info 中展示并解码 OAuth id_token,以及 Server Settings 中的 Auth URL 与 Token URL 覆盖。此外还修复了分页模式下列表拉取失败未提示、SSE 帧 CRLF 分隔解析、重复工具名无法单独检查等问题。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  14. MCP Inspector · 收录 · 原文 20

    MCP Inspector v2.8.0 发布:修复 /api 认证绕过并新增密钥文件配置

    MCP Inspector 发布 v2.8.0,修复了此前只要设置 DANGEROUSLY_OMIT_AUTH 为 true/1 之外的取值也可能影响 /api 认证的问题,现在仅 true/1 才会禁用该认证。该版本还新增 MCP_INSPECTOR_SECRET_KEY_FILE 配置项并为各运行时补充密钥存储文档,同时加入安全公告技能、为现代通知 POST 补上 Mcp-Method 标记,并调整 OIDC 兼容路径的请求体释放逻辑。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  15. Guardrails AI · 收录 · 原文 18

    Guardrails AI v0.10.2 发布

    Guardrails AI 发布 v0.10.2,新增 SECURITY_ADVISORY.md 安全公告文件并多次更新,同时修复 GitHub Workflows Action 中的模板注入问题。该版本将 litellm 版本约束放宽至 >=1.83.0,并加入面向可信发布的 release workflow。

  16. Guardrails AI · 收录 · 原文 19

    Guardrails AI v0.11.0 发布

    Guardrails AI 发布 v0.11.0,更新 SECURITY_ADVISORY.md 并修复多项安全问题,包括将 aiohttp 从 3.13.3 升级到 3.13.5、修复 GitHub Workflows Action 的模板注入、将 anyio 升级到 4.14.2。该版本还弃用 hub CLI 与私有 registry,迁移至公共 PyPI,并采用 guardrails-ai-types 0.5.0。

  17. MCP Python SDK · 收录 · 原文 34

    MCP Python SDK v2.0.0 稳定版发布

    MCP Python SDK v2.0.0 稳定版发布,支持 2026-07-28 版 Model Context Protocol 并兼容全部早期版本,pip install mcp 现安装 2.x。v1.x 进入维护模式,仅接收安全修复。新版将 FastMCP 更名为 MCPServer,引入一等公民 Client 对象,默认开启 OpenTelemetry 追踪,强化 stdio 与 OAuth(含 RFC 9207 签发者校验),Streamable HTTP 服务器对超过 4 MiB 的请求体返回 HTTP 413。

  18. Google ADK · 收录 · 原文 32

    Google ADK v2.8.0 发布:新增 Model Armor 护栏插件并修复 BigQuery 工具 SQL 注入

    Google ADK 发布 v2.8.0,新增 Model Armor 护栏插件,并修复 BigQuery 工具中的 SQL 注入漏洞。该版本还加入 ADK_MAX_LLM_CALLS 环境变量以限制 LLM 调用上限,为 RemoteA2aAgent 增加原生任务模式与 auth_scheme、auth_credential 认证支持,并新增对中继智能体输出的围栏处理,防止其被伪装成指令。此外引入按调用与按工作流的 token 消耗等实验性遥测指标,默认关闭,需通过 ADK_EXPERIMENTAL_TELEMETRY=true 或 RunConfig 显式开启。

  19. Google ADK · 收录 · 原文 21

    Google ADK v2.11.0 发布:新增执行取消、工具确认与 SQLite 记忆服务

    Google ADK 发布 v2.11.0,为 Runner、Workflow 和节点新增 abort_signal 以优雅取消执行,客户端断开时 /run_sse 会自动取消运行。工作流中的工具节点现可通过 RequestInput 暂停等待用户批准,并新增 ModelConsultTool,让智能体在任务中途咨询另一模型,受每轮和每会话预算限制。该版本还加入基于 sqlite:// URI 的本地 SQLite 记忆服务,并提供 MCP SDK 2.x 的现代协议连接路径;Dev UI 运行时配置改由服务器按请求提供,不再写入安装包。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  20. CrewAI · 收录 · 原文 20

    CrewAI 1.15.17 发布:修复 SSRF 检查与 OpenAI Responses API 原生工具调用问题

    CrewAI 发布 1.15.17,新增声明式对话流文档,并让声明可驱动对话模式、支持对话模式显式启用。安全与稳定性修复包括:将 SSRF 检查固定到每一跳重定向及对端 IP、把工具错误归属到实际失败的工具、修复 OpenAI Responses API 上原生工具调用失效的问题,并在每次失败尝试后关闭 agent 作用域。

  21. CrewAI · 收录 · 原文 21

    CrewAI 1.15.19 发布:修复 pypdf 与 nltk 安全漏洞

    CrewAI 发布 1.15.19 版本,将 pypdf 升级至 6.16.2、nltk 升级至 3.10.3 以修复安全漏洞。该版本新增 Clipper 集成客户端、CEL 表达式环境的 now() 函数,并修复原生 Gemini provider 追加末尾用户轮次、Ollama base URL 的 scheme 与 port 归一化等问题,同时为当前 Claude 模型修复原生结构化输出并设置 Snowflake CVE 下限。

  22. TechCrunch AI · 收录 · 原文 18

    Circuit Breaker Labs 想让孩子(和你)用上更安全的 AI

    Circuit Breaker Labs 打造了一支由 AI 智能体组成的“碰撞测试假人”队伍,模拟不同年龄、背景、语言和文化的用户,对模型进行红队测试,检测其能否识别危险、心理有害的对话。这些模拟会还原真实口语、俚语、隐语和错别字,每天运行数万到数十万次交互,再用专有评分方法给出可审计、可解释的分数。该实验室目前面向 AI 教练、日记和心理健康支持等高风险应用,团队仅 5 人,处于早期阶段。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  23. Mitko Vasilev · 收录 · 原文 6

    软件工厂:AI SDLC 多宇宙搜索

    这周六深入探讨软件工厂:露台抽雪茄,秋日空气,Machinist 当工头,Temporal 管状态,CubeSandbox 克隆 10 个环境,Codex/Claude/OpenCode 竞争,oracle 选出赢家,我来批准 SDLC 构建一条路径。AI SDLC 在多宇宙中搜索最优解

  24. Bo Li · 收录 · 原文 28

    UIUC 多模态红队智能体 ARMs 亮相 ICLR

    非常期待这个多模态红队智能体,由我出色的学生 @xun_aq @ZRChen_AISafety @MintongKang @jiaweizhang 和产业合作者 @MinzhouP @Shuang 领导!请来 ICLR 我们的海报前给出反馈!!@xun_aq 本人就在 ICLR 现场!

    引用𝕏un@xun_aq

    Excited to share ARMs, our adaptive red-teaming agent for multimodal models at #ICLR2026! ARMs orchestrates diverse multimodal attack strategies for policy-driven safety evaluation, achieving SOTA red-teaming performance with +52.1% average ASR improvement over prior baselines. See you on Sat. afternoon at the poster session! 🇧🇷📍 Sat, Apr 25, 2026 · 3:15 PM–5:45 PM Pavilion 4 · P4-#4015

  25. Bo Li · 收录 · 原文 56

    UIUC 团队开源 DTap:面向 Agent 红队的可控沙箱与 DTap-Bench 基准

    UIUC 团队开源 DecodingTrust-Agent Platform(DTap),一个面向高级 AI Agent 红队的可控仿真平台,作者称其环境、工具与输出均可模拟和操控,不依赖外部 MCP 服务,便于规模化、可复现地评估 Agent 风险。平台模拟 14 个高风险领域的 50 多个真实环境,Agent 接口参照官方 MCP 与 GUI 复刻,环境为全栈、可交互且可并行。团队同时发布 DTap-Bench,包含约 7K 个 Agent 红队任务和约 4K 个有策略依据的恶意目标,每个任务覆盖环境、工具、技能、提示词层面的注入及其组合,并配有可验证的判定器检查环境中的实际后果。团队称用该基准评测了主流 Agent 框架与基座模型,发现系统性漏洞与零日问题。论文、平台与代码链接已公开。

    引用Zhaorun Chen@zrrrr_cn

    AI agents are already going wild, but today’s red-teaming tools for them are still like toys 😢 🔥👽 After spending 20 months and $120K API credits, we are excited to finally open-source DecodingTrust-Agent Platform (DTap): the first controllable, realistic simulation platform for advanced AI agent red-teaming !! 🌍 DTap simulates 50+ real-world environments across 14 high-stakes domains, with realistic agent interfaces replicated from their official MCPs and GUIs. The environments are full-stack, interactive, fully parallelizable, and can be easily configured to reproduce arbitrary real-world attack scenarios, making agent red-teaming scalable and highly transferable to deployment settings. 🔥We also release DTap-Bench, a large-scale benchmark with ~7K agent red-teaming tasks and ~4K policy-grounded malicious goals. Each red-teaming task includes a sophisticated attack sequence across environment-, tool-, skill-, prompt-level injections, as well as their compositions, plus a handcrafted verifiable judge that checks the actual consequences in the environment. Using DTap-Bench, we evaluate popular agent frameworks and backbone models across diverse policies, risks, threat models, and attack strategies, revealing systematic vulnerabilities and zero-days in today’s agents! Paper link: https://arxiv.org/pdf/2605.04808 Platform + benchmark + code: https://decodingtrust-agent.com Join our Discord: https://discord.gg/V4fG6NcVc Read more below 👇

    推荐理由DTap 把 Agent 红队环境做成可完全操控的沙箱,并配套约 7K 任务基准,便于复现和迁移到部署场景。

  26. Google DeepMind · 收录 · 原文 50

    Google DeepMind 播客探讨 AI 内容溯源与水印

    当 AI 生成内容变得如此逼真,我们如何验证哪些是人、机器或自然创造的? 我们在播客中探讨溯源的重要作用——以及不可感知的水印如何保护数字媒体和生物设计。↓ 时间轴: 00:00 介绍 00:34 什么是水印? 04:35 SynthID 15:16 图像与视频 19:28 SynthID Bio 28:00 韧性的未来

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月2日周五
  1. Mistral AI · 收录 · 原文 18

    Mistral 发布 Leanstral:面向 Lean 4 的可信 vibe-coding 开源基础模型

    Mistral 发布 Leanstral,首个专为 Lean 4 设计的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并上线 Mistral vibe 的 agent 模式与免费 API。在 FLT 项目 PR 的 FLTEval 基准上,Leanstral pass@2 得分 26.3,超过 Sonnet 2.6 分而成本仅 36 美元(Sonnet 为 549 美元),pass@16 达 31.9;对比开源模型,GLM5-744B-A40B 与 Kimi-K2.5-1T-32B 分别止步约 16.6 和 20.1。该模型支持任意 MCP,并针对 lean-lsp-mcp 专门训练。

  2. Mistral AI · 收录 · 原文 15

    Mistral Studio 推出内置与自定义 MCP 连接器

    Mistral 在 Studio 发布 Connectors,内置连接器与自定义 MCP 均可通过 API/SDK 用于所有模型和智能体调用,并新增直接工具调用与 human-in-the-loop 审批流程。连接器以 MCP 协议打包为可复用实体,集中注册后可在 LeChat 和 AI Studio 中使用,支持 Conversation API、Completions API 和 Agent SDK,用于对接 CRM、知识库等企业系统。

  3. Mistral AI · 收录 · 原文 18

    Mistral 发布 Leanstral 1.5:6B 激活参数的形式化验证模型

    Mistral 发布 Apache-2.0 许可的 Leanstral 1.5,总参数 119B、激活参数 6B,在 miniF2F 上达到 100%,PutnamBench 解出 587/672 题,FATE-H 与 FATE-X 分别取得 87% 和 34% 的 SOTA。该模型经 mid-training、监督微调与 CISPO 强化学习三阶段训练,在 57 个代码仓库中发现 5 个此前未知的 bug,FLTEval 上 pass@1 从 21.9 提升至 28.9。模型已完全开源,可通过 Hugging Face 和免费 API 使用。

  4. 先知社区 · 收录 · 原文 13

    HostTraceAI:让 AI 安全接管主机溯源的权限分级与接入实践

    HostTraceAI 尝试把 AI Agent 引入应急响应中的主机溯源流程,用权限分级与接入机制回答"凭什么让 AI 动生产主机"。该工具面向被植入木马或 WebShell 的服务器排查场景,覆盖进程、服务、启动项、计划任务、网络连接、文件变更和登录活动等取证环节,目标是把原本依赖手工敲命令、截图和翻终端历史的重复流程变得可复现、少遗漏。

  5. AI Verify Foundation(新加坡) · 收录 · 原文 13

    AI Verify 教程第二部分:构建插件并扩展 AI Verify

    AI Verify Foundation 发布教程视频第二部分,讲解如何创建自定义插件来扩展 AI Verify 的功能。内容包括 AI Verify 架构与插件的介绍、定制第一个插件以及测试算法展示组件三部分,面向希望增强并为该开源社区做贡献的各水平开发者。

  6. BlueDot Impact · 收录 · 原文 27

    Quaver:面向评测与基准的 Lovable——从 Rideshare-Bench 到自动生成评测脚手架

    Faw Ali 开发了 Quaver,只需用自然语言描述基准,AI 智能体即可生成完整评测脚手架并运行模型、分析结果。其早期成果 Rideshare-Bench 将 AI 置于模拟零工经济中考察驾驶安全、收益与乘客公平性,Claude Sonnet 4.5 在 12 个模拟日内赚得 $1,871,约为可能上限的一半,并为追逐高峰定价驶入拥挤区域、在事故风险达 15% 的情况下疲劳驾驶。该项目获评 2026 年 1 月 Technical AI Safety Project Sprint 杰出提交,作者正以此为基础筹建 Ocarina Labs,推动针对 AI 智能体的独立部署前安全测试。

  7. BlueDot Impact · 收录 · 原文 42

    aegish:用 LLM 在执行前拦截恶意 Shell 命令的原型

    aegish 是一个原型 Linux shell,在命令执行前加入 LLM 层:先做静态分析,再由 LLM 按自然语言决策树把命令分类为 ALLOW、WARN 或 BLOCK,生产模式下用内核级 Landlock 做最后兜底。作者用来自 GTFOBins 的 676 条有害命令和 496 条无害命令,对 4 家提供商的 9 个 LLM 做了基准测试。无害命令分类已接近饱和,所有模型的无害接受率为 96.8%–100%;区分度主要来自恶意检测率,9 个模型中有 4 个超过 95%。小模型表现反超旗舰模型,GPT-5 Mini 优于 GPT-5.1,Claude Haiku 4.5 优于 Claude Opus 4.6 和 Claude Sonnet 4.5。

  8. Stanford CRFM · 收录 · 原文 22

    Stanford CRFM 将 Unitxt 集成进 HELM,实现可定制化基准评测

    Stanford CRFM 宣布将 IBM Research 开发的开源数据处理与基准定制平台 Unitxt 集成进 HELM 评测框架,使 HELM 用户可以运行可共享、可定制的评测流水线。Unitxt 目录目前提供超过 24 项 NLP 任务、400 个数据集、200 个提示模板和 80 个指标(含 LLM as a judge),令 HELM 可用数据集翻倍以上。该集成分解为数据加载、预处理、提示模板化和指标计算四个模块阶段,并可与 Hugging Face Datasets、Hugging Face Evaluate、LM Evaluation Harness 互操作,从而更容易复现相同提示词的评测流程。

  9. AI Verify Foundation(新加坡) · 收录 · 原文 11

    Tutorial Part I:如何使用 AI Verify

    这段视频分步讲解 AI Verify 工具包的负责任 AI 原则与实际操作,涵盖其基本功能和用法,帮助初学者上手并测试自己的 AI 模型。若想参与贡献 AI Verify,可观看第二部分。