全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态TechCrunch AI
Circuit Breaker Labs 想让孩子(和你)用上更安全的 AI
Circuit Breaker Labs 打造了一支由 AI 智能体组成的“碰撞测试假人”队伍,模拟不同年龄、背景、语言和文化的用户,对模型进行红队测试,检测其能否识别危险、心理有害的对话。这些模拟会还原真实口语、俚语、隐语和错别字,每天运行数万到数十万次交互,再用专有评分方法给出可审计、可解释的分数。该实验室目前面向 AI 教练、日记和心理健康支持等高风险应用,团队仅 5 人,处于早期阶段。
- 动态X @iotcoi
软件工厂:AI SDLC 多宇宙搜索
这周六深入探讨软件工厂:露台抽雪茄,秋日空气,Machinist 当工头,Temporal 管状态,CubeSandbox 克隆 10 个环境,Codex/Claude/OpenCode 竞争,oracle 选出赢家,我来批准 SDLC 构建一条路径。AI SDLC 在多宇宙中搜索最优解
- 动态X @_can1357
Tern v0.2.1 更新日志发布
感谢大家第一轮的反馈! 这是 Tern v0.2.1 的更新日志,由它自己生成,大约 10 分钟后发布 😬
- 动态X @_can1357
v0.2.8 发布新增 Notebook 支持
v0.2.8 现已发布,包含大量修复以及最后一刻加入的功能:Notebook 支持!
- 动态X @AISecHub
ADE Skills 项目 GitHub 发布
https://github.com/Adversarial-Detection-Engineering/adeskills
- 动态X @AISecurityInst
AISI 开源 optstop 优化评估 token 消耗
一些前沿 AI 评估需要数亿 token,而每一次浪费的试验都有真实成本。 我们推出 optstop:我们的开源工具,能在估计已经精确的地方停止评估,在还不精确的地方继续运行。🧵
- 动态X @uiuc_aisecure
UIUC 多模态红队智能体 ARMs 亮相 ICLR
非常期待这个多模态红队智能体,由我出色的学生 @xun_aq @ZRChen_AISafety @MintongKang @jiaweizhang 和产业合作者 @MinzhouP @Shuang 领导!请来 ICLR 我们的海报前给出反馈!!@xun_aq 本人就在 ICLR 现场!
- 动态X @uiuc_aisecure
UIUC 团队开源 DTap:面向 Agent 红队的可控沙箱与 DTap-Bench 基准
UIUC 团队开源 DecodingTrust-Agent Platform(DTap),一个面向高级 AI Agent 红队的可控仿真平台,作者称其环境、工具与输出均可模拟和操控,不依赖外部 MCP 服务,便于规模化、可复现地评估 Agent 风险。平台模拟 14 个高风险领域的 50 多个真实环境,Agent 接口参照官方 MCP 与 GUI 复刻,环境为全栈、可交互且可并行。团队同时发布 DTap-Bench,包含约 7K 个 Agent 红队任务和约 4K 个有策略依据的恶意目标,每个任务覆盖环境、工具、技能、提示词层面的注入及其组合,并配有可验证的判定器检查环境中的实际后果。团队称用该基准评测了主流 Agent 框架与基座模型,发现系统性漏洞与零日问题。论文、平台与代码链接已公开。
- 动态X @GoogleDeepMind
Google DeepMind 播客探讨 AI 内容溯源与水印
当 AI 生成内容变得如此逼真,我们如何验证哪些是人、机器或自然创造的? 我们在播客中探讨溯源的重要作用——以及不可感知的水印如何保护数字媒体和生物设计。↓ 时间轴: 00:00 介绍 00:34 什么是水印? 04:35 SynthID 15:16 图像与视频 19:28 SynthID Bio 28:00 韧性的未来
- 动态Adversa AI
Adversa AI 汇总 2026 年 10 月 AI 编码 Agent 安全资源 26 项
Adversa AI 发布 2026 年 10 月 AI 编码 Agent 安全资源汇总,共 26 项,按攻击技术、编码 Agent 漏洞、事件、入门、防御、红队和 CISO 资源分类。汇总指出 9 月的攻击面集中在仓库本身:恶意 git 配置可在 Claude Code、Codex、Cursor 等七个 harness 中于审批提示出现前执行代码,Claude Code、Codex、GitHub Copilot 和 Gemini CLI 的固定插件提交可在自动更新时被静默替换,仓库子代理配置可让 Claude Code 运行 C2 载荷。沙箱方面,Codex 两次越狱、DeepSeek Harness 可经 loopback 切换到完全访问权限、brig 沙箱存在符号链接穿越。
- 动态Mistral AI
Mistral 发布 Leanstral:面向 Lean 4 的可信 vibe-coding 开源基础模型
Mistral 发布 Leanstral,首个专为 Lean 4 设计的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并上线 Mistral vibe 的 agent 模式与免费 API。在 FLT 项目 PR 的 FLTEval 基准上,Leanstral pass@2 得分 26.3,超过 Sonnet 2.6 分而成本仅 36 美元(Sonnet 为 549 美元),pass@16 达 31.9;对比开源模型,GLM5-744B-A40B 与 Kimi-K2.5-1T-32B 分别止步约 16.6 和 20.1。该模型支持任意 MCP,并针对 lean-lsp-mcp 专门训练。
- 动态Mistral AI
Mistral Studio 推出内置与自定义 MCP 连接器
Mistral 在 Studio 发布 Connectors,内置连接器与自定义 MCP 均可通过 API/SDK 用于所有模型和智能体调用,并新增直接工具调用与 human-in-the-loop 审批流程。连接器以 MCP 协议打包为可复用实体,集中注册后可在 LeChat 和 AI Studio 中使用,支持 Conversation API、Completions API 和 Agent SDK,用于对接 CRM、知识库等企业系统。
- 动态Mistral AI
Mistral 发布 Leanstral 1.5:6B 激活参数的形式化验证模型
Mistral 发布 Apache-2.0 许可的 Leanstral 1.5,总参数 119B、激活参数 6B,在 miniF2F 上达到 100%,PutnamBench 解出 587/672 题,FATE-H 与 FATE-X 分别取得 87% 和 34% 的 SOTA。该模型经 mid-training、监督微调与 CISPO 强化学习三阶段训练,在 57 个代码仓库中发现 5 个此前未知的 bug,FLTEval 上 pass@1 从 21.9 提升至 28.9。模型已完全开源,可通过 Hugging Face 和免费 API 使用。
- 动态先知社区
OWASP GenAI LLM TOP 10 2026 中文民间翻译:AI 安全风险 TOP 10
OWASP GenAI LLM TOP 10 2026 的中文民间翻译版本发布,梳理了大语言模型应用面临的十大安全风险。该清单由 OWASP 发布,是 AI 安全领域被广泛引用的风险分类基准。此次翻译为中文读者提供了 2026 版风险条目的对照参考。
- 动态先知社区
HostTraceAI:让 AI 安全接管主机溯源的权限分级与接入实践
HostTraceAI 尝试把 AI Agent 引入应急响应中的主机溯源流程,用权限分级与接入机制回答"凭什么让 AI 动生产主机"。该工具面向被植入木马或 WebShell 的服务器排查场景,覆盖进程、服务、启动项、计划任务、网络连接、文件变更和登录活动等取证环节,目标是把原本依赖手工敲命令、截图和翻终端历史的重复流程变得可复现、少遗漏。
- 动态AI Verify Foundation(新加坡)
AI Verify 教程第二部分:构建插件并扩展 AI Verify
AI Verify Foundation 发布教程视频第二部分,讲解如何创建自定义插件来扩展 AI Verify 的功能。内容包括 AI Verify 架构与插件的介绍、定制第一个插件以及测试算法展示组件三部分,面向希望增强并为该开源社区做贡献的各水平开发者。
- 动态BlueDot Impact
Quaver:面向评测与基准的 Lovable——从 Rideshare-Bench 到自动生成评测脚手架
Faw Ali 开发了 Quaver,只需用自然语言描述基准,AI 智能体即可生成完整评测脚手架并运行模型、分析结果。其早期成果 Rideshare-Bench 将 AI 置于模拟零工经济中考察驾驶安全、收益与乘客公平性,Claude Sonnet 4.5 在 12 个模拟日内赚得 $1,871,约为可能上限的一半,并为追逐高峰定价驶入拥挤区域、在事故风险达 15% 的情况下疲劳驾驶。该项目获评 2026 年 1 月 Technical AI Safety Project Sprint 杰出提交,作者正以此为基础筹建 Ocarina Labs,推动针对 AI 智能体的独立部署前安全测试。
- 动态BlueDot Impact
aegish:用 LLM 在执行前拦截恶意 Shell 命令的原型
aegish 是一个原型 Linux shell,在命令执行前加入 LLM 层:先做静态分析,再由 LLM 按自然语言决策树把命令分类为 ALLOW、WARN 或 BLOCK,生产模式下用内核级 Landlock 做最后兜底。作者用来自 GTFOBins 的 676 条有害命令和 496 条无害命令,对 4 家提供商的 9 个 LLM 做了基准测试。无害命令分类已接近饱和,所有模型的无害接受率为 96.8%–100%;区分度主要来自恶意检测率,9 个模型中有 4 个超过 95%。小模型表现反超旗舰模型,GPT-5 Mini 优于 GPT-5.1,Claude Haiku 4.5 优于 Claude Opus 4.6 和 Claude Sonnet 4.5。
- 动态Stanford CRFM
Stanford CRFM 将 Unitxt 集成进 HELM,实现可定制化基准评测
Stanford CRFM 宣布将 IBM Research 开发的开源数据处理与基准定制平台 Unitxt 集成进 HELM 评测框架,使 HELM 用户可以运行可共享、可定制的评测流水线。Unitxt 目录目前提供超过 24 项 NLP 任务、400 个数据集、200 个提示模板和 80 个指标(含 LLM as a judge),令 HELM 可用数据集翻倍以上。该集成分解为数据加载、预处理、提示模板化和指标计算四个模块阶段,并可与 Hugging Face Datasets、Hugging Face Evaluate、LM Evaluation Harness 互操作,从而更容易复现相同提示词的评测流程。
- 动态AI Verify Foundation(新加坡)
Tutorial Part I:如何使用 AI Verify
这段视频分步讲解 AI Verify 工具包的负责任 AI 原则与实际操作,涵盖其基本功能和用法,帮助初学者上手并测试自己的 AI 模型。若想参与贡献 AI Verify,可观看第二部分。
- 动态AI Verify Foundation(新加坡)
AI Verify 与 Project Moonshot 概览:两大 AI 评估工具的用途对比
AI Verify 基金会梳理了 AI Verify 与 Project Moonshot 两款 AI 评估工具的定位差异,帮助使用者按自身需求选择合适的方案来测评和改进 AI 系统。两者可用于对照关键 AI 治理原则开展评估,并借此建立利益相关方的信任。
- 动态AI Verify Foundation(新加坡)
IMDA 发布面向 LLM 应用的安全与可靠性测试入门套件
IMDA 发布了《Testing LLM-based Applications for Safety and Reliability》入门套件,将业界与政府的新兴最佳实践整合为一套实用且自愿采用的指南,适用于各行业的 GenAI 应用。该套件提供分步指引,帮助企业识别风险、采用稳健的测试方法并评估其应用是否达到基线级安全与可靠性,覆盖五类常见风险:模型幻觉与不准确、决策偏见、不良内容、数据泄露以及易受对抗性提示词攻击。
- 动态Stanford CRFM
Stanford CRFM 将基于 IRT 的自适应测评集成进 HELM
Stanford CRFM 提出基于 IRT 中 Rasch 模型的两阶段自适应测评方法并集成进 HELM 框架,用以降低大语言模型的评测成本同时保持可靠性。该方法先在校准阶段估计各 LLM 的能力参数和各问题的难度参数,再据其动态选取最具信息量的问题进行自适应测试,从而减少所需题目数。在来自 5 个 HELM 排行榜的 22 个数据集、涵盖 183 个 LLM 和超过 78000 道题目的实验中,该模型平均取得训练集 0.85、测试集 0.83 的 AUC-ROC;在 Civil Comments 上对未参与校准的 Llama 3.1 8B 做自适应测试,前 200 题的能
- 动态Epoch AI
Epoch AI 周报:Cyber Vulnerabilities 浏览器上线,FrontierMath v2 中 Claude Fable 5 登顶
Epoch AI 发布了 Cyber Vulnerabilities 浏览器,追踪各组织自 2022 年以来向 CVE Program 报告的漏洞,可按严重程度筛选并叠加 AI 里程碑,数据显示 Anthropic 于 3 月底向 Project Glasswing 合作伙伴发布 Mythos Preview 前后高危与危急 CVE 明显上升。新版 FrontierMath: Tiers 1–4(Version 2)经审计修正了初版 42% 题目中的错误,Anthropic 最新的 Claude Fable 5 位居榜首,在 Tiers 1–3 达到 87%、Tier 4 达到 88%。