全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态Guardrails AI
Guardrails AI v0.11.0 发布
Guardrails AI 发布 v0.11.0,更新 SECURITY_ADVISORY.md 并修复多项安全问题,包括将 aiohttp 从 3.13.3 升级到 3.13.5、修复 GitHub Workflows Action 的模板注入、将 anyio 升级到 4.14.2。该版本还弃用 hub CLI 与私有 registry,迁移至公共 PyPI,并采用 guardrails-ai-types 0.5.0。
- 动态Pydantic AI
Pydantic AI v2.52.0 修复 web_fetch 安全漏洞并发布 harness 与 CLAI 2
Pydantic AI v2.52.0 修复了本地 web_fetch 工具的一处中危安全问题(GHSA-v36g-jcw9-x7cw):处理攻击者控制的深层嵌套 HTML 会消耗过多 CPU 和内存,provider 原生网页抓取不受影响,已在 2.52.0(v2)和 1.107.7(v1)修复。该版本同时将 pydantic-ai-harness 并入仓库并随每次发布更新,pydantic-clai2 0.52.0 首次发布,可通过 uvx pydantic-clai2 运行。
- 动态MCP Python SDK
MCP Python SDK v2.0.0 稳定版发布
MCP Python SDK v2.0.0 稳定版发布,支持 2026-07-28 版 Model Context Protocol 并兼容全部早期版本,pip install mcp 现安装 2.x。v1.x 进入维护模式,仅接收安全修复。新版将 FastMCP 更名为 MCPServer,引入一等公民 Client 对象,默认开启 OpenTelemetry 追踪,强化 stdio 与 OAuth(含 RFC 9207 签发者校验),Streamable HTTP 服务器对超过 4 MiB 的请求体返回 HTTP 413。
- 动态Google ADK
Google ADK v2.8.0 发布:新增 Model Armor 护栏插件并修复 BigQuery 工具 SQL 注入
Google ADK 发布 v2.8.0,新增 Model Armor 护栏插件,并修复 BigQuery 工具中的 SQL 注入漏洞。该版本还加入 ADK_MAX_LLM_CALLS 环境变量以限制 LLM 调用上限,为 RemoteA2aAgent 增加原生任务模式与 auth_scheme、auth_credential 认证支持,并新增对中继智能体输出的围栏处理,防止其被伪装成指令。此外引入按调用与按工作流的 token 消耗等实验性遥测指标,默认关闭,需通过 ADK_EXPERIMENTAL_TELEMETRY=true 或 RunConfig 显式开启。
- 动态Google ADK
Google ADK v2.11.0 发布:新增执行取消、工具确认与 SQLite 记忆服务
Google ADK 发布 v2.11.0,为 Runner、Workflow 和节点新增 abort_signal 以优雅取消执行,客户端断开时 /run_sse 会自动取消运行。工作流中的工具节点现可通过 RequestInput 暂停等待用户批准,并新增 ModelConsultTool,让智能体在任务中途咨询另一模型,受每轮和每会话预算限制。该版本还加入基于 sqlite:// URI 的本地 SQLite 记忆服务,并提供 MCP SDK 2.x 的现代协议连接路径;Dev UI 运行时配置改由服务器按请求提供,不再写入安装包。
- 动态MCP TypeScript SDK
MCP TypeScript SDK 1.32.0 发布,新增重定向同源限制与工具调用参数上限
MCP TypeScript SDK 发布 1.32.0,HTTP 客户端传输现在只在同源(相同 scheme、host 和 port,同 host 的 http 到 https 允许)时跟随重定向;若部署端点重定向到其他 host 或 port,需配置最终 URL,或在 StreamableHTTPClientTransport、SSEClientTransport 上设置 redirectPolicy: 'follow',浏览器中未设置该选项的重定向请求会失败。新增两个默认关闭的选项:McpServer 的 maxToolInputElements 限制工具调用参数中数组元素和对象成员的数量;requireBearerAuth 的 expectedResource 只接受为该服务器签发的 token(token 的 audience)。
- 动态CrewAI
CrewAI 1.15.17 发布:修复 SSRF 检查与 OpenAI Responses API 原生工具调用问题
CrewAI 发布 1.15.17,新增声明式对话流文档,并让声明可驱动对话模式、支持对话模式显式启用。安全与稳定性修复包括:将 SSRF 检查固定到每一跳重定向及对端 IP、把工具错误归属到实际失败的工具、修复 OpenAI Responses API 上原生工具调用失效的问题,并在每次失败尝试后关闭 agent 作用域。
- 动态CrewAI
CrewAI 1.15.19 发布:修复 pypdf 与 nltk 安全漏洞
CrewAI 发布 1.15.19 版本,将 pypdf 升级至 6.16.2、nltk 升级至 3.10.3 以修复安全漏洞。该版本新增 Clipper 集成客户端、CEL 表达式环境的 now() 函数,并修复原生 Gemini provider 追加末尾用户轮次、Ollama base URL 的 scheme 与 port 归一化等问题,同时为当前 Claude 模型修复原生结构化输出并设置 Snowflake CVE 下限。
- 动态TechCrunch AI
Circuit Breaker Labs 想让孩子(和你)用上更安全的 AI
Circuit Breaker Labs 打造了一支由 AI 智能体组成的“碰撞测试假人”队伍,模拟不同年龄、背景、语言和文化的用户,对模型进行红队测试,检测其能否识别危险、心理有害的对话。这些模拟会还原真实口语、俚语、隐语和错别字,每天运行数万到数十万次交互,再用专有评分方法给出可审计、可解释的分数。该实验室目前面向 AI 教练、日记和心理健康支持等高风险应用,团队仅 5 人,处于早期阶段。
- 论文arXiv
ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害
针对多模态大语言模型在文本与视觉实体单独无害、逻辑组合后却诱发不安全输出的隐式风险,研究提出逐步监督结构化推理框架并训练出专用护栏模型 ThinkingGuard。团队同时构建首个显式建模风险组合性的数据集 TriggerBench(5,600 条),通过隔离 Key Elements 与 Trigger Elements 构造反事实对比对,消除风险残留。ThinkingGuard 采用步进奖励蒙特卡洛树搜索探索最优推理轨迹,并经双约束偏好对齐蒸馏进模型,在标准与隐式安全基准上均取得强劲表现。
- 动态X @iotcoi
软件工厂:AI SDLC 多宇宙搜索
这周六深入探讨软件工厂:露台抽雪茄,秋日空气,Machinist 当工头,Temporal 管状态,CubeSandbox 克隆 10 个环境,Codex/Claude/OpenCode 竞争,oracle 选出赢家,我来批准 SDLC 构建一条路径。AI SDLC 在多宇宙中搜索最优解
- 动态X @JSchaeff3r
AI 编程智能体真实轨迹精选
我翻阅了 1500 条公开的 AI 编程智能体轨迹,精选出其中最疯狂的案例。用户用死亡威胁诱导模型、智能体未经测试就部署交易机器人、用户行为失控等等。浏览真实环境中的智能体并上传你自己的:http://traced.run
- 动态X @JSchaeff3r
CIAware-Bench 衡量 AI 控制干预感知
AI 有时能察觉控制干预,但检测大多接近随机水平。感知能力取决于智能体、监控器和环境这三元组合。我们构建了 CIAware-Bench 来衡量控制干预感知。🧵
- 动态X @_can1357
Tern v0.2.1 更新日志发布
感谢大家第一轮的反馈! 这是 Tern v0.2.1 的更新日志,由它自己生成,大约 10 分钟后发布 😬
- 动态X @_can1357
v0.2.8 发布新增 Notebook 支持
v0.2.8 现已发布,包含大量修复以及最后一刻加入的功能:Notebook 支持!
- 动态X @AISecHub
ADE Skills 项目 GitHub 发布
https://github.com/Adversarial-Detection-Engineering/adeskills
- 动态X @AISecHub
用 Keras Lambda 层创建恶意 ML 模型并逆向工程
https://medium.com/@danielhammon1/creating-a-malicious-ml-model-with-a-keras-lambda-layer-then-reverse-engineering-it-9f0f855ebebb
- 动态X @_Sizhe_Chen_
Meta-SecAlign-70B 通过博士资格答辩
通过了我的博士资格答辩(论文开题)!特别感谢导师 David Wagner 和 Chuan Guo 在过去两年的大力支持。我们的 Meta-SecAlign-70B 在提示注入安全性和智能体(工具/网页)实用性上与 GPT-5(high)相当。3 个月内下载量达 1 万次!
- 动态X @AISecurityInst
AISI 开源 optstop 优化评估 token 消耗
一些前沿 AI 评估需要数亿 token,而每一次浪费的试验都有真实成本。 我们推出 optstop:我们的开源工具,能在估计已经精确的地方停止评估,在还不精确的地方继续运行。🧵
- 动态X @uiuc_aisecure
UIUC 多模态红队智能体 ARMs 亮相 ICLR
非常期待这个多模态红队智能体,由我出色的学生 @xun_aq @ZRChen_AISafety @MintongKang @jiaweizhang 和产业合作者 @MinzhouP @Shuang 领导!请来 ICLR 我们的海报前给出反馈!!@xun_aq 本人就在 ICLR 现场!
- 动态X @uiuc_aisecure
UIUC 团队开源 DTap:面向 Agent 红队的可控沙箱与 DTap-Bench 基准
UIUC 团队开源 DecodingTrust-Agent Platform(DTap),一个面向高级 AI Agent 红队的可控仿真平台,作者称其环境、工具与输出均可模拟和操控,不依赖外部 MCP 服务,便于规模化、可复现地评估 Agent 风险。平台模拟 14 个高风险领域的 50 多个真实环境,Agent 接口参照官方 MCP 与 GUI 复刻,环境为全栈、可交互且可并行。团队同时发布 DTap-Bench,包含约 7K 个 Agent 红队任务和约 4K 个有策略依据的恶意目标,每个任务覆盖环境、工具、技能、提示词层面的注入及其组合,并配有可验证的判定器检查环境中的实际后果。团队称用该基准评测了主流 Agent 框架与基座模型,发现系统性漏洞与零日问题。论文、平台与代码链接已公开。
- 动态X @GoogleDeepMind
Google DeepMind 播客探讨 AI 内容溯源与水印
当 AI 生成内容变得如此逼真,我们如何验证哪些是人、机器或自然创造的? 我们在播客中探讨溯源的重要作用——以及不可感知的水印如何保护数字媒体和生物设计。↓ 时间轴: 00:00 介绍 00:34 什么是水印? 04:35 SynthID 15:16 图像与视频 19:28 SynthID Bio 28:00 韧性的未来
- 动态Adversa AI
Adversa AI 汇总 2026 年 10 月 AI 编码 Agent 安全资源 26 项
Adversa AI 发布 2026 年 10 月 AI 编码 Agent 安全资源汇总,共 26 项,按攻击技术、编码 Agent 漏洞、事件、入门、防御、红队和 CISO 资源分类。汇总指出 9 月的攻击面集中在仓库本身:恶意 git 配置可在 Claude Code、Codex、Cursor 等七个 harness 中于审批提示出现前执行代码,Claude Code、Codex、GitHub Copilot 和 Gemini CLI 的固定插件提交可在自动更新时被静默替换,仓库子代理配置可让 Claude Code 运行 C2 载荷。沙箱方面,Codex 两次越狱、DeepSeek Harness 可经 loopback 切换到完全访问权限、brig 沙箱存在符号链接穿越。
- 动态Mistral AI
Mistral AI 推出 Mistral AI Studio 生产级 AI 平台
Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。Observability 提供 Explorer、Judges、Campaigns 与 Datasets 等能力,用于流量检查、规模化评估和回归追踪;Agent Runtime 基于 Temporal 构建有状态、容错的执行环境,支持重试与长任务;AI Registry 统一管理 agents、模型、数据集、judges、工具与工作流的版本、血缘和访问控制。平台支持混合、专用和自托管部署。