全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA OpenShell:更安全地运行自主、自进化 AI 智能体
NVIDIA 推出 OpenShell,用于更安全地运行自主、自进化的 AI 智能体。这类被称为 claws 的智能体可接受目标后自行规划并持续执行,无需人类介入。随着其能力增强,信任难度上升,其自进化自主性也改变了运行环境。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
如何用 OpenClaw 与 NVIDIA NemoClaw 构建更安全、常驻的本地 AI 智能体
NVIDIA NemoClaw 这套开源参考栈可编排 NVIDIA OpenShell,在本机沙箱中运行 OpenClaw 等开放 harness,构建常驻的本地 AI 智能体。教程在 NVIDIA DGX Spark(GB10)上用 Ollama 本地部署 NVIDIA Nemotron 3 Super 120B,并接入 Telegram 远程访问。OpenShell 负责沙箱隔离、凭证管理与 API 代理,但官方提醒任何沙箱都无法完全防御高级提示注入。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA AI Red Team 如何用语法约束解码改进小语言模型的 Bash 生成
NVIDIA AI Red Team 提出用语法约束解码改进小语言模型的 Bash 命令生成,并将命令生成列为研究目标。Bash 是暴露给 AI 智能体的最灵活接口之一,模型输出的命令是可执行动作,能够读取文件、修改工作区、打开网络连接并串联工具。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA-Verified Agent Skills 为 AI 智能体提供能力治理
NVIDIA-Verified Agent Skills 为 AI 智能体提供能力治理,仅靠运行时护栏并不足够。随着自主 AI 智能体能力增强,开放模型、MCP 连接的工具与可移植技能让智能体更易扩展,但规模化使用需要结构透明与运行完整性。组织与团队需要理解和信任智能体所使用的技能(即指令)。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA MCG Toolkit 如何自动化 AI 模型文档编写
NVIDIA 发布 MCG Toolkit,用于自动化生成 AI 模型文档。该工具针对加州 AB-2013 和欧盟 AI Act 等监管框架下的模型卡编写需求,帮助软件团队在模型发布前产出可审计的完整文档,涵盖模型工作原理、预期用途与许可、训练数据及性能等信息。
- 动态METR
Opus 4.6 用简单 ReAct 脚手架复刻 CLI 版《Slay the Spire》与《Balatro》的观察
Opus 4.6 在简单 ReAct 脚手架下成功复刻出 CLI 版《Slay the Spire》和《Balatro》,虽功能残缺但基本可玩。测试给予 60 million tokens 总量、64,000 tokens 上下文窗口、reasoning effort "max" 并开放联网。复刻版存在卡牌效果错误、地图导航混乱、部分药水与事件缺失等问题,作者手动游玩约两小时评估,未设严格评分标准。
- 动态METR
METR 微调实验:少量指令微调即可提升思维链可控性
METR 发现,用 240 条指令跟随推理数据(约 100K-300K token)对 GPT-OSS-20B、GPT-OSS-120B、Qwen-3-8B、Qwen-3-32B 四个推理模型做微调后,在分布外 CoTControl 评测集上的思维链可控性从平均 2.9% 升到 8.8%。提升最大的是指定大小写推理、抑制特定词和向推理中插入指定句子这几类指令。作者指出 8.8% 绝对值仍低,但说明少量微调即可提升可控性,这一能力可能是模型潜在具备而非新学到的。局限包括前沿实验室不太可能专门为可控性做微调、尚未证明可控性提升会降低可监控性、以及多轮或 Agent 场景下影响不明。
- 动态METR
METR 研究笔记:从 NanoGPT 竞速看 AI 智能体的 AI 研发进展
METR 研究笔记通过 NanoGPT speedrun 排行榜评估 AI 智能体对 AI 研发的加速作用:2024 年 5 月至 2026 年 3 月,36 位贡献者提交 77 项记录,将小赛道训练时间从 45 分钟压缩至 1.43 分钟,累计加速 31 倍。其中约 21 倍来自浅层与中等深度贡献,导入、改编、原创想法分别贡献 6.7 倍、3.0 倍和 1.6 倍。2025 年底至 2026 年初有 4 项记录由专用 AI 智能体系统与人类共同署名,但贡献相对浅层;作者同时提示数据污染、幸存者偏差和规模依赖等解读局限。
- 动态Google Bug Hunters
OSV-SCALIBR 推出新补丁奖励计划
Google 为 OSV-SCALIBR 推出补丁奖励计划,向提交新型 OSV-SCALIBR 插件的开发者提供资金激励,插件方向包括资产清点、漏洞检测和密钥检测。该计划由 Google Bug Hunters 发布。
- 动态Google Bug Hunters
Google DeepMind 将 Hybrid 传输协议扩展至通用 JSON 消息
Google DeepMind 将 Hybrid 传输协议扩展为支持通用 JSON 消息,为多种新的安全认证与凭证用例铺路。
- 动态Redwood Research
Redwood Research 新论文:AI 控制中的重试与重采样对比
Redwood Research 发布新论文 Retrying vs Resampling in AI Control,在 BashArena 中用 Claude Opus 4.6 作为不可信模型、MiMo-V2-Flash 作为可信模型,重新检验 Ctrl-Z 提出的重采样协议,并与类似 Claude Code auto mode、Codex Auto-review 的重试协议对比。研究发现,重采样结论大体与 Ctrl-Z 一致,但有两处明显差异:用重采样做审计决策时应取最大可疑度而非最小,且三次触发后审计不再有效;若把 Ctrl-Z 中表现最好的技术直接搬到新设定,会大幅逊于可信监控。
- 动态Redwood Research
Redwood Research 提出不可信建议协议:每步 16 字符建议可恢复 67% 能力差距
Redwood Research 提出不可信建议(untrusted advice)协议,让可信执行模型 T 承担全部动作,不可信强模型 U 只能通过受限通道发送简短建议,从而把 U 的影响压缩到可监控的窄通道内。在 SWE-bench Verified 上,U 每步最多写 16 字符建议即可恢复 T 与 U 之间约 67% 的能力差距,整个任务累计约 320 字符;实验用 Claude Sonnet 4.6 作为 U,Gemini 3.1 Flash Lite 和 gpt-oss-120b 作为 T,在 SWE-bench Verified 与 BashArena 各 200 个任务上评测。
- 论文Hugging Face Daily Papers
EngiWorld 基准发布:前沿 Agent 在专业工程环境中最高仅得 44.3 分
研究者提出 EngiWorld,一个围绕完整设计闭环构建的工程 Agent 基准,包含 6 个工程领域(CAD、CAE、CAM、BIM、EDA 和 3D 可视化)、26 个专业软件平台、GUI 与 CLI 两种界面以及 6 类任务,共 1301 个专家整理的任务。该基准采用以产物为中心的评价方法,通过统一的领域验证器套件程序化检查最终与中间产物的几何有效性、物理可行性和规则合规性,并按规格达成度对定量设计任务连续打分,而非二元判定成功。对 7 个前沿模型的评测显示存在明显能力缺口:最强模型的 EngiScore 仅为 44.3,多软件任务的尝试成功率只有 3.6%。
- 动态Import AI
NVIDIA 用 ENPIRE 搭建机器人自我改进闭环
NVIDIA 研究人员开发了 ENPIRE 软件,让实体机器人在编码智能体驱动下自主实验并迭代策略,实现无需人工评判的成功率评分与场景自动重置。该系统由环境、策略改进、Rollout 和进化四个模块组成,工作站搭载 NVIDIA RTX 5090,配合两台 YAM 机械臂运行。在 PushT、整理插针盒和使用切割器剪断扎带等任务中取得最高 99% 成功率,并能尝试将 GPU 插入主板。
- 动态Import AI
Import AI 464:Fable 编写 GPU 内核、AI 自动化与模拟计算
Fable 写出了首个真正的 megaKernel——据 KernelBench-Mega 维护者和官方榜单确认,它在 RTX PRO 6000 Blackwell 上用 CUDA 实现 18.71X 加速,超过 Claude Opus 4.8 的 14.4X、GLM-5.2 的 11.14X 和 GPT 5.5 的 4.34X,且每个解码 token 仅一次协作内核启动,其他高分方案需 4–14 次。
- 动态OpenAI Alignment Research
OpenAI 分享在规模化代码验证上的实践方法
OpenAI 介绍了为 gpt-5-codex 和 gpt-5.1-codex-max 训练专用智能体代码审查器的经验,将其作为深度防御策略中的输出监控手段。审查器获得仓库级工具和执行权限后,能发现更多关键问题并减少误报,专门针对代码审查的训练进一步提升效果。部署上优先保证信噪比,宁可适度降低召回率以换取开发者信任,并允许通过自定义任务指令或 AGENTS.md 调整这一取舍。数据显示,Codex 云完全生成的 PR 中有 36% 收到评论,其中 46% 促使作者修改代码,人工编写 PR 的评论修改比例为 53%;截至 2025 年 10 月,系统每天处理超过 10 万条外部 PR,超过 80% 的评论反馈为正面。
- 动态腾讯玄武实验室
腾讯玄武实验室提出端侧提示词隐私保护方案并开源中文权重
腾讯安全玄武实验室提出一种可部署在端侧的提示词隐私保护方案,在调用云端 LLM 的流程中插入两个端侧步骤,先平行替换隐私实体完成脱敏,再还原云端输出中的隐私实体。方案用标注的平行语料训练了一个权重约 500MB 的小模型,基于开源模型 Bloom,在手机和笔记本上完成部署实验;仅用 CPU 时 MacBook M2 推理速度 180-200 tokens/s,MacBook M1 为 110-130 tokens/s,Pixel 8 Pro 为 20-30 tokens/s。原生支持润色、摘要、翻译、阅读理解和文本分类,并支持 Zero Shot 自定义扩展任务。
- 动态腾讯玄武实验室
腾讯玄武实验室推出一款基于安全大模型的EDR告警研判机器人
腾讯玄武实验室公开一款基于安全大模型的EDR告警研判机器人,能对EDR设备上报的告警做多维度的智能分析与自动调查取证。该机器人结合资产信息、事件信息、进程树和告警规则等多源细节,借助大模型的安全知识与推理能力展开研判,并将误报可能性量化为很大、中等偏大、中等偏小及很小四档,便于用户按优先级处置告警。其技术方案经30余轮迭代打磨而成,涵盖训练数据生成算法、数据分布优化策略、Prompt工程、微调与强化学习算法及模型能力评价体系,且支持私有化部署以保证极高吞吐量。
- 动态OpenAI
OpenAI 推出 Agents API
OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体,支持编排、长时间运行的会话与工具调用。
- 动态腾讯 AI-Infra-Guard 版本发布
腾讯 AI-Infra-Guard v4.1.13 发布
腾讯 AI-Infra-Guard 发布 v4.1.13,新增版本检查 API 端点(#376)。评分模块由加权比率改为绝对扣分模型(#403),并更新各语言 README 文档及致谢名单。
- 动态腾讯 AI-Infra-Guard 版本发布
腾讯 AI-Infra-Guard v4.1.14 新增 Agent 红队技能与 9 种单轮越狱攻击方法
腾讯 AI-Infra-Guard 发布 v4.1.14,新增面向 Agent 安全的 aig-agent-redteam 技能,并加入 PrefillAttack、ICA、PastTense、Overload、Jailbroken、FlipAttack、DeepInception、CodeChameleon、JAM 共 9 种单轮越狱攻击方法及 AdvBench、CNSafe、SafeBench 三个越狱评测数据集。该版本还将调度改为轮询选择 Agent 以实现负载均衡,并在文档中补充上述数据集致谢、更新 DeepTeam 仓库地址。
- 动态Frontier Model Forum
Frontier Model Forum 发布 AI 生物安全评估初步分类体系
Frontier Model Forum 发布《AI 生物安全评估初步分类》议题简报,提出按方法论和领域两个维度划分前沿 AI 生物安全评估的分类法与定义。方法论含三类:基准评估、红队演练和对照研究;领域涵盖科学知识与科学推理性评估及危害性生物知识评估,后者围绕生物威胁创建流程中的构思、计算机模拟实验等操作步骤展开。该分类基于 FMF 成员企业专家及外部先进 AI 与生物学专家的意见形成初步共识,旨在推动建立有效的 AI 生物安全评估生态。
- 动态Nicholas Carlini Writing
Nicholas Carlini 给出评估对抗样本防御的建议
Nicholas Carlini 基于其 ICML 2018 最佳论文《Obfuscated Gradients Give a False Sense of Security》的演讲,整理出评估对抗样本防御的建议。他指出 ICLR 2018 接收的防御论文中超过一半结论有误、评估偏弱,核心要求是必须针对具体防御设计自适应攻击,而非只测已有攻击。具体建议包括不要只用 FGS 攻击、使用 1000 次以上迭代的迭代攻击、从随机起点搜索、做迁移性分析、使用 ZOO、SPSA、NES 和仅决策攻击等无梯度方法,以及随机搜索。
- 动态Nicholas Carlini Writing
Nicholas Carlini 发布对抗机器学习阅读清单
Nicholas Carlini 整理了一份针对机器学习系统逃逸攻击(即对抗样本)研究的推荐阅读清单,分为三个版本:仅基础版收录五篇简要综述该领域的论文,快速入门版列出约十篇最值得读的重要论文,完整背景版则汇总所有从事神经网络评估的人应读完的论文。清单按主题分类并标注了各主题之间的先后阅读顺序,另提供 RSS Feed。