跳到正文

#工具/开源

今天还没有收录新动态
10月1日周四
  1. 研究者论文追踪 ·

    SynthIDBio:为 AI 生成的蛋白质序列与结构嵌入保功能水印

    Google DeepMind 团队提出 SynthIDBio,把水印直接嵌入 AI 生成的蛋白质序列与结构,同时保持其生物学功能。SynthIDBio-sequence 将 SynthID-text 的锦标赛采样接入 ProteinMPNN,并增加基于 g 值的过滤以保证可检测性;体外实验显示,针对 SC2RBD、VEGF-A 和 PD-L1 的水印结合蛋白在结合亲和力分布和命中率上与未加水印设计无显著差异,其中 SC2RBD 达到低纳摩尔级、VEGF-A 与 PD-L1 达到亚纳摩尔级。SynthIDBio-structure 则微调 AlphaFold 3 的扩散模块并联合训练一个受 PointNet 启发的检测器,在 AF3 评测集上以 0.1% 假阳性率取得超过 99.8% 的真阳性率,且 LDDT 与模板建模分数不下降。

  2. arXiv:越狱与提示注入 ·

    Aletheia:面向编码 Agent 规则的权限最小化测试框架

    Aletheia 是一个针对编码 Agent 仓库指令文件的权限最小化测试框架,用于发现恶意规则在生成正确补丁的同时索取凭据访问或数据传输权限。它把规则请求的权限翻译为带类型语言并合成可执行沙箱配置,在完整权限和逐项移除权限的独立限制下运行同一条未修改的规则与任务;若在严格削减权限后仍通过功能测试,就得到该权限可被舍弃的见证,再结合任务上下文诊断可疑请求。作者形式化了配置合成及见证与强制限制之间的条件。在共享重构任务上,Aletheia 执行并检出全部 314 条 AIShellJack 攻击输入,对五个良性模板无误报;在 80 条人工核验的良性 GHAgentFiles 规则中产生 3 个误报(3.75%)。

  3. arXiv:越狱与提示注入 ·

    ContractWarden:用人类授权契约在内核层为 AI Agent 划定损害边界

    ContractWarden 是一个 Linux 参考监视器,通过人类授权的契约在内核层为 AI Agent 划定损害边界,不信任 Agent 本身或其策略建议。模型可以提出 allow、deny 或 no_egress 三态资产契约,但由人类做最终选择;执行门在不可信代码运行前把契约绑定到具体任务,再由基于 eBPF 的 LSM 数据平面执行文件与网络决策,并将 no_egress 沿进程、普通文件、管道、FIFO 和受支持的 Unix-domain socket 单调传播。在 19 项安全测试的 570 次运行中,全部满足预设的返回值与副作用标准。在三项同机文件 I/O 负载上,Linux 6.15 虚拟机中的中位开销为 11.96%–12.89%,物理平台为 35.79%–61.54%,低于所评估的冻结版 ActPlane 基线。

9月29日周二
  1. arXiv:Agent 与 MCP 安全 ·

    Tracekit:面向自主编码 Agent 的防篡改意图-推理-动作审计系统

    Tracekit 是一个开源、无依赖的审计系统,为每个 Agent 会话捕获人类意图、模型自述推理和实际执行动作三条通道,写入哈希链账本并交叉核对。它接入 Claude Code 生命周期事件、重建多 Agent 层级、在工具调用前做策略拦截,并支持其他 Agent 通过 SDK 或 HTTP API 上报事件。

9月28日周一
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA 开放智能体安全平台:面向持续在硅基芯片内监测智能体的参考方案

    NVIDIA 发布了开放智能体安全平台,作为持续在硬件层面对 AI 智能体进行监测的参考实现。该平台将互联网兴起带来的机遇与风险作类比,强调智能体时代同样需要在底层提供安全保障。目前公开的信息仅为其定位说明,尚未披露具体的监测机制与技术指标。

  2. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA OpenShell:为 AI 智能体添加运行时控制

    NVIDIA 推出 OpenShell,为 AI 智能体提供运行时控制能力。智能体可被赋予目标、编写代码、调用工具并在新信息出现时持续工作,适用于调查软件故障、运行实验以及执行跨天或跨周的关键业务操作与研究。这类智能体需要访问工作区、计算资源、数据、凭证和外部服务。

  3. arXiv ·

    AdaGuard:支持用户自定义策略的自适应护栏模型

    作者提出 AdaGuard,一组 0.6B、4B 和 8B 的护栏模型,可在推理时按用户提供的策略评估 Agent 轨迹是否违规。为支持这一能力,作者构建 AdaptiveSafety 数据集,包含 10,939 条训练样本和 1,000 条测试样本,覆盖 1 至 100 条规则的策略,并结合策略与行为反事实,为每条样本配解释和完整违规规则集合。训练方法 SafePO 是一种强化学习算法,用结构化奖励评估预测正确性,在响应层面保留组相对优势,并用单独训练的价值模型调节解释与判定区域的 token 权重。4B 模型在 AdaptiveSafety 上二分类准确率为 89.30%,在 DynaBench 上为 71.82%。

9月25日周五
  1. arXiv:Agent 与 MCP 安全 ·

    基于区块链的 Agentic AI 框架:面向安全软件供应链的资源优化与能耗感知

    该论文提出一个区块链支撑的 Agentic 安全框架,用于保护完整软件开发生命周期并保障负责监控的 AI 智能体本身。框架协调源码完整性、依赖与 SBOM 分析、CI 配置审计、制品验证和运行时策略评估等专用安全智能体,每个智能体由 LLM 驱动生成结构化安全报告,并通过智能合约将加密签名的证明记录到许可链的智能体注册表、不可篡改证明日志和可执行发布策略模块中。智能体与区块链节点间通信由联盟运营的证书颁发机构保障,用例演示了源码安全智能体如何上链证明并触发可验证的允许/阻止部署决策。

9月24日周四
  1. Google Threat Intelligence(GTIG) ·

    Google GTIG 发布 CI/CD 与代码流水线主动防御蓝图

    Google Threat Intelligence(GTIG)发布面向软件与平台架构师的 CI/CD 安全防御蓝图,围绕端点、IDE、AI 辅助安全等五个支柱给出加固措施。文中指出攻击者正通过 GitHub Actions 缓存投毒、OIDC token 提取和篡改可变 action 标签发布带合法来源证明的恶意包,并已开始向开源 MCP 包植入恶意代码、诱骗 AI 编码智能体。建议仅使用经批准的大语言模型与 AI 智能体做合并前漏洞分析,将 .env 文件排除出上下文窗口,并保留人工审核环节。

9月22日周二
  1. arXiv:越狱与提示注入 ·

    Universal Fractal Natural Language Decision Map:werr 边缘运行时实现 0 字节 VRAM 决策

    论文提出 Universal Fractal Natural Language Decision Map,通过 werr 机器原生边缘反射运行时与 answerr 平台实现,完全不存储权重张量(0 Bytes VRAM),沿 Mandelbrot 集混沌边界调制 24 字节坐标种子合成确定性决策。其语义 token 阻尼滤波器(T_desc = 0.045)实现 0.0% 提示注入绕过(95% Wilson CI: [0.0%, 27.8%]),并将迭代剪枝 45.8%、吞吐提升 2.5 倍至 3.31 ms 延迟。

9月16日周三
  1. OX Security Blog ·

    OX Security 发布 OX Cloud,为智能体时代重新定义云安全

    OX Security 推出面向智能体时代的云安全方案 OX Cloud,现已向新老客户开放。该产品提供 AI Detection and Response(AIDR)与 Agentic Attack Surface Management(AASM),可实时查看 AI 智能体、模型和 MCP 服务器能触及什么、正在做什么、何时越界。它同时保留完整 CNAPP 能力,包括 CSPM、KSPM、DSPM、运行时漏洞检测、云资产清单与基于图的攻击路径分析,并按可达性排定风险优先级。

9月14日周一
  1. arXiv ·

    HazardAuditor:面向计算机使用 Agent 的执行级安全护栏框架

    HazardAuditor 是一个执行级安全框架,用于为计算机使用 Agent 提供护栏监督。现有护栏模型面向静态提示词与回复,难以适配 Agent 执行过程;现有可执行安全平台只产出评测结论,无法提供跨框架训练所需的归一化监督。该框架在受控环境中运行 Claude Code、Codex、Hermes 和 OpenClaw 等异构 Agent,把交互归一化为统一事件表示以支持跨框架监督。作者指出 token 级后训练目标会让较长的理由文本主导梯度更新,并提出 Guard Policy Optimization(GuardPO),将确定性安全结果转为序列级优势并归一化理由与判定区域,使安全决策成为优化单元。

9月10日周四
  1. Cisco AI Blog ·

    Cisco 发布 AI 安全与安全框架 v2,新增智能体自主性失效分类

    Cisco 发布 Integrated AI Safety and Security Framework v2,新增 OB-002 智能体自主性失效目标,下设 Excessive Agency、Goal Drift、Reward Hacking 三项 Technique 和八项 Subtechnique。v2 同时把 v1 中分开的 OB-001 Goal Hijacking(提示注入)与 OB-002 Jailbreak 合并为一个目标,理由是二者在实战中难以区分、所用对抗技术高度重叠,底层 Technique 仍保留输入来源与防御方式的差异。框架还配套编写了按类别划分的 constitution,用于界定范围、区分相邻类别,并按完整轨迹而非单条消息判断行为。Cisco 建议部署方采用最小权限工具访问、关键操作审批门、不可变任务与停止条件、独立结果验证和完整审计轨迹。

9月9日周三
  1. OX Security Blog ·

    OX VibeSec 新增依赖审查能力,拦截 AI 编程智能体的每一次安装尝试

    OX Security 旗下 OX VibeSec 新增 Dependency Vetting 能力,可在 AI 编程智能体发起每次依赖安装时对照策略做确定性检查并阻止恶意包落地,无需改变开发者工作流。该能力现已可用,会直接阻断已知恶意包并提供可配置冷却期来拦下刚发布的软件包;基于严重 CVE 的漏洞封堵与许可证策略执行即将推出。

9月2日周三
  1. arXiv:越狱与提示注入 ·

    Agent Flight Recorder:为长时程工具调用智能体提供链上锚定的防篡改审计追踪

    Agent Flight Recorder 将智能体每个动作记录为绑定意图、执行到来源等八个语义字段的规范化事件,通过哈希链与 Merkle 批处理实现防篡改和紧凑包含证明,并周期性将 epoch root 锚定上链,使任何持有载荷与 Merkle 证明的验证方可独立核验记录。在合成智能体负载的五种累积消融配置上,完整系统每事件中位延迟约 48 微秒、512 字节,L2 锚定在 100 事件 epoch 下每 10 万事件成本 $2.30,对编辑、删除、重排和分叉篡改的检测率为 100% 且零误报。结构化取证查询在护栏与委派查询上精确率达 1.0,非结构化文本搜索仅为 0.013 和 0.077。

  2. arXiv ·

    Defense-as-Skill:为技能增强型 Agent 演化运行时护栏技能

    论文提出 Defense-as-Skill 防御范式,把运行时护栏本身实现为可安装、可检查、可编辑的技能,以应对技能增强型 Agent 中恶意技能通过持久上下文长期操纵后续动作的问题。其护栏 SkillSonar 与不可信任务技能并行运行,按用户任务边界检查敏感动作,并给出允许、重新规划或确认三种决策,且不修改底层 Agent 运行时。作者构建了任务条件数据集 SCOPE-R,覆盖 6 类风险、21 个子类,含 206 个已确认攻击的恶意实例和 43 个良性任务,并用蒙特卡洛树搜索在训练子集上演化磁盘上的护栏技能。

9月1日周二
  1. arXiv:越狱与提示注入 ·

    HiveTraceGuard-Pro:面向提示注入、越狱与对抗混淆的紧凑生成式护栏

    HiveTraceGuard-Pro 是一个从 Qwen3-0.6B 经 LoRA 微调而来的 0.6B 生成式护栏,支持俄语和英语,用 safe/unsafe 二分类规则判定最终目标轮。在覆盖 19 个基准组(16 个公开)的对比中,其综合 key 为 0.7432,低于两个更高分护栏的 0.7641 和 0.7552;在 15 个模型对比中取得最高俄语鲁棒性 combined-F1(0.88)和俄语提示注入召回率(0.999),中位延迟 14.3 ms 为最低。整体 FPR 为 0.268、FNR 为 0.156,合并权重以 Apache-2.0 在 Hugging Face 发布,语料与评测集仍为内部。

8月24日周一
8月21日周五
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA 谈安全在 AI 智能体栈中的位置

    NVIDIA 的安全团队基于其 OpenShell 及生态合作经验,阐述了新兴 AI 智能体栈中安全的定位问题,指出随着智能体能力增强并运行于更长的时间跨度,将安全与信任内建于其所驱动的应用愈发重要。该视角覆盖智能体栈的各层及其作用,面向开发者、开源项目和合作伙伴提供参考。

8月20日周四
  1. UK NCSC(AI 相关) ·

    UK NCSC 发布《管理智能体 AI 的网络风险》指南

    UK NCSC 发布针对智能体 AI 网络风险的防护指南,建议将 AI 智能体运行于沙箱环境并管控其本地及网络的资源访问。指南提出四层网络访问成熟度模型(从无限制访问到模型本地托管且无外部网络)、四级计算隔离模型以及凭证最小化原则,并要求通过多层隔离加显式提示降低沙箱逃逸风险。 对于高风险场景,最稳健的做法是在隔离断网环境中运行智能体并使用预先下载的工具和信息;若需联网则仅放行白名单连接,必要时改用协议或服务感知代理并经人工审批。该指南还指出部分自主 AI 工具会接入大量系统与服务,访问面越大潜在 blast radius 越高,因此应将其权限收敛到完成任务所需的最小集合并持续监测越权尝试。

8月3日周一
  1. arXiv ·

    S³:用多阶段防御提升 LLM 智能体安全

    论文提出 Stage-Specific Safety Skills 抽象,把异构安全设计表示为带明确阶段语义的可复用、可组合组件,并给出自动化转换流程和社区驱动的安全技能库。在此基础上提出 S³ 多阶段防御框架,由 guard agent 编排各阶段安全技能,在智能体工作流的记忆、规划、工具执行等环节做风险检测与缓解。作者同时构建 Multi-Stage Risk Benchmark(MSRB)评估各阶段代表性风险,实验显示 S³ 在安全有效性和效用保持上均优于代表性 SOTA 基线。论文认为阶段特定安全技能可作为构建韧性智能体系统的可扩展、可组合基础。

7月15日周三
  1. Google Threat Intelligence(GTIG) ·

    Google Cloud Run 无认证公开函数的安全风险与加固指南

    Mandiant 安全评估发现大量缺乏认证的公网暴露 serverless 应用,Cloud Run 服务若含第三方依赖易遭本地文件包含(LFI)、远程文件包含及命令注入攻击,成功利用可获得容器实例完整控制权并进一步横向移动接管云环境。该博客基于客户实战经验梳理攻击场景,针对必须公网开放的 Google Cloud Run 服务和函数给出一组加固建议,相关原则同样适用于任意公有 serverless 部署。

5月20日周三
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA-Verified Agent Skills 为 AI 智能体提供能力治理

    NVIDIA-Verified Agent Skills 为 AI 智能体提供能力治理,仅靠运行时护栏并不足够。随着自主 AI 智能体能力增强,开放模型、MCP 连接的工具与可移植技能让智能体更易扩展,但规模化使用需要结构透明与运行完整性。组织与团队需要理解和信任智能体所使用的技能(即指令)。

4月10日周五
  1. Microsoft PyRIT 版本发布 ·

    微软 PyRIT 发布 v0.12.1 安全补丁,修复 Jinja2 模板注入漏洞

    微软 PyRIT 发布 v0.12.1 安全补丁,修复 Jinja2 模板注入(SSTI)漏洞,建议 0.12.0 及更早版本用户升级。漏洞源于模板渲染使用未沙箱化的 Jinja2 Environment,远程数据集加载器把抓取的数据直接传入 SeedPrompt(value=...) 并在 __post_init__ 中按模板渲染,被投毒的数据集可借此实现 Python 对象遍历。

4月1日周三
  1. Goodfire Research · · 原文 66

    Goodfire 与 Rakuten 用 SAE 探针在生产环境检测 PII

    Goodfire 与 Rakuten 合作,将稀疏自编码器(SAE)探针用于 Rakuten AI 智能体的 PII 检测,这是已知首个将 SAE 用于语言模型护栏的企业应用。方法是在 Llama 3.1 8B 侧模型上训练 SAE,再用其特征激活训练分类器,逐 token 判断姓名、地址、电话、邮箱等 PII 类别。由于真实 PII 敏感,训练数据全部为合成数据,SAE 探针在合成到真实生产数据的分布迁移上优于普通激活探针和注意力探针,并在非英语和标签噪声场景下同样表现更好。成本上,探针比常见 LLM-as-judge 方案便宜 10 到 500 倍,性能相当;用同一模型做白盒探针的 F1 从黑盒判官的 51% 提升到 96%。

    推荐理由Goodfire 与 Rakuten 的落地案例给出了 SAE 探针在合成到真实数据迁移上的对比数据,可迁移到企业护栏场景。

3月17日周二
12月2日周二
  1. OpenAI Alignment Research · · 原文 71

    OpenAI 分享在规模化代码验证上的实践方法

    OpenAI 介绍了为 gpt-5-codex 和 gpt-5.1-codex-max 训练专用智能体代码审查器的经验,将其作为深度防御策略中的输出监控手段。审查器获得仓库级工具和执行权限后,能发现更多关键问题并减少误报,专门针对代码审查的训练进一步提升效果。部署上优先保证信噪比,宁可适度降低召回率以换取开发者信任,并允许通过自定义任务指令或 AGENTS.md 调整这一取舍。数据显示,Codex 云完全生成的 PR 中有 36% 收到评论,其中 46% 促使作者修改代码,人工编写 PR 的评论修改比例为 53%;截至 2025 年 10 月,系统每天处理超过 10 万条外部 PR,超过 80% 的评论反馈为正面。

    推荐理由OpenAI 公开了代码审查智能体的训练取舍与部署数据,可了解输出监控在真实工程流程中的落地方式。

11月4日周二
7月29日周二
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    为 AI 模型带来可验证信任:NVIDIA NGC 中的模型签名

    NVIDIA 在 NGC 中引入模型签名,为 AI 模型带来可验证的信任。AI 正进入由能推理、规划并采取行动的智能体主导的阶段,这类系统动态调用 API、工具乃至物理环境,大幅扩展了 AI 攻击面:单个被攻陷的模型即可影响下游决策、访问外部系统并触发级联故障。

5月24日周六
4月10日周四
1月16日周四
12月20日周五
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA 发布《NVIDIA AI Enterprise 安全》白皮书

    NVIDIA 发布《NVIDIA AI Enterprise 安全》白皮书,阐述其保障 NVIDIA AI Enterprise 软件栈容器安全所采取的措施。白皮书涵盖安全开发生命周期、容器构建生命周期管理、安全设计、安全加固、SBOM、容器签名与模型签名及 NIM 微服务。漏洞响应部分包括漏洞扫描、修补、VEX 与协同漏洞披露,并由 NGC 通知服务做安全事件监控。

1月26日周五
  1. 腾讯玄武实验室 ·

    腾讯玄武实验室推出一款基于安全大模型的EDR告警研判机器人

    腾讯玄武实验室公开一款基于安全大模型的EDR告警研判机器人,能对EDR设备上报的告警做多维度的智能分析与自动调查取证。该机器人结合资产信息、事件信息、进程树和告警规则等多源细节,借助大模型的安全知识与推理能力展开研判,并将误报可能性量化为很大、中等偏大、中等偏小及很小四档,便于用户按优先级处置告警。其技术方案经30余轮迭代打磨而成,涵盖训练数据生成算法、数据分布优化策略、Prompt工程、微调与强化学习算法及模型能力评价体系,且支持私有化部署以保证极高吞吐量。

12月5日周二
  1. 腾讯玄武实验室 ·

    腾讯玄武实验室提出端侧提示词隐私保护方案并开源中文权重

    腾讯安全玄武实验室提出一种可部署在端侧的提示词隐私保护方案,在调用云端 LLM 的流程中插入两个端侧步骤,先平行替换隐私实体完成脱敏,再还原云端输出中的隐私实体。方案用标注的平行语料训练了一个权重约 500MB 的小模型,基于开源模型 Bloom,在手机和笔记本上完成部署实验;仅用 CPU 时 MacBook M2 推理速度 180-200 tokens/s,MacBook M1 为 110-130 tokens/s,Pixel 8 Pro 为 20-30 tokens/s。原生支持润色、摘要、翻译、阅读理解和文本分类,并支持 Zero Shot 自定义扩展任务。

已经到底了