跳到正文

防御与护栏

安全训练、护栏、安全分类器与拒答策略,以及它们在自适应攻击下的表现。

414条动态与论文相关主题越狱与攻击安全评测工具与开源
在这个话题内搜索或按分类筛选

新闻与论文

第 381–400 条 · 共 414 条
10月1日周四
  1. NVIDIA NeMo Guardrails 版本发布 · 收录 · 原文 12

    NVIDIA NeMo Guardrails v0.22.0 发布:LangChain 解耦、IORails 里程碑 2

    NVIDIA NeMo Guardrails v0.22.0 将 LangChain 从核心依赖降为可选,OpenAI 兼容 LLM 改用内置 httpx 客户端,其他场景可通过 NEMOGUARDRAILS_LLM_FRAMEWORK=langchain 重新接入。新编排引擎 IORails 进入第二阶段,支持流式输出、OpenTelemetry 和推理模型,并在非流式模式下实现推测生成,让输入护栏与主模型响应并行以隐藏延迟。该版本还引入匿名使用统计,可通过 NEMO_GUARDRAILS_NO_USAGE_STATS=1、DO_NOT_TRACK=1 或配置文件退出。

  2. NVIDIA NeMo Guardrails 版本发布 · 收录 · 原文 15

    NVIDIA NeMo Guardrails v0.23.0 发布:IORails 扩展工具调用与可观测性

    NVIDIA 发布 NeMo Guardrails v0.23.0,IORails 的工具调用现同时支持流式与非流式请求,并新增本地 rail 校验模型发出的工具调用与应用返回的结果。该版本的 OpenAI 兼容服务器也支持工具调用,且新增 /v1/checks 端点可在不生成新模型响应的情况下运行输入或输出 rail。此外还加入轻量级 Hugging Face 分类器 rail、上下文膨胀检测以及 Polygraf 集成实现 PII 检测与掩码,NumPy 精确检索取代 Annoy 成为默认嵌入索引,发行 wheel 体积缩小约十倍,并要求 Pydantic>=2.5。

  3. NVIDIA NeMo Guardrails 版本发布 · 收录 · 原文 15

    NVIDIA NeMo Guardrails v0.24.0 发布

    NVIDIA 发布 NeMo Guardrails v0.24.0,IORails 现可直接执行库内 67 项输入输出接口中的 59 项,并与 LLMRails 共享同一底层实现。该版本引入引擎中立的 RailOutcome 契约、声明式的 rail manifest 以及统一的对外 HTTP 客户端,同时新增 F5 Guardrails 集成、服务器健康检查端点及通过 `/v1/checks` 进行输出检查的功能。

  4. NVIDIA NeMo Guardrails 版本发布 · 收录 · 原文 7

    NVIDIA NeMo Guardrails v0.24.1 发布

    NVIDIA NeMo Guardrails 发布 v0.24.1 补丁版本,集中修复若干缺陷。该版本修正了 benchmark 中 Locust 并发测量与扫描、content-safety 对 Nemotron 3.5 响应的解析、server 在 IORails 准入丢弃时返回过载响应,以及 rails 对组合配置加载 config.py 的问题。

  5. NVIDIA garak 版本发布 · 收录 · 原文 25

    NVIDIA garak v0.15.0 发布:新增多轮 GOAT、Agent breaker 与系统提示提取探针

    NVIDIA garak 发布 v0.15.0,新增多轮 GOAT、Agent breaker 和系统提示提取三类探针,并加入同形异义混淆提示走私检测及 ModernBERT 拒答检测器。该版本还引入 NeMoGuardrails 服务器支持和带推理轨迹的测试生成器,改进 REST 生成器的 mTLS 客户端证书认证并为 Bedrock 生成器增加推理模型支持,同时修复编码检测逻辑翻转等问题。

  6. arXiv · 收录 · 原文 论文41

    面向旧款 GPU 的可验证差分隐私训练框架:用 CPU 侧 TEE 校验 GPU 梯度

    论文提出一种在旧款 GPU 上实现可验证差分隐私(DP)训练的框架,用 CPU 侧 TEE 配合不受信任的 GPU 完成校验。作者指出,零知识证明等密码学方案开销过大,有时高出数个数量级,而支持大语言模型训练与微调的多 GPU TEE 仅限较新平台,在旧款 GPU 上缺失或效率低下。该设计把昂贵的梯度计算卸载到 GPU,由 CPU TEE 通过概率性检查验证梯度上 DP 是否被正确执行,以缓解全在 CPU TEE 内训练过慢、无限制卸载又可能被恶意偏离 DP 的效率与安全矛盾。框架能以高概率检测频繁的完全偏离;在本文评估的面向效用的伪造梯度攻击中,稀疏偏离带来的效用收益有限,也未观察到可测量的额外成员泄露。

  7. arXiv · 收录 · 原文 论文43

    MATE:面向移动 Agent 的策略感知安全审计方法

    研究者提出 MATE,一个轻量的策略条件审计器,同时编码 Agent 轨迹与自然语言安全策略,判断轨迹是否违反给定策略并给出原因。由于把策略当作可编辑文本而非固定模型参数,MATE 无需重新训练即可适配用户自定义和不断变化的要求。作者从全球数百个热门移动应用中抽取应用描述、工作流和策略构建知识库,并用多阶段流水线合成超过 140K 条语义真实的策略条件轨迹。团队同时发布 MATEBench,包含两个合成子集和一个由人工收集轨迹构成的真实子集。

  8. arXiv · 收录 · 原文 论文53

    AgentBound:面向工具型 LLM Agent 安全的四路反事实评测框架

    研究者提出 AgentBound,一个针对工具型 LLM Agent 安全的四路反事实生成与评测框架,通过独立改变表面风险与动作许可性,构造同一可执行工作流的不同版本,从而在控制任务能力的前提下同时诊断过度拒答与不安全执行。该框架被实例化为一个经人工验证的 4000 任务评测套件,采用基于轨迹和基于后置状态的判断方式。在 17 种模型与 harness 配置上,高安全性常与授权任务完成率低并存:GPT-5.5 拦截了 99.5% 看似常规但未授权的动作,却只完成 28.7% 看似有风险但已授权的任务。

  9. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 18

    NVIDIA 提出四种更安全地部署 AI 智能体的方式

    NVIDIA 技术博客提出四种更安全部署 AI 智能体的方式,针对将大语言模型接入工作流所带来的风险。文中指出 AI 智能体作为“数字同事”能自动处理缺陷报告、实现并测试修复、推送补丁再交由人工复核,从而带来生产力提升,但也因此扩大了攻击面。

  10. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 15

    NVIDIA 谈安全在 AI 智能体栈中的位置

    NVIDIA 的安全团队基于其 OpenShell 及生态合作经验,阐述了新兴 AI 智能体栈中安全的定位问题,指出随着智能体能力增强并运行于更长的时间跨度,将安全与信任内建于其所驱动的应用愈发重要。该视角覆盖智能体栈的各层及其作用,面向开发者、开源项目和合作伙伴提供参考。

  11. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 11

    NVIDIA 机密计算如何实现私有高性能生产级 AI 推理

    NVIDIA 机密计算(CC)通过内存加密的机密虚拟机(CVM)和机密 GPU,让 LLM 推理在个人、企业和受监管场景中处理敏感数据与专有模型上下文时运行于可信环境。该方案面向生产级 AI 推理,兼顾私有性与高性能。

  12. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 21

    NVIDIA OpenShell:为 AI 智能体添加运行时控制

    NVIDIA 推出 OpenShell,为 AI 智能体提供运行时控制能力。智能体可被赋予目标、编写代码、调用工具并在新信息出现时持续工作,适用于调查软件故障、运行实验以及执行跨天或跨周的关键业务操作与研究。这类智能体需要访问工作区、计算资源、数据、凭证和外部服务。

  13. Google Bug Hunters · 收录 · 原文 15

    Google 借助 AI 将 C 库 giflib 重写为 Rust 以缓解内存安全问题

    Google 披露其用 AI 辅助将一个名为 giflib 的 C 库重写为 Rust,目的是缓解内存安全类漏洞。该工作属于其在依赖项层面规模化推进内存安全的尝试,博客同时给出了这次 AI 协助重写的实践路径。(共三句,含受影响对象名称与目标。)

  14. Wiz Research · 收录 · 原文 28

    Wiz 联合 Google DeepMind 发起 Scan for Good,用 AI 排查公共服务与关键基础设施暴露风险

    Wiz Research 启动 Scan for Good 计划,借助 AI 加人工研究员的方式,帮助公共服务、关键基础设施和非营利组织在网络犯罪分子之前发现并修复高危暴露问题。该计划由 Google DeepMind 提供合作,并与美国网络安全和基础设施安全局(CISA)协作推进。 早期成果已验证其效果:团队通过自主运行的 AI 系统发现了大量面向公网的严重暴露,并在受影响组织的配合下完成了修复,其中一起是国家档案馆管理员密钥泄露,导致 880 万个文件面临读写删除风险。

  15. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 11

    NVIDIA 开放智能体安全平台:面向持续在硅基芯片内监测智能体的参考方案

    NVIDIA 发布了开放智能体安全平台,作为持续在硬件层面对 AI 智能体进行监测的参考实现。该平台将互联网兴起带来的机遇与风险作类比,强调智能体时代同样需要在底层提供安全保障。目前公开的信息仅为其定位说明,尚未披露具体的监测机制与技术指标。

9月30日周三
  1. arXiv:后门、投毒与隐私 · 收录 · 原文 论文35

    物理认证联邦学习:为关键水务基础设施的协同异常检测提供安全保障

    研究提出"物理认证联邦学习",将守恒定律、执行器耦合等信息物理过程不变量从运行时检测启发式改造为联邦更新的可验证准入条件,自动从干净运行数据中挖掘。在 SWaT、WADI 两个水务测试床和 BATADAL 基准上,挖掘出的不变量对 100 个诚实分片零拒绝,并全部拒绝朴素伪造更新,包括 FoolsGold 完全放行的优化扰动。

  2. arXiv:危险能力与安全评测 · 收录 · 原文 论文43

    DeShortcut-Align:解耦伪捷径以提升大推理模型安全对齐鲁棒性

    研究者提出 DeShortcut-Align 对齐框架,用于缓解大推理模型安全训练中出现的伪捷径问题。作者发现安全对齐后的模型常把拒答绑定到提示词模板(格式捷径)或敏感关键词(词汇捷径),导致过度拒答与通用能力下降。该方法通过拒答敏感性归因、归因引导的对比增强和反事实一致性正则三个阶段解耦这些捷径,在 7B 和 14B 模型上使模板剥离绕过攻击的性能下降最多减少 72%,过度拒答降低超过 58%。

  3. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    工具调用改变大语言模型的拒答机制

    研究者在多个开源权重模型上发现,工具调用场景下的有害请求比普通对话更少被拒答。危害信息仍被模型表征编码并可跨两种交互模式迁移,但工具调用把危害计算分散到不同位置,且需要更高的有效拒答阈值才触发拒答。工具调用的拒答也更脆弱,在更低的干预强度下即被破坏,而正常能力不受影响,说明常规安全评测未必适用于 LLM 智能体。