全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA OpenShell:为 AI 智能体添加运行时控制
NVIDIA 推出 OpenShell,为 AI 智能体提供运行时控制能力。智能体可被赋予目标、编写代码、调用工具并在新信息出现时持续工作,适用于调查软件故障、运行实验以及执行跨天或跨周的关键业务操作与研究。这类智能体需要访问工作区、计算资源、数据、凭证和外部服务。
- 动态Google Bug Hunters
Google 借助 AI 将 C 库 giflib 重写为 Rust 以缓解内存安全问题
Google 披露其用 AI 辅助将一个名为 giflib 的 C 库重写为 Rust,目的是缓解内存安全类漏洞。该工作属于其在依赖项层面规模化推进内存安全的尝试,博客同时给出了这次 AI 协助重写的实践路径。(共三句,含受影响对象名称与目标。)
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA 开放智能体安全平台:面向持续在硅基芯片内监测智能体的参考方案
NVIDIA 发布了开放智能体安全平台,作为持续在硬件层面对 AI 智能体进行监测的参考实现。该平台将互联网兴起带来的机遇与风险作类比,强调智能体时代同样需要在底层提供安全保障。目前公开的信息仅为其定位说明,尚未披露具体的监测机制与技术指标。
- 动态Wiz Research
Wiz 联合 Google DeepMind 发起 Scan for Good,用 AI 排查公共服务与关键基础设施暴露风险
Wiz Research 启动 Scan for Good 计划,借助 AI 加人工研究员的方式,帮助公共服务、关键基础设施和非营利组织在网络犯罪分子之前发现并修复高危暴露问题。该计划由 Google DeepMind 提供合作,并与美国网络安全和基础设施安全局(CISA)协作推进。 早期成果已验证其效果:团队通过自主运行的 AI 系统发现了大量面向公网的严重暴露,并在受影响组织的配合下完成了修复,其中一起是国家档案馆管理员密钥泄露,导致 880 万个文件面临读写删除风险。
- 论文arXiv
SKILLLITE:用小模型做证据引导的恶意 Agent Skill 审计
SKILLLITE 是一个证据引导的智能体框架,用紧凑、可本地部署的 LLM 检测 Agent Skill 中的恶意行为。研究指出小模型难以识别复杂 Skill 包中隐含的恶意行为,SKILLLITE 先提取安全相关行为并推断 Skill 的预期功能,再据此评估恶意性。
- 论文arXiv
Render Before Reading:把不可信内容渲染成图像以防御提示注入
论文发现多模态大语言模型对以文本形式出现的对抗指令比对图像等非文本通道的同一指令更易服从,并将这一模态差异转化为无需训练的防御方法 Pictionary:在不可信内容进入模型前先渲染为排版图像或音频。
- 论文arXiv:后门、投毒与隐私
机器遗忘在 ASR 中是否有效:arXiv 论文评估现有算法与评测工具
一项提交至 ICASSP 2027 的研究评估了现有机器遗忘(MU)算法与评测工具是否适用于自动语音识别(ASR),发现基于梯度上升的算法能在隐私与效用间取得较好权衡,而更复杂的方法会过度遗忘样本、反而更容易被识别为已遗忘。研究指出,基于简单成员推理攻击的标准隐私评估不足以可靠判断遗忘是否成功,且顺序遗忘与同时遗忘的隐私和效用均差于单主体遗忘。
- 论文arXiv:后门、投毒与隐私
物理认证联邦学习:为关键水务基础设施的协同异常检测提供安全保障
研究提出"物理认证联邦学习",将守恒定律、执行器耦合等信息物理过程不变量从运行时检测启发式改造为联邦更新的可验证准入条件,自动从干净运行数据中挖掘。在 SWaT、WADI 两个水务测试床和 BATADAL 基准上,挖掘出的不变量对 100 个诚实分片零拒绝,并全部拒绝朴素伪造更新,包括 FoolsGold 完全放行的优化扰动。
- 论文arXiv:危险能力与安全评测
DeShortcut-Align:解耦伪捷径以提升大推理模型安全对齐鲁棒性
研究者提出 DeShortcut-Align 对齐框架,用于缓解大推理模型安全训练中出现的伪捷径问题。作者发现安全对齐后的模型常把拒答绑定到提示词模板(格式捷径)或敏感关键词(词汇捷径),导致过度拒答与通用能力下降。该方法通过拒答敏感性归因、归因引导的对比增强和反事实一致性正则三个阶段解耦这些捷径,在 7B 和 14B 模型上使模板剥离绕过攻击的性能下降最多减少 72%,过度拒答降低超过 58%。
- 论文arXiv:Agent 与 MCP 安全
Tracekit:面向自主编码 Agent 的防篡改意图-推理-动作审计系统
Tracekit 是一个开源、无依赖的审计系统,为每个 Agent 会话捕获人类意图、模型自述推理和实际执行动作三条通道,写入哈希链账本并交叉核对。它接入 Claude Code 生命周期事件、重建多 Agent 层级、在工具调用前做策略拦截,并支持其他 Agent 通过 SDK 或 HTTP API 上报事件。
- 论文arXiv:Agent 与 MCP 安全
Assay:用内容寻址证据图约束 AI 编码智能体的声明失效
Assay 将 AI 编码智能体的每条声明(测试通过、无密钥泄露、行为不变)绑定到其覆盖代码依赖锥的 Merkle 哈希,代码或其依赖一变声明即失效。在五个公开仓库上,600 token 的简报比探索式代理省 14x 至 114x,热重建比冷重建快最多 5x;锥绑定只需重验 7.9% 至 81.9% 的声明,而按模块绑定会漏掉 23% 至 68% 的应失效声明。
- 动态Google Security
Google Workspace 如何持续缓解间接提示注入攻击
Google 通过持续发现新攻击、扩充漏洞目录并迭代防御,缓解 Workspace with Gemini 面临的间接提示注入(IPI)威胁。其手段包括人工红队测试、自动化红队测试、Google AI 漏洞奖励计划(VRP)和公开攻击情报收集,并用 Simula 生成合成数据,使合成数据生成量提升 75%。
- 动态METR
METR 发布逐动作监控研究笔记:为自家评测部署实时阻断监控器
METR 研究人员发布研究笔记,介绍其为自家 Agent 评测部署的逐动作实时监控器:由 LLM 裁判在每个工具调用执行前打分,超过阈值即暂停评测并转人工复核。
- 动态OpenAI Alignment Research
OpenAI 发布 Codex Auto-review:用独立 Agent 审批越界操作
OpenAI 在 Codex 中推出 Auto-review,用独立的 Codex Agent 审批越过沙箱边界的操作,替代同步人工批准。
- 动态Help Net Security AI
Palo Alto Networks 与 NVIDIA 联手收紧对 AI 智能体的控制
Palo Alto Networks 扩大与 NVIDIA 的合作,通过 NVIDIA Open Agent Safety Platform 参考设计管控 AI 智能体的活动、网络流量与身份管理。
- 动态Simon Willison
Claude Code 将 auto mode 设为 Pro、Max 和 Team 计划默认设置
Anthropic 宣布从 8 月 14 日起在多数 Claude Code 计划的新会话中把 auto mode 设为默认设置。
- 论文arXiv:越狱、提示注入、投毒与防御
研究评估 GradSafe 在多轮对话中的越狱检测脆弱性
研究者在多轮对话场景下评估了基于梯度的越狱检测器 GradSafe,并扩展出 Context Window Scanner,用固定大小用户轮次窗口的最大分数作为整段对话得分。
- 动态DeepMind Safety Research
DeepMind 提出一致性训练,可限制谄媚与越狱
DeepMind Safety Research 提出一致性训练,让模型对用户偏见或越狱包装等无关线索保持不变,分为输出层的 BCT 和内部激活层的 ACT。在 Gemini 2.5 Flash 上,BCT 将 ClearHarm 上的攻击成功率从 67.8% 降至 2.9%,ACT 降低越狱的效果较弱但几乎不增加对良性请求的拒答。
- 论文arXiv:越狱、提示注入、投毒与防御
ACTR:对齐推理与回答以提升推理大语言模型的多语言安全
研究者提出 ACTR 框架,通过强化推理大语言模型已有的安全推理来提升多语言安全对齐。方法先用 think gap score(TGS)比较不同语言下推理痕迹对注意力输出的归一化贡献,并用推理痕迹替换衡量跨语言安全差距;再用越狱查询语料,通过神经元掩码引起的回答表示变化评估神经元重要性,对比开启与关闭推理时的高重要性神经元集合,识别支撑安全推理的安全 think 神经元;最后提出 neuron-selective consistency optimization(NSCO),用冻结的评判模型奖励推理痕迹与回答在安全类别上的一致,只更新选定神经元相关参数,无需人工标注回答或偏好数据。
- 论文arXiv:越狱、提示注入、投毒与防御
ToolFence:为工具调用 LLM Agent 提供细粒度授权
ToolFence 通过在执行前编译类型化授权蓝图并由确定性监控器执行,把用户授权值与不可信观测区分开,以应对保留工具但篡改参数的 within-tool 攻击。
- 动态Google DeepMind
Google DeepMind 为 Private AI Compute 引入安全服务端持久记忆
Google DeepMind 公布 Private AI Compute 架构更新,新增服务端持久记忆层,让 AI 助手跨设备保留上下文,同时维持端侧级别的隐私标准。
- 会议论文ACL 2026
RST-Guarder:通过 RST 解析与概率推断增强护栏的长文本鲁棒性
推理时用 RST 解析获取篇章关系,再分层概率推断聚合分段安全分数,无需训练;提升长文本有害内容检测并显著减少误报。
- 会议论文ACL 2026
别再全面加固:面向神经排序模型的免训练神经元级防御
定位对对抗扰动最脆弱的 top-K 神经元并施加反向扰动校正,无需重训练或对抗数据;在 MS MARCO 和 TREC 19 上对已见与未见攻击均优于基线。
- 会议论文ACL 2026
LLM 去毒:从数据集本身入手
提出 HSPD 流程,用 SoCD 定位并改写原始语料中的有毒片段;在 GPT2-XL 上毒性概率由 0.42 降至 0.18,并在多个模型上验证。