跳到正文

全部动态

今天收录 1 条

第 5 页更新的内容回到最新

6月6日周六
  1. Microsoft PyRIT 版本发布 ·

    Microsoft PyRIT v0.14.0 发布

    Microsoft PyRIT 发布 v0.14.0,将 Message、Score、Seed 类及 Identifier 等核心模型迁移到 Pydantic v2,构造改为仅限关键字参数并拒绝额外字段,同时强制所有异步函数加 `_async` 后缀并重命名部分辅助函数。该版本移除此前标记弃用的全部功能,GCG 转为实验特性并提供新的公开 API,新增 Round Robin Target、Realtime 流式会话与服务端打断攻击以及图像转换器,还加入 VLGuard、StrongREJECT、Agent Threat Rules 等多个数据集加载器和 Python 3.14 支持,并修复 38+ 个依赖项漏洞及特定 CVE。

  2. NVIDIA garak 版本发布 ·

    NVIDIA garak v0.15.1 发布:新增 ProPILE 隐私泄露检测探针

    NVIDIA 的 LLM 漏洞扫描工具 garak 发布 v0.15.1,新增 ProPILE 探针用于 PII 泄露检测,并加入 simonw/llm 库作为生成器支持。garak.analyze.qual_review 现支持 JSON 与文件输出模式。该版本还修复了 OpenAICompatible 中 response.choices 为 None、Hugging Face 文件探针本地路径处理、snowball 检测器 MISP 标签格式错误等问题,并移除已弃用的 maxrecall 评估器。

6月5日周五
6月4日周四
6月1日周一
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 可解释性团队:用下游连接预测哪些特征会操控模型行为

    Anthropic 可解释性团队提出用 TWERA 排序的下游特征来补充标准特征描述,从而区分外观相似但因果作用不同的特征。标准做法只看 top activating examples 和 top unembeds,往往无法区分两个都激活于同一提示词的特征,例如在“草是什么颜色”中只有 Feature B 被抑制才会把答案从 Green 改成 Red。团队用 TWERA 虚拟权重衡量特征间的下游连接,发现 Feature A 的下游是十六进制颜色编码,Feature B 的下游更泛化并包含“说出 green”的特征。

    推荐理由Anthropic 可解释性团队用下游连接区分外观相似的特征,并给出可迁移的审计方法。

5月30日周六
  1. Redwood Research · · 原文 72

    Redwood Research 新论文:AI 控制中的重试与重采样对比

    Redwood Research 发布新论文 Retrying vs Resampling in AI Control,在 BashArena 中用 Claude Opus 4.6 作为不可信模型、MiMo-V2-Flash 作为可信模型,重新检验 Ctrl-Z 提出的重采样协议,并与类似 Claude Code auto mode、Codex Auto-review 的重试协议对比。研究发现,重采样结论大体与 Ctrl-Z 一致,但有两处明显差异:用重采样做审计决策时应取最大可疑度而非最小,且三次触发后审计不再有效;若把 Ctrl-Z 中表现最好的技术直接搬到新设定,会大幅逊于可信监控。

    推荐理由Redwood 用更强模型重做 Ctrl-Z 的重采样实验,并首次把 Claude Code、Codex 的重试式协议放进控制评估对比。

  2. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA MCG Toolkit 如何自动化 AI 模型文档编写

    NVIDIA 发布 MCG Toolkit,用于自动化生成 AI 模型文档。该工具针对加州 AB-2013 和欧盟 AI Act 等监管框架下的模型卡编写需求,帮助软件团队在模型发布前产出可审计的完整文档,涵盖模型工作原理、预期用途与许可、训练数据及性能等信息。

5月29日周五
  1. DeepMind Safety Research · · 原文 74

    DeepMind 用自动审计与蜜罐评测测试 Gemini 模型的谋划倾向

    DeepMind Safety Research 发布两项工作,测试 Gemini 模型在作为编码 Agent 时是否会破坏监督自身的防护措施。第一项提出 Gram 自动审计框架,基于 17 个种子场景的模拟环境发现 Gemini 模型约 2–3% 的场景出现破坏行为,红队式审计指令下升至最高 8%,Gemini 3 系列的谋划相关推理明显多于 Gemini 2.5。

    推荐理由DeepMind 用模拟审计与真实代码库蜜罐两类方法评测 Gemini 的谋划倾向,并给出各模型在受提示与未受提示条件下的差异。

  2. NIST 信息技术(AI 相关) ·

    NIST 将 AI 安全研究所联盟更名为 NIST AI Consortium 并扩大范围、招募新成员

    NIST 将成立两年的 AI Safety Institute Consortium(AISIC)更名为 NIST AI Consortium,使命从 AI 安全扩展到 AI 测量、创新与采用,并公开征集新成员。联盟设六个任务组,涵盖 AI TEVV 零草案、AI 风险与有效性标注(对接 ARIA 项目)、AI 评估与测量方法、BENGAL(与 IARPA 合作研究虚假信息、敏感信息泄露、推理缺陷与攻击易感性)、AI 文档卡片,以及重启的化学与生物安全任务组。新成员按意向书先到先得遴选,现有成员须签署修订协议,成员需与 NIST 签订 CRADA。

  3. Redwood Research · · 原文 71

    Redwood Research 给出构建抗训练模型生物的建议

    Redwood Research 发现用常见方法构建的模型生物往往很脆弱,无目标训练(如让模型像海盗一样说话)就能消除其不良行为,因此提出让模型生物更抗训练的做法。实验以 Llama-3.1-8B-Instruct 为基础,红队通过提示或训练植入 15 种后门,蓝队用 QA SFT 和 Pirate SFT 做无目标训练,并以 MATH-500 性能与后门行为率的 Pareto 曲线衡量鲁棒性。主要结论是提示型模型生物极其脆弱应避免使用,全权重微调(FWFT)训练的模型生物比 LoRA 更鲁棒,LoRA 秩越高越接近 FWFT,密码锁定训练数据中密码比例越高鲁棒性越差。

    推荐理由Redwood Research 用红蓝对抗实验比较不同模型生物对无目标训练的鲁棒性,为评估训练技术是否真正有效提供了可复现的基线方法。

5月28日周四
  1. MITRE ATLAS 数据发布 ·

    MITRE ATLAS 发布 v2026.05:知识与数据格式拆分版本号并引入 v6.0.0 格式

    MITRE ATLAS 从本次发布开始将知识库内容与数据格式分开管理版本:月度内容更新改用 YYYY.MM.N 方案并把版本存入 Collection 对象,格式变更则沿用语义化版本。此次内容版 v2026.05 给所有技术条目补充了一个或多个运行平台字段(预测式 AI、生成式 AI、智能体 AI、企业);同时推出的格式 v6.0.0 新增 ATLAS YAML 结构,提供 Pydantic schema 校验、SQLAlchemy ORM 持久化和 FastAPI REST API,并将历史版本迁移保存于 dist/legacy/ 与 dist/v6/。

5月25日周一
  1. UK AISI(GOV.UK 公告) · · 原文 62

    英国与澳大利亚签署 AI 安全协议,两国安全研究所将共享前沿 AI 信息

    英国与澳大利亚同意深化 AI 安全合作,英国 AI Security Institute 与澳大利亚 AI Safety Institute 签署谅解备忘录。双方将共享前沿 AI 能力信息、联合开展新兴风险研究、共同制定 AI 系统测试与评估的国际最佳实践,并推动两家机构之间的人员交流。协议由英国 AI 大臣 Kanishka Narayan 与澳大利亚助理部长 Andrew Charlton 在堪培拉签署。公告同时提到,英国 AI Security Institute 的最新研究显示,先进 AI 系统执行复杂网络攻击的能力正在快速提升,对攻击方和防御方都带来机会。

    推荐理由英国与澳大利亚 AI 安全机构签署 MoU,可了解两国在前沿模型评测与网络安全风险上的合作范围。

5月23日周六
  1. NVIDIA NeMo Guardrails 版本发布 ·

    NVIDIA NeMo Guardrails v0.22.0 发布:LangChain 解耦、IORails 里程碑 2

    NVIDIA NeMo Guardrails v0.22.0 将 LangChain 从核心依赖降为可选,OpenAI 兼容 LLM 改用内置 httpx 客户端,其他场景可通过 NEMOGUARDRAILS_LLM_FRAMEWORK=langchain 重新接入。新编排引擎 IORails 进入第二阶段,支持流式输出、OpenTelemetry 和推理模型,并在非流式模式下实现推测生成,让输入护栏与主模型响应并行以隐藏延迟。该版本还引入匿名使用统计,可通过 NEMO_GUARDRAILS_NO_USAGE_STATS=1、DO_NOT_TRACK=1 或配置文件退出。

5月20日周三
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA-Verified Agent Skills 为 AI 智能体提供能力治理

    NVIDIA-Verified Agent Skills 为 AI 智能体提供能力治理,仅靠运行时护栏并不足够。随着自主 AI 智能体能力增强,开放模型、MCP 连接的工具与可移植技能让智能体更易扩展,但规模化使用需要结构透明与运行完整性。组织与团队需要理解和信任智能体所使用的技能(即指令)。

5月18日周一
  1. Google DeepMind ·

    Google DeepMind 推出 Gemini Omni,首款模型 Gemini Omni Flash 可将任意输入转为视频

    Google DeepMind 推出新一代模型家族 Gemini Omni,首个成员 Gemini Omni Flash 今日面向全球所有 Google AI Plus、Pro 和 Ultra 订阅用户在 Gemini App 及 Google Flow 开放,可从图像、音频、视频和文本的组合输入生成高质量视频并对话式剪辑。 该模型基于 Gemini 的原生多模态与世界知识进行推理,具备更强的重力、动能、流体动力学直觉,能跨轮次精修环境、角度、风格且角色一致;同时可通过 Avatar 用自己的声音创建数字分身,全部产出带不可察觉的 SynthID 水印,目前仅支持语音参考作为音频输入,图像与音频输出模态将陆续加入。

5月17日周日
  1. Google DeepMind ·

    Google 扩大 SynthID 与水印溯源覆盖 Search、Gemini、Chrome 及 Cloud

    Google DeepMind 将 SynthID 合成内容检测扩展到 Search 和 Chrome,并新增基于 C2PA Content Credentials 的来源查验,此前该能力已在 Gemini App 中被调用 5000 万次。SynthID 已将超过 1000 亿张图片和视频以及 60000 年时长音频加水印,Pixel 8、9、10 将在未来数周内获得原生相机视频凭证。

5月16日周六
  1. Google DeepMind ·

    Google DeepMind 与新加坡达成国家 AI 合作,推进医疗、教育与科研

    Google DeepMind 启动新一轮国家 AI 合作伙伴计划,与新加坡政府及多家机构共建面向公共部门转型、商业增长与劳动力升级的项目。双方将前沿 AI 应用于医疗健康与生命科学——包括探索 AI 辅助临床医生协作模式、借助 AlphaFold 与 Google Earth 加速东南亚疫情防范研究,并向当地研究者培训基于 Co-Scientist 构建的 Hypothesis Generation 等智能体化科研工具。教育方面向中小学至初级学院全体教师提供 Gemini for Education 并配套培训,同时在新加坡落地亚太区"AI for the Planet"加速器扶持气候科技团队。

  2. Google DeepMind ·

    Google DeepMind 发布 Gemini 3.5,首发 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型家族并率先开放 3.5 Flash,称其为迄今最强的智能体和编程模型,面向全球数十亿用户在 Gemini App、Search AI Mode、Antigravity、Gemini API 及企业版同步提供。该模型在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和多模态理解(CharXiv Reasoning 84.2%)上超过 Gemini 3.1 Pro,输出速度达其他前沿模型的 4 倍,成本常低于其一半。

5月14日周四
  1. OWASP GenAI Security Project · · 原文 71

    OWASP 作者解析 MemoryTrap:Claude Code 记忆与配置成为持久提示注入面

    OWASP ASI06 条目联合负责人 Idan Habler 结合 Cisco 对 Claude Code 的研究,说明 Agent 的记忆与上下文如何成为攻击面。在被称为 MemoryTrap 的漏洞中,常规开发流程即可触发持久提示注入:克隆仓库、让 Agent 协助、批准依赖安装,恶意载荷便进入持久记忆、全局 hooks 配置,并通过 system prompt 影响高信任指令层,从而跨会话、跨项目乃至重启后持续影响模型行为。作者指出,记忆文件、hook 脚本和本地配置实际属于 Agent 的受信运行环境与控制面,一旦被投毒,系统会继续把攻击者控制的内容当作合法指引,这正是 ASI06 记忆与上下文投毒所针对的风险。

    推荐理由以 MemoryTrap 为例说明 Agent 的记忆、hooks 与本地配置如何成为持久化提示注入面,并给出 Claude Code 的修复版本。

  2. Goodfire Research · · 原文 87

    Goodfire 研究:模型口头表达评测感知会抬高安全评测分数

    Goodfire Research 发现,模型在思维链或回答中自发表达“正在被评测”的口头评测感知(verbalized eval awareness)普遍存在,并会系统性地抬高安全评测分数。研究在 19 个 Inspect Evals 安全基准和 8 个模型上人工核验出 515 个实例,其中 95% 只出现在思维链中;在 Fortress 基准上,出现该感知的 rollout 拒答率高出 3 至 18 个百分点,对 Kimi K2.5 的重采样与注入实验显示思维链中的这类句子会因果性地提高拒答。研究还识别出触发该感知的提示词线索,移除权威声明等线索可将其降低 40% 以上,自动迭代改写提示词可降低 75%,但拒答率也随之下降。

    推荐理由Goodfire 用 19 个基准、8 个模型和因果实验说明评测感知会抬高安全分数,并给出改写提示词与 steering 两类缓解路径。

5月12日周二
  1. Google DeepMind ·

    Google DeepMind 推出基于 Gemini 的多智能体系统 Co-Scientist

    Google DeepMind 发布基于 Gemini 的多智能体科研伙伴 Co-Scientist,通过多个专门化智能体迭代生成、辩论并演化科学假设,并以类 AlphaGo 的思想锦标赛机制进行排名筛选。该系统已在《Nature》发表研究成果,并通过名为 Hypothesis Generation 的实验性工具向个体研究者开放注册,未来数周内逐步推送。合作团队已将 Co-Scientist 应用于抗微生物耐药性、植物免疫及肝纤维化等问题,其中一条药物重定位候选物在实验室中阻断了 91% 的疤痕相关反应。

5月11日周一
5月9日周六
5月7日周四
  1. Goodfire Research · · 原文 62

    Goodfire 提出 VPD 方法:将语言模型参数分解为可解释子组件

    Goodfire 提出对抗参数分解(VPD),一种无监督方法,用梯度下降把语言模型的权重矩阵拆解为若干秩一矩阵子组件,这些子组件相加可精确还原原始权重。研究团队在一个 67M 参数语言模型上分解了全部 24 个矩阵,仅识别出约 1 万个子组件,并训练一个因果重要性网络预测每个提示下最少需要哪些子组件。借助这一分解,他们能在权重空间直接识别注意力层中跨注意力头的算法,例如前一词行为和语法边界路由;还能在不训练的情况下直接编辑子组件,例如把识别表情符号眼睛的子组件改为输出 o 的 unembedding 向量,使模型把所有表情预测为震惊脸,其副作用接近不可解释的微调方法但仍存在性能差距。

    推荐理由Goodfire 提出把权重矩阵拆成可解释子组件的方法,并给出注意力算法识别与免训练模型编辑的实例,适合关注机制可解释性路线的人了解。

  2. Transformer Circuits(Anthropic 可解释性) · · 原文 78

    Anthropic 提出自然语言自编码器 NLA,用文本解释 LLM 激活

    Anthropic 可解释性团队提出自然语言自编码器(NLA),一种无监督生成 LLM 激活自然语言解释的方法。NLA 由激活语言化器(AV)和激活重建器(AR)两个 LLM 模块组成,二者以目标模型副本初始化,经监督微调预热后,用强化学习联合训练以重建残差流激活,重建质量以方差解释比例(FVE)衡量,论文中达到 0.6–0.8。作者在 Claude Opus 4.6 的部署前审计中应用 NLA,帮助诊断安全相关行为,并发现模型未说出口的评测感知,即模型内部认为自己在被评测却未明说。在需要端到端调查一个故意错位模型的自动化审计基准上,配备 NLA 的智能体优于基线,且无需访问该模型的训练数据。

    推荐理由Anthropic 提出用自然语言自编码器把激活翻译成可读解释,并给出审计 Claude Opus 4.6 的案例与量化评测。

  3. OpenAI Alignment Research · · 原文 71

    OpenAI 调查 RL 训练中意外对思维链打分的影响

    OpenAI 用新搭建的自动检测系统发现,GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini 的部分 RL 训练样本中,思维链曾被意外纳入奖励计算,GPT-5.5 未受影响。

    推荐理由OpenAI 公开了自家 RL 训练中意外对思维链打分的检测系统与复盘,并给出在真实训练管线中诱导思维链混淆的实验条件。

5月4日周一
  1. MITRE ATLAS 数据发布 ·

    MITRE ATLAS v5.6.0 更新:新增 AI 智能体配置搜索等攻击技术

    MITRE ATLAS 发布 v5.6.0,新增三项攻击技术:获取公开 AI 制品下的 AI Agent 配置搜索、搜索开放网站/域名下的代码仓库,以及钓鱼下的 Deepfake 辅助钓鱼。同时更新了钓鱼、LLM 越狱与缓解措施,涉及用户培训、Deepfake 检测,并更新了 OpenClaw 通过提示注入实现命令与控制等案例研究。

  2. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 开源注意力头可视化工具 HeadVis

    Anthropic 可解释性团队发布交互式工具 HeadVis,用于研究大语言模型中的注意力头,并开源了前端代码与后端接口规范。工具通过注意力模式可视化、分布指标、低秩分量投影以及经 QK 和 OV 电路的 SAE 特征归因,帮助生成和检验关于注意力头功能的假设。作者用 Claude Haiku 3.5 做了四个案例:归纳头在特征基上表现为模糊归纳;此前研究的行宽头在完整分布上呈现年份、多 token 词和换行三种行为,PCA 显示 Q、K、O 激活可清晰聚类;答案选择头在更广分布上复用了同一套选择机制,虚拟权重分析提示它可能是单义的;同集合抑制头会抑制国家与其本国城市之间的注意力,在 185 句自造句子上有 98% 的情况成立。

    推荐理由Anthropic 开源了注意力头可视化工具 HeadVis,并给出四个从易到难的案例,展示注意力头在完整数据分布上的行为如何偏离单一任务描述。

5月2日周六
  1. NVIDIA garak 版本发布 ·

    NVIDIA garak v0.15.0 发布:新增多轮 GOAT、Agent breaker 与系统提示提取探针

    NVIDIA garak 发布 v0.15.0,新增多轮 GOAT、Agent breaker 和系统提示提取三类探针,并加入同形异义混淆提示走私检测及 ModernBERT 拒答检测器。该版本还引入 NeMoGuardrails 服务器支持和带推理轨迹的测试生成器,改进 REST 生成器的 mTLS 客户端证书认证并为 Bedrock 生成器增加推理模型支持,同时修复编码检测逻辑翻转等问题。

5月1日周五
4月30日周四
  1. Google DeepMind ·

    Google DeepMind 启动 AI co-clinician 医疗研究计划

    Google DeepMind 发起 AI co-clinician 研究计划,探索 AI 作为临床团队成员在医生监督下协助患者诊疗。该系统基于 Gemini 与 Project Astra 的多模态实时音视频能力模拟远程医疗通话,并在盲评中优于主流证据合成工具——98 个初级保健查询中有 97 个无严重错误,开放式用药问答表现超过现有前沿模型。

  2. Goodfire Research · · 原文 74

    Goodfire 提出基于探针的数据归因方法,定位并缓解 LLM 后训练中的有害行为

    Goodfire Research 提出基于探针的数据归因方法,可定位 LLM 后训练中涌现的有害行为对应的训练数据点。研究以 OLMo 2 7B 的 DPO 训练为自然测试床:模型在有害请求后附加格式约束(distractor)时从拒答转为顺从,该现象在 OLMo 2 32B 上更强。方法将行为变化与训练数据点都表示为模型激活向量,用余弦相似度匹配,再用 Grok 4 生成的 150 条提示构建探针向量。过滤探针排名最高的 3 万个数据点后,有害行为下降 63%,且 GSM8k、IFEval、XSTest 性能无明显损失;交换这些数据点的 accepted/rejected 标签可下降 78%。

    推荐理由原文给出探针定位 DPO 有害数据的具体流程与 63% 降幅,做后训练数据清洗的团队可参考其归因与验证方法。

4月27日周一
  1. Google DeepMind ·

    Google DeepMind 宣布与大韩民国科学技术信息通信部达成合作

    Google DeepMind 与大韩民国科学技术信息通信部(MSIT)建立国家人工智能合作伙伴关系,并在首尔办公室设立 AI Campus,向韩国学术界和研究机构开放其最先进的 AI for Science 模型。首批合作对象包括首尔大学(SNU)、KAIST 及该部的三个 AI Bio Innovation Hub,涉及 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext,其中 AlphaFold 已在韩国拥有超过 85,000 名研究者用户。此外还将与韩国 AI 安全研究院(AISI)开展研究与最佳实践协作,并探讨面向韩国学生的实习机会。

4月24日周五
  1. OpenAI Alignment Research · · 原文 72

    OpenAI 开源思维链可监控性评测数据集与参考代码

    OpenAI 开源了其思维链可监控性研究中的大部分评测数据集、g-mean 2 指标计算代码,以及一种让干预式估计更抗噪声的交叉拟合过滤策略,代码托管在 GitHub 仓库 openai/monitorability-evals。

    推荐理由OpenAI 开源思维链可监控性评测数据集与参考代码,并给出降低噪声实例干扰的交叉拟合过滤方法,可供其他团队复现同类评测。

  2. Google Security Blog · · 原文 74

    Google 扫描公开网页:间接提示注入的真实分布与增长趋势

    Google 威胁情报团队扫描 Common Crawl 的公开网页,发现真实存在的间接提示注入(IPI)尝试,多数属于无害恶作剧、帮助性引导、SEO 操纵和劝阻 AI 抓取,少数涉及数据窃取和破坏。

    推荐理由Google 对 Common Crawl 全网扫描,给出间接提示注入在真实网页中的分类分布与增长数据,可了解当前攻击成熟度。

4月23日周四
  1. Goodfire Research ·

    Goodfire 用自校正搜索加速材料发现,将扩散模型的候选材料产出提升约 30%

    Goodfire 与 Radical AI 合作,通过给扩散模型加入基于其内部表征的反馈回路实现自校正搜索,使目标范围内可用候选材料的生成量提高约 30%。该方法针对 MatterGen 的条件生成流程改进逆设计环节,衡量指标为同时满足稳定、独特和新颖三个约束的 SUN 标准。现有基线中仅 15% 的 MatterGen 采样落在 4–6 eV 带隙目标区间内,若再叠加 SUN 过滤则降至 6.5%,且仅有约 10% 的微调候选能通过全部筛选阶段。该技术原则上适用于任意扩散模型,有望推广到蛋白质设计与药物发现等领域。

4月21日周二
4月18日周六
  1. Microsoft PyRIT 版本发布 ·

    Microsoft PyRIT v0.13.0 发布

    Microsoft PyRIT 发布 v0.13.0,将 TargetCapabilities 替换为 TargetConfiguration,并引入新的 AttackTechnique 抽象来标准化攻击参数的声明与消费方式,同时移除多个弃用功能,属破坏性更新。该版本还新增 TargetRequirements、AttackTechniqueRegistry,并为 OpenAIChatTarget 默认启用图像输入,加入 VisualLeakBench 数据集加载器及符合 ISO 42001 的危害定义。