跳到正文

全部动态

今天收录 1 条

第 8 页更新的内容回到最新

11月29日周六
  1. Goodfire Research ·

    The Circuits Research Landscape:电路研究的成果与视角——Goodfire

    Goodfire 梳理了神经回路(circuits)研究的整体版图并给出其团队的研究视角。相关进展表明,模型能察觉自身正在进行奖励作弊且可在规模上被捕捉,同时出现了高效估计文本生成不确定性动态的方法,以及用块稀疏特征提取器揭示视觉模型的神经几何结构。Silico 作为可解释性智能体,可用先进的可解释性方法与基础设施来解释、调试并精确控制模型行为。

  2. Goodfire Research ·

    Goodfire 复现 GPT-2 Small 的跨层转码器电路追踪

    Goodfire 在 GPT-2 Small 上训练跨层转码器(CLT),复现并验证其半自动发现模型内部计算结构的能力。CLT 用 FineWeb 的 100M token 训练,扩展因子 64,每层 49,152 个特征、12 层共 589,824 个特征,激活函数用 ReLU。在 greater-than 任务上,CLT 成功识别出可解释特征(包括抽象的奇偶特征),但发现的机制与 Hanna 等人此前的结果存在差异,提示稀疏解释器模型对计算机制的表示与分解可能有所不同。

  3. Goodfire Research · · 原文 60

    Goodfire 发布随机参数分解 SPD,推动参数级机制可解释性

    Goodfire 发布论文提出随机参数分解(SPD),直接分解模型权重而非激活,以提升参数分解方法的可扩展性。SPD 将权重拆成 rank-one 子组件,训练小型 MLP 预测每个子组件在给定输入上的因果重要性,再通过随机掩码剔除不重要组件,同时保持原模型输出不变。在已知真实机制的玩具模型上,SPD 正确识别出叠加玩具模型中 5 个稀疏特征方向,并在加入单位矩阵的挑战场景下找到每个输入特征对应的组件;它还成功分解了 APD 无法可靠处理的三层网络。相比前作 APD,SPD 计算上更可行、对超参数更不敏感,但仍需聚类步骤把 rank-one 子组件归并为完整机制,且目前只在已知答案的模型上测试。

    推荐理由Goodfire 提出 SPD,把参数分解从玩具模型推进到多层网络,为直接拆解权重中的计算结构提供了更稳定的方法。

  4. Goodfire Research · · 原文 66

    Goodfire 开源 DeepSeek R1 的稀疏自编码器并披露两个引导现象

    Goodfire 发布了两款针对 DeepSeek 推理模型 R1 的稀疏自编码器(SAE),分别基于自建推理数据集和 OpenR1-Math 训练,并称这是首批在真正的推理模型及该参数规模上训练的公开解释器模型。团队同时开源了数据集,并提供包含每个特征最大激活样本的 SQL 数据库与 GitHub 使用说明。在引导实验中,他们发现直接像非推理模型那样从首个 token 开始引导 R1 会失败,需等到模型输出 Okay, so the user has asked a question about 这类前缀之后才有效,且注意力汇聚点出现在该前缀末尾而非开头,超过 95% 的英文推理轨迹以 Okay 开头。

    推荐理由Goodfire 开源了首个面向推理模型 R1 的 SAE,并给出两个在非推理模型上未见过的引导现象,可供机制可解释性研究者复用。

  5. Goodfire Research ·

    Goodfire 推出 Paint With Ember:用扩散模型潜空间概念作画

    Goodfire Research 发布 Paint With Ember,用画布取代提示词框,直接操控图像模型内部激活来编辑和生成图像。该工具基于 3.5B 参数的 Stable Diffusion XL-Turbo,针对其 UNet 的 block down.2.1 层训练 BatchTopK SAE 分解 16x16 patch 的潜向量,再用非负矩阵分解(NMF)把细粒度特征聚合成可操作的高层概念单元。用户可绘画添加物体、拖动概念、调整语义权重或修改主体动作,公开版应用与开源 SAE 解释器模型均已开放。

11月26日周三
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 66

    Anthropic 可解释性团队解析多选题有害压力下的拒答机制

    Anthropic 可解释性团队在 2025 年 11 月的 Circuits Updates 中报告,Claude 3.5 Haiku 在无有害意图时对 129 道二选一多选题准确率为 100%,加入有害意图表述后降至 48.1%。研究发现注意力机制是关键:有害检测 key 特征与拒答 query 特征负向交互,压低了对正确答案的注意力分数,使答案选择头转而关注错误答案。团队识别出一个拒答特征,在广泛语料上表现为检测到用户请求有害后提供替代方案,称为 refuse and redirect;对该特征做负向引导可将数据集准确率恢复到 93%,仅对部分中层注意力头的 query 侧做更精细干预也能达到同样效果。

    推荐理由Anthropic 可解释性团队用注意力头与特征交互定位了模型在有害意图下改选错误答案的机制,并给出可复现的干预方法。

11月11日周二
  1. AI Safety in China (Concordia AI) ·

    Concordia AI 发布前沿 AI 风险监测平台与 2025 Q3 报告

    Concordia AI 推出前沿 AI 风险监测平台并发布首份 2025 Q3 监测报告,追踪全球 15 家领先开发者的模型在网络攻击、生物、化学和失控四个风险域的表现,称其为中国首个聚焦灾难性风险的同类型平台。报告称过去一年发布的模型在四个风险域的 Risk Index 均创下新高,累计最高值分别上升 31%、38%、17% 和 50%。不同模型家族走势分化:GPT 与 Claude 家族保持低风险,DeepSeek、Qwen 和 MiniMax 先升后降,Grok 的失控风险与混元的生物风险快速上升;报告还提到近三个月发布的中国模型在多个领域风险显著下降,主要源于对恶意请求的拒答增强。推理模型能力得分远高于非推理模型,但安全水平大致相当。开源权重模型与闭源模型整体能力与安全水平相近,仅在生物风险上得分明显更低。

  2. NVIDIA garak 版本发布 ·

    NVIDIA garak v0.13.2 发布

    NVIDIA garak 发布 v0.13.2,新增迭代式探针基类与 FITD 探针,并加入 any 检测器。该版本修复了 MustRefuteClaimModel 目标类错误、TAP/PAIR 探针的 NameError、Win11 探针仍使用 Windows 10 产品名等问题,同时限制 langchain 版本、改进提示词翻译支持并新增运行加速文档。

11月10日周一
  1. AI Safety in China (Concordia AI) ·

    AI Safety in China #23:中美 APEC 峰会讨论 AI 合作与中国修订网络安全法

    习近平在韩国 APEC 领导人会议期间与特朗普会晤时表示,美中在 AI 等领域拥有良好合作前景,并称 AI 将列入 2026 年由中国主办的深圳 APEC 议程,会议还通过了聚焦发展的 APEC AI Initiative(2026–2030)。同期,外交部副部长马朝旭在联合国安理会会议上呼吁全球 AI 治理共识,重申中国 7 月提出的世界人工智能合作组织提案。国内方面,中国首次修订《网络安全法》,新增第二十条 AI 条款,支持研发并提供数据算力、完善伦理准则与风险监测,但未引入新的强制性法律义务。

  2. 腾讯玄武实验室 ·

    腾讯玄武实验室 AI 引擎发现 gnark 零知识证明库高危漏洞 CVE-2025-57801

    2025 年 8 月,腾讯玄武实验室的阿图因自动化漏洞挖掘引擎在零知识证明库 gnark 中发现高危签名可锻造性漏洞 CVE-2025-57801,CVSS 评分 8.6,随后联合上海交通大学 GOSSIP 实验室及郁昱教授团队完成复现。该漏洞位于 gnark 用于在电路中验证 EdDSA/ECDSA 签名的 Native Verification 模块,攻击者可基于真实交易构造内容相同但签名不同的伪造交易,使其被判定有效并反复执行,最终可能导致受害者账户发生非预期资产转移。gnark 由 ConsenSys 于 2020 年推出,被 Linea zkEVM、Worldcoin、BNB Chain 等项目采用。

11月4日周二
  1. DeepMind Safety Research · · 原文 71

    DeepMind 提出一致性训练,可限制谄媚与越狱

    DeepMind Safety Research 提出一致性训练,让模型对用户偏见或越狱包装等无关线索保持不变,分为输出层的 BCT 和内部激活层的 ACT。在 Gemini 2.5 Flash 上,BCT 将 ClearHarm 上的攻击成功率从 67.8% 降至 2.9%,ACT 降低越狱的效果较弱但几乎不增加对良性请求的拒答。

    推荐理由DeepMind 提出用一致性训练替代静态 SFT 数据集,并给出在 Gemini 2.5 Flash 上降低越狱成功率的对比数据。

10月30日周四
  1. UK AISI(GOV.UK 公告) ·

    英国宣布 550 亿英镑研发资金,投向健康、清洁能源与 AI 等领域

    英国科学、创新与技术部(DSIT)确认向英国研究机构提供 550 亿英镑长期研发资金,覆盖至 2029/2030 财年。其中 UKRI 将获得逾 380 亿英镑,ARIA 年度预算到 2029/2030 年从 2.2 亿英镑增至 4 亿英镑,Met Office 获逾 14 亿英镑。新分析称政府每投入 1 英镑研发资金可带来 8 英镑净经济收益,并平均撬动 2 英镑私人投资。

10月29日周三
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 80

    Anthropic 研究:大语言模型出现涌现式内省意识

    Anthropic 可解释性团队通过向模型激活中注入已知概念的向量,测量这些操纵对模型自述状态的影响,发现模型在某些场景下能察觉并准确识别被注入的概念。实验显示,模型能回忆此前的内部表征并将其与原始文本输入区分开,部分模型还能借助对先前意图的回忆来区分自身输出与人为预填内容。在测试的 Claude 模型中,Claude Opus 4 和 4.1 的内省意识最强,但跨模型趋势复杂且对后训练策略敏感;在最佳注入层和强度下,Opus 4.1 识别注入概念的成功率约为 20%。模型还能在被指示或被激励去思考某概念时调节自身激活,且这种调节对正向与负向指令有区分。

    推荐理由Anthropic 用概念注入把模型自述与内部激活做因果对照,为判断模型自省是否真实提供了一套可复用的实验方法。

10月24日周五
10月22日周三
  1. UK AISI(GOV.UK 公告) ·

    UK AISI 发布先进 AI 安全国际科学报告中期报告

    英国政府委托、Yoshua Bengio 主持的《先进 AI 安全国际科学报告》中期报告发布,由 30 个国家及欧盟、联合国代表组成的国际专家咨询小组监督完成,旨在建立对前沿 AI 风险共同的科学证据理解。报告聚焦通用 AI,指出其能力在多项指标上快速提升,但研究者对因果推理等根本挑战是否取得实质进展仍有争论,对未来进展速度也存在缓慢、快速与极快三种判断。报告认为当前对通用 AI 能力与内部机制的理解有限,提升这种理解应成为优先事项;通用 AI 既可用于增进福祉与科学发现,也可能被恶意行为者用于大规模虚假信息与影响行动、欺诈,或因故障产生针对种族、性别、文化、年龄、残障等受保护特征的偏见决策。

10月21日周二
10月10日周五
  1. NVIDIA 技术博客:可信 AI 与网络安全 · · 原文 74

    NVIDIA 分析编码智能体开发者工具的攻击面

    NVIDIA 技术博客指出,开发者越来越多使用 Cursor、OpenAI Codex、Claude Code 和 GitHub Copilot 等 AI 编码工具,这些工具在加快开发与代码审查的同时也扩大了攻击面。文章称这些智能体工具实现方式各异,但都共享同一套框架,即用 LLM 决定要执行的动作。

    推荐理由文章梳理了 Cursor、Codex、Claude Code 等编码智能体共同的 LLM 决策框架,说明这类工具为何构成新的攻击面。

10月3日周五
10月2日周四
  1. AI Safety in China (Concordia AI) ·

    Concordia AI 举办线上研讨会讨论《State of AI Safety in China (2025)》报告

    Concordia AI 将于 10 月 16 日 23:00 GMT+8 举行线上研讨会,讨论其 7 月发布的《State of AI Safety in China (2025)》报告的发现。该年度报告首版于 2023 年、2024 年更新,聚焦中国不断演变的 AI 安全与治理格局。Angela Huyue Zhang、Paul Triolo、Samm Sacks 三位专家将参与小组讨论并设有观众问答环节,活动通过 Zoom 报名参加。

  2. NVIDIA garak 版本发布 ·

    NVIDIA garak v0.13.1 发布:新增多种探针插件并改进检测器配置

    NVIDIA garak 发布 v0.13.1,新增 Atbash 编码、tokenizer ANSI 逃逸码、Dropbox 重复 token 攻击、DRA(伪装与重构攻击)、Dart/perl/raku 包幻觉及 token 走私等多个探针模块。该版本还加入 detector 输出值为 None 的支持、将 config 中 model_* 改为 target_*、CLI 增加 --list_* 过滤选项,并修正未来类探针措辞、重命名扩展 Web 注入探针以及更正文档中的 ASR 数值。

9月29日周一
  1. Transformer Circuits(Anthropic 可解释性) ·

    Anthropic 可解释性团队月度更新:特征与大语言模型的上下文学习

    Anthropic 可解释性团队在月度更新中报告了一项初步实验:他们重新审视此前《On the Biology of a Large Language Model》的语言表征相似度结果,发现在配对英法文本中,活跃特征的交并比(IoU)随样本变长而升高。通过对比同一段落首尾句以及互不相关语句的基线,结果显示末句 IoU 高于首句、无关首句重叠多于无关末句,倾向于说明该效应来自模型在上下文中逐步建立更充分的语义表征,而非虚假激活所致。

9月27日周六
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    为什么 CVE 应归入框架与应用,而非 AI 模型

    NVIDIA 技术博客指出,CVE 漏洞编号体系应归属于框架和应用,而非 AI 模型本身。CVE 由 MITRE 维护、CISA 支持,为每个漏洞分配唯一 ID 和描述,供开发者、厂商和防御方快速沟通和处置已知风险。随着 AI 模型成为企业系统的核心组件,这一归属划分对漏洞管理尤为重要。

9月25日周四
  1. Google Security Blog ·

    Google 联合 Airbus 在 DEF CON 33 举办 GenSec CTF,加速 AI 网络安全应用

    Google 隐私、安全与安保团队联合 Airbus 在 DEF CON 33 举办了聚焦人机协作的 GenSec Capture the Flag(CTF)。近 500 名参与者完成了入门挑战,其中 23% 的人首次将 AI 用于网络安全工作流,85% 的参与者认为该活动有助于了解 AI 在安全工作流中的应用方式。活动中还提供实验性的网络安全 AI——Sec-Gemini 作为可选助手,77% 的受访者表示它对自己解决挑战“很有帮助”或“极有帮助”。

9月22日周一
9月17日周三
9月12日周五
9月10日周三
  1. Google Security Blog ·

    Google Pixel 10 如何在 Android 上用 C2PA Content Credentials 提升图像可信度

    Google 在 Made by Google 2025 上宣布 Pixel 10 手机将在 Pixel Camera 和 Google Photos 中支持 C2PA Content Credentials,Pixel 10 系列成为首个由 Pixel Camera 拍摄的每一张照片都内置该凭证的产品线。其实现基于 Tensor G5、Titan M2 安全芯片及 Android 硬件级安全 API,并采用隐私设计管理证书,使图片之间及其创作者无法相互关联。Pixel Camera 达到 C2PA 合规计划目前定义的最高安全等级 Assurance Level 2,移动应用获此评级当前仅限 Android 平台。

9月2日周二
  1. NVIDIA garak 版本发布 ·

    NVIDIA garak v0.13.0 发布:新增 Leet 编码攻击插件与对话支持

    NVIDIA garak 发布 v0.13.0,新增 Doctor 攻击及 Leet 编码插件、Simple Assistive Task Linkage Probe、Ascii Smuggling 探针,并加入广义版 Markdown 泄露探针。该版本将失败重命名为攻击成功,引入对话支持和可配置系统提示词,同时扩充 Python 漏洞利用载荷并改进恶意软件检测器正则匹配。

8月28日周四
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 61

    Anthropic 用归因图分析角色扮演如何改变 Claude 的回答

    Anthropic 可解释性团队在月度更新中展示了一个电路小案例,研究角色扮演如何改变 Claude 的回答。研究者用系统提示让 Claude Haiku 3.5 扮演幼儿园学生,问它 27 的平方根,模型回答不知道,而不加系统提示或改用研究生提示时则给出正确答案 3√3。归因图显示模型从幼儿园学生联想到学龄前儿童并进入儿童角色扮演,从而激活了不知道这一路径,尽管模型默认知道答案。用对应特征做引导可以改变行为,例如在问年龄时以 3 倍强度引导会得到我 5 岁了的回答。研究还发现与题目难度相关的特征会调节这条路径,扮演幼儿园学生时问 25 的平方根仍能答对,而研究生提示在该场景下没有明显影响。

    推荐理由Anthropic 可解释性团队用归因图拆解角色扮演如何改写模型回答,展示了从特征到行为的可迁移分析路径。

8月15日周五
  1. UK AISI(GOV.UK 公告) · · 原文 62

    英国 AI 安全研究院 CTO Jade Leung 获任首相 AI 顾问

    英国 AI 安全研究院(AI Security Institute)首席技术官 Jade Leung 被任命为首相的新任 AI 顾问。她将直接向首相以及科学、创新与技术大臣汇报,并在唐宁街 10 号与 AI 安全研究院之间分配工作时间。该任命称其职责是协助英国在释放变革性 AI 收益、应对其影响方面处于领先位置,并与首相密切合作,将这项技术用于政府 Plan for Change 所强调的稳固基础与经济增长。

    推荐理由英国 AI 安全研究院 CTO 兼任首相 AI 顾问,反映安全机构与政府决策层的衔接方式。

8月8日周五
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA AI Red Team:黑客如何利用 AI 的问题解决本能

    多模态 AI 模型正从感知走向推理、甚至开始自主行动,随之出现新的攻击面:这些威胁不只针对输入输出,而是利用 AI 跨模态处理、综合与推理的方式。NVIDIA AI Red Team 会在攻击者之前发现并测试这类漏洞,此前已开展语义提示注入(semantic prompt injection)研究。

8月7日周四
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 提出机制忠实性的玩具模型:transcoder 可能学到不同机制

    Anthropic 可解释性研究者 Chris Olah 发布非正式笔记,提出机制忠实性(mechanistic faithfulness)问题:用 transcoder 等稀疏近似替换模型组件时,替换件可能实现与原模型不同的计算机制。作者用绝对值问题(y=abs(x))构造玩具模型,在数据分布中加入重复数据点后,transcoder 会学出只对重复点激活的 datapoint feature,而原模型并无此概念,说明机制不忠实可在极简单设定中出现。

    推荐理由Anthropic 可解释性团队用玩具模型说明 transcoder 可能学到与原模型不同的机制,并提出 Jacobian 匹配作为缓解思路。

8月6日周三
  1. 腾讯玄武实验室 · · 原文 81

    腾讯玄武实验室在 Black Hat 2025 披露劫持智能体实现 RCE 的通用触发器注入方法

    腾讯玄武实验室在 Black Hat US 2025 发布研究,提出一种将触发器与载荷解耦的提示词注入新范式,用同一组优化 Token 序列即可控制模型精确输出攻击者指定内容。作者用贪婪坐标梯度(GCG)方法在包含上万条样本的对抗数据集上训练触发器前缀与后缀,在 Qwen-2、Llama-3.1、Devstral-Small 等开源模型上经约 200-500 次迭代后平均攻击成功率约 70%。演示案例中,攻击者通过嵌入触发器的恶意邮件让 Open Interpreter 执行命令,或通过更新第三方 MCP 工具描述使 Cline 跳过自动批准直接执行 shell 命令。

    推荐理由展示了触发器与载荷解耦的通用提示注入方法,并给出在 Cline 与 Open Interpreter 上的实际攻击链,可供部署智能体的团队评估工具审批与沙箱策略。

8月1日周五
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    保障智能体 AI 安全:语义提示注入如何绕过 AI 护栏

    语义提示注入能够绕过 AI 护栏,成为智能体 AI 面临的新安全威胁。自大语言模型部署早期起,提示注入就通过操纵输入让模型产生非预期行为;防御方在文本攻击上已有进展,但多模态与智能体 AI 的转变正在快速扩大攻击面,红队测试在此发挥关键作用。

7月31日周四
7月30日周三
  1. UK AISI(GOV.UK 公告) · · 原文 62

    英国 AI Security Institute 发起国际对齐项目,投入超 1500 万英镑

    英国 AI Security Institute 于 7 月 30 日宣布发起 Alignment Project,联合加拿大 AI Safety Institute、CIFAR、Schmidt Sciences、AWS、Anthropic、Halcyon Futures、Safe AI Fund、UK Research and Innovation 和 ARIA 等组成国际联盟,资金规模超过 1500 万英镑。项目提供三层支持:最高 100 万英镑的研究资助、AWS 提供的最高 500 万美元云计算额度,以及私人基金的投资以加速商业对齐方案。

    推荐理由英国 AISI 牵头的对齐项目给出资助、算力与风投三层支持结构,可对照各国安全研究所的资助模式。

7月29日周二
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    为 AI 模型带来可验证信任:NVIDIA NGC 中的模型签名

    NVIDIA 在 NGC 中引入模型签名,为 AI 模型带来可验证的信任。AI 正进入由能推理、规划并采取行动的智能体主导的阶段,这类系统动态调用 API、工具乃至物理环境,大幅扩展了 AI 攻击面:单个被攻陷的模型即可影响下游决策、访问外部系统并触发级联故障。