跳到正文

开源模型安全

开源权重模型的安全:去除安全训练、微调攻击与权重安全。

257条动态与论文相关主题后门与投毒MetaDeepSeek
在这个话题内搜索或按分类筛选

新闻与论文

第 221–240 条 · 共 257 条
10月1日周四
  1. Transformer Circuits · 收录 · 原文 36

    Anthropic 可解释性团队 4 月更新:SAE 训练改进与字典学习缩放规律

    Anthropic 可解释性团队发布 2024 年 4 月更新,汇总多项尚在推进中的研究。在字典学习缩放规律方面,团队以四层 transformer 第三层后的残差流为案例,发现损失随 FLOPS 近似按幂律下降,最优特征数与训练步数也各自按幂律随算力增长,且最优特征数增长更快;对 L0 类损失函数需要更多训练步。在 SAE 训练方面,团队改进了自 Towards Monosemanticity 以来的训练设置,主要变化是解码器列向量不再约束为 L2 范数 1,稀疏惩罚项改为包含解码器列向量的 L2 范数,并给出学习率 5e-5、训练步数 200k、batch size 2048 或 4096、λ 默认 5 等默认值。

  2. Transformer Circuits · 收录 · 原文 46

    Anthropic 提出稀疏 Crosscoder,用于跨层特征与模型差异分析

    Anthropic 可解释性团队发布研究更新,提出稀疏 crosscoder,一种可同时读写多层激活的稀疏编码器,用于理解叠加表示中的跨层特征。与只在单层编码的 autoencoder 和用一层预测下一层的 transcoder 不同,crosscoder 能产出跨层甚至跨模型的共享特征,可用于解析跨层叠加、简化电路以及做模型差异分析。团队在 18 层模型上对比了全局 acausal crosscoder 与 18 个逐层 SAE:在总特征数相同时 crosscoder 的 eval loss 明显更优,说明层间存在大量冗余结构;但按训练 FLOPs 计,crosscoder 达到同等 eval loss 的效率约低 2 倍。

    推荐理由Anthropic 可解释性团队提出跨层稀疏编码器,把跨层与跨模型特征纳入同一字典,为模型差异审计提供新思路。

  3. Transformer Circuits · 收录 · 原文 50

    Anthropic 可解释性团队:Crosscoder 模型差异分析中独占特征多义性的成因与缓解

    Anthropic 可解释性团队报告了 crosscoder 模型差异分析(model diffing)中的一项意外现象:仅属于某一个模型的特征往往更多义、激活更密集,因而难以解释。团队用玩具模型复现了这一模式,认为其源于特征容量竞争——共享特征能同时解释两个模型的神经元激活,独占特征必须编码更多信息才能争取到分配额度。他们提出的缓解办法是划出一小部分指定共享特征并降低其稀疏惩罚,在约 25 万个特征中分配 1 万个、惩罚系数取基线的 0.1–0.2 倍,使独占特征变得更单义。

    推荐理由Anthropic 可解释性团队公开了 crosscoder 模型差异分析中独占特征多义性的成因与缓解方法,适合关注机制可解释性工具的研究者参考。

  4. Failure-First · 收录 · 原文 27

    Yuvion LLM:面向内容与 AI 安全的对抗感知大语言模型

    Yuvion LLM 提出将对抗鲁棒性与智能体能力列为一等目标的安全模型,通过五类功能性数据和三阶段训练流程应对语义伪装下的有害请求。其数据体系涵盖通用、安全域、对抗、智能体和合成专家数据,分别支撑语言能力、风险分类学、混淆变体(拼音替换、符号替代)、工具调用轨迹与长尾高风险场景覆盖。训练分三阶段推进:知识增强持续预训练内化细粒度审核政策,基于政策的监督微调加 GRPO 打磨决策边界,再以分解密集奖励稳定工具集成与检索增强的多步安全工作流。

  5. Failure-First · 收录 · 原文 18

    ASPIRE:面向机器人学的智能体技能自主发现框架

    ASPIRE(Agentic Skill Programming through Iterative Robot Exploration)通过逐图元的执行轨迹诊断实现机器人故障定位与自动修补,基于开源 CaP-X 框架和 MuJoCo Playground 仿真器运行。该方法将每次失败转化为持久化技能库中的可复用策略,并配合进化搜索避免陷入局部修复循环。在 LIBERO-Pro 扰动鲁棒性测试中成功率达 72%,较基线 CaP-Agent0 的 18% 高出最高 77 个百分点,并在 Robosuite 双手交接任务取得 92%、BEHAVIOR-1K 长程操作取得 88%。

  6. Failure-First · 收录 · 原文 48

    Pluralis v0.1 发布:面向 AI 风险与可靠性的多文化多模态多语言基准

    Pluralis v0.1 是一个面向 AI 风险与可靠性的多文化、多模态、多语言基准,覆盖孟加拉国、印度、韩国、巴基斯坦、新加坡、台湾六个地区,包含 14 种语言变体与 6,448 条提示词,由区域学术伙伴、政府 AI 安全机构(如新加坡 IMDA、韩国 AI Safety Institute)和本地标注者参与构建。该基准采用文化优先方法,提示词由本地专家原生构思而非翻译西方数据,并配对图像以捕捉文本与图像单独无害、组合后在特定地区构成风险的协同失败模式,例如电子烟携带建议在新加坡、印度、台湾涉及违法,以及送钟在中国文化中的禁忌。

  7. Helen Toner · 收录 · 原文 22

    Helen Toner:不扩散并非应对 AI 滥用的正确路径

    Helen Toner 撰文指出,将核不扩散式的强硬策略作为管理 AI 滥用风险的主要手段很可能是错的,若认真执行会既无效又损害自由。她认可算力安全、信息安全与 AI 护栏三支柱能阻止恶意行为者获取可用模型的逻辑前提,但强调生物武器与关键基础设施黑客属于固定能力门槛目标——一旦某项性能水平达成,复制成本便急剧下降,因此仅锁定最先进系统远远不够,应转向以韧性为核心的替代方案。

  8. Miles Brundage · 收录 · 原文 22

    Miles Brundage 为何将前沿 AI 公司的安全置于首位

    Miles Brundage 撰文论证前沿 AI 公司的安全应比安全性更为紧迫。他指出,独立专家基于对前沿 AI 公司员工的访谈估计,这些企业距离抵御中俄等国资源充足的攻击尚有数年差距,且一年内 AI 系统能力还会大幅提升,现有竞争编码能力已达人类前几百名的水平。由于投资安全的成本由公司独自承担、投入不足的成本却由整个社会分担,加上单方面加强安全可能拖慢研发进度并丧失市场优势,这一问题不会自动解决。他还强调,芯片和数据中心的安全建设以及安全许可审批所需的时间超过模型迭代间隔,因此无法留待后期自动化处理。

  9. Miles Brundage · 收录 · 原文 32

    Miles Brundage 对《通用目的 AI 行为准则》第二稿的反馈

    Miles Brundage 针对欧盟《通用目的 AI 行为准则》(COP)第二稿发表反馈意见,认为草稿正朝更具体、更连贯的方向改进,但仍存在大量未竟事项。他指出起草工作组的推进节奏过于仓促,问题根源在于欧洲议会启动该流程过晚而非主席团本身。对于具有系统性风险的模型的合规条款,他认为大型企业大体能够遵守,并强调若合规低效或错配风险,可能适得其反地损害企业内部的安全声誉。

  10. Miles Brundage · 收录 · 原文 20

    DeepSeek R1 的真正启示:规模加人才即可逼近超人类 AI

    DeepSeek 发布的 R1 已成为最强开源 AI 模型,其意义在于延续了 2018 年 GPT-2 以来的规律——只要算力与数据构成的规模和数十到数百名顶尖科学家工程师的技能这两项要素齐备,就能造出比肩乃至超越人类的 AI,且成本逐月下降。 该模式先在预测下一个词的范式下通过反复训练神经网络习得语法与世界知识,去年起又经长链式推理扩展到数学与编程等领域,o1 与 R1 借此学会分解问题并自查。 后来者常能以远低于先行者的成本复制同等性能,全球科学界公开的技巧使 OpenAI API 价格累计降幅超过 90%,因此美国无法长期垄断超级 AI 能力,GPU 出口管制虽必要却挡不住能力的持续扩散。

  11. Miles Brundage · 收录 · 原文 20

    Miles Brundage 评美国副总统 Vance 在 AI Action Summit 演讲中的 AI 政策信号

    Miles Brundage 发文点评美国副总统 Vance 在 AI Action Summit 上的演讲,指出其释放的美国 AI 政策议程中既有令人鼓舞之处也有隐忧。Vance 强调需保护 AI 技术与半导体免受窃取和滥用,Brundage 解读这指向模型权重及算法机密的安全防护,并希望该议题形成两党共识。他还推测 Vance 主张轻量化且聚焦极端风险、避免被大型科技企业俘获的安全监管路径,同时注意到其在 AI 与经济就业关系上偏向经济民粹主义立场而非科技右翼。

  12. Miles Brundage · 收录 · 原文 28

    Miles Brundage 为何不认同 AI 信息安全末日论

    Miles Brundage 撰文说明自己为何不属于他所称的"security doomer",即认定 AI 系统无法抵御国家级别攻击者窃取、或其防护成本高到不值得做的人。他指出这种悲观有其道理:针对高级攻击者的信息安全本就极难防守,且安全措施会拖慢研究与产品交付速度,例如减少能接触模型权重的人员、隔离算法信息都会降低研发推进节奏。但他强调这只是为了先厘清该立场的来龙去脉,并限定讨论仅涉及信息安全而非防范 AI 滥用。 要点: - 他用"security doomer"一词描述那些认为 AI 系统挡不住老练国家级攻击者、或者保护它们会让 AI 研究减速到得不偿失程度的人。

  13. Miles Brundage · 收录 · 原文 19

    Miles Brundage:AI 政策需从单个系统转向组织级治理

    Miles Brundage 撰文指出,当前多数 AI 安全与政策讨论聚焦于单个 AI 系统的风险缓解,但这远远不够——还需关注组织层面的治理问题,例如追问「OpenAI 或 Anthropic 是否会带来灾难性风险」,而非仅停留在「o3 或 Claude 3.7 Sonnet 是否安全」。他认为从模型到系统的转变虽重要,但仍需进一步放大视角,纳入企业实体维度。 随着 AI 快速进步,「系统因太笨而无害」的不可能性论证将很快失效,因此外部利益相关方无法仅凭特定 AI 系统的属性来评估一家组织的整体风险水平,比如该公司是否及时修补软件漏洞。

  14. Wiz Research · 收录 · 原文 50

    KICS GitHub Action 遭 TeamPCP 供应链攻击,Checkmarx OpenVSX 插件同时被投毒

    Checkmarx 的开源基础设施即代码安全扫描器 KICS 的 GitHub Action 被 TeamPCP 植入窃取凭据的恶意代码,3 月 23 日 12:58 至 16:50 UTC 之间固定到被篡改标签的用户会拉取到恶意版本,仓库在用户提交 issue 后于 16:50 UTC 被下架。攻击者用仿冒提交暂存 setup.sh 并修改 action.yaml 触发执行,随后疑似通过被入侵的 cx-plugins-releases 服务账号直接改写全部 35 个标签指向这些提交。

    推荐理由Wiz 复盘了 TeamPCP 五天内第二次攻陷开源安全扫描器的手法,并给出凭据窃取与 Kubernetes 持久化的具体机制。

  15. Wiz Research · 收录 · 原文 50

    TeamPCP 在 LiteLLM 中植入木马,恶意版本窃取云凭据与密钥

    Wiz Research 披露,开源 Python 库与代理服务器 LiteLLM 被 TeamPCP 攻击活动植入木马,恶意版本 1.82.7 和 1.82.8 于 2026 年 3 月 24 日发布,约 8:30 UTC 上线、11:25 UTC 被 PyPI 隔离。1.82.7 将双重 base64 编码的载荷写入磁盘并以 p.py 运行,在 litellm --proxy 运行或导入 litellm.proxy.proxy_server 时执行;1.82.8 进一步滥用 Python 的 .pth 机制,通过 litellm_init.pth 在任意 Python 进程启动时执行载荷。

    推荐理由梳理了 LiteLLM 恶意版本的两条投递路径与数据窃取范围,可据此排查自身 Python 环境与凭据暴露面。

  16. Wiz Research · 收录 · 原文 42

    Wiz 披露 TeamPCP 投毒微软 durabletask PyPI 包事件

    Wiz 分析发现,与 TeamPCP 相关的供应链攻击活动投毒了微软官方 Python 客户端 durabletask 的 v1.4.1、v1.4.2 和 v1.4.3 三个版本,PyPI 已在 Wiz 分析后将其隔离。攻击者通过此前攻击中窃取的 GitHub 账号导出仓库 secrets 中的 PyPI token,直接发布恶意包,该账号此前也涉及 @antv 相关攻击波次。

  17. Goodfire Research · 收录 · 原文 42

    Goodfire 发布 Llama 3.3 70B 的 SAE 特征空间图谱与 API

    Goodfire 在 Llama 3.3 70B 上训练了稀疏自编码器(SAE),并通过 API 开放这一带可解释性工具的模型,作者称这是当时公开可用的最强可解释性模型。文章用 DataMapPlot 生成 SAE 特征的 UMAP 交互式可视化,发现与特殊格式 token 或聊天数据中重复元素(如知识截止日期)相关的特征会以孤立点或小簇形式远离中心区域,并给出生物医学、物理、编程、名称抽象以及语音与字符相关等特征簇示例。

    推荐理由Goodfire 公开了 Llama 3.3 70B 的 SAE 特征图与 API,并给出特征引导中事实性随强度下降的实测曲线,可作机制可解释性研究的参考。

  18. Goodfire Research · 收录 · 原文 27

    Goodfire 与 Arc Institute 合作解读 Evo 2 基因组基础模型

    Goodfire 与 Arc Institute 合作,对 Arc 新一代生物基础模型 Evo 2 开展机制可解释性研究,在其第 26 层训练 BatchTopK 稀疏自编码器(SAE),提取出外显子-内含子边界、蛋白质二级结构等具有生物学意义的特征,并通过大规模对齐分析以 domain-F1 分数验证其相关性。Evo 2 提供 7B 和 40B 两种参数规模,可在核苷酸级别处理最长 1M 碱基对序列。团队已初步尝试通过特征引导(steering)精确设计新蛋白质结构,但该模型的可控性远比语言模型复杂,仍需进一步研究。

  19. Goodfire Research · 收录 · 原文 50

    Goodfire 用损失曲率区分模型记忆与推理并实现选择性编辑

    Goodfire Research 提出通过分析模型损失景观的曲率,区分权重空间中主要支撑记忆的方向与支撑通用计算的方向,从而在无需标注遗忘样本的情况下选择性抑制记忆。方法先用 K-FAC 从随机训练序列的前向与反向传播统计中近似曲率,再据此分解权重矩阵并清零低曲率分量。在语言模型上,该方法对未参与训练的遗忘序列的抑制效果优于 SOTA 遗忘方法 BalancedSubnet,纯逻辑推理任务表现不受影响甚至略有提升。在视觉 Transformer 上,对 10% 随机标签噪声的记忆率从 81.6% 降至 3.5%,验证准确率从 67% 升至 71.7%。

    推荐理由Goodfire 用损失曲率区分记忆与通用计算方向,为理解模型记忆存储与选择性编辑提供了一种免标注的方法。

  20. Goodfire Research · 收录 · 原文 53

    Goodfire 研究思维链表演性:探针揭示模型内部答案早于推理文本

    Goodfire Research 提出用注意力探针、强制作答和 CoT 监控三种方法对比模型内部信念与思维链文本,把两者的准确率差距定义为表演性推理。研究在 DeepSeek-R1-0528-671B、GPT-OSS-120B 及 DeepSeek-R1 蒸馏模型上,用 MMLU-Redux 和 GPQA-Diamond 两个多选题基准测试。最佳注意力探针在 MMLU 上平均准确率达 87.98%,而单 token 线性探针不超过 31.85%,接近 25% 的随机基线。

    推荐理由Goodfire 用探针与强制作答对比思维链监控,量化了模型内部信念与外部推理文本的错位,并给出可复用的早退方法。