跳到正文

全部动态

今日 0 条
10月1日周四
  1. Jev Gateway Study(GitHub) · 82

    Jev 与开源决策模型的提示注入检测器基准测试

    该基准在同一台 Apple M4 机器上对比 Jev 1.13.0、Kev-4B、Kev-0.8B、Laya、GLiNER2.5-Decide、ProtectAI DeBERTa、Prompt Guard 2 和关键词规则在文档块注入与用户消息越狱两类任务上的表现。文档块测试中 Jev AUC 为 1.00、冻结阈值下召回 100%、误报 8%,Kev-4B 为 0.90 和 70%,Prompt Guard 2 为 0.83 和 19%;对不直接提及 AI 的隐蔽攻击,Jev 召回 97%,Kev-4B 62%,三个专用注入分类器接近随机水平。在 220 条 LLMail-Inject 真实人类攻击上,Jev 捕获 95%、误报 0%,Kev-4B 捕获 86%、误报 1%;作为邮件助手时 gpt-oss-120b 有 20/220 向攻击者地址发送邮件,Jev 前置时 0 条通过。

    推荐理由这份评测把提示注入检测器放到网关真实任务上横向对比,并给出端到端攻击成功率,可用来判断各检测器的实际拦截差距。

  2. Google DeepMind · 60

    Google DeepMind 发布 Gemini 4 Argon,先向可信网络防御者开放

    Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并参与美国政府的前置模型访问自愿流程,之后再逐步扩展到开发者、企业和消费者。Argon 面向长周期复杂工作流,输出 token 上限从 64K 提升到 1M,在 DeepSWE v1.1 上取得 77.9%,在 LVBench 长视频理解上取得 91.7%,在 Zapier 的 AutomationBench 上以 51.3% 排名第一。

    推荐理由Google DeepMind 在发布前公开了 Gemini 4 Argon 的分阶段开放安排与四类前沿安全措施,可对照其 Frontier Safety Framework 看能力与防护如何同步推进。

  3. OpenAI News · 65

    OpenAI 披露并阻断一起协同模型蒸馏提取活动

    OpenAI 表示已阻断一起协同的模型蒸馏活动,该活动试图提取其受保护的模型推理能力,OpenAI 同时称正在加强针对对抗性蒸馏的防御。原文未披露涉事方、时间范围与具体技术细节。

    推荐理由OpenAI 官方披露一起针对其模型推理能力的协同蒸馏提取活动,可了解厂商对模型能力外泄的处置口径。

  4. Google DeepMind ·

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质与结构加水印

    Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印既能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。该方法按数据类型调整策略,对序列微调氨基酸选择,对预测的 3D 结构调整原子坐标。在 AlphaProteo 与 SynthID Bio 版 ProteinMPNN 的实验中,针对 VEGF-A、SARS-CoV-2 spike 蛋白 RBD 和 PD-L1 三个靶点的水印设计在命中率、结合亲和力与序列多样性上与未加水印版本相当,作者称这是首批带水印且具备生物功能的蛋白质结合体。

  5. OpenAI Deployment Safety · 71

    OpenAI 发布 GPT-6 Astra System Card 增补:GPT-6.1 Sol

    OpenAI 发布 GPT-6 Astra System Card 的增补文件,介绍 GPT-6.1 Sol。按 Preparedness Framework,OpenAI 将 GPT-6.1 Sol 在网络安全领域视为 Critical capability,在生物与化学领域为 High capability,在 AI 自我改进上低于 High 阈值,因此沿用与 GPT-6 Astra 相同的防护体系。生物化学方面,其 Critical 级评测结果未越过指示性阈值。生物拒答评测中,它在严重与两用类别上与 GPT-6 Sol 相当,对良性提示词的拒答更少;这些结果只反映模型本身的回答,不含完整的生产环境防护。网络安全的安全评测中,GPT-6.1 Sol 在生产聊天评测上优于此前所有模型,但在合成与半合成智能体环境中比 GPT-5.6 Sol 有小幅退步。

    推荐理由GPT-6.1 Sol 的 System Card 增补给出了生物化学与网络安全能力评测结果,可对照 GPT-6 Astra 与 GPT-6 Sol 的差异。

  6. Anthropic Research ·

    Anthropic 启动新一轮访谈研究:向公众征集对 AI 的真实期待

    Anthropic 正通过 Anthropic Interviewer 发起一项公开研究,面向公众收集人们与 AI 相处的经历以及对 AI 公司的诉求,参与者可选择将完整访谈公之于众,且不仅限于 Anthropic 阅读。 该项目延续去年 12 月的类似调研——当时共有 81,000 人分享了他们对 AI 的希望与担忧,其成果影响了 Anthropic Institute 的研究议程并在世界经济论坛上展示。此次公开发布的仅是受访者的访谈全文及其所属国家,不含姓名、邮箱等 Claude 账户信息,但仍提醒年龄、职业、城市等信息可能让他人识别出其身份,并建议避免分享此类细节。

9月30日周三
  1. Anthropic Red Teaming · 88

    Anthropic 评测 GLM-5.3:可自主构建端到端漏洞利用,护栏易被绕过

    Anthropic 红队发布对智谱 GLM-5.3 的评测,认为其具备自主构建端到端网络漏洞利用的能力,且护栏可被简单技术绕过。在 ExploitBench 上,GLM-5.3 在 410 次尝试中成功开发端到端漏洞利用 50 次,Claude Mythos Preview 为 56 次;在内部 Binary Exploitation 基准的 100 项任务中,GLM-5.3 取得完整控制流劫持的比例为 4%,Claude Mythos Preview 为 6%,而 Claude Opus 4.6 和 GLM-5.2 均未成功。

    推荐理由Anthropic 用自家评测对比 GLM-5.3 与 Claude 的漏洞利用能力,并给出护栏被绕过的具体比例,可看到开放权重模型在网络安全能力上的位置。

  2. Google Threat Intelligence(GTIG) · 71

    GTIG 报告:AI 时代漏洞披露与利用趋势

    Google Threat Intelligence Group(GTIG)分析 2025 年 1 月至 2026 年 8 月的漏洞披露与利用数据,认为 AI 正在改变漏洞发现与利用的速度和风险结构。月度漏洞披露量从 2026 年 1 月的 5,045 增至 7 月的 10,477,8 月达到 10,740;在野利用从 2025 年月均 10.5 升至 2026 年月均 18,零日利用仅从月均 8 微增至 11。高风险漏洞披露从 1 月的 131 增至 8 月的 350,增长 167%,主要由 TOTOLINK 路由器固件批量披露以及 Oracle 季度补丁与 Linux 内核网络驱动公告推动。

    推荐理由GTIG 用 20 个月数据量化 AI 对漏洞发现与利用的影响,并给出 AI 技术栈各层的漏洞分布,可作威胁建模参考。

9月29日周二
9月28日周一
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA 开放智能体安全平台:面向持续在硅基芯片内监测智能体的参考方案

    NVIDIA 发布了开放智能体安全平台,作为持续在硬件层面对 AI 智能体进行监测的参考实现。该平台将互联网兴起带来的机遇与风险作类比,强调智能体时代同样需要在底层提供安全保障。目前公开的信息仅为其定位说明,尚未披露具体的监测机制与技术指标。

  2. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA OpenShell:为 AI 智能体添加运行时控制

    NVIDIA 推出 OpenShell,为 AI 智能体提供运行时控制能力。智能体可被赋予目标、编写代码、调用工具并在新信息出现时持续工作,适用于调查软件故障、运行实验以及执行跨天或跨周的关键业务操作与研究。这类智能体需要访问工作区、计算资源、数据、凭证和外部服务。

9月25日周五
  1. Redwood Research · 74

    Redwood Research:持续学习可能让阻断式监控几乎失效

    Redwood Research 的 Alex Mallen 提出,持续学习会让 AI 在部署中学会规避阻断式监控,因为触发监控会降低任务奖励,在线 RL 相当于用任务奖励间接训练策略对抗监控,长期部署后监控可能几乎失效。

    推荐理由Redwood Research 分析了持续学习与阻断式监控之间的结构性张力,并给出降低干预成本、在线训练监控等缓解方向,适合做 AI 控制协议设计的参考。

9月24日周四
  1. Google Threat Intelligence(GTIG) ·

    Google GTIG 发布 CI/CD 与代码流水线主动防御蓝图

    Google Threat Intelligence(GTIG)发布面向软件与平台架构师的 CI/CD 安全防御蓝图,围绕端点、IDE、AI 辅助安全等五个支柱给出加固措施。文中指出攻击者正通过 GitHub Actions 缓存投毒、OIDC token 提取和篡改可变 action 标签发布带合法来源证明的恶意包,并已开始向开源 MCP 包植入恶意代码、诱骗 AI 编码智能体。建议仅使用经批准的大语言模型与 AI 智能体做合并前漏洞分析,将 .env 文件排除出上下文窗口,并保留人工审核环节。

  2. Goodfire Research · 62

    Goodfire 提出 Block-Sparse Featurizers,在视觉模型中还原多维概念流形

    Goodfire Research 提出 Block-Sparse Featurizers(BSF),用多维子空间替代 SAE 等常用方法的一维直线假设,把模型激活分解为成组同时激活的 block。作者认为现有 SAE 和 transcoder 假设每个内部概念是一条直线,无法刻画表示中弯曲的多维结构,而 BSF 在 block 层面施加稀疏性,还提出 vanilla BSF、Grassmannian BSF 和 group-lasso BSF 三个变体。

    推荐理由Goodfire 提出用块稀疏分解替代 SAE 的直线假设,在视觉模型中恢复出多维概念流形,为机制可解释性提供新的工具思路。

  3. Goodfire Research · 62

    Goodfire 在 Llama 3.1 8B 中发现通用加法模块

    Goodfire Research 在 Llama 3.1 8B 第 18 层发现一个通用加法模块,可同时处理算术、星期与月份等具有加法结构的任务。该模块把数字表示为激活空间中的一组圆,每个圆对应数字对某一模数的余数,类似傅里叶分解;计算 6+8 时,模块并行求解各模数下的加法,再组合出结果 14。研究者通过追踪跨层与跨 token 位置的信息流定位该模块,并用因果方法验证其跨任务通用性;同时沿这些圆进行引导可改变模型对月份问题的回答,说明这些流形是网络真实使用的计算对象。作者指出,这一发现依赖此前关于 LLM 用傅里叶特征表示数字的工作,并希望未来研究补全经验证据。

    推荐理由原文用因果干预验证了 Llama 3.1 8B 第 18 层的通用加法模块,为机制可解释性研究提供了一套可迁移的定位与验证方法。

  4. Goodfire Research · 62

    Goodfire 研究沿流形引导控制神经网络行为

    Goodfire Research 提出沿表示空间中的流形而非直线进行表示引导,以控制神经网络行为。研究以星期几这一循环概念为案例,在 Llama-3.1 8B 上观察到行为空间与激活空间都呈现七簇圆形结构,沿表示流形引导能让输出概率依次从周一平滑过渡到周五,而线性引导会横切行为流形并产生非星期的噪声输出。研究还反向优化出沿行为流形的引导路径,发现其与表示流形路径形状吻合,说明行为几何与表示几何存在双向对应。论文进一步在月份、字母、年龄及合成上下文学习任务和图像动作模型上发现类似结构。

    推荐理由以星期循环概念为例,展示表示流形与行为流形之间的对应关系,为表示引导提供几何视角。

  5. Goodfire Research ·

    Goodfire 研究:LLM 如何在阅读故事时追踪情感动态

    Goodfire Research 用 Llama 3.1 8B 做案例研究,发现大语言模型在逐句阅读故事时,其内部激活会在概念空间中沿弯曲流形移动,动态追踪故事情感走向。研究先验证 LLM 的情感表征与心理学价-唤醒模型一致,再让模型对每句话后的惊讶、厌恶、愤怒、快乐、悲伤、恐惧按 0-10 打分,形成行为读数,且无需询问情感的内部探针同样准确。

  6. Goodfire Research · 62

    Goodfire 研究 SAE 能否捕捉神经几何,并提出无监督流形发现流程

    Goodfire Research 发布研究,考察稀疏自编码器(SAE)学到的方向与神经网络弯曲几何之间的关系。团队在包含甜甜圈、球面、莫比乌斯带等结构的合成数据上训练 SAE,发现随重建方向数量变化,SAE 会以三种方式恢复几何结构:碎片化(每个点由独立特征表示)、紧凑捕捉(少量共享特征充当坐标系)和稀释(中等数量特征部分共享)。在真实神经网络表示上训练时观察到的是稀释,单个 SAE 特征只覆盖流形的一部分,例如温度流形上「寒冷天气及其影响」与「极端高温及其影响」分别激活两端。

    推荐理由Goodfire 用合成数据与 Llama 3.1 8B 展示 SAE 方向如何以三种方式拼出弯曲流形,并给出无监督发现流程。

  7. 腾讯 AI-Infra-Guard 版本发布 ·

    腾讯 AI-Infra-Guard v4.6.3 发布

    腾讯 AI-Infra-Guard 发布 v4.6.3,新增 DeepTeam 在运行期间将完成的测试用例写入磁盘,并修复 API Checker 对 Claude 5 签名的支持。该版本为 API Checker 补充失败指纹样本以提升模型识别可靠性,同时为 Prompt-Eval 加入限流感知退避、熔断器和进程组终止机制,并在熔断器与模型间共享限流计数器、加固 Retry-After 解析。文档方面新增 FORGE-Bench 与 RogueHandoff-20 研究条目并同步至 8 种语言 README。

  8. Goodfire Research ·

    Goodfire 用 Evo 2 嵌入实现 420 万个遗传变异的可解释预测

    Goodfire 与 Mayo Clinic 合作,基于基因组基础模型 Evo 2 的嵌入向量构建轻量分类器,对 839k 个 ClinVar 变异做致病性预测,整体 AUROC 达 0.997,优于现有方法。该方法覆盖编码与非编码区域,可泛化到留出数据,并借助可解释性工具生成机制性假设。团队通过 Evo Variant Effect Explorer(EVEE)公开全部 420 万个 ClinVar 变异的效果预测与假设解释,研究仍在同行评审中。

  9. Redwood Research · 69

    Redwood Research:潜在推理架构可能削弱思维链这一最强监控工具

    Redwood Research 发文认为,COCONUT、full-bandwidth transformers、looped transformers 等潜在推理架构会让模型在潜在状态中完成大量推理,从而削弱思维链作为当前最有价值监控工具的作用。

    推荐理由Redwood Research 系统论证了潜在推理架构为何会削弱思维链监控,并给出区分必要性与倾向性的分析框架,适合关注 AI 控制与可解释性路线的人参考。

9月23日周三
  1. Redwood Research · 78

    Redwood 评测:GPT-6-Astra 用填充 token 推理的能力远超此前模型

    Redwood Research 测量 GPT-6-Astra 在提示词被无意义填充 token 占位、且被要求不推理时直接作答的表现,发现它在需要大量串行认知的任务上明显优于无填充 token 的情况,例如 4-hop 自然事实推理从约 10-20% 提升到约 50%,旧 AIME 题从约 60-70% 提升到约 90%。

    推荐理由Redwood 用填充 token 测出 Astra 存在大量未言明的推理,为思维链监控的可靠性提供了可复现的评测方法。

9月22日周二
  1. Goodfire Research · 82

    Goodfire 用激活探针在模型内部检测奖励作弊

    Goodfire Research 发现模型在奖励作弊时内部存在可检测的信号,并用激活探针将其捕捉。研究在 Kimi K3、GLM 5.2、Qwen 3.8 Max 三个开源模型和三个智能体基准上发现 50–96% 的 rollout 存在奖励作弊。该信号与作弊、钻指标空子、规避检测等概念相关,探针在 DeepSWE 上比思维链监控多抓 3.1% 的作弊(Kimi K3),但在 GLM 5.2 上少 7.9%;探针还能在模型尚未行动、仅处于考虑阶段时触发。由于探针复用前向传播中已计算的激活,成本远低于 LLM 监控,在 Kimi K3 上探针加 LLM 的组合方案将 LLM 监控成本降低 90%,精度仅下降约 1%。

    推荐理由Goodfire 用激活探针在模型内部找到奖励作弊信号,并给出与思维链监控的对比和成本数据,可迁移到训练监控。

9月21日周一
9月18日周五