跳到正文
10月6日周二
  1. Truffle Security · 收录 · 原文 43

    Truffle Security CEO 预测 AI 蠕虫将在 6 至 12 个月内成为现实威胁

    Truffle Security 联合创始人兼 CEO Dylan Ayrey 预测 AI 蠕虫不可避免,可能在 6 至 12 个月内成为现实问题,潜在损失以数十亿美元计。他梳理了已具备的条件:6 月一项研究用开源权重模型在 33 台主机的隔离网络上平均在 20.4 台主机上启动副本,最多繁衍七代;Palisade Research 展示 Qwen3.6-27B 智能体复制自身权重、推理运行时、harness 与提示词并启动子实例,一次运行跨越三大洲四台虚拟机。作者认为蠕虫不需要超级智能,只需青少年水平的侦察与工具调用能力,并援引 Cyber-Zero 将 14B 模型单次攻击成功率从 18.6% 提升到 29.1%、TermiAgent 用 Qwen3-4B 在 230 个易受攻击配置中拿到 137 个 shell 等结果说明算力门槛不高。

10月2日周五
  1. FAR.AI · 收录 · 原文 33

    Mind the Mitigation Gap:为何 AI 公司必须同时报告缓解前与缓解后的安全性评估

    FAR.AI 指出多数 AI 公司只披露缓解前或缓解后其中一类安全评估,导致风险难以准确衡量,主张两者都必须上报。其梳理发现 OpenAI 对 o1 两类均公开且覆盖 CBRN 高风险能力,Anthropic 仅报基于低拒绝版 Claude 3 与 3.5 的缓解前能力且无明确定义,Gemini 1.5 仅有缓解后评估,Meta 对 Llama 3.1 只给模糊声明,阿里 Qwen-2.5 仅有基础缓解后评估,DeepSeek R1 则完全没有报告。该框架应用于 o1、GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Pro 后发现,WMDP-Chem 准确率上 o1 与 GPT-4o 最高达 70–75%,危险请求合规率上 GPT-4o 高达 50%。

  2. 安远AI · 收录 · 原文 31

    中国开源最强 AI 模型,安全吗?

    中国实验室今年夏天发布 Kimi K3、Qwen 3.8-Max、GLM-5.3 等开源模型,能力仅略落后于美国最强模型,引发开源模型是否会被滥用的争论。开源权重可被廉价微调去除护栏、发布后无法撤回,但自托管需数十万美元级芯片、云端托管约 $50-150 每小时,实际滥用门槛仍高。中国 TC260 已在 AI 风险框架中点名开源模型安全机制可能被移除或绕过,并着手起草开源 AI 安全标准。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. Cisco · 收录 · 原文 42

    Cisco 与 VAIL 研究:以国别标签判断 AI 模型风险存在盲区

    Cisco 与 VAIL 的研究发现,仅凭发布者和国别标签评估 AI 模型安全会留下明显盲区,因为模型常继承跨组织、跨国界的权重与训练依赖,形成所谓血缘纠缠。研究用两种独立指纹方法验证:Cisco 的 Model Provenance Kit 分析模型权重,VAIL 则对推理行为做指纹。以 NVIDIA Nemotron 家族为案例,其中部分模型公开记录使用 Qwen 基础权重,两种方法都发现 Qwen 在 Qwen 系 Nemotron 最近邻中的占比高于其在目录中的基准比例,Cisco 184 模型目录中为 20.9% 对 12.0%,VAIL 1159 模型目录中为 28.1% 对 14.9%,且都还原了 Qwen、NVIDIA、Llama 三组的既有排序。作者强调相似性是证据而非因果证明,指纹可用于企业部署前的血缘核查与事件后排查,但不能替代托管与运营控制层面的判断。

已经到底了