跳到正文

DeepSeek

DeepSeek 模型的安全评估、越狱研究与监管关注。

75条动态与论文相关主题开源模型安全Meta越狱与攻击
在这个话题内搜索或按分类筛选

新闻与论文

第 41–60 条 · 共 75 条
10月2日周五
  1. 安远AI · 收录 · 原文 50

    Concordia AI 发布 2026 Q1 前沿 AI 风险监测报告:滥用防护改善而失控安全停滞

    Concordia AI 发布 2026 Q1 前沿 AI 风险监测报告,首次采用 Risk Index v1.5 框架,独立评估 16 家公司 70 多个模型。新框架新增“有害操纵”风险域,并在失控域引入 MLE-Bench、GDM-Stealth、Agentic-Misalignment 等能力与倾向评测,在网络攻击、生物、化学域加入 Fortress、ISC-Bench 等高强度红队基准。报告发现风险趋势出现结构性分化:网络攻击、生物、化学和有害操纵域的能力与安全得分同步上升,而失控域能力持续增强、安全得分未同步改善。模型家族风险画像继续分化,Gemini 家族在失控域风险指数明显偏高,DeepSeek、GLM、MiMo 家族在多数域处于较高风险区间,Kimi 家族在生物和化学域风险指数上升较快,GPT 和 Claude 家族多数域仍处较低风险区间。

  2. FAR.AI · 收录 · 原文 57

    FAR.AI 红队测试:DeepSeek R1 与 OpenAI、Anthropic、Google 可微调模型的护栏可被轻易移除

    FAR.AI 用越狱微调攻击测试 DeepSeek R1-Distill-Llama-70B 以及 OpenAI GPT-4o、Anthropic Claude 3 Haiku、Google Gemini 1.5 Pro,发现这些模型的护栏可被移除且响应质量基本保留。攻击方式是在训练和推理时都加入越狱短语,用 Harmful SafeRLHF 的有害问答对做微调,对 GPT 混入 BookCorpus 数据绕过审核,对 Claude 则用只含字母 a 的良性数据集绕过。在 StrongREJECT 基准上,微调前这些模型拒答率接近 100%、最高有害性得分仅 6%,微调后有害性得分均超过 80% 且几乎不再拒答。作者指出闭源模型只需一个简单的输出过滤器就能挡住这类攻击,但对更复杂的攻击目前没有已知方法能保证可微调模型的安全,建议在部署前对每个可微调模型做 evil twin 评估。

    推荐理由FAR.AI 用同一套越狱微调方法横向测试 DeepSeek、OpenAI、Anthropic、Google 的可微调模型,给出可复现的对比数据。

  3. FAR.AI · 收录 · 原文 33

    Mind the Mitigation Gap:为何 AI 公司必须同时报告缓解前与缓解后的安全性评估

    FAR.AI 指出多数 AI 公司只披露缓解前或缓解后其中一类安全评估,导致风险难以准确衡量,主张两者都必须上报。其梳理发现 OpenAI 对 o1 两类均公开且覆盖 CBRN 高风险能力,Anthropic 仅报基于低拒绝版 Claude 3 与 3.5 的缓解前能力且无明确定义,Gemini 1.5 仅有缓解后评估,Meta 对 Llama 3.1 只给模糊声明,阿里 Qwen-2.5 仅有基础缓解后评估,DeepSeek R1 则完全没有报告。该框架应用于 o1、GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Pro 后发现,WMDP-Chem 准确率上 o1 与 GPT-4o 最高达 70–75%,危险请求合规率上 GPT-4o 高达 50%。

  4. IAPS · 收录 · 原文 42

    IAPS 提议由市场化出口审计机构协助美国芯片出口管制执法

    IAPS 在一份工作论文中提出,美国出口管制执法可由独立营利性出口审计机构协助,这些机构由美国工业与安全局(BIS)认证和监管,进口方须为特定类别出口聘请经认证的审计公司,审计方通过现场检查等方式发现潜在的转运行为。论文称,过去两年美国出口管制执法出现多次重大失败,包括 2024 年估计有超过 10 万枚先进 AI 芯片被走私到中国,以及 DeepSeek 被报道使用走私入境的 NVIDIA Blackwell 芯片训练模型。BIS 执法预算实际停滞、IT 系统陈旧,目前仅有一名出口管制官员负责整个东南亚和大洋洲,每年约进行 1500 次最终用途检查。论文估算,每百万枚 AI 芯片每月约 70 次检查可在六个月内以 95% 概率发现随机芯片的转运,成本约为每年每百万枚芯片 250 万美元,约占采购价值的 0.005%。

  5. IAPS · 收录 · 原文 43

    IAPS 评估 H200 对华出口的影响:DeepSeek 算力或接近美国数据中心

    IAPS 发布 Issue Brief,评估美国商务部 BIS 1 月半导体出口规则下 Nvidia H200 对华销售的影响。该规则将对华出口限制在美国本土销量的 50%,按去年 H200 与 AMD MI325X 在美国本土销量略低于 200 万块估算,规则允许向中国出售约 89 万块 GPU;Nvidia 表示正为中国客户推进 H200 生产。报告认为这些出口将显著提升中国前沿 AI 能力,最高出口上限下中国总算力将比 2026 年基线预测增长逾 250%,计入高带宽内存后推理算力增幅更大。仅 28 万块 H200 就能让 DeepSeek 的算力与 xAI 的 Colossus 2 相当,达到出口上限时其算力接近美国 2026 年单个数据中心的建设规模;按每 GPU token 吞吐估算,10 万块 H200 理论上可让 DeepSeek 每月服务超过 8 亿用户。

  6. FAR.AI · 收录 · 原文 22

    FAR.AI 2025 年 AI 回顾:能力加速进步,风险问题更难

    FAR.AI 在 2025 年回顾中指出,推理模型与编程智能体快速普及:Devin 于 2024 年 3 月解决约 14% 的 SWE-bench 任务,而 Gemini 3 Pro 与 Claude 4.5 Opus 近期均达到 74%;GPQA Diamond 上 o3.1 和 Gemini 3 Pro 已达 90% 以上,基准接近饱和。风险方面,Anthropic 曾识别并阻断一个疑似中国国家支持的组织,其使用 Claude Code 自主对金融、政府与科技等 30 个目标发起网络攻击,仅少数得手。

  7. IAPS · 收录 · 原文 41

    IAPS 政策备忘录:美国应对 AI 蒸馏攻击的行政与国会行动仍需补强

    IAPS 发布政策备忘录,认为白宫与国会在应对 AI 蒸馏攻击上已有动作,但力度与威胁规模不匹配。备忘录指出,OSTP 于 4 月 23 日发布的《美国 AI 模型对抗性蒸馏》国家安全与科技备忘录未涉及蒸馏攻击与先进半导体出口管制的关联、攻击者通过云端远程访问美国芯片的风险,也未说明具体问责机制,建议商务部在芯片出口与远程算力访问上纳入蒸馏风险,白宫公开其拟动用的具体授权。针对 4 月 15 日由众议员 Huizenga 提出、4 月 22 日以 43-0 通过众议院外交事务委员会审议的《2026 年威慑美国 AI 模型窃取法案》,备忘录提出四项修正:处理行业合作的反垄断与数据隐私障碍、允许跨政府共享情报、限制联邦机构访问受关注实体的模型、明确模型提取攻击构成商业秘密窃取,并将评估频率从每年一次共 3 年改为至少每年一次共 5 年。

  8. POLITICO Europe Technology · 收录 · 原文 35

    全球AI安全治理努力可能不得不在美国缺席下推进

    联合国大会期间,多国领导人及OpenAI CEO Sam Altman、Anthropic CEO Dario Amodei呼吁建立AI全球治理框架,Anthropic主张制定模型测试的"共同全球标准"。由芬兰和挪威牵头、22国通过的AI安全宣言未获美国和中国签署,特朗普在联大演讲中明确拒绝任何AI"全球主义控制方案"。前美国官员指出,美国不参与将限制相关努力的有效性,而中美领导人本周会晤仅将顺带讨论AI。

  9. 安远AI · 收录 · 原文 31

    中国开源最强 AI 模型,安全吗?

    中国实验室今年夏天发布 Kimi K3、Qwen 3.8-Max、GLM-5.3 等开源模型,能力仅略落后于美国最强模型,引发开源模型是否会被滥用的争论。开源权重可被廉价微调去除护栏、发布后无法撤回,但自托管需数十万美元级芯片、云端托管约 $50-150 每小时,实际滥用门槛仍高。中国 TC260 已在 AI 风险框架中点名开源模型安全机制可能被移除或绕过,并着手起草开源 AI 安全标准。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  10. OX Security · 收录 · 原文 62

    OX Research 披露 DeepSeek Harness 沙箱逃逸漏洞 CVE-2026-82533

    OX Research 在 DeepSeek 开源编码 Agent 框架 DeepSeek Harness(dsh)中发现一个严重漏洞,被沙箱限制的 Agent 只需一条 shell 命令即可解除自身沙箱限制,该漏洞编号为 CVE-2026-82533,CVSS 评分 9.4。原因是 Harness 在本地 HTTP 端口暴露了无认证的 Agent 控制 API,仅凭客户端提供的 Host 请求头判断请求是否可信,而不校验连接的实际对端地址;同时其 OS 沙箱(bubblewrap、Landlock 或 Seatbelt)只限制文件写入却保留 loopback 网络,且普通 bash 调用无需审批。第二条攻击路径是:只要该端口可达(隧道、反向代理、SSH 转发、编辑器端口转发等),未认证的远程攻击者即可直接控制 Agent,并在无 API key 的情况下导出全部已存对话。

    推荐理由披露了 DeepSeek Harness 沙箱逃逸的完整链路与修复版本,运行本地编码 Agent 的团队可据此核对自身配置。

  11. FAR.AI · 收录 · 原文 60

    FAR.AI 压力测试 DeepSeek-V4-Pro:三种攻击策略下护栏成功率 98% 至 100%

    FAR.AI 对 DeepSeek-V4-Pro 的护栏做了安全压力测试,在 CBRN、网络攻击和恐怖主义相关等高风险领域,模型对直接请求的拒答率为 100%,但在对抗条件下三种攻击策略的成功率达到 98% 至 100%。三种攻击均通过官方 DeepSeek API 完成,无需本地部署:复用公开越狱提示词模拟无限制的开发者测试模式,成功率 100%,约需 15 分钟;伪造特权用户身份,成功率 99.6%,约需 45 分钟;在模型回复中预填伪造的安全评估,成功率 99.6%,约需 150 分钟。被越狱后模型在生物、化学和编程任务上仍保持接近基线的能力,能生成细节充分的威胁场景回答。

    推荐理由FAR.AI 用三种攻击策略测出 DeepSeek-V4-Pro 的拒答在对抗条件下几乎全部失效,并指出旧版越狱可直接迁移。

  12. Datadog Security Labs · 收录 · 原文 43

    Datadog 追踪两个凭证收集平台:LLM 辅助搭建的攻击基础设施

    Datadog 安全研究团队自 2026 年 7 月起监控两个凭证收集平台 Loot 和 UltraVault,二者有时由同一主机提供,且无需认证即可访问,任何人都能浏览其持有的全部凭证并按受害域名搜索。Loot 是带搜索框和验证按钮的凭证目录,共列出 26,733 个密钥,其中 AI 类别有 1,778 条记录、196 条为 live,覆盖 15 个提供商标签,包括 OpenAI 699 条(93 条 live)、Gemini 666 条(55 条 live)、Anthropic 114 条(10 条 live)。UltraVault 更复杂,自称持有 42,286 个密钥,live 率仅 2.7%,提供一键验证、按漏洞推荐利用方式,并围绕 react2shell、wp2shell、xss2shell、joomla2shell 等利用链组织目标,还包含 14 个本地提权漏洞的推荐矩阵。

  13. SentinelLabs · 收录 · 原文 50

    SentinelLABS 用 fast16 样本评测前沿模型的长周期恶意软件分析能力

    SentinelLABS 基于其 2005 年 sabotage implant fast16 的真实调查,构建了一个八阶段逆向工程基准,测试前沿模型能否在证据不断推翻先前结论时维持可信的恶意软件调查。OpenAI 的 GPT-5.6 Sol 是唯一完成全部八阶段的公开可用模型,三个不同推理强度设置的运行均通过基准;GPT-5.5、GLM-5.2 和 Opus 4.x 系列能完成局部分析,但无法贯穿整个梯度。区分完成运行的关键是项目级恢复能力,即撤回被推翻的结论、修复技术产物、更新依赖报告而不丢失调查。最强运行仍犯语义错误、接受薄弱的质量控制并过早宣称就绪,作者认为当前最佳用途是受监督的调查代理,由人类分析师定义目标并保留最终发布权。所有实验共消耗超过 230 亿 token,缓存读取率 93.58%;自托管 GLM-5.2 以 100 美元预算产出 267.41M token。

    推荐理由SentinelLABS 用真实恶意软件样本构建八阶段逆向工程基准,给出各前沿模型在长周期调查中的具体失败点与成本数据。

  14. Cisco Talos · 收录 · 原文 55

    Cisco Talos 披露首个自主 AI C2 植入体 CLOSEDQUORUM

    Cisco Talos 通过 CAIRN 项目发现并分析了名为 CLOSEDQUORUM 的 Windows 植入体,称其为已知首个把战术命令控制交给商业大语言模型投票决策的公开记录样本。该 16.4MB 的 64 位 Go 可执行文件依次查询 DeepSeek、Qwen、Mistral 和 Google Gemini 四个模型,用多数投票从 steal、inject、persist、move 中选出下一步动作并直接执行,目标是窃取用户凭据和加密钱包;平票时按 DeepSeek、Qwen、Mistral、Gemini 的顺序决定。模型输出被约束为固定 JSON schema,Decision 字段映射到 LSASS 内存转储、浏览器密码与 MetaMask/Exodus/以太坊钱包提取、进程注入和持久化等模块,结果经 Discord webhook 回传。

    推荐理由Cisco Talos 公开了首个由多模型投票自主决策 C2 的 Windows 植入体静态分析,并给出可落地的行为检测组合。

10月1日周四
  1. AI Frontiers · 收录 · 原文 19

    《Obsolete》节选:AI 军备竞赛并非不可避免,只是有利可图

    AI 军备竞赛并非技术必然,而是利润驱动——前沿 AI 公司认为率先实现 AI 研发自动化可将暂时领先转为永久优势。Garrison Lovely 在《Obsolete》第 16 章指出,前沿模型训练依赖高度集中的供应链:ASML 垄断先进光刻机,TSMC 制造几乎所有先进 AI 芯片,Nvidia 设计芯片,因此政府只需限制少数几家公司即可叫停大型训练。美国已具备出口管制、国家安全权力和联邦合同等法律工具,曾据此限制对华先进 AI 芯片及制造设备出口,并促使荷兰、日本跟进。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. arXiv:可解释性 · 收录 · 原文 论文55

    研究:思维链对答案的约束随模型相对任务难度而变化

    论文用单步扰动、截断并强制续写,测试思维链对最终答案的单向因果约束;这一“承重性”不等同于完整机制忠实性。在所测Gemma、Llama及DeepSeek蒸馏模型和正确多步基线中,旁路、自我修正与错误传播的比例随任务和模型条件变化,条件内比较支持模型相对难度的重要作用。序贯分解中的98.8%仅指特定分桶与进入顺序下已解释离差的难度项占比。DeepSeek与其他模型的差异不能单独证明后训练的因果效应;隐状态探针可读出行为模式,但被测试的加性干预只能部分改变错误传播。

    推荐理由论文用扰动续写实验量化思维链对答案的因果约束,并给出难度主导的方差分解,为思维链监控的适用边界提供可迁移方法。

  3. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文18

    DeepSeek Elastic Compute(DSec):面向大规模智能体训练的高效沙箱基础设施

    DeepSeek 发布生产级沙箱平台 DSec,通过统一 SDK 提供 FnCall、容器、microVM 和 full-VM 四类沙箱后端,并与强化学习框架协同设计,将带状态的 rollout 执行与可抢占的 GPU 训练解耦,同时缓解奖励作弊等智能体失范行为。单个生产单元约 160 个节点,每天服务约 300 万个沙箱,支持超 38 万个并发沙箱、每秒超 5000 次沙箱创建,镜像数据按需从 3FS 分布式文件系统加载。

  4. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文6

    RULER:面向 SVG 生成的实例感知评分标准奖励

    RULER 用实例感知评分标准为 SVG 生成提供强化学习奖励,无需配对 SVG 真值或人类偏好标注。它把每条指令转成覆盖语义、视觉、风格三个维度的六项评分标准,由 judge VLM 对渲染结果逐项打分,加权满意度经 GRPO 优化。在 MMSVG-Illustration 和 MMSVG-Icon 上,评分从 0.432/0.395 提升至 0.693/0.683,超过专用 SVG 模型并追平更大的 DeepSeek-V3。

  5. arXiv:可解释性 · 收录 · 原文 论文43

    ARIA:用稀疏自编码器实现测试时机器遗忘

    作者提出 ARIA(autoencoder-gated inference-time unlearning),一种不改动模型权重的测试时遗忘方法,只在生成进入遗忘相关状态时门控对目标知识的访问。ARIA 用稀疏自编码器(SAE)潜变量训练轻量线性检测器,再对触发状态施加可解释的干预,测试时开销可忽略。在 TOFU、R-TOFU 和 WMDP 上,ARIA 在思考模型 DeepSeek-R1-Distilled-Qwen-1.5B 与指令模型 Gemma-3-1B-it 上均改善了遗忘与保留的权衡,例如显著降低 WMDP-cyber 遗忘集准确率,同时 MMLU 与遗忘前模型相差在 1% 以内。

  6. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    FUSE:面向大语言模型危险能力的模块化评测框架

    研究者提出 FUSE 模块化评测框架,通过知识(K)、防御(D)、危害(H)三条正交管线在统一协议下评测模型,并汇总为标准化危险能力画像 φ。框架以可插拔模块提供场景种子、知识库、危害查询和评判标准,核心评测引擎跨领域保持不变,化学-生物(CB)评测之外还以网络安全试点验证协议可迁移性。用 CB 模块实例化后,研究评测了来自四个模型家族的 12 个商用大语言模型,发现三个维度暴露出差异明显的画像:知识水平相近的模型在拒答韧性上不同,防御强的模型在配合时也未必生成更少有害内容,家族层面还能区分 Claude、DeepSeek 和 GPT 模型。