跳到正文

危险能力 · 精选

10月9日 · 周五

危险能力 · 精选

今天 3 条进了精选
今天10月9日周五
  1. CERT PolskaCERT Polska · 67

    CERT Polska:Ollama 路径穿越漏洞可致 root RCE

    CERT Polska 披露 Ollama 存在路径穿越漏洞 CVE-2026-103663,影响 0.34.2 至 0.35.0 版本,已在 0.35.0 修复。漏洞位于 /api/pull 端点,digestToPath 函数对 layer digest 校验不足,未认证的远程攻击者可将路径穿越序列作为 layer digest 传入,把恶意二进制文件写到模型存储目录之外。若服务进程对 /usr/lib/ollama 有写权限,攻击者可借此实现 root 远程代码执行。

  2. Anthropic Research、Anthropic 等 4 个来源Anthropic Research 等 4 个来源 · 4 篇报道 · ↑358

    Anthropic推出开源漏洞扫描服务OSS Scanner

    Anthropic 启动长期计划 Anthropic Cyber Mission,聚焦关键基础设施与开源软件两大方向。关键基础设施方面,Critical Infrastructure Defense Program 向电力、水务、交通等运营技术防御方提供前沿 Claude 模型、驻场工程师与威胁研究,创始合作伙伴包括 CrowdStrike、Dragos、Palo Alto Networks、Rockwell Automation 等。开源软件方面,Anthropic 推出 OSS Scanner,一个可选加入的漏洞扫描服务,由该公司最强模型免费为加入项目定期做安全扫描;过去六个月,Anthropic 用最新模型扫描重要软件项目,发现超过 29,000 个候选漏洞,仅人工复核约 6,000 个,并在维护者要求下直接发送近 5,000 份未经人工验证的报告。该服务输出完全由模型生成,不做人工复核或分诊,报告可能不准确;Anthropic 还请专家渗透测试人员进行了核查。CyberScoop 报道称,该关键基础设施防御计划将 Claude 模型、自家工程师与威胁研究同 Accenture、Booz Allen、CrowdStrike、Deloitte、Dragos、Hitachi、Nozomi Networks、Palo Alto Networks、PwC、Rockwell Automation 等网络安全公司的专业能力结合,用于发现并修复关键基础设施和开源软件中的安全漏洞。The Verge AI 报道称,选择加入的开源项目将获得由 Anthropic 最强模型进行的全面、定期安全扫描,且不收取费用,这可能让开源项目更早收到潜在安全问题提醒,但报道提到该服务存在取舍。

  3. Goodfire Research、TechCrunch AIGoodfire Research 等 2 个来源 · 2 篇报道 · ↑150

    Goodfire 部署生产级模型内部监控

    Goodfire 发布“由内而外”监控器,通过 Baseten 向客户提供,可在智能体运行中实时读取模型内部激活信号,由探针触发二次核查,客户可选监控攻击性黑客、化生武器滥用和奖励作弊等风险。在 Kimi K3 上测试约 1,500 次会话,监控成本约 51 美元,而用廉价模型逐步检查需 233 美元、顶级模型约 10,000 美元;探针捕获 94% 的恶意黑客会话,并把 8.7% 的无害会话送去复核。Goodfire 另为 Kimi K3 和 GLM 5.3 构建基于探针的网络安全监控系统,部署在生产推理栈上,探针作为一线过滤器,只把可疑交互升级给 LLM 裁判。该级联在 5.5% 良性会话中断率下达到约 93% 召回,成本低于每百万次交互 200 美元,比逐轮调用裁判便宜约 50 倍,且不增加推理延迟。在 FAR.AI 为期两天、基于 140 个越狱策略的静态红队测试中,启用监控后通用越狱从 66 个降到 0 个。

10月8日周四
  1. Kyunghyang Shinmun、Financial News Korea 等 21 个来源Kyunghyang Shinmun 等 21 个来源 · 27 篇报道 · ↑877

    韩国金融机构遭疑似AI辅助黑客攻击

    韩国多家金融机构接连遭网络入侵并泄露客户信息。10月4日金融监管机构召开紧急检查会议,新韩银行泄露25727条个人信息,国民银行、韩亚银行分别涉及119名、89名客户;后续报道称KB国民银行泄露153件、礼加拉姆储蓄银行4万余件、Welcome储蓄银行2200件,友利与NH农协银行防御成功。金融当局要求银行与卡公司6日、证券保险储蓄银行及电子金融业者8日前完成紧急自查。韩国总统李在明10月6日要求加快调查,警方以违反信息通信网法立案并组建28人专案组。调查人员在一台疑似攻击服务器上发现中文开源渗透测试系统ARTEX AI痕迹,但银行与监管部门未确认其使用,AI智能体作案仍属推定。CrowdStrike报告称9月底至10月初有攻击者用ARTEX配合大语言模型入侵,中国外交部回应称不了解具体情况。金融委员会委员长李亿元10月8日承认应对存在基本缺口,正研究调整网络分离监管。

    事件进展共 9 个进展
    1. 低估复查:韩国金融 AI 工具入侵升级为全行业事件——10-04 假日金融委紧急召集各行行长、李在明总统下令彻查;受害扩

    2. CrowdStrike称黑客用Claude Code攻击韩国金融业

    3. 韩国金融委推迟网络隔离例外项目遴选

  2. bytedance/UI-TARS-desktop · 60

    字节 Agent TARS 修复 agent-server 未鉴权远程命令执行漏洞

    字节 Agent TARS(UI-TARS-desktop)的 agent-server 存在未鉴权远程命令执行问题:会话创建时未过滤的 agentOptions 会被展开进 Agent 构造函数,调用方可覆盖 mcpServers(经 StdioClientTransport 启动本地进程)、aioSandbox(把沙箱部署降级为主机执行或重定向到攻击者 MCP 服务器)以及模型端点;服务端绑定所有网卡且无鉴权,因此构成未鉴权远程命令执行。相同注入还可经 runtimeSettings(未配置服务端 transform 时)和 agent-server-next 的 sessionInfo.metadata.agentOptions 触发。这是破坏性变更,依赖网络访问的部署需将 server.host 设为 0.0.0.0 或指定地址。

  3. Forever Security · 65

    Forever Security 用一个扩展劫持五款浏览器内置 Agent,获 2 万美元赏金与 2 个 CVE

    Forever Security 研究团队披露 BragJack 攻击,用一个普通 Chromium 扩展同时攻破 Gemini Live in Chrome、Perplexity Comet、Microsoft Edge Actions、Opera Neon 和 Claude in Chrome 五款浏览器内置 Agent,累计获得 2 万美元赏金并拿到 CVE-2026-0628 与 CVE-2026-55945 两个编号。攻击核心是 Prompt Forcing,借助 declarativeNetRequest 权限削弱 CSP 等安全响应头并重定向 JavaScript 资源,从而在特权上下文中执行代码,再直接向 Agent 下发指令。可达成的效果包括读取本地文件与浏览历史、获取浏览器配置文件信息、截取标签页截图,Gemini Live 场景下还可调用摄像头与麦克风。

  4. The Hacker News、CSA Labs ResearchThe Hacker News 等 2 个来源 · 2 篇报道 · ↑156

    GitLab 修复 AI Gateway 9.9 分命令执行漏洞

    GitLab 于 2026 年 10 月 2 日披露并修复自托管 AI Gateway 中的严重漏洞 CVE-2026-90970,CVSS 3.1 评分 9.9,归类为 CWE-1336(模板引擎特殊元素未被正确中和)。拥有 Duo Agent Platform 访问权限的已认证用户可通过特制 flow 配置逃逸提示词模板沙箱,在网关主机上执行任意命令。受影响版本为 18.1.6 至 19.2.3、19.3.0 至 19.3.2 之前版本;修复版本为 19.2.4、19.3.2 和 19.4.1,仅自托管网关的组织需要升级,使用 GitLab 托管网关的 GitLab.com 等不受影响。

    事件进展
    1. GitLab AI Gateway 模板注入沙箱逃逸 RCE

    2. GitLab 修复 AI Gateway 9.9 分命令执行漏洞

  5. Anthropic · 57

    Anthropic 发布 Claude Opus 5.5 System Card

    Anthropic 发布 Claude Opus 5.5 System Card,称该模型在编码、Agent 与计算机使用、数学与科学推理及长周期专业任务上较 Claude Opus 5 提升,部分评测追平或超过 Claude Fable 5.1 与 Claude Mythos 5.1。在 RSP 与 FCF 评估中,Anthropic 将 Opus 5.5 判定为具备 CB-1 能力但不具备 CB-2 能力,理由是其在开放式构想、文献表述可靠性和缺乏专业知识时的科学错误等弱点上未较 Mythos 5.1 改善,因此沿用与 Claude Fable 5 系列相同的扩展生物安全护栏。AI R&D 能力处于或略高于 Mythos 5.1,但远未达到替代其研究人员的水平,内部指标未显示持续的 AI 归因 2 倍开发加速,METR 外部测试结论一致。

  6. The News · 54

    巴基斯坦两起涉 AI 谋杀策划案:Claude 上报 FBI 后当地展开调查

    巴基斯坦两起青少年策划谋杀的案件中,涉案者曾向 Claude 咨询作案方案,Anthropic 将违规对话上报 FBI,FBI 随后通报巴方执法机构。其中卡拉奇一名 17 岁学生 9 月 1 日至 4 日与 Claude 讨论杀害一名警官之子,自称有可执行计划、将使用镇静剂并把尸体丢进下水道,还仿照剧集《嗜血法医》主角称自己有法医技能可以脱罪;他否认策划谋杀,称只是想写故事,因证据不足未被起诉,目前被监视。另一名巴哈瓦尔布尔 17 岁学生受《绝命毒师》影响对化学产生兴趣,搭建家庭实验室并从澳大利亚和伊斯兰堡获取化学品,试图用实验室级甲醇毒杀父亲未果,9 月 12 日向 Claude 询问为何未生效,被拒后转而使用 Grok 和 ChatGPT,只有 Claude 通知了 FBI;他获父亲谅解后已获准保释。

  7. GIGAZINE · 65

    Gambit Security 披露开源 AI 智能体自主攻击日本及海外电商,至少 27 家公司被入侵

    安全公司 Gambit Security 获取并调查攻击者的中继服务器后发现,Hermes、Strix、Cairn 三款开源 AI 工具被用于对电商网站的攻击,从漏洞探测、入侵、提权到窃取数据大部分由 AI 自主完成。三款工具分工明确:Strix 扫描目标网站寻找可入侵漏洞,Cairn 按“获取管理员权限”等目标自主尝试数小时,Hermes 负责调度攻击任务与后续操作,注册了 121 项技能。2026 年 8 月 23 日至 31 日,Strix 在 138 台主机上运行 146 次,195 小时内完成 633 小时的处理量;9 月 10 日至 15 日启动 105 个 Cairn 攻击项目,至少 27 家公司被确认遭到某种程度的入侵,部分攻击在一天甚至数小时内完成。该报告为初步评估,实际攻击规模和损失可能更大。

  8. Rep. Nathaniel Moran · 53

    Moran 提出 AI Incident Reporting Act,要求前沿模型危险事件及时上报

    美国众议员 Nathaniel Moran 于 6 月 25 日提出 AI Incident Reporting Act,要求最先进 AI 模型的开发者向商务部报告危险能力、安全漏洞和安全事件。法案规定由商务部认定达到能力阈值、足以对国家安全或公共安全构成重大风险的模型,开发者须在发现危险活动后 7 天内提交报告;对模型可自主自我改进或对公共安全构成严重风险等最严重事件,商务部须在 48 小时内通知国会领导层及相关委员会主席。可上报事件包括模型试图规避人类监督或抵制关停、模型权重遭未授权访问或窃取、可用于对关键基础设施发动攻击性网络攻击的能力,以及化学、生物、放射、核与爆炸物相关风险。法案要求商务部与 AI 开发者、学术研究者、网络安全专家和国家安全官员协商制定上报阈值,并包含敏感、涉密信息的保护条款和跨机构共享安排。该法案已由众议员提出并转交相关委员会审议,尚未通过。

  9. U.S. Congress · 57

    美国众议院提出《AI 事故报告法案》,要求模型开发者 7 天内上报严重风险事件

    美国众议员 Moran 于 2026 年 6 月 25 日在众议院提出 H.R. 9477《AI 事故报告法案》,要求商务部长在法案生效后 180 天内制定规则,按能力等阈值指定受涵盖模型与开发者。受涵盖开发者在知悉或合理相信发生应报告活动后 7 天内须向商务部长提交详细报告,面临紧迫或持续严重风险时需加快上报,并随后补充材料信息。应报告活动包括模型试图规避人类监督、欺骗评测者或操作者、绕过护栏、抵抗关机或修改、未授权获取工具或权限,以及模型权重被窃取或外泄、可实质助推攻击性网络行动的能力、无提示下加速 AI 研发的能力、可助推化学生物放射核爆炸武器开发的能力,以及仅因开发者控制措施之外的因素才未造成严重风险的侥幸情形。该法案已提出并转交众议院能源和商务委员会,尚未通过。

  10. AWS SecurityAWS Security · 2 篇报道 · 46

    AWS 发布 AI 漏洞分诊 steering 文件配置指南

    AWS 安全团队发布 AI 漏洞分诊 harness 的配置指南,用 steering file 把团队分诊方法论固化为模型每次会话加载的持久指令。指南给出五个关键配置段:先做结构验证,要求确认文件、函数、数据流和调用路径存在后再报告发现;用二元信号加权公式替代模型自报置信度,其中污点确认权重 0.30;解析 IaC 并按控制类型施加乘数,攻击阻断控制可叠加且下限为 0.15;接入 CISA KEV、EPSS 和公开 PoC 信号。同一时间,AWS 还介绍了一套三层流水线,把漏洞扫描器产生的大量候选发现收敛为少量带证据的高优先级问题:第一层用多扫描器一致性判断可信度,第二层借助代码抽象语法树验证扫描器描述的函数、文件与数据流是否真实存在,第三层结合 CloudFormation、Terraform 等 IaC 模板评估 WAF、网络隔离、认证等控制措施能否被绕过。作者强调该架构与具体工具无关,可替换自有扫描器和模型。

  11. Anthropic Red Teaming · 59

    Anthropic 发布 LLM ATT&CK Navigator,映射 832 个账号的 AI 网络攻击行为

    Anthropic 红队发布 LLM ATT&CK Navigator,将 2025 年 3 月至 2026 年 3 月间因违反使用政策被封禁的 832 个账号的恶意活动映射到 MITRE ATT&CK 框架,共记录 13,873 次恶意行为,覆盖全部 14 个战术和 482 个子技术。研究提出 AI Risk Enablement Score(ARiES)风险评分,从威胁、漏洞利用和影响三个维度给出 0 至 100 分。数据显示,中高风险行为者占比从研究前半年的 33% 升至后半年的 56%,增长约 1.7 倍,且集中在横向移动、凭据转储和 web shell 等后期攻击阶段。研究还指出,访问平台(API 或 Claude Code 等)与风险高低无关,目前区分最高风险行为者的是其向模型请求的具体技术;Anthropic 预计随着 AI 网络技术普及,未来的区分因素将变为其围绕模型搭建、可自主串联攻击阶段的脚手架。

  12. OpenAI Deployment Safety、OpenAI 等 7 个来源OpenAI Deployment Safety 等 7 个来源 · 7 篇报道 · ↑669

    OpenAI 全球上线 GPT-6 与 Intelligent UI

    OpenAI 在全球 ChatGPT 上线 GPT-6,并推出 Intelligent UI 新界面,将可点击按钮、定制计算器、交互式图表和可编辑图形等视觉交互元素引入对话,回答格式随问题自动调整,还可在对话内生成储蓄计算器、小游戏等小工具;Pro、Plus、Business 和 Enterprise 用户全球可用,免费与 Go 档用户次日可用。付费用户使用 GPT-6 Sol,免费用户使用 GPT-6 Luna;GPT-6 支持在“思考”过程中同步作答。后续报道称,GPT-6 已开始向免费和 Go 用户推送,用 GPT-6 Luna 替换此前的 GPT-5.6 Luna。另有报道称,OpenAI 的 GPT-6 报告指出青少年安全退步。

    事件进展
    1. OpenAI的GPT-6报告指出青少年安全退步

    2. OpenAI 发布 GPT-6 Sol/Luna 部署安全更新

    3. OpenAI 全球发布 GPT-6 与 Intelligent UI

  13. Anthropic Research、Anthropic 等 7 个来源Anthropic Research 等 7 个来源 · 7 篇报道 · ↑663

    Anthropic 发布 Claude Haiku 5.5 小模型

    Anthropic 发布 Claude Haiku 5.5,称其为迄今最快、最便宜且能力最强的小模型,运行成本比 Haiku 4.5 平均低约 75%,10 万 token 以内输入/输出价格为 $0.10/$0.50 每 1M token,超 100K 后为 $0.50/$2.50。它是首个支持可调 effort 设置与自适应思考的 Haiku 级模型,可作 Opus 5.5 和 Sonnet 5.5 的子智能体。Artificial Analysis 智能指数得分 43,比上一代发布一年后提升 26 分。官方 benchmark 显示 OSWorld 2.1 Max 档达 72.4%,超过 GPT-6 Luna,并超越 DeepSeek-V4.1 Flash 等成为新的小模型守门员。System Card 从 RSP、网络安全、护栏与无害性、Agent 安全、对齐、模型福祉和能力七方面报告部署前评测:整体能力低于 Opus 5,未跨过 CB-2 或 Autonomy-2 阈值,但达到 CB-1 和 Autonomy-1 阈值并应用相应缓解措施。抗提示注入能力为 Haiku 系列最强,编码与计算机使用环境自适应攻击测试中抵抗力基本追平前沿模型,Claude Code 拒答率从 66.6% 升至 84.3%,计算机使用场景从 58.9% 升至约 82.6%;网络安全护栏比 Haiku 4.5 更严格,但比 Sonnet 5.5 等近期模型宽松,仍阻止渗透测试。后续报道指出,该模型支持 100 万 token 上下文,Terminal-Bench 4.0 仅得 39.2%,远低于 Sonnet 5.5 的 70.6%,Anthropic 仍建议复杂编程任务使用更强模型。

    事件进展
    1. Anthropic 发布 Claude Haiku 5.5 系统卡

    2. Anthropic 发布 Claude Haiku 5.5 小模型

  14. Euronews · 55

    欧盟在申请三个月后获准测试 Anthropic 的 Mythos 5

    欧盟网络安全局 ENISA 已获得 Anthropic 最强模型 Mythos 5 的访问权限并正在测试,欧委会科技主权发言人 Thomas Regnier 确认了这一消息。Mythos 5 于 4 月发布预览版,能以前所未有的速度识别和利用网络漏洞,Anthropic 因此通过与美国政府合作的 Project Glasswing 项目限制访问,合作伙伴从 4 月的约 50 家扩大到 6 月的约 200 家。美国政府随后出台出口管制措施,禁止全球非美国用户访问,包括 Anthropic 在美国境外的自家员工,欧委会质疑此举是否歧视可信伙伴,并担心华盛顿可能对最新美国技术启动“kill switch”。Regnier 还表示,ENISA 此前已获得 OpenAI 的 GPT-5.6-Cyber 和 GPT-6 Astra 的访问权限。

10月7日周三
  1. AI Weekly · 57

    WSJ 报道 Swarmchasers:400 人 Discord 社群追踪失控 AI 智能体

    AI Weekly 转述《华尔街日报》对 Swarmchasers 志愿者网络的报道:该 Discord 社区约有400名成员,搜集疑似异常智能体活动的记录。报道列举多个研究团体掌握的消息、搜索记录和运行痕迹,并介绍 OpenAI 对其自身日志的排查及通知受影响机构的说法。这些资料来自不同调查,部分活动的 AI 归因尚未获相关企业完整确认,不能把所有记录都视为已证实的攻击。

  2. Omniscient MediaOmniscient Media · 65

    GPT-6 Astra系统卡可监测性限制分析

    Omniscient Media 分析 GPT-6 Astra 系统卡中的思维链可监测性与推理摘要可用性限制,并提到该模型被列为首个 Critical 网络安全模型,默认配置仅完成 2.4% 漏洞利用。报道指出,这一比例涉及特定评测环境,不能据此推断生产环境中的普遍缺失比例。

  3. CiscoCisco · 55

    Cisco 发布 VLoc Bench 评测 Agent 漏洞定位能力

    Cisco 发布 VLoc Bench,用于评测 Agent 在仓库规模下定位漏洞代码的能力:任务只给 CWE 描述和真实仓库的只读访问权限,不含公告文本、CVE 编号、修复提交或文件提示。该基准覆盖 290 个仓库、六个包生态和 147 个 CWE 类别的 500 个真实漏洞,每个任务包含修复前定位与修复后确认漏洞已消失两个阶段,以区分理解代码、定位漏洞代码和验证修复三种能力。在统一提示词、只读工具和命令预算下评测 27 个语言模型和 Agent。