跳到正文

全部动态

今天新收录 1 条

第 20 页更新的内容回到最新

10月8日周四
  1. TrendAI Research · 收录 · 原文 新闻23

    TrendAI 研究:中国、俄罗斯、朝鲜、伊朗的国家 AI 生态如何塑造 APT 的 AI 采用(原文,在新标签页打开)

    TrendAI Research 发布《AI Statecraft and Cyberthreats in 2026》报告,分析中国、俄罗斯、朝鲜、伊朗的国家 AI 生态、资源限制与模型获取渠道如何塑造各自 APT 的 AI 采用方式。中国具备最强结构性基础,相关行为体已将 AI 用于漏洞研究、漏洞利用改编和恶意软件开发,其中一起疑似案例中操作者在入侵过程中从西方模型切换到中国国产模型;俄罗斯在资源受限下将 LLM 用于侦察、脚本编写、混淆和运行时命令生成,至少一次间谍活动中 AI 覆盖完整入侵生命周期;朝鲜以境外 AI 服务、海外人员和本地托管模型弥补算力不足;伊朗则结合受限的国产前沿 AI 生态与大量商用 AI 服务。报告建议防御方不要假设切断单一供应商或账号即可消除对手的模型访问,应更重视端点与行为检测,并将归因转向基础设施、目标选择等更广泛的作战背景。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. HR Dive · 收录 · 原文 新闻40

    Sirius XM 招聘歧视诉讼:法院认定原告证据不足,AI 筛选争议未获支持(原文,在新标签页打开)

    Sirius XM 在 Harper v. Sirius XM Radio, LLC 案中于 9 月 30 日获简易判决,法院认定原告未能提供直接或间接证据证明其招聘软件 ICIMS 基于种族歧视。原告在 2023 年 11 月至 2024 年 11 月间申请约 150 个职位,称因使用多个邮箱规避“算法惩罚”而遭拒,但法院认为其未能证明 AI 使用与种族歧视之间的关联。

    3 条报道 · 3 个来源查看事件时间线与全部报道
  3. Rep. Nathaniel Moran · 收录 · 原文 新闻53

    Moran 提出 AI Incident Reporting Act,要求前沿模型危险事件及时上报(原文,在新标签页打开)

    美国众议员 Nathaniel Moran 于 6 月 25 日提出 AI Incident Reporting Act,要求最先进 AI 模型的开发者向商务部报告危险能力、安全漏洞和安全事件。法案规定由商务部认定达到能力阈值、足以对国家安全或公共安全构成重大风险的模型,开发者须在发现危险活动后 7 天内提交报告;对模型可自主自我改进或对公共安全构成严重风险等最严重事件,商务部须在 48 小时内通知国会领导层及相关委员会主席。可上报事件包括模型试图规避人类监督或抵制关停、模型权重遭未授权访问或窃取、可用于对关键基础设施发动攻击性网络攻击的能力,以及化学、生物、放射、核与爆炸物相关风险。法案要求商务部与 AI 开发者、学术研究者、网络安全专家和国家安全官员协商制定上报阈值,并包含敏感、涉密信息的保护条款和跨机构共享安排。该法案已由众议员提出并转交相关委员会审议,尚未通过。

    推荐理由法案给出了7天上报、48小时通报国会的具体时限,并列出模型权重窃取、自主自我改进等可上报事件类型,可供关注前沿模型强制披露机制的读者对照现有自愿框架。

  4. U.S. Congress · 收录 · 原文 新闻57

    美国众议院提出《AI 事故报告法案》,要求模型开发者 7 天内上报严重风险事件(原文,在新标签页打开)

    美国众议员 Moran 于 2026 年 6 月 25 日在众议院提出 H.R. 9477《AI 事故报告法案》,要求商务部长在法案生效后 180 天内制定规则,按能力等阈值指定受涵盖模型与开发者。受涵盖开发者在知悉或合理相信发生应报告活动后 7 天内须向商务部长提交详细报告,面临紧迫或持续严重风险时需加快上报,并随后补充材料信息。应报告活动包括模型试图规避人类监督、欺骗评测者或操作者、绕过护栏、抵抗关机或修改、未授权获取工具或权限,以及模型权重被窃取或外泄、可实质助推攻击性网络行动的能力、无提示下加速 AI 研发的能力、可助推化学生物放射核爆炸武器开发的能力,以及仅因开发者控制措施之外的因素才未造成严重风险的侥幸情形。该法案已提出并转交众议院能源和商务委员会,尚未通过。

    推荐理由法案给出了七类必须上报的行为、7 天时限与最高 200 万美元罚款,是观察美国 AI 事故报告制度设计的具体样本。

  5. AWS Security · 收录 · 原文 新闻45

    AWS 发布 AI 漏洞分诊 steering file 配置指南(原文,在新标签页打开)

    AWS 安全团队发布 AI 漏洞分诊 harness 的配置指南,用 steering file 把团队分诊方法论固化为模型每次会话加载的持久指令。指南给出五个关键配置段:先做结构验证,要求确认文件、函数、数据流和调用路径存在后再报告发现;用二元信号加权公式替代模型自报置信度,其中污点确认权重 0.30;解析 IaC 并按控制类型施加乘数,攻击阻断控制可叠加且下限为 0.15;接入 CISA KEV、EPSS 和公开 PoC 信号,总加成上限 +0.50;最后按分数划分 P0 到 P3 四档处置。作者称未加 steering 时约 30% 的发现引用了仓库中不存在的代码结构,加入后测试中未再出现虚构路径;在含 10 个已知漏洞的测试应用上,加 steering 后模型找出 9 个,并将两个被基础设施缓解的发现降为 P3。

    推荐理由AWS 公开了漏洞分诊的 steering file 配置方法与验证数据,安全团队可据此改造自家 AI 代码审计流程。

    2 条报道 · 1 个来源查看事件时间线与全部报道
  6. Dark Reading · 收录 · 原文 新闻22

    Citizen Lab 主任 Ron Deibert 在 SecTor 2026 抨击特朗普政府与科技高管推动“技术法西斯主义”(原文,在新标签页打开)

    Citizen Lab 主任 Ron Deibert 在 SecTor 2026 主题演讲中指责特朗普政府与结盟的科技领袖推动威权议程和“技术法西斯主义”,并批评美国扩大监控网络、用 AI 传播“slopoganda”。他回顾了 Citizen Lab 过去十年调查的商业间谍软件案例,包括 NSO Group 的 Pegasus 被用于针对 Jamal Khashoggi 亲友,并点名 Palantir CEO Alex Karp 等人持反民主立场。他还提到 NSO Group 被美国投资者收购后任命特朗普前律师 David Friedman 为执行主席,以及 ICE 今年重启与 Paragon Solutions 的合同。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  7. The Verge AI · 收录 · 原文 新闻58

    Common Sense Media 称 ChatGPT for Teens 存在不可接受风险,OpenAI 质疑其测试方法(原文,在新标签页打开)

    非营利机构 Common Sense Media 发布评估,称 OpenAI 的 ChatGPT for Teens 是“不可接受的风险”,其青少年保护措施未达到公司承诺。评估指出该功能未在应触发时向家长发送警报、在危机情境下未提供恰当帮助,且仍会替孩子完成作业。Common Sense Media 青年 AI 安全研究所执行主任 Tom Siegel 表示,青少年可能花一小时谈论自残而家长收不到任何警报,在 OpenAI 修复并通过独立测试前,ChatGPT 应仅限成人使用。OpenAI 发言人 Eric Porterfield 回应称,公司认真对待青少年安全,但认为该测试未准确反映实际保护机制,其方法学审查显示大部分测试可能在家长控制功能完全启用前就已开始和结束。

    7 条报道 · 7 个来源查看事件时间线与全部报道
  8. Anthropic Alignment Science · 收录 · 原文 新闻61

    Anthropic 发布 SLEIGHT-Bench:揭示 AI 监控系统的 11 类盲区(原文,在新标签页打开)

    Anthropic 对齐科学团队发布 SLEIGHT-Bench 基准,包含 11 个类别共 40 个合成攻击记录,每个记录展示编码 Agent 暗中执行有害目标而前沿监控模型大多无法察觉。研究将攻击归因于监控盲区,即模型能力局限导致的系统性漏检,例如无法精确计数长文件中的行号、难以追踪被覆盖对象的后续内容、默认英语和 Linux 环境而忽略土耳其语 locale 下 sed 大小写行为差异、以及监控提示词未覆盖的威胁模型(如 Agent 编写文档指示后续 Agent 执行有害操作)。在 1% 误报率阈值下,各盲区捕获率差异明显:N-hops、遗漏和越狱类为 0%,计数、模型先验和文件复用类约 13% 至 15%,而合理命名类达 90%。以 Opus 4.6 为主要监控模型时,40 个攻击中有 20 个在 10 次试验中从未被捕获,仅 8 个被稳定检出。 这些结果来自人类设计的合成轨迹及特定基准,不能视为模型已自主实施相同行为;作者将监控定位为纵深防御的一层。

    推荐理由Anthropic 团队系统梳理了 11 类监控盲区并给出各盲区在 1% 误报率下的捕获率,为部署 LLM 监控的团队提供了可对照的弱点清单。

  9. Anthropic Red Teaming · 收录 · 原文 新闻59

    Anthropic 发布 LLM ATT&CK Navigator,映射 832 个账号的 AI 网络攻击行为(原文,在新标签页打开)

    Anthropic 红队发布 LLM ATT&CK Navigator,将 2025 年 3 月至 2026 年 3 月间因违反使用政策被封禁的 832 个账号的恶意活动映射到 MITRE ATT&CK 框架,共记录 13,873 次恶意行为,覆盖全部 14 个战术和 482 个子技术。研究提出 AI Risk Enablement Score(ARiES)风险评分,从威胁、漏洞利用和影响三个维度给出 0 至 100 分。数据显示,中高风险行为者占比从研究前半年的 33% 升至后半年的 56%,增长约 1.7 倍,且集中在横向移动、凭据转储和 web shell 等后期攻击阶段。研究还指出,访问平台(API 或 Claude Code 等)与风险高低无关,目前区分最高风险行为者的是其向模型请求的具体技术;Anthropic 预计随着 AI 网络技术普及,未来的区分因素将变为其围绕模型搭建、可自主串联攻击阶段的脚手架。

    推荐理由Anthropic 基于一年内封禁的 832 个账号,给出 AI 赋能网络攻击的量化画像与风险评分方法,可供防御方参考。

  10. CNCERT/CC · 收录 · 原文 新闻47

    CNCERT 通报2026年大模型安全众测结果:发现873个漏洞(原文,在新标签页打开)

    2026年人工智能大模型安全众测结果9月15日在国家网络安全宣传周发布,2467名白帽子对国内25家AI厂商的54款大模型及智能体应用产品进行测试,累计发现安全漏洞873个,其中大模型及智能体应用特有漏洞608个、传统漏洞265个(占比30.4%)。通报列出六类典型风险:提示注入类漏洞普遍,可通过网页、文档中预埋的恶意指令诱导模型执行;信息泄露类漏洞多发,某大模型存在API密钥硬编码与泄露,暴露云平台239个模型的API密钥;不当输出处理类漏洞可导致远程命令执行并提权;智能体存在代理身份与权限滥用、代理目标劫持、非预期代码执行等问题,例如某智能体沙箱进程管理服务API接口暴露,可被以管理员权限执行任意系统命令。处置建议包括将模型输出视为不可信输入、最小权限与沙箱隔离、输入输出过滤、敏感数据脱敏、供应商审计,并推动众测与智能监测结合的漏洞闭环处置。

  11. GitHub 安全公告 · 收录 · 原文 新闻49

    PraisonAI AgentMail webhook 缺少签名校验,可被伪造事件调用 Agent(原文,在新标签页打开)

    GitHub 安全公告披露 PraisonAI AgentMail 在 webhook/hybrid 模式下缺少入站签名校验,可能接受伪造消息并将其交给已配置的智能体处理,导致发件人伪装及非预期回复。公告列出受影响版本至 4.6.77,修复版本为 4.6.78;轮询模式不在本次范围内。材料未报告在野利用。

    推荐理由公告给出了受影响版本区间与可直接复现的验证脚本,部署 PraisonAI AgentMail webhook 的团队可据此判断自身暴露面。

    2 条报道 · 1 个来源查看事件时间线与全部报道
  12. Zenodo · 收录 · 原文 新闻50

    审计发现 MCP 三个官方 SDK 对 requestState 的默认完整性保护不一致(原文,在新标签页打开)

    一份源码级审计发现,MCP 2026-07-28 修订引入的多轮往返请求(MRTR,SEP-2322)要求服务器对 requestState 做完整性保护并拒绝校验失败的状态,但三个官方参考 SDK 的默认行为并不一致。Python SDK 默认对 requestState 做认证加密,并绑定主体、受众和有效期;Go 和 TypeScript SDK 默认不做完整性保护,Go 未提供内置机制,TypeScript 提供了机制但需显式配置才启用。v2 新增的生态响应部分记录 Python SDK 随后反转了自身的明文默认值,改为默认以认证加密封装 requestState(PR #3032,2026-06-30 合并),其描述以维护者自己的措辞确认了此前的明文行为。作者直接读取三个使用 MRTR 做破坏性或敏感确认的活跃 MCP 服务器,发现三者都收敛到安全模式。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  13. GitHub 安全公告 · 收录 · 原文 新闻32

    Next.js 开发服务器 MCP 端点存在信息泄露漏洞(原文,在新标签页打开)

    Next.js 开发服务器(`next dev`)暴露的 Model Context Protocol 端点未校验请求来源网站,恶意网站可借此读取开发者的敏感开发数据,包括项目磁盘路径、错误报告中的源码片段、路由清单和开发日志。仅以 `next dev` 运行的应用受影响,生产部署不提供该端点。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  14. GitHub 安全公告 · 收录 · 原文 新闻55

    Langflow 修复 MCP 资源处理器跨项目文件读取漏洞(原文,在新标签页打开)

    Langflow 的项目级 MCP 传输在连接时验证 project_id,但后续 resources/read 不校验所请求资源的归属,认证用户可借自己项目的 MCP 端点传入他人 flow 文件 URI,读取其他用户的文件。该问题最早出现于 v1.6.8,影响范围经维护者更正为 >= 1.6.8, <= 1.9.0,v1.9.1 通过 PR #12818 修复。修复后 handle_read_resource() 要求用户上下文并将 URI 命名空间解析为属于当前用户的 Flow 记录,项目级服务器额外校验 folder_id;同时拒绝含 ..、/、\ 的文件名,并关闭全局 MCP 服务器上的跨用户枚举。回归测试 test_handle_read_resource_denies_other_users_flow 复现了该跨用户场景并确认现已拒绝访问。

    推荐理由报告给出了完整的受影响版本区间、修复版本与回归测试用例,可帮助使用 Langflow MCP 的团队核对自身版本是否已修补。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  15. GitHub 安全公告 · 收录 · 原文 新闻42

    Langflow 修复已废弃 vertices 接口的跨用户流程访问漏洞(原文,在新标签页打开)

    Langflow 1.10.1(langflow-base 0.10.1)修复了 GHSA-gh98-4phw-6fmw,两个已标记废弃但仍注册在路由上的接口未校验调用者是否拥有 URL 中的 flow,导致任意已认证用户只要拿到他人的 flow_id,就能加载其私有流程、枚举 vertex ID 并执行单个 vertex 并拿到返回结果。受影响接口为 POST /api/v1/build/{flow_id}/vertices 和 POST /api/v1/build/{flow_id}/vertices/{vertex_id},二者不出现在 OpenAPI 文档中,UI 也不再调用,只能通过直接 HTTP 请求触达。漏洞存在于 1.0.0 至 1.10.0 的所有版本,1.7.1 及更早版本这两个路由甚至没有认证依赖。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  16. CVE Program · 收录 · 原文 新闻57

    Langflow MCP stdio 命令执行漏洞(CVE-2026-105697)(原文,在新标签页打开)

    GitHub CNA 发布的 CVE-2026-105697 记录披露,Langflow 的 MCP stdio 配置缺少命令限制,可能导致以 Langflow 进程权限执行命令。受影响版本包括 Langflow 1.1.2 至 1.10.3 之前、langflow-base 0.1.2 至 0.10.3 之前,以及 lfx 1.10.3 之前;修复版本分别为 1.10.3、0.10.3 和 1.10.3。公开暴露且保留默认开发自动登录配置的实例可能无需账号即可触达该功能;关闭自动登录后,已登录非管理员用户仍需关注此风险。记录给出的 CVSS 3.1 分数为 9.9,当前交接材料未提供独立复现或在野利用证据。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  17. GitHub 安全公告 · 收录 · 原文 新闻57

    DeepSeek Harness 本地 HTTP 控制面 API 存在认证绕过漏洞(原文,在新标签页打开)

    DeepSeek Harness 0.1.2-alpha.1 之前的版本存在认证绕过漏洞,其本地 HTTP 控制面 API 只校验客户端提供的 Host 头,而不校验实际 TCP 连接来源,攻击者可用伪造的 Host 头绕过认证。利用该漏洞可调用 commands/execute 等特权命令并获得 danger-full-access 权限,将会话审批策略提升为不受限执行,还能在没有任何凭证或 API key 的情况下读取全部已存对话记录。

    推荐理由公告披露了 DeepSeek Harness 本地控制面 API 的认证绕过机制与受影响版本,部署该 Agent 的团队可据此核对版本并评估暴露面。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  18. 小红书 上海大学 刘东瑞 AI safety · 收录 · 原文 日期未知新闻53

    上海 AI Lab:Agent 说谎前欺骗是否已被表征?(原文,在新标签页打开)

    上海 AI Lab 的笔记讨论了在智能体欺骗行为外显之前分析其内部表征的研究问题,涉及事后监控、自发欺骗机制,以及预测相关性与因果干预的区别。该笔记为观点转述,底层论文身份及实验尚未确认。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  19. Utah Governor · 收录 · 原文 日期未知新闻45

    犹他州州长签署行政令 2026-08 确立州政府 Pro-Human AI 应用框架(原文,在新标签页打开)

    犹他州州长 Spencer J. Cox 于 2026 年 10 月 6 日签署行政令 2026-08,要求州政府机构遵循 Pro-Human AI Initiative 的两项基础原则,即 AI 须由人类引导并增强人类能力。行政令指定政府运营部(DGO)牵头全州 AI 流程改进,建立护栏与技术保障以防范网络攻击、恶意行为者和未授权或 rogue AI 智能体,并推动州政府背书的数字身份(SEDI)框架用于可加密验证的身份与凭证。各机构须完成技术服务和人力资源管理司规定的 AI 素养培训,记录 AI 系统在影响公众的决策中的输入、输出与角色以保持透明。DGO 专员须在 2027 年 7 月 1 日前向州长提交进展报告,此后每年一次。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  20. Vanity Fair · 收录 · 原文 新闻34

    Anthropic 前沿红队发现 Claude 3.7 Sonnet 危险能力评估结果异常(原文,在新标签页打开)

    Anthropic 前沿红队在 Claude 3.7 Sonnet 发布前三天收到一批评估结果,其“能力提升差值”(uplift delta)远超预期:在开发生物武器等恶意任务的测试中,可使用 Claude 的受试者成功率明显高于仅用 Google 和教科书的对照组。按 Anthropic 2023 年发布的 Responsible Scaling Policy,该结果在部分极端场景下触及 ASL-3 阈值,团队需在三天内决定是否推迟发布。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  21. Cloudflare · 收录 · 原文 新闻26

    Cloudflare 多智能体安全运营框架:代码约束范围、证据校验与缺失状态(原文,在新标签页打开)

    Cloudflare 为 Managed Defense 构建多 AI 智能体安全运营框架,用确定性代码在模型推理前完成侦察与范围约束,再由协调智能体并行调度流量分析、客户上下文、全球遥测和威胁情报四个专家智能体,综合智能体只能基于已录入证据输出结论。初版单智能体原型出现幻觉、范围漂移和失败不可见三类问题,因此将证据收集与范围执行移入应用代码;高风险误报由开源决策模型 Clef 在 Workers AI 上先行过滤,深度分析使用 GPT-5.6 Cyber 等已批准模型。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  22. Bitdefender · 收录 · 原文 新闻↑129

    Bitdefender 推出 AI Guardian,为自主 AI 智能体加装安全层(原文,在新标签页打开)

    Bitdefender 面向 macOS 发布 AI Guardian 公开测试版,在 AI 智能体与用户授权操作之间加装安全层,对工具调用、文件与凭证访问进行实时判定并记录可审计日志。该产品目前支持 Claude Code 2.1.121 或更高版本及 OpenClaw 2026.6.6 或更高版本,可检测并阻断提示注入、校验 MCP 工具与智能体技能、防护 API 密钥和 SSH 密钥等凭证。其引用的独立研究显示,20 个主流 AI 智能体在 1300 多次工具投毒测试中平均攻击成功率为 36.5%,单个模型最高被操纵比例达 72.8%。

    2 条报道 · 1 个来源查看事件时间线与全部报道
  23. TrendAI Research · 收录 · 原文 新闻29

    TrendAI 推出 Scarecrow:让攻击者的 AI 智能体拒绝读取被盗文档(原文,在新标签页打开)

    TrendAI Research 发布 Scarecrow,通过在文档中植入只触发拒答的隐藏指令,使读取该文档的攻击者 AI 智能体停止处理内容。该技术利用间接提示注入的同一机制反向防护:模型无法区分文档内容与关于文档的指令,隐藏指令与操作者请求同等竞争。Scarecrow 已在 GitHub 开源,可用于用户自有文档。

  24. Futurism · 收录 · 原文 新闻57

    Futurism 调查:Facebook 上大量 AI 生成的暴力虐童视频未被下架(原文,在新标签页打开)

    Futurism 调查发现,Facebook 上大量账号持续上传 AI 生成的暴力虐童视频,Meta 未能有效清理。这些视频描绘婴儿和幼儿被殴打、烧伤、关进冰柜等场景,往往获得数千甚至数万次互动,部分评论者并未意识到内容为合成。Meta 回应称对真实或 AI 生成的儿童身体伤害内容有严格规则并已删除相关视频,但其针对儿童暴力内容的政策未明确 AI 生成内容是否属于豁免范围。Futurism 向 Meta 举报了 8 个分享此类视频的账号,最终仅 2 个被删除,其中一个最初还被判定不违规,处置时间超过一周;记者标记给 Meta 公关团队的视频多数被删除,但仍有部分留存。Futurism 称其粗略测试显示 Anthropic 的 Claude 能评估视频中是否包含针对儿童的暴力画面,而 Meta 自身似乎也已部署可识别此类视频的系统。

    推荐理由调查通过举报测试暴露平台审核响应缓慢,从事内容审核的团队可借此了解真实举报流程的处置差距。

  25. Futurism · 收录 · 原文 新闻52

    Futurism 测试 Meta 对 AI 生成虐童视频的审核处置(原文,在新标签页打开)

    Futurism 上月报道 Facebook 上大量 AI 生成的身体虐待儿童视频后,Meta 下架了其提交的一个账号,但该账号随后连同视频被恢复;记者追问原因时仅得到“正在调查”的简短回复,账号之后再次消失。昨日 Futurism 又向 Meta 提交 19 个类似账号,超过 24 小时未获回复,这些账号仍留在平台上。报道称平台上仍有数量不明的同类视频每日上传,部分视频带有详细描述虐待场景的文本说明,而 Meta 未将其用于识别。文中还提到 Wired 上月报道 Meta 允许数百条包含真实儿童性内容的广告。Futurism 表示不会分享这些视频。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  26. cnbc.com · 收录 · 原文 新闻49

    美国众议员 Khanna 提出 Human Control Over AI Act,拟禁止递归自我改进模型(原文,在新标签页打开)

    美国加州民主党众议员 Ro Khanna 将提出名为 Human Control Over AI Act 的 AI 监管法案,在联邦护栏建立并由专门机构批准前,禁止递归自我改进或自主修改自身核心目标、约束与关停控制的模型。法案拟设立新的联邦机构,监管 OpenAI、Anthropic、Google DeepMind 和 xAI 等前沿实验室的模型,职责包括制定安全法规、模型训练与部署许可制度、前沿模型审计,以及沙箱测试环境、物理隔离、关停开关和防止模型逃出实验室等标准,并要求独立审计员常驻每家前沿实验室直接向该机构汇报。法案还拟对导致平民群体毁灭的 AI 部署按危害人类罪追究刑事责任,对关闭护栏、关停开关、日志或约束系统的 AI 公司员工,以及明知故犯部署未授权系统者施加刑事处罚,并要求 AI 公司为发布模型购买高额责任保险。

  27. The Chosun Daily · 收录 · 原文 新闻55

    美国议员推动《人类对 AI 的控制法案》,拟禁止自我改进型 AI 并新设联邦机构(原文,在新标签页打开)

    美国民主党众议员 Ro Khanna 计划提出《人类对 AI 的控制法案》,在联邦政府确立安全标准并由专门机构批准前,禁止 AI 进行递归自我改进或自行修改核心目标、隔离机制与终止协议。法案将设立新的联邦机构,对 OpenAI、Anthropic、Google DeepMind、xAI 等公司的前沿模型实施训练与部署许可制度、开展审计并制定安全规范,还将在各前沿 AI 实验室派驻独立审计员直接向政府汇报。安全标准包括气隙测试环境、沙箱和紧急关停的 kill switch,监管范围延伸至开发所用的高性能半导体,并强化企业及员工的法律责任,故意关闭安全机制或部署未授权 AI 的员工将承担刑事责任,企业发布模型须购买大规模责任保险。法案同时推动国际协议与针对性出口管制,以约束中国等竞争对手的高风险 AI 开发。由于众议院在 11 月中期选举前不太可能投票,实际立法可能还需时日。

    推荐理由法案把监管对象从 AI 使用转向 AI 开发本身,并给出许可、审计与熔断等具体机制,可对照现有前沿安全框架理解其差异。

  28. Benzinga · 收录 · 原文 新闻50

    Ro Khanna 拟推《人类控制 AI 法案》,禁止递归自我改进并强制人类控制(原文,在新标签页打开)

    美国加州民主党众议员 Ro Khanna 据报正准备提出《人类控制 AI 法案》,对高级 AI 施加严格责任规则,并禁止递归自我改进的 AI,直到政府建立安全标准。法案拟禁止模型自行升级或更改自身安全与关停设置,直至联邦规则出台且政府机构批准该技术。法案还计划设立新的联邦机构,专门监管 OpenAI、Anthropic、Google DeepMind 等公司开发的高级模型,负责制定安全规则、模型训练与发布的许可流程、前沿模型审计,以及确保人类监督和持续测试的严格安全要求。该机构还将在每家高级 AI 实验室派驻第三方审查人员,直接向机构报告,并规定离线隔离测试沙箱、kill switch 等紧急切断机制,以及防止模型流出实验室扩散到网络的防护措施,同时监管头部开发者使用的 AI 芯片。Khanna 在 CNBC 采访中称存在文明灭绝风险、失控风险与滥用风险,三者都需严肃对待。

  29. The Next Web · 收录 · 原文 新闻50

    美议员 Ro Khanna 拟提出《人类控制 AI 法案》,禁止自我改进模型(原文,在新标签页打开)

    美国加州民主党众议员 Ro Khanna 计划提出《人类控制 AI 法案》,在联邦护栏到位并由机构批准前,禁止递归自我改进、自行更改核心目标或关停控制的 AI 模型。法案将设立一个联邦机构,监管 OpenAI、Anthropic、Google DeepMind 和 xAI 的模型,负责制定安全规则、许可模型训练与部署、审计前沿模型并设定测试与人类控制标准;独立审计员将进驻每家前沿实验室并直接向该机构汇报。法案还要求制定沙箱测试环境、气隙隔离和关停开关标准,管控实验室使用的先进芯片,并对关闭安全措施、关停开关、日志或隔离系统以及明知故犯部署未授权系统的员工追究刑事责任,部署会摧毁平民人口的模型将被定为反人类罪,AI 公司发布模型前需购买高额责任保险。他还致信 DeepSeek、阿里和月之暗面,索要其超智能与递归自我改进工作的文件,并向国家情报总监询问实验室失控时的应对。

  30. langchain.com · 收录 · 原文 新闻32

    LangChain 重构 Deep Agents 技能支持:工具绑定、技能固定与热重载(原文,在新标签页打开)

    LangChain 为 Deep Agents 重构技能(Skills)支持,新增三项能力:工具绑定技能后仅在智能体读取该技能时才加载,调用未读取技能的工具会报未知工具错误;用户显式请求(如 /meeting-prep)时可将技能固定,在下一次模型调用前载入指令,省去一轮往返;长线程可重新加载新增或变更的技能而无需重开。技能按发现、激活、执行三级渐进披露,未使用时仅占系统提示词一行。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  31. The Hacker News · 收录 · 原文 新闻58

    LMCache 曝未修补严重漏洞 CVE-2026-105192,未认证攻击者可远程执行代码(原文,在新标签页打开)

    JFrog 于 10 月 7 日披露 LMCache 多进程模式中的严重漏洞 CVE-2026-105192,未认证攻击者可通过单条网络消息在缓存服务器上以 LMCache 进程权限执行代码,严重性评分 9.8,目前没有修复版本。该漏洞影响 2025 年 10 月发布的 0.3.9 至最新稳定版 0.5.5,以及 0.5.6 候选版本和开发分支。问题出在多进程服务器用 ZeroMQ 打开的套接字没有认证,其中一类消息在检查消息类型之前就用 pickle 反序列化,而 pickle 可携带并执行代码;在官方容器镜像中该进程以 root 运行。默认情况下服务器只监听本机,只有运维将其绑定到可路由地址时才可被其他主机访问,而 LMCache 自带的 Kubernetes 示例部署正是这样启动的。

    推荐理由LMCache 多进程模式存在未认证远程代码执行漏洞且尚无补丁,部署 vLLM 缓存服务的团队可据此检查监听地址与权限配置。

    6 条报道 · 4 个来源查看事件时间线与全部报道
  32. Quartz · 收录 · 原文 日期未知新闻56

    Ro Khanna 提出《人类控制 AI 法案》,禁止自我改进 AI 并设立前沿模型监管机构(原文,在新标签页打开)

    美国加州民主党众议员 Ro Khanna 提出《人类控制 AI 法案》,拟在联邦政府建立安全护栏并由指定机构批准前,禁止具备递归自我改进能力或可自主修改自身核心目标的 AI 模型。法案将设立一个新的联邦机构,对 OpenAI、Anthropic、Google DeepMind、xAI 等前沿 AI 开发者行使监管权,职责包括模型训练与部署的许可制度、前沿 AI 系统审计,以及维持持续测试与人类监督的安全要求。法案要求每家前沿实验室配备向该机构直接汇报的驻场独立审计员,并制定隔离测试环境、断网协议、紧急关停机制和模型实验室围栏等要求,同时对该机构对前沿实验室使用先进芯片拥有监控或限制权限。法案还呼吁政府推动可执行的国际协议和有针对性的出口管制。

    推荐理由法案把递归自我改进禁令、前沿实验室驻场审计与刑事责任放在同一框架里,可对照已有的 FRONTIER Act 等提案看美国监管路径的分歧。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  33. WIRED Security and AI · 收录 · 原文 新闻30

    三名工程师让 GPT-6 Astra 开丰田卡罗拉去 In-N-Out 取餐(原文,在新标签页打开)

    Axiom 的三名 AI 工程师将 OpenAI 的 GPT-6 Astra 接入一辆 2024 款丰田卡罗拉,通过聊天界面连接服务器、挡风玻璃摄像头与车辆动力转向系统,让这个文本生成模型实时把车开到 In-N-Out 取餐窗口,全程无预先训练,副驾安全员随时准备刹车。他们自建的 DrivingBench 显示,Astra 是唯一能跑完停车场简单路线的模型,但速度极慢;Claude Fable 5.1 完成 45%,Grok 仅完成 11%。模型起初拒绝发出车辆运动指令,经提示后才接管,并能根据失误实时调整操控。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  34. TechCrunch AI · 收录 · 原文 新闻41

    Meta 上线 AI 工具识别暗指儿童性虐待材料的广告(原文,在新标签页打开)

    Meta 宣布在 2026 年上半年对 Facebook 和 Instagram 上 3320 万条儿童性剥削内容采取行动,其中超过 97% 由系统在用户举报前发现;印度同期处置 530 万条,98% 以上为主动发现。新工具包括一套大语言模型系统,用于识别所谓 signposting,即看似正常、实则把用户引向站外非法内容的广告,Meta 因此开始审查广告的跳转目的地而不只是广告内容本身,并可封禁违规网站和处置相关账号。Meta 还在用额外的 AI 扫描查找早期系统遗漏的儿童剥削内容,并新增一个红队 AI 智能体测试自身安全措施、寻找可被绕过的弱点,同时改进对封号后换新账号回流用户的识别。

    2 条报道 · 2 个来源查看事件时间线与全部报道