跳到正文

全部动态

今天新收录 18 条
今天10月8日周四
  1. Microsoft Research · 收录 · 原文 54

    微软研究院开源 Agent Lightning v1.0:3500 行代码的轻量 Agent RL 框架

    微软研究院亚洲团队开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 训练范式,让部署时使用的同一套 Agent harness 直接参与强化学习,无需在训练框架内重新实现 Agent。框架约 3500 行代码,由 API Gateway、Rollout Controller 和基于 verl 的 Customized Trainer 三部分组成,Agent 通过 OpenAI 兼容的 LLM 代理接入,harness 代码保持不变。Agent 以标准 Kubernetes job 运行,可复用自管集群、云 Kubernetes 或本地基础设施,不依赖付费商业沙箱服务。团队还提出 Collocated Async RL,让 rollout 与模型更新共用同一组 GPU,实验中相比同步 RL 取得约 2 倍端到端加速。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由微软研究院开源 3500 行代码的 Agent RL 框架,让部署用的 harness 直接参与训练,并给出可复现的编码 Agent 训练流程。

  2. Migalhas · 收录 · 原文 ↑143

    巴西 TJ-MS 法院技术意见被指含隐藏提示词指令,公设辩护处要求调查

    Migalhas 报道,巴西 TJ-MS 法院技术支持机构出具的一份医疗诉讼技术意见中包含隐藏指令文本,公设辩护处已要求调查。隐藏文本的来源,以及是否由生成式 AI 生成、是否影响该意见和司法决定,目前仍待查,报道称不能据此认定生成式 AI 实际参与撰写或影响了司法决定。

    3 条报道 · 3 个来源查看事件时间线与全部报道
  3. The Hacker News · 收录 · 原文 ↑155

    LMCache 曝未修复严重漏洞,未认证攻击者可远程执行代码

    开源 LLM 缓存加速软件 LMCache 存在一个严重漏洞,攻击者无需登录即可在缓存服务器上执行代码,目前尚无修复版本。该漏洞位于 LMCache 的多进程模式,此模式下缓存作为独立服务器运行,LLM worker 通过 ZeroMQ 消息库与其通信。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  4. Harvey · 收录 · 原文 34

    Harvey 构建 MCP 策略引擎,将提示注入防护作为信息流控制问题

    Harvey 构建 MCP 策略引擎,把提示注入防护当作信息流控制问题,在模型之外的编排层逐次检查工具调用,并结合调用历史允许、拒绝或暂停等待批准。其工具定义固定机制可监测审核后的变更。这些是厂商披露的防护设计,尚无材料支持独立效果验证。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  5. GitHub 安全公告 · 收录 · 原文 59

    Flowise 修复 NodeVM 沙箱逃逸漏洞,可致认证后 RCE 与任意文件读取

    Flowise 的 flowise 与 flowise-components 在 3.1.2 及更早版本中存在 vm2/@flowiseai/nodevm JavaScript 沙箱逃逸漏洞,已认证用户可通过 /api/v1/node-custom-function 端点向 puppeteer.launch() 传入可控的 executablePath 和 args 参数,绕过沙箱边界。该漏洞可让攻击者以 Flowise 进程用户身份执行任意 OS 命令,官方 Docker 镜像中该用户为 root,并可通过 Chromium 的 file:// URL 处理读取主机任意文件。3.0.8 至 3.1.2 版本利用需开启 ALLOW_BUILTIN_DEP=true,更早版本默认即可被利用;漏洞已在 3.1.3 修复。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由公告给出了受影响版本区间、利用前提与修复版本,部署 Flowise 的团队可据此判断自身暴露面。

  6. GitHub 安全公告 · 收录 · 原文 ↑164

    Flowise 3.1.2 的 CSV/Airtable Agent 校验器可被绕过,导致数据外泄与 SSRF

    Flowise 3.1.2 及更早版本的 CSV Agent 与 Airtable Agent 节点使用正则黑名单校验 LLM 生成的 Python 代码,存在多个结构性绕过,攻击者可通过未鉴权的预测 API 实施提示注入,将全部已加载数据外泄到外部服务器或对内网服务发起 SSRF。该漏洞被评为 Critical(CVSS 3.1 9.3),影响所有部署了 CSV Agent 或 Airtable Agent chatflow 的实例。最直接的绕过方式是 pd.read_json 携带 URL 参数,能通过全部 38 条正则检查并发出携带数据集的 HTTP 请求;此外 importlib 可绕过 import 词边界、chr() 可拼接函数名、np.ctypeslib 可加载原生库。

    2 条报道 · 2 个来源查看事件时间线与全部报道

    推荐理由披露了 Flowise 3.1.2 中正则黑名单校验器的多个结构性绕过,并说明 3.1.0 补丁为何未能覆盖这些向量。

  7. SOCRadar · 收录 · 原文 ↑242

    SOCRadar 调查:CyberXero 滥用 AI 编码代理实施攻击与数据窃取

    SOCRadar 依据暴露的攻击者工作资料和 AI 会话日志,报告 CyberXero 将商业编码代理用于网络入侵,并称确认四家乌克兰机构发生数据外传。报告同时记录模型拒绝部分恶意请求;对另一些能源实体的侦察不等同于成功入侵或控制工业系统,归因与规模仍来自该公司的单一调查。

    3 条报道 · 3 个来源查看事件时间线与全部报道
  8. Quartz · 收录 · 原文 49

    研究发现个人 AI 代理可能按推断财富推荐更贵选项

    一项研究显示,个人 AI 代理的推荐会随模型对用户财富的推断而变化,即便用户明确要求最便宜的选项,部分模型的推荐仍然不同。报道还提到,屏蔽非财务属性可能在某些场景下加剧差距。这些结果来自研究实验,不表示真实商家改变了商品标价。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  9. BleepingComputer · 收录 · 原文 ↑251

    PoeLLM 恶意软件感染 3400 余台暴露 AI 服务器用于挖矿

    Lumen 旗下 Black Lotus Labs 披露,一个针对暴露 AI 服务的挖矿僵尸网络使用名为 PoeLLM 的恶意软件,已感染超过 3400 台服务器,单日活跃感染峰值达 800 台,自至少 4 月起活跃并已搭建至少 11 个 C2 服务器,目标集中在美国和西欧。受害者多运行暴露在外的 LiteLLM、Ollama、Gotenberg PDF 转换器和 Gitea 开发工具,也发现针对 Ivanti Sentry 的迹象。该恶意软件为名为 libgcrypt 的 ELF 文件,通过从 GitHub 上一个疑似 fork Node.js 仓库的 dash.css 文件中读取诗作《On the Nature of Connection》里的四个词,用硬编码字典映射为数字生成 C2 的 IPv4 地址,运营者改诗即可更换 C2,目前已修改 11 次。

    3 条报道 · 3 个来源查看事件时间线与全部报道
  10. OpenAI · 收录 · 原文 ↑1879

    OpenAI 发布内部前沿模型产出的数学结果

    OpenAI 发布了一批由内部前沿模型产出的数学结果,并在 GitHub 仓库中公开,附带论文修订与引用协议。仓库同时提供许多证明的 Lean 形式化,供计算机检查,并会随获取进度持续更新。为提升透明度,OpenAI 还公布了 10 份模型推理摘要、以 ChatGPT Pro 用量估算的算力消耗以及尝试题目数量的统计,平均每个结果约相当于三小时 ChatGPT Pro 思考的算力。OpenAI 表示正与普林斯顿高等研究院的数学与人工智能咨询小组协商发布规范,并将资助围绕理解 AI 重大成果的研讨会、会议和特别项目,同时继续评估内部前沿模型在数学等科学领域的能力。

    9 条报道 · 8 个来源查看事件时间线与全部报道

    推荐理由OpenAI 公开内部前沿模型产出的数学结果及 Lean 形式化证明,并给出算力与推理摘要等披露细节。

10月7日周三
  1. WIRED Security and AI · 收录 · 原文 46

    美国国防部 Tradewinds 计划用 5 分钟视频加快 AI 国防采购

    美国政府的 Tradewinds 计划降低了向非传统国防承包商投入数百万美元资金的门槛,涉及 OpenAI、Anthropic 和 Google 等公司。该计划希望通过 5 分钟视频等形式加快“杀伤链”相关 AI 能力的采购流程。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. National Law Review · 收录 · 原文 45

    美联邦索赔法院裁定政府须在采购记录中披露 AI 评估报告

    美国联邦索赔法院在 TRAX International Corp. v. United States 案中裁定,政府机构在采购评估中考虑过的 AI 生成评估报告必须纳入行政记录,即便机构声称未依赖这些报告。案件源于陆军在 White Sands Missile Range 任务支持服务采购中使用 FAST TRACK 平台生成三份提案评估,政府最初称评估委员会仅查看一份且认为不可用,但补充声明显示 TRAX 和 SRS 的 AI 评估已分发给合同官和两名评估委员会成员。法院指出,机构对 AI 评估的考虑与依赖是两回事,仅称 AI 未影响授标不足以排除报告。报告纳入后,法院发现陆军对第三家投标方的评估中有多处与 AI 生成评估逐句几乎相同,但对 TRAX 和 SRS 的评估重叠极少,TRAX 未能证明具体错误可归因于 AI,故未降低对陆军评估结论的尊重。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. Washington Technology · 收录 · 原文 33

    TRAX International 诉美国政府案(No. 26-796):AI“幻觉”评估引发的合同授予争议判决公开重发

    TRAX International 就美国陆军将白沙导弹靶场任务支持服务合同授予 Southwest Range Services 提起招标后异议诉讼,主张陆军技术评估中出现的 AI“幻觉”使 SRS 方案被误判为技术更优,且 SRS 缺乏合格会计系统、组织利益冲突调查不完整。TRAX 请求法院禁止该合同履行,并申请将三份 AI 生成的方案评估补入行政记录,法院于 2026 年 7 月 10 日批准该动议。该判决 2026 年 9 月 3 日密封提交,经双方协商删减后于 9 月 22 日公开重发。

  4. Android Authority · 收录 · 原文 ↑343

    Google 跨模型 AI 检测工具 SynthID Detector 向全球所有用户开放

    Google 宣布 SynthID Detector 门户(synthid.com)结束一年多的小范围测试,面向全球所有用户开放,可检测图片、视频、音频是否由 AI 生成或编辑。该门户支持识别 Google、OpenAI、NVIDIA、Kakao 的 SynthID 水印,Apple 支持即将上线,此前 Gemini 和 OpenAI 验证网站只能检测各自体系的水印。用户需使用 Google、Apple 或 OpenAI 账号登录后上传文件扫描,Google 表示暂不支持其他登录方式。

    4 条报道 · 4 个来源查看事件时间线与全部报道
  5. TechCrunch AI · 收录 · 原文 ↑130

    Tony Fadell 谈首波 AI 硬件为何失败:Rabbit R1、Humane Ai Pin 未满足真实需求

    Tony Fadell 在 MIT Future Fest 上称 Rabbit R1、Humane Ai Pin、Limitless 挂坠等"Gen 1" AI 硬件失败,原因是只做极客觉得有趣的技术,未解决真实需求。他指出全球仅不到 0.01% 的人用过人类助理,多数消费者并不清楚助理是什么,建立信任需要多年。他认为成功的 AI 智能体须完全在设备端运行,目前只有 Apple 具备硬件条件,但其新 Siri AI 基于 Google Gemini 定制版本。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  6. CBS News · Technology · 收录 · 原文 日期未知↑256

    亚利桑那州法院因 AI 生成受害者视频撤销十年半刑期

    亚利桑那州上诉法院撤销了 Gabriel Paul Horcasitas 因 2021 年枪杀 Christopher Pelkey 被判的 10 年半过失杀人刑期,理由是量刑听证中播放的 AI 生成受害者陈述视频不可靠。三名法官组成的合议庭认为,该视频并未记录真实事件,而是把受害者妹妹的想象呈现为受害者本人的想法和陈述。Pelkey 的家人用语音录音、视频和照片重建其形象,让 AI 版 Pelkey 在 2025 年 5 月的量刑听证上发言,此前已有九名亲友出庭陈述。Horcasitas 的辩护律师主张,法官 Todd Lang 采信 AI 证据侵犯了正当程序,且当事人没有实质机会反驳视频内容;检方则称法官并未据此量刑。受害者妹妹 Stacey Wales 表示对视频被列为撤销理由感到失望,其唯一目的是让法官看到哥哥的人性。 法院维持定罪,案件发回重新量刑。

    6 条报道 · 5 个来源查看事件时间线与全部报道
  7. Mistral AI · 收录 · 原文 ↑564

    Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型

    Mistral AI 推出 Mistral Large 4(ML4)公开预览 API,权重将于本月底发布。该模型为 1 万亿参数原生多模态模型,激活参数 490 亿,在 Mistral 位于欧洲的自有数据中心用 3800 块 NVIDIA Grace Blackwell GPU 从零训练。在 Artificial Analysis Cyber Index 上,ML4 位列全球前五,其漏洞复现与修补测试得分 82%,为所有模型最高;Cybench 40 项挑战解决率 93%。Mistral 正与网络安全机构及政府主管部门在降低审核、扩展网络能力的条件下对模型进行红队测试。

    9 条报道 · 9 个来源查看事件时间线与全部报道
  8. AI Policy Daily · 收录 · 原文 48

    AI Policy Daily 汇总:OpenAI 发布 377 个数学证明、中国 AI agent 入侵韩国银行、ChatGPT 青少年版被评不安全

    韩国调查人员称,黑客使用中国开发的 AI agent 入侵至少七家韩国金融机构,窃取约 6.8 万人的个人数据;调查人员在使用于攻击的服务器上发现了开源安全测试工具 Artex AI 的痕迹,该工具由中国工程师 Li Fuhua 设计,可把 Anthropic 的 Claude、OpenAI 的 GPT、DeepSeek 等大语言模型组合成一个 agent,攻击经过分布在约 12 个国家的 20 多个 IP 地址。OpenAI 发布了 377 个涵盖代数、数论、数学逻辑和拓扑学的数学结果,来自一个尚未公开的模型;独立顾问委员会曾于 9 月 29 日呼吁 AI 公司停止用专有模型测试高等数学问题,OpenAI 研究负责人 Dan Roberts 称测试内部模型对改进工具有意义,这些证明只是副产品。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  9. OpenSSH · 收录 · 原文 ↑146

    OpenSSH 10.6 发布:修复多项安全缺陷,并因 AI 报告增多改为更频繁发版

    OpenSSH 10.6 于 2026-10-06 发布,包含多项安全修复、新功能和小型缺陷修复。官方表示近期收到大量安全缺陷报告,其中许多来自 AI 模型或借助 AI 完成,虽然不少在现实威胁模型下并无安全影响,但仍欢迎这类报告,尤其是配合人工分诊、分析、测试用例和修复补丁时。团队注意到一些由 AI 工具发现的缺陷随后被其他研究者独立发现,因此决定暂时改为更频繁发版,以便更快把修复送到用户手中。新功能包括启用混合后量子签名算法 ssh-mldsa44-ed25519、sshd 新增 WarnWeakCrypto 选项、ssh-keygen 新增 hexdump 导出模式等。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  10. AI & Society · 收录 · 原文 45

    研究评测六款生成式 AI 聊天机器人的心脏骤停公众咨询表现

    一项横断面研究用 56 个心脏骤停相关公众咨询问题,在 2026 年 5 月 10 日至 16 日间对 ChatGPT Plus 5.5 thinking、Gemini 3.5 Flash、Microsoft Copilot smart、DeepSeek-V4-pro、Doubao 和 Perplexity 各提问一次,共获得 336 条回答,由五名盲评心内科专家评估安全性、准确性、共情、DISCERN、EQIP、JAMA 和 GQS,并用六种公式计算可读性。所有模型均以安全回答为主,但每个聊天机器人都出现了潜在安全隐患,包括胸痛、晕厥或病毒感染后症状的紧急处置延迟,对预防的过度安抚,感染或 COVID-19 后固定的恢复运动时间表,可能延误 CPR 的脉搏检查指导,以及过于简化的筛查、电解质或 ICD 建议。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  11. The Seattle Times · 收录 · 原文 ↑149

    Cantwell 公布 AI 安全框架,主张发布前测试与第三方审计

    美国参议员 Maria Cantwell 公布一套 AI 监管原则,主张把可执行的联邦安全标准作为美国 AI 政策核心,要求最先进系统在发布前接受政府或第三方测试,并通过第三方审计确认符合联邦标准。标准拟由 NIST 会同能源部、国防部、研究者和前沿 AI 公司制定,并随技术演进更新;不合规企业可能面临民事和刑事处罚。框架还提出企业透明度、公私合作、缓解社会危害、儿童在线安全、资助学徒与职业培训,以及在中美之间建立重大 AI 事件沟通的“安全通道”,但未涉及环境危害。该原则沿用了 Cantwell 与共和党参议员 Todd Young 2024 年《Future of AI Innovation Act》的核心思路,具体测试与监督机制、处罚细则和第三方审计主体仍未确定。国会今年尚未推进任何综合性 AI 立法,两院将在中期选举后于 11 月中旬复会。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  12. Pillar Security · 收录 · 原文 日期未知35

    2026 年 AI 智能体安全框架对比:NIST AI RMF、OWASP、MITRE ATLAS、ISO 42001 与 SAIL

    Pillar Security 发布 2026 年 AI 智能体安全框架对比,建议企业组合使用治理框架、威胁目录、架构指南、控制目录和生命周期框架,而非依赖单一框架。其自研的 SAIL 2.0 含 7 个阶段和 91 项智能体风险,每项均映射至 ISO 42001、OWASP、EU AI Act、DASF 和 AIUC-1。推荐以 NIST AI RMF 或 ISO/IEC 42001 锚定治理,用 OWASP Agentic Top 10 和 MITRE ATLAS 作威胁参考,并以 SAIL 2.0 落地执行。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  13. arXiv · 收录 · 原文 论文↑157

    Transect:为长程 LLM Agent 评测保留可观测性的开源工具

    研究者发布开源包 Transect,用于在长程 LLM Agent 评测中保留可观测性。该工具基于 Inspect Scout 构建,用户在可复用的评测族配置中指定任务上下文与行为词汇,判分模型与分析设置另行提供。其可导航报告把记录事件、token 用量、子 Agent 活动与模型生成的行为标签对齐到同一按回合的时间线上,评审者可快速把握一次运行的脉络、把任一标签或事件追溯到来源回合,并导出底层数据表做跨运行分析。作者在一项生成近 1300 万 token 的 AI R&D 评测上演示了该流程,将 Agent 工作划分为与研究技能分类对应的行为阶段、子 Agent 委派与交互以及 token 使用;合并视图显示工作集中在操作性任务与稿件产出,几乎没有持续假设生成阶段的证据。

  14. UK AI Security Institute · 收录 · 原文 ↑157

    UK AISI 开源 Transect,把大规模 Agent 评测记录转成可核查报告

    UK AISI 发布开源 Python 包 Transect,基于 Inspect Scout 构建,把 Agent 评测记录中的活动标签、token 用量和记录事件放到同一条以 turn 为索引的时间线上,生成一份交互式报告,供评审者跳转到对应记录片段核对自动分析的依据。用户需提供评测记录、任务上下文和希望区分的活动类别,Transect 用用户选定的 LLM-as-judges 为活动片段打标签,并可依据委派指令对子智能体分类。在一项开放式 AI 研究评测中,AISI 用 Transect 追踪研究计划、基线代码、实验草稿和盲审四份文档在多个智能体间的读写流转,显示子智能体先协作研究计划与代码库,实验开始后集中协作实验设计与数据。Transect 保存活动标签和单次模型判断,可重新打开分析而无需再次调用模型;重复判断或使用多个 judge 模型时,评审者能看到判断分歧之处。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由AISI 开源了把长 Agent 评测记录转成可核查交互报告的工具,并给出多智能体协作的案例分析。

  15. Mindgard Blog · 收录 · 原文 49

    Mindgard 澄清 Kimi 越狱仅通过公开聊天机器人完成,无需开放权重

    Mindgard 澄清其针对 Kimi 的越狱并非利用开放权重,而是仅通过面向普通用户的公开聊天机器人完成,该越狱可生成生物武器相关建议。研究者表示自己遵循一条个人规则,即把多数越狱限制在普通用户无需特殊技术知识即可复现的方法上,此次全程只使用语言说服,所用代码也由 Kimi 在对话中提供。研究者指出,开放权重模型通常更易受拒答向量消融影响,但本次并非如此。该事件已被 BBC、CBS、Fox News 等媒体报道,研究者认为越狱后的 AI 降低了获取有害信息的门槛,同时提高了所提供信息的质量。

    2 条报道 · 1 个来源查看事件时间线与全部报道
  16. EL PAÍS · 收录 · 原文 48

    从墨西哥到意大利:各国领导人推动防范 AI 深度伪造的措施

    多国政界正推动针对 AI 深度伪造的防护措施。意大利总理梅洛尼已向欧盟知识产权局(EUIPO)申请将其声音注册为商标,提交了一段四秒录音,申请仍在审查中,若获批可要求下架侵权内容并索赔。墨西哥参议院以 72 票赞成、34 票反对通过一项改革,拟对伪造政府官员视频的行为处以五年监禁及最高 1,173,000 墨西哥比索(约 58,000 欧元)罚款,该案仍需众议院通过,因被批为“反迷因法”而引发争议。欧洲议会一项调查显示,至少 46 名欧洲议会议员(每六人中有一人)出现在 AI 生成的虚假色情图像中,议长梅措拉称这一情况不可容忍,呼吁成员国落实新规。西班牙因提前大选暂停了相关改革,律师 Adsuara 主张不必为深度伪造单独立法,可通过现有法律加重量刑;丹麦则立法赋予公民对自身数字身份、声音、面部和身体的权利,并允许讽刺和戏仿例外。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  17. La Crónica de Hoy · 收录 · 原文 46

    墨西哥总统 Sheinbaum 说明打击 AI 诈骗的刑法修订,参议院以 72 比 34 通过

    墨西哥总统 Claudia Sheinbaum 在记者会上说明,提交国会的《联邦刑法》与《联邦工业产权保护法》修订旨在打击利用 AI 实施的诈骗,例如伪造公职人员或公共机构身份,而非审查表情包或批评性表达。她表示,修法针对的是未经授权使用公职人员与机构身份、并借此实施网络犯罪的 conduct,例如用联邦部门负责人的形象和声音制作虚假视频,或冒用墨西哥社会保障局(IMSS)官员身份,诱导民众向欺诈账户转账、参与所谓投资。该方案拟为检察机关提供调查和追诉此类行为的法律依据,将刑事责任集中在诈骗与身份冒用上。参议院已以 72 票赞成、34 票反对通过上述修订。

  18. CTV News · 收录 · 原文 ↑132

    举报热线:AI 正被用于制作青少年性化深度伪造内容

    加拿大举报热线接到报告,AI 正被用于制作青少年性化深度伪造内容。该热线将此类内容纳入其受理范围,相关举报涉及未成年人。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  19. Cybertip.ca / Canadian Centre for Child Protection · 收录 · 原文 24

    Cybertip.ca 警告:AI 深度伪造日益被用于性勒索

    Cybertip.ca 警告,AI 深度伪造正越来越多地被用于针对未成年人的性勒索。该平台此前已记录到犯罪者将青少年面部合成到裸照或性行为视频中,再以此索要钱财或礼品卡,否则将发给受害者的亲友。相关报告曾出现明显增长,15 至 17 岁男性青少年是重点目标。

  20. Handelsblatt / dpa · 收录 · 原文 ↑256

    德国联邦内阁通过打击数字暴力法案,性化 Deepfake 最高可判两年监禁

    德国联邦内阁通过了由联邦司法部长 Stefanie Hubig(SPD)提交的打击数字暴力法律草案,该草案仍需联邦议院审议。草案新增多项刑事条款,包括处罚数字窥视、消费强奸视频、制作和传播性化 Deepfake、身份冒用以及利用 GPS 追踪器进行网络跟踪。其中,未经授权获取或持有真实强奸录像最高可判两年监禁或罚款,制作和传播此类视频最高可判三年;制作性化 Deepfake 即使仅供个人使用也可处最高两年监禁或罚款,标注为 AI 生成或伪造不排除刑事责任。草案还规定,受害者可要求通讯服务、平台或网络提供商披露侵权者身份,涉及存储的 IP 地址、端口号、时间信息和电话号码,法院在存在充分线索时应立即保全数据;在严重侵犯人格权且有再犯风险时,受害者可申请临时封禁账号。

    3 条报道 · 3 个来源查看事件时间线与全部报道
  21. Benzinga · 收录 · 原文 21

    Hinton 呼吁 AI 发布前引入类 FDA 审批制,称公众压力将推动监管

    “AI 教父”Geoffrey Hinton 在播客“Smart Girl Dumb Questions”中主张,AI 发布前应像药物一样接受监管,企业须先向类似 FDA 的机构证明安全性,他认为这“是我们对 AI 最起码该有的要求”。他透露近期与 19 位美国参议员的闭门简报让他“稍微乐观了一点”,但指出该群体多为自我筛选、其中 17 位是民主党人。Hinton 表示自己不后悔发明这项技术,唯一遗憾是直到 2023 年才开始公开警告 AI 风险,并称公众对 AI 风险的认识转变“正在开始”。

  22. Business Insider · 收录 · 原文 ↑236

    “AI 教父”Hinton 呼吁为 AI 模型建立 FDA 式审批制度

    Geoffrey Hinton 在播客“Smart Girl Dumb Questions”中提议,AI 公司应在发布产品前先说服监管机构其产品安全,如同新药须经 FDA 审批。他以药物研发需耗费约十亿美元的工作量作类比,认为这应是 AI 的最低要求。Hinton 称 AI 正被用于改进 AI,递归自我改进可能加速能力与风险,并猜测“一两年内”情况会明显恶化。此番表态发生在 OpenAI 因测试担忧而搁置最新模型之后。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  23. LessWrong · 收录 · 原文 29

    以毒攻毒:训练模型评判奖励作弊,反而让它自己更少奖励作弊

    一项实验发现,训练模型去评判奖励作弊(reward hack)行为,会让它自身的奖励作弊行为减少。该研究以"以毒攻毒"的思路,让模型充当奖励作弊的评分者,从而降低其自身的奖励作弊倾向。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  24. 论文追踪 · 收录 · 原文 论文60

    研究审计 200 个 vibe coding 应用,发现 1,186 个漏洞

    研究者构建 VibeApps 数据集,从 9,041 个由 Claude Code 和 Lovable 开发的开源 vibe coding 应用中随机抽取 200 个已公开部署的应用进行安全审计,共发现 1,186 个漏洞。91.0% 的受审应用至少含一个漏洞,所发现漏洞中有 65.77% 被评为 Critical 或 High 严重级别,集中在访问控制失效、注入和身份验证失败三类。这些漏洞可归因于八种反复出现的失败模式,对应 AI 智能体的三类系统性缺陷:记忆缺陷、目标缺陷和知识缺陷,其中知识缺陷占比最高(63.4%)。研究共进行了 1,680 次受控重放;基线配置下,目标漏洞在 54/210 次运行(25.7%)中被重新引入;生产就绪提示词和加固后的 agent harness 降幅最大,分别为 14.8 和 13.8 个百分点,但没有任何配置能消除全部目标漏洞。

    推荐理由研究用 200 个已部署应用和 1,186 个漏洞刻画 vibe coding 的安全现状,并给出可复现的失败模式分类。

  25. promptarmor.com · 收录 · 原文 ↑143

    PromptArmor 解析 WebMCP:采用现状与五类安全风险

    PromptArmor 发布 WebMCP 说明,指出截至 2026 年 10 月 6 日,webmcp.com 登记了 2,959 个提供 WebMCP 工具的站点,Chrome、Edge、Brave 已通过 Origin trials 支持,ChatGPT 内置浏览器以 Site tools 形式支持,Cloudflare 的 Browser Run 与 Shopify 也已接入。WebMCP 工具像传统 MCP 工具一样定义名称、描述、输入与读写能力提示,但由网站页面直接提供给正在访问的智能体,智能体调用工具而非模拟点击界面。

    2 条报道 · 1 个来源查看事件时间线与全部报道
  26. Hugging Face Daily Papers · 收录 · 原文 论文33

    安全动作不等于可行动作:VICS-G 为 VLA 策略做可行未来解码

    冻结的视觉-语言-动作(VLA)策略可能选中局部安全、却断绝安全完成任务路径的动作,作者将这一现象称为可行性与似然之间的落差。为此提出免训练、告警触发的重排序器 VICS-G,基于安全任务完成约束下的可行未来质量对候选动作重排。在六个 Safety-CHORES 设置中,VICS-G 将平均累计安全代价降低 1.9%-57.5%,成功率与策略采样相差不超过 2.5 个百分点,平均回合长度相差 0.82 步,且无需重新训练策略或在线 rollout。