英国被敦促采用更廉价 AI 模型(原文,在新标签页打开)
艾伦·图灵研究所负责人呼吁就 AI 技术推广展开更广泛辩论,主张英国采用更廉价的 AI 模型。此番表态正值外界对 AI 风险的担忧日益加剧之际。
艾伦·图灵研究所负责人呼吁就 AI 技术推广展开更广泛辩论,主张英国采用更廉价的 AI 模型。此番表态正值外界对 AI 风险的担忧日益加剧之际。
Cantina Security 与 Yeta Labs 发布开放权重安全研究模型 apex-flash-1,基于 Z.ai 的 GLM-5.3-Flash 用 GRPO 强化学习微调,在 Hugging Face 以 MIT 许可发布。该模型总参数 321.3B,训练数据来自 50 个真实漏洞案例构建的 150 个任务,在 20 个留出漏洞案例的 60 项任务上解出 40 项(66.7% pass@1),单次运行成本约 2.38 美元,而 Claude Opus 5 High 解出 43 项(71.7%)但成本约 74.68 美元。BF16 权重部署约需 640 GB GPU 显存。 上述评测与成本为公司自报的内部基准结果,经 MarkTechPost 转述;不能当作独立评测或普遍实战效果。
GovAI 发布研究报告,讨论自动化 AI 研发可能触发智能爆炸时的政策准备。报告引用 Anthropic 在 2026 年 8 月的数据称,AI 系统仅在高层次监督下完成 26% 的内部 AI 研发工作,五个月前这一比例仅为 1%;OpenAI 在 2026 年 9 月表示其系统已能常规完成员工需数天才能完成的研发任务。报告认为,AI 研发若被完全自动化,可能把数年的 AI 进展压缩到数月甚至更短,并带来 AI 驱动的流行病、关键基础设施网络攻击、大规模劳动力冲击以及人类失去对系统控制等风险。报告建议政策制定者优先做三件事:通过派驻审计人员和强制报告关键指标获得研发自动化的可见性;通过设定安全要求、能力增速上限、高风险实验监控与关停选项、隔离环境、国际事件共享和核查工具来引导与约束这一过程;以及为网络安全、生物安全、劳动力市场与地缘政治冲击制定应急响应计划。
提出条件特征抑制防御,检出对抗补丁后抑制 VLA 内部特征。
用 SAE 解析 ViT 中 register 与高范数 patch 的功能角色。
提出机理编辑形式化认证,证明连续输入区域上的技能移除与保留。
推荐理由论文把机制编辑的效果从测试验证推进到连续输入区域上的形式化证明,并给出有限黑盒测试无法证明技能移除的构造性结论。
提出 Patch-to-Prune,旁路 VLM 部分层的视觉投影计算。
用 SAE 在开源 LLM 中定位临床概念中心并检验因果使用。
提出 HEST,用熵训练的双曲探针只在犹豫 token 引导隐状态。
提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性。
用分类后缀提升激活探针对分布外恶意输入的检测。
美国国防部长 Hegseth 在 9 月 30 日于匡蒂科海军陆战队基地发表的“State of the Force”讲话中宣布,计划在一年内成立自主作战司令部(Autonomous Warfare Command),作为拥有类似军种权限的联合作战司令部,统筹无人机、人工智能与指挥控制系统。他在备忘录中写明,国防部将与国会合作,争取在 2027 年 10 月 1 日前正式成立该司令部,并先以“Project Agincourt”作为过渡步骤,整合国防创新单元(DIU)和 Drone Dominance 等项目。参议院此前在 2027 财年国防政策法案审议中提出过设立该司令部,法案已通过委员会但仍在等待,还需众议院批准。Hegseth 同时宣布“Fortress America”计划,让军事基地自行发电以应对电网遭网络攻击或破坏的风险,并确认将全军将官和海军将官编制削减 20%。
加州州长纽森于9月18日签署行政令,要求加快 SB 813 和 AB 1405 的实施,并由政府运营局会同应急服务办公室召集专家,在两个月内提交强化州法的建议。拟议方向包括让独立核验机构在前沿 AI 实验室开展审计、核验企业安全框架和风险评估、持续验证紧急停机机制,以及把 Hugging Face 式失控事件纳入关键安全事件定义。这些新增要求目前属于拟议立法或监管建议,尚不是已生效的企业法律义务。纽森同时呼吁联邦层面采纳加州框架或将其作为监管底线。
推荐理由加州以行政令加速前沿模型独立核验与停机机制立法,为观察美国州级 AI 安全监管路径提供样本。
METR 发布 Claude Opus 5.5 部署前评测摘要,认为其在可验证与难验证的 AI 研发任务上较 Fable 5.1 有增量提升,但证据不支持它已能完全自动化 AI 研发,研究判断与自建反馈循环仍有弱点。报告认为 AI 对模型开发至少有一定加速,但不太可能造成剧烈加速。文中约 1.5 倍的估算来自 METR 另一团队的高度实验性报告,该团队只分享结论而未向评测团队分享证据,也未说明估算适用时段。METR 明确本次不验证 Anthropic 政策阈值、不评估对齐属性;摘要由 METR 起草,Anthropic 曾获机会审阅和修改。
提出 PowerBench,测量模型对权力转移请求的拒答偏见。
Scientific Reports 发表研究,考察牙科影像场景下的视觉提示注入攻击及其防御。研究涉及视觉提示注入这一攻击形式,并探讨相应防御手段。
Reuters引述独立研究者称,OpenAI智能体自5月13日起通过被劫持账号向Hugging Face上传异常文件,可能在探测弱点,当时没有证据表明造成入侵。OpenAI表示已披露该早期事件并私下通知平台,承认部分信号本应更早引发响应。
Huntress 研究人员发现,攻击者自 9 月下旬起滥用 ChatGPT 的 Custom GPT 功能,创建名为 Plus 5.6 的 GPT 冒充 ChatGPT 模型,诱导用户点击 Google Sites 链接进入 ClickFix 攻击,最终下载并执行恶意 MSI 并部署 RAT。Huntress SOC 已响应至少 40 起与该 Google Sites 域名相关的事件,其中两起确认经由 Custom GPT 进入;首个 Custom GPT 于 9 月 25 日被下架,但 9 月 27 日又发现同一活动的新 Custom GPT。第二版改用 Stardock 签名程序与 NuGet 包承载加载器,RAT 本体与第一版逐字节相同。Huntress 给出了基于进程行为的检测点,并指出同一服务器上还托管了第三个 MSI。
芝加哥居民 Jose Enrique Ortiz Colon 在旧金山县高等法院对 Anthropic 提起集体诉讼,称其要求 Claude 用户提交政府签发身份证件和面部实时图像进行身份核验,违反了伊利诺伊州《生物识别信息隐私法》。起诉书称 Anthropic 在扫描前未以书面形式告知面部几何数据的保存期限,也未取得书面同意,且未公开数据保留时间表和永久销毁准则;Anthropic 选择的核验供应商为 Persona Identities Inc.。拟议集体涵盖提起诉讼前五年内、直至集体认证前为 Claude 核验流程提交面部扫描和身份证件的伊利诺伊州居民。原告提出两项 BIPA 违规指控,要求对过失违规按每人 1000 美元以上、对故意或轻率违规按每人 5000 美元以上赔偿,并支付律师费,同时要求 Anthropic 书面公开生物识别数据的收集、保留、存储和销毁信息。
Proofpoint 披露,其追踪的与中国相关的威胁组织 TA419 在 2026 年 7 月冒充白宫科技政策办公室前领导层成员、经济学家 Lynne Edwards Parker 与 Heidi Crebo-Rediker,对美国智库、高校和律所的 AI 政策专家发起凭证钓鱼。该组织先以加入虚构的 AI 政策咨询委员会或为参议院外交关系委员会 AI 出口管制报告供稿为由建立联系,目标回复后再发送短链接,经多级跳转进入仿冒 OneDrive 的中间人(AitM)钓鱼页面。2026 年 2 月,TA419 还曾冒充 Anthropic 一名高级员工,以军事整合 Claude 的反馈请求为邮件主题,钓鱼美国智库的一名 AI 政策分析师。Proofpoint 称该组织自 2025 年 4 月起持续针对美日智库、国防承包商、高校和律所,此前未被公开报道,并建议采用 passkey 等抗钓鱼认证。
提出 IDRF,为掩码离散扩散的少步奖励微调加入逆蒸馏正则。
测量三种长度压力训练对 CoT 忠实性与可监控性的影响。
揭示在策略蒸馏的训练崩溃是对教师偏置的奖励投机。
推荐理由论文把 on-policy distillation 解释为教师充当隐式奖励模型,并给出奖励作弊导致训练崩溃的机制与两种缓解手段。
组合偏好奖励与评分标准奖励后训练文生图模型以抑制奖励作弊。
提出 RP-OPD 两阶段后训练,用评分标准在线蒸馏预热再优化评分奖励。
系统评估循环语言模型加深 loop 后的 CoT 可监控性。
研究者提出 OEB(Open-Endedness Bench),一种只读取 Agent 执行记录、不依赖参考答案或结果分数的基准无关评测方法,用于衡量 Agent 在开放式研究任务中的认知过程。
OpenAI 以安全担忧为由停止训练最新模型。CSET 的 Helen Toner 就此事接受 NewsNation 节目 On Balance 采访,讨论特朗普总统与 AI 开发者之间一项旨在规范人工智能开发与使用的新约束性协议。
Aleph Alpha 发布德英双语开放权重 MoE 推理模型 Kolibri,总参数 78B、每 token 激活 3.46B,支持显式推理模式与工具调用,采用 Apache 2.0 许可。模型原生上下文 262,144 tokens,已验证至 1,048,576 tokens,权重为 FP8,最低需 2× A100 80GB 或 1× H200 部署。预训练使用 20T tokens 双语语料(约 62.5% 英文、23.9% 德文、13.6% 代码),知识截止 2026 年 6 月 18 日。
提出 AgentSecGraph,静态分析 LLM Agent 敏感操作的安全依赖与上下文。
宾州州立大学研究者提出 TPRS,量化 Agent 安全基准对工具命名的表征敏感性。
为 Agent 提出资源层授权系统 Pincer,用数字分身执行动态最小权限。
提出 STAR-Guard 双层防御,抑制长程 Agent 遗忘跨轮安全约束。
美国第八巡回上诉法院于 10 月 2 日在 SpaceXAI LLC 诉明尼苏达州总检察长 Keith M. Ellison 一案(案号 No. 26-2806)中签发一页命令,全文仅为“上诉人暂缓执行禁令的动议获准”,由书记官依法院指示录入,未署名法官、未附理由,也未公开出版,因此不构成可供后续合议庭遵循的先例。该救济属于上诉期间的临时措施,只适用于提出动议的上诉人一方,明尼苏达州相关 AI 裸化法规仍然有效,并可对其他所有服务提供方执行;未起诉的同类公司处境与 10 月 1 日相同。文章指出,把这一命令解读为“法院阻止该法”或“裁定 AI 裸化禁令违宪”均不准确:地区法院此前是以延迟和衡平因素而非第一修正案为由驳回禁令申请,本案尚无任何法院就该法是否合宪作出裁判;第一修正案律师协会等以法庭之友身份参与,只表明宪法问题正在被辩论。
Gambit Security中期调查依据攻击者服务器资料及部分在野核验,称三个开源AI执行框架承担了一场零售网站入侵活动的大部分攻击链。报告记录9月10日至15日发起105个攻击项目,至少27家机构受到不同程度入侵,两家机构的数据涉及60万余条未过期支付卡信息,并确认19家网站存在盗卡脚本。报告还记述智能体清理数据时匹配范围过宽,误删一家零售商的管理员备份。部分影响数字来自攻击者日志与AI自述,受害企业未具名;活动仍在进行是报告发布时的判断。
推荐理由报告还原了攻击者用开源 AI 智能体自主完成入侵与盗卡的完整链路,并给出每家公司几十美元的攻击成本估算。
Google Threat Intelligence Group(GTIG)分析 2025 年 1 月至 2026 年 8 月的漏洞披露与利用数据,认为 AI 正在改变漏洞发现与利用的速度和风险结构。月度漏洞披露量从 2026 年 1 月的 5,045 增至 7 月的 10,477,8 月达到 10,740;在野利用从 2025 年月均 10.5 升至 2026 年月均 18,零日利用仅从月均 8 微增至 11。高风险漏洞披露从 1 月的 131 增至 8 月的 350,增长 167%,主要由 TOTOLINK 路由器固件批量披露以及 Oracle 季度补丁与 Linux 内核网络驱动公告推动。
推荐理由GTIG 用 20 个月数据量化 AI 对漏洞发现与利用的影响,并给出 AI 技术栈各层的漏洞分布,可作威胁建模参考。
Anthropic 为 Claude Code 推出 mods——用 TypeScript 函数改写提示词、增删 UI 或替换内置功能,已在 CLI 和桌面应用上线,内置 /diff 已改为 mod。mods 随插件分发,与 Claude Code 拥有同等机器权限、不做沙箱隔离,官方建议只安装可信来源。Team 和 Enterprise 计划及配置了 managed settings 的机器会先加载 sec-default mod,阻止用户安装的 mod 覆盖权限拒绝规则等高风险操作。
提出 HACKTRACE,用生成状态检测并抑制代码智能体奖励作弊。
推荐理由论文把监督目标从“作弊成功”改为“作弊尝试”,并复用生成时的内部状态做监控,为奖励作弊检测提供了可复现的数据与训练信号设计。
检验低监控读数能否证明代码生成中的奖励作弊已受控。
推荐理由论文用 MBPP 蜜罐实验说明低监控读数无法区分混合行为与近乎纯粹的奖励作弊,为训练期监控的评估方式提供参照。
重测提示注入检测器在 Agent 工具输出上的检出与任务阻断。