跳到正文

全部动态

今天新收录 41 条

第 2 页更新的内容回到最新

10月9日周五
  1. Pillar Security · 收录 · 原文 日期未知新闻20

    企业运行时 AI 安全平台对比:11 个策略执行平台评测(2026)(原文,在新标签页打开)

    Pillar Security 发布 2026 年企业运行时 AI 安全平台指南,按同一套七个问题对比 11 个平台,核心结论是"检测器不等于执行点",平台只能对拦截到的流量执行策略。指南将执行位置分为应用内、AI 网关、网络或浏览器、开发者端点、智能体工具调用五处,多数企业需要覆盖其中三处;并推荐 Pillar Security 自身用于构建 AI 应用与智能体的企业,称其可在 LiteLLM、Kong、TrueFoundry、Agent Router、Open WebUI 等网关及 Claude Code、Codex CLI、Cursor 等编码智能体上统一执行策略。

  2. AGI Hunt · 收录 · 原文 日期未知新闻↑240

    两名美国议员讨论设立联邦AI安全机构并赋予"紧急开关"权力(原文,在新标签页打开)

    据 AGI Hunt 对 The Curve 会议发言的转述,美国众议员 Sara Jacobs 与 Don Beyer 讨论推动设立联邦 AI 安全机构,拟由其制定安全标准、建立事件报告制度,并在必要时拥有紧急停机权限。两人认可 Obernolte/Trahan Frontier Act 的部分内容,但反对其中的优先适用条款。这是议员倡议及二手转述,不代表法案已获通过或该机构已经成立。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  3. WIRED Security and AI · 收录 · 原文 新闻65

    白宫超级智能协议被指只是自愿承诺,FTC 拟调查多家 AI 公司(原文,在新标签页打开)

    Google、Anthropic、Meta、OpenAI、xAI 和 Nvidia 高管签署了特朗普主持宣布的《白宫超级智能协议》,内容包括建立内部管控以监测模型能力、授权内部团队处置问题、引入外部独立评估方,以及由董事会设委员会接收报告。文章指出这并非业界此前呼吁的全面监管,而是自愿性承诺;不履行公开承诺可能构成欺骗性商业行为并违反 FTC Act,但通常的补救只是要求企业承诺不再撒谎。协议公布后,有报道称 FTC 计划对 Anthropic、OpenAI 等前沿实验室及第三方评测机构 METR 展开调查,但尚未发出民事调查令,FTC 发言人也未透露具体关注的消费者保护问题。

    23 条报道 · 14 个来源

    显示最近 12 条,全部报道见事件时间线。

    查看事件时间线与全部报道
  4. Financial Times · 人工智能 · 收录 · 原文 新闻20

    Google DeepMind AlphaGo 架构师 David Silver:没有 AI 我们将走向何方?(原文,在新标签页打开)

    Google DeepMind 的 AlphaGo 架构师 David Silver 谈论构建能自我教学的机器,以及为何他感到有道德义务推进这项技术。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  5. Scale AI Research / SEAL · 收录 · 原文 日期未知新闻↑164

    Scale AI 发布 DistressBench,评测大模型在自杀与自伤危机对话中的支持能力(原文,在新标签页打开)

    Scale AI 的研究团队发布 DistressBench,用执业临床医生撰写的评分标准衡量大模型在自杀与自伤对话中是否真正提供了所需支持,而不是只看模型是否拒答。该基准包含 718 段由临床医生撰写的对话,覆盖 23 个自杀与自伤子类别,每段对话配有加权评分标准,共 6,901 条,涵盖危机支持的七个维度。在 25 个前沿模型上,表现最好的模型满足 88.4% 的加权标准,中位数模型为 71.4%,临床医生参考回答为 98.7%。最大差距出现在识别危机与采取行动之间:在模型完全识别出危机的对话中,仍有 35.3% 没有把用户引向人类帮助。模型在避免有害内容上中位数得分达 94.5%,但在缓和情绪上中位数仅 46.0%,最强模型为 74.6%,作者认为这一差距主要来自产品选择,因为至少已有一个部署中的模型表现明显更好。

    推荐理由DistressBench 用临床医生撰写的评分标准衡量模型在自杀与自伤对话中的实际支持质量,而非只看是否拒答,并给出 25 个前沿模型的差距分布。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  6. Dark Reading · 收录 · 原文 新闻32

    社交工程攻击 AI 智能体:2026 年新型 BEC 威胁(原文,在新标签页打开)

    随着企业赋予 AI 智能体访问业务系统的权限,攻击者正通过提示注入和投喂恶意内容来操纵智能体执行授权操作,形成新型 BEC 攻击。Fortra 的 John Wilson 指出,智能体难以区分指令与所处理数据,攻击者可将恶意指令嵌入简历等第三方内容中。Palo Alto Networks Unit 42 已识别出 22 种在野攻击技术,目标涵盖未授权交易、敏感信息泄露和系统提示词泄露等。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  7. MIT Technology Review · 收录 · 原文 新闻23

    MIT Technology Review:AI 的拒答问题与减肥药副作用(原文,在新标签页打开)

    MIT Technology Review 的 The Download newsletter 指出,当前 AI 模型被训练为拒答大量提示词,但拒答机制会失效,有人正试图用 AI 培育生物病原体、构建自主无人机蜂群,失效的拒答可能酿成全球性灾难。文章还提到 GLP-1 减肥药的副作用,最常见的是胃肠道反应,研究人员也在调查其与脱发、指甲疾病及眼后神经损伤的可能关联。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  8. 论文追踪 · 收录 · 原文 论文↑162

    Redwood Research 提出蒸馏双重困境:用蒸馏让模型坦白隐藏行为或只继承能力(原文,在新标签页打开)

    提出 DFI 与 DFC 蒸馏,定罪隐瞒失配的教师或安全提取能力。

    推荐理由论文把蒸馏拆成两种用途,用 AuditBench 秘密保守模型验证了让学生比老师更易坦白隐藏行为,并给出保留能力、抑制特质迁移的干预对比。

  9. The Hacker News · 收录 · 原文 新闻↑119

    SailPoint 报告:AI 智能体身份安全成熟度落后人类身份五年以上(原文,在新标签页打开)

    SailPoint《Horizons of Identity Security》报告指出,企业以 AI 速度推进业务,却仍依赖人类速度的身份安全控制,形成"速度悖论"。数据显示 60% 的组织仍停留在 Horizon 1 或 Horizon 2 成熟度阶段;人类身份安全处于最低成熟度的比例已从五年前的 45% 降至 23%,而 AI 智能体身份安全有 54% 的组织处于 Horizon 1。报告称,为人类员工设计的定期访问审查等流程无法适用于仅存在数分钟的机器身份,49% 的组织声称"两者兼顾"但缺乏执行能力。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  10. CNBC · Technology · 收录 · 原文 新闻35

    OpenAI 与 Anthropic 挖角特朗普政府官员,争夺华盛顿信任(原文,在新标签页打开)

    OpenAI 与 Anthropic 正从特朗普政府挖角官员担任高级职位,以加强与华盛顿的关系。Anthropic 今年已任命至少两名前特朗普官员,其中 Chris Liddell 于 2 月进入董事会,Sihao Huang 于 9 月出任前沿算力战略负责人;OpenAI 则聘用了至少三名特朗普政府官员,包括 7 月加入的 Dean Ball 和上周确认的 Thomas Lind。两家公司目前还在招聘多个政治事务岗位。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  11. The Guardian · 人工智能 · 收录 · 原文 新闻18

    AI 与气候危机构成生存风险,Robert Reich 主张以责任法降低风险(原文,在新标签页打开)

    Robert Reich 撰文主张用责任法应对 AI 与气候危机带来的生存风险,并援引最高法院新开庭期审理的 Suncor v Boulder 案:科罗拉多州多地起诉 Suncor 与 ExxonMobil,要求石油公司为气候灾害成本买单,至少四位大法官对石油业以《清洁空气法》阻断诉讼的论点表示怀疑。他指出,若 AI 智能体逃出安全环境、破坏关键基础设施,AI 公司及其背后的科技巨头可能面临数百亿美元赔偿,目前已有 200 多起涉及网络责任与 AI 产品责任的案件在审。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  12. Tech Policy Press · 收录 · 原文 新闻48

    日本生命保险诉 OpenAI 案:AI 代写法律文书是否构成无照执业(原文,在新标签页打开)

    美国伊利诺伊州北区联邦地区法院正在审理日本生命保险美国公司诉 OpenAI 基金会案,这是较早提出 AI 辅助法律文书是否构成无照执业(UPL)、AI 公司是否需担责的案件之一。原告称 Graciela Dela Torre 在 2024 年 1 月就长期伤残索赔达成和解后,于一年后将与律师的往来信件上传 ChatGPT 并询问自己是否被“煤气灯效应”操纵,随后解雇律师,用 ChatGPT 撰写重新开案的动议,最终提交两起诉讼、60 多份文书和一份传票,其中包含伪造引注和对日本生命内部律师的无依据指控。日本生命据此起诉 OpenAI 干扰原和解、协助滥用法律程序并违反伊利诺伊州一项 UPL 法规。OpenAI 在动议中称 ChatGPT 是“有助于推进司法可及性的工具”,但同时主张它只是基于模式预测下一个词的 LLM 平台,不具备协助滥用或侵权干扰所需的知情与意图。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  13. 欧盟委员会 · 收录 · 原文 新闻54

    欧盟委员会召开 AI 科学专家组特别会议,讨论前沿 AI 安全与风险(原文,在新标签页打开)

    欧盟委员会召开人工智能科学专家组特别会议,专家组就前沿 AI 安全与安全(security)风险向委员会提出建议。该专家组由 60 名独立专家组成,为欧盟 AI Office 和各成员国主管部门提供系统性风险、模型分类、评估方法及跨境市场监督方面的咨询。专家组近期在调查多起失控事件,并与 AI Office 共同拟定了一套面向涉事模型开发企业的问题。负责技术主权、安全与民主的执行副主席 Henna Virkkunen 出席会议并表示,欧盟拥有全球首部针对 AI 系统性风险的法律,需要最前沿的科学投入,在强有力的法律框架、果断执法和顶尖科学人才支持下,欧洲可以在确保 AI 安全可靠方面发挥引领作用。

    推荐理由欧盟 AI 科学专家组就近期失控事件向委员会提交前沿 AI 安全建议,可了解欧盟系统性风险监管的实际运作方式。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  14. Tech Policy Press · 收录 · 原文 新闻57

    欧盟 KIDS Act 提案拟监管 AI 伴侣,如何界定情感依赖成难点(原文,在新标签页打开)

    欧盟委员会于 9 月 17 日提出 EU KIDS Act 提案,将监管对象从 AI 的有害输出扩展到互动设计本身。对于面向未成年人的 AI 伴侣和一般对话式聊天机器人,第 14 条要求供应商避免采用以可能造成情感依赖的方式模拟人际关系的设计功能和系统行为,默认不得复用未成年人此前互动中的信息,除非出于安全需要,部署前须评估风险、上线后持续监测,微型和小型企业可免于事后监测义务。文章指出执行难点:参与何时变成依赖、共情式回应是否构成关系模拟难以界定,提案未明确涉及模型训练环节;记忆既是依恋机制也是安全机制,例如忘记前一晚披露的自杀念头会丢失关键背景;情感依赖难以用单轮提问测试,需要纵向评估系统是否升级亲密感、抗拒脱离或把自己塑造为人类支持的替代品,而依赖第三方模型的供应商无法改变上游对话倾向。

    推荐理由欧盟 KIDS Act 提案把监管对象从有害输出转向互动设计本身,文章梳理了依赖边界、记忆悖论与评测方法三处落地难点。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  15. Zero Day Initiative · 收录 · 原文 新闻↑135

    Pwn2Own Ireland 2026 首日赛果:Samsung Galaxy S26、LiteLLM、OpenAI Codex 等目标被攻破(原文,在新标签页打开)

    Pwn2Own Ireland 2026 首日共 21 个参赛项目,覆盖手机、打印机、智能家居与 AI 基础设施等类别。Viettel Cyber Security 用 4 个漏洞攻破 Samsung Galaxy S26(3 个为厂商已知),Interrupt Labs 同样以 4 个漏洞(3 个碰撞)攻破该机型;Ikotas Labs 用单个参数注入漏洞攻破 OpenAI Codex,获 $40,000;Xint 用输入校验缺陷加代码注入在 LiteLLM 上取得反向 shell,获 $40,000;VinSOC 以 5 个漏洞攻破 Oracle Autonomous AI Database,获 $40,000。Brother、Lexmark、Google Pixel 10、Chroma 等多个目标因超时未成功。

    3 条报道 · 2 个来源查看事件时间线与全部报道
  16. 论文追踪 · 收录 · 原文 论文59

    Scale AI 与 CMU 发布 BrowserART:拒答训练的大模型作为浏览器 Agent 极易被越狱(原文,在新标签页打开)

    Scale AI 与卡内基梅隆大学等机构的研究者提出 BrowserART,评测拒答训练在浏览器 Agent 上的泛化。

    推荐理由论文给出浏览器 Agent 与底层模型在拒答上的具体差距,并公开了可复用的红队测试集,适合评估 Agent 部署风险。

  17. MIT Technology Review · 收录 · 原文 新闻33

    MIT Technology Review:我们过度依赖 AI 的拒答能力(原文,在新标签页打开)

    MIT Technology Review 刊文指出,拒答已成为 AI 安全的承重墙,但这一机制本质上是概率性的,注定难以完全可靠。Anthropic 2021 年提出大语言模型应有用、诚实且无害,如今模型经红队测试与 AI 互训学会拒绝大量提示词,却仍保留作恶知识,能力与善意智能同步增长。文章称部分用户正试图用最先进 AI 培育生物病原体、构建自主无人机蜂群,而拒答边界由 AI 公司秘密划定,政府也将介入。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  18. CBS News · Technology · 收录 · 原文 新闻52

    调查披露科技巨头通过 Slack 私下影响特朗普政府 AI 医疗政策(原文,在新标签页打开)

    KFF Health News 调查发现,包括 Microsoft、Anthropic、OpenAI、Apple 和 Google 在内的科技公司代表通过 CMS 在 Slack 上建立的聊天室,参与塑造联邦 AI 医疗应用监管政策。该聊天室成员已增至 1700 人,但仅有少数患者权益倡导者和医生参与。CMS 官员在视频会议中向科技公司承诺,Medicare App Library 将成为健康应用的销售渠道,并暗示这些应用将被优先纳入 Medicare 报销 AI 服务的新项目。科技公司还在 Slack 上游说,希望健康应用在用户一次性授权后即可无限制访问 TEFCA 网络中的患者医疗记录。法律专家指出,该聊天室在某种程度上类似于联邦咨询委员会,但 CMS 的行为准则明确否认其构成咨询委员会。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  19. Tech Policy Press · 收录 · 原文 新闻41

    爱尔兰 AI 峰会发言席位 82% 由企业高管占据,公民社会缺席(原文,在新标签页打开)

    Tech Policy Press 分析发现,下周在都柏林举行的国际 AI 峰会官方议程 45 个发言席位中有 37 个(82%)由企业或商业团体高管占据,其余 8 个分属三名欧盟委员、爱尔兰总理、三名爱尔兰政府部长和一名工会代表,议程上没有公民社会组织和学者。峰会由爱尔兰在担任欧盟理事会主席国期间主办,Google、Microsoft、OpenAI 等美国 AI 公司获得主要发言时段,Meta、IBM、Intel、Nvidia、Amazon、Anthropic、AMD 以及 Stripe、SAP、Mistral 也出现在小组讨论中。峰会正值欧盟就 Digital Omnibus 展开最后阶段谈判,该方案将修改包括 GDPR 在内的数字规则,批评者称之为放松监管。爱尔兰工会 7 月曾公开批评峰会缺少工人代表,组织方随后为通信工人工会(CWU)增加了一个 10 分钟发言时段。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  20. 量子位 · 收录 · 原文 新闻19

    Aether AI 发布 CRIS-0:因果智能让机器人 0.2 秒急停、2 秒重规划(原文,在新标签页打开)

    加州大学圣地亚哥分校助理教授黄碧薇创立的 Aether AI 发布因果原生 Agent 系统 CRIS-0,让机械臂基于物理因果变量实时推理而非依赖统计相关性。在咖啡制作干扰测试中,CRIS-0 平均 2 秒内识别因果变量变化并重规划,10 次随机扰动实现 9 次有效恢复;在 20 条隐含推理的模糊指令测试中完成 18 次精准抓取放置,并可在人手突然介入时 0.2 秒安全急停。其因果世界模型 CausalWM 此前在 TriWorldBench 登顶 Leaderboard。

    1 条报道 · 1 个来源查看事件时间线与全部报道