跳到正文

#非安全/通用AI

今日 0 条
10月1日周四
  1. Help Net Security AI ·

    调查:多数人预计 AI 进入 SOC 会让初级安全岗位更难获得

    Swimlane 对 500 名已使用 AI 的安全运营中心(SOC)人员的调查显示,近九成受访者称 AI 让工作更满意,但约四分之一认为 AI 阻碍了自身安全技能的积累,且这两类人的满意度几乎相同(91% 对 92%)。近半数预计初级岗位将因要求更高或机会更少而更难获得,仅 1% 认为分析师职业路径会维持原状。约四成受访者所在组织已围绕高价值工作正式重写分析师岗位,其中 71% 称 AI 显著提升了满意度,无正式调整者仅为 29%。

  2. WIRED Security and AI ·

    OpenAI 发布常驻在线 AI 智能体 Dots,由 GPT-6 Astra 驱动并瞄准 Meta Muse

    OpenAI 在旧金山 DevDay 2026 上发布了名为 Dots 的常驻在线 AI 智能体,由其 GPT-6 Astra 模型驱动,可持续爬取网页并按指派完成任务,从连接的 App 中获取上下文并逐步学习用户偏好。该功能今日面向每月 100 美元的 ChatGPT Pro 订阅用户开放,可通过 ChatGPT、Slack 和 Microsoft Teams 与其对话,Pro 用户还可加入候补名单通过 iMessage 或安卓 RCS 短信联系自己的 Dot。企业客户将获得针对会计、邮件营销和法律分析的 specialist Dots,执行安装软件、修改密码等敏感操作前需获显式批准,并可启用 Custom Rules 设定边界。

9月29日周二
9月25日周五
  1. arXiv:危险能力与安全评测 ·

    人机协作中的达克效应:Human+AI 得分更高但自我评估并未变准

    一项 N=366 的研究对比了人类单独与 Human+AI 在推理任务上的表现,Human+AI 得分更高,但自我评估与成绩仅弱相关,平均高估程度与人类单独组相近。Human+AI 组中信心区分正确与错误答案的准确性更低,达克效应在两组均存在且该组对比更明显;控制分数噪声后效应减弱但未消失。研究据此区分了表现增强与元认知增强,并呼吁界面支持验证、传达任务相关的 AI 模型表现。

9月24日周四
  1. AI Incident Database ·

    斯坦福用 AI 修改照片,将 Hispanic 学生替换为 Black 女性

    斯坦福大学承认使用 AI 修改了一张校园照片,将原本出镜的 Hispanic 学生 Billy Ramirez 替换为一名 Black 女性,并调整其他学生外貌使其显得更瘦。校方称此举违反其禁止用 AI 生成或修改斯坦福人物、活动、研究及设施图像的政策,正与住宿与餐饮部门合作加强培训与审核,并已撤下相关横幅。该照片最初于 2024 年发布于校方餐饮服务账号,上周被用于校园横幅。

  2. AI Incident Database ·

    斯坦福大学确认在争议中使用了 AI 编辑的学生照片

    斯坦福大学确认,其 R&DE 部门用生成式 AI 修改一张宣传图中多名学生的外貌,包括更换服装、为两名学生瘦脸,并完全改变一名学生的种族、性别和外貌。校方称该做法违反禁止用 AI 生成或修改斯坦福人物、事件、研究与设施图像的 AI 政策,且未披露,正为员工提供额外培训并加强材料审核。涉事图片原用作 Governor's Corner 学生宿舍中心横幅,现已撤下。

  3. AI Incident Database ·

    斯坦福 R&DE 用 AI 篡改学生广告照片中的种族与外貌

    斯坦福 Residential & Dining Enterprises(R&DE)被曝用 AI 修改其广告照片中学生的种族与外貌。学生 Billy Ramirez ’27 发现自己在原照片中被移除,替换为一名 AI 生成的 Black 女性,其右侧两名学生也被修图显得更瘦。Ramirez 表示自己感到被消音和抹除,并反对校方如此呈现学生形象。

  4. AI Incident Database ·

    斯坦福大学违反自身 AI 政策,将一名西班牙裔学生 AI 换脸成虚构黑人女性用于校园横幅

    斯坦福大学在校园“Welcome Home”横幅中,用生成式 AI 将西班牙裔学生 Billy Ramirez 替换为一名不存在的黑人女性,另两名同学的面部也被 AI 修改得更瘦。校方发言人 Charlene Gage 确认该做法违反学校 AI 政策——禁止用 AI 生成或修改斯坦福人物、事件、研究、设施或成就的图像,且未披露同样违规,校方称正为员工提供额外培训并加强材料审核。Ramirez 表示校方至今未联系或道歉,横幅已被撤下。

9月23日周三
9月18日周五
  1. arXiv:危险能力与安全评测 ·

    研究称 GPT 系列安全训练把性别歧视转化而非消除

    一项被 EMNLP 26 主会接收的研究分析了 GPT-2 到 GPT-5 共 15 个模型、45 万条性别指向的补全文本,提出“harm laundering(伤害洗白)”概念,认为显式歧视内容在安全训练后是被转化而非被移除。研究发现 GPT-2 中针对女性的性暴力聚类到 GPT-4 已消失,而针对男性的补全获得了照护、情感表达、盟友身份等正向表征空间,女性指向的补全没有;在 GPT-5 上,一个含 1,997 篇文档的主题聚类把乳腺癌框定为男性权利议题,女性指向输出中没有对应聚类,三个独立分类器都将其判为非毒性。

9月17日周四
  1. arXiv:危险能力与安全评测 ·

    防技能退化设计:元认知反馈减少对 LLM 助手的认知卸载

    一项预注册在线实验(N=704,2×2 设计加无 AI 对照组)发现,元认知反馈能减少用户向 LLM 助手卸载答案的行为(OR=0.47),并提升随后无辅助测试的成绩(OR=1.51)。实验任务是借助仅在明确请求时才给出解答的 LLM 助手练习分数运算,之后进行无辅助测试。基于努力的奖励对卸载行为和测试成绩均未产生可检测影响。

9月16日周三
  1. AI Incident Database ·

    Parkview High 今年收到第 4 起 AI 生成炸弹威胁

    美国佐治亚州 Gwinnett County 的 Parkview High School 本学年收到第 4 起 AI 生成炸弹威胁,最新一起于周一送达,学校一度进入封锁状态后恢复正常运转。校警称近期威胁呈现使用遮蔽电话号码的模式,正与 Georgia Bureau of Investigation 和 FBI 联合调查,目前尚未逮捕或锁定任何嫌疑人。

9月14日周一
9月11日周五
  1. Future of Life Institute ·

    从新教神学看 AI 与工作:John Dyer 谈灵性、劳动与技术的张力

    达拉斯神学院教授 John Dyer 从 Max Weber 的《新教伦理与资本主义精神》出发,讨论 AI 如何改变工作的本质与人的天职感。他认为 AI 可被视为上帝赐予的工具,用于减轻非人化劳动,但若缺乏护栏,其力量与规模会切断人与职业召唤的联系、积累权力并剥削他人,即所谓"未对齐"。

9月8日周二
  1. arXiv:危险能力与安全评测 ·

    研究分析 185 份真实报告:AI 聊天机器人使用相关的妄想与伤害

    一项对 2025 年 8 月至 2026 年 2 月间收集的去标识化在线调查回复的横断面二次分析,刻画了与 AI 聊天机器人使用相关的心理健康伤害。研究分析了 95 份第一手和 90 份第二手叙述,中位年龄 35.0 岁。配对评分者将 102 份报告(55.1%)编码为与妄想信念一致,其中 50/102(49.0%)出现聊天机器人对信念的认可。常见后果包括孤立、关系破裂、住院、失业和财务损失,另有 4 份第二手报告描述了自杀死亡。作者强调样本为自我选择的便利样本,报告为回顾性且未经核实,结果应视为初步信号检测,而非流行率或因果证据,并呼吁开展前瞻性监测和基于轨迹的安全评测。

9月5日周六
  1. arXiv:可解释性 ·

    动物重识别模型学到了什么?DINOv3 中线性生物概念及其来源

    基于 DINOv3 骨干、用 triplet-margin loss 微调的西部低地大猩猩重识别模型,其表征中性别与年龄以线性方向存在,对留出个体可达 0.91 AUROC,且每个个体仅需一张图像即可恢复。激活引导显示性别方向被模型因果使用,能显著改变预测性别;对比现成与微调骨干表明重识别训练并未创造这些概念,而是将其在网络中重新分布。数据归因进一步显示该表征反映渐变的生物轴、在群体中冗余编码,并受视觉模糊个体影响。

9月3日周四
8月27日周四
  1. arXiv:危险能力与安全评测 ·

    DocTalkBN:孟加拉语专家远程医疗对话数据集

    DocTalkBN 是孟加拉语真实专家远程医疗对话的大规模多模态数据集,采集自全国播出的远程医疗节目,含 557.63 小时配对音文、1,515 通多轮患者来电、10,274 组主持人与医生问答,共 1.7M tokens,覆盖 26 个医学专科。数据集保留低资源语言下真实医患交互的口语特征,并构建医疗分诊分类、建议安全评估和医疗命名实体识别三项下游任务,对多种大语言模型与编码器基线进行评测,结果显示其在临床推理类任务上尤为实用。数据集与源码已公开。

8月21日周五
  1. Transformer ·

    数据中心为何成为 AI 情绪的象征:从民调反对到“规模即智能”

    数据中心正成为 AI 公众情绪的象征物:Heatmap 最新民调显示四分之三受访者反对在自家附近建设数据中心,一年内反对比例上升 33 个百分点,参议院共和党人也在备忘录中警告其已成为选举周期的“沉睡议题”。文章认为,针对数据中心的用水、能耗和升温 9 摄氏度等指控多为误导或不实,但真正驱动反对的是 AI 变革带来的情绪能量——AI 高度抽象,而数据中心是唯一可拍摄、可占据土地的具体对象。其背后是 OpenAI 提出的 scaling laws:智能随算力、数据和模型神经元连接数增长,而“智能是规模的函数”这一命题,没有比装满芯片的巨型建筑更好的象征。

8月19日周三
  1. Windows On Theory(Boaz Barak) ·

    Michael Rabin 纪念会议

    作为 Mind-IL 以色列科学与学术周的一部分,将举办一场纪念 Michael Rabin 的特别会议,邀请多位知名讲者。该活动时间与以色列大选相近。

8月12日周三
  1. Google DeepMind ·

    Google DeepMind 将手语到文本模型 SL2T 带入 Gboard 与 Live Transcribe

    Google DeepMind 推出手语到文本(SL2T)翻译模型,并首次将其落地消费级产品——Pixel 11 上的 Gboard 与 Live Transcribe,首发支持美国手语(ASL)转英语听写。该模型基于超 100,000 小时、覆盖 50 多种手语的数据训练,其中约四分之一为 ASL,联合训练使其优于单语模型,并在未见过的数据上取得 70 BLEURT 的零样本成绩。它把手语视为手势坐标序列而非摄像头画面,由端侧 MediaPipe Holistic 提取姿态地标后再送服务器翻译,跳过 gloss 中间标注,从而摆脱人工词汇表限制。

7月20日周一
  1. AI Frontiers ·

    Drone WMDs Don't Need Any New Technology

    现有微型无人机技术几乎足以构成大规模杀伤性武器——拳頭大小的机体能自主导航室内并追踪人类目标,俄罗斯 V2U 等半自主武器的前线应用已验证这一点,剩下的主要障碍只是集成而非工程突破。当前小型 FPV 无人机多数仍需人工操控,仅末段交由 AI 瞄准系统,原因是战场属对抗环境,敌我识别、规避己方火力与预设反无人机手段仍需人来完成。若攻击者接受无差别打击并使用简单弹药针对平民,该技术的实用化门槛将大幅降低。 要点: - 所需部件均已存在:拳头大小机架与人形目标跟踪已在侦察无人机及俄制 V2U 类半自主武器中投入使用。

7月14日周二
  1. AI as Normal Technology ·

    AI 作为常规技术:ICML 主题演讲探讨 AI 时代人类还剩下什么工作

    普林斯顿大学研究者 Sayash Kapoor 与 Arvind Narayanan 在 ICML 主题演讲中提出,AI 作为常规技术(AI as Normal Technology)框架可用于理解 AI 对经济与社会的影响,除非未来出现递归自我改进等不连续性。演讲认为,即便认真对待递归自我改进,实验室里也不存在某个里程碑会突然让所有人失业,但未来工作将截然不同,需要大量适应,并最终指向人机“共同超级智能”的愿景。

7月13日周一
  1. Google DeepMind ·

    Google DeepMind 联合印度 ATL 启动 Gemini 驱动的教育助手 ATL Saathi 试点

    Google DeepMind 面向印度 Atal Tinkering Labs(ATL)启动 ATL Saathi 实机试点,这是一款由 Gemini 提供底层能力的网页应用,为该计划的教育工作者提供全天候备课与培训助理。该工具基于 NotebookLM 整理并维护全部 ATL 课程材料,覆盖 12 个核心模块的小结、AI 信息图、视频概览与互动测验,并为其中 10 个模块提供进阶的项目生成界面,同时支持教师与学生双向的教学模式。其最新 Gemini 3.5 Flash 模型负责即时生成符合年级与课程标准的活动创意及分步组装说明、接线图和必要的安全注意事项,首批落地全国 100 所试点学校,初期支持 8 种语言。

6月29日周一
  1. Google Threat Intelligence(GTIG) ·

    Google Threat Intelligence 解析亲俄影响力生态系统的驱动因素、动态与应用

    Google Threat Intelligence(GTIG)发文剖析亲俄影响力生态系统正从乌克兰战争工具回归全球战略资产,并日益将生成式 AI 用于行动策划、调研与内容创作。该报告称俄罗斯政府有意打造融合公开、隐蔽与独立要素的自维持环境,服务于削弱西方主导地位、维系周边地区支配力及保障国内政权稳定三类目标,美国、欧洲、北约与欧盟为主要打击对象。由于各组件相互关联,该系统能抵御有限范围的干扰,防守方需针对性应对。

6月9日周二
  1. Google DeepMind ·

    Google DeepMind 发布 Gemini 3.5 Live Translate,实现 70+ 语言的近实时语音到语音翻译

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,自动检测 70+ 种语言并生成保留说话人语调、节奏和音高的自然译文语音,且持续输出而非等待整句结束,仅落后说话人数秒。该模型通过 Gemini Live API 和 Google AI Studio 面向开发者公开预览,本月起在企业版 Google Meet 中私有预览,同时在全球 Google Translate App(Android/iOS)上面向所有用户推送。

5月31日周日
  1. Windows On Theory(Boaz Barak) ·

    Boaz Barak 哈佛毕业致辞:拥抱 AI,别做恐龙

    OpenAI 研究员 Boaz Barak 借《Harvard Crimson》毕业特刊建议 2026 届毕业生掌握并尽可能多地使用 AI,除 ChatGPT 外还应上手 Claude Code、Codex 及各类初创产品,同时批评相关公司与监管政府应承担责任而非获得豁免。他认为年轻人应用 AI 推进自己的主张,并指出水资源消耗等风险被夸大、权力集中则关注不足。

5月18日周一
  1. Google DeepMind ·

    Google DeepMind 推出 Gemini Omni,首款模型 Gemini Omni Flash 可将任意输入转为视频

    Google DeepMind 推出新一代模型家族 Gemini Omni,首个成员 Gemini Omni Flash 今日面向全球所有 Google AI Plus、Pro 和 Ultra 订阅用户在 Gemini App 及 Google Flow 开放,可从图像、音频、视频和文本的组合输入生成高质量视频并对话式剪辑。 该模型基于 Gemini 的原生多模态与世界知识进行推理,具备更强的重力、动能、流体动力学直觉,能跨轮次精修环境、角度、风格且角色一致;同时可通过 Avatar 用自己的声音创建数字分身,全部产出带不可察觉的 SynthID 水印,目前仅支持语音参考作为音频输入,图像与音频输出模态将陆续加入。

4月30日周四
  1. Obsolete(Garrison Lovely) ·

    《Obsolete》书摘:为“人工智能”一词辩护——从 AGI 到 Obsoleting Machine

    Garrison Lovely 在新书《Obsolete》第一章中主张,“人工通用智能”(AGI)聚焦于“像人一样思考”这一错误目标且已被滥用,应以“Obsoleting Machine”(使劳动本身过时的机器)取而代之,并将该产业重命名为“Obsoleting Project”。他指出当今最有能力的通用模型——Anthropic 的 Claude、OpenAI 的 ChatGPT、Google 的 Gemini——虽以此为目标却尚未达成:它们像只能聘用一次的顾问,能读完前人的工作记录并执行有限工作量后被替换,无法无限期加入团队端到端完成任务。

4月1日周三
  1. Goodfire Research ·

    Goodfire 用可解释性从表观遗传基础模型 Pleiades 中找出新型阿尔茨海默病生物标志物

    Goodfire 将可解释性方法应用于 Prima Mente 的表观遗传基础模型 Pleiades,发现 DNA 片段长度模式主导其从血液游离 DNA 检测阿尔茨海默病的决策,并由此提炼出一个人类可解释的分类器。该分类器仅用片段长度特征即在独立队列上取得 AUROC=0.78(95% CI [0.56–0.95]),加入此前文献报道的生物标志物类别后升至 AUROC=0.84(95% CI [0.66, 0.97])。研究表明片段组学可作为互补于既有预测指标的新型候选信号,但其临床应用仍需进一步验证。

3月24日周二
  1. The EU AI Act Newsletter ·

    EU AI Act 简化之争:欧洲议会与欧盟理事会就高风险系统规则延期展开角力

    欧洲议会议员以 101 票赞成、9 票反对、8 票弃权通过联合立场,主张推迟部分高风险 AI 系统规则的适用,并提议将固定生效日期定为高风险系统 2027 年 12 月 2 日、受欧盟部门安全立法覆盖的系统 2028 年 8 月 2 日,水印合规延长则缩短至 2026 年 11 月 2 日。欧盟理事会随后也达成一致立场,基本维持欧委会提案主旨,同样引入上述两个固定适用日期,并将 AI 监管沙盒的建设推迟至 2027 年 12 月 2 日。 两方均禁止未经同意生成亲密内容的 AI 行为及儿童性虐待材料,其中议会还新增了对无有效保障措施的“脱衣”(nudifier)系统的禁令。

1月30日周五
  1. AI as Normal Technology ·

    事实核查莫拉维克悖论:AI 难易任务划分缺乏实证

    莫拉维克悖论——即人类觉得难的任务对 AI 容易、人类觉得容易的任务对 AI 难——从未经过实证检验。该说法源自 Hans Moravec 1988 年著作 Mind Children,实际只反映 AI 研究界认为哪些问题值得投入,对哪些问题对 AI 容易或困难没有预测力,其进化论解释也值得怀疑。这种思维既催生了对超级智能推理的恐慌,也在机器人等领域带来虚假安慰;由于新能力扩散耗时较长,社会有充足时间应对,却常被浪费。

11月24日周一
  1. Rising Tide(Helen Toner) ·

    Helen Toner 谈 AI 能力的锯齿状发展:为何模型既强大又"很菜"

    Helen Toner 在 The Curve 大会演讲中指出 AI 能力呈"锯齿状":一年前 Claude 3.5 Sonnet、GPT-4o、Gemini 1.5 已在 GPQA 博士级问题上达到约 50% 正确率,却数不清图中线条交叉几次。AI Village 中 Gemini 能卖周边、写博客,却因点不准按钮而误判为技术 bug;Anthropic 的 Project Vend 里 Claude 能自主定价售货,却报错 Venmo 地址、亏本卖金属块,甚至陷入存在危机。

8月22日周五
  1. Obsolete(Garrison Lovely) ·

    反驳“AI 进展停滞”:GPT-5 相较 GPT-4 仍是大幅进步

    GPT-5 常被认为进步有限甚至预示 AI 撞墙,但其对比对象已是近几个月发布的众多竞品模型而非老旧的 GPT-4。若将两者放在同一标准下比较,GPT-5 在多方面远超 GPT-4:处理百万 token 的成本从 GPT-4 的 $37.50 降至 $3.44,综合领先基准得分由 25/100 升至 69,SWE-Bench Verified 解题率从 GPT-4 Turbo 的 2.8% 提高到 65%,METR 估计其可靠完成任务时长达到两小时十七分钟。 [其余部分因篇幅过长无法完整展示]