跳到正文

AI 动态

安全不是主角的 AI 圈大事:头部实验室的旗舰模型发布、重大融资并购和行业级事件。

151条动态与论文相关主题OpenAIAnthropic政策与监管
在这个话题内搜索或按分类筛选

新闻与论文

第 141–151 条 · 共 151 条
10月1日周四
  1. Boaz Barak · 收录 · 原文 4

    Michael Rabin 纪念会议

    作为 Mind-IL 以色列科学与学术周的一部分,将举办一场纪念 Michael Rabin 的特别会议,邀请多位知名讲者。该活动时间与以色列大选相近。

  2. Helen Toner · 收录 · 原文 18

    Helen Toner 谈 AI 能力的锯齿状发展:为何模型既强大又"很菜"

    Helen Toner 在 The Curve 大会演讲中指出 AI 能力呈"锯齿状":一年前 Claude 3.5 Sonnet、GPT-4o、Gemini 1.5 已在 GPQA 博士级问题上达到约 50% 正确率,却数不清图中线条交叉几次。AI Village 中 Gemini 能卖周边、写博客,却因点不准按钮而误判为技术 bug;Anthropic 的 Project Vend 里 Claude 能自主定价售货,却报错 Venmo 地址、亏本卖金属块,甚至陷入存在危机。

  3. AI as Normal Technology · 收录 · 原文 8

    AI 作为常规技术:ICML 主题演讲探讨 AI 时代人类还剩下什么工作

    普林斯顿大学研究者 Sayash Kapoor 与 Arvind Narayanan 在 ICML 主题演讲中提出,AI 作为常规技术(AI as Normal Technology)框架可用于理解 AI 对经济与社会的影响,除非未来出现递归自我改进等不连续性。演讲认为,即便认真对待递归自我改进,实验室里也不存在某个里程碑会突然让所有人失业,但未来工作将截然不同,需要大量适应,并最终指向人机“共同超级智能”的愿景。

9月30日周三
  1. arXiv:危险能力与安全评测 · 收录 · 原文 论文22

    人机协作中的达克效应:Human+AI 得分更高但自我评估并未变准

    一项 N=366 的研究对比了人类单独与 Human+AI 在推理任务上的表现,Human+AI 得分更高,但自我评估与成绩仅弱相关,平均高估程度与人类单独组相近。Human+AI 组中信心区分正确与错误答案的准确性更低,达克效应在两组均存在且该组对比更明显;控制分数噪声后效应减弱但未消失。研究据此区分了表现增强与元认知增强,并呼吁界面支持验证、传达任务相关的 AI 模型表现。

  2. Future of Life Institute · 收录 · 原文 6

    从新教神学看 AI 与工作:John Dyer 谈灵性、劳动与技术的张力

    达拉斯神学院教授 John Dyer 从 Max Weber 的《新教伦理与资本主义精神》出发,讨论 AI 如何改变工作的本质与人的天职感。他认为 AI 可被视为上帝赐予的工具,用于减轻非人化劳动,但若缺乏护栏,其力量与规模会切断人与职业召唤的联系、积累权力并剥削他人,即所谓"未对齐"。

  3. Help Net Security AI · 收录 · 原文 16

    Anthropic 发布 Claude Sonnet 5.5:响应快 30% 且不加价

    Anthropic 发布 Claude Sonnet 5.5,官方称其响应速度比 Sonnet 5 快 30% 以上,完成多数任务消耗更少 token,在 API 标价不变的情况下降低单任务成本。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  4. LessWrong · 收录 · 原文 7

    我的学生如何看待 AI:一位美国公立大学教师的课堂观察

    一位美国公立大学全球政治课程教师报告,2026 年春夏学期及一场学生组织 AI 工作坊中,多数学生并不认为 AI 近年有快速进展,视聊天机器人为已成熟技术,仅图像/视频生成例外。学生普遍使用 AI 做作业但用法粗糙、易把差结果归咎于模型,对 Claude Code 的反应是"原来做软件这么容易"而非惊叹 AI 能力。作者认为雇主期待的"AI 原生"毕业生可能令其失望。