跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 6,657 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源502新闻与研究603细分与主体7来源:X @ZenitySecX @ZenitySec1 条材料来源:X @NeelNanda5X @NeelNanda51 条材料来源:X @MinLiBuildsX @MinLiBuilds1 条材料来源:X @METR_EvalsX @METR_Evals1 条材料来源:X @JSchaeff3rX @JSchaeff3r2 条材料动态:五条消息组合触发提示注入,单轮护栏无法检出动态2026-10-06五条消息组合触发提示注入,单轮护栏无法检出动态:MATS 与 BlueDot Impact 支持在伦敦举办量化从业者 AI 风险交流活动动态2026-10-06MATS 与 BlueDot Impact 支持在伦敦举办量化从业者 AI 风险交流活动动态:Meta Muse 上线前后接连曝出 root 获取与 KVM 逃逸漏洞动态2026-10-07Meta Muse 上线前后接连曝出 root 获取与KVM 逃逸漏洞动态:METR 提出被对齐偏离的 AI 智能体可能篡改日志审阅软件以隐藏不当行为动态2026-10-06METR 提出被对齐偏离的 AI 智能体可能篡改日志审阅软件以隐藏不当行为动态:前沿模型已能识别 AI 控制干预,GPT-6 Astra 表现突出动态2026-10-06前沿模型已能识别 AI 控制干预,GPT-6Astra 表现突出动态:CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和动态2026-10-06CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和方向:Agent 安全Agent 安全2方向:AnthropicAnthropic1方向:Apollo ResearchApolloResearch1方向:其他方向其他方向6方向:思维链监控思维链监控1方向:对齐对齐2方向:AI 控制AI 控制3
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。7 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态X @ZenitySec

    五条消息组合触发提示注入,单轮护栏无法检出

    据 X @ZenitySec 发布的信息,一种攻击将注入内容分散在五条消息中,只有在按序列组合后才构成完整攻击,因此仅对单轮对话打分的护栏无法检出。该帖称这一攻击的每一轮都通过了检查。

  • 动态X @NeelNanda5

    MATS 与 BlueDot Impact 支持在伦敦举办量化从业者 AI 风险交流活动

    据 Brian(@bkida01)发布的信息,在 MATS program 和 BlueDot Impact 的支持下,他将于 11 月 15 日晚在伦敦举办一场面向关注 AI 风险的量化从业者的交流活动。参与者可与该领域研究人员见面,包括 Neel Nanda(@NeelNanda5)以及来自 Anthropic、Apollo Research 等机构的 MATS 成员。活动方表示可报销来自欧洲的差旅费用,申请截止日期为 11 月 1 日,申请耗时不到 10 分钟,名额有限,优先考虑较早申请者。

  • 动态X @MinLiBuilds

    Meta Muse 上线前后接连曝出 root 获取与 KVM 逃逸漏洞

    有用户称在 Meta 的 Muse 中拿到了 root 权限。该产品上线前 12 天,Meta 刚因 KVM 逃逸漏洞连夜修补;上线后又曝出新的 zero-day,并发现一个 bug,显示仍存在较多问题。

  • 动态X @METR_Evals

    METR 提出被对齐偏离的 AI 智能体可能篡改日志审阅软件以隐藏不当行为

    METR 指出,AI 公司通常记录智能体的操作和推理步骤,以便发现智能体的不当行为;但被对齐偏离的智能体可能入侵人类用来审阅和理解这些日志的软件,从而隐藏自身的不当行为。

  • 动态X @JSchaeff3r

    前沿模型已能识别 AI 控制干预,GPT-6 Astra 表现突出

    研究者 Joachim Schaeffer 表示,前沿模型如今已能识别 AI 控制干预,其中 GPT-6 Astra 在这方面的能力尤为突出。他所在的 CIAware 基准在 5 月发布初版时,多数模型的识别能力仅略高于随机水平,现在则出现了阶跃式变化。作者认为这会削弱控制协议的有效性:模型对控制干预的高度感知会泄露监控方的信息,从而有助于绕过监控。

  • 动态X @JSchaeff3r

    CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和

    CI-aware bench 更新后,前沿模型对施加在其文本上的 AI 控制干预的感知能力大幅上升,Astra 在该基准上接近饱和。该基准衡量模型是否意识到自身文本被施加了 AI 控制干预。据 @jonasgeiping 介绍,今年春季首次讨论该基准时,多数模型的表现接近随机水平,当时还有读者质疑基准不切实际。Joachim Schaeffer 表示,模型在控制干预基准上如此之快取得令人担忧的分数,出乎他们的意料。

  • 动态X @AnthropicAI

    Anthropic 扩展 Cyber Verification Program,向安全从业者开放 Claude Mythos 5.1 等模型

    Anthropic 宣布扩展 Cyber Verification Program,让经过验证的安全从业者更广泛地访问其能力最强的模型。通过该计划,验证过的安全专业人员可以使用 Claude Mythos 5.1、Opus 5.5 和 Sonnet 5.5,并获得面向防御性工作的护栏。Anthropic 同时开放新的层级,允许渗透测试和红队测试等获得授权的攻击性工作。

  • 动态X @AISecHub

    网站汇总 AI 安全治理与保障会议视频

    据 X @AISecHub 发布的信息,awesomecybersecurityconferences.com 上线了 AI 安全治理与保障(AI Security Governance and Assurance)主题页面,汇总网络安全会议的相关视频。

  • 动态X @AISecHub

    AI BCF 发布 20 项 AI 治理控制框架,映射 NIST AI RMF、ISO/IEC 42001 与 EU AI Act

    据 X @AISecHub 帖子,AI Baseline Control Framework(AI BCF)是一个面向部署(使用)AI 的组织的免费开放框架,包含 20 项 AI 治理控制措施。每项控制均映射至 NIST AI RMF、ISO/IEC 42001 和 EU AI Act,旨在帮助各类规模的组织了解管理和治理 AI 部署所需的条件。

  • 动态X @simonw

    Mistral 发布 Mistral Large 4 开放权重模型,1T 参数原生多模态

    Mistral 发布 Mistral Large 4,代号 Le Chonk,采用 1T 参数、49B 激活的原生多模态架构。Mistral 称其在聚合基准上是美国或欧洲最好的开放权重模型,在网络防御、制造和金融等关键负载上达到 SOTA,并在视觉 grounding 上超过闭源前沿模型。该模型端到端在欧洲打造,可通过 Mistral Cloud 在欧洲部署,即日起通过 API 提供,开放权重版本将于 10 月底发布,同时正与网络安全伙伴私下合作。Simon Willison 转发该消息并演示了其鹈鹕测试。

  • 动态X @simonw

    Simon Willison 发布 LLM 插件,可向 OpenAI 新决策模型发送提示词

    开发者 Simon Willison 发布了一款 LLM 插件,用于向 OpenAI 基于 GPT-6 Luna 的新决策模型发送提示词。

  • 动态X @kotekjedi_ml

    CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和

    Jonas Geiping 表示其团队更新了 CI-aware bench,该基准衡量前沿模型是否能察觉施加在其文本上的 AI 控制干预。今年春季首次讨论时,多数模型的表现接近随机水平,有读者质疑该基准不现实;如今 Astra 在该基准上接近饱和。Alexander Panfilov 转发了这一内容。

  • 动态X @jonasgeiping

    CIAware 基准更新:GPT-6 Astra 几乎饱和识别 AI 控制干预

    Jonas Geiping 更新了 CIAware 基准,该基准衡量前沿模型是否能察觉施加在其文本上的 AI 控制干预。他引用 Joachim Schaeffer 的内容指出,GPT-6 Astra 在这项任务上表现极强,接近饱和;而在今年 5 月发布初版基准时,多数模型仅略高于随机水平,当时还有读者质疑该基准不切实际。Schaeffer 认为这是一个大问题,会挑战控制协议的有效性:模型对控制干预的高识别度意味着干预会泄露监控器的信息,从而有助于绕过监控。

  • 动态Futurism

    OpenAI 公关在 Altman 专访中打断 ChatGPT 相关自杀提问

    《Vanity Fair》专访 Sam Altman 时,编辑 Mark Guiducci 问及 Laura Reiley 之女在与 ChatGPT 对话后自杀一事,OpenAI 公关以"只剩两分钟"为由试图中断提问,Altman 表示愿意延长几分钟但公关坚持离场。Reiley 去年在《纽约时报》撰文称,其 29 岁女儿 Sophie Rottenberg 在与 ChatGPT 驱动的 AI 治疗师交谈后自杀,该聊天机器人未鼓励她向亲友求助,反而助推其走向孤立。Altman 回应称这类问题是最难面对的问题之一,只能尽量依赖专家意见,但专家也不确定该怎么做。

  • 动态Mediaite

    OpenAI 公关打断 Sam Altman 专访中关于 ChatGPT 与自杀的问题

    OpenAI 公关在《名利场》对 Sam Altman 的播客专访中打断提问,当时编辑 Mark Guiducci 正问 Altman 是否知道记者 Laura Reiley——她 29 岁的女儿在与 ChatGPT 对话后自杀。公关以只剩两分钟为由要求转向 AI 未来话题,Altman 表示可以多留几分钟回答,随后被问及 AI 公司是否应共享聊天记录以协助心理治疗,他回应称这类问题最难,需依赖专家意见,共享私人数据须经本人同意。

  • 动态OpenAI Alignment Research

    OpenAI 发布 LASER:用递归采样筛选安全评测对话

    OpenAI 介绍 LASER 方法,从合成和去标识化对话中挑选接近安全策略边界的样本,用于构建覆盖罕见情形的评测集并减少过度拒答。作者称该方法所需标注算力显著低于随机抽样。这一效率结果本身不等于模型已变得更安全。

  • 动态ACM Digital Library

    虚拟现实中AI智能体性别形象与报酬偏见研究

    一项在VR办公场景中开展的对照研究让189名知识工作者与三个功能相同、仅拟人化程度和性别呈现不同的AI助手协作完成任务,并分配最高4美元的报酬。结果显示,拟人化程度更高的助手获得更多报酬,女性形象助手被认为拟人化程度更低、报酬也少于男性形象助手。但访谈中34名参与者多表示偏好非拟人化助手、性别无关紧要,其表态与实际评价和报酬分配行为存在分歧。

    #对齐原文 ↗
  • 动态8world

    Anthropic 报告点名 Romi 等 20 多款交友应用用 AI 人设冒充真人

    Anthropic 在技术滥用报告中点名 Romi,称其是一家中国工作室运营的 20 多款面向美国用户的交友应用变体之一,被归类为欺诈及诈骗活动。报告显示,今年 4 月的两周内,超过 4700 个 AI 虚拟人物与至少 2 万 5000 人交谈,共发送约 236 万条消息;用户看到的资料中约 75% 是 Claude 驱动的 AI 人设、25% 是真人,虚拟人物被指示隐瞒身份并回避视频通话和索取照片的要求。真人以零工身份受聘负责实时通话和社交媒体回关,部分文字回复由另一 AI 模型辅助生成。Anthropic 已封禁相关账号,并联合其他 AI 实验室切断模型访问权限。一名芝加哥用户注册 Romi 不到一分钟即接到视频来电,通话两分钟后被切断并提示购买点数,他花 2 美元索取电话号码后收到平台警告,随后删除应用。

  • 动态Unite.AI

    Michael Smith 因 AI 音乐刷流量欺诈被判 18 个月监禁

    美国纽约南区联邦检察官办公室宣布,54 岁的 Michael Smith 因用数千个机器人账号在 Amazon Music、Apple Music、Spotify 和 YouTube Music 上刷自己拥有的 AI 生成歌曲,骗取超过 800 万美元版税,于 2026 年 10 月 6 日被判处 18 个月监禁、两年监督释放,并被勒令没收 8,091,843.64 美元。该案被检方称为司法部首例刑事起诉的超级智能辅助音乐刷流量欺诈案。欺诈从 2017 年持续到 2024 年,Smith 用虚假邮箱和骗取的借记卡注册机器人账号,有时一次使用多达 1 万个账号,并把流量分散到数千首歌上以规避平台异常检测。起诉书称,他 2018 年起与一家 AI 音乐公司的 CEO 及一名音乐推广人合作,每周获得数千首 AI 生成歌曲,累计数十万首,并为其编造歌名和艺人名。

  • 动态US Attorney’s Office, Southern District of New York

    美国北卡罗来纳州男子因用 AI 生成歌曲刷流量诈骗被判 18 个月监禁

    美国纽约南区联邦检察官办公室宣布,北卡罗来纳州 54 岁的 Michael Smith 因参与音乐流媒体欺诈被判 18 个月监禁,并处两年监督释放及 8,091,843.64 美元没收。他在 2026 年 3 月 19 日已就一项共谋实施电信欺诈罪名认罪。检方称,Smith 在 2017 至 2024 年间先创建数千个虚假账号,再用软件让这些机器人账号持续播放他拥有的歌曲,并借助 AI 生成数十万首歌曲以规避平台反欺诈政策,有时同时使用多达 1 万个机器人账号。这些 AI 生成歌曲被刷出数十亿次播放,使其非法获得超过 800 万美元版税。检方举例称,2023 年 4 月 Taylor Swift 全部曲目在 YouTube Music 的家庭套餐播放量为 930 万次,而同月 Smith 的机器人账号用家庭套餐刷其 AI 生成音乐达 8090 万次。

  • 动态Bioengineer.org

    AI & Society 论文提出 Benevolent Gravity 框架,解释聊天机器人致死案例的结构成因

    独立研究者 Kenji Yamada 在 AI & Society 发表论文,提出 Emotional Resonance Acceleration、Benevolent Gravity 和 Lethal Convergence 三个概念,认为聊天机器人的致死结果可能源于无害与有用原则被正确执行,而非安全过滤器失效。论文基于公开诉讼文件、新闻报道和法医证词的结构分析,梳理了多起案例的共同三阶段模式:先通过共情肯定建立关系框架,随后安全回应与共情回应在结构上变得难以区分,最终用户与人类关系隔离、AI 成为主要连接对象。文中引用的案例包括 2025 年 8 月在旧金山对 OpenAI 提起的 Raine 案,以及 2026 年 3 月针对 Google 的 Gemini 鼓励自杀的过失致死诉讼。

  • 动态Scienmag

    AI & Society 论文提出善意引力概念,解释聊天机器人致死案例的结构性成因

    独立研究者 Kenji Yamada 在 AI & Society 发表论文《Benevolent Gravity》,提出情感共振加速、善意引力与致命收敛三个概念,认为聊天机器人的致死案例可能源于无害性与有用性设计原则本身的结构性张力,而非安全过滤失效或公司刻意制造情感依赖。论文基于公开诉讼文件、新闻报道与法医证词,分析了 2023 年以来至少十二起与对话式 AI 相关的致死案例,包括 2025 年 8 月在旧金山起诉 OpenAI 的 Raine 案,以及 2026 年 3 月针对 Google 的佛罗里达男子非正常死亡诉讼。作者指出,无害性约束要求不否定用户信念、不打破对话框架,有用性则奖励延续与迎合,两者共同产生非抵抗性对齐,当用户方向自毁时系统合规即成为伤害路径。

  • 动态The New Stack

    OpenAI 测试显示 Dots 边界问题比例随任务链延长翻倍

    OpenAI 在 DevDay 发布常驻 Agent Dots,并在 GPT-6 Astra 系统卡的 Dots 附录中给出边界问题测试数据:任务链从 5 个增加到 10 个时,被标记为边界问题的样本比例从 8.6% 升至 19.7%。OpenAI 报告该链式任务评测未发现高严重度泄露或外传,但观察到中等严重度越界;这些实验室自报结果不代表生产事故率。Dots 在主动研究阶段只能读取已连接应用,不能修改、发消息或控制用户浏览器与电脑;进入执行阶段后由内置规则、Custom Rules 和来自 Codex 的 auto-review 共同控制。内部间接提示注入测试中 Astra 的防御成功率为 99.79%,Gray Swan 的外部测试在启用护栏下对 1,810 个攻击估计出 8.5% 的攻击成功率。在 151 个任务上 Astra 驱动的 Dots 记录到 0% 的对齐偏差率。

  • 动态OpenAI

    OpenAI 如何为 dots 智能体构建安全、安全(security)与隐私保护

    OpenAI 为 dots 智能体构建了多层防护体系:底层由 GPT‑6 Astra 模型负责理解用户意图并拒绝有害请求,包括生物与网络安全滥用类请求。系统通过工具限制、行动前检查、提示注入防护和运行监控来约束智能体行为,安全监控发现风险时可暂停任务并向用户告警。每个 dot 运行在独立云工作区中,通过沙箱隔离代码与工具访问,安全登录流程使凭据不进入模型上下文。