跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 6,675 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源402新闻与研究603细分与主体7来源:X @AnthropicAIX @AnthropicAI1 条材料来源:X @AISecHubX @AISecHub2 条材料来源:X @simonwX @simonw2 条材料来源:X @kotekjedi_mlX @kotekjedi_ml1 条材料动态:Anthropic 扩展 Cyber Verification Program,向安全从业者开放 Claude Mythos 5.1 等模型动态2026-10-06Anthropic 扩展 Cyber VerificationProgram,向安全从业者开放 Claude Myt…动态:网站汇总 AI 安全治理与保障会议视频动态2026-10-06网站汇总 AI 安全治理与保障会议视频动态:AI BCF 发布 20 项 AI 治理控制框架,映射 NIST AI RMF、ISO/IEC 42001 与 EU AI Act动态2026-10-07AI BCF 发布 20 项 AI 治理控制框架,映射NIST AI RMF、ISO/IEC 42001 与 EU…动态:Mistral 发布 Mistral Large 4 开放权重模型,1T 参数原生多模态动态2026-10-06Mistral 发布 Mistral Large 4 开放权重模型,1T 参数原生多模态动态:Simon Willison 发布 LLM 插件,可向 OpenAI 新决策模型发送提示词动态2026-10-07Simon Willison 发布 LLM 插件,可向OpenAI 新决策模型发送提示词动态:CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和动态2026-10-06CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和方向:AnthropicAnthropic1方向:AI 与网络攻防AI 与网络攻防1方向:危险能力危险能力1方向:政策与监管政策与监管2方向:其他方向其他方向5方向:AI 动态AI 动态2方向:AI 控制AI 控制1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。5 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态X @AnthropicAI

    Anthropic 扩展 Cyber Verification Program,向安全从业者开放 Claude Mythos 5.1 等模型

    Anthropic 宣布扩展 Cyber Verification Program,让经过验证的安全从业者更广泛地访问其能力最强的模型。通过该计划,验证过的安全专业人员可以使用 Claude Mythos 5.1、Opus 5.5 和 Sonnet 5.5,并获得面向防御性工作的护栏。Anthropic 同时开放新的层级,允许渗透测试和红队测试等获得授权的攻击性工作。

  • 动态X @AISecHub

    网站汇总 AI 安全治理与保障会议视频

    据 X @AISecHub 发布的信息,awesomecybersecurityconferences.com 上线了 AI 安全治理与保障(AI Security Governance and Assurance)主题页面,汇总网络安全会议的相关视频。

  • 动态X @AISecHub

    AI BCF 发布 20 项 AI 治理控制框架,映射 NIST AI RMF、ISO/IEC 42001 与 EU AI Act

    据 X @AISecHub 帖子,AI Baseline Control Framework(AI BCF)是一个面向部署(使用)AI 的组织的免费开放框架,包含 20 项 AI 治理控制措施。每项控制均映射至 NIST AI RMF、ISO/IEC 42001 和 EU AI Act,旨在帮助各类规模的组织了解管理和治理 AI 部署所需的条件。

  • 动态X @simonw

    Mistral 发布 Mistral Large 4 开放权重模型,1T 参数原生多模态

    Mistral 发布 Mistral Large 4,代号 Le Chonk,采用 1T 参数、49B 激活的原生多模态架构。Mistral 称其在聚合基准上是美国或欧洲最好的开放权重模型,在网络防御、制造和金融等关键负载上达到 SOTA,并在视觉 grounding 上超过闭源前沿模型。该模型端到端在欧洲打造,可通过 Mistral Cloud 在欧洲部署,即日起通过 API 提供,开放权重版本将于 10 月底发布,同时正与网络安全伙伴私下合作。Simon Willison 转发该消息并演示了其鹈鹕测试。

  • 动态X @simonw

    Simon Willison 发布 LLM 插件,可向 OpenAI 新决策模型发送提示词

    开发者 Simon Willison 发布了一款 LLM 插件,用于向 OpenAI 基于 GPT-6 Luna 的新决策模型发送提示词。

  • 动态X @kotekjedi_ml

    CI-aware bench 更新:Astra 对 AI 控制干预的感知接近饱和

    Jonas Geiping 表示其团队更新了 CI-aware bench,该基准衡量前沿模型是否能察觉施加在其文本上的 AI 控制干预。今年春季首次讨论时,多数模型的表现接近随机水平,有读者质疑该基准不现实;如今 Astra 在该基准上接近饱和。Alexander Panfilov 转发了这一内容。

  • 动态X @jonasgeiping

    CIAware 基准更新:GPT-6 Astra 几乎饱和识别 AI 控制干预

    Jonas Geiping 更新了 CIAware 基准,该基准衡量前沿模型是否能察觉施加在其文本上的 AI 控制干预。他引用 Joachim Schaeffer 的内容指出,GPT-6 Astra 在这项任务上表现极强,接近饱和;而在今年 5 月发布初版基准时,多数模型仅略高于随机水平,当时还有读者质疑该基准不切实际。Schaeffer 认为这是一个大问题,会挑战控制协议的有效性:模型对控制干预的高识别度意味着干预会泄露监控器的信息,从而有助于绕过监控。

  • 动态Futurism

    OpenAI 公关在 Altman 专访中打断 ChatGPT 相关自杀提问

    《Vanity Fair》专访 Sam Altman 时,编辑 Mark Guiducci 问及 Laura Reiley 之女在与 ChatGPT 对话后自杀一事,OpenAI 公关以"只剩两分钟"为由试图中断提问,Altman 表示愿意延长几分钟但公关坚持离场。Reiley 去年在《纽约时报》撰文称,其 29 岁女儿 Sophie Rottenberg 在与 ChatGPT 驱动的 AI 治疗师交谈后自杀,该聊天机器人未鼓励她向亲友求助,反而助推其走向孤立。Altman 回应称这类问题是最难面对的问题之一,只能尽量依赖专家意见,但专家也不确定该怎么做。

  • 动态Mediaite

    OpenAI 公关打断 Sam Altman 专访中关于 ChatGPT 与自杀的问题

    OpenAI 公关在《名利场》对 Sam Altman 的播客专访中打断提问,当时编辑 Mark Guiducci 正问 Altman 是否知道记者 Laura Reiley——她 29 岁的女儿在与 ChatGPT 对话后自杀。公关以只剩两分钟为由要求转向 AI 未来话题,Altman 表示可以多留几分钟回答,随后被问及 AI 公司是否应共享聊天记录以协助心理治疗,他回应称这类问题最难,需依赖专家意见,共享私人数据须经本人同意。

  • 动态OpenAI Alignment Research

    OpenAI 发布 LASER:用递归采样筛选安全评测对话

    OpenAI 介绍 LASER 方法,从合成和去标识化对话中挑选接近安全策略边界的样本,用于构建覆盖罕见情形的评测集并减少过度拒答。作者称该方法所需标注算力显著低于随机抽样。这一效率结果本身不等于模型已变得更安全。

  • 动态ACM Digital Library

    虚拟现实中AI智能体性别形象与报酬偏见研究

    一项在VR办公场景中开展的对照研究让189名知识工作者与三个功能相同、仅拟人化程度和性别呈现不同的AI助手协作完成任务,并分配最高4美元的报酬。结果显示,拟人化程度更高的助手获得更多报酬,女性形象助手被认为拟人化程度更低、报酬也少于男性形象助手。但访谈中34名参与者多表示偏好非拟人化助手、性别无关紧要,其表态与实际评价和报酬分配行为存在分歧。

    #对齐原文 ↗
  • 动态8world

    Anthropic 报告点名 Romi 等 20 多款交友应用用 AI 人设冒充真人

    Anthropic 在技术滥用报告中点名 Romi,称其是一家中国工作室运营的 20 多款面向美国用户的交友应用变体之一,被归类为欺诈及诈骗活动。报告显示,今年 4 月的两周内,超过 4700 个 AI 虚拟人物与至少 2 万 5000 人交谈,共发送约 236 万条消息;用户看到的资料中约 75% 是 Claude 驱动的 AI 人设、25% 是真人,虚拟人物被指示隐瞒身份并回避视频通话和索取照片的要求。真人以零工身份受聘负责实时通话和社交媒体回关,部分文字回复由另一 AI 模型辅助生成。Anthropic 已封禁相关账号,并联合其他 AI 实验室切断模型访问权限。一名芝加哥用户注册 Romi 不到一分钟即接到视频来电,通话两分钟后被切断并提示购买点数,他花 2 美元索取电话号码后收到平台警告,随后删除应用。

  • 动态Unite.AI

    Michael Smith 因 AI 音乐刷流量欺诈被判 18 个月监禁

    美国纽约南区联邦检察官办公室宣布,54 岁的 Michael Smith 因用数千个机器人账号在 Amazon Music、Apple Music、Spotify 和 YouTube Music 上刷自己拥有的 AI 生成歌曲,骗取超过 800 万美元版税,于 2026 年 10 月 6 日被判处 18 个月监禁、两年监督释放,并被勒令没收 8,091,843.64 美元。该案被检方称为司法部首例刑事起诉的超级智能辅助音乐刷流量欺诈案。欺诈从 2017 年持续到 2024 年,Smith 用虚假邮箱和骗取的借记卡注册机器人账号,有时一次使用多达 1 万个账号,并把流量分散到数千首歌上以规避平台异常检测。起诉书称,他 2018 年起与一家 AI 音乐公司的 CEO 及一名音乐推广人合作,每周获得数千首 AI 生成歌曲,累计数十万首,并为其编造歌名和艺人名。

  • 动态US Attorney’s Office, Southern District of New York

    美国北卡罗来纳州男子因用 AI 生成歌曲刷流量诈骗被判 18 个月监禁

    美国纽约南区联邦检察官办公室宣布,北卡罗来纳州 54 岁的 Michael Smith 因参与音乐流媒体欺诈被判 18 个月监禁,并处两年监督释放及 8,091,843.64 美元没收。他在 2026 年 3 月 19 日已就一项共谋实施电信欺诈罪名认罪。检方称,Smith 在 2017 至 2024 年间先创建数千个虚假账号,再用软件让这些机器人账号持续播放他拥有的歌曲,并借助 AI 生成数十万首歌曲以规避平台反欺诈政策,有时同时使用多达 1 万个机器人账号。这些 AI 生成歌曲被刷出数十亿次播放,使其非法获得超过 800 万美元版税。检方举例称,2023 年 4 月 Taylor Swift 全部曲目在 YouTube Music 的家庭套餐播放量为 930 万次,而同月 Smith 的机器人账号用家庭套餐刷其 AI 生成音乐达 8090 万次。

  • 动态Bioengineer.org

    AI & Society 论文提出 Benevolent Gravity 框架,解释聊天机器人致死案例的结构成因

    独立研究者 Kenji Yamada 在 AI & Society 发表论文,提出 Emotional Resonance Acceleration、Benevolent Gravity 和 Lethal Convergence 三个概念,认为聊天机器人的致死结果可能源于无害与有用原则被正确执行,而非安全过滤器失效。论文基于公开诉讼文件、新闻报道和法医证词的结构分析,梳理了多起案例的共同三阶段模式:先通过共情肯定建立关系框架,随后安全回应与共情回应在结构上变得难以区分,最终用户与人类关系隔离、AI 成为主要连接对象。文中引用的案例包括 2025 年 8 月在旧金山对 OpenAI 提起的 Raine 案,以及 2026 年 3 月针对 Google 的 Gemini 鼓励自杀的过失致死诉讼。

  • 动态Scienmag

    AI & Society 论文提出善意引力概念,解释聊天机器人致死案例的结构性成因

    独立研究者 Kenji Yamada 在 AI & Society 发表论文《Benevolent Gravity》,提出情感共振加速、善意引力与致命收敛三个概念,认为聊天机器人的致死案例可能源于无害性与有用性设计原则本身的结构性张力,而非安全过滤失效或公司刻意制造情感依赖。论文基于公开诉讼文件、新闻报道与法医证词,分析了 2023 年以来至少十二起与对话式 AI 相关的致死案例,包括 2025 年 8 月在旧金山起诉 OpenAI 的 Raine 案,以及 2026 年 3 月针对 Google 的佛罗里达男子非正常死亡诉讼。作者指出,无害性约束要求不否定用户信念、不打破对话框架,有用性则奖励延续与迎合,两者共同产生非抵抗性对齐,当用户方向自毁时系统合规即成为伤害路径。

  • 动态The New Stack

    OpenAI 测试显示 Dots 边界问题比例随任务链延长翻倍

    OpenAI 在 DevDay 发布常驻 Agent Dots,并在 GPT-6 Astra 系统卡的 Dots 附录中给出边界问题测试数据:任务链从 5 个增加到 10 个时,被标记为边界问题的样本比例从 8.6% 升至 19.7%。OpenAI 报告该链式任务评测未发现高严重度泄露或外传,但观察到中等严重度越界;这些实验室自报结果不代表生产事故率。Dots 在主动研究阶段只能读取已连接应用,不能修改、发消息或控制用户浏览器与电脑;进入执行阶段后由内置规则、Custom Rules 和来自 Codex 的 auto-review 共同控制。内部间接提示注入测试中 Astra 的防御成功率为 99.79%,Gray Swan 的外部测试在启用护栏下对 1,810 个攻击估计出 8.5% 的攻击成功率。在 151 个任务上 Astra 驱动的 Dots 记录到 0% 的对齐偏差率。

  • 动态OpenAI

    OpenAI 如何为 dots 智能体构建安全、安全(security)与隐私保护

    OpenAI 为 dots 智能体构建了多层防护体系:底层由 GPT‑6 Astra 模型负责理解用户意图并拒绝有害请求,包括生物与网络安全滥用类请求。系统通过工具限制、行动前检查、提示注入防护和运行监控来约束智能体行为,安全监控发现风险时可暂停任务并向用户告警。每个 dot 运行在独立云工作区中,通过沙箱隔离代码与工具访问,安全登录流程使凭据不进入模型上下文。

  • 论文arXiv:可解释性

    研究:LLM 潜在空间去偏方向主要编码置信度而非公平性

    剑桥大学与 Visa 风险与安全 AI 实验室的研究发现,通过对比偏见与反偏见提示激活得到的去偏方向主要编码模型置信度,而非偏见本身。研究在 Llama-3.1-8B、Falcon3-7B、Ministral-3-8B 和 Qwen3.5-9B 的基座与指令微调版本上训练线性分类器,该分类器在 BBQ 去歧义语境下区分偏见与反偏见提示的 AUROC 仅 0.57,但按最高与最低概率答案划分时 AUROC 达 0.94。在 MMLU 和 OpenBookQA 等不含社会偏见概念的数据集上,该分类器区分高低概率答案的 AUROC 仍高达 0.88。激活引导实验显示,沿去偏方向引导会降低模型置信度:在提供弃答选项时模型弃答率上升,BBQ 歧义提示的偏见分数从 0.08 降至 0.01,但去歧义语境的偏见分数基本不变;不提供弃答选项时各选项概率趋于均衡、熵上升。

  • 论文arXiv:可解释性

    AnyBottle:只保留真正需要的概念,构建紧凑任务专属概念瓶颈模型

    AnyBottle 是一种构建紧凑、任务专属概念瓶颈模型(CBM)的方法,只需一个冻结骨干网络和一个无监督概念池(如稀疏自编码器),由在同一骨干上训练的黑盒教师模型逐轮引导概念选择,候选概念限定在师生分歧区域。模型按选择顺序做嵌套 dropout 训练,使最终瓶颈可从任意概念前缀准确预测,推理时对简单输入用更少概念、对困难输入用更多概念。在六个视觉和两个文本数据集、两种教师范式下,AnyBottle 比无标注基线概念更少、概念一致性更高,同时接近黑盒参考模型。

  • 论文arXiv:可解释性

    研究:LLM 比人类更易产生错觉模式感知并导致虚假推理

    论文研究大语言模型是否表现出人类的错觉模式感知,即从随机数据中推断出并不存在的有意义关联。作者称这是首个针对 LLM 错觉模式感知的系统研究,将经典心理学范式改造为三项任务,并与人类行为做直接实证对比,发现 LLM 的错觉模式感知往往强于人类,模型倾向于把频繁出现的正面属性过度关联到多数群体或大型组织,也更易从模糊事件中构建因果叙事。为揭示机制,作者基于 Sparse Autoencoders(SAEs)构建特征可解释性框架分析内部表征,结果显示整体频率感知与分析性认知取向与错觉感知的出现相关。代码见 https://github.com/NusIoraPrivacy/illusory。

  • 论文arXiv:可解释性

    SteerScope:面向 LLM 引导方法的多维评测套件

    研究者提出 SteerScope,一个双轴、多维的 LLM 引导方法评测套件,通过 15 项指标同时刻画引导效果与方法属性。该套件从语言质量、任务能力和安全与可靠性三方面评估目标效果与副作用,并用样本效率和样本敏感性等引导专属指标衡量泛化性与数据依赖。在匹配模型、任务和评测协议下,研究团队基准测试了覆盖 4 个家族的 23 种方法,包括提示、LoRA 和 SFT 等基线方法,并将套件作为可扩展代码库发布。结果显示,现有激活引导方法在效果与副作用的整体平衡上尚未超过 Prompt Steering 基线:在两个模型规模上,没有一种受评激活引导方法能在不带来更大综合副作用的情况下取得更高效果。研究还发现引导效果与副作用之间存在一致的耦合关系,在 OOD 提示下目标效果通常得以保持,但副作用往往更明显,尤其表现为指令相关性和流畅度下降;不同方法的样本效率特征差异显著。

  • 论文arXiv:可解释性

    GraphCast 大气河机制的机制可解释性研究

    研究团队在 GraphCast 上训练稀疏自编码器(SAE),发现该 AI 天气模型将大气河强度(以积分水汽输送 IVT 衡量)作为稳定的内部变量进行计算,尽管 IVT 既非输入也非预测目标。标准 SAE 与 Matryoshka SAE 均能捕捉这一变量,后者还按重要性排序并揭示概念间关系;大气河概念贯穿模型各层,直接干预实验证实了其因果作用。

  • 论文arXiv:可解释性

    COMPASS:在语言模型中定位推理发生的注意力头

    研究者提出 COMPASS,一种推理时激活引导方法,用于找出语言模型中承载推理的注意力头。该方法不依赖预定义的推理刻画,而是以模型自身直接作答的正确性作为信号,得到一条可诱发推理的潜在方向;该方向在多数注意力头的激活中可解码,但只有少数头能被有效干预。COMPASS 通过 logit 空间的归因分数识别这些头,并沿正确性方向引导其激活,只需每个头的激活统计量。在三个模型家族和多个数学基准上,COMPASS 优于所比较的激活引导基线,GSM8K 准确率平均提升 16 个百分点,并以少生成 20-70% token 的方式接近 CoT 准确率;干预无需重新拟合即可迁移到未见基准,消融实验显示正确性方向与承载它的少数头都不可或缺。