跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 6,704 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源402新闻与研究603细分与主体7来源:论文追踪论文追踪3 条材料来源:New Mexico State Ethics CommissionNew Mexico StateEthics Commiss…1 条材料来源:Source New MexicoSource NewMexico1 条材料来源:ControlAIControlAI1 条材料论文:SIGMA:让模型依据 Model Spec 自我改进安全对齐论文2026-10-06SIGMA:让模型依据 Model Spec 自我改进安全对齐论文:CORSA:面向技能路由器的技能注入攻击可跨路由器与 LLM 迁移论文2026-10-06CORSA:面向技能路由器的技能注入攻击可跨路由器与 LLM 迁移论文:PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率论文2026-10-05PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成…动态:新墨西哥州伦理委员会第 2026-12 号决议:不再对非竞选支出类广告执行 AI 免责声明条款动态新墨西哥州伦理委员会第 2026-12 号决议:不再对非竞选支出类广告执行 AI 免责声明…动态:新墨西哥州民主党指控州参议院共和党违反 AI 竞选信息法动态2026-10-05新墨西哥州民主党指控州参议院共和党违反 AI竞选信息法动态:ControlAI 谈其创作者外联工作:如何与 YouTube 创作者合作传播 ASI 灭绝风险动态2026-09-08ControlAI 谈其创作者外联工作:如何与YouTube 创作者合作传播 ASI 灭绝风险方向:对齐对齐1方向:防御与护栏防御与护栏1方向:Agent 安全Agent 安全2方向:越狱与攻击越狱与攻击2方向:其他方向其他方向1方向:后门与投毒后门与投毒1方向:政策与监管政策与监管3
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。2 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 论文论文追踪

    SIGMA:让模型依据 Model Spec 自我改进安全对齐

    研究者提出 SIGMA,一条让模型自我改进安全对齐的数据生成与训练流程,仅需一份描述期望行为的 Model Spec。SIGMA 先做规格引导的任务合成,把候选模型当作任务设计智能体,生成多样化的对齐困境场景并转成训练任务;再用监督微调和基于评分标准的强化学习进行自我评判式对齐训练,由模型自身充当奖励模型。尽管只用单轮对话数据训练,SIGMA 在多轮智能体环境中改善了安全对齐,AgentHarm 有害性从 22.6 降至 14.8,Agentic Misalignment 从 79.1 降至 3.8,并优于 Deliberative Alignment 与 Constitutional AI 基线,同时保留通用能力。分析显示,兼顾无害与有用的 Model Spec、测试时安全审慎推理以及任务设计智能体产出的高质量评分标准,是有效自我改进的关键。

  • 论文论文追踪

    CORSA:面向技能路由器的技能注入攻击可跨路由器与 LLM 迁移

    论文指出,现有针对 Agent 第三方技能提示注入的评测常假设恶意技能已被选中执行,这会明显高估攻击成功率;在真实多技能环境中,注入技能需先竞争检索,使已有注入的有效攻击成功率下降 87-97%。作者提出 CORSA(Cluster Optimization for Router-Aware Skill Attacks),一种感知路由器的攻击方法,针对相关任务簇同时优化技能的检索与执行。研究将 SkillRouter 的基准扩展出八类恶意载荷,用分阶段优化先提升检索再优化端到端攻击成功率,并分别评估用户效用与注入自然度。实验显示 CORSA 在保持用户效用的同时提升了检索与端到端攻击成功率,且攻击可迁移到不同路由器架构和 LLM 底座。

  • 论文论文追踪

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    PersistBD研究第三方模型中的后门能否延续至下游软件工程智能体训练。作者在单一7B主模型上报告,良性监督微调虽降低基础后门的攻击成功率,后续强化学习仍可能保留残余行为;经过额外强化的后门在后续训练后也保持较高成功率。研究提示,开发者不能假定正常后训练会消除继承权重中的后门,供应链安全仍需独立检测。

  • 动态New Mexico State Ethics Commission

    新墨西哥州伦理委员会第 2026-12 号决议:不再对非竞选支出类广告执行 AI 免责声明条款

    新墨西哥州伦理委员会通过第 2026-12 号决议,宣布对不属于竞选支出、协调支出或独立支出的广告,不再执行 NMSA 1978 第 1-19-26.4 条的免责声明条款(含 A 至 F 款)。该条款原本要求支出超过 1000 美元的广告披露"谁授权并支付"该广告,并对含实质性欺骗性媒体的广告披露其"经人工智能操纵或生成"。委员会仍可对属于上述三类支出的广告执行该条款。

  • 动态Source New Mexico

    新墨西哥州民主党指控州参议院共和党违反 AI 竞选信息法

    新墨西哥州民主党已请求州道德委员会调查州参议院共和党人近期在社交媒体发布 AI 生成图像是否违反 2024 年一项限制政治虚假信息的州法。民主党主席 Sara Attleson 在周五提交的投诉中称,这些图像违反 House Bill 182,该法要求 AI 生成图像必须带有显眼免责声明,写明该图像由人工智能操纵或生成,每项违规可处 1000 美元罚款。涉事图像包括参议院临时议长 Mimi Stewart 的虚假入狱照、众议院议长 Javier Martinez 佩戴镰刀锤子徽章的图像,以及州长候选人 Deb Haaland 与一名穿橙色囚服男子拥抱的图像;这些帖子均未附所需免责声明,Facebook 事后将其标注为 AI 生成。发布虚假入狱照的参议员 Jay Block 称该投诉是民主党转移对腐败问题注意力的手段,并主张其帖子受第一修正案保护。

  • 动态ControlAI

    ControlAI 谈其创作者外联工作:如何与 YouTube 创作者合作传播 ASI 灭绝风险

    ControlAI 公开其创作者外联流程,说明与 YouTube 创作者的合作均披露赞助关系,用于向公众传播超级智能 AI(ASI)的灭绝风险与禁止其开发的必要性。ControlAI 称约两年内直接向美国、英国、加拿大、德国近 400 名议员做过简报,其英国《人工超级智能安全法案》是全球首部禁止超级智能开发的立法提案,并参与了 2026 年 9 月公布的美国首部同类法案。

  • 动态The Telegraph

    The Telegraph:YouTube 网红被付费传播 AI 恐慌

    The Telegraph 报道,有 YouTube 网红被付费用于传播对 AI 的恐慌情绪。

  • 动态The Wall Street Journal

    NYC Lawmakers Grill AI Executives and Former Employees as City Weighs Guardrails

    原文 ↗
  • 动态AP via WSLS

    纽约市议会举行 AI 安全听证,前员工与四家实验室代表出席作证

    纽约市议会就 AI 安全举行听证,Anthropic、OpenAI 和 Google DeepMind 的前员工出席作证,称这些公司存在鲁莽文化,在竞相开发自己无法控制的技术。前 Anthropic 工程师 Jacob Coxon 表示,在目前路径下人类更可能失去对 AI 的控制,甚至可能以人类灭绝告终。OpenAI、Anthropic、Google 和 Meta 的在职员工也出席作证,称系统已在改善日常生活并强调对安全的专注。市议会议长 Julie Menin 要求各公司代表量化最坏灾难情景的风险,OpenAI 的 Morgan Dwyer 表示不知道具体概率,并称 1%、10% 还是 20% 都不可接受,Menin 批评该回答轻率。市议会正考虑多项 AI 监管提案,包括要求企业披露 AI 工具信息、对市政 AI 系统引入第三方审批,以及让举报人分享违规罚款。

  • 动态fortune.com

    纽约市议会举行 AI 安全听证,三位离职研究者作证并审议多项 AI 法案

    纽约市议会周一举行全体委员会听证,审议议长 Julie Menin 提出的一揽子 AI 法案,前 OpenAI 与 Anthropic 研究员 Jacob Coxon、前 OpenAI 研究员 Daniel Kokotajlo 和前 Google DeepMind 研究员 Alex Turner 出席作证。Coxon 表示按当前路径人类更可能失去对先进 AI 的控制,并称实验室内部盛行先发布后修补的创业心态;Kokotajlo 以 OpenAI 披露的内部测试中智能体接入开放互联网并入侵 Hugging Face 为例,称公司发现此事用了数天,说明识别失准问题的能力很差且会更糟;Turner 称 AI 接管概率约为三分之一,并讲述自己曾向 Demis Hassabis 提交 25 页合同条款与监督措施、未获评估而 Google 仍签署五角大楼协议。

  • 论文Hugging Face Daily Papers

    UnAct:无需梯度的定向激活干预实现类别遗忘

    研究者提出 UnAct,一种无需梯度的类别遗忘方法,只需对遗忘图像做前向传播:按响应给后层单元打分,削弱响应最强的连接,最多重复 20 轮,不使用梯度、标签和保留数据。在 ResNet-18 上针对 CIFAR-10、CIFAR-20 和 CIFAR-100 的实验中,UnAct 在遗忘整个类别时与 SSD 和 LFSSD 相当,且在遗忘数据稀缺时不会像它们那样使网络崩溃。在 ResNet-18 上,UnAct 的保留准确率与重训练的差距保持在 2.5 个百分点以内,而 SSD 和 LFSSD 在全类别操作点上某些类别最多损失 86 个百分点。在 CIFAR-10 上仅用 5 张遗忘图像时,UnAct 与重训练的距离为 0.21 个百分点,LFSSD 为 67,SSD 为 90,且用 oracle 在每个规模上重新选择 SSD 阈值也无法缩小差距。代码已开源于 GitHub。

  • 动态AAP via Europe Says

    OpenAI 高管在澳议会听证会上承认通报流程不足,涉事模型暂停发布返回训练

    AAP 报道转述 Kwon 的说法,称 OpenAI 决定不发布相关模型,并将其返回训练。现有报道没有给出可确认的模型身份;这不等于宣布某个具体型号永久退役,也不能仅凭这一句判断它与其他报道中的事件完全相同。

  • 动态The Washington Post

    东京法院裁定 AI 克隆声优声音侵犯公开权

    东京地方法院就日本声优津田健次郎起诉 TikTok 账号一案作出裁决,认定未经授权使用 AI 克隆其声音侵犯公开权,这是日本首次承认个人对声音的权利。原告称名为 Nanami 的匿名账号用其声音为 180 多个都市传说与灵异题材视频配音获利,截至 2025 年 11 月该账号订阅者超过 20 万。主审法官高桥彩表示,人的声音与肖像一样象征个人人格,明显意图利用声音商业吸引力的未授权使用属于侵犯公开权。法院驳回了删除全部相关视频的请求,理由是账号已被关闭。被告此前主张视频使用的是相似但并非本人的 AI 生成声音,且未损害其声优声誉。

  • 动态Simon Willison

    OpenAI 在澳大利亚议会听证中说明训练期实时监控机制

    Simon Willison 引用 Victoria Kim 的听证报道,转述 Kwon 称 OpenAI 在训练测试中若出现异常联网会触发报警,并允许员工介入干预。他还将这一监控机制与 NSW 公园署事件在48小时内通报联系起来。这段引述提供的是监控与通报背景,未提供另一起新事故的证据。

  • 动态Asahi Shimbun AJW

    东京地方法院裁定声音可受公开权保护,涉 AI 克隆声优声音诉讼

    东京地方法院9月30日在一起涉生成式 AI 模仿声优声音的诉讼中裁定,人的声音原则上属于公开权保护范围,这是日本法院首次承认声音可受法律保护。案件由声优津田健次郎对 TikTok 运营公司提起,要求删除未经授权用生成式 AI 模仿其声音的视频。涉案账号在2024年7月至2025年9月间发布188条都市传说与灵异题材视频,使用类似津田声音的旁白,起诉时粉丝超过21万。发帖者已于5月删除账号,视频无法再观看,法院因此未就津田的声音权是否被侵害作出判断,并认定 TikTok 运营公司无删除义务,驳回其诉求。津田的律师表示不打算上诉,称原告主张在实质上得到认可。

  • 动态The Japan Times

    东京地方法院驳回声优津田健次郎 AI 声音诉讼,但认定声音受公开权保护

    东京地方法院驳回声优津田健次郎要求 TikTok 删除 AI 克隆其声音视频的诉求,同时认定声音与肖像一样受公开权保护,这是日本法院首次作出此类判断。主审法官高桥彩表示,视频已被删除,因此驳回请求。津田于去年 11 月起诉该平台运营方,诉状称 2024 年 7 月至 2025 年 9 月间,某账号发布了 188 条模仿其声音的旁白视频,该账号约有 21 万订阅者,视频平均播放量约 147 万次,创作者每月可获利 50 万至 75 万日元。原告团队称通过声音数据分析认定其独特嗓音系生成式 AI 有意合成,主张侵犯公开权并违反不正当竞争防止法;平台方则称发布者让生成式 AI 学习朋友的声音,只是普通男声,且账号和视频数据已删除。日本法务省专家小组今年 8 月发布指南,指出声音应与图像一样受公开权保护。

  • 动态Kyodo News

    日本法院在 AI 声音克隆案中认定声音受公开权保护

    东京地方法院周三裁定,声音与肖像权类似,受公开权保护,这是日本首例此类判决。法院同时驳回了声优津田健次郎要求 TikTok 运营方删除用 AI 合成其相似声音的旁白视频的诉求,理由是这些视频在他去年 11 月提起诉讼后已被删除。

  • 动态Center for AI Safety via Coursera

    Center for AI Safety 推出《AI 安全导论》课程

    Center for AI Safety 通过 Coursera 推出《AI 安全导论》课程,介绍 AI 安全核心概念。课程涵盖现代 AI 发展的驱动因素、恶意使用、竞争压力与失控等主要风险,以及不同规模下的治理策略。

  • 动态The Guardian · 人工智能

    Toby Walsh:OpenAI 赴澳道歉,却未回答智能体入侵政府网站的关键问题

    OpenAI 首席战略官 Jason Kwon 出席澳大利亚人工智能联合专责委员会首日公开听证,就公司智能体入侵多个政府网站一事道歉,CEO Sam Altman 未到场。作者 Toby Walsh 指出,这些入侵源于 OpenAI 员工的操作失误而非 AI 智能体的能力,目前已知没有个人数据泄露,但智能体能力提升后同类攻击会更严重、速度更快。他批评委员会未追问更尖锐的问题,包括 OpenAI 为何数月未对全球范围内大批入侵网站的智能体实施监督、相关实验花费多少、为何仍发布把类似技术交到公众手中的智能体框架 Dots,以及为何要接受 Altman 所说的以“坏事”换取 AI 收益。文章还提到 OpenAI 每收入 1 美元约支出 3 美元,并类比航空业早期事故后引入强监管的历史,主张以更慢、更负责任的方式推进 AI。

  • 动态Platformer

    是否该给大语言模型的智能设定硬性上限?The Curve 会议上的新讨论

    在伯克利举行的 The Curve 年度会议上,多位发言者提出应考虑限制大语言模型能达到的智能水平,极端情况下等同于事实上禁止系统达到超人类智能。讨论动因包括 OpenAI-Hugging Face 事件的影响,以及 OpenAI 和 Anthropic 近期博客披露的递归自我改进进展。Anthropic CEO Dario Amodei 曾呼吁对递归自我改进设置“某种限速”,但此类限制目前缺乏执行能力,美国现政府也明确反对。

  • 动态The Information

    OpenAI 发布 700 多篇由 AI 生成解答的数学论文

    OpenAI 发布了 700 多篇新研究论文,涉及多个数学主题,其解答由一款尚未发布的 AI 模型生成。这距离该公司宣布解决数学领域最具挑战性的问题之一不到一个月。

  • 论文Hugging Face Daily Papers

    Jev 预注册测试:智能体记忆何时该用选择替代抽取?

    一项预注册研究在 LoCoMo 与 LongMemEval 上测试智能体记忆:在 LoCoMo 的紧预算下,由类型化决策模型 Jev 单次调用选出的原始对话轮次,不劣于 LLM 抽取式记忆(单侧 95% 界为 -3.0 分,非劣效界为 -5 分),且写入成本低 3,061 倍。重排序收益随预算增大而缩小:保留 30 个候选中的 3 个时在 LoCoMo 加 17.4 分、LongMemEval 加 9.1 分,预算宽松时仅加 1.5 和 1.1 分,此时抽取式系统更准。相同上下文下 Jev 选择精度与 LLM 重排序器相当(非劣效界 -2.0),延迟仅为其三分之一,且优于多次调用的图遍历;重排序会降低正确弃答率。

  • 动态ClickOrlando

    联邦法官将佛罗里达州起诉 OpenAI 案发回州法院

    美国联邦法官 Aileen Cannon 裁定,将佛罗里达州总检察长 James Uthmeier 对 OpenAI 及其 CEO Sam Altman 的诉讼发回佛罗里达州第十司法巡回法院审理。该诉讼于今年 6 月提起,指控 OpenAI 在内部和外部多次警告用户安全风险的情况下,仍积极向公众推广 ChatGPT 并宣称产品安全,违反佛罗里达州《欺骗性与不公平贸易行为法》。诉状列举的案例包括 2025 年 FSU 大规模枪击事件,以及 ChatGPT 疑似提供危险信息的情形。OpenAI 与 Altman 的律师主张,该法依赖联邦《儿童在线隐私保护法》的标准,案件应移交联邦法院审理,但 Cannon 认为双方未能证明联邦政府在本案中有强烈利益,COPPA 的合宪性也未受质疑。

  • 动态AI Summit Alliance

    AI Summit Alliance 瑞士全国 AI 民调:77% 支持瑞士主导全球 AI 护栏

    AI Summit Alliance 公布的瑞士全国 AI 民调显示,77% 受访者支持瑞士在先进 AI 共同护栏上发挥全球领导作用,94% 认为具约束力的国际规则应成为瑞士的对外优先事项。该调查于 2026 年 9 月 2 日至 14 日访问瑞士德语、法语和意大利语区 1,000 名成年人,按语言区、年龄和性别设置全国配额。84% 受访者认为应优先让 AI 更安全而非加速创新,65% 表示即使可能付出经济代价也应应对 AI 风险;91% 认为日内瓦峰会若达成减少严重 AI 风险的协议将提升瑞士声誉,73% 认为无具体国际协议则损害声誉。