跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 199 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源402新闻与研究603细分与主体7来源:AI Alignment ForumAI AlignmentForum2 条材料来源:DeepMind Safety ResearchDeepMind SafetyResearch1 条材料来源:CAISCAIS1 条材料来源:LessWrongLessWrong2 条材料动态:合成文档微调无法阻止奖励作弊引发的失准泛化动态2026-09-15合成文档微调无法阻止奖励作弊引发的失准泛化动态:METR 与 Redwood 独立调查 OpenAI / Hugging Face 事件中的智能体行为动态2026-08-29METR 与 Redwood 独立调查 OpenAI /Hugging Face 事件中的智能体行为动态:DeepMind 提出预测 RL 训练何时破坏思维链可监控性的框架动态2026-04-01DeepMind 提出预测 RL 训练何时破坏思维链可监控性的框架动态:AISN #82:中美启动 AI 对话,联合国大会与特朗普-习峰会聚焦 AI 风险动态2026-09-29AISN #82:中美启动 AI 对话,联合国大会与特朗普-习峰会聚焦 AI 风险动态:为什么我害怕强化学习:RL 正让 AI 系统变得更不对齐动态2026-09-23为什么我害怕强化学习:RL 正让 AI 系统变得更不对齐动态:用一只脚解释 Knightianism:如何与无法建模和控制的世界相处动态2026-09-11用一只脚解释 Knightianism:如何与无法建模和控制的世界相处方向:思维链监控思维链监控2方向:其他方向其他方向6方向:欺骗与谋划欺骗与谋划3方向:奖励作弊奖励作弊6方向:对齐对齐4方向:Agent 安全Agent 安全2方向:AnthropicAnthropic2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。12 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条