跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 921 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源402新闻与研究603细分与主体7来源:arXiv:越狱、提示注入、投毒与防御arXiv:越狱、提示注入、投毒与防御1 条材料来源:AI Alignment ForumAI AlignmentForum2 条材料来源:Redwood ResearchRedwood Research1 条材料来源:DeepMind Safety ResearchDeepMind SafetyResearch2 条材料动态:为“渐进式去权”辩护:驳 Bentham's Bulldog 与 John Halstead 的批评动态2026-09-17为“渐进式去权”辩护:驳 Bentham'sBulldog 与 John Halstead 的批评论文:研究:自然语言自动编码器中哪些 token 最值得审计论文2026-09-29研究:自然语言自动编码器中哪些 token 最值得审计动态:Redwood 评测:GPT-6-Astra 用填充 token 推理的能力远超此前模型动态2026-09-23Redwood 评测:GPT-6-Astra 用填充token 推理的能力远超此前模型动态:论文:Stringological 序列预测 III——分层 zipline 程序与更高效预测算法动态2026-09-18论文:Stringological 序列预测 III——分层 zipline 程序与更高效预测算法动态:DeepMind 提出预测 RL 训练何时破坏思维链可监控性的框架动态2026-04-01DeepMind 提出预测 RL 训练何时破坏思维链可监控性的框架动态:DeepMind 用自动审计与蜜罐评测测试 Gemini 模型的谋划倾向动态2026-05-29DeepMind 用自动审计与蜜罐评测测试Gemini 模型的谋划倾向方向:AI 控制AI 控制2方向:其他方向其他方向4方向:思维链监控思维链监控3方向:对齐对齐5方向:欺骗与谋划欺骗与谋划3方向:Google DeepMindGoogleDeepMind2方向:Agent 安全Agent 安全1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。5 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条