跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 428 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源402新闻与研究603细分与主体7来源:arXiv:对齐、欺骗与监督arXiv:对齐、欺骗与监督1 条材料来源:Redwood ResearchRedwood Research2 条材料来源:arXiv:越狱、提示注入、投毒与防御arXiv:越狱、提示注入、投毒与防御2 条材料来源:AI Alignment ForumAI AlignmentForum1 条材料论文:Hessian Null Space Continuation:在单个神经网络解附近发现大量表征多样性论文2026-09-29Hessian Null Space Continuation:在单个神经网络解附近发现大量表征多样性动态:Redwood Research 提出 NLS depth:量化模型不可言说串行认知的新指标动态2026-09-10Redwood Research 提出 NLS depth:量化模型不可言说串行认知的新指标论文:研究:自然语言自动编码器中哪些 token 最值得审计论文2026-09-29研究:自然语言自动编码器中哪些 token 最值得审计动态:Redwood Research:潜在推理架构可能削弱思维链这一最强监控工具动态2026-09-23Redwood Research:潜在推理架构可能削弱思维链这一最强监控工具动态:WorkspaceBench:评估读取模型全局工作区的可解释性方法动态2026-09-23WorkspaceBench:评估读取模型全局工作区的可解释性方法论文:研究用因果激活修补定位模型服从提示注入指令的决策层论文2026-09-29研究用因果激活修补定位模型服从提示注入指令的决策层方向:对齐对齐2方向:AI 控制AI 控制2方向:可解释性可解释性6方向:思维链监控思维链监控4方向:其他方向其他方向5方向:提示注入提示注入2方向:Agent 安全Agent 安全1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。7 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条