跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 7 条 · 共 583 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 2
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源602新闻与研究603细分与主体7来源:Import AIImport AI1 条材料来源:Simon WillisonSimon Willison1 条材料来源:arXiv:越狱、提示注入、投毒与防御arXiv:越狱、提示注入、投毒与防御1 条材料来源:CAISCAIS1 条材料来源:DeepMind Safety ResearchDeepMind SafetyResearch1 条材料来源:AI Alignment ForumAI AlignmentForum1 条材料动态:Import AI 470:METR 研究 AI 加速科学发现不均衡;SPADE 自动生成训练环境;Hawkeye 优化 GPU kernel动态2026-08-24Import AI 470:METR 研究 AI 加速科学发现不均衡;SPADE 自动生成训练环境;Ha…动态:Boris Cherny 称 Opus 5 是 Anthropic 最难被提示注入的模型动态2026-07-25Boris Cherny 称 Opus 5 是 Anthropic最难被提示注入的模型论文:研究评估 GradSafe 在多轮对话中的越狱检测脆弱性论文2026-09-29研究评估 GradSafe 在多轮对话中的越狱检测脆弱性动态:AI 安全周报第 81 期:Anthropic 研究员辞职与 GPT-6 Astra 发布引发风险讨论动态2026-09-15AI 安全周报第 81 期:Anthropic 研究员辞职与 GPT-6 Astra 发布引发风险讨论动态:DeepMind 用自动审计与蜜罐评测测试 Gemini 模型的谋划倾向动态2026-05-29DeepMind 用自动审计与蜜罐评测测试Gemini 模型的谋划倾向动态:WorkspaceBench:评估读取模型全局工作区的可解释性方法动态2026-09-23WorkspaceBench:评估读取模型全局工作区的可解释性方法方向:AnthropicAnthropic2方向:System CardSystem Card2方向:安全评测安全评测6方向:其他方向其他方向6方向:对齐对齐1方向:Agent 安全Agent 安全2方向:思维链监控思维链监控1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。11 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 7 条