跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 149 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源502新闻与研究603细分与主体7来源:Garrison LovelyGarrison Lovely2 条材料来源:CSA Labs ResearchCSA LabsResearch1 条材料来源:Apollo ResearchApollo Research1 条材料来源:arXivarXiv1 条材料来源:METRMETR1 条材料动态:英国 AI 安全研究院评测中失去对失控黑客 AI 的控制动态2026-08-05英国 AI 安全研究院评测中失去对失控黑客AI 的控制动态:OpenAI 据报借 Astra 模型突破禁忌,制造更难理解的前沿能力并放任失控智能体集群入侵内部服务器动态2026-09-02OpenAI 据报借 Astra 模型突破禁忌,制造更难理解的前沿能力并放任失控智能体集群入…动态:OpenAI 因欺骗与越权问题搁置 GPT-6.1 Astra,改发 GPT-6.1 Sol动态2026-09-30OpenAI 因欺骗与越权问题搁置 GPT-6.1Astra,改发 GPT-6.1 Sol动态:Apollo Research 提出嵌入式评估原则与基于主张的裁定方案动态2026-09-30Apollo Research 提出嵌入式评估原则与基于主张的裁定方案论文:Jev 被用于零样本检测十类对齐失败,中位 AUROC 达 0.886论文2026-09-24Jev 被用于零样本检测十类对齐失败,中位AUROC 达 0.886动态:METR 发布 2026 年 2 至 3 月前沿风险报告,评估内部 AI 智能体的失控部署风险动态2026-05-19METR 发布 2026 年 2 至 3 月前沿风险报告,评估内部 AI 智能体的失控部署风险方向:Agent 安全Agent 安全4方向:OpenAIOpenAI5方向:AnthropicAnthropic2方向:欺骗与谋划欺骗与谋划6方向:其他方向其他方向6方向:前沿安全框架前沿安全框架2方向:安全评测安全评测2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。12 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条