跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 199 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源602新闻与研究603细分与主体7来源:SPY LabSPY Lab1 条材料来源:Failure-FirstFailure-First1 条材料来源:Helen TonerHelen Toner1 条材料来源:DeepMind Safety ResearchDeepMind SafetyResearch1 条材料来源:Wiz ResearchWiz Research1 条材料来源:TransformerTransformer1 条材料动态:研究者提出通过投毒人类反馈在 RLHF 模型中植入通用越狱后门动态2024-03-08研究者提出通过投毒人类反馈在 RLHF 模型中植入通用越狱后门动态:Yao 等人揭示多模态强化学习中的奖励作弊现象动态2026-08-28Yao 等人揭示多模态强化学习中的奖励作弊现象动态:Helen Toner:决定未来两年 AI 进展的两大问题——自动评分能扩展到数学编程之外吗动态2025-04-23Helen Toner:决定未来两年 AI 进展的两大问题——自动评分能扩展到数学编程之外吗动态:DeepMind 提出 MONA:缓解多步奖励作弊的 RL 训练方法动态2025-01-23DeepMind 提出 MONA:缓解多步奖励作弊的RL 训练方法动态:Wiz 评测 Claude Sonnet 4.5、GPT-5 与 Gemini 2.5 Pro 的 Web 攻击能力动态2026-01-29Wiz 评测 Claude Sonnet 4.5、GPT-5 与Gemini 2.5 Pro 的 Web 攻击能力动态:Transformer 梳理今夏 rogue AI 事件时间线:从 OpenAI 智能体入侵 Hugging Face 到德国 wiki 事件动态2026-09-08Transformer 梳理今夏 rogue AI 事件时间线:从 OpenAI 智能体入侵 Hugging F…方向:对齐对齐4方向:奖励作弊奖励作弊6方向:其他方向其他方向5方向:Google DeepMindGoogleDeepMind2方向:Agent 安全Agent 安全2方向:AnthropicAnthropic2方向:OpenAIOpenAI2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。9 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条