跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 35 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源202新闻与研究603细分与主体5来源:Anthropic Alignment ScienceAnthropicAlignment Scien…1 条材料来源:ACLACL5 条材料会议论文:AE Studio 与 Anthropic 提出 GRAM:用模块化预训练隔离危险知识的初步研究会议论文2026AE Studio 与 Anthropic 提出 GRAM:用模块化预训练隔离危险知识的初步研究会议论文:OASIS:通过正交自适应安全对齐策略缓解 LLM 有害微调攻击会议论文2026OASIS:通过正交自适应安全对齐策略缓解LLM 有害微调攻击会议论文:CTRAP:嵌入坍塌陷阱以保护 LLM 免受有害微调会议论文2026CTRAP:嵌入坍塌陷阱以保护 LLM 免受有害微调会议论文:SGT:用安全引导触发器保护开源 LLM 免受恶意微调会议论文2026SGT:用安全引导触发器保护开源 LLM 免受恶意微调会议论文:HarmRLVR:利用可验证奖励实现有害对齐会议论文2026HarmRLVR:利用可验证奖励实现有害对齐会议论文:对齐与失效:微调如何破坏并恢复大模型安全会议论文2026对齐与失效:微调如何破坏并恢复大模型安全方向:对齐对齐1方向:AnthropicAnthropic1方向:危险能力危险能力1方向:防御与护栏防御与护栏1方向:开源模型安全开源模型安全6
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条