跳到正文
图中 6 条 · 本页 24 条 · 共 1,033 条动态论文会议论文
左右滑动查看
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源402新闻与研究603细分与主体7来源:DeepMind Safety ResearchDeepMind SafetyResearch1 条材料来源:arXiv:越狱、提示注入、投毒与防御arXiv:越狱、提示注入、投毒与防御3 条材料来源:Google DeepMindGoogle DeepMind1 条材料来源:ACLACL1 条材料论文:研究者提出 Controlled Decoding Attacks,通过纯文本接口越狱黑盒 LLM论文2026-09-29研究者提出 Controlled DecodingAttacks,通过纯文本接口越狱黑盒 LLM动态:DeepMind 提出一致性训练,可限制谄媚与越狱动态2025-11-03DeepMind 提出一致性训练,可限制谄媚与越狱论文:ACTR:对齐推理与回答以提升推理大语言模型的多语言安全论文2026-09-29ACTR:对齐推理与回答以提升推理大语言模型的多语言安全论文:ToolFence:为工具调用 LLM Agent 提供细粒度授权论文2026-09-29ToolFence:为工具调用 LLM Agent 提供细粒度授权动态:Google DeepMind 为 Private AI Compute 引入安全服务端持久记忆动态2026-09-23Google DeepMind 为 Private AICompute 引入安全服务端持久记忆会议论文:RST-Guarder:通过 RST 解析与概率推断增强护栏的长文本鲁棒性会议论文2026RST-Guarder:通过 RST 解析与概率推断增强护栏的长文本鲁棒性方向:越狱与攻击越狱与攻击3方向:对齐对齐2方向:Google DeepMindGoogleDeepMind2方向:其他方向其他方向1方向:Agent 安全Agent 安全1方向:防御与护栏防御与护栏6方向:隐私与数据泄露隐私与数据泄露1
来源 → 材料 → 方向 · 宽度按材料数量其他方向 · 1 个

点击节点查看内容

本页材料

24 条