跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 3 条 · 本页 3 条 · 共 3 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源302新闻与研究303细分与主体7来源:arXivarXiv1 条材料来源:arXiv:对齐、欺骗与监督arXiv:对齐、欺骗与监督1 条材料来源:Goodfire ResearchGoodfireResearch1 条材料论文:Meerkat:跨大量 Agent 轨迹检测安全违规论文2026-04-13Meerkat:跨大量 Agent 轨迹检测安全违规论文:DeepSeek Elastic Compute(DSec):面向大规模智能体训练的高效沙箱基础设施论文2026-09-19DeepSeek Elastic Compute(DSec):面向大规模智能体训练的高效沙箱基础设施动态:Goodfire 发布预测式数据调试方法,可在训练前预测 DPO 会学到什么动态2026-06-11Goodfire 发布预测式数据调试方法,可在训练前预测 DPO 会学到什么方向:思维链监控思维链监控1方向:Agent 安全Agent 安全2方向:对齐对齐2方向:DeepSeekDeepSeek1方向:奖励作弊奖励作弊3方向:工具与开源工具与开源2方向:其他方向其他方向1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。1 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 3 条
  • 论文arXiv

    Meerkat:跨大量 Agent 轨迹检测安全违规

    研究者提出 Meerkat,将聚类与智能体搜索结合,用自然语言描述违规行为并在大量 Agent 轨迹中定位稀疏失败。该方法不依赖种子场景、固定流程或穷举,通过结构化搜索和自适应调查有潜力的区域来发现违规。在滥用、失准和任务博弈等场景中,Meerkat 的违规检测效果显著优于基线监控器,并在一个头部 Agent 基准上发现大量开发者作弊行为,在 CyBench 上找到的奖励作弊案例比此前审计多近 4 倍。论文共 35 页、17 张图,作者为 Adam Stein、Davis Brown、Hamed Hassani、Mayur Naik、Eric Wong。

  • 论文arXiv:对齐、欺骗与监督

    DeepSeek Elastic Compute(DSec):面向大规模智能体训练的高效沙箱基础设施

    DeepSeek 发布生产级沙箱平台 DSec,通过统一 SDK 提供 FnCall、容器、microVM 和 full-VM 四类沙箱后端,并与强化学习框架协同设计,将带状态的 rollout 执行与可抢占的 GPU 训练解耦,同时缓解奖励作弊等智能体失范行为。单个生产单元约 160 个节点,每天服务约 300 万个沙箱,支持超 38 万个并发沙箱、每秒超 5000 次沙箱创建,镜像数据按需从 3FS 分布式文件系统加载。

  • 动态Goodfire Research

    Goodfire 发布预测式数据调试方法,可在训练前预测 DPO 会学到什么

    Goodfire Research 发布预测式数据调试研究,主张在训练前用可解释性方法预测偏好数据会让 DPO 放大或抑制哪些行为,预测结果与实际学习效果的 R² 达 0.9,并能追溯到具体数据点。方法把数据集输入已解释的模型,按模型实际计算的概念而非嵌入向量聚类来观察数据,从而区分模型真正学到的行为与评分者眼中的行为表象。