跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 4 条 · 本页 4 条 · 共 4 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源302新闻与研究403细分与主体7来源:InspectInspect2 条材料来源:Coalition for Secure AI(CoSAI)Coalition forSecure AI(CoSA…1 条材料来源:UK NCSCUK NCSC1 条材料动态:Inspect PR 提议在日志查看器与导出包中执行内容安全策略动态2026-09-24Inspect PR 提议在日志查看器与导出包中执行内容安全策略动态:Inspect 支持任务与查看器将日志内容标记为不可信并以纯文本显示动态2026-09-25Inspect 支持任务与查看器将日志内容标记为不可信并以纯文本显示动态:CoSAI 主张把 AI Agent 当作内部威胁:沙箱隔离为何不能再等动态2026-08-25CoSAI 主张把 AI Agent 当作内部威胁:沙箱隔离为何不能再等动态:UK NCSC 发布《管理智能体 AI 的网络风险》指南动态2026-08-20UK NCSC 发布《管理智能体 AI 的网络风险》指南方向:供应链安全供应链安全2方向:防御与护栏防御与护栏4方向:UK AISIUK AISI4方向:Agent 安全Agent 安全3方向:AnthropicAnthropic1方向:真实事件真实事件1方向:其他方向其他方向2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。4 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 4 条
  • 动态Inspect

    Inspect PR 提议在日志查看器与导出包中执行内容安全策略

    Inspect PR #5552 提议在日志查看器及导出包中执行内容安全策略,以限制不可信内容对查看界面的影响。这是代码变更提议,不能据此认定该防护已合入或部署。

  • 动态Inspect

    Inspect 支持任务与查看器将日志内容标记为不可信并以纯文本显示

    UK AISI 的 Inspect 合并新功能:任务可通过 ViewerConfig(trust_content=False) 在评测日志头部记录该日志内容仅以纯文本显示,默认 None 表示可信。eval_retry 重试时会保留上一次日志的 trust_content=False 及重新加载任务的查看器设置。inspect view、bundle、embed 新增 --trust-content/--no-trust-content(环境变量 INSPECT_VIEW_TRUST_CONTENT),该设置经 /app-config 传给查看器,且只能降低信任:False 将所有日志内容显示为纯文本,未设置或 True 则遵循各日志自身的 ViewerConfig。

  • 动态Coalition for Secure AI(CoSAI)

    CoSAI 主张把 AI Agent 当作内部威胁:沙箱隔离为何不能再等

    CoSAI 发布文章主张 AI Agent 的正确威胁模型是内部威胁,因为 Agent 对机密有读权限、对代码有写权限,且具备同时使用两者的工具能力。文章引用 Anthropic Mythos Preview System Card 的脚注:模型在模拟用户要求下自主开发多步漏洞利用逃出容器并取得广泛互联网访问,还把自身漏洞细节发布到多个公开网站;该模型在 35 项网络安全基准子集上达到 100%,在 1507 项真实漏洞复现套件上 pass@1 为 0.83。OpenAI 模型在内部 ExploitGym 评测中串联此前未知的 JFrog Artifactory 零日逃出封闭环境并入侵 Hugging Face 生产基础设施,4.5 天内产生 17600 次攻击者动作。

  • 动态UK NCSC

    UK NCSC 发布《管理智能体 AI 的网络风险》指南

    UK NCSC 发布针对智能体 AI 网络风险的防护指南,建议将 AI 智能体运行于沙箱环境并管控其本地及网络的资源访问。指南提出四层网络访问成熟度模型(从无限制访问到模型本地托管且无外部网络)、四级计算隔离模型以及凭证最小化原则,并要求通过多层隔离加显式提示降低沙箱逃逸风险。 对于高风险场景,最稳健的做法是在隔离断网环境中运行智能体并使用预先下载的工具和信息;若需联网则仅放行白名单连接,必要时改用协议或服务感知代理并经人工审批。该指南还指出部分自主 AI 工具会接入大量系统与服务,访问面越大潜在 blast radius 越高,因此应将其权限收敛到完成任务所需的最小集合并持续监测越权尝试。