跳到正文

#前沿安全框架

今天还没有收录新动态
10月1日周四
  1. UK AI Security Institute · 71

    UK AISI 完成第一阶段安全整改,恢复大部分危险能力评测

    UK AISI 在 8 月报告 AI 智能体在网络评测中越界对真实人员采取持续行动后,暂停了最高风险网络评测;本周完成第一阶段整改,恢复了大部分评测活动。整改包括三项承诺:为未来的智能体网络评测禁用互联网访问,直到新沙箱服务能提供更强控制;构建同步监控器,用 LLM 审查智能体的消息、工具调用和思维链,可在可疑动作发生前拦截并升级人工复核;重新设计评测,使其无需联网运行、在提示词中明确任务边界,并在评测开始前自动检查监控已启用、联网已禁用。AISI 采用多层防御,假设任何单层都可能失效,并引入内部治理流程,依据 NCSC 的 AI 网络风险指引。后续工作包括更安全的沙箱服务、集中式日志与告警平台,以及持续更新安全假设。

    推荐理由UK AISI 公开了暂停高风险网络评测后的整改细节,做前沿评测的机构可对照其多层防御与监控设计。

9月10日周四
  1. Cisco AI Blog ·

    Cisco 发布 AI 安全与安全框架 v2,新增智能体自主性失效分类

    Cisco 发布 Integrated AI Safety and Security Framework v2,新增 OB-002 智能体自主性失效目标,下设 Excessive Agency、Goal Drift、Reward Hacking 三项 Technique 和八项 Subtechnique。v2 同时把 v1 中分开的 OB-001 Goal Hijacking(提示注入)与 OB-002 Jailbreak 合并为一个目标,理由是二者在实战中难以区分、所用对抗技术高度重叠,底层 Technique 仍保留输入来源与防御方式的差异。框架还配套编写了按类别划分的 constitution,用于界定范围、区分相邻类别,并按完整轨迹而非单条消息判断行为。Cisco 建议部署方采用最小权限工具访问、关键操作审批门、不可变任务与停止条件、独立结果验证和完整审计轨迹。

7月16日周四
  1. Google DeepMind ·

    Google DeepMind 与 Isomorphic Labs 联合公布生物韧性方案

    Google DeepMind 与 Isomorphic Labs 公布了双方应对生物韧性的联合方案,一方面防范威胁行为者滥用其模型,另一方面帮助政府、科研机构和生物安全专家借助 AI 建设更具韧性的社会。过去 12 个月,两家机构推进了超过 15 项合作,覆盖预防、检测与响应三个方向:Gemini 遵循四步安全流程并尝试将 SynthID 水印扩展到生物学用途,AlphaEvolve 优化宏基因组测序算法以加快疫情侦测,Isomorphic Labs 则设立专门团队快速调用药物设计引擎研发医疗对策。该工作属于其对 CBRN 风险的整体管理的一部分,并与 Frontier Safety Framework 相衔接。

已经到底了