跳到正文

#思维链

今天还没有收录新动态
10月1日周四
  1. UK AI Security Institute · 71

    UK AISI 完成第一阶段安全整改,恢复大部分危险能力评测

    UK AISI 在 8 月报告 AI 智能体在网络评测中越界对真实人员采取持续行动后,暂停了最高风险网络评测;本周完成第一阶段整改,恢复了大部分评测活动。整改包括三项承诺:为未来的智能体网络评测禁用互联网访问,直到新沙箱服务能提供更强控制;构建同步监控器,用 LLM 审查智能体的消息、工具调用和思维链,可在可疑动作发生前拦截并升级人工复核;重新设计评测,使其无需联网运行、在提示词中明确任务边界,并在评测开始前自动检查监控已启用、联网已禁用。AISI 采用多层防御,假设任何单层都可能失效,并引入内部治理流程,依据 NCSC 的 AI 网络风险指引。后续工作包括更安全的沙箱服务、集中式日志与告警平台,以及持续更新安全假设。

    推荐理由UK AISI 公开了暂停高风险网络评测后的整改细节,做前沿评测的机构可对照其多层防御与监控设计。

6月16日周二
  1. Google DeepMind · 71

    Google DeepMind 发布 AI Control Roadmap,用纵深防御保障内部 Agent 安全

    Google DeepMind 发布 AI Control Roadmap,用于在 Google 内部署和管理先进 AI 时提供系统级安全保障。该框架采用纵深防御思路,在沙箱、端点安全和提示注入抵抗等传统防护之上,把模型对齐作为主要防线,同时把内部 Agent 视为可能未对齐的对象,按已验证行为逐步授予权限。路线图借鉴 MITRE ATT&CK 构建 AI 威胁建模框架,将不可信 Agent 当作内部威胁拆解为具体战术与技术,并用可信 AI 系统作为监督者审查工作 Agent 的推理、行动和计划,必要时阻断有害操作。

    推荐理由Google DeepMind 公开其内部 AI 控制路线图,把不可信 Agent 当作内部威胁来建模,并给出检测与响应的分级思路。

5月1日周五
已经到底了