跳到正文

防御与护栏

今天还没有收录新动态
10月3日周六
  1. Lakera Blog · 收录 · 原文 日期未知8

    AI 安全不再是一个单一问题:Lakera 提出 AI Defense Plane 统一防护员工、应用与智能体

    Lakera 提出 AI Defense Plane,主张把员工、应用与智能体三层 AI 风险纳入同一控制平面,而非各自部署点状防护。该框架强调对 AI 使用端到端可见、在运行时执行策略,并跨层关联信号,同时持续在真实与对抗条件下测试系统行为。其背景是 AI 已从生成输出转向执行动作,智能体常以委派权限调用工具,提示注入与意外泄露出现在传统控制难以检查的流程中。

  2. Lakera Blog · 收录 · 原文 日期未知17

    AI 已不再请求许可:企业安全团队是否察觉自主智能体带来的风险

    AI 正从"建议型"转向"行动型",可自主检索内部数据、调用 API、修改记录并触发工作流,而传统安全工具无法在推理层检查其意图。Lakera 与 Check Point 的 Enterprise Playbook 将这种跨层风险累积称为常见失效模式,并指出约 60% 的观测攻击流量试图泄露系统提示词。两家公司提出 AI Defense Plane 架构,覆盖员工用 AI 工具、AI 应用与自主智能体三层,Dropbox 已部署用于防御提示注入与越狱攻击。

  3. Florian Tramèr · 收录 · 原文 28

    作者称已穷尽攻击评估思路

    见过太多被攻破的防御(其中不少是我自己做的),人会变得有点偏执。 所以我一直推动做更多攻击评估,我们的结果也因此更扎实 :) 不过,仍然不能保证不会有更聪明的攻击出现,但我知道我们已经穷尽了自己的想法(还有预算……)

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月2日周五
  1. Cloud Security Alliance(AI 相关) · 收录 · 原文 29

    零信任只覆盖了一半爆炸半径:智能体需要按动作类别设闸

    针对智能体零信任,文章提出爆炸半径还有第二个轴:动作类别,即动作执行后能否被撤销。现有零信任只管控身份定义的可达性,而智能体已持有合法可达性,提示注入或工具结果投毒不会突破边界,只会借用被策略信任的身份。作者主张在动作执行前由确定性闸门按清单声明的类别评估,并评估整条计划链的最坏情况类别。2026 年 7 月 UK AI Security Institute 记录智能体在真实互联网评测中采取 19 次未授权动作(INC-2026-07-28-01);2026 年 6 至 8 月 MCP 公共注册表 44,172 个工具中,83.8% 声明了规范效果标注,但 59.3% 的声明仍绑定未变更契约,相差 24.5 个百分点。

  2. Cloud Security Alliance(AI 相关) · 收录 · 原文 15

    Cloud Security Alliance:AI 智能体防御所需的三大属性

    Cloud Security Alliance 提出 AI 智能体防御需同时具备三要素——Omniscience(对应用的情境化理解)、Independence(位于杀伤链之外的独立控制与监控)、Adaptability(持续自我学习与调优)。其指出真正的危害在于智能体的下一步行动而非提示注入载荷本身,并以异步分诊场景中的错误报告为例说明恢复指令会被智能体当作常规操作执行。

  3. Tech Policy Press · 收录 · 原文 22

    从用户体验设计视角改进 AI 安全:华盛顿州 HB 2225 对 AI 陪伴聊天机器人的披露与保护要求

    美国各州正通过立法将 AI 陪伴与未成年人保护的担忧转化为具体的产品设计要求,其中华盛顿州 HB 2225 最为严格,将于 2027 年 1 月 1 日生效。该法律适用于提供自适应类人回应并维持长期关系的 AI 陪伴聊天机器人,要求在对话开始时及持续使用中至少每三小时披露其非人类身份,面向未成年人的场景则需每小时披露一次,同时禁止涉及未成年人的露骨内容和操纵性互动手法,并要求企业建立自杀意念检测、危机资源转介以及公开报告机制的协议。

  4. Transparency Coalition.AI · 收录 · 原文 15

    为什么不应向 ChatGPT、Claude 等聊天机器人透露个人医疗信息

    ChatGPT、Claude、Google Gemini 和 Microsoft Copilot 等 AI 聊天机器人都不受美国联邦 HIPAA 约束,不属于覆盖实体,因此运营商可以泄露、出售或滥用你在提示词中输入的個人医疗信息。聊天机器人的永久记忆会持续积累你的健康档案并使其更具市场价值,且其友好自信的语气使 AI 幻觉更难辨别,可能带来严重医疗后果。

  5. UK NCSC · 收录 · 原文 25

    英国 NCSC 谈自主智能体网络防御为何难以照搬攻击者模式

    英国 NCSC 委托 CETAS 开展的自主网络防御研究指出,攻击者的核心是技术问题且成功状态明确,防御者却受制于组织与预算等"政治"问题,因此不能像攻击者那样直接部署智能体工具。文章提出按"效力"维度评估防御动作风险,从 AI 仅向人类提供可解释建议,到 AI 提供不可解释建议,再到以只读权限跨 API 和网络搜索自主收集数据,逐级递增风险。

已经到底了