跳到正文
事件持续更新

韩国推进AI智能体安全评测标准

4 篇报道4 个报道来源2 小时前更新

先了解这件事

AI 综述

韩国科学技术信息通信部下属 AI 安全研究所对自主体 AI Agent 开展提示注入攻击评测,各模型平均防御率为 53.3% 至 93.9%,提交给国会的材料写明目前未确认有能完全阻断此类攻击的 LLM;在向 AI 内部存储信息植入恶意指令的攻击中所有受测模型均防御失败,实验中成功窃取认证密钥、配置信息、系统设置和个人信息,针对长期记忆的攻击中外部注入的偏置信息被写入长期记忆后,7 个模型的平均攻击者意图一致率(AAR)被测量。韩国金融保安院随后制定并公布金融领域 AI 智能体安全评测标准,用于检查金融业引入 AI 智能体后出现的新型安全威胁。该标准分为数据投毒攻击应对、模型投毒攻击应对、数据与模型提取攻击应对、规避攻击应对、AI 智能体安全 5 个领域共 17 个检查项,其中 10 项针对 AI 智能体引入后新增的威胁,重点包括智能体的执行权限与隔离管理、外部工具调用与审批流程、可执行任务范围与结果核验、自主执行限制与紧急中止能力,并将这些内容纳入 AI 红队测试基准。金融保安院计划今年年底前在金融行业开展试点。

AI 根据报道生成 · 31 分钟前更新

事件进展

2 个进展
  1. 10月7日 07:40 · 3 篇报道
    韩联社报道金融保安院AI智能体安全评测标准
    DailySecu:韩国金融保安院发布金融 AI 智能体安全评估标准,将执行层纳入红队评测
  2. 10月6日 10:36 · 1 篇报道
    韩国AI安全研究所评测七款Agent模型提示注入防御
    Financial News Korea:韩国 AI 安全研究所评测:自主体 Agent 提示注入防御率 53.3% 至 93.9%,无模型能完全阻断

后续时间线

报道和讨论按时间排:从发布、媒体跟进到各平台的讨论。

10月7日
  1. Yonhap News Agency
    韩国金融保安院发布金融领域 AI 智能体安全评测标准

    韩国金融保安院制定并公布金融领域 AI 智能体安全评测标准,用于检查金融业引入 AI 智能体后出现的新型安全威胁。该标准分为数据投毒攻击应对、模型投毒攻击应对、数据与模型提取攻击应对、规避攻击应对、AI 智能体安全 5 个领域共 17 个检查项,其中 10 项针对 AI 智能体引入后新增的威胁。金融保安院表示,已分析国内外主要 AI 智能体安全威胁及应对方案并据此提炼检查项,并将把这些内容纳入 AI 红队测试基准。相关已确认的 AI 智能体安全威胁、实际攻击手法和最终评测标准将在今年的 AI 红队报告中公开。院长朴相元表示,希望以此标准实际验证金融业 AI 智能体的风险,支持金融机构安全可信地使用 AI 技术。

  2. SBS
    韩国金融保安院制定金融领域 AI 智能体安全评估标准,含 5 大类 17 项检查

    SBS 报道韩国金融保安院制定17项AI安全检查标准,其中10项针对智能体带来的新威胁,涉及执行权限、隔离与审批等环节。报道将相关检查归为五类。

  3. DailySecu精选
    韩国金融保安院发布金融 AI 智能体安全评估标准,将执行层纳入红队评测

    韩国金融保安院开发了《金融领域 AI 智能体安全评估标准》,把 AI 智能体的执行层纳入金融 AI 红队评测范围。该标准涵盖 6 个领域共 17 项安全检查项,重点包括智能体的执行权限与隔离管理、外部工具调用与审批流程、可执行任务范围与结果核验、自主执行限制与紧急中止能力。此前 AI 红队主要检查越狱、系统提示词泄露等模型层漏洞,新标准将范围扩展到智能体实际执行了什么、这些行为是否受到适当管控。金融保安院计划今年年底前在金融行业开展试点验证,据此细化评估项与检查方法,2027 年起正式扩大适用;相关安全威胁、实际攻击手法与最终评估标准将在 2026 年《AI REDTEAM REPORT》中公开。院长朴相元表示,AI 智能体不止于判断还会直接行动,因此带来不同于以往 AI 的安全风险。

10月6日
  1. Financial News Korea
    韩国 AI 安全研究所评测:自主体 Agent 提示注入防御率 53.3% 至 93.9%,无模型能完全阻断

    韩国科学技术信息通信部下属 AI 安全研究所对自主体 AI Agent 开展提示注入攻击评测,各模型平均防御率为 53.3% 至 93.9%,提交给国会的材料写明目前未确认有能完全阻断此类攻击的 LLM。在向 AI 内部存储信息植入恶意指令的攻击中,所有受测模型均出现防御失败,实验中成功窃取认证密钥、配置信息、系统设置和个人信息。针对 AI 长期记忆的攻击中,外部注入的偏置信息被写入长期记忆后,7 个模型的平均攻击者意图一致率(AAR)达 91.2%,意味着被注入的信息会持续影响后续判断与任务执行。共同民主党议员金佑荣据此提出,政府推进前沿 AI 竞争的同时,应在 AI 安全综合计划中把紧急停止与人类最终控制体系列为具体安全标准。

相关讨论

各平台上讨论这件事的帖子和转述:不单独成文,只列链接和一句原文。72 小时的讨论链接数还含 4 篇报道,见后续时间线。

本站还没有收集到这件事的讨论链接。

关注度走势

内容价值与传播共同决定关注度;传播减弱时回落到内容价值。

每天新增来源

2 天共 4 个·最多 3(10月7日)·今天 3

  • 10月6日 新增 1 个来源(1 家媒体、0 个账号)
  • 10月7日 新增 3 个来源(3 家媒体、0 个账号)

每小时关注度

还没有足够的连续观测数据,暂不绘制趋势。