韩国推进AI智能体安全评测标准
先了解这件事
韩国科学技术信息通信部下属 AI 安全研究所对自主体 AI Agent 开展提示注入攻击评测,各模型平均防御率为 53.3% 至 93.9%,提交给国会的材料写明目前未确认有能完全阻断此类攻击的 LLM;在向 AI 内部存储信息植入恶意指令的攻击中所有受测模型均防御失败,实验中成功窃取认证密钥、配置信息、系统设置和个人信息,针对长期记忆的攻击中外部注入的偏置信息被写入长期记忆后,7 个模型的平均攻击者意图一致率(AAR)被测量。韩国金融保安院随后制定并公布金融领域 AI 智能体安全评测标准,用于检查金融业引入 AI 智能体后出现的新型安全威胁。该标准分为数据投毒攻击应对、模型投毒攻击应对、数据与模型提取攻击应对、规避攻击应对、AI 智能体安全 5 个领域共 17 个检查项,其中 10 项针对 AI 智能体引入后新增的威胁,重点包括智能体的执行权限与隔离管理、外部工具调用与审批流程、可执行任务范围与结果核验、自主执行限制与紧急中止能力,并将这些内容纳入 AI 红队测试基准。金融保安院计划今年年底前在金融行业开展试点。
AI 根据报道生成 · 31 分钟前更新
事件进展
- 10月7日 07:40 · 3 篇报道韩联社报道金融保安院AI智能体安全评测标准
- 10月6日 10:36 · 1 篇报道韩国AI安全研究所评测七款Agent模型提示注入防御
后续时间线
- Yonhap News Agency韩国金融保安院发布金融领域 AI 智能体安全评测标准
韩国金融保安院制定并公布金融领域 AI 智能体安全评测标准,用于检查金融业引入 AI 智能体后出现的新型安全威胁。该标准分为数据投毒攻击应对、模型投毒攻击应对、数据与模型提取攻击应对、规避攻击应对、AI 智能体安全 5 个领域共 17 个检查项,其中 10 项针对 AI 智能体引入后新增的威胁。金融保安院表示,已分析国内外主要 AI 智能体安全威胁及应对方案并据此提炼检查项,并将把这些内容纳入 AI 红队测试基准。相关已确认的 AI 智能体安全威胁、实际攻击手法和最终评测标准将在今年的 AI 红队报告中公开。院长朴相元表示,希望以此标准实际验证金融业 AI 智能体的风险,支持金融机构安全可信地使用 AI 技术。
- SBS韩国金融保安院制定金融领域 AI 智能体安全评估标准,含 5 大类 17 项检查
SBS 报道韩国金融保安院制定17项AI安全检查标准,其中10项针对智能体带来的新威胁,涉及执行权限、隔离与审批等环节。报道将相关检查归为五类。
- DailySecu精选韩国金融保安院发布金融 AI 智能体安全评估标准,将执行层纳入红队评测
韩国金融保安院开发了《金融领域 AI 智能体安全评估标准》,把 AI 智能体的执行层纳入金融 AI 红队评测范围。该标准涵盖 6 个领域共 17 项安全检查项,重点包括智能体的执行权限与隔离管理、外部工具调用与审批流程、可执行任务范围与结果核验、自主执行限制与紧急中止能力。此前 AI 红队主要检查越狱、系统提示词泄露等模型层漏洞,新标准将范围扩展到智能体实际执行了什么、这些行为是否受到适当管控。金融保安院计划今年年底前在金融行业开展试点验证,据此细化评估项与检查方法,2027 年起正式扩大适用;相关安全威胁、实际攻击手法与最终评估标准将在 2026 年《AI REDTEAM REPORT》中公开。院长朴相元表示,AI 智能体不止于判断还会直接行动,因此带来不同于以往 AI 的安全风险。
- Financial News Korea韩国 AI 安全研究所评测:自主体 Agent 提示注入防御率 53.3% 至 93.9%,无模型能完全阻断
韩国科学技术信息通信部下属 AI 安全研究所对自主体 AI Agent 开展提示注入攻击评测,各模型平均防御率为 53.3% 至 93.9%,提交给国会的材料写明目前未确认有能完全阻断此类攻击的 LLM。在向 AI 内部存储信息植入恶意指令的攻击中,所有受测模型均出现防御失败,实验中成功窃取认证密钥、配置信息、系统设置和个人信息。针对 AI 长期记忆的攻击中,外部注入的偏置信息被写入长期记忆后,7 个模型的平均攻击者意图一致率(AAR)达 91.2%,意味着被注入的信息会持续影响后续判断与任务执行。共同民主党议员金佑荣据此提出,政府推进前沿 AI 竞争的同时,应在 AI 安全综合计划中把紧急停止与人类最终控制体系列为具体安全标准。
相关讨论
关注度走势
每天新增来源
- 10月6日 新增 1 个来源(1 家媒体、0 个账号)
- 10月7日 新增 3 个来源(3 家媒体、0 个账号)