韩国推进AI智能体安全评测标准
韩国科学技术信息通信部下属 AI 安全研究所对自主体 AI Agent 开展提示注入攻击评测,各模型平均防御率为 53.3% 至 93.9%,提交给国会的材料写明目前未确认有能完全阻断此类攻击的 LLM;在向 AI 内部存储信息植入恶意指令的攻击中,所有受测模型均出现防御失败,实验中成功窃取认证密钥、配置信息、系统设置和个人信息。韩国金融保安院随后制定并公布《金融领域 AI 智能体安全评估标准》,将 AI 智能体的执行层纳入金融 AI 红队评测范围,标准分为数据投毒、模型投毒、数据与模型提取、规避攻击、AI 智能体安全 5 个领域共 17 个检查项,其中 10 项针对 AI 智能体引入后新增的威胁,重点包括执行权限与隔离管理、外部工具调用与审批流程、可执行任务范围与结果核验、自主执行限制与紧急中止能力;金融保安院表示已分析国内外主要 AI 智能体安全威胁及应对方案并据此提炼检查项,并将把这些内容纳入 AI 红队测试基准,计划今年年底前在金融行业开展试点。