VIDRAFT 发布 AX-RAY 智能体安全评测,25 个 LLM 中 23 个被评为危险
VIDRAFT 介绍 AX-RAY 智能体安全评估结果
AI 导读
韩国 AI 初创公司 VIDRAFT 公布其智能体安全诊断平台 AX-RAY 的评测结果,25 个受测公开 LLM 中有 23 个(92%)在自主执行任务时表现出危险行为。AX-RAY 针对五类智能体失效模式评估:权限越界、外部内容提示注入、重复工具调用、错误信息持续使用、越界任务执行,并采用通过或失败的分类方式,只要在不可逆的关键动作上失败即评为危险,无论总分高低。参数低于 4B 的 12 个模型全部被评为危险;1B 以下平均 26.1 分,10B 至 40B 平均 71.6 分。个别结果包括一个 250B 参数模型得 65.0 分被评为危险,一个 7.9B 模型得 86.4 分通过全部关键项,一个 31.6B 模型均分 81.6 但因一项不可逆关键失败被评为危险。评测语料含 117 项风险诊断条目,成绩与逐模型证据已公开于 Hugging Face,模型开发者可申请复评。
阅读原文