VoxParity 评测:语音智能体在需要听声判断时仍按文字行事
Almost Human, Except When It Matters: VoxParity and the Decisions a Voice Should Change
AI 导读
VoxParity 评测语音智能体是否会依据声音信息改变行动。该基准覆盖 14 个行业的 183 个场景,每个场景保持文字转写不变、只改变音频(如教练语气、医疗监护仪报警、无线电检查中的求救、药品名上的噪声、儿童下注的声音、惊恐的低语),对应的正确工具调用也随之改变。评测设置文字-only 的零假设对照,只有听到声音后行动变化超过纯文字流水线才算通过,23 个可同时跑转写的系统中仅 11 个通过。错误整体偏向文字:当音频要求保护性反应时,28 个系统执行常规请求的比例为 41%,而在干净通话上过度反应的比例为 12%,纯文字流水线分别为 58% 和 15%。