亚马逊 Nova Sonic 语音代理大规模测试工具开源,无需麦克风即可自动化评估
AWS 发布 Nova Sonic Test Harness 开源框架,支持自动运行多轮对话、LLM-as-judge 评估和音频幻觉检测,无需麦克风即可大规模测试语音代理。本文详解其工作原理、配置方法及对中文开发者的实用价值。
一句话看懂
AWS 开源 Nova Sonic 语音代理测试工具,自动运行多轮对话并用 LLM 评判质量,无需真人录音即可大规模回归测试。
详细发生了什么
语音代理正改变企业客服场景,但测试难度远高于文本聊天:双向流式音频、非确定性响应、多轮上下文依赖、音频与文本可能不一致(音频幻觉),以及 8 分钟会话超时。传统手动测试效率低、不标准、无法规模化。
AWS 发布 Nova Sonic Test Harness,一个开源框架,解决两大痛点:快速迭代系统提示和工具配置(运行→查看→调整→重复),以及大规模验证语音代理质量。它自动运行完整多轮对话,使用 LLM-as-judge 技术评估,还能检测音频输出与文本输出不匹配的情况。无需麦克风。
框架工作流程分四步:1)在 JSON 文件中定义测试场景(包括系统提示、工具配置、用户模拟器提示、评估标准);2)自动运行对话,用户模拟器(如 Claude Haiku)扮演呼叫者,与 Nova Sonic 交互;3)对话结束后,独立 LLM 评判(如 Claude Opus)根据预设标准评估;4)生成报告。框架内置 SessionContinuationManager 处理 8 分钟超时,自动重连并回放历史。
评估指标分三个层级:目标达成(关键)、响应准确性(关键)、工具使用(重要)、对话流畅度(重要)、合规性(信息)、音频-文本一致性(信息)。
中文圈视角
对国内开发者来说,这个工具直接可用吗?需要梯子?Nova Sonic Test Harness 依赖 Amazon Bedrock 和 Nova Sonic 模型,国内用户需通过 AWS 中国区域(北京/宁夏)或使用 VPN 访问全球区域。如果使用 AWS 中国区,需注意 Nova Sonic 模型是否可用(目前部分模型需申请)。
平替方案:国内类似语音代理测试需求可参考以下方案:
- 使用阿里云语音识别+通义千问构建语音代理,测试可借助 FunASR 或自建脚本模拟音频输入
- 百度智能云 UNIT 支持语音对话,但缺乏类似的开源测试框架
- 科大讯飞星火语音大模型提供 API,测试需自行开发
对中文用户的实用价值:
- 如果你正在用 Amazon Nova Sonic 开发中文语音客服(需确认模型中文支持),该工具可直接用,只需修改 JSON 中的提示词为中文
- 框架的 LLM-as-judge 评估思路可复用:用国产模型(如 DeepSeek、Qwen)作为评判者,评估中文语音代理质量
- 音频幻觉检测功能对中文场景同样重要,尤其是数字、日期、人名等易错信息
盲点提醒:中文语音代理测试中,方言、口音、多音字等问题比英文更复杂,该工具目前未专门处理。建议在用户模拟器提示中增加方言或口音描述,或在评估标准中加入中文特有指标。
几条值得记住的细节
- 测试场景用 JSON 定义,包含系统提示、工具配置、用户模拟器提示、评估标准,无需写代码
- 用户模拟器支持文本或合成音频(Amazon Polly)输入,后者可测试完整语音识别链路
- 内置 SessionContinuationManager 自动处理 8 分钟超时,支持长对话测试
- 评估指标分三层:目标达成/响应准确性(关键)、工具使用/对话流畅度(重要)、合规性/音频-文本一致性(信息)
- 框架开源,可在 GitHub 获取,依赖 Amazon Bedrock 和 Nova Sonic 模型
一句话总结
如果你在开发语音客服代理,这个开源工具能帮你把测试从手动喊话变成自动化回归,大幅提升迭代效率。