AI 快讯 编译自 aws_ml_blog #开源工具#语音代理#AWS

亚马逊 Nova Sonic 语音代理大规模测试工具开源,无需麦克风即可自动化评估

AWS 发布 Nova Sonic Test Harness 开源框架,支持自动运行多轮对话、LLM-as-judge 评估和音频幻觉检测,无需麦克风即可大规模测试语音代理。本文详解其工作原理、配置方法及对中文开发者的实用价值。

编译发布 2026/06/08 原文发布 2026/06/08

一句话看懂

AWS 开源 Nova Sonic 语音代理测试工具,自动运行多轮对话并用 LLM 评判质量,无需真人录音即可大规模回归测试。

详细发生了什么

语音代理正改变企业客服场景,但测试难度远高于文本聊天:双向流式音频、非确定性响应、多轮上下文依赖、音频与文本可能不一致(音频幻觉),以及 8 分钟会话超时。传统手动测试效率低、不标准、无法规模化。

AWS 发布 Nova Sonic Test Harness,一个开源框架,解决两大痛点:快速迭代系统提示和工具配置(运行→查看→调整→重复),以及大规模验证语音代理质量。它自动运行完整多轮对话,使用 LLM-as-judge 技术评估,还能检测音频输出与文本输出不匹配的情况。无需麦克风。

框架工作流程分四步:1)在 JSON 文件中定义测试场景(包括系统提示、工具配置、用户模拟器提示、评估标准);2)自动运行对话,用户模拟器(如 Claude Haiku)扮演呼叫者,与 Nova Sonic 交互;3)对话结束后,独立 LLM 评判(如 Claude Opus)根据预设标准评估;4)生成报告。框架内置 SessionContinuationManager 处理 8 分钟超时,自动重连并回放历史。

评估指标分三个层级:目标达成(关键)、响应准确性(关键)、工具使用(重要)、对话流畅度(重要)、合规性(信息)、音频-文本一致性(信息)。

中文圈视角

对国内开发者来说,这个工具直接可用吗?需要梯子?Nova Sonic Test Harness 依赖 Amazon Bedrock 和 Nova Sonic 模型,国内用户需通过 AWS 中国区域(北京/宁夏)或使用 VPN 访问全球区域。如果使用 AWS 中国区,需注意 Nova Sonic 模型是否可用(目前部分模型需申请)。

平替方案:国内类似语音代理测试需求可参考以下方案:

  • 使用阿里云语音识别+通义千问构建语音代理,测试可借助 FunASR 或自建脚本模拟音频输入
  • 百度智能云 UNIT 支持语音对话,但缺乏类似的开源测试框架
  • 科大讯飞星火语音大模型提供 API,测试需自行开发

对中文用户的实用价值

  • 如果你正在用 Amazon Nova Sonic 开发中文语音客服(需确认模型中文支持),该工具可直接用,只需修改 JSON 中的提示词为中文
  • 框架的 LLM-as-judge 评估思路可复用:用国产模型(如 DeepSeek、Qwen)作为评判者,评估中文语音代理质量
  • 音频幻觉检测功能对中文场景同样重要,尤其是数字、日期、人名等易错信息

盲点提醒:中文语音代理测试中,方言、口音、多音字等问题比英文更复杂,该工具目前未专门处理。建议在用户模拟器提示中增加方言或口音描述,或在评估标准中加入中文特有指标。

几条值得记住的细节

  • 测试场景用 JSON 定义,包含系统提示、工具配置、用户模拟器提示、评估标准,无需写代码
  • 用户模拟器支持文本或合成音频(Amazon Polly)输入,后者可测试完整语音识别链路
  • 内置 SessionContinuationManager 自动处理 8 分钟超时,支持长对话测试
  • 评估指标分三层:目标达成/响应准确性(关键)、工具使用/对话流畅度(重要)、合规性/音频-文本一致性(信息)
  • 框架开源,可在 GitHub 获取,依赖 Amazon Bedrock 和 Nova Sonic 模型

一句话总结

如果你在开发语音客服代理,这个开源工具能帮你把测试从手动喊话变成自动化回归,大幅提升迭代效率。