← 返回信息流

精选Hugging Face Blog短讯

Open TTS Leaderboard:可扩展的多语言语音合成与声音克隆评估基准

huggingface.co评测AI评分:70/100

发布 Open TTS Leaderboard,旨在为多语言文本转语音(TTS)和声音克隆技术提供可扩展的评估标准。

然而,评估工作并未跟上步伐:它依然支离破碎且缺乏标准化。黄金标准是人类偏好评分,如 MOS 或 MUSHRA(详见指标部分)。为此,几个基于竞技场模式的排行榜已确立为社区有用的参考点:

  1. TTS Arena v2
  2. Artificial Analysis
  3. Voice Arena

这些竞技场通过向用户展示来自两个模型的 TTS 输出,并要求他们在两者之间做出选择来比较模型。在收集到足够多的投票后,计算 Elo 分数以对模型进行排名,通常使用 Bradley–Terry 模型(参见 Voice Arena 方法论)。

虽然人类偏好是最终的裁决者,但竞技场无法扩展以跟上 TTS 发布的节奏。这可能在一定程度上解释了为什么开源模型在竞技场式排行榜中代表性不足:截至 2026 年 9 月 30 日,Artificial Analysis 上的 92 个模型中仅有 16 个是开放权重的,Voice Arena 也存在类似的偏差。这可能反映了实际因素:添加 API 模型只需提供 API 密钥即可,而开源模型必须由竞技场运营商托管和提供服务,且商业提供商比开源作者更有理由寻求上榜。竞技场式评估的另一个局限性在于投票者的一致性:没有任何竞技场能够确保具有相同“更好”标准的同一批投票者能随时间一致地评估模型。即使是单个人的偏好也会随时间变化(正如赫拉克利特那句名言所说:“人不能两次踏进同一条河流”)。

为此,我们构建了 Open TTS Leaderboard,它使用客观指标从性能的不同互补方面对模型进行评估:

  1. 可懂度:提示文本与生成音频转录本之间的字/字符错误率(WER 和 CER),使用 Qwen3 ASR(Open ASR Leaderboard 上排名最高的开源模型)。
  2. 速度:在 H200 GPU 上进行批量离线推理时的逆实时因子(RTFx),以及在 H200 GPU 和 CPU 上量化流式批处理大小为 1 的延迟的时间首音(TTFA)。
  3. 说话人相似度:通过计算生成音频与参考片段的 WavLM 说话人嵌入之间的余弦相似度(SIM)得出。

依靠客观指标进行评估,所需时间从几周(用于收集投票)缩短到了几小时 ⚡

重要的是,Open TTS Leaderboard 并不取代人类偏好排名。基于 ASR 的 WER 提供了可懂度的代理指标,而说话人相似度则估计了声音身份保留情况。它们都没有直接测量自然度、表现力或听众偏好。尽管如此,它们甚至可以为基于投票的排行榜提供建议,帮助其确定纳入评估的模型。

我们建立此排行榜的初衷是让它由社区塑造;我们希望听到您的反馈,以便评估保持相关性和洞察力。接下来的几个章节将概述 Open TTS Leaderboard 的主要功能。

多语言 + 语音克隆评估

从排行榜的默认视图来看,模型根据 Seed TTS Eval(论文)和 CV3 Eval(零样本)(论文)英语切片的宏观平均 WER 进行排名。

hexgrad/Kokoro-82M、Supertone/supertonic-3 和 fishaudio/s2-pro 在这两个切片上的平均英语 WER 中领先,而帕累托图则可视化了哪些模型在 WER、批量推理(RTFx)和模型大小之间取得了良好的平衡。

英语性能不一定能转化为其他语言的表现。可以切换多种语言,以根据多语言性能对模型进行排名。Seed TTS Eval 仅包含英语和中文的音频,因此其他语言的成绩仅来自 CV3 Eval(零样本)。请注意,中文、日文和韩文是基于字符的语言,因此报告的是字符错误率(CER),跨语言的“平均 WER”是各语言的宏观平均值。

k2-fsa/OmniVoice、fishaudio/s2-pro 以及 FunAudioLLM/Fun-CosyVoice3-0.5B-2512 是表现强劲的多语言模型。

通过切换“语音克隆”选项,可以比较支持该功能(在所选语言上)的模型。

此外,表格中现在出现了用于衡量说话人相似度的 SIM 列,以及两个额外的帕累托图,用于可视化 SIM、批量推理和模型大小之间的权衡关系。

部分模型(如 bosonai/higgs-tts-3-4b 和 openbmb/VoxCPM2)的平均 WER 在启用语音克隆时有所改善,即当提供参考音频时。

比较并投票评选 TTS 输出

数字仅能讲述故事的一部分,正如前文所述,人类偏好才是最终的裁决者。从“Listen”标签页中,您可以比较那些支撑各项指标生成的实际输出,从而找出您更青睐的模型!

选择您感兴趣的语言/数据集,决定是否要比较语音克隆功能,并可选择特定模型或随机听取一些输出。

“Listen”标签页填补了现有 TTS 排行榜的一个重要空白:一个探索各种模型输出的空间。

您甚至可以对生成的输出提供反馈。随着我们从社区收集到更多投票,我们可能会将这些数据纳入排行榜。所以请投票!但请使用您的 HF 账号登录,以帮助我们剔除垃圾信息和机器人。

流式传输性能

“Streaming”标签页比较了模型的流式传输能力。模型根据 TTFA(首次音频时间)进行排名,该指标量化了用户在探测模型后需要等待多长时间才能获得可播放的音频。这对于语音代理和其他交互式应用至关重要。

对于支持流式传输的模型(“Streaming API”列标记为 ✅),TTFA 是指直到第一个音频块到达所需的时间。对于不支持流式传输的模型,TTFA 是指生成整个语句所需的时间,因为播放无法更早开始。每个模型每次运行一个音频(批处理大小为 1),使用 CV3-Eval 中的相同 50 个英文提示词,在同一硬件上并使用其默认声音进行测试。我们丢弃前 3 次运行作为预热,并报告其余运行的中位数 TTFA。

默认视图比较了在 H200 GPU 上的性能。对于一小部分(但正在增长)的模型,我们还提供了 CPU 上的结果!

kyutai/pocket-tts 是一款在 GPU 和 CPU 上进行流式传输的优秀模型!

结论

Open TTS Leaderboard 的目标不仅是跟上 TTS 模型发布的惊人速度,还要由社区共同塑造;我们希望听到您的反馈,以使评估保持相关性和洞察力。请告诉我们您希望看到哪些数据集、模型和指标!

目前,我们专注于:

  1. 开源模型,以突出许多被竞技场式评估所忽视的优秀模型。
  2. 多语言能力,因为英语性能并非其他语言的合适代理指标。

我们将很快开源评估脚本,类似于 Open ASR Leaderboard 仓库,以便您可以通过 GitHub Issues 和 PRs 直接提供反馈和建议!让我们一起塑造 TTS 评估 🤗

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文