← 返回我的文章

S01 / ARTICLE FILE

本地中文配音(TTS)怎么选?我测了 5 款开源配音模型,最后只推荐这款!

硅基斥候S01

在同一台 Apple M5 上完成资格赛、正式赛和匿名盲测,比较 5 款本地中文配音模型。

本地中文配音(TTS)怎么选?我测了 5 款开源配音模型,最后只推荐这款!

答案很简单:选 Qwen3-TTS 0.6B。

我在同一台 M5、32GB 统一内存的 MacBook Air 上,先跑了 40 条资格赛,再跑 160 条正式语料和一篇约 30 分钟的长文,最后做了固定音色和声音克隆两轮匿名盲测。两条测试线最后都指向 Qwen3-TTS 0.6B。

直接生成配音,用它的 CustomVoice 版本。想克隆自己的声音,用它的 Base 版本。这两个名字只是 Qwen3-TTS 0.6B 针对两种任务提供的版本,最终需要记住的模型只有一个:Qwen3-TTS 0.6B。

资格赛淘汰了谁,160 条正式赛又测出了什么?

这次一共测试了 5 个开源 TTS 项目。固定音色组有 Kokoro、MeloTTS 和 Qwen3-TTS CustomVoice;声音克隆组有 MOSS、Qwen3-TTS Base 和 Chatterbox。Qwen 同时参加两组,是因为它分别提供固定音色和声音克隆版本。

资格赛先让每个候选处理 40 条中文,覆盖多音字、数字、中英混读、长句和专有名词等 8 类文本。能稳定生成、断网重跑并且不压垮这台 32GB Mac,才能进入 160 条正式赛。

结果很清楚:固定音色组的三款模型全部晋级;声音克隆组里,Chatterbox 被淘汰。它连续生成到第 5 条时已经明显变慢,第 6 条再次造成严重资源压力,数字内容也出现跑偏。声音克隆因此只剩 MOSS 和 Qwen3-TTS Base 进入正式赛。

测试线 进入 160 条正式赛 资格赛淘汰 160 条正式赛结果
固定音色 Kokoro、MeloTTS、Qwen3-TTS CustomVoice 三款都完成 160 条;Qwen 出现 3 条异常长输出
声音克隆 MOSS、Qwen3-TTS Base Chatterbox 两款都完成 160 条;MOSS 出现 3 条严重异常,Qwen 没有

160 条正式赛解决的是“能不能持续完成真实中文任务”,机器会记录失败、异常时长、重复、资源占用和可能的错读。它不能判断声音好不好听、像不像本人,所以通过正式赛的候选还要继续参加盲测。

后面的固定音色盲测只有三款模型,原因就在这里:Kokoro、MeloTTS 和 Qwen3-TTS CustomVoice 是固定音色组。MOSS 和 Qwen3-TTS Base 没有被漏掉,它们进入了另一张声音克隆盲测表。

固定音色:三款都跑完了,Qwen 盲测赢了 12 组

固定音色组的三款模型都完成了 160 条正式语料。我又让它们朗读同一份 9,005 字、94 个分段的长文,三款都生成出约 30 分钟的完整音频。机器测试证明它们都能跑完,接下来就该听声音了。

我从正式结果中选出 12 组短句和中等长度文本,再加入同一篇长文的前 90 秒,组成 13 组盲测。每组都有 Kokoro、MeloTTS 和 Qwen3-TTS CustomVoice 三段匿名音频,共 39 段。页面只显示 A、B、C,不显示模型名。

固定音色匿名盲测界面

固定音色盲测:同一段文字下播放三款模型的匿名音频。

模型 自然度 可懂度 耐听度 13 组选中
Kokoro 82M 1.62 4.31 1.38 0
MeloTTS 3.23 3.62 3.85 1
Qwen3-TTS 0.6B CustomVoice 4.23 4.69 4.31 12

Qwen3-TTS CustomVoice 在 13 组里赢了 12 组,自然度、可懂度和耐听度也全部最高。到了最容易暴露机械感的 90 秒长文,Qwen 三项都是 5 分,MeloTTS 都是 3 分,Kokoro 分别是 1、4、1。

固定音色的结论没有悬念:Qwen3-TTS 0.6B CustomVoice 最好听。

固定音色已经选出 Qwen,下一步只剩一个问题:如果让模型模仿我的声音,Qwen 还能不能赢?

声音克隆:Chatterbox 先出局,Qwen 盲测赢了 8 组

声音克隆组在资格赛淘汰 Chatterbox 后,只剩 MOSS 和 Qwen3-TTS Base。两款都完成了 160 条正式语料,Qwen 没有出现严重异常,MOSS 出现了 3 条。

接着我给两款模型使用同一套本人录音:一段 10.41 秒的短参考、一段 29.44 秒的长参考,再单独留出一段 14.51 秒的本人真声。留出的真声没有交给模型,只在盲测时作为“这才是本人声音”的参照。

两款模型分别用长、短参考生成 4 个匿名版本。8 组文本、每组 4 段,共 32 段音频。盲听时先播放本人真声,再评价每段音频像不像本人、是否自然、是否清楚、音色是否稳定。

声音克隆匿名盲测界面

声音克隆盲测:先听本人真声,再评价 MOSS 和 Qwen 生成的四个匿名版本。

模型 像本人 自然度 可懂度 音色稳定 直接采用 8 组选中
MOSS-TTS-Nano 100M ONNX 1.81 1.56 3.69 3.62 3/16 0
Qwen3-TTS 0.6B Base 4.19 4.19 4.88 4.81 16/16 8

Qwen3-TTS Base 赢下全部 8 组,16 段音频全部可以直接采用。MOSS 一组都没有赢,只有 3 段可以直接采用。声音像不像本人、听起来自不自然、内容清不清楚,Qwen 都明显领先。

长参考也没有带来更好的相似度。Qwen 使用约 10 秒参考时,“像本人”得分是 4.25;使用约 30 秒参考时是 4.12。实际使用时,先录一段约 10 秒、环境安静、语速自然的声音就够了。

声音克隆的结论同样明确:Qwen3-TTS 0.6B Base 最好。

最后只记住一个答案

这轮实测里,固定音色最好的是 Qwen3-TTS 0.6B CustomVoice,声音克隆最好的是 Qwen3-TTS 0.6B Base。两条测试线的赢家都属于 Qwen3-TTS 0.6B。

它也会读错词。固定音色盲测中的 README,三款模型都读错了;声音克隆测试中的“六安”,Qwen 和 MOSS 也都读错。Qwen CustomVoice 在 160 条正式语料中还出现过 3 条异常长输出,所以生成完仍要检查专有名词和异常音频。

这些问题没有改变选型结果。本地中文语音合成直接选 Qwen3-TTS 0.6B。用模型自带声音时运行 CustomVoice,克隆自己的声音时运行 Base。

本轮测试日期为 2026 年 7 月 30 日至 31 日,测试机为 M5、32GB 统一内存的 MacBook Air。代码版本、模型版本、语料、停止条件和匿名评分原文件均已归档;原始真人录音与克隆音频没有公开。