答案很简单:选 Qwen3-TTS 0.6B。
我在同一台 M5、32GB 统一内存的 MacBook Air 上,先跑了 40 条资格赛,再跑 160 条正式语料和一篇约 30 分钟的长文,最后做了固定音色和声音克隆两轮匿名盲测。两条测试线最后都指向 Qwen3-TTS 0.6B。
直接生成配音,用它的 CustomVoice 版本。想克隆自己的声音,用它的 Base 版本。这两个名字只是 Qwen3-TTS 0.6B 针对两种任务提供的版本,最终需要记住的模型只有一个:Qwen3-TTS 0.6B。
资格赛淘汰了谁,160 条正式赛又测出了什么?
这次一共测试了 5 个开源 TTS 项目。固定音色组有 Kokoro、MeloTTS 和 Qwen3-TTS CustomVoice;声音克隆组有 MOSS、Qwen3-TTS Base 和 Chatterbox。Qwen 同时参加两组,是因为它分别提供固定音色和声音克隆版本。
资格赛先让每个候选处理 40 条中文,覆盖多音字、数字、中英混读、长句和专有名词等 8 类文本。能稳定生成、断网重跑并且不压垮这台 32GB Mac,才能进入 160 条正式赛。
结果很清楚:固定音色组的三款模型全部晋级;声音克隆组里,Chatterbox 被淘汰。它连续生成到第 5 条时已经明显变慢,第 6 条再次造成严重资源压力,数字内容也出现跑偏。声音克隆因此只剩 MOSS 和 Qwen3-TTS Base 进入正式赛。
| 测试线 | 进入 160 条正式赛 | 资格赛淘汰 | 160 条正式赛结果 |
|---|---|---|---|
| 固定音色 | Kokoro、MeloTTS、Qwen3-TTS CustomVoice | 无 | 三款都完成 160 条;Qwen 出现 3 条异常长输出 |
| 声音克隆 | MOSS、Qwen3-TTS Base | Chatterbox | 两款都完成 160 条;MOSS 出现 3 条严重异常,Qwen 没有 |
160 条正式赛解决的是“能不能持续完成真实中文任务”,机器会记录失败、异常时长、重复、资源占用和可能的错读。它不能判断声音好不好听、像不像本人,所以通过正式赛的候选还要继续参加盲测。
后面的固定音色盲测只有三款模型,原因就在这里:Kokoro、MeloTTS 和 Qwen3-TTS CustomVoice 是固定音色组。MOSS 和 Qwen3-TTS Base 没有被漏掉,它们进入了另一张声音克隆盲测表。
固定音色:三款都跑完了,Qwen 盲测赢了 12 组
固定音色组的三款模型都完成了 160 条正式语料。我又让它们朗读同一份 9,005 字、94 个分段的长文,三款都生成出约 30 分钟的完整音频。机器测试证明它们都能跑完,接下来就该听声音了。
我从正式结果中选出 12 组短句和中等长度文本,再加入同一篇长文的前 90 秒,组成 13 组盲测。每组都有 Kokoro、MeloTTS 和 Qwen3-TTS CustomVoice 三段匿名音频,共 39 段。页面只显示 A、B、C,不显示模型名。

固定音色盲测:同一段文字下播放三款模型的匿名音频。
| 模型 | 自然度 | 可懂度 | 耐听度 | 13 组选中 |
|---|---|---|---|---|
| Kokoro 82M | 1.62 | 4.31 | 1.38 | 0 |
| MeloTTS | 3.23 | 3.62 | 3.85 | 1 |
| Qwen3-TTS 0.6B CustomVoice | 4.23 | 4.69 | 4.31 | 12 |
Qwen3-TTS CustomVoice 在 13 组里赢了 12 组,自然度、可懂度和耐听度也全部最高。到了最容易暴露机械感的 90 秒长文,Qwen 三项都是 5 分,MeloTTS 都是 3 分,Kokoro 分别是 1、4、1。
固定音色的结论没有悬念:Qwen3-TTS 0.6B CustomVoice 最好听。
固定音色已经选出 Qwen,下一步只剩一个问题:如果让模型模仿我的声音,Qwen 还能不能赢?
声音克隆:Chatterbox 先出局,Qwen 盲测赢了 8 组
声音克隆组在资格赛淘汰 Chatterbox 后,只剩 MOSS 和 Qwen3-TTS Base。两款都完成了 160 条正式语料,Qwen 没有出现严重异常,MOSS 出现了 3 条。
接着我给两款模型使用同一套本人录音:一段 10.41 秒的短参考、一段 29.44 秒的长参考,再单独留出一段 14.51 秒的本人真声。留出的真声没有交给模型,只在盲测时作为“这才是本人声音”的参照。
两款模型分别用长、短参考生成 4 个匿名版本。8 组文本、每组 4 段,共 32 段音频。盲听时先播放本人真声,再评价每段音频像不像本人、是否自然、是否清楚、音色是否稳定。

声音克隆盲测:先听本人真声,再评价 MOSS 和 Qwen 生成的四个匿名版本。
| 模型 | 像本人 | 自然度 | 可懂度 | 音色稳定 | 直接采用 | 8 组选中 |
|---|---|---|---|---|---|---|
| MOSS-TTS-Nano 100M ONNX | 1.81 | 1.56 | 3.69 | 3.62 | 3/16 | 0 |
| Qwen3-TTS 0.6B Base | 4.19 | 4.19 | 4.88 | 4.81 | 16/16 | 8 |
Qwen3-TTS Base 赢下全部 8 组,16 段音频全部可以直接采用。MOSS 一组都没有赢,只有 3 段可以直接采用。声音像不像本人、听起来自不自然、内容清不清楚,Qwen 都明显领先。
长参考也没有带来更好的相似度。Qwen 使用约 10 秒参考时,“像本人”得分是 4.25;使用约 30 秒参考时是 4.12。实际使用时,先录一段约 10 秒、环境安静、语速自然的声音就够了。
声音克隆的结论同样明确:Qwen3-TTS 0.6B Base 最好。
最后只记住一个答案
这轮实测里,固定音色最好的是 Qwen3-TTS 0.6B CustomVoice,声音克隆最好的是 Qwen3-TTS 0.6B Base。两条测试线的赢家都属于 Qwen3-TTS 0.6B。
它也会读错词。固定音色盲测中的 README,三款模型都读错了;声音克隆测试中的“六安”,Qwen 和 MOSS 也都读错。Qwen CustomVoice 在 160 条正式语料中还出现过 3 条异常长输出,所以生成完仍要检查专有名词和异常音频。
这些问题没有改变选型结果。本地中文语音合成直接选 Qwen3-TTS 0.6B。用模型自带声音时运行 CustomVoice,克隆自己的声音时运行 Base。
本轮测试日期为 2026 年 7 月 30 日至 31 日,测试机为 M5、32GB 统一内存的 MacBook Air。代码版本、模型版本、语料、停止条件和匿名评分原文件均已归档;原始真人录音与克隆音频没有公开。