flow-matching 声音克隆
F5-TTS 是上海交通大学 X-LANCE 实验室出的零样本声音克隆文本转语音系统,基于 flow matching 加扩散 transformer。务实的卖点是:你给它一小段参考音频和对应文本,它就用那个声音说出你的目标文本,中英双语,质量能与商业系统掰手腕。截至 2026-06 有 14,759 星,是个口碑不错、又真能用的研究级选项。
架构是大家选它的原因之一:flow matching 比老的扩散方法收敛和运行都更快,而且设计上省掉了单独的时长模型,简化了管线。
它做什么
你提供几秒的参考音频加它的文本,再给要说的内容。F5-TTS 用参考声音说出新文本,支持多说话人和语言间的 code-switching,还带一个 Gradio 网页 UI 和一个 CLI,快速用和脚本化都行。社区微调把它扩展到了中英之外的更多语言。
安装
pip install f5-tts
要训练和微调,clone 后从源码 pip install -e .。推理有 Gradio 应用(f5-tts_infer-gradio)和 CLI(f5-tts_infer-cli)。一块消费级 GPU 能应付推理;训练吃显存得多。
代码 MIT,权重非商用
这是要紧、又常被搞错的许可细节:代码是 MIT,但预训练权重不是。README 写明代码以 MIT 发布,而预训练模型是 CC-BY-NC,因为它们在 Emilia 数据集(一个野外采集语料)上训练。所以你能商用地使用、修改、发布代码,但不能把官方发布的权重用进商业产品。商用的干净路子是:用 MIT 代码,在你有授权的数据上训练自己的权重。这个拆分让 F5-TTS 比一个全限制的模型对商业更友好,只要你搞清哪一半是哪一半。
适合与不适合
想要高质量零样本声音克隆、又要宽松代码许可,中英够用或有社区微调覆盖你的语言,且你能提供干净参考片段时,选它。处理好权重问题的话,它对研究和产品都是个不错的底座。
如果你要一个免训练、即插即用的商业模型,它就弱一些,因为官方权重非商用。克隆质量高度依赖参考片段,过短或有噪声的参考效果更差,而且实测推理速度会因硬件和配置不同,偏离宣传的基准数。对微调者来说,训练稳定性也是个被反复提到的痛点。
F5-TTS 和其它开源 TTS 模型的对比
| F5-TTS | fish-speech | ChatTTS | VoxCPM | |
|---|---|---|---|---|
| Stars | 14,759 | 30,832 | 39,458 | 28,884 |
| 强项 | flow-matching 克隆 | 多语言克隆 | 对话韵律 | 声音设计与克隆 |
| 代码许可 | MIT | Fish Audio Research | AGPLv3 | Apache-2.0 |
| 权重 | CC-BY-NC | 研究、非商用 | CC-BY-NC | Apache-2.0 |
| 商业用途 | 自训权重或授权 | 需单独授权 | 不允许 | 允许 |
数字为截至 2026 年 6 月的 GitHub 数据。fish-speech 任何用途都需单独商业许可。ChatTTS 两层都仅限研究。VoxCPM 是 Apache-2.0,开箱就对商业完全友好。F5-TTS 居中:MIT 代码,且只要你重训权重就有清晰的商用路径。
star 曲线
star 曲线在论文和基础模型落地后稳步上行,一个带强零样本克隆的 flow-matching 方法,同时吸引了研究者和开发者。它进入 2026 年仍持续发布,印证了维护故事,比一些更出名的同类更活跃。
issue 区给你的预警
反复出现的 issue 关于参考质量和训练。克隆对参考片段敏感,所以短、有噪声或不匹配的参考会降质,某些情况下中文声调和爆破音会有瑕疵。真实推理速度常偏离宣传的基准数,后者依赖特定硬件和加速配置,难复现。微调者报训练不稳,包括跑了很多步后 loss 突然飙升。依赖链(torch、注意力 kernel、Gradio 版本)也脆,锁版本很重要。
相关仓库
要研究许可下的多语言克隆,看 fish-speech。要对话式 TTS,看 ChatTTS。要 Apache-2.0、对商业友好的模型,看 VoxCPM。想看什么在涨,见 LLM 工具、每日榜 和 每周报告。
常见问题
F5-TTS 能商用吗? 代码能,官方权重不能。代码是 MIT,但预训练权重因 Emilia 训练数据是 CC-BY-NC。要商用,就用 MIT 代码在有授权的数据上训练自己的权重,或为数据另行授权。
F5-TTS 还是 fish-speech,谁对商业更友好? F5-TTS,但有前提。它代码 MIT、你能重训权重来商用,而 fish-speech 任何用途都需单独商业许可。要完全宽松的默认,VoxCPM 的 Apache-2.0 更干净。
F5-TTS 需要多长的参考音频? 几秒就够,但质量取决于片段。短、有噪声或不匹配的参考会让克隆变差,所以用一段几秒的干净参考效果最好。
F5-TTS 支持哪些语言? 基础模型覆盖中英,并能在两者间 code-switching。社区微调扩展到其它语言,所以你的目标语言在基础集之外时,查一下有没有微调版。
F5-TTS 够快做实时吗? 比老的扩散 TTS 快,但真实速度会因硬件和加速偏离公布的基准。流式首包延迟可能超过实时,所以靠它做实时前先按你的配置测一遍。