多语言语音与声音克隆

fish-speech 是一个文本转语音与语音克隆模型,已成为较知名的开源选项之一,如今在 Fish Audio S2 和 S2 Pro 品牌下开发。它生成自然、有表现力的语音,能从一小段样本克隆一个声音,覆盖多种语言。README 称 S2 Pro 模型在超过 1000 万小时、覆盖 80 多种语言的音频上训练,采用双自回归架构。截至 2026-06 有 30,832 星,想要高质量多语言开源声音克隆时,它是常见之选。

有段历史值得知道:项目早期带 OpenAudio 和 S1 品牌,所以旧引用和 issue 里这些名字混着用。当前线是 Fish Audio S2。

它做什么

核心能力是多语言 TTS 和零样本/少样本声音克隆:给它一段参考片段和文本,它就用那个声音产出语音。它支持表现力控制,对一级语言(中、英、日)最稳,较冷门语言质量有波动。它带网页 UI、CLI 和 server 模式,模型首次使用时下载。

安装

pip install fish-speech

也有 Docker 镜像和 Gradio 网页 UI,而 speech.fish.audio 上的官方安装与用法文档是该跟的源,因为项目迭代快,当前模型和参数以那里为准。要一块够力的 GPU;较大模型很吃显存,好几个 issue 都报消费级显卡显存吃紧。

许可证是个坎

这是你在它之上做任何东西前该读的部分:fish-speech 不是标准开源许可。代码和模型权重都以 Fish Audio Research License 发布,该许可允许研究和非商用免费使用,但任何商业用途都需 Fish Audio 单独授权。这是背后公司有意的选择,且会被执行。所以 fish-speech 用来做实验、学习、个人项目没问题,但你要把它放进产品或付费服务,就得联系 Fish Audio 谈条款。别以为「在 GitHub 上」就等于「能随便商用」。

适合与不适合

想为研究或非商用项目做高质量多语言声音克隆、在意一级语言质量、又能跑得起够力 GPU 时,选它。表现力和语言覆盖是它的强项。

如果你需要一个宽松许可来做商业产品,它就不对,除非你为商业条款付费,否则研究许可是硬阻断。它也比一些替代品更吃显存,而且官方训练和微调工具没完全开放,自训比 star 数暗示的更难。商用又不想单独签协议的话,下面这些替代品在许可证上差别很大。

fish-speech 和其它开源 TTS 模型的对比

fish-speechF5-TTSChatTTSVoxCPM
Stars30,83214,75939,45828,884
强项多语言克隆、有表现力flow-matching 克隆对话韵律声音设计与克隆
代码许可Fish Audio ResearchMITAGPLv3Apache-2.0
权重研究、非商用CC-BY-NCCC-BY-NCApache-2.0
商业用途需单独授权自训权重或授权不允许允许

数字为截至 2026 年 6 月的 GitHub 数据。F5-TTS 代码是 MIT,但权重是 CC-BY-NC,所以商用得拿自己的数据重训。ChatTTS 代码和权重都仅限研究。VoxCPM 是 Apache-2.0,这组里对商业最友好。如果许可证是你的决定性因素,看那一列就够了。

star 曲线

star 曲线在开源 TTS 那波里强劲上行,声音克隆变得人人可用,而从 OpenAudio 和 S1 改名到 S2,标记了从社区模型转为公司支持的产品线。增长反映真实能力,又被限制部署范围的许可证压着。

issue 区给你的预警

反复出现的 issue 都很实际。显存和 CUDA 兼容性常被提到,有报消费级 GPU 显存吃紧和版本相关的失败,所以拿你的硬件对着文档查。推理速度即便在强卡上也是常见抱怨。训练和微调流程文档不足、官方工具没完全开放,让自定义声音项目受挫。语言质量分级:中英日扎实,冷门语言有波动,所以定下来前先测你的目标语言。

相关仓库

要 MIT 代码的声音克隆,看 F5-TTS。要对话式 TTS,看 ChatTTS。要 Apache-2.0、对商业友好的模型,看 VoxCPM。想看什么在涨,见 LLM 工具每日榜每周报告

常见问题

fish-speech 能商用吗? 不单独授权就不能。代码和权重都在 Fish Audio Research License 下,研究和非商用免费,但任何产品或付费服务都需 Fish Audio 的商业协议。条款找他们谈。

fish-speech 和 OpenAudio、S1 是一回事吗? 是同一个项目。OpenAudio 和 S1 是早期品牌;当前线是 Fish Audio S2 和 S2 Pro。旧引用和 issue 里名字混用。

fish-speech 还是 F5-TTS,商用选哪个? F5-TTS 代码是 MIT,但预训练权重是 CC-BY-NC,商用得拿自己的数据重训。fish-speech 任何用途都需商业许可。要默认宽松,VoxCPM 的 Apache-2.0 更干净。

fish-speech 哪些语言处理得最好? 中、英、日最稳。模型覆盖更多语言,但冷门语言质量有波动,所以靠它干活前先测你的具体目标语言。

跑 fish-speech 要什么 GPU? 一块显存充足、够力的 GPU。issue 区常报消费级显卡显存吃紧和版本相关的 CUDA 失败,所以拿官方文档对着你的硬件核。