语音#TTS#零样本#科研友好

F5-TTS · 极简架构零样本 TTS

论文一作开源的流匹配 TTS:3 秒克隆,代码简洁适合魔改

15k stars 2.2k forksPython MIT 最近提交 2026-07-23 在 GitHub 查看源码

快速上手

pip install f5-tts
f5-tts_infer-cli --model F5TTS_v1_Base \
  --ref-audio ref.wav --ref-text "参考音频的文字内容" \
  --text "你好,这是 F5-TTS 克隆出的声音。" --output out.wav

项目速览

F5-TTS 出自 ICML 论文作者,用流匹配(Flow Matching)+ DiT 架构实现零样本语音克隆,训练代码极短、复现门槛低,社区魔改版本众多(中文优化、加速推理),是学习现代 TTS 原理的最佳开源样本之一。

能做什么

  • 3~10 秒参考音频零样本克隆,中英双语
  • E2-TTS/F5 双模型可选,推理脚本简洁
  • 训练/评估代码规模小,适合二次开发与学术改进

怎么部署

pip 安装带 Gradio 演示;也可在 ComfyUI 节点直接调用。产品化替代看 CosyVoice

适合谁

想改 TTS 模型本身的研究者与喜欢清爽代码的开发者。

不想部署?试试同类在线工具

返回全部开源项目指标每周自动更新,数据来自 GitHub API