语音上手难度 🔧 进阶#语音合成#TTS#声音克隆#多语言#Apache-2.0#OpenBMB#Tokenizer-Free

VoxCPM2 · 无分词器多语言语音合成模型

GitHub 37k⭐:Tokenizer-Free TTS,30 种语言+9 种中文方言,声音设计+克隆,Apache-2.0 可商用

指标同步中,请稍后刷新查看 在 GitHub 查看源码

5 分钟上手

推荐 8GB 显存 GPU,纯 CPU 可用但速度慢
pip install voxcpm
# Python 一行调用
python -c "
from voxcpm import VoxCPM
import soundfile as sf
model = VoxCPM.from_pretrained('openbmb/VoxCPM2')
wav = model.generate(text='你好,这是一个开源语音合成演示。')
sf.write('demo.wav', wav, model.tts_model.sample_rate)
"

项目速览

VoxCPM2 是面壁智能(OpenBMB)联合清华大学人机语音交互实验室(THUHCSI)开源的 Tokenizer-Free 语音合成模型,2B 参数,在超过 200 万小时的多语言语音数据上训练。它采用「无分词器」技术路线——直接在连续空间中生成语音信号,跳过了传统 TTS 中分词、映射等中间步骤,原生输出 48kHz 高保真音频。支持 30 种语言和 9 种中文方言,独创「语音设计」功能:只需用文字描述声音特征,就能凭空创造出一个全新的声音。Apache-2.0 协议,可免费商用。

能做什么

  • 文本转语音:30 种语言 + 9 种中文方言(四川话、粤语、吴语等),48kHz 高保真输出
  • 语音设计:用文字描述凭空创造新音色(如「年轻女性温柔甜美的声音」)
  • 声音克隆:几秒参考音频即可克隆任何人的声音(可控克隆与极致克隆两档)
  • 提供 CLI 命令行、Python 库和 Web 演示页面三种使用方式

怎么部署

pip install voxcpm 一行安装,Python 3.10+ + PyTorch 2.5+ + CUDA 12+。推荐 8GB 显存 GPU,纯 CPU 也能跑但速度慢。权重可从 Hugging Face 或 ModelScope 下载。

适合谁

需要多语言高品质 TTS 的内容创作者、做语音克隆应用的开发者、关注 Tokenizer-Free 技术路线的研究者。

✅ 优点

  • Apache-2.0 协议,可免费商用
  • 30 种语言 + 9 种方言,覆盖面广
  • 独创「语音设计」功能,无需参考音频即可创造新声音
  • 2B 参数 8GB 显存可运行,部署门槛较低

⚠️ 局限与坑

  • 2B 参数模型在复杂情感表达上仍有局限
  • Tokenizer-Free 路线的实时推理效率有待提升
  • 中文方言的准确性部分方言需进一步优化

💼 典型应用场景

  • 1.多语言高品质 TTS 内容生产(播客/有声书/配音)
  • 2.语音设计与声音克隆应用开发
  • 3.Tokenizer-Free 技术路线的研究参考

不想部署?试试同类在线工具

返回全部开源项目指标每周自动更新,数据来自 GitHub API