语音上手难度 ⚡ 入门#语音克隆#TTS#语音合成#变声#Voicebox#开源#语音工作室

Voicebox · 开源 AI 语音工作室:克隆、听写、创作一条龙

54.9k⭐ 开源 AI 语音全能工具:语音克隆+合成+转录+变声,本地可跑

指标同步中,请稍后刷新查看 在 GitHub 查看源码

5 分钟上手

建议 6GB+ 显存 NVIDIA GPU,CPU 可用但速度较慢
# Docker 一键部署(推荐)
docker run -d --gpus all -p 8080:8080 voicebox/voicebox
# 或本地 Python 安装
git clone https://github.com/jamiepine/voicebox.git
cd voicebox && pip install -r requirements.txt
python app.py

项目速览

Voicebox 是一款开源的 AI 语音全能工作室,集语音克隆、文本转语音、语音识别/转录、变声和语音编辑于一体。它提供了统一的 Web UI 界面,无需编写代码即可完成从声音克隆到语音合成的完整工作流。支持基于少量样本(5-10 秒)的声音克隆,生成的语音保留原声的音色、语调和情感。项目基于 PyTorch,整合了 Coqui TTS、Whisper、So-VITS-SVC 等主流语音 AI 模型,提供一键安装脚本和 Docker 部署方案,普通用户也能在本地 GPU 上运行。

能做什么

  • 声音克隆:5-10 秒音频样本克隆任意人声,支持跨语言克隆
  • 文本转语音:高质量 TTS 合成,支持多种语言和情感控制
  • 语音识别转录:基于 Whisper 的精准语音转文字
  • 实时变声:支持麦克风输入实时变声,适合直播/游戏场景
  • 语音编辑:对已有录音进行文字级编辑,修改文字后自动重生成对应语音

怎么部署

提供 Docker 一键部署和本地 Python 安装两种方式。Web UI 运行后通过浏览器访问即可使用全部功能。建议有 NVIDIA GPU 以获得最佳性能。

适合谁

内容创作者(播客/视频配音)、有声书制作人、需要语音合成的开发者、AI 语音技术爱好者。

✅ 优点

  • Web UI 界面零代码操作,上手门槛极低
  • 整合 Coqui/Whisper/SVC 等主流引擎,一站搞定
  • Docker 部署方便,社区活跃 55k+ stars

⚠️ 局限与坑

  • 高音质合成需要 NVIDIA GPU 加速
  • 中文语音克隆质量不如专门优化的国产工具
  • 实时变声有可感知的延迟(约 300-500ms)

💼 典型应用场景

  • 1.有声书/播客配音的 AI 语音生成
  • 2.直播/视频创作中的实时变声与角色配音
  • 3.个人声音资产的克隆与多语言应用

不想部署?试试同类在线工具

返回全部开源项目指标每周自动更新,数据来自 GitHub API