语音上手难度 ⚡ 入门#语音克隆#TTS#语音合成#变声#Voicebox#开源#语音工作室
Voicebox · 开源 AI 语音工作室:克隆、听写、创作一条龙
54.9k⭐ 开源 AI 语音全能工具:语音克隆+合成+转录+变声,本地可跑
指标同步中,请稍后刷新查看 在 GitHub 查看源码
5 分钟上手
建议 6GB+ 显存 NVIDIA GPU,CPU 可用但速度较慢# Docker 一键部署(推荐)
docker run -d --gpus all -p 8080:8080 voicebox/voicebox
# 或本地 Python 安装
git clone https://github.com/jamiepine/voicebox.git
cd voicebox && pip install -r requirements.txt
python app.py项目速览
Voicebox 是一款开源的 AI 语音全能工作室,集语音克隆、文本转语音、语音识别/转录、变声和语音编辑于一体。它提供了统一的 Web UI 界面,无需编写代码即可完成从声音克隆到语音合成的完整工作流。支持基于少量样本(5-10 秒)的声音克隆,生成的语音保留原声的音色、语调和情感。项目基于 PyTorch,整合了 Coqui TTS、Whisper、So-VITS-SVC 等主流语音 AI 模型,提供一键安装脚本和 Docker 部署方案,普通用户也能在本地 GPU 上运行。
能做什么
- 声音克隆:5-10 秒音频样本克隆任意人声,支持跨语言克隆
- 文本转语音:高质量 TTS 合成,支持多种语言和情感控制
- 语音识别转录:基于 Whisper 的精准语音转文字
- 实时变声:支持麦克风输入实时变声,适合直播/游戏场景
- 语音编辑:对已有录音进行文字级编辑,修改文字后自动重生成对应语音
怎么部署
提供 Docker 一键部署和本地 Python 安装两种方式。Web UI 运行后通过浏览器访问即可使用全部功能。建议有 NVIDIA GPU 以获得最佳性能。
适合谁
内容创作者(播客/视频配音)、有声书制作人、需要语音合成的开发者、AI 语音技术爱好者。
✅ 优点
- •Web UI 界面零代码操作,上手门槛极低
- •整合 Coqui/Whisper/SVC 等主流引擎,一站搞定
- •Docker 部署方便,社区活跃 55k+ stars
⚠️ 局限与坑
- •高音质合成需要 NVIDIA GPU 加速
- •中文语音克隆质量不如专门优化的国产工具
- •实时变声有可感知的延迟(约 300-500ms)
💼 典型应用场景
- 1.有声书/播客配音的 AI 语音生成
- 2.直播/视频创作中的实时变声与角色配音
- 3.个人声音资产的克隆与多语言应用
不想部署?试试同类在线工具
语音· 同类项目推荐
返回全部开源项目指标每周自动更新,数据来自 GitHub API