语音Hugging Face上手难度 ⚡ 入门#TTS#语音合成#声音克隆#Zero-Shot#腾讯#AuK#语音编辑#Hugging Face#开源模型
AuK · 腾讯 AuK — 零样本 TTS 语音合成与声音克隆,2026 年 9 月冲上 HF 热门榜
腾讯开源零样本 TTS 模型,支持 Zero-Shot 语音克隆、Instruct TTS、情绪编辑与语音分离,众测登顶 HF 语音榜
指标同步中,请稍后刷新查看 在 Hugging Face 查看
5 分钟上手
推荐 8GB+ 显存 GPU;支持单卡推理# Hugging Face Transformers 加载
from transformers import pipeline
pipe = pipeline('text-to-speech', model='tencent/AuK')
# 基本 TTS 合成
result = pipe('你好,欢迎使用腾讯 AuK 语音合成。', speaker='default')
# result['audio'] 为合成音频,result['sample_rate'] 为采样率
# 声音克隆(需提供参考音频)
result = pipe('今天天气真不错。', speaker='default', reference_audio='ref_speech.wav')项目速览
AuK 是腾讯在 Hugging Face 开源的全能零样本 TTS 语音合成模型,2026 年 9 月发布后迅速冲上 Hugging Face 热门趋势榜。与传统 TTS 模型不同,AuK 不仅支持最基础的文本转语音,还集成了声音克隆、语音内容编辑、歌词编辑、音高/语速/音量调节、情绪与音色编辑、口音编辑与去噪、副语言事件编辑(呼吸声/笑声/咳嗽)以及语音分离等十余项能力,覆盖语音合成全链路。
其 Zero-Shot TTS 能力仅需几秒参考音频即可克隆任意说话人的音色;Instruct TTS 功能甚至仅用文字描述即可零参考音频生成目标音色。模型采用先进的离散音频编码与指令跟随架构,在音色还原度和自然度方面达到业界领先水平。
能做什么
- Zero-Shot TTS:仅需几秒参考音频即可克隆声音并合成新语音
- Instruct TTS:纯文字描述声音特征即可生成对应语音,无需参考音频
- 语音内容编辑:不改变音色语调的前提下替换、插入或删除录音中的文字
- 歌词编辑:保留旋律与歌声特质,只改写歌词
- 音高/语速/音量编辑:以半音、倍速、分贝为单位精确调节声学属性
- 情绪与音色编辑:不改文字改变情感色彩,或保留内容转换音色
- 口音编辑与去噪:去除口音、降噪去混响,提升清晰度
- 副语言事件编辑:添加或移除呼吸声、笑声、咳嗽
- 语音分离:按说话顺序拆分多人音频,或按描述提取目标说话人
怎么部署
模型权重在 Hugging Face 公开发布(tencent/AuK)。可通过 Hugging Face Transformers 或腾讯自研推理框架加载。建议在 GPU 环境下运行推理。
适合谁
语音内容创作者(播客/有声书/短视频配音)、AI 语音应用开发者、需要高精度声音克隆的内容 IP 团队。
✅ 优点
- •全能的语音编辑能力:从克隆到编辑/分离一站式覆盖
- •Zero-Shot 克隆仅需几秒参考音频,效果出色
- •Instruct TTS 纯文字描述即可生成目标音色,无参考音频也能用
- •腾讯官方出品,模型质量有保障
- •2026 年 9 月冲上 Hugging Face 热门榜,社区认可度高
⚠️ 局限与坑
- •需 GPU 推理(推荐 8GB+ 显存),CPU 不可用
- •部分高级功能(如歌词编辑)文档尚不够详细
- •腾讯开源 TTS 模型存在版本迭代,需关注后续更新
💼 典型应用场景
- 1.有声书/播客的批量高质量语音合成
- 2.短视频/教程配音的声音克隆与情绪调节
- 3.语音内容后期编辑:替换/插入文字不改音色
不想部署?试试同类在线工具
语音· 同类项目推荐
返回全部开源项目指标每周自动更新