首页/AI 开源项目/Confucius4-R2T2
语音Hugging Face上手难度 🔧 进阶#语音识别#ASR#流式识别#实时字幕#同声传译#Hugging Face#网易有道#开源 SOTA

Confucius4-R2T2 · 网易有道子曰4-R2T2 真流式语音识别模型

Hugging Face ASR Trending #1,200-600ms 延迟开源 SOTA,支持 LLM 语音 Agent 实时字幕与同传

指标同步中,请稍后刷新查看 在 Hugging Face 查看

5 分钟上手

GPU 推理推荐 8GB+ 显存;CPU 可跑量化版但延迟上升
# 通过 Hugging Face 加载
from transformers import AutoModel
model = AutoModel.from_pretrained("netease-youdao/Confucius4-R2T2")
# 或使用 GGUF 量化版本地运行
# 下载 GGUF 文件后通过 llama.cpp 加载

项目速览

Confucius4-R2T2 是网易有道于 2026 年 9 月开源的真流式自动语音识别(ASR)模型,基于 Qwen3-ASR-1.7B 构建,登顶 Hugging Face ASR Trending 榜首。核心突破在于「真流式」设计:从第一个音频帧进入的毫秒级即开始推理与输出,平均延迟仅 200-600ms 即达到接近离线识别的准确率,延迟与识别质量双双达到开源 SOTA。支持从 80ms 到 2s 的细粒度可配置解码块,一个模型适配不同场景的实时性需求。

R2T2 发布后全球社区快速跟进:Hugging Face 官方团队主动提供 ZeroGPU 搭建在线 Demo;第三方开发者将其移植到纯 C++ 本地推理框架 audio.cpp(含 GGUF 量化、本地麦克风识别、Streaming API);海外量化社区从 Q2 到 Q8 全量覆盖。适合构建实时字幕、同声传译、AI 语音 Agent、会议转写等场景。

能做什么

  • 真流式语音识别:200-600ms 延迟即输出稳定文本,无需等用户说完
  • 细粒度延迟配置:80ms 到 2s 可调解码块,一个模型适配高实时/高质量场景
  • 热词识别增强:热词命中率突破 99%,适配人名、产品名、行业术语场景
  • 上下文推理:结合前文语义修正同音词、改口、重复,输出「可直接使用」的文字
  • 社区生态完善:GGUF 量化(Q2-Q8)+ audio.cpp 本地运行 + Ollama 集成

怎么部署

可通过 Hugging Face Transformers 直接加载,或下载 GGUF 量化版本通过 llama.cpp / Ollama 本地运行。Hugging Face 官方提供 ZeroGPU 在线 Demo 可零部署体验。

适合谁

构建 AI 语音 Agent 的开发者、需要实时字幕/同传能力的应用团队、研究流式 ASR 架构的研究人员、需要本地化语音识别的隐私敏感场景。

✅ 优点

  • •真流式架构,200-600ms 延迟即稳定输出,开源 ASR SOTA
  • •Hugging Face ASR Trending #1 验证,社区生态完善
  • •支持 80ms-2s 可配置解码粒度,灵活适配不同场景
  • •GGUF 量化 + audio.cpp + Ollama 多重本地部署方案

⚠️ 局限与坑

  • •1.7B 参数规模有限,复杂噪声环境下准确率不如大参数模型
  • •仅支持中文和英文,暂不支持更多语种
  • •需 GPU 推理达到 200ms 级低延迟,纯 CPU 延迟会更高

💼 典型应用场景

  • 1.AI 语音 Agent 的实时语音转文字基础能力
  • 2.会议/直播/短剧的实时字幕与同声传译
  • 3.本地化部署的隐私敏感语音转写场景

不想部署?试试同类在线工具

返回全部开源项目指标每周自动更新