Jina-OCR-v1 · Jina-OCR-v1 — Elastic 开源紧凑型 MoE 文档解析模型,低成本 GPU 也可快速解析
3.4B MoE 架构(仅 570M 激活参数),OmniDocBench 91.14 + olmOCR-Bench 83.4,FastMTP 推测解码吞吐 2.57 页/秒
5 分钟上手
单张 NVIDIA L4(24GB)及以上 GPU;推荐 8GB+ 显存# Hugging Face 加载
from transformers import AutoModel
model = AutoModel.from_pretrained('jinaai/jina-ocr-v1', trust_remote_code=True)
# 推理(输入图片,输出 Markdown)
import requests
from PIL import Image
image = Image.open(requests.get('https://example.com/doc.jpg', stream=True).raw)
result = model.generate(image)
print(result) # 输出带格式的 Markdown项目速览
Jina-OCR-v1 是 Elastic(Jina AI)于 2026 年 9 月 20 日开源的端到端文档解析模型,采用混合专家(MoE)架构,总参数 3.4B,但推理时每个 Token 仅激活约 570M 参数。模型基于 DeepSeek-OCR 的紧凑视觉编码器与 MoE 解码器路线,重点加入两项创新:FastMTP(单共享 dense block 递归前向 K=3 步生成候选 token 的推测解码草稿头)和 Dense Verifiable Rewards(GRPO 后训练,每项奖励由确定性代码按部分正确程度分级评分)。
在 OmniDocBench v1.6 上取得 91.14 分,在 olmOCR-Bench 上取得 83.4 分,均为同参数量级最佳。在 14 款主流端到端系统的吞吐实测中,以 2.57 页/秒领跑全场。在单张 NVIDIA L4 低成本 GPU 上,FastMTP 技术的推测解码可将生成速度提升近一倍,且输出序列与标准自回归解码严格一致、完全无损。支持超过 100 种语言的文字识别,输出格式为带结构的 Markdown,包含标题层级、表格、公式和阅读顺序。
能做什么
- 文档转结构化 Markdown:输入 PDF/图片,输出带标题层级、表格、公式和阅读顺序的 Markdown
- 表格提取:将复杂表格转换为 HTML 格式,便于导入电子表格或数据库
- 公式识别:将印刷数学公式转换为 LaTeX 代码,适配学术出版和科学计算场景
- 多语言支持:覆盖 100+ 种语言,包括中文、英文、日文、韩文、阿拉伯文等
- 手写体识别:读取多种语言的草书和大段手写文本
- 低预算 GPU 推理:在 NVIDIA L4 等低成本显卡上高效运行,FastMTP 加速接近翻倍
怎么部署
模型权重和推理代码已发布在 Hugging Face 和 ModelScope。可通过 Transformers 加载推理,推荐使用支持 MoE 的推理框架。单张 L4(24GB)即可流畅运行,支持批量文档解析。FastMTP 草稿头已内置,无需额外配置。
适合谁
需要低成本、高吞吐文档解析的 RAG 系统开发者、预算有限的学术实验室和小团队、需要多语言文档结构化的企业知识库团队。
✅ 优点
- •MoE 架构仅 570M 激活参数,推理成本远低于同精度模型
- •FastMTP 推测解码在 L4 上速度翻倍,输出无损
- •2.57 页/秒端到端吞吐,14 个系统实测领先
- •端到端输出 Markdown,省去多模型流水线维护成本
- •100+ 语言支持,覆盖主流国际语言
⚠️ 局限与坑
- •非商用许可限制企业商用场景
- •3.4B 总参数量仍需 GPU 推理(L4+ 推荐)
- •复杂手写体和极端退化文档精度不如专用大参数模型
💼 典型应用场景
- 1.PDF 文档批量转结构化 Markdown 入库
- 2.多语言合同/发票/论文的自动化信息提取
- 3.RAG 系统的文档预处理和版面理解