开源大模型上手难度 🔧 进阶#文档解析#OCR#电信#视觉语言模型#表格解析#公式识别#OmniDocBench
TeleOCR · TeleOCR — 中国电信开源文档解析模型,OmniDocBench 榜首
1.2B 参数文档解析模型,OmniDocBench 96.87 分登顶,超越 MinerU2.5-Pro
指标同步中,请稍后刷新查看 在 GitHub 查看源码
5 分钟上手
GPU 8GB+ 显存推荐,支持 CUDA# 克隆仓库
git clone https://github.com/caipeng328/TeleOCR.git
cd TeleOCR
# 创建环境
conda create -n teleocr python=3.10 -y
conda activate teleocr
pip install -r requirements.txt
# 推理
python infer.py --input document.jpg --output result.md项目速览
TeleOCR 是中国电信星辰通用人工智能实验室开源的文档解析模型,采用约 1.2B 参数的轻量级视觉语言架构,在单一框架内统一处理数字文档与相机拍摄文档,将文字、版面、表格、公式和科学图表转换为可直接使用的结构化结果。在 OmniDocBench v1.6 中取得 96.87 总分登顶榜首,超越 MinerU2.5-Pro、PaddleOCR-VL-1.6、OvisOCR2 等同类专业模型。同时拿下 PureDocBench 榜首和 ICDAR-2026 科学图解析挑战赛冠军。
采用视觉语言模型端到端架构,替代传统"版面检测→图像校正→识别"的多阶段流水线,避免误差累积。核心创新包括几何感知建模(处理弯曲/透视畸变页面)、渐进式四阶段训练(视觉语言对齐→几何感知解析→内容-结构解耦→强化学习)和数据工程闭环(多节点共识投票选高置信样本、自验证纠错、渐进式清洗)。
能做什么
- 文字识别:高精度提取文档文本内容,数字文档识别率达 97.22(OmniDocBench)
- 表格解析:精确还原跨行跨列、单元格合并的复杂表格结构,TEDS 达 97.05
- 公式识别:结构化解析公式语义与语法,符号级准确恢复,CDM 达 96.36
- 科学图表解析:识别图表元素并提取数据,ICDAR-2026 科学图解析冠军
- 拍摄文档处理:直接处理透视畸变、页面弯曲、阴影模糊等真实退化文档
- 结构化输出:结果生成 Markdown、JSON 等格式,便于接入 RAG 和业务系统
怎么部署
克隆 GitHub 仓库 git clone https://github.com/caipeng328/TeleOCR.git,创建 conda 环境(Python 3.10+)并安装依赖。需要支持 CUDA 的 GPU 环境。提供完整的推理 Pipeline 脚本,支持批量文档解析。
适合谁
需要高精度 OCR 和文档解析的 RAG 系统开发者、合同/论文/档案结构化提取的企业团队、文档自动化处理流程工程师。
✅ 优点
- •OmniDocBench 96.87 分登顶,文档解析能力业界领先
- •1.2B 轻量级架构,部署门槛低
- •端到端统一处理数字文档和拍摄文档,无需预处理流水线
- •表格/公式/图表专项能力强,ICDAR-2026 冠军
⚠️ 局限与坑
- •1.2B 参数仍需要 GPU 推理(8GB+ 显存推荐)
- •社区生态尚在初期,周边工具和文档有限
- •中文文档效果优于英文,国际场景覆盖待验证
💼 典型应用场景
- 1.PDF/扫描件转 Markdown 结构化数据
- 2.学术论文图表批量提取
- 3.合同档案的自动录入与检索
开源大模型· 同类项目推荐
返回全部开源项目指标每周自动更新,数据来自 GitHub API