开源大模型Hugging Face上手难度 🔧 进阶#视觉语言模型#苹果#Apple#Qwen3.5#长文档理解#VLM#Hugging Face#开源模型
LensVLM-9B · Apple LensVLM-9B — 苹果开源视觉语言模型,基于 Qwen3.5-9B 的长文档理解专家
苹果在 Hugging Face 开源的 9B VLM,基于 Qwen3.5-9B 构建,选择性上下文使长文档 Token 消耗降低 84%
指标同步中,请稍后刷新查看 在 Hugging Face 查看
5 分钟上手
单张 16GB+ 显存 GPU(A100/RTX 4090 等),推荐使用 vLLM 部署# Hugging Face Transformers 加载
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModel.from_pretrained('apple/LensVLM-9B', trust_remote_code=True)
tokenizer = AutoTokenizer.from_pretrained('apple/LensVLM-9B', trust_remote_code=True)
# 推理示例:文档问答
messages = [{"role": "user", "content": [
{"type": "image", "image": "document.jpg"},
{"type": "text", "text": "这份文档的主要内容是什么?"}
]}]
inputs = tokenizer.apply_chat_template(messages, return_tensors='pt')
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0]))项目速览
LensVLM-9B 是苹果公司于 2026 年 9 月 23-24 日在 Hugging Face 开源的视觉语言模型(VLM),基于阿里通义千问 Qwen3.5-9B 构建。这是苹果首次在开源社区公开发布基于中国开源基座的大模型权重,引起全球开发者广泛关注。
LensVLM 的核心创新是「选择性上下文扩展」(Selective Context Expansion):先以极低分辨率缩略图快速浏览整份文档,判断哪些页面与当前问题相关,再仅对关键页面做高分辨率提取。这种「先粗扫、再细看」的策略大幅降低了长文档场景的 Token 消耗和 KV Cache 占用——论文数据显示 Token 消耗降低约 84%,KV Cache 占用从约 1.6GB 压缩至约 250MB。模型原生支持处理数十页的 PDF 合同、论文和报告,特别适合对文档内容进行问答、摘要和结构化提取。
能做什么
- 长文档理解:一次性处理数十页 PDF/文档图像,回答文档内容相关问题,输出摘要和结构化信息
- 选择性上下文:先低分辨率扫描全局,再高精度提取关键页面,大幅降低推理成本
- 视觉问答:理解文档中的图表、表格和配图,结合文本内容进行多模态问答
- OCR 与文档解析:对扫描版文档进行文字识别和版面理解,输出结构化结果
- 基于 Qwen3.5-9B 生态:兼容 Qwen3.5 系列的推理框架和工具链
怎么部署
模型权重在 Hugging Face 公开发布,可通过 Transformers 或 vLLM 加载推理。推荐使用支持 Qwen3.5 的推理框架。需要支持 CUDA 的 GPU 环境,建议 16GB+ 显存。
适合谁
需要处理长文档的 RAG 系统开发者、文档智能提取和问答的工程团队、对苹果开源模型生态感兴趣的研究者和开发者。
✅ 优点
- •苹果官方开源,代码质量和文档有保障
- •基于 Qwen3.5-9B,生态成熟、社区活跃
- •选择性上下文技术降低长文档 Token 消耗约 84%
- •9B 参数适中,可在单卡上部署推理
⚠️ 局限与坑
- •苹果首次开源 VLM,社区周边工具尚在建设
- •9B 参数仍需 GPU 推理(推荐 16GB+ 显存)
- •基于 Qwen3.5 基座,非完全自研架构
💼 典型应用场景
- 1.PDF合同/论文的文档级问答与摘要
- 2.扫描版多页文档的结构化信息提取
- 3.基于文档内容的视觉问答与检索
不想部署?试试同类在线工具
开源大模型· 同类项目推荐
返回全部开源项目指标每周自动更新