什么是 VLM?
VLM(Vision Language Model,视觉语言模型)是一种能够同时处理图像和文本的多模态 AI 模型。与传统的纯文本大模型不同,VLM 拥有视觉编码器,可以将图像"翻译"成模型能理解的表示,从而实现看图、识图、理解图的能力。
VLM 能做什么?
图像描述:给出一张图片,VLM 能用自然语言描述图片中的场景、物体、人物和活动。
视觉问答:针对图片提问,如"这张图表中的趋势是什么?""图中有几个人?"。
文档分析:理解扫描文档、PDF、PPT 截图中的文字和布局,提取关键信息。
手写识别:识别手写笔记、表单、签名等内容。
代码截图:看懂代码截图,识别编程语言和逻辑。
主流 VLM 产品
- ·GPT-4V / GPT-4o:OpenAI 的视觉模型,能力最全面
- ·Claude 3.5 Vision:Anthropic 的视觉模型,文档分析能力强
- ·Gemini:Google 原生多模态模型
- ·通义千问 VL:阿里出品,中文文档理解表现优秀
- ·Qwen-VL:开源视觉语言模型
VLM 的应用场景
VLM 在文档数字化、内容审核、辅助驾驶、医疗影像分析、电商商品识别、教育辅导等领域有广泛应用。例如,上传一张药盒照片让 AI 说明用法用量,或上传一张数据图表让 AI 分析趋势。