首页/问答百科/VLM(视觉语言模型)
🧠 模型与架构

VLM(视觉语言模型)

VLM视觉语言模型Vision Language Model图文模型

VLM(Vision Language Model,视觉语言模型)是一种能同时理解图像和文本的多模态 AI 模型,可以看懂图片内容并回答相关问题,是 GPT-4V、Claude 3.5 Vision 等模型背后的技术。


什么是 VLM?

VLM(Vision Language Model,视觉语言模型)是一种能够同时处理图像和文本的多模态 AI 模型。与传统的纯文本大模型不同,VLM 拥有视觉编码器,可以将图像"翻译"成模型能理解的表示,从而实现看图、识图、理解图的能力。

VLM 能做什么?

图像描述:给出一张图片,VLM 能用自然语言描述图片中的场景、物体、人物和活动。

视觉问答:针对图片提问,如"这张图表中的趋势是什么?""图中有几个人?"。

文档分析:理解扫描文档、PDF、PPT 截图中的文字和布局,提取关键信息。

手写识别:识别手写笔记、表单、签名等内容。

代码截图:看懂代码截图,识别编程语言和逻辑。

主流 VLM 产品

  • ·GPT-4V / GPT-4o:OpenAI 的视觉模型,能力最全面
  • ·Claude 3.5 Vision:Anthropic 的视觉模型,文档分析能力强
  • ·Gemini:Google 原生多模态模型
  • ·通义千问 VL:阿里出品,中文文档理解表现优秀
  • ·Qwen-VL:开源视觉语言模型

VLM 的应用场景

VLM 在文档数字化、内容审核、辅助驾驶、医疗影像分析、电商商品识别、教育辅导等领域有广泛应用。例如,上传一张药盒照片让 AI 说明用法用量,或上传一张数据图表让 AI 分析趋势。


相关术语

分享: