🧠 模型与架构

多模态

多模态AI多模态模型跨模态Multimodal

多模态(Multimodal)是指 AI 模型能够同时理解和处理多种类型的数据,如文本、图片、音频、视频等,实现跨模态的感知和生成能力,是 GPT-4V、Gemini 等前沿模型的核心特性。


什么是多模态?

多模态(Multimodal)指的是 AI 模型能够同时处理和理解多种不同类型的数据——不仅仅是文字,还包括图像、语音、视频、代码等。如果说传统 AI 是"单通道"的,那么多模态 AI 就是"全通道"的。

多模态能力的体现

视觉理解:给模型一张图片,它能描述图片内容、回答关于图片的问题、识别图片中的文字和物体。例如 GPT-4V 可以看懂图表、漫画、手写笔记。

图文生成:根据文字描述生成图片,或根据图片生成文字描述。这是多模态理解与生成的双向能力。

音视频处理:理解视频内容、分析音频、识别语音中的情感和语气。

跨模态推理:用文字描述来搜索图片,用图片来生成文字说明,用语音指令来操控视觉界面——不同模态的信息可以互相转换和推理。

主流多模态模型

  • ·GPT-4V / GPT-4o:OpenAI 的多模态模型,支持图像理解和语音对话
  • ·Gemini:Google 原生多模态模型,从设计之初就支持文本、图像、音频、视频
  • ·Claude 3.5:Anthropic 的多模态模型,支持图像分析
  • ·通义千问 VL:阿里出品,支持图片理解和文档分析
  • ·文心一言:百度出品,支持图文理解

多模态的应用场景

多模态能力让 AI 的应用范围大大扩展:从看懂医疗影像辅助诊断、理解图表数据辅助分析、识别商品图片辅助电商,到视频内容审核、会议录音转写与摘要等,几乎覆盖了所有需要"看"和"听"的场景。


相关术语

分享: