首页/AI 百科词条/Sora(视频生成模型)
🧠 模型与架构

Sora(视频生成模型)

SoraOpenAI SoraSora视频生成Sora模型Sora AI

Sora 是 OpenAI 推出的文本到视频生成模型,能够根据文字描述生成长达 60 秒的高质量、逼真视频,具备对物理世界的深度理解能力,代表了 AI 视频生成技术的最前沿。


Sora 是什么?

Sora 是 OpenAI 于 2024 年 2 月首次公布的文本到视频生成模型,以日语"空"(天空)命名。Sora 能够根据文字描述生成最长 60 秒、分辨率高达 1080p 的视频内容,画面质量、连贯性和物理真实感远超此前所有视频生成模型。

核心技术

Sora 采用扩散模型 + Transformer 的混合架构,将视频和图像表示为时空补丁(Spacetime Patches)的统一表示形式,在大规模视频数据上训练。这种设计让 Sora 不仅能生成视频,还能理解视频中物体之间的物理交互和因果关系。

核心能力

文生视频:输入"一只金毛在樱花树下奔跑",Sora 生成一段 60 秒的连贯视频。图生视频:上传一张图片,让 Sora 基于该图片生成动态视频。视频编辑:对已有视频进行扩展、补帧、风格转换等操作。长视频生成:生成长达 60 秒、保持主体一致性和场景连贯性的视频。

行业影响

Sora 的出现被视为 AI 视频生成的"GPT 时刻",让影视、广告、游戏等行业的创作者看到了 AI 大幅降低视频制作成本的可能性。


相关术语

分享: