Sora 是什么?
Sora 是 OpenAI 于 2024 年 2 月首次公布的文本到视频生成模型,以日语"空"(天空)命名。Sora 能够根据文字描述生成最长 60 秒、分辨率高达 1080p 的视频内容,画面质量、连贯性和物理真实感远超此前所有视频生成模型。
核心技术
Sora 采用扩散模型 + Transformer 的混合架构,将视频和图像表示为时空补丁(Spacetime Patches)的统一表示形式,在大规模视频数据上训练。这种设计让 Sora 不仅能生成视频,还能理解视频中物体之间的物理交互和因果关系。
核心能力
文生视频:输入"一只金毛在樱花树下奔跑",Sora 生成一段 60 秒的连贯视频。图生视频:上传一张图片,让 Sora 基于该图片生成动态视频。视频编辑:对已有视频进行扩展、补帧、风格转换等操作。长视频生成:生成长达 60 秒、保持主体一致性和场景连贯性的视频。
行业影响
Sora 的出现被视为 AI 视频生成的"GPT 时刻",让影视、广告、游戏等行业的创作者看到了 AI 大幅降低视频制作成本的可能性。