每日速览

OpenAI 首次展示 Sora,文生视频迈向一分钟高保真生成

摘要

2024年2月15日,OpenAI公开Sora研究预览及技术报告,将其描述为在视频和图像数据上大规模训练的文本条件扩散模型。Sora使用Transformer处理视频与图像潜在编码中的时空图块,可接受不同持续时间、分辨率和宽高比的数据;当时展示的最大模型能够根据文字提示生成最长一分钟的高保真视频,也能扩展既有视频或依据静态图像生成动态内容。OpenAI把这项研究视为探索通用物理世界模拟器的路径,但没有宣称模型已经准确理解现实物理。官方展示同时暴露了明显局限,例如复杂场景中的因果关系错误、物体状态变化不一致、空间方向混乱及对精确动作描述理解不足。首发阶段并未向公众普遍开放,而是先交给红队人员及部分视觉艺术家、设计师和电影制作人评估风险与创作需求。Sora使长时程生成视频成为全球AI竞争的新核心方向。

内容由花盆 AI 编辑整理,仅作信息索引;事实与完整内容以原始来源为准。

查看原文