Sora,OpenAI 发布的人工智能文生视频大模型
(但
OpenAI
并未单纯将其视为视频模型,而是作为
“
世界模拟器
” [10]
)
,于 2024
年 2 月 15 日
(美国当地时间)
正式对外发布 [1] [3]。
Sora 继承了 DALL-E 3 的画质和遵循指令能力,可以根据用户的文本提示创建逼真的视频 [1],该模型可以深度模拟真实物理世界
[2],能生成具有多个角色、包含特定运动的复杂场景,能理解用户在提示中提出的要求,还了解这些物体在物理世界中的存在方式 [4]。
Sora 对于需要制作视频的艺术家、电影制片人或学生带来无限可能,其是 OpenAI“教 AI 理解和模拟运动中的物理世界”计划的其中
一步 [4],也标志着人工智能在理解真实世界场景并与之互动的能力方面实现飞跃 [2]。
�
OpenAI 在大模型领域的成功
�
2022 年底,OpenAI 正式推出 ChatGPT,这款由人工智能技术驱动的自然语言处理工具能够通过学习和理解人类的语言来进行对
话 [26]。ChatGPT 是 OpenAI 迈出的第一步,这款让所有人都能体会到人工智能潜力的现象级产品,展现出了文字对于过去人工智能的
理解力和逻辑能力的超越。随后,OpenAI 的开发重点逐步过渡到图像的生成,Dall-E 模型在生成图像方面也获得了重大突破 [25]。
�
视觉算法的进步
�
视觉算法近年来的突破在泛化性、可提示性、生成质量和稳定性等方面均取得了进展,这预示着技术拐点的临近以及爆款应用的
涌现。特别是在 3D 资产生成和视频生成领域,由于扩散算法的成熟,这些领域受益匪浅。然而,与图像生成相比,3D 资产和视频生成
在数据和算法方面面临的难点更多 [21]。
尽管如此,考虑到大型语言模型(LLM)对人工智能各领域的加速作用以及已经出现的优秀开源模型,2024 年该行业有望实现更
大的发展。在 2023 年末至 2024 年初,Pika、HeyGen 等人工智能生成的视频应用逐渐受到关注,这验证了多模态技术的持续进步与成
熟 [21]。但与此同时,民主倡导者和人工智能研究人员警告说,这些工具已经被用来欺骗和欺骗民众。