跳转到正文

Sora 文生视频模型

OpenAI 推出的 Sora 是文本生成视频模型。原文介绍的首个版本,能够根据文字指令生成最长一分钟、兼具真实感与想象力的场景。

OpenAI 表示,其愿景是构建能够理解和模拟运动中的物理世界的 AI,并训练能够解决现实交互问题的模型。

能力

Sora 可以在较好遵循用户提示词的同时生成高质量视频。它能够处理多角色、不同运动类型和背景的复杂场景,理解各元素的关系;也可以在同一视频中生成多个镜头,并保持角色与视觉风格一致。

下面是原文提供的示例。

提示词:

A stylish woman walks down a Tokyo street filled with warm glowing neon and animated city signage. She wears a black leather jacket, a long red dress, and black boots, and carries a black purse. She wears sunglasses and red lipstick. She walks confidently and casually. The street is damp and reflective, creating a mirror effect of the colorful lights. Many pedestrians walk about.

观看东京街头行走示例

提示词:

A movie trailer featuring the adventures of the 30 year old space man wearing a red wool knitted motorcycle helmet, blue sky, salt desert, cinematic style, shot on 35mm film, vivid colors.

观看针织宇航员示例

视频来源:OpenAI Sora

方法

Sora 是扩散模型,可以生成整段视频,也可以延长现有生成视频。它同时使用 Transformer 架构,以支持规模扩展。

视频与图像被表示为图块,类似 GPT 中的词元,从而形成统一的视频生成系统,支持不同的时长、分辨率和宽高比。Sora 采用 DALL·E 3 使用的重新描述技术,使模型更准确地遵循文字指令;它也能根据给定图片生成视频,让画面动起来。

局限与安全

原文所列局限包括物理模拟不准确、因果关系理解不足,以及误解提示词中的空间细节或事件,例如相机运动轨迹。OpenAI 当时向红队测试人员和创作者开放模型,以评估潜在危害与能力。

提示词:

Prompt: Step-printing scene of a person running, cinematic film shot in 35mm.

观看向后跑步的错误示例

视频来源:OpenAI Sora更多视频示例

ChatGPT 中文使用指南 · MIT 许可 · 隐私政策