CAAI
用户5503
分享
Sora来了,我们离AI模拟世界还有多远
输入“/”快速插入内容
Sora来了,我们离AI模拟世界还有多远
用户5503
用户5503
2024年2月22日修改
本文完整版本已发表于wuhu动画人空间:
https://mp.weixin.qq.com/s/8j-MaShHjd6Nzs4CqXySYw
1分钟的视频包括什么?谁?在哪?做些什么?发生在什么环境中?
Prompt: A movie trailer featuring the adventures of the 30 year old space man wearing a red wool knitted motorcycle helmet, blue sky, salt desert, cinematic style, shot on 35mm film, vivid colors.
一部电影预告片,展示一位30岁太空人的冒险故事,他戴着一顶红色羊毛编织的摩托车头盔,背景是蓝天和盐漠,采用电影风格,使用35毫米胶片拍摄,色彩鲜艳。
我们来通过这短短17s的视频包含了哪些信息量
第一镜给到主角近景,包括红色羊毛编织的摩托车头盔和蓝天和由盐组成的沙漠环境都被准确表现出来
第二镜,从蓝色摇到了远景的人,再到特写出现主角色眼神,角色和第一镜保持了一致,包括角色的五官特征,毛线帽和头盔上33的标记都能够验证这一点,此时人物的位置关系是带着33号头盔的主角站在了远景角色的反方向
第三镜,出现了一个带头盔的稍年轻的角色,胡子也短了不少,他似乎是在飞船内部向外看
第四镜,镜头跟随远景的角色向前推进,画面中出现的清晰的脚印,
第五镜,飞船内的年轻角色似乎发现了有人正在走近飞船,特写推的更近了,暗示有变化会发生
第六镜,特写舱门,手从右侧入画
第七镜,特写主角眼神,增加紧张感
第八镜,特写主角侧面,此时他站在原地,看向另一侧
第九镜,太空仓内环境,各类仪表、屏幕清晰可辨。
3个先后出现的角色一致,位置关系一致,环境一致,全程镜头都保持了手持摄影机的摇晃感,输出1920*1080,30帧/秒的高清视频
视频是Sora的能力之一,但这并不是Sora的全部,理解真实的物理世界,并能够模拟和创造才是,而且视频的创作,是内容领域能够展现最多模态能力的领域,也是能够产生高价值内容的重要途径。
OpenAI研究的野心在于——构建物理世界通用模拟器
再来好好读一下这篇技术文档
简单来说,OpenAI在探索视频生成模型的大规模训练,超过runway,pika以及任何现有视频生成模型,构建了一个世界模拟器。这个模拟器,是从大量的不同时长,不同宽高比,和分辨率的视频和图形上训练出来的基于文本条件的扩散模型,这也意味着,Sora能够根据提供的文本描述(如“一只坐在草地上的小猫”)来生成与描述相匹配的视频内容,同时具有灵活的时长和分辨率,最大上限是1920*1080,30帧/秒。
接下来的内容包括两项重点:
(1)将所有类型的视觉数据转化为统一表示的方法,从而能够大规模训练生成模型
(2)对 Sora 的能力和局限性进行定性评估。
Turning visual data into patches 把视觉数据转换为Patch
将视觉数据转换为patch指的是一种处理和表示视觉信息的方法,其中视觉数据(如图片和视频帧)被分割成小块或“补丁”。这些小块作为模型输入的基本单位,模型可以学习到如何表示和重建视觉场景,从而在给定某些条件(如文本描述)时生成新的图像或视频内容。Patch类似于大语言模型的"token",是指文本数据的基本处理单元。这些模型通过将文本分解为较小的片段来理解和生成语言,Tokenization(分词)是将原始文本转换成模型能够理解的一系列token的过程。训练过程把不同类型视频和图片转成patch,作为模型输入的基本单位。这一个过程先将视频压缩到较低维的潜在空间,将视频转换为patch,然后分解为spacetime patches.