mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
4596 字
13 分钟
Sora:自称世界模拟器
2026-07-09

《Sora 技术报告》解读:把世界切成 patch 再赌一把 scaling——视频生成自称”世界模拟器”#

论文:Video generation models as world simulators(技术报告,未挂 arXiv) 作者:Tim Brooks、Bill Peebles、Connor Holmes 等(报告未完整列名),OpenAI 发布背景一句话:2024-02-15 发布,核心主张是”把视频和图像统一压缩成时空 patch、用 diffusion transformer 大规模训练,视频生成是通往物理世界模拟器的路径”;前置知识提示:前两年文生视频还停留在 3-4 秒的固定尺寸短片(上一站),Sora 一口气把时长打到 60 秒,它开启了文生视频军备竞赛,也为 2024 年底 Sora Turbo 公测和后来的 Sora 2 埋下了伏笔。


一、引言:一份没有基准分数的”技术报告”#

2024 年 2 月 15 日,OpenAI 甩出一份非常不”论文”的技术报告:没有 arXiv 链接、没有代码、没有参数量、没有训练细节,甚至没有一个基准分数。有的只是十几个让人起鸡皮疙瘩的演示视频:穿行东京街头的老太太、纸飞机在森林里翻飞的慢镜、一列蒸汽火车在雪地里驰过。

但就是这份”什么都没有”的报告,把整个文生视频行业震住了。因为在它之前,这条赛道的主流产品只能生成 3 到 4 秒的固定尺寸短片,人物一转身就崩,物理一碰撞就穿模。Sora 直接给出最长 60 秒、最高 1080p 的高保真视频,还支持任意宽高比、多镜头切换、人物跨镜头保持一致。

报告标题起得野心十足:Video generation models as world simulators——“作为世界模拟器的视频生成模型”。核心叙事是:模型不只是在”画视频”,它是在学物理世界的规律。这个”世界模拟器”的主张,比视频本身更值钱——它把 Sora 从”内容生成工具”抬升成了”通往 AGI 的一条路径”。

这份报告的”论文成色”也是后来争议的一部分:它更像一份能力宣言(capability showcase),而不是可复现的学术文献。但恰恰是这种宣言,让全世界第一次直观感受到了”scaling 视频模型”这个方向的能量。

二、方法:视频先压成 latent,再切成 patch,最后丢进 diffusion transformer#

报告能确认的技术主线有四条,每一条都不长,但拼起来是完整的一幅图。

第一条,视频压缩网络(video compression network)。Sora 先用一个网络把原始视频压到低维潜空间(latent space),时间和空间两个维度一起压缩,再配一个解码器把潜表示映射回像素。这相当于给视频做了一版 VAE(变分自编码器)式的压缩——把”算视频”的成本先降下来,后续大规模训练才可行。

第二条,时空 patch(spacetime patches)。压缩后的潜表示被分解成一串”时空补丁”,直接当 transformer 的 token 用。图片就是只有一帧的视频,所以图像和视频能共用同一套表示、混在一起训练。这套做法灵感直接来自 LLM——文本能用 token 统一代码、数学和各种自然语言,视觉为什么不行?patch 就是视觉世界的 token。

第三条,扩散 transformer(diffusion transformer,DiT)。Sora 是扩散模型:给带噪的 patch,预测”干净 patch”,逐步去噪还原出视频。但去噪的骨干网络换成了 transformer,而不是老式的 U-Net。DiT 在图像生成上已被证明能跟着 scaling 走——参数和算力上去,画质稳定提升。Sora 就是把同一个赌注押到了视频上。报告里放了一张”固定种子、训练逐步推进”的对比图,画面质量随训练算力增加肉眼可见地变好,这就是它敢喊 scaling 的底气。

第四条,原生尺寸训练 + 重标注(recaptioning)。Sora 不把视频裁剪成统一尺寸,而是在原始宽高比、原始时长上训练,实测构图和取景比”裁成方形再训”的版本好得多——这是 Sora 最被低估的工程决策之一。语言理解则照搬 DALL·E 3 的套路:先训练一个”描述器”模型,给海量视频自动生成非常详细的字幕,再用 GPT 把用户的短提示扩写成长提示。视频能不能听懂人话,一半是这套重标注挣来的。

提示(prompting)的灵活性也被当作方法的一部分来写:Sora 可以拿图片、视频当输入,而不只是文字——它能动画化 DALL·E 生成的图片、延长一段已有视频、把两段视频缝成一段。这意味着”视频生成”和”视频编辑”在同一个模型里是打通的,不用另起炉灶。对创作者来说,这等于一个模型干了过去三个产品线的活。

报告还留了一个”彩蛋级”的暗示:它把”视频压缩网络 + patch 化”描述成通往统一表示的一步——同一套表示,既能做文生视频,也能做图生视频、视频编辑、甚至数字世界模拟。这个野心和 LLM 用 token 统一语言是同一个思路:Sora 团队想做的,是一个”视觉通用模型”,而不只是视频生成器。

为什么选扩散而不是 GAN 或者自回归?报告没细说,但懂行的人都知道:GAN 的对抗训练不稳定,自回归 transformer 逐帧预测容易误差累积,而扩散模型的去噪过程天然适合”整体协调”——每一帧都在同一次去噪里被优化,长程一致性更好。这是 Sora 能撑住 60 秒时长而不糊的技术底牌之一。

报告最后一段把话说得很满:“扩展视频生成模型是构建物理世界通用模拟器的有希望路径。“这句是全文唯一一个真正的结论,其他全是能力展示。它把 Sora 的研究目标从”生成视频”悄悄换成了”模拟世界”——标题里的 world simulators 不是修辞,是路线图。

报告还明说”不包含模型和实施细节”——patch 多大、压缩比多少、训练用了多少数据,全都没写。我们能确认的只是范式,不是配方。这也是读这份报告前要先打的一针预防针。

三、成绩:没有分数,但到处都是”涌现”#

先说清楚:Sora 报告没有给出任何基准分数——这是它的特点,也是它的争议。它交出来的证据是定性的:一段段视频,加一份”能力与局限”的清单。

能力清单可以列得很长:物理一致性(物体滚动、光影变化的直觉表现)、长镜头下的目标持久性(object permanence,物体离开画面再回来不”变脸”)、多镜头切换、前后双向的视频扩展(往未来或过去延长生成)、图生视频、视频拼接(把两段视频缝成一段),甚至直接生成图像。最夸张的是涌现出来的模拟能力:报告展示了 Sora 能模拟 Minecraft 数字世界,让玩家用脚本控制角色,还能在同一场景并行生成多个视角。这些能力没人专门训练过,属于 scaling 之后自己冒出来的——这正是报告最想证明的事。

这些能力不是均匀分布的。报告给了例证:训练计算量越大,同一批种子(seed)生成的视频就越稳定、越连贯——“涌现”不是魔术,是算力曲线上的一个点。这也是为什么后来所有团队都愿意往视频生成上砸钱:模型越大越聪明的路,已经被证明是通的,剩下的只是烧多少钱的问题。

局限清单同样诚实:玻璃杯碎得不对、吃东西不留下咬痕、左右方向经常搞混、复杂动作在长时间尺度下会崩。OpenAI 自己承认,Sora 还没到能真正”理解物理”的程度——这跟”世界模拟器”的大旗形成了微妙的反差,也是后来所有批评的起点。

红队测试还发现,Sora 能生成逼真的深度伪造素材,这是它迟迟不敢公测的直接原因之一——把一个”什么都敢画”的视频模型放出去,社会成本不可控。OpenAI 的选择是:模型先封存,只给艺术家和红队测试者试用,同时把 C2PA 水印、可见水印、内容检索工具这一整套溯源机制做扎实,才敢谈公测。

再补一组对比,让 Sora 的位置更清楚:2024 年初的行业平均水平是 3 到 4 秒、固定尺寸,Sora 直接把规格翻了一个数量级。这个”规格上的碾压”比画面精致度更能说明问题——它不是把已有的路走得更远,而是换了一种走法。

艺术家和早期测试者的反馈也没少挨骂:试用者抱怨 Sora 生成可控性差、风格不稳定。这些声音最终被 12 月的公测版消化了——Sora Turbo 靠 Storyboard、Remix 这些工具把”可控性”补了回来。产品补课补了十个月,补的就是这份”从炫技到能用”的差距。

价格上也能看出这有多烧钱:一次 1080p 视频生成要吃掉 100 到 2000 个 credits(额度)。这解释了为什么 Sora 一直没开放给免费用户——视频生成的边际成本比文本高出几个量级,“免费开放”这种 GPT-4o 的玩法,在视频赛道暂时行不通。

Sora 的竞品反应也很快:Google Veo、快手可灵、字节即梦、Runway Gen-3 都在 2024 年陆续跟上。但注意一个差异——Sora 一上来就是 60 秒加 1080p 的规格宣言,竞品大多是先做 5 秒 720p 再慢慢追。这个”先定规格、再填能力”的打法,让 OpenAI 在文生视频赛道抢占了整整一年的定义权。

产品化则是一场十个月的等待。报告发布后 Sora 只对红队测试者和少数艺术家开放,直到 2024 年 12 月 9 日才以 Sora Turbo 之名公测。公测版最长 20 秒、最高 1080p,支持文本、图片、视频三种输入方式,还配了 Storyboard(故事板)、Remix(重混)、Re-cut(重剪)、Loop(循环)、Blend(混合)等编辑工具。定价挂进 ChatGPT 订阅:Plus($20/月)每月 50 个720p/5 秒视频,Pro($200/月)最多 500 个1080p/20 秒优先视频且可无水印。上线当天官网直接被挤崩,Altman 不得不临时关停注册。

安全方面,Sora 是全链路加锁的:训练和产品都过红队测试,成品自带 C2PA(内容真实性溯源联盟)元数据水印和可见水印,OpenAI 还内置了一个内容检索工具用于验证一段视频是否出自 Sora,并明确禁止生成 CSAM(儿童性虐待材料)和性深度伪造。这一套”水印 + 溯源 + 检索”的组合,后来成了所有文生视频产品的标配模板。

还有个产品插曲值得记一笔:Altman 在公测直播里把 Sora 称作”视频版的 GPT-1”。既是自谦,也是在暗示一条和 ChatGPT 一模一样的演进曲线——先跑通,再迭代,后普及。

收尾:我的一点看法#

一句话:Sora 报告是 2024 年最成功的一次”能力宣言”,也是技术透明度的一次大倒退。它把”scaling 能带来涌现”讲得令人信服,却连 patch 大小、压缩比、训练数据规模都不肯说,像一份招商材料,不像论文。但话又说回来,正是这份”招商材料”让整个行业确信视频生成是下一个必争之地——之后 Veo、可灵、Gen-3、混元、Movie Gen 的军备竞赛,起点全是这一篇。

“世界模拟器”这个提法,我一半信、一半警惕。信的部分:Sora 在 3D 一致性、目标持久性上的表现,不像单纯”记住像素”,更像学到了空间与物体的隐式规律。警惕的部分:它连玻璃碎掉这种基础物理都处理不好,离”理解世界”还差得远。“世界模拟器”是一个研究纲领,不是对当前能力的描述——把它当广告看,别当事实看。

十个月的公测等待同样值得复盘。Sora 不是造不出来,是”造出来不等于敢卖出去”:推理算力成本高、长视频一致性不过关、深度伪造风险要一层层堵。这个时间差本身就是信息量——它说明在 2024 年,“视频生成”离”可靠产品”的距离,比 OpenAI 想让外界以为的要远。

最后把 Sora 放回 ChatGPT 史的总坐标系。2024 年 OpenAI 踩的是三条腿:GPT-4o 打通了全模态输入输出,o1 打通了”深度思考”,Sora 指向最远的那个——让模型学会”想象世界”。三件事里 Sora 产品化最晚、兑现最少,但野心最大。等 Sora 2 出来再回头看这篇报告,我们大概会更清楚:它到底是世界模拟器的序章,还是 OpenAI 画的最大一张饼。


附:核心数据速查#

关键数字表格

指标数值对比/备注
报告发布日期2024-02-15未挂 arXiv,无代码、无参数细节
生成时长最长 60 秒行业此前多为 3-4 秒
2024 年初行业水平3-4 秒、固定尺寸Sora 规格碾压
输入方式文本 / 图片 / 视频支持动画化 DALL·E 图片
分辨率最高 1080p(1920×1080)竖屏 1080×1920 亦可
图像生成最高 2048×2048图片即单帧视频
架构diffusion transformer(DiT)输入为时空 latent patch
视频压缩视频压缩网络(latent VAE)时间 + 空间联合压缩
重标注DALL·E 3 式描述器模型GPT 扩写用户提示
Sora Turbo 公测2024-12-09距首次展示约 10 个月
Turbo 时长 / 分辨率20 秒 / 1080pPlus 档为 720p/5 秒
Turbo 定价Plus $20:50 个/月;Pro $200:500 个/月Pro 支持 1080p/20 秒/无水印
溯源安全C2PA 元数据水印 + 可见水印内置内容检索验证工具
生成成本1080p 一次 100-2000 credits视频生成边际成本高
开放对象仅 Plus / Pro 订阅用户无免费档
报告唯一结论scaling 视频模型是通向世界模拟器的路径全文无基准分数

关键概念清单

  • DiT(diffusion transformer,扩散变压器)= 用 transformer 做去噪骨干的扩散模型
  • spacetime patches(时空 patch)= 视频潜表示切成的时空块,等价于视觉 token
  • latent space(潜空间)= 数据的低维压缩表示空间
  • VAE(variational autoencoder,变分自编码器)= 压缩与重建数据的生成模型框架
  • recaptioning(重标注)= 用模型为训练数据重新生成详细描述
  • object permanence(目标持久性)= 物体离开画面再出现时保持同一身份
  • world simulator(世界模拟器)= 能学习并模拟物理世界规律的模型主张
  • C2PA(内容真实性溯源联盟)= 记录内容来源与修改历史的元数据标准
  • red team(红队测试)= 外部专家主动寻找模型漏洞
  • CSAM(儿童性虐待材料)= Sora 明确禁止生成的内容
  • Sora Turbo = Sora 的加速公测版本,2024-12-09 上线
  • seed(种子)= 控制生成随机性的固定参数,便于对比实验
  • Storyboard(故事板)= 按时间轴分段描述场景的视频编排工具
  • Remix / Re-cut / Blend = Sora Turbo 的编辑工具,分别对应重混 / 重剪 / 混合
  • credits(额度)= Sora 按视频规格计费的额度单位
  • alpha(内测)= 小范围用户先行的测试阶段,Sora 曾长期停留于此
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Sora:自称世界模拟器
https://mizuki-eaf.pages.dev/posts/chatgpt/sora自称世界模拟器/
作者
无名之子
发布于
2026-07-09
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录