• 我的订阅
  • 科技

OpenAI空降视频生成模型:一口气生成60s,风格画质尺寸灵活定制 | 最前线

类别:科技 发布时间:2024-02-18 06:20:00 来源:36氪

文 | 周鑫雨

编辑 | 苏建勋

2023年4月,成立于纽约的Runway AI发布了一段用AI生成的视频:模糊卡顿、物体扭曲,且仅4秒;

四个月后,Runway将文生视频的视频效果拉到了4K的超逼着高度,实现了镜头的连贯稳定。而视频的最大长度也从4秒,提升到了18秒——这也是2023年文生视频的“时长天花板”。

然而,就在北京时间2024年2月16日凌晨,“天花板”又被打破——OpenAI又出王炸,发布了可以生成60秒视频的AI模型Sora。

OpenAI空降视频生成模型:一口气生成60s,风格画质尺寸灵活定制 | 最前线

OpenAI官宣Sora。

同样在2月16日发布的谷歌最新多模态模型Gemini Pro 1.5,则被Sora迅速夺走了关注度。

OpenAI空降视频生成模型:一口气生成60s,风格画质尺寸灵活定制 | 最前线

网友为Gemini和Sora制作的梗图。

根据OpenAI官方发布的推文和技术报告,Sora能力的革命性可以被提炼为:最长生成60s视频、镜头的前后一致性、超逼真。

从官方发布的视频demo而言,Sora只需要输入包含“构成元素、环境、行为及发生顺序、视频风格”等关键因素的Prompt(提示词),就能生成不同风格的高清、连贯,且具有丰富运镜和转场的60s级视频。

比如生成包含人物和城市元素的视频:

提示词:一位时尚女性走在充满温暖霓虹灯和动画城市标牌的东京街道上。她穿着黑色皮夹克、红色长裙和黑色靴子,拎着黑色钱包。她戴着太阳镜,涂着红色口红。她走路自信又随意。街道潮湿且反光,在彩色灯光的照射下形成镜面效果。许多行人走来走去。

OpenAI空降视频生成模型:一口气生成60s,风格画质尺寸灵活定制 | 最前线

Sora生成视频(原视频为60s,文中截取20s,画质受gif大小限制有所压缩)。图源:OpenAI

Sora也能生成动物和自然风光:

提示词:几只巨大的毛茸茸的猛犸象踏着白雪皑皑的草地走近,它们长长的毛茸茸的皮毛在风中轻轻飘动,远处覆盖着积雪的树木和雄伟的雪山,午后的阳光下有缕缕云彩,太阳高高地挂在空中距离产生温暖的光芒,低相机视角令人惊叹地捕捉到大型毛茸茸的哺乳动物,具有美丽的摄影和景深。

OpenAI空降视频生成模型:一口气生成60s,风格画质尺寸灵活定制 | 最前线

Sora生成视频(画质受gif大小限制有所压缩)。图源:OpenAI

Sora生成的视频已经能够达到逼真的效果。不过,用3D和动漫风格生成虚拟场景对Sora而言也不在话下:

提示词:动画场景的特写是一个毛茸茸的小怪物跪在融化的红蜡烛旁边。艺术风格是 3D 和现实的,重点是灯光和纹理。这幅画的气氛是一种惊奇和好奇,怪物睁大眼睛、张开嘴巴凝视着火焰。它的姿势和表情传达出一种天真和俏皮的感觉,就好像它第一次探索周围的世界一样。暖色调和戏剧性灯光的使用进一步增强了图像的舒适氛围。

OpenAI空降视频生成模型:一口气生成60s,风格画质尺寸灵活定制 | 最前线

Sora生成视频(画质受gif大小限制有所压缩)。图源:OpenAI

突破时长和逼真的瓶颈,Sora摸着DALL-E过河

在半年前,在保证生成画质的前提下时长仅仅是突破10秒,对于多数视频模型而言都是难以企及的高度。

这是由于循环网络、生成对抗网络、Diffusion模型等主流视频建模范式,通常只能学习某一小类的视觉数据、较短的视频或者固定大小的视频。

这意味着,此前主流范式下的视频生成模型对训练数据有较高的要求,需要将训练数据处理为具有标准大小、裁剪尺寸的视频。

Sora的技术报告显示,为了构建Sora,OpenAI创新性地采用了文生图模型DALL-E 3的相关技术:将Diffusion模型(可以将随机像素大致转换为图像)与Transformer神经网络(支持处理长数据序列)相结合。

这意味着,Sora可以像处理文字和图像数据一样,对视觉数据进行分块式地理解分析,不用进行标准化的预先处理。

比如对应大语言模型中将文本分割为最小的处理单位Token,Sora也通过压缩视频到较低维度,将视觉数据分割为可分块处理的补丁(patch)。并且随着训练计算量的规模式(Scaling)提升,视频生成质量会显著提高。

OpenAI空降视频生成模型:一口气生成60s,风格画质尺寸灵活定制 | 最前线

基于基础计算量生成的样本效果。图源:OpenAI

OpenAI空降视频生成模型:一口气生成60s,风格画质尺寸灵活定制 | 最前线

基于4倍计算量生成的样本效果。图源:OpenAI

OpenAI空降视频生成模型:一口气生成60s,风格画质尺寸灵活定制 | 最前线

基于16倍计算量生成的样本效果。图源:OpenAI

基于原始数据而非标准化处理数据的训练,不仅可以让Sora初步拥有理解真实或虚拟世界的能力,还能灵活生成时长不同、分辨率和尺寸各异的视频(目前可生成的尺寸范围是:宽屏1920x1080p~竖屏1080x1920p),以适应不同场景和设备的使用需求。

Sora生成不同尺寸下的同主题视频。图源:OpenAI

不过,仍有不少专家以审慎的态度看待这次技术突破。伊利诺伊大学厄巴纳-尚佩恩分校信息科学教授Ted Underwood在华盛顿邮报的采访中表示,OpenAI可能会挑选可以展示模型最佳表现的一些视频。

再比如,普林斯顿大学计算机科学教授 Arvind Narayanan在X推文中指出,Sora生成的时尚女子在东京街头行走的视频中,女子的左右腿交换了位置,背景中的人物在被前进物体短暂遮挡后消失了。

OpenAI空降视频生成模型:一口气生成60s,风格画质尺寸灵活定制 | 最前线

Arvind Narayanan的推文,可仔细观察原视频14-16秒处的双腿交换。

OpenAI官方也放出了一些“Sora翻车视频”,展示了Sora在理解复杂场景的物理原理、因果关系、空间细节、时间推移上的弱点。比如,它搞反了人在跑步机上跑步的方向。

OpenAI空降视频生成模型:一口气生成60s,风格画质尺寸灵活定制 | 最前线

Sora生成的视频截图。提示词:打印一个人跑步的场景,35 毫米电影胶片。

Sora杀死Runway们,伦理安全引发大众担忧

2022年,TikTok观看量Top 10的视频平均时长为44.2秒,最长的一个视频长达2分16秒;

广告分析公司Integral Ad Science的统计数据显示,移动网络展示广告和移动应用的广告平均时长分别为15.6秒和20.2秒。

这意味着,一旦文生视频模型突破了60s的时长瓶颈、画质达到商用级别,对于用户的生产和娱乐方式,都会产生巨大的影响。《马戏之王》导演Michael Gracey告诉华盛顿邮报:“电影制作者不再需要一个由 100 或 200 名艺术家组成的团队,在三年内制作他们的动画长片。这让我很兴奋。”

然而,他依然对AI工具可能会造成的版权争议、失业问题而感到担忧:“它(AI)剥夺了其他人的创造力、工作、想法和执行力,却没有给予他们应有的荣誉和经济报酬时,那就不好了。”

由于Sora生成的视频质量远高于多数视频生成模型,尤其现实风格让人真假难辨,不少专家也表达了对视频深度伪造(Deepfake)的担忧。政治竞选虚假信息识别组织True Media创始人、华盛顿大学教授Oren Etzioni在纽约时报的采访中表示:“我非常害怕这种事情会影响一场势均力敌的选举。”

目前,OpenAI为Sora生成的视频自动添加了水印标记,以表明由AI生成。OpenAI创始人兼CEO Sam Altman在X上表示,目前Sora正在展开红队测试(Red-Teaming,一种安全评估方法),并只对少数人开放测试。

OpenAI空降视频生成模型:一口气生成60s,风格画质尺寸灵活定制 | 最前线

Sam Altman的推文。

不过,即便尚未正式对公众开放,Sora的能力已经引起了不少视频模型创业者的恐慌。

“当一个质量更好、时长更长、应用场景更广泛的视频模型摆在面前,没有人还想用‘Runway们’。”一名AI创业者告诉36氪,“对模型层创业者来说,当务之急还是赶紧找场景、做应用。”

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-02-18 08:45:01

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

努比亚一口气发布两款AI手机
今天下午,努比亚一口气发布两款AI手机:努比亚Z60Ultra领先版、努比亚Z60SPro。它们均依托行业领先的自研星云AI大模型
2024-07-24 03:35:00
腾讯混元一口气开源5个3D生成模型:最快30秒生成!
快科技3月19日消息,腾讯最新公告,一口气开源5个3D生成模型,通过腾讯混元3D官网即可体验。据介绍,这5个开源模型均基于Hunyuan3D-2
2025-03-19 00:26:00
大厂加码落地大模型,京东云一口气发了10个AI应用
...nchmark。" 京东云新发布的AI应用,图片由公司提供为什么一口气发这么多AI产品,京东云言犀相关人士的回答是:"电商需要的是一整套的系统的AI应用,而不是某一款提供单
2024-12-07 09:55:00
字节版Sora终于来了!一口气两款视频模型,带来的震撼不只一点点
...字节跳动旗下的火山引擎在深圳办了一场 AI 创新巡展,一口气发布了两款视频生成大模型,正式宣告进军 AI 视频生成
2024-09-26 13:45:00
云计算一哥终于搞多模态了:一口气6个大模型,还有个3nm芯片!
...布自家新款AI多模态系列大模型,名曰Amazon Nova。而且是一口气涵盖文本对话、图片生成、视频生成,甚至直接吐露一个小目标
2024-12-05 09:45:00
《玉骨遥》空降,一口气放出4集,登顶热搜
由肖战和任敏合作主演的《玉骨遥》终于正式和大家见面了,这部剧在两年前就已经杀青两年的时间里,也曾多次的被网友提到。很多粉丝都期待能够早日看到这部作品,但粉丝们每一次贡献热度之后,
2023-07-04 15:48:00
周鸿祎一口气发布200多个数字人 “马斯克”“孙悟空”“诸葛亮”将把守大模型应用入口?
昨日(6月13日), 360正式发布“360智脑”大模型应用,360智脑从1.0迭代至4.0版本,包括360安全卫士、360安全浏览器
2023-06-14 13:00:00
曝《无忧渡》本周空降,刘诗诗新剧延后,宋祖儿或一口气播两部剧
...忧渡》,那腾讯内部也立马就抬《折腰》,宋祖儿有可能一口气播两部剧。 关于宋祖儿的税务问题,此前工作室声明经税务机关核查,宋祖儿无偷逃税款的行为,也未因税务事宜被处罚,而且这
2025-04-11 08:22:00
新剧空降开播!一口气追六集不过瘾,观众连刷好评,又抓到好剧了
如今,市场上能够看得下去的电视剧可能要数周迅的不完美受害人还有张一山和关晓彤的曾少年了。这两部电视剧还是蛮对我的口味的,但是因为追剧的节奏太快,所以已经追平了,在成毅新剧莲花楼还
2023-07-24 22:11:00
更多关于科技的资讯:
厦门网讯(厦门日报记者 林露虹)电子数据取证领域的顶尖人才齐聚厦门,以赛促训强本领。昨日,“美亚杯”第十一届中国电子数据取证大赛(以下简称“美亚杯”)在厦门举行
2025-11-16 08:34:00
“原子级制造:前沿与应用”自然国际会议在宁举行操控原子可“按需造物”,南京已“先行一步”□南京日报/紫金山新闻记者张安琪11月11日至14日
2025-11-16 08:43:00
谁说养老只能慢节奏?记者带您解锁雄安颐养・智慧养老展示馆,三大科技彩蛋让你忍不住竖起大拇指!彩蛋1:AI健康管理机器人
2025-11-16 14:45:00
“先导杯”决赛在合肥打响 全国大学生比拼“智能计算”
大皖新闻讯 AI正在加速改变世界,但其根基仍在“算”。11月15日-16日,2025全国大学生计算机系统能力大赛——智能计算创新设计赛(先导杯)线下决赛及颁奖典礼在合肥举行
2025-11-16 14:46:00
从好房子到好生活:海尔智家以智慧重新定义未来人居
《晏子春秋》云:“君子居必择居,游必择士。”安居乐业,始终是中国人最朴素的向往。过去,一处遮风避雨的“安身之所”已是百姓慰藉
2025-11-16 15:16:00
海尔智慧家庭与小度达成全面战略合作
当智能家居行业从各自分散走向共创融合,一场新的家庭生活变革正在悄然发生。11月13日,百度世界2025于北京召开。现场
2025-11-16 15:18:00
张宣科技金属制品公司研发锌铝镁合金新产品
河北新闻网讯(董佳倩)近日,在张宣科技金属制品公司镀锌丝厂房里,一根根钢丝平稳浸入锌锅,然后裹着“银装”出锅上行,穿越配药箱之后
2025-11-16 16:19:00
东南网11月16日讯(本网记者 卢金福)随着AI技术的普及,电商平台上AI展示商品的现象日益增多。AI模特穿AI衣服做AI直播
2025-11-16 22:09:00
海尔智慧家庭与小度战略合作:双向控制,生态互通
伴随市场需求从单品向全屋智能深入,智能家居生态正从过去单一入口向着多入口、多圈层的生态体系迈进。特别是互联平台的兼容性方面
2025-11-16 15:16:00
摘要:本文围绕企业绩效管理体系的构建与完善展开研究,首先明确该体系的核心构成,包含目标设定、过程监控、评估实施与结果应用四个相互衔接的环节
2025-11-15 05:22:00
厦门软件园健康马拉松赛开跑 引入AI陪跑员
厦门网讯(厦门日报记者 林露虹 摄影报道)“我的‘跑友’是机器人!”昨日,厦门软件园第十七届健康马拉松赛在软件园二期热力开跑
2025-11-15 08:20:00
吉林本土动画电影《疯狂电脑城》,凭啥在海外频频获奖?
在温哥华华语电影节上,吉林动画学院师生联合打造的《疯狂电脑城》摘得“最佳动画片奖”,这已经不是该片第一次出海,2024年
2025-11-15 19:01:00
摘要:本文聚焦数字化转型背景下企业行政管理效率提升问题,首先剖析数字化转型与企业行政管理的内在关联,指出二者通过流程优化
2025-11-15 05:22:00
2025网聚美好安徽|“双路由”直连上海 看宿州腾“云”而上
大皖新闻讯 11月14日,“皖美十四五 再启新征程”2025网聚美好安徽网络主题活动采访团走进位于宿州高新区的汴水之畔超级计算中心
2025-11-15 10:05:00
“世界舞台”上秀一圈,南京收获了什么?
进博会圆满落幕,南京交易分团意向成交9.98亿美元“世界舞台”上秀一圈,南京收获了什么?□南京日报/紫金山新闻记者 黄琳燕11月10日
2025-11-14 08:38:00