• 我的订阅
  • 科技

北大、快手开源视频生成模型Pyramid Flow,1分钟生成5秒视频

类别:科技 发布时间:2024-10-12 09:49:00 来源:智东西
北大、快手开源视频生成模型Pyramid Flow,1分钟生成5秒视频

智东西10月11日消息,据VentureBeat报道,北京大学、北京邮电大学和快手科技在本周联合开源了一款名为Pyramid Flow的高清视频生成模型。Pyramid Flow能根据文本描述制作长达10秒、分辨率为1280×768、每秒24帧的视频。

Pyramid Flow采用了金字塔流匹配算法,优化了视频生成的效率和质量。这一算法将视频生成过程分解为多个阶段,每个阶段对应着不同的分辨率。

在推理阶段,Pyramid Flow模型能够以相当快的速度生成视频。具体来说,它可以在56秒内生成一段时长为5秒、分辨率为384p的视频,这一速度与市面上许多全序列扩散模型相当,甚至更快。

目前,该项目已经在Hugging Face和GitHub上开源。

开源地址:

1、https://github.com/jy0205/Pyramid-Flow

2、https://huggingface.co/rain1011/pyramid-flow-sd3

一、金字塔流匹配算法:高质量AI视频新技术,逐层提高分辨率

文生视频领域有一个非常难的技术挑战,就是如何有效地处理和生成高维度的视频数据。

针对这一技术挑战,Pyramid Flow研发团队提出了金字塔流匹配算法。

金字塔流匹配算法的核心思想是将视频生成过程分解为多个阶段来有效处理高维度的视频数据。这些阶段从低分辨率开始,逐步升级到高分辨率,从而逐步提升视频的清晰度。

这个过程就像是先画一个简单的草图,然后一点点地加上颜色和细节,直到画出一幅完整的画。

北大、快手开源视频生成模型Pyramid Flow,1分钟生成5秒视频

▲金字塔流匹配算法:视频的生成是在不同的分辨率层次上逐步进行的(图源:arxiv论文截图)

二、开源数据集训练,Pyramid Flow生成5-10秒高清视频

Pyramid Flow模型通过分阶段的方式生成视频,大大减少了计算成本。

//oss.zhidx.com/uploads/2024/10/6708ce81379bf_6708ce8130b37_6708ce8130b05_2.mp4

▲Pyramid Flow生成的视频展示(图源:Pyramid Flow官网)

与传统的扩散模型相比,Pyramid Flow的金字塔流匹配算法将token数量减少了4倍。

//oss.zhidx.com/uploads/2024/10/6708cef0f36bb_6708cef0ea0a5_6708cef0ea080_2.mp4

▲Pyramid Flow生成的视频展示(图源:Pyramid Flow官网)

据官网介绍,该模型可以在768p分辨率和每秒24帧的条件下生成5至10秒的视频,并且是基于开源数据集进行训练的。

//oss.zhidx.com/uploads/2024/10/6708cfe934692_6708cfe922581_6708cfe92255e_2.mp4

▲Pyramid Flow生成的视频展示(图源:Pyramid Flow官网)

具体来说,Pyramid Flow在训练时用到的数据集包括LAION-5B、CC-12M、SA-1B以及WebVid-10M和OpenVid-1M等。

1、LAION-5B:一个用于多模态AI研究的大型数据集。

2、CC-12M:一个由网络爬虫收集的图像文本对的数据集。

3、SA-1B:具有高质量、无模糊图像的数据集。

4、WebVid-10M和OpenVid-1M:两个被广泛用于文本到视频生成的视频数据集。

三、宽松许可,Pyramid Flow开源商业用途,轻松实现视频微调

Pyramid Flow是开源的AI视频生成工具,它允许用户用在商业项目里,但须保留版权声明。

//oss.zhidx.com/uploads/2024/10/6708d06aaa71b_6708d06aa00f2_6708d06aa00cf_2.mp4

▲Pyramid Flow生成的视频展示(图源:Pyramid Flow官网)

通过使用Pyramid Flow,用户可以免费调整视频细节,这项功能对于电影制片厂来说很有吸引力。

电影制片厂可以通过使用Pyramid Flow来提高视频制作效率、降低视频制作成本,并探索新的视频创意工具。

不过,要想充分利用好这一模型,电影制片厂还需要具备一定的开发人才和计算资源。

目前,Pyramid Flow缺乏像Runway Gen-3 Alpha这样的模型所具备的一些高级微调功能,比如精确控制摄像机角度、关键帧和人体姿态等电影元素。

//oss.zhidx.com/uploads/2024/10/6708d0bf19031_6708d0bf0fc60_6708d0bf0fc3e_2.mp4

▲Pyramid Flow生成的视频展示(图源:Pyramid Flow官网)

//oss.zhidx.com/uploads/2024/10/6708d11fb804e_6708d11fb15f1_6708d11fb15d1_2.mp4

▲Pyramid Flow生成的视频展示(图源:Pyramid Flow官网)

//oss.zhidx.com/uploads/2024/10/6708d140beee7_6708d140b8aa9_6708d140b8a87_3.mp4

▲Pyramid Flow生成的视频展示(图源:Pyramid Flow官网)

来源:VentureBeat、Pyramid Flow官网、arxiv

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-10-12 12:45:01

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

文生视频大模型,短视频的过弯点?
...就成为了国内厂商追逐的焦点。6月初,快手自研的视频生成大模型“可灵”正式上线。可灵AI采用了与Sora相似的技术路线,能够生成具有合理运动和模拟物理世界特性的视频。截至目前,
2024-07-30 14:08:00
快手发布对标Sora的视频生成大模型「可灵」 已开放邀测体验
...近日,又一国产视频大模型加入战局,快手“可灵”视频生成大模型官网正式上线。相较此前各家放出的视频大模型以展示视频为主,本次亮相的可灵大模型不但效果对标Sora,且已在快手旗下
2024-06-07 09:20:00
AI视频新战场:字节对决快手、反击Sora
...新知 原创作者丨萧维 编辑丨蕨影一场由Sora引发的AI视频生成竞赛,如今迎来新的竞争者!9月24日,2024火山引擎AI创新巡展深圳站上
2024-09-30 13:34:00
视频大模型 快手美图殊途同归
...视频大模型“可灵”并开始邀测,用户输入一段文字即可生成视频。美图宣布将在7月底上线新品MOKI,该产品基于美图奇想大模型的视频生成能力,可帮助用户生成AI短片。不论是做视频还
2024-06-13 23:55:00
蓝色光标Blue AI携手快手可灵AI,共同引领AI视频生成新时代
...色光标宣布与快手可灵AI正式签署战略合作协议,就AI视频生成技术研发、平台合作、场景共建、内容创作优化等多维度展开深入合作,共探AI视频生成的无限潜力。蓝色光标自研AI行业模
2024-09-11 14:48:00
视频生成大模型sora和可灵的区别在哪里?
...称为“世界模拟器”:它理解真实的规则,并在此基础上生成“世界”。如果说从前还是一道铜墙铁壁,那么现在,虚拟与真实可能仅一线之隔。Sora之后,它的挑战者前赴后继。6月,视频生
2024-06-26 14:27:00
对标Sora!快手自研视频生成大模型可灵AI全面开放内测
快科技7月25日消息,日前,快手视频生成大模型可灵AI宣布基础模型升级,并全面开放内测,同时正式上线付费会员体系。用户每日登录都可免费获得66灵感值,可用于兑换可灵AI平台内指定
2024-07-25 07:57:00
大模型的未来,快手在自己身上找答案
...数字人 | 图片来源:视觉中国而另一片场地上,快手视频生成大模型明星「可灵」发布了一系列重磅升级和 AIGC 短剧,台下欢呼声此起彼伏。对外界来说,AI 能力是抽象的,带货主
2024-07-11 14:20:00
快手可灵大模型开放视频续写功能 可生成最长约3分钟视频
本文转自:中国新闻网快手的视频生成大模型“可灵”自面世以来,以其惊艳效果引发了国内外的广泛关注。 6月21日,可灵再度进化,正式推出图生视频功能,支持用任意静态图像生成5s视频,
2024-06-24 19:53:00
更多关于科技的资讯:
引领健康储鲜,澳柯玛风冷变频冷柜斩获“云鼎奖”
鲁网9月5日讯近日,奥维云网2025数字生态大会在杭州闭幕。作为家电行业极具影响力的年度盛会,现场汇聚了众多家电领军品牌
2025-09-05 13:38:00
周黑鸭携四大产品线矩阵破局全场景消费,构建卤味行业新范式
齐鲁晚报·齐鲁壹点 记者 张召旭在近期举办的行业展会上,周黑鸭凭借前瞻性战略布局引发行业广泛关注——品牌首次系统推出针对多元消费需求与渠道特性开发的四大产品线
2025-09-05 11:00:00
当“保温杯里泡枸杞”从段子变成日常,当“中药房下午茶”取代美式咖啡成为年轻人新宠,老字号品牌们逐渐发现:年轻人不是在买一杯饮料
2025-09-05 11:02:00
本报记者 魏 静 □ 忽 艳在国内鼓励创新、倡导在世界舞台展示中国实力产品与个人实力的大环境下,越来越多中国品牌凭借创新精神与卓越品质
2025-09-05 11:02:00
近日,阳光人寿秦皇岛中支在益寿园开展“银发课堂”特色活动,为老年群体送上内容丰富的金融知识。活动现场,工作人员通过生动的案例
2025-09-05 09:36:00
36氪首发|掘金“微醺”社交经济,精酿品牌「TAGSIU」获近千万 Pre-A 轮融资
作者 | 李小霞36 氪获悉,精酿品牌「TAGSIU 醍宿酿造」(下称“TAGSIU”)已完成近千万 Pre-A轮融资
2025-09-04 22:09:00
从形态突破到生态跃迁:华为三折叠的「鸿蒙时刻」
三折叠这个赛道,或许只有华为能够超越华为。华为Mate XT 非凡大师发布一年之后,三折叠这片“无人区”,仍然只有华为的身影
2025-09-05 00:13:00
大众网记者 张田夏荫 实习记者 张智尧 报道海信集团总裁、海信视像科技股份有限公司董事长于芝涛正式以大赛形象大使与推介大使的身份
2025-09-04 10:04:00
第26届GOPS全球运维大会落幕,AI Infra赋能运维转型
2025年6月28日,为期两天的第26届GOPS全球运维大会暨研运数智化技术峰会在北京市圆满落幕。作为国内首个运维行业盛会
2025-09-04 11:33:00
三联家电“伙拼9.12”权益全解析!三重补贴省心省钱嗨购金秋
鲁网9月4日讯金秋家装季撞上三联家电第十一季“伙拼9.12”大型内购福利会!这场被万千家庭期待的消费盛宴即将引爆全城!多重补贴
2025-09-04 11:33:00
灵动集团旗下欢米粒心理:新学期,为青少年心理护航——以专业体系构建成长防护网
在青少年心理健康服务需求进入 “刚性增长期” 的当下,资质与专业双轮驱动成为行业发展的核心支撑。灵动生活集团作为《互联网心理服务・心理测评服务通用规范》国家标准制定委员单位
2025-09-04 11:55:00
金秀之光,宏瑶传承千年瑶浴的现代创新之路
金秀大瑶山的采药人每日清晨踏遍青山,采集当地草药。这些草药通过广西宏瑶生物科技股份有限公司(以下简称“宏瑶股份”)的现代研发与技术加工
2025-09-04 11:55:00
井壁稳定“智能分析师”:Biot - Coussy PORORI团队研发井壁失稳风险分析系统
在深层能源勘探开发不断推进的背景下,钻井工程常面临地质条件复杂、井下环境多变等严峻挑战。其中,井壁失稳是导致钻井周期延长
2025-09-04 12:08:00
锦纶新材料首秀!南山智尚亮相2025中国国际纺织面料及辅料(秋冬)博览会
9月2日至4日,2025中国国际纺织面料及辅料(秋冬)博览会在上海国家会展中心举行。南山智尚(股票代码:300918)及旗下锦纶新材料公司共同亮相
2025-09-04 12:11:00
36氪2025 AI Partner百业大会 | 思必驰定义对话式AI新价值
AI浪潮席卷千行百业,“中国式方案”正在无声地改写着全球科技产业版图,实现“AI+”与千行百业的深度赋能。日前,36氪与中欧国际工商学院联合主办2025 AI Partner百业大会
2025-09-04 13:56:00