• 我的订阅
  • 科技

史上首个实时AI视频生成技术:DiT通用,速度提升10.6倍

类别:科技 发布时间:2024-06-28 09:32:00 来源:机器之心Pro

机器之心报道

机器之心编辑部

DiT 都能用,生成视频无质量损失,也不需要训练。

实时 AI 视频生成来了!

本周三,新加坡国立大学尤洋团队提出了业内第一种可以实时输出的,基于 DiT 的视频生成方法。

史上首个实时AI视频生成技术:DiT通用,速度提升10.6倍

该技术名为 Pyramid Attention Broadcast (PAB)。通过减少冗余注意力计算,PAB 实现了高达 21.6 FPS 的帧率和 10.6 倍的加速,同时不会牺牲包括 Open-Sora、Open-Sora-Plan 和 Latte 在内的流行基于 DiT 的视频生成模型的质量。值得注意的是,作为一种不需要训练的方法,PAB 可以为任何未来基于 DiT 的视频生成模型提供加速,让其具备实时生成的能力。

自今年起,OpenAI 的 Sora 和其他基于 DiT 的视频生成模型引起了 AI 领域的又一波浪潮。然而与图像生成相比,人们对于视频生成的关注点基本都在于质量,很少有研究专注于探索如何加速 DiT 模型推理。加速视频生成模型的推理对于生成式 AI 应用来说已经是当务之急。

PAB 方法的出现,为我们打开了一条路。

原始方法与 PAB 视频生成速度的比较。作者在 Open-Sora 上测试了 5 个 4s(192 帧)480p 分辨率的视频。

GitHub 链接:https://github.com/NUS-HPC-AI-Lab/OpenDiT?tab=readme-ov-file#pyramid-attention-broadcast-pab-blogdoc

金字塔式注意力广播

近期,Sora 和其他基于 DiT 的视频生成模型引起了广泛关注。然而,与图像生成相比,很少有研究专注于加速基于 DiT 的视频生成模型的推理。此外,生成单个视频的推理成本可能很高。

史上首个实时AI视频生成技术:DiT通用,速度提升10.6倍

图 1:当前扩散步骤和先前扩散步骤之间的注意力输出差异,使用均方误差 (MSE) 对差异进行量化。

实现

这项研究揭示了视频扩散 transformer 中注意力机制的两个关键观察结果:

首先,不同时间步骤的注意力差异呈现出 U 形模式,在最初和最后 15% 的步骤中发生显著变化,而中间 70% 的步骤则非常稳定,差异很小。

其次,在稳定的中间段内,注意力类型之间存在差异:空间注意力变化最大,涉及边缘、纹理等高频元素;时间注意力表现出与视频中的运动和动态相关的中频变化;跨模态注意力是最稳定的,将文本与视频内容联系起来,类似于反映文本语义的低频信号。

基于此,研究团队提出金字塔式注意力广播来减少不必要的注意力计算。在中间部分,注意力表现出微小的差异,该研究将一个扩散步骤的注意力输出广播到几个后续步骤,从而显著降低计算成本。

此外,为了更有效的计算和最小的质量损失,作者根据不同注意力的稳定性和差异性设置了不同的广播范围。即使没有后期训练,这种简单而有效的策略也能实现高达 35% 的加速,同时生成内容的质量损失可以忽略不计。

史上首个实时AI视频生成技术:DiT通用,速度提升10.6倍

图 2:该研究提出了金字塔式注意力广播,其中根据注意力差异为三个注意力设置不同的广播范围。注意力变化越小,广播范围越广。在运行时,该方法将注意力结果广播到接下来的几个步骤,以避免冗余的注意力计算。x_t 指的是时间步 t 的特征。

并行

下图 3 为本文方法与原始动态序列并行(Dynamic Sequence Paralle, DSP)之间的比较。当时间注意力得到传播时,则可以避免所有通信。

史上首个实时AI视频生成技术:DiT通用,速度提升10.6倍

为了进一步提升视频生成速度,本文基于 DSP 来改进序列并行。序列并行将视频分割为跨多个 GPU 的不同部分,从而减少了每个 GPU 的工作负载并降低了生成延迟。不过,DSP 引入了大量的通信开销,需要为时间注意力准备两个 All to All 通信。

通过在 PAB 中传播时间注意力,本文不再需要对时间注意力进行计算,由此减少了通信。相应地,通信开销大幅降低了 50% 以上,使得实时视频生成可以进行更高效的分布式推理。

评估结果

加速

下图为不同模型在 8 块英伟达 H100 GPU 上生成单个视频时,测量得到的 PAB 总延迟。当使用单块 GPU 时,作者实现了 1.26 至 1.32 倍的加速,并在不同的调度器中保持稳定。

当扩展到多块 GPU 时,本文方法实现了 10.6 倍的加速,并得益于高效的序列并行改进实现了与 GPU 数量之间的近线性扩展。

史上首个实时AI视频生成技术:DiT通用,速度提升10.6倍

定性结果

以下三个视频分别为 Open-Sora、Open-Sora-Plan 和 Latte 三个不同的模型使用原始方法与本文方法的效果对比。可以看到,本文方法在不同的 GPU 数量下均实现了不同程度的 FPS 加速。

史上首个实时AI视频生成技术:DiT通用,速度提升10.6倍

史上首个实时AI视频生成技术:DiT通用,速度提升10.6倍

史上首个实时AI视频生成技术:DiT通用,速度提升10.6倍

视频链接:https://mp.weixin.qq.com/s/tidE-qSM3nZ8kUfjNcpMZA

定量结果

下表为 Open-Sora、Open-Sora-Plan 和 Latte 三个模型的 LPIPS(学习感知图像块相似度)和 SSIM(结构相似度)指标结果。

史上首个实时AI视频生成技术:DiT通用,速度提升10.6倍

更多技术细节和评估结果可以查看即将推出的论文。

项目地址:https://oahzxl.github.io/PAB/

参考链接:

https://oahzxl.github.io/PAB/

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-06-28 13:45:01

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

AI首次实时生成视频!尤洋团队新作,网友:这是新纪元
...大学尤洋以及3位学生推出。具体来说,PAB通过减少冗余注意力计算,可实现高达21.6FPS和10.6倍加速,并且不会牺牲基于DiT的流行视频生成模型(包括Open-Sora
2024-06-29 09:30:00
连发两款模型“补课”,百度AI成色如何?
...源。目前,百度仅初步透露了多个层面的技术优化,包括注意力机制、模型架构、模型幻觉等方面。据介绍,文心4.5采用自研的FlashMask动态注意力掩码,降低了计算冗余和存储开销
2025-03-20 11:38:00
腾讯混元上线文生视频并开源,120秒内成片!还有提示词建议
...(MLLM),优化文本与图像的对齐;3、使用130亿参数的全注意力机制(DIT)和双模态ScalingLaw,增强时空建模与动态表现
2024-12-04 09:49:00
智谱AI发布视频生成大模型,B站参与研发,亦庄提供算力|甲子光年
... 3D convolution)为主要模型组件,移除了自编码器中常用的注意力模块,使得模型具备不同分辨率迁移使用的能力。同时,在时间维度上因果卷积的形式也使得模型具备视频编解
2024-07-27 09:30:00
优爱腾芒的AI营销论,怎样让广告主信服?
...利用AI生成的实时动态广告、互动广告等,以吸引用户的注意力,提高用户的参与度。同时,它们还需要提供透明的数据报告,让广告主清楚地看到每一分钱的投入都花在了哪里,产生了怎样的效
2024-06-18 17:54:00
超越YOLOv10/11、RT-DETRv2/3!D-FINE重新定义边界框回归任务
...RT-DETR 引入了 YOLO 的 RepNCSP 模块,以替代冗余的多尺度自注意力层,通过重新设计轻量化的混合编码器
2024-10-30 09:52:00
智谱AI杀入视频生成:「清影」上线,时长6秒,免费不限量
... 94 亿参数,它通过 CogView2 生成一系列初始帧,基于双向注意力模型对图像进行插帧的方法实现视频生成。此外
2024-07-27 09:27:00
苹果Vision Pro的另一面:虚拟人3.0要爆发了
...用户进行以虚拟人为载体实时视频互动,好处显而易见。注意力碎片化的今天,用户特别是年轻人更习惯消费多媒体内容,特别是短视频、直播等内容,对传统的静态图文内容越来越无感,对XR、
2023-06-13 11:00:00
开源社区参数量最大的文生视频模型来了,腾讯版Sora免费使用
...循,自研 3D 视觉编码器支持图像视频混合训练,通过全注意力机制提升画面运镜能力,并根据自研的图像视频 Scaling Law 设计和训练了最优配比模型
2024-12-04 09:48:00
更多关于科技的资讯:
聚焦心理服务新生态:灵动生活集团旗下幸福研习社亮相第十九届中国心理学家大会
2025年8月8-10日,第十九届中国心理学家大会于深圳盛大启幕。本届大会紧扣“此心安处是吾乡—中国社会心理服务的文化归根与范式突围”主题
2025-08-13 15:45:00
校企联动,智绘未来:哈尔滨工程大学深圳校友企业联盟探访博大数据前海智算中心
近日,哈尔滨工程大学深圳校友企业联盟代表团探访博大数据深圳前海智算中心,近20家来自同行业以及相关领域的校友企业代表齐聚于此
2025-08-13 13:51:00
(摘要:守护权益,“链”动责任)供应链不仅是一种资源配置关系,更是企业责任延伸的重要载体,员工的权益保障与企业可持续发展紧密相连
2025-08-13 13:52:00
平度:国内外市场齐发力 泡菜产业蓬勃发展
大众网记者 尚超 尹璐瑶 青岛报道近日,在平度经开区青岛农一食品有限公司的生产车间,工人们熟练地操作着各类设备,从蔬菜清洗
2025-08-13 09:27:00
近期,我国在海南商业航天发射场使用长征十二号运载火箭,成功将卫星互联网低轨07组卫星发射升空。7月30日,我国在海南商业航天发射场使用长征八号甲运载火箭
2025-08-13 10:12:00
9月10日至14日,2025年服贸会将在首钢园举办,电信、计算机和信息服务专题展(服贸会ICT展)作为科技领域“排头兵”
2025-08-13 10:42:00
中国网8月13日讯据国家安全部,“旧手机、旧电脑换菜刀、换不锈钢盆喽!”这与时俱进又略带夸张的吆喝,您是否也曾听过?一些闲置的“电子家当”留着无用
2025-08-13 10:02:00
下一款全民级AI应用,可能是个老熟人
这是技术革命时刻,也是超车巨头的机遇。2025年年中,两个看似无关的消息,形成了有趣的对照。首先是8月8日,OpenAI夏季发布会举行
2025-08-13 07:01:00
何以中国·和合共生 撰稿:杨春文拍摄:刘岩、阎金勇制作:李辉监制:李华楠协助单位:天津杨柳青画社
2025-08-13 08:06:00
我市两项目入选省级首批实践案例点数成“金”,公共数据“跑”起来南报网讯(通讯员玄数轩建数萱记者邓露洁卫凌云)近日,省数据局在全国率先组织开展江苏省公共数据“跑起来”场景县(市
2025-08-13 07:45:00
东北雨姐账号将于10月解封,解封后可继续直播带货,名下关联5家公司3家已注销
近日,曾因虚假宣传被处罚的网红“东北雨姐”在社交平台更新动态,引发公众对其复出的猜测。8月11日,本溪满族自治县互联网信息办公室工作人员回应称
2025-08-12 12:08:00
当全球经济寒风凛冽,消费者的钱包愈发收紧,一个来自中国的新名字,却在海外电商版图上掀起了一场低价风暴——TEMU。它像一把利刃
2025-08-12 13:00:00
倍益康理疗机器人亮相2025世界机器人大会,探索理疗机器人新发展
8月8日,2025世界机器人大会在北京经济技术开发区北人亦创国际会展中心隆重举行。大会以“让机器人更智慧,让具身体更智能”为主题
2025-08-12 13:06:00
红松APP正式上线行业首个适老化艺术能力认证服务
近日,红松APP官宣正式启动银发艺术培训认证服务,上线行业首个面向银发人群的“艺术能力水平认证系统”。该服务由中国艺术职业教育学会培训中心(下称“培训中心”)联合红松集团共同打造
2025-08-12 13:08:00
开业未满五年 永辉超市池州远东国际店即将停业
大皖新闻讯 近日,永辉超市池州远东国际店发布停业公告,宣布该门店9月2日起正式停止营业,8月22日至9月1日期间将开展商品出清活动
2025-08-12 13:10:00